ML Kit — Google-এর একটি মেশিন লার্নিং লাইব্রেরি যা মোবাইল ডিভাইসে টেক্সট, মুখ, অবজেক্ট এবং বারকোড শনাক্তকরণের জন্য প্রস্তুত API প্রদান করে। ক্লাউড ML সমাধানের বিপরীতে, ML Kit সমস্ত গণনা ডিভাইসে স্থানীয়ভাবে সম্পাদন করে, ইন্টারনেট ছাড়াই কাজ এবং ব্যবহারকারীর ডেটার গোপনীয়তা নিশ্চিত করে। Google ML Kit Documentation (2026) অনুসারে, লাইব্রেরিটি Android এবং iOS সমর্থন করে, যা কম্পিউটার ভিশন এবং টেক্সট প্রসেসিংয়ের বিভিন্ন কাজের জন্য 15+টি API কভার করে।
মূল বিষয়
ML Kit Google-এর একটি মোবাইল SDK লাইব্রেরি যা ডেভেলপারদের Android এবং iOS-এর জন্য প্রস্তুত মেশিন লার্নিং API প্রদান করে। এটি 2018 সালে Google I/O-তে Firebase-এর অংশ হিসেবে উপস্থাপিত হয়েছিল এবং পরে একটি স্বতন্ত্র SDK হিসেবে উপলব্ধ হয়। ML Kit ডেটা সায়েন্সের জটিলতাকে দূর করে: ডেভেলপারকে মডেল প্রশিক্ষণ, হাইপারপ্যারামিটার টিউনিং বা টেনসর গণনা বোঝার প্রয়োজন নেই।
লাইব্রেরিটি কম্পিউটার ভিশন এবং NLP-এর চারটি মূল ক্ষেত্র কভার করে: টেক্সট শনাক্তকরণ, মুখ শনাক্তকরণ, বারকোড স্ক্যানিং, ইমেজ বিশ্লেষণ এবং অবজেক্ট সেগমেন্টেশন। প্রতিটি API দুটি ভেরিয়েন্টে উপলব্ধ — দ্রুত (বেসিক) এবং নির্ভুল (বর্ধিত মডেল সহ)।
ML Kit Android-এর জন্য Google Play Services-এর মাধ্যমে বিতরণ করা হয়, যা অ্যাপের নতুন সংস্করণ প্রকাশ না করেই মডেল আপডেট করার অনুমতি দেয়। প্রতিটি API-এর ডাউনলোড আকার মডেল জটিলতার উপর নির্ভর করে 2 থেকে 15 MB পর্যন্ত হয়। iOS-এর জন্য, লাইব্রেরিটি CocoaPods বা Swift Package Manager-এর মাধ্যমে প্রথম লঞ্চে ম্যানুয়াল মডেল ডাউনলোড সহ সরবরাহ করা হয়। Google-এর মতে, সমস্ত ML Kit API-এর মোট আকার 80 MB-এর বেশি নয়, যা লাইব্রেরিটিকে আকারের সীমাবদ্ধতা সহ মোবাইল অ্যাপের জন্য গ্রহণযোগ্য করে তোলে।
ML Kit-এ ল্যাটিন, সিরিলিক এবং CJK অক্ষর সমর্থন সহ টেক্সট শনাক্তকরণ, হাসি এবং খোলা চোখ শনাক্তকরণ সহ মুখ শনাক্তকরণ এবং ট্র্যাকিং, সমস্ত জনপ্রিয় ফর্ম্যাটের বারকোড স্ক্যানিং, অগ্রভাগ এবং পটভূমিতে ইমেজ সেগমেন্টেশন, 33টি মূল পয়েন্টে মানব পোজ বিশ্লেষণ এবং শ্রেণিবিন্যাস সহ অবজেক্ট শনাক্তকরণের API অন্তর্ভুক্ত রয়েছে। Google I/O 2025 অনুসারে, ML Kit-এর বেসিক মডেলের নির্ভুলতা ল্যাটিন টেক্সটের জন্য 97% এবং মুখের জন্য 94% পর্যন্ত পৌঁছায়।
ML Kit বেশ কয়েকটি API গ্রুপ অফার করে, প্রতিটি একটি নির্দিষ্ট কম্পিউটার ভিশন বা টেক্সট প্রসেসিং কাজ সমাধান করে। আসুন তিনটি সর্বাধিক চাহিদাযুক্ত ক্ষেত্র দেখি।
Text Recognition API রিয়েল টাইমে ছবি থেকে মুদ্রিত এবং হস্তলিখিত টেক্সট উত্তোলন করে। APIটি 50+টি ভাষার সাথে কাজ করে, যার মধ্যে রাশিয়ান, ইংরেজি, চীনা এবং আরবি অন্তর্ভুক্ত। ফলাফলগুলি একটি শ্রেণিবদ্ধ কাঠামো হিসাবে ফেরত দেওয়া হয়: টেক্সট ব্লক → লাইন → প্রতিটি উপাদানের স্থানাঙ্ক সহ টোকেন। Google ML Kit বেঞ্চমার্ক (2026) অনুসারে, একটি মিড-রেঞ্জ ডিভাইসে বেসিক মডেলের জন্য একটি ফ্রেম শনাক্ত করতে 80–150 মিলিসেকেন্ড সময় লাগে।
Face Detection API ছবি এবং ভিডিও স্ট্রিমে মুখ শনাক্ত করে, 17টি পর্যন্ত মূল ল্যান্ডমার্ক চিহ্নিত করে: চোখ, ভ্রু, নাক, মুখ এবং মুখের কনট্যুর। API হাসির সম্ভাবনা, চোখের খোলা অবস্থা এবং তিনটি অক্ষে মাথার ঘূর্ণন কোণও গণনা করে। ক্লাউড সমাধানের বিপরীতে, ML Kit ছবি সার্ভারে না পাঠিয়েই মুখগুলিকে ডিভাইসে সম্পূর্ণরূপে প্রক্রিয়া করে।
Barcode Scanning API সমস্ত সাধারণ ফর্ম্যাট সমর্থন করে: EAN-13, QR Code, Code 128, PDF417, Data Matrix এবং Aztec। API স্বয়ংক্রিয়ভাবে কোড ফর্ম্যাট সনাক্ত করে এবং এর বিষয়বস্তু ফেরত দেয় — সরল টেক্সট থেকে গঠনযুক্ত ডেটা (URL, vCard, ভূ-অবস্থান স্থানাঙ্ক) পর্যন্ত। স্ক্যানিং গতি প্রতি সেকেন্ডে 30 ফ্রেমে পৌঁছায়, যা রিয়েল-টাইম অ্যাপ্লিকেশনে API ব্যবহারের অনুমতি দেয়।
Android প্রকল্পে ML Kit যুক্ত করতে, build.gradle-এ সংশ্লিষ্ট ডিপেন্ডেন্সি যোগ করা এবং একটি প্রসেসর ইনস্ট্যান্স তৈরি করা যথেষ্ট। Text Recognition API-এর উদাহরণ দিয়ে ইন্টিগ্রেশন দেখি।
build.gradle ফাইল (অ্যাপ-লেভেল) এ ML Kit Text Recognition-এর জন্য ডিপেন্ডেন্সি যোগ করা হয়। লাইব্রেরিটি Google Play Services-এর মাধ্যমে প্রথম কলেই স্বয়ংক্রিয়ভাবে মডেল ডাউনলোড করে।
dependencies {
// ML Kit Text Recognition v2
implementation 'com.google.mlkit:text-recognition:16.0.1'
// Google Play Services ছাড়া ডিভাইসের জন্য
implementation 'com.google.mlkit:text-recognition:16.0.1'
}
ডিপেন্ডেন্সি সেটআপ করার পরে, আপনি একটি TextRecognizer তৈরি করতে পারেন এবং এটিকে InputImage ফর্ম্যাটে একটি ছবি দিতে পারেন। ফলাফল RecognizedText অবজেক্ট হিসেবে ফেরত আসে।
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)
recognizer.process(image)
.addOnSuccessListener { result ->
for (block in result.textBlocks) {
val blockText = block.text
val lines = block.lines
// শনাক্ত করা টেক্সট প্রক্রিয়াকরণ
Log.d("MLKit", "Block: $blockText")
}
}
.addOnFailureListener { e ->
Log.e("MLKit", "Error: $e")
}
কোডটি একটি TextRecognition ক্লায়েন্ট তৈরি করে, এটিকে একটি বিটম্যাপ ছবি পাঠায় এবং ফলাফলটি অ্যাসিঙ্ক্রোনাসভাবে প্রক্রিয়া করে। টেক্সট ব্লকগুলিতে স্থানাঙ্ক সহ নেস্টেড লাইন এবং টোকেন থাকে, যা শনাক্ত করা টেক্সটকে সরাসরি ছবির উপরে প্রদর্শনের অনুমতি দেয়।
ইন্টিগ্রেশনের একটি গুরুত্বপূর্ণ দিক হল এরর হ্যান্ডলিং। ML Kit খুব অন্ধকার ছবি, ঘোরানো টেক্সট বা মেমরি সীমা অতিক্রম করলে ত্রুটি ফেরত দিতে পারে। সুপারিশ করা হয় যে সর্বদা সেই ক্ষেত্রেগুলির জন্য Google Cloud Vision-এর মাধ্যমে ক্লাউড শনাক্তকরণে ফলব্যাক যোগ করুন যেখানে অন-ডিভাইস মডেল ব্যর্থ হয়। অনুশীলন দেখায় যে সম্মিলিত পদ্ধতি (ML Kit + Cloud Vision) জটিল ডকুমেন্টে সামগ্রিক শনাক্তকরণ নির্ভুলতা 92% থেকে 98% পর্যন্ত বাড়িয়ে দেয়।
অন-ডিভাইস ML ML Kit-কে ক্লাউড ML পরিষেবা থেকে আলাদা করার মূল বৈশিষ্ট্য। সমস্ত গণনা ডিভাইসে স্থানীয়ভাবে ঘটে, যা তিনটি প্রধান সুবিধা প্রদান করে। প্রথমটি — শূন্য লেটেন্সি: মডেলটি সার্ভার প্রতিক্রিয়ার জন্য অপেক্ষা না করেই 50–200 মিলিসেকেন্ডে ডেটা প্রক্রিয়া করে। দ্বিতীয়টি — ইন্টারনেট ছাড়াই কাজ: লাইব্রেরি এয়ারপ্লেন মোডেও কাজ করে, যা ফিল্ড অ্যাপ্লিকেশনের জন্য গুরুত্বপূর্ণ।
স্থানীয় প্রক্রিয়াকরণ নিশ্চিত করে যে ফটো, ডকুমেন্ট এবং ব্যবহারকারীর ব্যক্তিগত ডেটা কখনই ডিভাইসের বাইরে না যায়। এটি বিশেষ করে চিকিৎসা, অর্থ এবং কর্পোরেট নিরাপত্তার ক্ষেত্রে অ্যাপ্লিকেশনের জন্য গুরুত্বপূর্ণ, যেখানে নিয়ন্ত্রক প্রয়োজনীয়তার কারণে সার্ভারে ডেটা পাঠানো নিষিদ্ধ। Google পরিসংখ্যান (2026) অনুসারে, 78% ব্যবহারকারী গোপনীয়তার কারণে অন-ডিভাইস প্রক্রিয়াকরণ সহ অ্যাপ পছন্দ করেন।
ক্লাউড ML সমাধানগুলির বিপরীতে যা ছবি সার্ভারে পাঠায় এবং মোবাইল ট্রাফিক ব্যবহার করে, ML Kit-এর নেটওয়ার্ক সংযোগের প্রয়োজন নেই। গভীরভাবে ইমেজ প্রক্রিয়াকরণকারী অ্যাপগুলির জন্য ট্রাফিক সাশ্রয় প্রতিদিন 50–200 MB পর্যন্ত হতে পারে। ব্যাটারি খরচ মাঝারি: একটি শনাক্তকরণ চক্র সক্রিয় ব্যবহারের প্রতি ঘন্টায় 0.5–2% চার্জ ব্যবহার করে।
ML Kit নেটিভ ML ফ্রেমওয়ার্ক (TensorFlow Lite, Core ML) এবং ক্লাউড পরিষেবাগুলির (Google Cloud Vision, AWS Rekognition) মধ্যে একটি মধ্যবর্তী অবস্থান দখল করে। আসুন মূল বৈশিষ্ট্যগুলির তুলনা করি।
| বৈশিষ্ট্য | ML Kit | TensorFlow Lite | Google Cloud Vision |
|---|---|---|---|
| নির্বাহ | শুধুমাত্র অন-ডিভাইস | শুধুমাত্র অন-ডিভাইস | ক্লাউড |
| ডেটা সায়েন্স প্রয়োজন | না | হ্যাঁ | না |
| গতি | 80–200 মি.সে. | 50–300 মি.সে. | 500–2000 মি.সে. |
| অফলাইনে কাজ | হ্যাঁ | হ্যাঁ | না |
| নির্ভুলতা | 94–97% | 95–99% | 98–99% |
| কাস্টম মডেল | TFLite-এর মাধ্যমে | হ্যাঁ | AutoML Vision |
| মূল্য | বিনামূল্যে | বিনামূল্যে | $1.50/1000 ইউনিট |
সাধারণ কম্পিউটার ভিশন কাজ যেমন ডকুমেন্ট স্ক্যানিং বা মুখ যাচাইয়ের জন্য, ML Kit তার সহজ ইন্টিগ্রেশনের কারণে সর্বোত্তম পছন্দ। কাস্টম নিউরাল নেটওয়ার্ক আর্কিটেকচার সহ জটিল প্রকল্পগুলির TensorFlow Lite প্রয়োজন। ক্লাউড পরিষেবাগুলি তখনই ন্যায়সঙ্গত যখন সর্বোচ্চ নির্ভুলতার প্রয়োজন হয়।
ML Kit এবং TensorFlow Lite-এর মধ্যে নির্বাচন করার সময়, ডেভেলপমেন্ট গতি এবং নমনীয়তার মধ্যে ভারসাম্য বিবেচনা করুন। যদি প্রকল্পে ইতিমধ্যেই একজন ডেটা সায়েন্টিস্ট এবং একটি প্রশিক্ষিত মডেল থাকে, তাহলে সরাসরি TFLite ব্যবহার করুন। যদি ML অ্যাপের একটি সহায়ক বৈশিষ্ট্য মাত্র (রসিদ স্ক্যান করা, সেলফিতে হাসি চেক করা), তাহলে ML Kit এক সপ্তাহের পরিবর্তে 30 মিনিটে ফলাফল দেবে।
Google (2026) অনুসারে, একটি বিদ্যমান প্রকল্পে ML Kit সংহত করার গড় সময় বেসিক দৃশ্যের জন্য 4–6 ঘন্টা এবং কাস্টম মডেল সহ সম্পূর্ণ ইন্টিগ্রেশনের জন্য 2–3 দিন। 73% ক্ষেত্রে, ডেভেলপাররা সর্বোচ্চ মডেল নির্ভুলতার জন্য নয়, বরং ইন্টিগ্রেশনের গতির জন্য ML Kit বেছে নেন।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
না, ML Kit সমস্ত গণনা ডিভাইসে স্থানীয়ভাবে সম্পাদন করে। শুধুমাত্র Google Play Services-এর মাধ্যমে প্রাথমিক মডেল ডাউনলোডের জন্য ইন্টারনেট প্রয়োজন, তারপর লাইব্রেরিটি সম্পূর্ণ অফলাইনে কাজ করে।
Android (API 24+) এবং iOS (12.0+)। Android-এর জন্য Google Play Services-এর মাধ্যমে ইন্টিগ্রেশন ব্যবহার করা হয়, iOS-এর জন্য — CocoaPods বা Swift Package Manager-এর মাধ্যমে ম্যানুয়াল মডেল ডাউনলোড সহ।
হ্যাঁ, ML Kit LocalModel বা RemoteModel ক্লাসের মাধ্যমে কাস্টম TensorFlow Lite মডেল আমদানি সমর্থন করে। মডেলটিকে .tflite ফর্ম্যাটে রূপান্তর করতে হবে এবং মোবাইল ডিভাইসের জন্য অপ্টিমাইজ করতে হবে।
ML Kit একটি উচ্চ-স্তরের লাইব্রেরি যার রেডি-মেড API রয়েছে এবং এতে ML জ্ঞানের প্রয়োজন নেই। TensorFlow Lite কাস্টম মডেল চালানোর জন্য একটি নিম্ন-স্তরের রানটাইম। ML Kit অভ্যন্তরীণভাবে TFLite ব্যবহার করে তবে ডেভেলপারের থেকে জটিলতা লুকিয়ে রাখে।
মডেলগুলি Android-এর জন্য Google Play Services এবং iOS-এর জন্য App Store-এর মাধ্যমে স্বয়ংক্রিয়ভাবে আপডেট হয়। Google প্রতি 6–8 সপ্তাহে আপডেট প্রকাশ করে, শনাক্তকরণ নির্ভুলতা উন্নত করে এবং নতুন ভাষা যোগ করে।
সারসংক্ষেপ
আমরা একটি মোবাইল অ্যাপ্লিকেশন টার্নকি তৈরি করব
IT Sectr 2017 সাল থেকে স্টার্টআপ এবং ব্যবসার জন্য iOS এবং Android অ্যাপ্লিকেশন তৈরি করে। আমরা আপনাকে পরামর্শ দেব এবং সেরা সমাধান প্রস্তাব করব।
আরও পড়ুন