Image Labeling: এটি কী, পদ্ধতি এবং কাজের নীতি

লেখক: IT Sectr প্রকাশিত: 2026-07-19 পড়ার সময়: 9 মিনিট

Image Labeling একটি কম্পিউটার ভিশন টাস্ক যেখানে একটি নিউরাল নেটওয়ার্ক একটি পূর্বনির্ধারিত শ্রেণীর সেট থেকে একটি ছবিতে লেবেল নির্ধারণ করে: সরল (বিড়াল, কুকুর, গাড়ি) থেকে নির্দিষ্ট (উদ্ভিদের প্রজাতি, স্মার্টফোন মডেল, মেডিকেল স্ক্যান) পর্যন্ত। মোবাইল ডেভেলপমেন্টে, Image Labeling গ্যালারিতে ফটোর অটো-ট্যাগিং, ব্যবহারকারীর কন্টেন্ট মডারেশন, ফটো দ্বারা পণ্যের ভিজুয়াল অনুসন্ধান এবং AR অ্যাপ্লিকেশনের জন্য ব্যবহৃত হয়। Google ML Kit, 2025 অনুসারে, বিল্ট-ইন ক্লাসিফায়ার 91% নির্ভুলতার (top-1) সাথে প্রতি ফ্রেমে 10–20 ms-এ 400+ ক্যাটাগরি চিহ্নিত করে।

মূল পয়েন্ট

  • Image Labeling — একটি পূর্বনির্ধারিত শ্রেণীর সেট থেকে একটি ছবিতে লেবেল নির্ধারণ
  • ML Kit — 400+ বিল্ট-ইন লেবেল, 10–20 ms, 91% top-1 নির্ভুলতা
  • Core ML — Vision + কাস্টম মডেলের মাধ্যমে iOS-এ নেটিভ শ্রেণীবিভাগ
  • কাস্টম মডেল — TensorFlow, PyTorch-এর মাধ্যমে প্রশিক্ষণ, TFLite-এ রূপান্তর
  • ডিভাইসে — সমস্ত গণনা স্থানীয়ভাবে, সার্ভারে ডেটা না পাঠিয়ে

Image Labeling কী: শ্রেণীবিভাগের মৌলিক বিষয়

Image Labeling ইমেজ শ্রেণীবিভাগের একটি উপপ্রকার যেখানে মডেল ইনপুট হিসেবে একটি ছবি নেয় এবং প্রশিক্ষণ সেট থেকে প্রতিটি শ্রেণীর জন্য সম্ভাবনা ফেরত দেয়। অবজেক্ট ডিটেকশনের বিপরীতে, Image Labeling ছবিতে বস্তুর অবস্থান নির্ধারণ করে না — শুধুমাত্র তাদের উপস্থিতি বা অনুপস্থিতি। ইমেজ সেগমেন্টেশনের বিপরীতে, এটি বস্তুর কনট্যুর নির্ধারণ করে না। Image Labeling প্রশ্নের উত্তর দেয় “ফটোতে কী আছে?”, না “ফটোতে কোথায় এবং কী আছে?”

ক্লাসিফায়ার আর্কিটেকচার: একটি CNN ব্যাকবোন (MobileNet, ResNet, EfficientNet) ছবি থেকে ফিচার ম্যাপ বের করে, Global Average Pooling স্থানিক মাত্রাগুলোকে সংকুচিত করে, এবং Softmax অ্যাক্টিভেশন সহ একটি সম্পূর্ণ সংযুক্ত স্তর (Dense) শ্রেণীর সম্ভাবনা তৈরি করে। MobileNetV2 মোবাইল ডিভাইসের জন্য সবচেয়ে জনপ্রিয় ব্যাকবোন: 3.5M প্যারামিটার, GPU-র মাধ্যমে Pixel 6-এ 0.5–2 ms ইনফারেন্স। EfficientNet-Lite ভালো নির্ভুলতা/প্যারামিটার অনুপাত সহ একটি বিকল্প।

Top-1 বনাম Top-5 নির্ভুলতা: top-1 — মডেল সঠিকভাবে প্রধান শ্রেণী অনুমান করেছে (ML Kit-এ 91%); top-5 — সঠিক শ্রেণীটি পাঁচটি সবচেয়ে সম্ভাব্য শ্রেণীর মধ্যে রয়েছে (ML Kit-এ 98%)। প্রোডাকশন অ্যাপ্লিকেশনের জন্য, top-5 ব্যবহার করুন এবং ব্যবহারকারীকে একাধিক লেবেল বিকল্প দেখান। কন্টেন্ট মডারেশনের জন্য, কনফিডেন্স থ্রেশহোল্ড >= 0.8 সহ top-1 ব্যবহার করুন (ফলস পজিটিভ রেট 40% কমায়)।

আর্কিটেকচারপ্যারামিটারলেটেন্সিTop-1আকার
MobileNetV23.5M0.5–2 ms90.2%14 MB
MobileNetV32.5M0.3–1.5 ms91.5%10 MB
EfficientNet-Lite04.7M1–3 ms92.3%18 MB
ResNet-5025.6M10–30 ms95.2%98 MB

ডিভাইসে বনাম ক্লাউড: ডিভাইসে শ্রেণীবিভাগ (ML Kit, Core ML) সম্পূর্ণ ডেটা গোপনীয়তা সহ 1–20 ms লেটেন্সি দেয়। ক্লাউড API (Google Cloud Vision, AWS Rekognition) — 500–2000 ms লেটেন্সি এবং প্রতি অনুরোধে খরচ, কিন্তু বড় মডেল (ViT, CLIP) এর কারণে বেশি নির্ভুল (97–99%)। রিয়েল-টাইম অ্যাপ্লিকেশনের (ক্যামেরা, AR) জন্য, ডিভাইসে বিকল্প বেছে নিন। জটিল পরিস্থিতিতে (চিকিৎসা, বিশেষজ্ঞ বিশ্লেষণ), ডিভাইসে ফলব্যাক সহ ক্লাউড ব্যবহার করুন।

Android এবং iOS-এ ML Kit Image Labeling

ML Kit Image Labeling ডিভাইসে ইমেজ শ্রেণীবিভাগের জন্য Google-এর তৈরি লাইব্রেরি। দুটি মোডে উপলব্ধ: ডিভাইসে (বিনামূল্যে, 400+ লেবেল, 10–20 ms) এবং ক্লাউড (পরিশোধিত, 10000+ লেবেল, 500+ ms)। ডিভাইসে সংস্করণ INT8 কোয়ান্টাইজেশন সহ MobileNetV3 ব্যবহার করে, ডিস্কে 4 MB জায়গা নেয়। ML Kit স্বয়ংক্রিয়ভাবে ছবির ওরিয়েন্টেশন শনাক্ত করে এবং শ্রেণীবিভাগের আগে আকার অপ্টিমাইজ করে।

ML Kit API: InputImage (Bitmap, media.Image, filePath থেকে) → ImageLabeler → ImageLabel (লেবেল, কনফিডেন্স, ইনডেক্স) তালিকা সহ OnSuccessListener। কনফিডেন্স থ্রেশহোল্ড (ডিফল্ট 0.5) একটি লেবেল ফেরত দেওয়ার জন্য ন্যূনতম আত্মবিশ্বাস। থ্রেশহোল্ড 0.7-এ বাড়ালে প্রতি ফ্রেমে লেবেলের সংখ্যা কমে কিন্তু প্রতিটির নির্ভুলতা বাড়ে। কন্টেন্ট মডারেশনের জন্য, থ্রেশহোল্ড 0.8 সেট করুন।

kotlin
val labeler = ImageLabeling.getClient(
    ImageLabelerOptions.DEFAULT_OPTIONS
)

labeler.process(inputImage)
    .addOnSuccessListener { labels ->
        labels
            .filter { it.confidence >= 0.7f }
            .forEach { label ->
                log("Label: ${label.label}")
                log("Confidence: ${label.confidence}")
            }
    }
    .addOnFailureListener { error -> handleError(error) }

iOS-এ ML Kit: API Android-এর মতো, UIImage বা CMSampleBuffer ব্যবহার করে। ML Kit স্বয়ংক্রিয়ভাবে A12+ ডিভাইসে Core ML + ANE ব্যবহার করে। iOS 16+-এর জন্য, ML Kit Image Labeling iPhone 15 Pro-তে 8–15 ms লেটেন্সি দেয়। লেটেন্সি কমানোর জন্য, সর্বনিম্ন সম্ভাব্য ইমেজ রেজোলিউশন (MobileNet-এর জন্য 224x224) পাস করুন — MLKit স্বয়ংক্রিয়ভাবে স্কেল করে, কিন্তু বড় ছবি রূপান্তর করতে 2–5 ms ওভারহেড যোগ হয়।

iOS-এ Core ML এবং Vision Framework

Core ML ডিভাইসে ML মডেল চালানোর জন্য Apple-এর ফ্রেমওয়ার্ক। Vision Framework (VNCoreMLRequest) এর সাথে মিলিত হয়ে, Core ML ন্যূনতম কোড সহ ইমেজ শ্রেণীবিভাগ সক্ষম করে। Apple বিল্ট-ইন মডেল সরবরাহ করে: SqueezeNet (5 MB, 80.5% top-1), ResNet50 (98 MB, 95.2%), MobileNetV2 (14 MB, 90.2%)। .mlmodel বা .mlpackage ফর্ম্যাটের মডেল TensorFlow বা PyTorch থেকে coremltools-এর মাধ্যমে রূপান্তরিত হয়।

VNCoreMLRequest একটি Vision API যা ইমেজ প্রিপ্রসেসিং (স্কেলিং, ক্রপ-টু-ফিল, কালার স্পেস রূপান্তর) পরিচালনা করে এবং ফলাফল মডেলে পাঠায়। Vision identifier (শ্রেণীর নাম) এবং confidence (0..1) সহ VNClassificationObservation ফেরত দেয়। MaxCandidates ফেরত দেওয়া লেবেলের সর্বোচ্চ সংখ্যা (ডিফল্ট 1)। স্বয়ংক্রিয় নির্বাচন শ্রেণীবিভাগের জন্য, imageCropAndScaleOption = .centerCrop সহ VNCoreMLRequest ব্যবহার করুন।

swift
guard let model = try? VNCoreMLModel(for: MobileNetV2().model) else { return }
let request = VNCoreMLRequest(model: model) { request, _ in
    guard let results = request.results as? [VNClassificationObservation] else { return }
    results.prefix(5).forEach { obs in
        print("লেবেল: \(obs.identifier), কনফিডেন্স: \(obs.confidence)")
    }
}
request.imageCropAndScaleOption = .centerCrop

let handler = VNImageRequestHandler(cgImage: cgImage, options: [:])
try handler.perform([request])

iOS-এ Core ML বনাম ML Kit: Core ML নেটিভ, অতিরিক্ত SDK প্রয়োজন হয় না, এবং ANE (Apple Neural Engine) এর জন্য ভালভাবে অপ্টিমাইজড। ML Kit Google-এর মডেলের কারণে জটিল দৃশ্যে বেশি নির্ভুল। Core ML যেকোনো মডেল (coremltools-এর মাধ্যমে রূপান্তরিত) সমর্থন করে, যখন ML Kit শুধুমাত্র নিজের মডেল সমর্থন করে। দ্রুত বাস্তবায়নের জন্য, ML Kit ব্যবহার করুন। সর্বোচ্চ মডেল নিয়ন্ত্রণের জন্য, Core ML ব্যবহার করুন। একটি ব্যবহারিক পদ্ধতি: একটি অ্যাপে উভয় ফ্রেমওয়ার্ক ব্যবহার করুন — স্ট্যান্ডার্ড লেবেলের জন্য ML Kit, কাস্টমের জন্য Core ML।

কাস্টম মডেলের প্রশিক্ষণ এবং একীকরণ

কাস্টম Image Labeling মডেল — একটি নির্দিষ্ট কাজের জন্য নিজস্ব শ্রেণীবিভাগকারী প্রশিক্ষণ: ফলের গুণমান সনাক্তকরণ, উত্পাদন লাইনে ত্রুটি শনাক্তকরণ, কুকুরের প্রজাতি শ্রেণীবিভাগ। প্রক্রিয়ার মধ্যে রয়েছে ডেটাসেট সংগ্রহ (প্রতি শ্রেণীতে 1000+ ছবি), অ্যানোটেশন, পূর্ব-প্রশিক্ষিত MobileNetV2 বা EfficientNet-এ ট্রান্সফার লার্নিংয়ের মাধ্যমে প্রশিক্ষণ এবং TFLite / Core ML-এ রূপান্তর।

ট্রান্সফার লার্নিং — মোবাইল শ্রেণীবিভাগকারী প্রশিক্ষণের প্রধান পদ্ধতি। ImageNet-এ পূর্ব-প্রশিক্ষিত একটি মডেল নেওয়া হয়, নীচের স্তরগুলি (CNN ব্যাকবোন) ফ্রিজ করা হয়, এবং উপরের স্তরগুলি পুনরায় প্রশিক্ষিত হয় (ফাইন-টিউনিং)। এর জন্য প্রতি শ্রেণীতে মাত্র 100–500 ছবির প্রয়োজন এবং Google Colab (GPU) তে 1–2 ঘন্টা সময় লাগে। লাইব্রেরি: TensorFlow Keras (Android), PyTorch + coremltools (iOS)। ফলাফল: লক্ষ্য শ্রেণীতে 95–98% নির্ভুলতা।

kotlin
// TFLite কাস্টম মডেল ইনফারেন্স
val interpreter = Interpreter(loadModelFile(context))
val inputImage = TensorImage.fromBitmap(bitmap)
    .apply { load(Bitmap.createScaledBitmap(bitmap, 224, 224, true)) }

val output = Array(1) { FloatArray(NUM_CLASSES) }
interpreter.run(inputImage.tensorBuffer, output)

val probabilities = TensorLabel.mapIndexToLabels(output[0])
val topClass = probabilities.maxByOrNull { it.value }

ML Kit Custom Model API — একটি বিকল্প: TFLite Interpreter কোড লেখার প্রয়োজন নেই — ML Kit মডেল লোড করে এবং প্রিপ্রসেসিং স্বয়ংক্রিয়ভাবে পরিচালনা করে। কাস্টম Image Labeler ইনপুট আকার 224x224x3 এবং আউটপুট score float[NUM_CLASSES] সহ একটি TFLite মডেল গ্রহণ করে। শুধু মডেল ফাইল প্রদান করুন এবং স্ট্যান্ডার্ড লেবেল পান। ML Kit Custom Model API সুপারিশ করা হয় যদি মডেল TFLite ফর্ম্যাটের সাথে মেলে। যদি ইনফারেন্সের উপর আরও সূক্ষ্ম নিয়ন্ত্রণের প্রয়োজন হয় (প্রতি শ্রেণীর থ্রেশহোল্ড), তাহলে সরাসরি TFLite Interpreter ব্যবহার করুন।

TFLite এবং Core ML: ফর্ম্যাট তুলনা

TFLite (TensorFlow Lite) মোবাইল এবং এজ ডিভাইসের জন্য Google-এর মডেল ফর্ম্যাট। এটি কোয়ান্টাইজেশন (FP16, INT8) সমর্থন করে, যা মডেলের আকার 4 গুণ কমায় এবং গতি 2–3 গুণ বাড়ায়, সামান্য নির্ভুলতা হ্রাস (1–2%) সহ। TFLite Android-এ GPU Delegate (OpenGL/OpenCL) এর মাধ্যমে এবং iOS-এ Core ML Delegate এর মাধ্যমে চলে। TFLite Task API Image Classifier, Object Detector এবং অন্যান্য কাজের জন্য একটি ইউনিফাইড ইন্টারফেস সরবরাহ করে।

Core ML Apple-এর ফর্ম্যাট (.mlpackage — নতুন, .mlmodel — পুরাতন)। এটি কোয়ান্টাইজেশন (FP16) এবং ওয়েট প্যালেটাইজেশন (1/2/4/6/8 বিট পর্যন্ত) সমর্থন করে, যা 80% পর্যন্ত মডেল কম্প্রেশন অর্জন করে। Core ML ANE (Neural Engine), GPU এবং CPU ব্যবহার করে — সিস্টেম স্বয়ংক্রিয়ভাবে সর্বোত্তম ইঞ্জিন নির্বাচন করে। PyTorch থেকে torch.onnx.export + coremltools এর মাধ্যমে, TensorFlow থেকে tf-keras + coremltools এর মাধ্যমে রূপান্তর। iOS 18+ Core ML Training API-এর মাধ্যমে ডিভাইসে প্রশিক্ষণ সমর্থন করে।

বৈশিষ্ট্যTFLiteCore ML
আকার (MobileNetV2)14 MB (FP32) / 3.5 MB (INT8)14 MB (FP16) / 2.8 MB (4-bit)
ইনফারেন্স ইঞ্জিনGPU / NNAPI / XNNPACKANE / GPU / CPU (স্বয়ংক্রিয়)
কোয়ান্টাইজেশনFP16, INT8, DynamicRangeFP16, প্যালেটাইজেশন (1-8 bit)
iOS কর্মক্ষমতাCore ML Delegate (2–5 ms)নেটিভ ANE (1–3 ms)
সরঞ্জামTFLite Model Maker, Task APIcoremltools, Create ML

মধ্যবর্তী ফর্ম্যাট হিসাবে ONNX: মডেলগুলিকে ONNX (PyTorch → ONNX, TensorFlow → ONNX) এবং তারপর onnx2tf বা onnx2coreml-এর মাধ্যমে TFLite / Core ML-এ রূপান্তর করুন। ONNX একটি ইউনিফাইড ফর্ম্যাট যা 70+ ফ্রেমওয়ার্ক দ্বারা সমর্থিত। এটি পাইপলাইনকে সহজ করে: একটি প্রশিক্ষিত মডেল → ONNX → উভয় প্ল্যাটফর্মের জন্য নেটিভ ফর্ম্যাট। ক্রস-প্ল্যাটফর্ম প্রকল্পের জন্য PyTorch-এ প্রশিক্ষণ + ONNX → TFLite (Android) / Core ML (iOS)-এ রূপান্তর প্রস্তাবিত পাইপলাইন।

মোবাইল অ্যাপে Image Labeling-এর প্রয়োগ

ফটোর অটো-ট্যাগিং — গ্যালারি অ্যাপ (Google Photos, Apple Photos) স্বয়ংক্রিয়ভাবে ছবিতে লেবেল নির্ধারণ করে: “সৈকত”, “সূর্যাস্ত”, “কুকুর”, “খাবার”। ML Kit Image Labeling ব্যাকগ্রাউন্ডে গ্যালারির প্রতিটি ফটো প্রক্রিয়া করে — 100 ফটোর জন্য 1–2 সেকেন্ড (ব্যাচ)। ব্যবহারকারী ম্যানুয়াল সাজানো ছাড়াই লেবেল দ্বারা অনুসন্ধান পায়। Google Photos জটিল দৃশ্যের জন্য পরবর্তী সার্ভার যাচাই সহ ডিভাইসে শ্রেণীবিভাগ ব্যবহার করে।

কন্টেন্ট মডারেশন — ব্যবহারকারীর কন্টেন্টে (সোশ্যাল নেটওয়ার্ক, মার্কেটপ্লেস, UGC প্ল্যাটফর্ম) অবাঞ্ছিত ছবির স্বয়ংক্রিয় সনাক্তকরণ। ML Kit Custom Model 92–96% নির্ভুলতার সাথে NSFW কন্টেন্ট, সহিংসতা এবং প্রচার শনাক্ত করে। ট্রিগার থ্রেশহোল্ড — কনফিডেন্স 0.8। ফলস পজিটিভ (বৈধ মেডিকেল ছবি) কমানোর জন্য, শ্রেণীবিভাগকারীদের একটি কমিটি ব্যবহার করুন: Image Labeling + Object Detection + Blur Detection। ডিভাইসে মডারেশন দ্রুত এবং ব্যবহারকারীর গোপনীয়তা রক্ষা করে।

পণ্যের ভিজুয়াল অনুসন্ধান — ব্যবহারকারী একটি পণ্যের (স্নিকার, ব্যাগ, আসবাব) ছবি তোলে, অ্যাপ লেবেল নির্ধারণ করে এবং ক্যাটালগে অনুরূপ পণ্য খুঁজে পায়। Image Labeling অনুসন্ধানকে একটি বিভাগে সীমাবদ্ধ করে, তারপর ফিচার ডিস্ক্রিপ্টর (ফিচার ভেক্টর) দৃশ্যত অনুরূপ আইটেম খুঁজে পায়। Pinterest Lens, Google Lens এবং Amazon StyleSnap এই পদ্ধতি ব্যবহার করে। ডিভাইসে শ্রেণীবিভাগ 10–30 ms-এ ফলাফল দেয়, ক্লাউড অনুসন্ধান — 200–500 ms-এ।

swift
// ভিজুয়াল অনুসন্ধানের জন্য Core ML সহ Image Labeling
let request = VNCoreMLRequest(model: productClassifier) { req, _ in
    guard let result = req.results?.first as? VNClassificationObservation,
          result.confidence > 0.6 else { return }
    SearchService.findSimilarProducts(
        category: result.identifier,
        image: capturedPhoto,
        limit: 10
    ) { products in
        DispatchQueue.main.async {
            self.showResults(products)
        }
    }
}

AR এবং শিক্ষামূলক অ্যাপ — Image Labeling ক্যামেরার মাধ্যমে রিয়েল টাইমে বস্তু শ্রেণীবদ্ধ করে। ব্যবহারকারী তার ফোন একটি গাছের দিকে নির্দেশ করে — অ্যাপ নাম, যত্ন নির্দেশনা এবং জল দেওয়ার সময়সূচী দেখায়। একটি যান্ত্রিক অংশের দিকে নির্দেশ করে — এর উদ্দেশ্য ব্যাখ্যা করে। প্রয়োজনীয়তা: লেটেন্সি < 30 ms। ফ্ল্যাগশিপ ডিভাইসে EfficientNet-Lite 15–25 ms দেয়। কম আলোতে, নির্ভুলতা কমে যায় — একটি অভিযোজিত কনফিডেন্স থ্রেশহোল্ড ব্যবহার করুন (ইনপুট মানের অবনতি পূরণের জন্য কম আলোতে থ্রেশহোল্ড কমিয়ে দিন)।

সচরাচর জিজ্ঞাসিত প্রশ্ন

Image Labeling কীভাবে Object Detection থেকে আলাদা?

Image Labeling নির্ধারণ করে ছবিতে কোন বস্তু উপস্থিত আছে কিন্তু তাদের অবস্থান নির্দেশ করে না। Object Detection বস্তু খুঁজে বের করে এবং প্রতিটির জন্য বাউন্ডিং বক্স ফেরত দেয়। Image Labeling দ্রুত (1–20 ms বনাম 20–100 ms), কম প্রশিক্ষণ ডেটার প্রয়োজন, কিন্তু অবস্থানগত তথ্য প্রদান করে না। সরল শ্রেণীবিভাগের (বিড়াল/কুকুর) জন্য, Image Labeling ব্যবহার করুন। লক্ষ্যযুক্ত শনাক্তকরণের (কতগুলি বস্তু, কোথায় আছে) জন্য, Object Detection ব্যবহার করুন।

ডিভাইসে Image Labeling-এর জন্য কি ইন্টারনেট সংযোগ প্রয়োজন?

না, ML Kit Image Labeling সম্পূর্ণরূপে ডিভাইসে কাজ করে। প্রথম লঞ্চে মডেল ডাউনলোড হয় (ডাউনলোডেড মোড — 4 MB) এবং স্থানীয়ভাবে সংরক্ষিত হয়। Core ML মডেল অ্যাপের সাথে বান্ডেল করা হয়। TFLite কাস্টম মডেল APK-এর অংশ। সমস্ত গণনা ডিভাইসে চলে, এবং সার্ভারে কোনো ডেটা পাঠানো হয় না। এটি ব্যবহারকারীর গোপনীয়তা এবং অফলাইন কার্যকারিতা নিশ্চিত করে। ক্লাউড শ্রেণীবিভাগ (Google Cloud Vision) একটি বিকল্প যার জন্য ইন্টারনেট প্রয়োজন এবং উচ্চ নির্ভুলতা প্রদান করে।

একটি কাস্টম মডেল প্রশিক্ষণের জন্য কতগুলি ছবি প্রয়োজন?

MobileNetV2-এ ট্রান্সফার লার্নিংয়ের জন্য: ন্যূনতম 50–100 ছবি প্রতি শ্রেণীতে, সর্বোত্তম 300–500। যত বেশি বৈচিত্র্য (কোণ, আলো, পটভূমি), তত বেশি নির্ভুলতা। স্ক্র্যাচ থেকে প্রশিক্ষণের (পূর্ব-প্রশিক্ষিত মডেল ছাড়া) জন্য, প্রতি শ্রেণীতে ন্যূনতম 1000 ছবি প্রয়োজন। সুপারিশ: প্রতি শ্রেণীতে 200 ছবি দিয়ে শুরু করুন, নির্ভুলতা মূল্যায়ন করুন এবং কম নির্ভুল শ্রেণীর জন্য ডেটা যোগ করুন। ডেটা অগমেন্টেশন (ঘূর্ণন, স্কেলিং, শিফট) নতুন ডেটা সংগ্রহ না করেই কার্যকর ডেটাসেট 3–5 গুণ বাড়ায়।

Image Labeling-এর জন্য TFLite মডেলের আকার কীভাবে কমানো যায়?

প্রধান পদ্ধতি: প্রশিক্ষণ-পরবর্তী INT8 কোয়ান্টাইজেশন — 1–2% নির্ভুলতা হ্রাস সহ আকার 4 গুণ কমায়; প্রুনিং (গুরুত্বহীন ওয়েট বাদ দেওয়া) — 50% পর্যন্ত কম্প্রেশন; ডিস্টিলেশন (একটি বড় টিচার মডেলের আউটপুটে প্রশিক্ষিত ছোট স্টুডেন্ট মডেল) — 80% পর্যন্ত কম্প্রেশন। MobileNetV2 INT8 3.5 MB জায়গা নেয়, SqueezeNet — 5 MB। লক্ষ্য আকার — অগ্রগতি নির্দেশক ছাড়াই তাৎক্ষণিক লোডিংয়ের জন্য 10 MB-এর বেশি নয়।

ML Kit Image Labeling v2-এর নির্ভুলতা কত?

ML Kit Image Labeling v2 Google-এর পরীক্ষা সেটে (400+ শ্রেণী) 91% top-1 নির্ভুলতা দেখায়। Top-5 নির্ভুলতা — 98%। অ-মানক কোণ এবং আলোর অবস্থায়, নির্ভুলতা 75–85% পর্যন্ত কমতে পারে। উত্পাদনের জন্য, নিম্ন-মানের ভবিষ্যদ্বাণীর স্থিতিশীল ফিল্টারিংয়ের জন্য 0.7-এর কনফিডেন্স থ্রেশহোল্ড ব্যবহার করার পরামর্শ দেওয়া হয়। যদি নির্ভুলতা অপর্যাপ্ত হয়, তবে একটি নির্দিষ্ট ডেটাসেটে প্রশিক্ষিত কাস্টম মডেল ব্যবহার করুন: লক্ষ্য শ্রেণীতে 95–98% নির্ভুলতা।

সারাংশ

  • Image Labeling — একটি নির্দিষ্ট সেট থেকে লেবেল নির্ধারণকারী ইমেজ শ্রেণীবিভাগ
  • ML Kit Image Labeling — 400+ লেবেল, 10–20 ms লেটেন্সি, ডিভাইসে 91% নির্ভুলতা
  • Core ML + Vision — ANE ত্বরণ এবং কাস্টম মডেল সহ নেটিভ iOS পদ্ধতি
  • ট্রান্সফার লার্নিং — প্রতি শ্রেণীতে 100–500 ছবি, Google Colab-এ 1–2 ঘন্টা প্রশিক্ষণ
  • TFLite / Core ML — আকার কমানোর জন্য কোয়ান্টাইজেশন সহ দুটি প্রধান ফর্ম্যাট
  • ডিভাইসে — গোপনীয়তা, শূন্য লেটেন্সি, ইন্টারনেটের প্রয়োজন নেই
  • প্রয়োগ — ফটো ট্যাগিং, কন্টেন্ট মডারেশন, AR, ভিজুয়াল পণ্য অনুসন্ধান

আমরা একটি মোবাইল অ্যাপ্লিকেশন টার্নকি তৈরি করব

IT Sectr 2017 সাল থেকে স্টার্টআপ এবং ব্যবসার জন্য iOS এবং Android অ্যাপ্লিকেশন তৈরি করে। আমরা আপনাকে পরামর্শ দেব এবং সেরা সমাধান প্রস্তাব করব।

প্রকল্প নিয়ে আলোচনা করুন

আরও পড়ুন