Image Labeling एक कंप्यूटर विज़न कार्य है जिसमें एक तंत्रिका नेटवर्क एक पूर्वनिर्धारित वर्गों के सेट से एक छवि को लेबल प्रदान करता है: सरल (बिल्ली, कुत्ता, कार) से लेकर विशिष्ट (पौधे की प्रजाति, स्मार्टफ़ोन मॉडल, मेडिकल स्कैन) तक। मोबाइल डेवलपमेंट में, Image Labeling का उपयोग गैलरी में फ़ोटो के ऑटो-टैगिंग, उपयोगकर्ता सामग्री के मॉडरेशन, फ़ोटो द्वारा उत्पादों की विज़ुअल खोज और AR अनुप्रयोगों के लिए किया जाता है। Google ML Kit, 2025 के अनुसार, अंतर्निहित वर्गीकारक 91% सटीकता (top-1) के साथ प्रति फ्रेम 10–20 ms में 400+ श्रेणियों को पहचानता है।
मुख्य बिंदु
Image Labeling इमेज वर्गीकरण का एक उपप्रकार है जहाँ मॉडल इनपुट के रूप में एक छवि लेता है और प्रशिक्षण सेट से प्रत्येक वर्ग के लिए संभावनाएँ लौटाता है। ऑब्जेक्ट डिटेक्शन के विपरीत, Image Labeling छवि में वस्तुओं की स्थिति निर्धारित नहीं करता — केवल उनकी उपस्थिति या अनुपस्थिति। इमेज सेग्मेंटेशन के विपरीत, यह वस्तु की रूपरेखा नहीं बनाता। Image Labeling प्रश्न का उत्तर देता है “फ़ोटो में क्या है?”, न कि “फ़ोटो में कहाँ और क्या है?”
वर्गीकारक वास्तुकला: एक CNN बैकबोन (MobileNet, ResNet, EfficientNet) छवि से फ़ीचर मैप निकालता है, Global Average Pooling स्थानिक आयामों को संक्षिप्त करता है, और Softmax सक्रियण के साथ एक पूरी तरह से जुड़ी परत (Dense) वर्ग संभावनाएँ उत्पन्न करती है। MobileNetV2 मोबाइल उपकरणों के लिए सबसे लोकप्रिय बैकबोन है: 3.5M पैरामीटर, GPU के माध्यम से Pixel 6 पर 0.5–2 ms अनुमान। EfficientNet-Lite बेहतर सटीकता/पैरामीटर अनुपात वाला एक विकल्प है।
Top-1 बनाम Top-5 सटीकता: top-1 — मॉडल ने मुख्य वर्ग का सही अनुमान लगाया (ML Kit में 91%); top-5 — सही वर्ग पाँच सबसे संभावित वर्गों में शामिल है (ML Kit में 98%)। उत्पादन अनुप्रयोगों के लिए, top-5 का उपयोग करें और उपयोगकर्ता को कई लेबल विकल्प दिखाएँ। सामग्री मॉडरेशन के लिए, कॉन्फिडेंस थ्रेशोल्ड >= 0.8 के साथ top-1 का उपयोग करें (फ़ॉल्स पॉज़िटिव दर को 40% कम करता है)।
| आर्किटेक्चर | पैरामीटर | विलंबता | Top-1 | आकार |
|---|---|---|---|---|
| MobileNetV2 | 3.5M | 0.5–2 ms | 90.2% | 14 MB |
| MobileNetV3 | 2.5M | 0.3–1.5 ms | 91.5% | 10 MB |
| EfficientNet-Lite0 | 4.7M | 1–3 ms | 92.3% | 18 MB |
| ResNet-50 | 25.6M | 10–30 ms | 95.2% | 98 MB |
डिवाइस पर बनाम क्लाउड: डिवाइस पर वर्गीकरण (ML Kit, Core ML) पूर्ण डेटा गोपनीयता के साथ 1–20 ms विलंबता देता है। क्लाउड API (Google Cloud Vision, AWS Rekognition) — 500–2000 ms विलंबता और प्रति अनुरोध लागत, लेकिन बड़े मॉडल (ViT, CLIP) के कारण अधिक सटीक (97–99%) है। रीयल-टाइम अनुप्रयोगों (कैमरा, AR) के लिए, डिवाइस पर विकल्प चुनें। जटिल परिदृश्यों (चिकित्सा, विशेषज्ञ विश्लेषण) के लिए, डिवाइस पर फ़ॉलबैक के साथ क्लाउड का उपयोग करें।
ML Kit Image Labeling Google की डिवाइस पर इमेज वर्गीकरण के लिए तैयार लाइब्रेरी है। दो मोड में उपलब्ध: डिवाइस पर (मुफ़्त, 400+ लेबल, 10–20 ms) और क्लाउड (सशुल्क, 10000+ लेबल, 500+ ms)। डिवाइस पर संस्करण INT8 क्वांटाइज़ेशन के साथ MobileNetV3 का उपयोग करता है, डिस्क पर 4 MB स्थान लेता है। ML Kit स्वचालित रूप से छवि ओरिएंटेशन का पता लगाता है और वर्गीकरण से पहले आकार को अनुकूलित करता है।
ML Kit API: InputImage (Bitmap, media.Image, filePath से) → ImageLabeler → ImageLabel (लेबल, कॉन्फिडेंस, इंडेक्स) की सूची के साथ OnSuccessListener। कॉन्फिडेंस थ्रेशोल्ड (डिफ़ॉल्ट 0.5) लेबल लौटाने के लिए न्यूनतम आत्मविश्वास है। थ्रेशोल्ड को 0.7 तक बढ़ाने से प्रति फ्रेम लेबल की संख्या कम हो जाती है लेकिन प्रत्येक की सटीकता बढ़ जाती है। सामग्री मॉडरेशन के लिए, थ्रेशोल्ड को 0.8 पर सेट करें।
val labeler = ImageLabeling.getClient(
ImageLabelerOptions.DEFAULT_OPTIONS
)
labeler.process(inputImage)
.addOnSuccessListener { labels ->
labels
.filter { it.confidence >= 0.7f }
.forEach { label ->
log("Label: ${label.label}")
log("Confidence: ${label.confidence}")
}
}
.addOnFailureListener { error -> handleError(error) }
iOS पर ML Kit: API Android के समान है, UIImage या CMSampleBuffer का उपयोग करता है। ML Kit स्वचालित रूप से A12+ उपकरणों पर Core ML + ANE का उपयोग करता है। iOS 16+ के लिए, ML Kit Image Labeling iPhone 15 Pro पर 8–15 ms विलंबता देता है। विलंबता को कम करने के लिए, न्यूनतम संभव छवि रिज़ॉल्यूशन (MobileNet के लिए 224x224) पास करें — ML Kit स्वचालित रूप से स्केल करता है, लेकिन बड़ी छवियों को बदलने में 2–5 ms ओवरहेड जुड़ता है।
Core ML Apple का डिवाइस पर ML मॉडल चलाने का फ्रेमवर्क है। Vision Framework (VNCoreMLRequest) के साथ मिलकर, Core ML न्यूनतम कोड के साथ इमेज वर्गीकरण सक्षम करता है। Apple अंतर्निहित मॉडल प्रदान करता है: SqueezeNet (5 MB, 80.5% top-1), ResNet50 (98 MB, 95.2%), MobileNetV2 (14 MB, 90.2%)। .mlmodel या .mlpackage प्रारूप में मॉडल TensorFlow या PyTorch से coremltools के माध्यम से परिवर्तित किए जाते हैं।
VNCoreMLRequest एक Vision API है जो छवि प्रीप्रोसेसिंग (स्केलिंग, क्रॉप-टू-फ़िल, कलर स्पेस रूपांतरण) संभालता है और परिणाम मॉडल को पास करता है। Vision identifier (वर्ग नाम) और confidence (0..1) के साथ VNClassificationObservation लौटाता है। MaxCandidates लौटाए गए लेबल की अधिकतम संख्या है (डिफ़ॉल्ट 1)। स्वचालित चयन वर्गीकरण के लिए, imageCropAndScaleOption = .centerCrop के साथ VNCoreMLRequest का उपयोग करें।
guard let model = try? VNCoreMLModel(for: MobileNetV2().model) else { return }
let request = VNCoreMLRequest(model: model) { request, _ in
guard let results = request.results as? [VNClassificationObservation] else { return }
results.prefix(5).forEach { obs in
print("लेबल: \(obs.identifier), कॉन्फिडेंस: \(obs.confidence)")
}
}
request.imageCropAndScaleOption = .centerCrop
let handler = VNImageRequestHandler(cgImage: cgImage, options: [:])
try handler.perform([request])
iOS पर Core ML बनाम ML Kit: Core ML देशी है, अतिरिक्त SDK की आवश्यकता नहीं है, और ANE (Apple Neural Engine) के लिए बेहतर अनुकूलित है। ML Kit Google के मॉडलों की बदौलत जटिल दृश्यों पर अधिक सटीक है। Core ML किसी भी मॉडल (coremltools के माध्यम से परिवर्तित) का समर्थन करता है, जबकि ML Kit केवल अपने मॉडल का समर्थन करता है। त्वरित कार्यान्वयन के लिए, ML Kit का उपयोग करें। अधिकतम मॉडल नियंत्रण के लिए, Core ML का उपयोग करें। एक व्यावहारिक दृष्टिकोण: एक ऐप में दोनों फ्रेमवर्क का उपयोग करें — मानक लेबल के लिए ML Kit, कस्टम के लिए Core ML।
कस्टम Image Labeling मॉडल — एक विशिष्ट कार्य के लिए अपना स्वयं का वर्गीकारक प्रशिक्षित करना: फल की गुणवत्ता पहचानना, उत्पादन लाइन पर दोष का पता लगाना, कुत्ते की नस्लों का वर्गीकरण। प्रक्रिया में डेटासेट संग्रह (प्रति वर्ग 1000+ छवियाँ), एनोटेशन, पूर्व-प्रशिक्षित MobileNetV2 या EfficientNet पर ट्रांसफ़र लर्निंग के माध्यम से प्रशिक्षण, और TFLite / Core ML में रूपांतरण शामिल है।
ट्रांसफ़र लर्निंग — मोबाइल वर्गीकारकों को प्रशिक्षित करने की मुख्य विधि। ImageNet पर पूर्व-प्रशिक्षित मॉडल लिया जाता है, निचली परतें (CNN बैकबोन) फ़्रीज़ की जाती हैं, और ऊपरी परतों को फिर से प्रशिक्षित किया जाता है (फ़ाइन-ट्यूनिंग)। इसके लिए प्रति वर्ग केवल 100–500 छवियों की आवश्यकता होती है और Google Colab (GPU) पर 1–2 घंटे लगते हैं। लाइब्रेरीज़: TensorFlow Keras (Android), PyTorch + coremltools (iOS)। परिणाम: लक्ष्य वर्गों पर 95–98% सटीकता।
// TFLite कस्टम मॉडल अनुमान
val interpreter = Interpreter(loadModelFile(context))
val inputImage = TensorImage.fromBitmap(bitmap)
.apply { load(Bitmap.createScaledBitmap(bitmap, 224, 224, true)) }
val output = Array(1) { FloatArray(NUM_CLASSES) }
interpreter.run(inputImage.tensorBuffer, output)
val probabilities = TensorLabel.mapIndexToLabels(output[0])
val topClass = probabilities.maxByOrNull { it.value }
ML Kit Custom Model API — एक विकल्प: TFLite Interpreter कोड लिखने की आवश्यकता नहीं — ML Kit मॉडल लोड करता है और प्रीप्रोसेसिंग स्वचालित रूप से संभालता है। कस्टम Image Labeler इनपुट आकार 224x224x3 और आउटपुट score float[NUM_CLASSES] वाला TFLite मॉडल स्वीकार करता है। बस मॉडल फ़ाइल प्रदान करें और मानक लेबल प्राप्त करें। ML Kit Custom Model API अनुशंसित है यदि मॉडल TFLite प्रारूप से मेल खाता है। यदि अनुमान पर अधिक नियंत्रण (प्रति वर्ग थ्रेशोल्ड) की आवश्यकता है, तो सीधे TFLite Interpreter का उपयोग करें।
TFLite (TensorFlow Lite) मोबाइल और एज उपकरणों के लिए Google का मॉडल प्रारूप है। यह क्वांटाइज़ेशन (FP16, INT8) का समर्थन करता है, जो मॉडल आकार को 4 गुना कम करता है और गति को 2–3 गुना बढ़ाता है, जिसमें थोड़ी सटीकता हानि (1–2%) होती है। TFLite Android पर GPU Delegate (OpenGL/OpenCL) के माध्यम से और iOS पर Core ML Delegate के माध्यम से चलता है। TFLite Task API Image Classifier, Object Detector और अन्य कार्यों के लिए एक एकीकृत इंटरफ़ेस प्रदान करता है।
Core ML Apple का प्रारूप है (.mlpackage — नया, .mlmodel — पुराना)। यह क्वांटाइज़ेशन (FP16) और वेट पैलेटाइज़ेशन (1/2/4/6/8 बिट तक) का समर्थन करता है, जो 80% तक मॉडल संपीड़न प्राप्त करता है। Core ML ANE (Neural Engine), GPU और CPU का उपयोग करता है — सिस्टम स्वचालित रूप से इष्टतम इंजन चुनता है। PyTorch से torch.onnx.export + coremltools के माध्यम से, TensorFlow से tf-keras + coremltools के माध्यम से रूपांतरण। iOS 18+ Core ML Training API के माध्यम से डिवाइस पर प्रशिक्षण का समर्थन करता है।
| विशेषता | TFLite | Core ML |
|---|---|---|
| आकार (MobileNetV2) | 14 MB (FP32) / 3.5 MB (INT8) | 14 MB (FP16) / 2.8 MB (4-bit) |
| अनुमान इंजन | GPU / NNAPI / XNNPACK | ANE / GPU / CPU (स्वचालित) |
| क्वांटाइज़ेशन | FP16, INT8, DynamicRange | FP16, पैलेटाइज़ेशन (1-8 bit) |
| iOS प्रदर्शन | Core ML Delegate (2–5 ms) | देशी ANE (1–3 ms) |
| उपकरण | TFLite Model Maker, Task API | coremltools, Create ML |
मध्यवर्ती प्रारूप के रूप में ONNX: मॉडलों को ONNX (PyTorch → ONNX, TensorFlow → ONNX) और फिर onnx2tf या onnx2coreml के माध्यम से TFLite / Core ML में बदलें। ONNX एक एकीकृत प्रारूप है जो 70+ फ्रेमवर्क द्वारा समर्थित है। यह पाइपलाइन को सरल बनाता है: एक प्रशिक्षित मॉडल → ONNX → दोनों प्लेटफ़ॉर्म के लिए देशी प्रारूप। क्रॉस-प्लेटफ़ॉर्म परियोजनाओं के लिए PyTorch में प्रशिक्षण + ONNX → TFLite (Android) / Core ML (iOS) में रूपांतरण अनुशंसित पाइपलाइन है।
फ़ोटो का ऑटो-टैगिंग — गैलरी ऐप्स (Google Photos, Apple Photos) स्वचालित रूप से छवियों को लेबल प्रदान करते हैं: “समुद्र तट”, “सूर्यास्त”, “कुत्ता”, “भोजन”। ML Kit Image Labeling पृष्ठभूमि में गैलरी से प्रत्येक फ़ोटो संसाधित करता है — 100 फ़ोटो (बैच) के लिए 1–2 सेकंड। उपयोगकर्ता मैन्युअल सॉर्टिंग के बिना लेबल द्वारा खोज प्राप्त करता है। Google Photos जटिल दृश्यों के लिए बाद में सर्वर सत्यापन के साथ डिवाइस पर वर्गीकरण का उपयोग करता है।
सामग्री मॉडरेशन — उपयोगकर्ता सामग्री (सोशल नेटवर्क, मार्केटप्लेस, UGC प्लेटफ़ॉर्म) में अवांछित छवियों का स्वचालित पता लगाना। ML Kit Custom Model 92–96% सटीकता के साथ NSFW सामग्री, हिंसा और प्रचार का पता लगाता है। ट्रिगर थ्रेशोल्ड — कॉन्फिडेंस 0.8। फ़ॉल्स पॉज़िटिव (वैध चिकित्सा छवियाँ) को कम करने के लिए, वर्गीकारकों की एक समिति का उपयोग करें: Image Labeling + Object Detection + Blur Detection। डिवाइस पर मॉडरेशन तेज़ है और उपयोगकर्ता गोपनीयता की रक्षा करता है।
उत्पादों की विज़ुअल खोज — उपयोगकर्ता एक उत्पाद (स्नीकर्स, बैग, फ़र्नीचर) का फ़ोटो लेता है, ऐप लेबल निर्धारित करता है और कैटलॉग में समान उत्पाद ढूँढता है। Image Labeling खोज को एक श्रेणी तक सीमित करता है, फिर फ़ीचर डिस्क्रिप्टर (फ़ीचर वेक्टर) समान दिखने वाली वस्तुएँ ढूँढते हैं। Pinterest Lens, Google Lens और Amazon StyleSnap इस दृष्टिकोण का उपयोग करते हैं। डिवाइस पर वर्गीकरण 10–30 ms में परिणाम देता है, क्लाउड खोज — 200–500 ms में।
// विज़ुअल खोज के लिए Core ML के साथ Image Labeling
let request = VNCoreMLRequest(model: productClassifier) { req, _ in
guard let result = req.results?.first as? VNClassificationObservation,
result.confidence > 0.6 else { return }
SearchService.findSimilarProducts(
category: result.identifier,
image: capturedPhoto,
limit: 10
) { products in
DispatchQueue.main.async {
self.showResults(products)
}
}
}
AR और शैक्षिक ऐप्स — Image Labeling कैमरे के माध्यम से रीयल टाइम में वस्तुओं का वर्गीकरण करता है। उपयोगकर्ता अपना फ़ोन एक पौधे की ओर इंगित करता है — ऐप नाम, देखभाल निर्देश और पानी देने का शेड्यूल दिखाता है। एक यांत्रिक भाग की ओर इंगित करता है — इसका उद्देश्य बताता है। आवश्यकता: विलंबता < 30 ms। फ़्लैगशिप उपकरणों पर EfficientNet-Lite 15–25 ms देता है। कम रोशनी में, सटीकता गिर जाती है — एक अनुकूली कॉन्फिडेंस थ्रेशोल्ड का उपयोग करें (इनपुट गुणवत्ता में गिरावट की भरपाई के लिए कम रोशनी में थ्रेशोल्ड कम करें)।
अक्सर पूछे जाने वाले प्रश्न
Image Labeling यह निर्धारित करता है कि छवि में कौन सी वस्तुएँ मौजूद हैं लेकिन उनका स्थान नहीं बताता। Object Detection वस्तुओं का पता लगाता है और प्रत्येक के लिए बाउंडिंग बॉक्स लौटाता है। Image Labeling तेज़ है (1–20 ms बनाम 20–100 ms), कम प्रशिक्षण डेटा की आवश्यकता है, लेकिन स्थितिगत जानकारी प्रदान नहीं करता। सरल वर्गीकरण (बिल्ली/कुत्ता) के लिए, Image Labeling का उपयोग करें। लक्षित पहचान (कितनी वस्तुएँ, वे कहाँ हैं) के लिए, Object Detection का उपयोग करें।
नहीं, ML Kit Image Labeling पूरी तरह से डिवाइस पर काम करता है। मॉडल पहले लॉन्च पर डाउनलोड होता है (डाउनलोडेड मोड — 4 MB) और स्थानीय रूप से संग्रहीत होता है। Core ML मॉडल ऐप के साथ बंडल किए जाते हैं। TFLite कस्टम मॉडल APK का हिस्सा है। सभी गणनाएँ डिवाइस पर चलती हैं, और सर्वर को कोई डेटा नहीं भेजा जाता है। यह उपयोगकर्ता गोपनीयता और ऑफ़लाइन कार्यक्षमता की गारंटी देता है। क्लाउड वर्गीकरण (Google Cloud Vision) एक विकल्प है जिसके लिए इंटरनेट की आवश्यकता है और अधिक सटीकता प्रदान करता है।
MobileNetV2 पर ट्रांसफ़र लर्निंग के लिए: न्यूनतम 50–100 छवियाँ प्रति वर्ग, इष्टतम 300–500। जितनी अधिक विविधता (कोण, प्रकाश, पृष्ठभूमि), उतनी अधिक सटीकता। शुरुआत से प्रशिक्षण (बिना पूर्व-प्रशिक्षित मॉडल) के लिए, प्रति वर्ग न्यूनतम 1000 छवियों की आवश्यकता है। अनुशंसा: प्रति वर्ग 200 छवियों से शुरू करें, सटीकता का मूल्यांकन करें, और कम सटीकता वाले वर्गों के लिए डेटा जोड़ें। डेटा ऑग्मेंटेशन (रोटेशन, स्केलिंग, शिफ्ट) नया डेटा एकत्र किए बिना प्रभावी डेटासेट को 3–5 गुना बढ़ाता है।
मुख्य विधियाँ: प्रशिक्षण के बाद INT8 क्वांटाइज़ेशन — 1–2% सटीकता हानि के साथ आकार को 4 गुना कम करता है; प्रूनिंग (महत्वहीन वेट हटाना) — 50% तक संपीड़न; डिस्टिलेशन (एक बड़े टीचर मॉडल के आउटपुट पर प्रशिक्षित छोटा स्टूडेंट मॉडल) — 80% तक संपीड़न। MobileNetV2 INT8 3.5 MB स्थान लेता है, SqueezeNet — 5 MB। लक्ष्य आकार — प्रगति संकेतक के बिना तत्काल लोडिंग के लिए 10 MB से अधिक नहीं।
ML Kit Image Labeling v2 Google के परीक्षण सेट (400+ वर्ग) पर 91% top-1 सटीकता दिखाता है। Top-5 सटीकता — 98%। गैर-मानक कोणों और प्रकाश स्थितियों में, सटीकता 75–85% तक गिर सकती है। उत्पादन के लिए, निम्न-गुणवत्ता वाली भविष्यवाणियों की स्थिर फ़िल्टरिंग के लिए 0.7 के कॉन्फिडेंस थ्रेशोल्ड का उपयोग करने की अनुशंसा की जाती है। यदि सटीकता अपर्याप्त है, तो एक विशिष्ट डेटासेट पर प्रशिक्षित कस्टम मॉडल का उपयोग करें: लक्ष्य वर्गों पर 95–98% सटीकता।
सारांश
हम एक मोबाइल एप्लिकेशन टर्नकी विकसित करेंगे
IT Sectr 2017 से स्टार्टअप और व्यवसायों के लिए iOS और Android एप्लिकेशन बनाता है। हम आपको सलाह देंगे और सर्वोत्तम समाधान प्रस्तावित करेंगे।
यह भी पढ़ें