ML Kit — biblioteca de învățare automată de la Google, care oferă API-uri gata făcute pentru recunoașterea textului, fețelor, obiectelor și codurilor de bare pe dispozitive mobile. Spre deosebire de soluțiile ML bazate pe cloud, ML Kit execută toate calculele local pe dispozitiv, asigurând funcționarea fără internet și confidențialitatea datelor utilizatorului. Conform Google ML Kit Documentation (2026), biblioteca suportă Android și iOS, acoperind peste 15 API-uri pentru diverse sarcini de viziune computerizată și procesare a textului.
Principalele puncte
ML Kit — este o bibliotecă SDK mobilă de la Google care oferă dezvoltatorilor API-uri gata făcute de învățare automată pentru Android și iOS. A fost prezentată în 2018 la Google I/O ca parte a Firebase, iar apoi a devenit disponibilă ca SDK autonom. ML Kit abstrage complexitatea Data Science: dezvoltatorul nu trebuie să antreneze modele, să configureze hiperparametri sau să înțeagă calculele tensorilor.
Biblioteca acoperă patru direcții cheie ale viziunii computerizate și NLP: recunoașterea textului, detectarea fețelor, scanarea codurilor de bare, analiza imaginilor și segmentarea obiectelor. Fiecare API este disponibil în două variante — de bază (accelerat) și precis (cu model extins).
ML Kit este distribuit prin Google Play Services pentru Android, ceea ce permite actualizarea modelelor fără a publica o nouă versiune a aplicației. Dimensiunea de descărcare a fiecărui API este cuprinsă între 2 și 15 MB, în funcție de complexitatea modelului. Pentru iOS, biblioteca este furnizată prin CocoaPods sau Swift Package Manager cu descărcarea manuală a modelului la prima lansare. Conform Google, dimensiunea totală a tuturor API-urilor ML Kit nu depășește 80 MB, ceea ce face biblioteca acceptabilă pentru aplicațiile mobile cu restricții de volum.
ML Kit include API-uri pentru recunoașterea textului cu suport pentru alfabetul latin, chirilic și caractere chinezești, detectarea și urmărirea fețelor cu identificarea zâmbetului și a ochilor deschiși, scanarea codurilor de bare în toate formatele populare, segmentarea imaginilor în prim-plan și fundal, analiza posturii umane pe baza a 33 de puncte cheie și recunoașterea obiectelor cu clasificare. Conform Google I/O 2025, precizia modelelor de bază ML Kit atinge 97% pentru textul latin și 94% pentru fețe.
ML Kit oferă mai multe grupuri de API-uri, fiecare rezolvând o sarcină specifică de viziune computerizată sau procesare a textului. Să examinăm trei domenii cele mai solicitate.
Text Recognition API permite extragerea textului tipărit și de mână din imagini în timp real. API-ul funcționează cu 50+ limbi, inclusiv română, engleză, chineză și arabă. Rezultatul este returnat sub forma unei structuri ierarhice: blocuri de text → rânduri și tokeni cu coordonatele fiecărui element. Conform Google ML Kit benchmarks (2026), pe un dispozitiv de clasă medie, recunoașterea unui cadru durează 80–150 ms pentru modelul de bază.
Face Detection API detectează fețe în imagini și flux video, identificând până la 17 puncte de referință cheie: ochi, sprâncene, nas, gură, conturul feței. API-ul calculează, de asemenea, probabilitatea zâmbetului, deschiderea ochilor și unghiul de rotație a capului pe trei axe. Spre deosebire de soluțiile cloud, ML Kit procesează fețele strict pe dispozitiv, fără a trimite imagini pe server.
Barcode Scanning API suportă toate formatele comune: EAN-13, QR Code, Code 128, PDF417, Data Matrix și Aztec. API-ul detectează automat formatul codului și returnează conținutul acestuia — de la text simplu la date structurate (URL, carte de vizită vCard, coordonate de geolocație). Viteza de scanare atinge 30 de cadre pe secundă, ceea ce permite utilizarea API-ului în aplicații de timp real.
Pentru a conecta ML Kit la un proiect Android, este suficient să adăugați dependența corespunzătoare în build.gradle și să creați o instanță a procesorului. Să examinăm integrarea pe exemplul Text Recognition API.
În fișierul build.gradle (la nivel de aplicație) se adaugă dependența pentru ML Kit Text Recognition. Biblioteca descarcă automat modelul la prima apelare prin Google Play Services.
dependencies {
// ML Kit Text Recognition v2
implementation 'com.google.mlkit:text-recognition:16.0.1'
// Pentru funcționarea pe dispozitive fără Google Play
implementation 'com.google.mlkit:text-recognition:16.0.1'
}
După configurarea dependențelor, puteți crea un TextRecognizer și să îi transmiteți o imagine în format InputImage. Rezultatul este returnat sub formă de obiecte RecognizedText.
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)
recognizer.process(image)
.addOnSuccessListener { result ->
for (block in result.textBlocks) {
val blockText = block.text
val lines = block.lines
// Procesarea textului recunoscut
Log.d("MLKit", "Block: $blockText")
}
}
.addOnFailureListener { e ->
Log.e("MLKit", "Eroare: $e")
}
Codul creează un client TextRecognition, îi transmite o imagine bitmap și procesează rezultatul asincron. Blocurile de text conțin rânduri încuibate și tokeni cu coordonate, ceea ce permite afișarea textului găsit direct pe imagine.
Un aspect important al integrării este gestionarea erorilor. ML Kit poate returna o eroare la o imagine prea întunecată, text rotit sau depășirea limitei de memorie. Se recomandă să adăugați întotdeauna un fallback la recunoașterea în cloud prin Google Cloud Vision pentru cazurile în care modelul pe dispozitiv nu a reușit. Practica arată că abordarea combinată (ML Kit + Cloud Vision) crește precizia generală de recunoaștere de la 92% la 98% pe documente complexe.
ML pe dispozitiv — diferența cheie dintre ML Kit și serviciile ML în cloud. Toate calculele au loc local pe dispozitiv, ceea ce oferă trei avantaje principale. Primul — zero întârziere: modelul procesează datele în 50–200 ms fără a aștepta răspunsul de la server. Al doilea — funcționarea fără internet: biblioteca funcționează în modul avion, ceea ce este critic pentru aplicațiile de teren.
Procesarea locală garantează că fotografiile, documentele și datele personale ale utilizatorului nu părăsesc niciodată dispozitivul. Acest lucru este deosebit de important pentru aplicațiile din domeniile medical, financiar și de securitate corporativă, unde transmiterea datelor pe server este interzisă de cerințele de reglementare. Conform statisticilor Google (2026), 78% dintre utilizatori preferă aplicațiile cu procesare pe dispozitiv din motive de confidențialitate.
Spre deosebire de soluțiile ML în cloud care trimit imagini pe server și consumă trafic mobil, ML Kit nu necesită conexiune la rețea. Economia de trafic poate ajunge la 50–200 MB pe zi pentru aplicații cu procesare intensivă a imaginilor. Bateria se consumă moderat: un ciclu de recunoaștere consumă 0.5–2% încărcare pe oră de utilizare activă.
ML Kit ocupă o poziție intermediară între framework-urile native ML (TensorFlow Lite, Core ML) și serviciile cloud (Google Cloud Vision, AWS Rekognition). Să comparăm caracteristicile cheie.
| Caracteristică | ML Kit | TensorFlow Lite | Google Cloud Vision |
|---|---|---|---|
| Execuție | Doar pe dispozitiv | Doar pe dispozitiv | În cloud |
| Necesită Data Science | Nu | Da | Nu |
| Viteză | 80–200 ms | 50–300 ms | 500–2000 ms |
| Funcționare offline | Da | Da | Nu |
| Precizie | 94–97% | 95–99% | 98–99% |
| Modele personalizate | Prin TFLite | Da | AutoML Vision |
| Preț | Gratuit | Gratuit | $1.50/1000 unit. |
Pentru sarcini tipice de viziune computerizată, cum ar fi scanarea documentelor sau verificarea fețelor, ML Kit este alegerea optimă datorită simplității de integrare. Proiectele complexe cu arhitecturi proprii de rețele neuronale necesită TensorFlow Lite. Serviciile cloud sunt justificate atunci când este necesară precizie maximă.
Atunci când alegeți între ML Kit și TensorFlow Lite, luați în considerare raportul dintre viteza de dezvoltare și flexibilitate. Dacă în proiect există deja un data scientist și un model antrenat — utilizați TFLite direct. Dacă ML este doar o funcție auxiliară a aplicației (scanarea unei chitanțe, verificarea zâmbetului într-un selfie) — ML Kit va oferi un rezultat în 30 de minute, în loc de o săptămână.
Conform Google (2026), timpul mediu de implementare a ML Kit într-un proiect existent este de 4–6 ore pentru un scenariu de bază și 2–3 zile pentru o integrare completă cu un model personalizat. În 73% din cazuri, dezvoltatorii aleg ML Kit tocmai pentru viteza de integrare, nu pentru precizia maximă a modelelor.
întrebări frecvente
Nu, ML Kit execută toate calculele local pe dispozitiv. Internetul este necesar doar pentru descărcarea inițială a modelului prin Google Play Services, după care biblioteca funcționează complet offline.
Android (API 24+) și iOS (12.0+). Pentru Android se utilizează integrarea prin Google Play Services, pentru iOS — prin CocoaPods sau Swift Package Manager cu descărcarea manuală a modelului.
Da, ML Kit suportă importul modelelor personalizate TensorFlow Lite prin clasele LocalModel sau RemoteModel. Modelul trebuie convertit în formatul .tflite și optimizat pentru dispozitive mobile.
ML Kit — o bibliotecă de nivel înalt cu API-uri gata făcute, care nu necesită cunoștințe de ML. TensorFlow Lite — un runtime de nivel scăzut pentru rularea modelelor personalizate. ML Kit folosește intern TFLite, dar ascunde complexitatea față de dezvoltator.
Modelele sunt actualizate automat prin Google Play Services pentru Android și prin App Store pentru iOS. Google lansează actualizări la fiecare 6–8 săptămâni, îmbunătățind precizia de recunoaștere și adăugând noi limbi.
Rezumat
Vom dezvolta o aplicație mobilă la cheie
IT Sectr creează aplicații iOS și Android pentru startup-uri și afaceri din 2017. Vă vom consilia și vă vom propune cea mai bună soluție.
Citiți și