ML Kit — библиотека машинског учења од Google-а, која пружа готове API-је за препознавање текста, лица, објеката и баркодова на мобилним уређајима. За разлику од облачких ML решења, ML Kit извршава све прорачуне локално на уређају, омогућућући рад без интернета и поверљивост података корисника. Према Google ML Kit Documentation (2026), библиотека подржава Android и iOS, обухватајући више од 15 API-ја за различите задатке рачунарске визије и обраде текста.
Главно
ML Kit — је мобилна SDK библиотека од Google-а која програмерима пружа готове API-је машинског учења за Android и iOS. Представљена је 2018. године на Google I/O као део Firebase-а, а затим је постала доступна као самостални SDK. ML Kit апстрахује сложеност Data Science-а: програмер не мора да тренира моделе, подешава хиперпараметре или разуме тензорске прорачуне.
Библиотека покрива четири кључна подручја рачунарске визије и NLP-а: препознавање текста, откривање лица, скенирање баркодова, анализу слика и сегментацију објеката. Сваки API је доступан у два варијанта — основни (убрзани) и прецизни (са проширеним моделом).
ML Kit се дистрибуира путем Google Play Services за Android, што омогућава ажурирање модела без објављивања нове верзије апликације. Величина преузимања сваког API-ја креће се од 2 до 15 MB у зависности од сложености модела. За iOS, библиотека се доставља путем CocoaPods или Swift Package Manager-а са ручним преузимањем модела при првом покретању. Према Google-у, укупна величина свих API-ја ML Kit-а не прелази 80 MB, што чини библиотеку прихватљивом за мобилне апликације са ограничењима по обиму.
ML Kit укључује API-је за препознавање текста са подршком за латиницу, ћирилицу и кинеске знакове, откривање и праћење лица са одређивањем осмеха и отворених очију, скенирање баркодова у свим популарним форматима, сегментацију слика на предњи и позадину план, анализу положаја људи на основу 33 кључне тачке и препознавање објеката са класификацијом. Према Google I/O 2025, прецизност основних модела ML Kit-а достиже 97% за латински текст и 94% за лица.
ML Kit нуди неколико група API-ја, од којих свака решава одређени задатак рачунарске визије или обраде текста. Размотримо три најтраженија подручја.
Text Recognition API омогућава издвајање штампаног и рукописног текста из слика у реалном времену. API ради са 50+ језика, укључујући српски, енглески, кинески и арапски. Резултат се враћа у облику хијерархијске структуре: блокови текста → редови → токени са координатама сваког елемента. Према Google ML Kit benchmarks (2026), на уређају средње класе препознавање једног кадра траје 80–150 ms за основни модел.
Face Detection API открива лица на сликама и у видео току, одређујући до 17 кључних тачака: очи, обрве, нос, уста, контуру лица. API такође израчунава вероватноћу осмеха, отвореност очију и угао ротације главе по три осе. За разлику од облачких решења, ML Kit обрађује лица искључиво на уређају без слања слика на сервер.
Barcode Scanning API подржава све раширене формате: EAN-13, QR Code, Code 128, PDF417, Data Matrix и Aztec. API аутоматски одређује формат кода и враћа његов садржај — од обичног текста до структурираних података (URL, vCard визиткарница, координате геолокације). Брзина скенирања достиже 30 кадрова у секунди, што омогућава кориштење API-ја у апликацијама реалног времена.
За повезивање ML Kit-а са Android пројектом довољно је додати одговарајућу зависност у build.gradle и креирати инстанцу процесора. Размотримо интеграцију на примеру Text Recognition API-ја.
У датотеци build.gradle (ниво апликације) додаје се зависност за ML Kit Text Recognition. Библиотека аутоматски преузима модел при првом позиву путем Google Play Services-а.
dependencies {
// ML Kit Text Recognition v2
implementation 'com.google.mlkit:text-recognition:16.0.1'
// За рад на уређајима без Google Play-а
implementation 'com.google.mlkit:text-recognition:16.0.1'
}
Након подешавања зависности можете креирати TextRecognizer и пренијети му слику у InputImage формату. Резултат се враћа у облику RecognizedText објеката.
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)
recognizer.process(image)
.addOnSuccessListener { result ->
for (block in result.textBlocks) {
val blockText = block.text
val lines = block.lines
// Обрада препознатог текста
Log.d("MLKit", "Block: $blockText")
}
}
.addOnFailureListener { e ->
Log.e("MLKit", "Грешка: $e")
}
Код креира клијента TextRecognition, преноси му битмап слику и обрађује резултат асинхроно. Блокови текста садрже угнијеждене редове и токене са координатама, што омогућава приказ пронађеног текста директно на слици.
Важан аспект интеграције је руковање грешкама. ML Kit може да врати грешку код превише тамне слике, окренутог текста или прекорачивања лимита меморије. Препоручује се увијек додати fallback на облачко препознавање путем Google Cloud Vision-а за случајеве када модел на уређају није успио. Пракса показује да комбиновани приступ (ML Kit + Cloud Vision) повећава укупну прецизност препознавања са 92% на 98% на сложеним документима.
ML на уређају — кључна разлика ML Kit-а од облачких ML услуга. Све прорачуне се одвијају локално на уређају, што пружа три принципијелне предности. Прва — нулта кашњење: модел обрађује податке за 50–200 ms без чекања одговора са сервера. Друга — рад без интернета: библиотека ради у авионском моду, што је критично за теренске апликације.
Локална обрада гарантује да фотографије, документи и лични подаци корисника никада не напуштају уређај. То је посебно важно за апликације у медицини, финансијама и корпоративној сигурности, где је слање података на сервер забрањено регулаторним захтевима. Према статистици Google-а (2026), 78% корисника преферира апликације са обрадом на уређају из разлога приватности.
За разлику од облачких ML решења која шаљу слике на сервер и троше мобилни промет, ML Kit не захтева мрежну везу. Уштеда промета може да достигне 50–200 MB дневно за апликације са интензивном обрадом слика. Батерија се троши умјерено: један циклус препознавања троши 0.5–2% напуњења по сату активног кориштења.
ML Kit заузима посредну позицију између нативних ML фрејмворка (TensorFlow Lite, Core ML) и облачких услуга (Google Cloud Vision, AWS Rekognition). Упоредимо кључне карактеристике.
| Карактеристика | ML Kit | TensorFlow Lite | Google Cloud Vision |
|---|---|---|---|
| Извршавање | Само на уређају | Само на уређају | Облачко |
| Захтева Data Science | Не | Да | Не |
| Брзина | 80–200 ms | 50–300 ms | 500–2000 ms |
| Рад ван мреже | Да | Да | Не |
| Прецизност | 94–97% | 95–99% | 98–99% |
| Прилагођени модели | Путем TFLite | Да | AutoML Vision |
| Цена | Бесплатно | Бесплатно | $1.50/1000 јед. |
За типичне задатке рачунарске визије, као што је скенирање докумената или провјера лица, ML Kit је оптималан избор због једноставности интеграције. Сложени пројекти са сопственим архитектурама неуронских мрежа захтевају TensorFlow Lite. Облачке услуге су оправдане када је потребна максимална прецизност.
При избору између ML Kit-а и TensorFlow Lite-а узмите у обзир однос брзине развоја и флексибилности. Ако у пројекту већ постоји data scientist и обучен модел — користите TFLite директно. Ако је ML само помоћна функција апликације (скенирање рачуна, провјера осмеха на селфију) — ML Kit ће дати резултат за 30 минута уместо недељу дана.
Према Google-у (2026), просечно врјеме имплементације ML Kit-а у постојећи пројекат износи 4–6 сати за основни сценаријум и 2–3 дана за потпуну интеграцију са прилагођеним моделом. У 73% случајева, програмери бирају ML Kit управо због брзине интеграције, а не због максималне прецизности модела.
Често постављана питања
Не, ML Kit извршава све прорачуне локално на уређају. Интернет је потребан само за првобитно преузимање модела путем Google Play Services-а, након чега библиотека ради потпуно офлајн.
Android (API 24+) и iOS (12.0+). За Android се користи интеграција путем Google Play Services-а, за iOS — путем CocoaPods или Swift Package Manager-а са ручним преузимањем модела.
Да, ML Kit подржава увоз прилагођених TensorFlow Lite модела кроз класе LocalModel или RemoteModel. Модел мора бити конвертован у .tflite формат и оптимизован за мобилне уређаје.
ML Kit — библиотека високог нивоа са готовим API-јима, која не захтева познање ML-а. TensorFlow Lite — рантајм ниског нивоа за покретање прилагођених модела. ML Kit унутра користи TFLite, али скрива сложеност од програмера.
Модели се ажурирају аутоматски путем Google Play Services-а за Android и путем App Store-а за iOS. Google објављује ажурирања сваких 6–8 недеља, побољшавајући прецизност препознавања и додајући нове језике.
Резиме
Развићемо мобилну апликацију под кључ
IT Sectr креира iOS и Android апликације за стартапе и предузећа од 2017. године. Саветоваћемо вас и предложити најбоље решење.
Прочитајте такође