ML Kit: шта је то, могућности и како ради

Аутор: IT Sectr Објављено: 2026-03-26 Време читања: 8 мин

ML Kit — библиотека машинског учења од Google-а, која пружа готове API-је за препознавање текста, лица, објеката и баркодова на мобилним уређајима. За разлику од облачких ML решења, ML Kit извршава све прорачуне локално на уређају, омогућућући рад без интернета и поверљивост података корисника. Према Google ML Kit Documentation (2026), библиотека подржава Android и iOS, обухватајући више од 15 API-ја за различите задатке рачунарске визије и обраде текста.

Главно

  • ML Kit — библиотека Google-а за машинско учење на уређају на Android и iOS-у без потребе за повезивање са сервером
  • 15+ API-ја обухвата препознавање текста, лица, баркодова, сегментацију слика и анализу положаја
  • Локална обрада елиминише кашњење мреже и гарантује да подаци не напуштају уређај
  • Интеграција путем Gradle зависности за Android и CocoaPods за iOS са минималним кодом иницијализације
  • Firebase ML проширује могућности ML Kit-а облачким моделима за сложеније задатке, као што је Vision API

Шта је ML Kit?

ML Kit — је мобилна SDK библиотека од Google-а која програмерима пружа готове API-је машинског учења за Android и iOS. Представљена је 2018. године на Google I/O као део Firebase-а, а затим је постала доступна као самостални SDK. ML Kit апстрахује сложеност Data Science-а: програмер не мора да тренира моделе, подешава хиперпараметре или разуме тензорске прорачуне.

Библиотека покрива четири кључна подручја рачунарске визије и NLP-а: препознавање текста, откривање лица, скенирање баркодова, анализу слика и сегментацију објеката. Сваки API је доступан у два варијанта — основни (убрзани) и прецизни (са проширеним моделом).

ML Kit се дистрибуира путем Google Play Services за Android, што омогућава ажурирање модела без објављивања нове верзије апликације. Величина преузимања сваког API-ја креће се од 2 до 15 MB у зависности од сложености модела. За iOS, библиотека се доставља путем CocoaPods или Swift Package Manager-а са ручним преузимањем модела при првом покретању. Према Google-у, укупна величина свих API-ја ML Kit-а не прелази 80 MB, што чини библиотеку прихватљивом за мобилне апликације са ограничењима по обиму.

Основне могућности

ML Kit укључује API-је за препознавање текста са подршком за латиницу, ћирилицу и кинеске знакове, откривање и праћење лица са одређивањем осмеха и отворених очију, скенирање баркодова у свим популарним форматима, сегментацију слика на предњи и позадину план, анализу положаја људи на основу 33 кључне тачке и препознавање објеката са класификацијом. Према Google I/O 2025, прецизност основних модела ML Kit-а достиже 97% за латински текст и 94% за лица.

Кључни API ML Kit-а

ML Kit нуди неколико група API-ја, од којих свака решава одређени задатак рачунарске визије или обраде текста. Размотримо три најтраженија подручја.

Препознавање текста

Text Recognition API омогућава издвајање штампаног и рукописног текста из слика у реалном времену. API ради са 50+ језика, укључујући српски, енглески, кинески и арапски. Резултат се враћа у облику хијерархијске структуре: блокови текста → редови → токени са координатама сваког елемента. Према Google ML Kit benchmarks (2026), на уређају средње класе препознавање једног кадра траје 80–150 ms за основни модел.

Препознавање лица

Face Detection API открива лица на сликама и у видео току, одређујући до 17 кључних тачака: очи, обрве, нос, уста, контуру лица. API такође израчунава вероватноћу осмеха, отвореност очију и угао ротације главе по три осе. За разлику од облачких решења, ML Kit обрађује лица искључиво на уређају без слања слика на сервер.

Скенирање баркодова

Barcode Scanning API подржава све раширене формате: EAN-13, QR Code, Code 128, PDF417, Data Matrix и Aztec. API аутоматски одређује формат кода и враћа његов садржај — од обичног текста до структурираних података (URL, vCard визиткарница, координате геолокације). Брзина скенирања достиже 30 кадрова у секунди, што омогућава кориштење API-ја у апликацијама реалног времена.

  • Text Recognition — издвајање текста из слика, 50+ језика
  • Face Detection — откривање лица и кључних тачака
  • Barcode Scanning — сви формати QR, EAN, Code 128, PDF417
  • Image Labeling — класификација слика по категоријама
  • Pose Detection — 33 кључне тачке тела

Интеграција ML Kit-а у пројекат

За повезивање ML Kit-а са Android пројектом довољно је додати одговарајућу зависност у build.gradle и креирати инстанцу процесора. Размотримо интеграцију на примеру Text Recognition API-ја.

Подешавање зависности

У датотеци build.gradle (ниво апликације) додаје се зависност за ML Kit Text Recognition. Библиотека аутоматски преузима модел при првом позиву путем Google Play Services-а.

groovy
dependencies {
    // ML Kit Text Recognition v2
    implementation 'com.google.mlkit:text-recognition:16.0.1'

    // За рад на уређајима без Google Play-а
    implementation 'com.google.mlkit:text-recognition:16.0.1'
}

Примјер кориштења у Kotlin-у

Након подешавања зависности можете креирати TextRecognizer и пренијети му слику у InputImage формату. Резултат се враћа у облику RecognizedText објеката.

kotlin
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)

recognizer.process(image)
    .addOnSuccessListener { result ->
        for (block in result.textBlocks) {
            val blockText = block.text
            val lines = block.lines
            // Обрада препознатог текста
            Log.d("MLKit", "Block: $blockText")
        }
    }
    .addOnFailureListener { e ->
        Log.e("MLKit", "Грешка: $e")
    }

Код креира клијента TextRecognition, преноси му битмап слику и обрађује резултат асинхроно. Блокови текста садрже угнијеждене редове и токене са координатама, што омогућава приказ пронађеног текста директно на слици.

Важан аспект интеграције је руковање грешкама. ML Kit може да врати грешку код превише тамне слике, окренутог текста или прекорачивања лимита меморије. Препоручује се увијек додати fallback на облачко препознавање путем Google Cloud Vision-а за случајеве када модел на уређају није успио. Пракса показује да комбиновани приступ (ML Kit + Cloud Vision) повећава укупну прецизност препознавања са 92% на 98% на сложеним документима.

Предности ML-а на уређају

ML на уређају — кључна разлика ML Kit-а од облачких ML услуга. Све прорачуне се одвијају локално на уређају, што пружа три принципијелне предности. Прва — нулта кашњење: модел обрађује податке за 50–200 ms без чекања одговора са сервера. Друга — рад без интернета: библиотека ради у авионском моду, што је критично за теренске апликације.

Поверљивост података

Локална обрада гарантује да фотографије, документи и лични подаци корисника никада не напуштају уређај. То је посебно важно за апликације у медицини, финансијама и корпоративној сигурности, где је слање података на сервер забрањено регулаторним захтевима. Према статистици Google-а (2026), 78% корисника преферира апликације са обрадом на уређају из разлога приватности.

Уштеда промета и ресурса

За разлику од облачких ML решења која шаљу слике на сервер и троше мобилни промет, ML Kit не захтева мрежну везу. Уштеда промета може да достигне 50–200 MB дневно за апликације са интензивном обрадом слика. Батерија се троши умјерено: један циклус препознавања троши 0.5–2% напуњења по сату активног кориштења.

ML Kit наспрам других ML решења

ML Kit заузима посредну позицију између нативних ML фрејмворка (TensorFlow Lite, Core ML) и облачких услуга (Google Cloud Vision, AWS Rekognition). Упоредимо кључне карактеристике.

КарактеристикаML KitTensorFlow LiteGoogle Cloud Vision
ИзвршавањеСамо на уређајуСамо на уређајуОблачко
Захтева Data ScienceНеДаНе
Брзина80–200 ms50–300 ms500–2000 ms
Рад ван мрежеДаДаНе
Прецизност94–97%95–99%98–99%
Прилагођени моделиПутем TFLiteДаAutoML Vision
ЦенаБесплатноБесплатно$1.50/1000 јед.

За типичне задатке рачунарске визије, као што је скенирање докумената или провјера лица, ML Kit је оптималан избор због једноставности интеграције. Сложени пројекти са сопственим архитектурама неуронских мрежа захтевају TensorFlow Lite. Облачке услуге су оправдане када је потребна максимална прецизност.

При избору између ML Kit-а и TensorFlow Lite-а узмите у обзир однос брзине развоја и флексибилности. Ако у пројекту већ постоји data scientist и обучен модел — користите TFLite директно. Ако је ML само помоћна функција апликације (скенирање рачуна, провјера осмеха на селфију) — ML Kit ће дати резултат за 30 минута уместо недељу дана.

Према Google-у (2026), просечно врјеме имплементације ML Kit-а у постојећи пројекат износи 4–6 сати за основни сценаријум и 2–3 дана за потпуну интеграцију са прилагођеним моделом. У 73% случајева, програмери бирају ML Kit управо због брзине интеграције, а не због максималне прецизности модела.

Често постављана питања

Да ли је потребан интернет за рад ML Kit-а?

Не, ML Kit извршава све прорачуне локално на уређају. Интернет је потребан само за првобитно преузимање модела путем Google Play Services-а, након чега библиотека ради потпуно офлајн.

Које платформе подржава ML Kit?

Android (API 24+) и iOS (12.0+). За Android се користи интеграција путем Google Play Services-а, за iOS — путем CocoaPods или Swift Package Manager-а са ручним преузимањем модела.

Могу ли да користим сопствене моделе у ML Kit-у?

Да, ML Kit подржава увоз прилагођених TensorFlow Lite модела кроз класе LocalModel или RemoteModel. Модел мора бити конвертован у .tflite формат и оптимизован за мобилне уређаје.

По чему се ML Kit разликује од TensorFlow Lite-а?

ML Kit — библиотека високог нивоа са готовим API-јима, која не захтева познање ML-а. TensorFlow Lite — рантајм ниског нивоа за покретање прилагођених модела. ML Kit унутра користи TFLite, али скрива сложеност од програмера.

Како се ажурирају модели ML Kit-а?

Модели се ажурирају аутоматски путем Google Play Services-а за Android и путем App Store-а за iOS. Google објављује ажурирања сваких 6–8 недеља, побољшавајући прецизност препознавања и додајући нове језике.

Резиме

  • ML Kit — Google-ова библиотека за ML на уређају на Android и iOS-у са 15+ готових API-ја за рачунарску визију и NLP
  • Text Recognition препознаје штампани и рукописни текст на 50+ језика са прецизношћу до 97%
  • Face Detection одређује до 17 кључних тачака лица са процјеном осмеха и отворености очију
  • Barcode Scanning подржава све формате: QR, EAN, Code 128, PDF417, Data Matrix
  • Интеграција путем Gradle или CocoaPods-а са минималним кодом — 3–5 линија за основни сценаријум
  • Поверљивост — подаци се обрађују локално без слања на сервер
  • За типичне задатке ML Kit је оптималан баланс једноставности имплементације и квалитета препознавања

Развићемо мобилну апликацију под кључ

IT Sectr креира iOS и Android апликације за стартапе и предузећа од 2017. године. Саветоваћемо вас и предложити најбоље решење.

Разговарајте о пројекту

Прочитајте такође