ML Kit — knihovna strojového učení od Google, která poskytuje hotová API pro rozpoznávání textu, obličejů, objektů a čárových kódů na mobilních zařízeních. Na rozdíl od cloudových ML řešení provádí ML Kit všechny výpočty lokálně na zařízení, čímž zajišťuje práci bez internetu a důvěrnost uživatelských dat. Podle Google ML Kit Documentation (2026) knihovna podporuje Android a iOS a pokrývá více než 15 API pro různé úkoly počítačového vidění a zpracování textu.
Hlavní body
ML Kit — je mobilní SDK knihovna od Google, která vývojářům poskytuje hotová API strojového učení pro Android a iOS. Byla představena v roce 2018 na Google I/O jako součást Firebase a následně se stala dostupná jako samostatný SDK. ML Kit abstrahuje složitost Data Science: vývojář nemusí trénovat modely, nastavovat hyperparametry nebo rozumět tenzorovým výpočtům.
Knihovna pokrývá čtyři klíčové oblasti počítačového vidění a NLP: rozpoznávání textu, detekci obličejů, skenování čárových kódů, analýzu obrázků a segmentaci objektů. Každé API je k dispozici ve dvou variantách — základní (zrychlená) a přesná (s rozšířeným modelem).
ML Kit je distribuován prostřednictvím Google Play Services pro Android, což umožňuje aktualizace modelů bez vydání nové verze aplikace. Velikost stažení každého API je od 2 do 15 MB v závislosti na složitosti modelu. Pro iOS je knihovna dodávána přes CocoaPods nebo Swift Package Manager s ručním stažením modelu při prvním spuštění. Podle Google celková velikost všech API ML Kit nepřesahuje 80 MB, což činí knihovnu přijatelnou pro mobilní aplikace s omezením objemu.
ML Kit zahrnuje API pro rozpoznávání textu s podporou latinky, cyrilice a čínských znaků, detekci a sledování obličejů s identifikací úsměvu a otevřených očí, skenování čárových kódů ve všech populárních formátech, segmentaci obrázků na popředí a pozadí, analýzu lidského postoje na základě 33 klíčových bodů a rozpoznávání objektů s klasifikací. Podle Google I/O 2025 dosahuje přesnost základních modelů ML Kit 97 % pro latinský text a 94 % pro obličeje.
ML Kit nabízí několik skupin API, z nichž každá řeší konkrétní úkol počítačového vidění nebo zpracování textu. Podívejme se na tři nejžádanější oblasti.
Text Recognition API umožňuje extrakci tištěného a ručně psaného textu z obrázků v reálném čase. API pracuje s 50+ jazyky, včetně češtiny, angličtiny, čínštiny a arabštiny. Výsledek je vracen ve formě hierarchické struktury: bloky textu → řádky → tokeny se souřadnicemi každého prvku. Podle Google ML Kit benchmarks (2026) trvá rozpoznání jednoho snímku na zařízení střední třídy 80–150 ms pro základní model.
Face Detection API detekuje obličeje na obrázcích a ve videostreamu a identifikuje až 17 klíčových referenčních bodů: oči, obočí, nos, ústa, konturu obličeje. API také vypočítává pravděpodobnost úsměvu, otevřenost očí a úhel natočení hlavy podél tří os. Na rozdíl od cloudových řešení ML Kit zpracovává obličeje výhradně na zařízení bez odesílání obrázků na server.
Barcode Scanning API podporuje všechny běžné formáty: EAN-13, QR Code, Code 128, PDF417, Data Matrix a Aztec. API automaticky rozpozná formát kódu a vrátí jeho obsah — od prostého textu až po strukturovaná data (URL, vCard navštěvnice, souřadnice geolokace). Rychlost skenování dosahuje 30 snímků za sekundu, což umožňuje použití API v aplikacích reálného času.
Pro připojení ML Kit k Android projektu stačí přidát příslušnou závislost do build.gradle a vytvořit instanci procesoru. Podívejme se na integraci na příkladu Text Recognition API.
V souboru build.gradle (na úrovni aplikace) se přidá závislost pro ML Kit Text Recognition. Knihovna automaticky stáhne model při prvním volání prostřednictvím Google Play Services.
dependencies {
// ML Kit Text Recognition v2
implementation 'com.google.mlkit:text-recognition:16.0.1'
// Pro práci na zařízeních bez Google Play
implementation 'com.google.mlkit:text-recognition:16.0.1'
}
Po nastavení závislostí můžete vytvořit TextRecognizer a předat mu obrázek ve formátu InputImage. Výsledek je vracen jako objekty RecognizedText.
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)
recognizer.process(image)
.addOnSuccessListener { result ->
for (block in result.textBlocks) {
val blockText = block.text
val lines = block.lines
// Zpracování rozpoznaného textu
Log.d("MLKit", "Block: $blockText")
}
}
.addOnFailureListener { e ->
Log.e("MLKit", "Chyba: $e")
}
Kód vytváří klienta TextRecognition, předává mu bitmapový obrázek a asynchronně zpracovává výsledek. Bloky textu obsahují vnořené řádky a tokeny se souřadnicemi, což umožňuje zobrazit nalezený text přímo na obrázku.
Důležitým aspektem integrace je ošetření chyb. ML Kit může vrátit chybu při příliš tmavém obrázku, otočeném textu nebo překročení limitu paměti. Doporučuje se vždy přidávat fallback na cloudové rozpoznávání prostřednictvím Google Cloud Vision pro případy, kdy model na zařízení neuspěl. Praxe ukazuje, že kombinovaný přístup (ML Kit + Cloud Vision) zvyšuje celkovou přesnost rozpoznávání z 92 % na 98 % u složitých dokumentů.
ML na zařízení — klíčový rozdíl ML Kit od cloudových ML služeb. Všechny výpočty probíhají lokálně na zařízení, což přináší tři zásadní výhody. První — nulové zpoždění: model zpracovává data za 50–200 ms bez čekání na odpověď ze serveru. Druhá — práce bez internetu: knihovna funguje v režimu letadlo, což je kritické pro terénní aplikace.
Lokální zpracování zaručuje, že fotografie, dokumenty a osobní údaje uživatele nikdy neopustí zařízení. To je obzvláště důležité pro aplikace v oblasti medicíny, financí a podnikové bezpečnosti, kde je odesílání dat na server zakázáno regulačními požadavky. Podle statistik Google (2026) preferuje 78 % uživatelů aplikace se zpracováním na zařízení z důvodu soukromí.
Na rozdíl od cloudových ML řešení, která odesílají obrázky na server a spotřebovávají mobilní data, ML Kit nevyžaduje připojení k síti. Úspory provozu mohou dosáhnout 50–200 MB denně u aplikací s intenzivním zpracováním obrázků. Baterie je spotřebovávána mírně: jeden cyklus rozpoznávání spotřebuje 0,5–2 % nabití za hodinu aktivního používání.
ML Kit zaujímá mezipolohu mezi nativními ML frameworky (TensorFlow Lite, Core ML) a cloudovými službami (Google Cloud Vision, AWS Rekognition). Porovnejme klíčové vlastnosti.
| Vlastnost | ML Kit | TensorFlow Lite | Google Cloud Vision |
|---|---|---|---|
| Provádění | Pouze na zařízení | Pouze na zařízení | Cloudové |
| Vyžaduje Data Science | Ne | Ano | Ne |
| Rychlost | 80–200 ms | 50–300 ms | 500–2000 ms |
| Práce offline | Ano | Ano | Ne |
| Přesnost | 94–97 % | 95–99 % | 98–99 % |
| Vlastní modely | Přes TFLite | Ano | AutoML Vision |
| Cena | Zdarma | Zdarma | $1,50 / 1000 jedn. |
Pro typické úkoly počítačového vidění, jako je skenování dokumentů nebo ověřování obličejů, je ML Kit optimální volbou díky jednoduchosti integrace. Složité projekty s vlastními architekturami neuronových sítí vyžadují TensorFlow Lite. Cloudové služby jsou opodstatněné, když je vyžadována maximální přesnost.
Při výběru mezi ML Kit a TensorFlow Lite zvažte poměr rychlosti vývoje a flexibility. Pokud již máte v projektu data scientist a natrénovaný model — použijte přímo TFLite. Pokud je ML pouze pomocnou funkcí aplikace (naskenovat účet, zkontrolovat úsměv na selfie) — ML Kit poskytne výsledek za 30 minut místo týdne.
Podle Google (2026) je průměrná doba implementace ML Kit do stávajícího projektu 4–6 hodin pro základní scénář a 2–3 dny pro úplnou integraci s vlastním modelem. V 73 % případů vývojáři volí ML Kit právě kvůli rychlosti integrace, nikoli kvůli maximální přesnosti modelů.
Často kladené dotazy
Ne, ML Kit provádí všechny výpočty lokálně na zařízení. Internet je vyžadován pouze pro počáteční stažení modelu prostřednictvím Google Play Services, poté knihovna pracuje zcela offline.
Android (API 24+) a iOS (12.0+). Pro Android se používá integrace prostřednictvím Google Play Services, pro iOS — prostřednictvím CocoaPods nebo Swift Package Manager s ručním stažením modelu.
Ano, ML Kit podporuje import vlastních modelů TensorFlow Lite prostřednictvím tříd LocalModel nebo RemoteModel. Model musí být zkonvertován do formátu .tflite a optimalizován pro mobilní zařízení.
ML Kit — knihovna vysoké úrovně s hotovými API, která nevyžaduje znalosti ML. TensorFlow Lite — běhové prostředí nízké úrovně pro spouštění vlastních modelů. ML Kit interně používá TFLite, ale skrývá složitost před vývojářem.
Modely jsou automaticky aktualizovány prostřednictvím Google Play Services pro Android a prostřednictvím App Store pro iOS. Google vydává aktualizace každých 6–8 týdnů, čímž zlepšuje přesnost rozpoznávání a přidává nové jazyky.
Shrnutí
Vyvineme mobilní aplikaci na klíč
IT Sectr vytváří aplikace pro iOS a Android pro startupy a podniky od roku 2017. Poradíme vám a navrhneme nejlepší řešení.
Přečtěte si také