ML Kit: co to je, možnosti a jak funguje

Autor: IT Sectr Publikováno: 2026-03-26 Doba čtení: 8 min

ML Kit — knihovna strojového učení od Google, která poskytuje hotová API pro rozpoznávání textu, obličejů, objektů a čárových kódů na mobilních zařízeních. Na rozdíl od cloudových ML řešení provádí ML Kit všechny výpočty lokálně na zařízení, čímž zajišťuje práci bez internetu a důvěrnost uživatelských dat. Podle Google ML Kit Documentation (2026) knihovna podporuje Android a iOS a pokrývá více než 15 API pro různé úkoly počítačového vidění a zpracování textu.

Hlavní body

  • ML Kit — knihovna Google pro strojové učení na zařízení na Android a iOS bez potřeby připojení k serveru
  • 15+ API pokrývá rozpoznávání textu, obličejů, čárových kódů, segmentaci obrázků a analýzu postoje
  • Lokální zpracování eliminuje zpoždění sítě a zaručuje, že data neopustí zařízení
  • Integrace přes Gradle závislosti pro Android a CocoaPods pro iOS s minimálním inicializačním kódem
  • Firebase ML rozšiřuje možnosti ML Kit o cloudové modely pro složitější úkoly, jako je Vision API

Co je ML Kit?

ML Kit — je mobilní SDK knihovna od Google, která vývojářům poskytuje hotová API strojového učení pro Android a iOS. Byla představena v roce 2018 na Google I/O jako součást Firebase a následně se stala dostupná jako samostatný SDK. ML Kit abstrahuje složitost Data Science: vývojář nemusí trénovat modely, nastavovat hyperparametry nebo rozumět tenzorovým výpočtům.

Knihovna pokrývá čtyři klíčové oblasti počítačového vidění a NLP: rozpoznávání textu, detekci obličejů, skenování čárových kódů, analýzu obrázků a segmentaci objektů. Každé API je k dispozici ve dvou variantách — základní (zrychlená) a přesná (s rozšířeným modelem).

ML Kit je distribuován prostřednictvím Google Play Services pro Android, což umožňuje aktualizace modelů bez vydání nové verze aplikace. Velikost stažení každého API je od 2 do 15 MB v závislosti na složitosti modelu. Pro iOS je knihovna dodávána přes CocoaPods nebo Swift Package Manager s ručním stažením modelu při prvním spuštění. Podle Google celková velikost všech API ML Kit nepřesahuje 80 MB, což činí knihovnu přijatelnou pro mobilní aplikace s omezením objemu.

Hlavní možnosti

ML Kit zahrnuje API pro rozpoznávání textu s podporou latinky, cyrilice a čínských znaků, detekci a sledování obličejů s identifikací úsměvu a otevřených očí, skenování čárových kódů ve všech populárních formátech, segmentaci obrázků na popředí a pozadí, analýzu lidského postoje na základě 33 klíčových bodů a rozpoznávání objektů s klasifikací. Podle Google I/O 2025 dosahuje přesnost základních modelů ML Kit 97 % pro latinský text a 94 % pro obličeje.

Klíčová API ML Kit

ML Kit nabízí několik skupin API, z nichž každá řeší konkrétní úkol počítačového vidění nebo zpracování textu. Podívejme se na tři nejžádanější oblasti.

Rozpoznávání textu

Text Recognition API umožňuje extrakci tištěného a ručně psaného textu z obrázků v reálném čase. API pracuje s 50+ jazyky, včetně češtiny, angličtiny, čínštiny a arabštiny. Výsledek je vracen ve formě hierarchické struktury: bloky textu → řádky → tokeny se souřadnicemi každého prvku. Podle Google ML Kit benchmarks (2026) trvá rozpoznání jednoho snímku na zařízení střední třídy 80–150 ms pro základní model.

Detekce obličejů

Face Detection API detekuje obličeje na obrázcích a ve videostreamu a identifikuje až 17 klíčových referenčních bodů: oči, obočí, nos, ústa, konturu obličeje. API také vypočítává pravděpodobnost úsměvu, otevřenost očí a úhel natočení hlavy podél tří os. Na rozdíl od cloudových řešení ML Kit zpracovává obličeje výhradně na zařízení bez odesílání obrázků na server.

Skenování čárových kódů

Barcode Scanning API podporuje všechny běžné formáty: EAN-13, QR Code, Code 128, PDF417, Data Matrix a Aztec. API automaticky rozpozná formát kódu a vrátí jeho obsah — od prostého textu až po strukturovaná data (URL, vCard navštěvnice, souřadnice geolokace). Rychlost skenování dosahuje 30 snímků za sekundu, což umožňuje použití API v aplikacích reálného času.

  • Text Recognition — extrakce textu z obrázků, 50+ jazyků
  • Face Detection — detekce obličejů a klíčových bodů
  • Barcode Scanning — všechny formáty QR, EAN, Code 128, PDF417
  • Image Labeling — klasifikace obrázků podle kategorií
  • Pose Detection — 33 klíčových bodů těla

Integrace ML Kit do projektu

Pro připojení ML Kit k Android projektu stačí přidát příslušnou závislost do build.gradle a vytvořit instanci procesoru. Podívejme se na integraci na příkladu Text Recognition API.

Nastavení závislostí

V souboru build.gradle (na úrovni aplikace) se přidá závislost pro ML Kit Text Recognition. Knihovna automaticky stáhne model při prvním volání prostřednictvím Google Play Services.

groovy
dependencies {
    // ML Kit Text Recognition v2
    implementation 'com.google.mlkit:text-recognition:16.0.1'

    // Pro práci na zařízeních bez Google Play
    implementation 'com.google.mlkit:text-recognition:16.0.1'
}

Příklad použití v Kotlin

Po nastavení závislostí můžete vytvořit TextRecognizer a předat mu obrázek ve formátu InputImage. Výsledek je vracen jako objekty RecognizedText.

kotlin
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)

recognizer.process(image)
    .addOnSuccessListener { result ->
        for (block in result.textBlocks) {
            val blockText = block.text
            val lines = block.lines
            // Zpracování rozpoznaného textu
            Log.d("MLKit", "Block: $blockText")
        }
    }
    .addOnFailureListener { e ->
        Log.e("MLKit", "Chyba: $e")
    }

Kód vytváří klienta TextRecognition, předává mu bitmapový obrázek a asynchronně zpracovává výsledek. Bloky textu obsahují vnořené řádky a tokeny se souřadnicemi, což umožňuje zobrazit nalezený text přímo na obrázku.

Důležitým aspektem integrace je ošetření chyb. ML Kit může vrátit chybu při příliš tmavém obrázku, otočeném textu nebo překročení limitu paměti. Doporučuje se vždy přidávat fallback na cloudové rozpoznávání prostřednictvím Google Cloud Vision pro případy, kdy model na zařízení neuspěl. Praxe ukazuje, že kombinovaný přístup (ML Kit + Cloud Vision) zvyšuje celkovou přesnost rozpoznávání z 92 % na 98 % u složitých dokumentů.

Výhody ML na zařízení

ML na zařízení — klíčový rozdíl ML Kit od cloudových ML služeb. Všechny výpočty probíhají lokálně na zařízení, což přináší tři zásadní výhody. První — nulové zpoždění: model zpracovává data za 50–200 ms bez čekání na odpověď ze serveru. Druhá — práce bez internetu: knihovna funguje v režimu letadlo, což je kritické pro terénní aplikace.

Důvěrnost dat

Lokální zpracování zaručuje, že fotografie, dokumenty a osobní údaje uživatele nikdy neopustí zařízení. To je obzvláště důležité pro aplikace v oblasti medicíny, financí a podnikové bezpečnosti, kde je odesílání dat na server zakázáno regulačními požadavky. Podle statistik Google (2026) preferuje 78 % uživatelů aplikace se zpracováním na zařízení z důvodu soukromí.

Úspory provozu a zdrojů

Na rozdíl od cloudových ML řešení, která odesílají obrázky na server a spotřebovávají mobilní data, ML Kit nevyžaduje připojení k síti. Úspory provozu mohou dosáhnout 50–200 MB denně u aplikací s intenzivním zpracováním obrázků. Baterie je spotřebovávána mírně: jeden cyklus rozpoznávání spotřebuje 0,5–2 % nabití za hodinu aktivního používání.

ML Kit vs jiná ML řešení

ML Kit zaujímá mezipolohu mezi nativními ML frameworky (TensorFlow Lite, Core ML) a cloudovými službami (Google Cloud Vision, AWS Rekognition). Porovnejme klíčové vlastnosti.

VlastnostML KitTensorFlow LiteGoogle Cloud Vision
ProváděníPouze na zařízeníPouze na zařízeníCloudové
Vyžaduje Data ScienceNeAnoNe
Rychlost80–200 ms50–300 ms500–2000 ms
Práce offlineAnoAnoNe
Přesnost94–97 %95–99 %98–99 %
Vlastní modelyPřes TFLiteAnoAutoML Vision
CenaZdarmaZdarma$1,50 / 1000 jedn.

Pro typické úkoly počítačového vidění, jako je skenování dokumentů nebo ověřování obličejů, je ML Kit optimální volbou díky jednoduchosti integrace. Složité projekty s vlastními architekturami neuronových sítí vyžadují TensorFlow Lite. Cloudové služby jsou opodstatněné, když je vyžadována maximální přesnost.

Při výběru mezi ML Kit a TensorFlow Lite zvažte poměr rychlosti vývoje a flexibility. Pokud již máte v projektu data scientist a natrénovaný model — použijte přímo TFLite. Pokud je ML pouze pomocnou funkcí aplikace (naskenovat účet, zkontrolovat úsměv na selfie) — ML Kit poskytne výsledek za 30 minut místo týdne.

Podle Google (2026) je průměrná doba implementace ML Kit do stávajícího projektu 4–6 hodin pro základní scénář a 2–3 dny pro úplnou integraci s vlastním modelem. V 73 % případů vývojáři volí ML Kit právě kvůli rychlosti integrace, nikoli kvůli maximální přesnosti modelů.

Často kladené dotazy

Je pro práci ML Kit potřeba internet?

Ne, ML Kit provádí všechny výpočty lokálně na zařízení. Internet je vyžadován pouze pro počáteční stažení modelu prostřednictvím Google Play Services, poté knihovna pracuje zcela offline.

Jaké platformy ML Kit podporuje?

Android (API 24+) a iOS (12.0+). Pro Android se používá integrace prostřednictvím Google Play Services, pro iOS — prostřednictvím CocoaPods nebo Swift Package Manager s ručním stažením modelu.

Mohu v ML Kit používat vlastní modely?

Ano, ML Kit podporuje import vlastních modelů TensorFlow Lite prostřednictvím tříd LocalModel nebo RemoteModel. Model musí být zkonvertován do formátu .tflite a optimalizován pro mobilní zařízení.

Čím se liší ML Kit od TensorFlow Lite?

ML Kit — knihovna vysoké úrovně s hotovými API, která nevyžaduje znalosti ML. TensorFlow Lite — běhové prostředí nízké úrovně pro spouštění vlastních modelů. ML Kit interně používá TFLite, ale skrývá složitost před vývojářem.

Jak se aktualizují modely ML Kit?

Modely jsou automaticky aktualizovány prostřednictvím Google Play Services pro Android a prostřednictvím App Store pro iOS. Google vydává aktualizace každých 6–8 týdnů, čímž zlepšuje přesnost rozpoznávání a přidává nové jazyky.

Shrnutí

  • ML Kit — knihovna Google pro ML na zařízení na Android a iOS s 15+ hotovými API pro počítačové vidění a NLP
  • Text Recognition rozpoznává tištěný a ručně psaný text v 50+ jazycích s přesností až 97 %
  • Face Detection identifikuje až 17 klíčových bodů obličeje s hodnocením úsměvu a otevřenosti očí
  • Barcode Scanning podporuje všechny formáty: QR, EAN, Code 128, PDF417, Data Matrix
  • Integrace přes Gradle nebo CocoaPods s minimálním kódem — 3–5 řádků pro základní scénář
  • Soukromí — data jsou zpracovávána lokálně bez odesílání na server
  • Pro typické úkoly představuje ML Kit optimální rovnováhu mezi jednoduchostí implementace a kvalitou rozpoznávání

Vyvineme mobilní aplikaci na klíč

IT Sectr vytváří aplikace pro iOS a Android pro startupy a podniky od roku 2017. Poradíme vám a navrhneme nejlepší řešení.

Prodiskutovat projekt

Přečtěte si také