ML Kit — a Google gépi tanulási könyvtára, amely kész API-kat biztosít szövegek, arcok, tárgyak és vonalkódok felismeréséhez mobileszközökön. A felhőalapú ML megoldásokkal ellentétben az ML Kit az összes számítást lokálisan, az eszközön végzi, biztosítva az internet nélküli működést és a felhasználói adatok bizalmas kezelését. A Google ML Kit Documentation (2026) szerint a könyvtár támogatja az Android és iOS rendszereket, több mint 15 API-t lefedve számítógépes látás és szövegfeldolgozás különböző feladataihoz.
Főbb pontok
ML Kit — egy mobilos SDK könyvtár a Google-tól, amely kész gépi tanulási API-kat biztosít a fejlesztők számára Android és iOS rendszerekhez. 2018-ban mutatták be a Google I/O-n a Firebase részeként, majd önálló SDK-ként vált elérhetővé. Az ML Kit elvonatkoztatja az adattudomány összetettségét: a fejlesztőnek nem kell modelleket tanítania, hiperparamétereket beállítania vagy tenzorszámításokat értenie.
A könyvtár négy fő területet fed le a számítógépes látás és NLP köréből: szövegfelismerés, arcfelismerés, vonalkódolvasás, képelemzés és objektumszegmentálás. Minden API két változatban érhető el — alap (gyorsított) és pontos (kibővített modellel).
Az ML Kit Android esetén a Google Play Services-en keresztül terjesztik, ami lehetővé teszi a modellek frissítését az alkalmazás új verziójának kiadása nélkül. Az egyes API-k letöltési mérete 2 és 15 MB között van, a modell összetettségétől függően. iOS esetén a könyvtárat CocoaPods vagy Swift Package Manager segítségével szállítják, a modell első induláskor történő kézi letöltésével. A Google szerint az összes ML Kit API együttes mérete nem haladja meg a 80 MB-ot, ami elfogadhatóvá teszi a könyvtárat a térfogatkorlátokkal rendelkező mobilalkalmazások számára.
Az ML Kit API-kat tartalmaz szövegek felismeréséhez latin, cirill és kínai karakterek támogatásával, arcok észleléséhez és követéséhez mosoly és nyitott szemek azonosításával, vonalkódok olvasásához az összes népszerű formátumban, képek elő- és háttérre szegmentálásához, emberi póz elemzéséhez 33 kulcspont alapján és tárgyak felismeréséhez osztályozással. A Google I/O 2025 szerint az ML Kit alapmodelljeinek pontossága eléri a 97%-ot latin szöveg és a 94%-ot arcok esetében.
Az ML Kit több API-csoportot kínál, amelyek mindegyike a számítógépes látás vagy szövegfeldolgozás egy-egy konkrét feladatát oldja meg. Tekintsük át a három legkeresettebb területet.
A Text Recognition API lehetővé teszi nyomtatott és kézírásos szöveg kinyerését képekből valós időben. Az API 50+ nyelvvel működik, beleértve a magyart, angolt, kínait és arabot. Az eredmény hierarchikus struktúra formájában érkezik: szövegblokkok → sorok → tokenek az egyes elemek koordinátáival. A Google ML Kit benchmarks (2026) szerint egy közepes kategóriájú eszközön egy képkocka felismerése 80–150 ms-ig tart az alapmodell esetén.
A Face Detection API arcokat észlel képeken és videófolyamban, és akár 17 kulcsfontosságú referenciapontot azonosít: szemek, szemöldök, orr, száj, arc kontúrja. Az API kiszámítja továbbá a mosoly valószínűségét, a szemek nyitottságát és a fej elfordulásának szögét három tengely mentén. A felhőalapú megoldásokkal ellentétben az ML Kit az arcokat kizárólag az eszközön dolgozza fel, anélkül, hogy képeket küldene a szerverre.
A Barcode Scanning API az összes elterjedt formátumot támogatja: EAN-13, QR Code, Code 128, PDF417, Data Matrix és Aztec. Az API automatikusan felismeri a kód formátumát és visszaadja annak tartalmát — az egyszerű szövegtől a strukturált adatokig (URL, vCard névjegykártya, geolokációs koordináták). Az olvasási sebesség eléri a 30 képkockát másodpercenként, ami lehetővé teszi az API használatát valós idejű alkalmazásokban.
Az ML Kit csatlakoztatásához egy Android projekthez elegendő a megfelelő függőség hozzáadása a build.gradle fájlhoz és a processzor példányának létrehozása. Nézzük meg az integrációt a Text Recognition API példáján.
A build.gradle fájlban (alkalmazásszinten) hozzáadjuk az ML Kit Text Recognition függőséget. A könyvtár automatikusan letölti a modellt az első híváskor a Google Play Services-en keresztül.
dependencies {
// ML Kit Text Recognition v2
implementation 'com.google.mlkit:text-recognition:16.0.1'
// Google Play nélküli eszközökön történő működéshez
implementation 'com.google.mlkit:text-recognition:16.0.1'
}
A függőségek beállítása után létrehozhat egy TextRecognizer példányt és átadhat neki egy képet InputImage formátumban. Az eredmény RecognizedText objektumokként érkezik.
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)
recognizer.process(image)
.addOnSuccessListener { result ->
for (block in result.textBlocks) {
val blockText = block.text
val lines = block.lines
// Felismert szöveg feldolgozása
Log.d("MLKit", "Block: $blockText")
}
}
.addOnFailureListener { e ->
Log.e("MLKit", "Hiba: $e")
}
A kód létrehoz egy TextRecognition klienst, átad neki a bitmap képet és aszinkron módon feldolgozza az eredményt. A szövegblokkok egymásba ágyazott sorokat és tokeneket tartalmaznak koordinátákkal, ami lehetővé teszi a megtalált szöveg képre történő közvetlen kiírását.
Az integráció egy fontos szempontja a hibakezelés. Az ML Kit hibát adhat túl sötét kép, elforgatott szöveg vagy memóriahatár túllépése esetén. Javasolt mindig tartalék megoldást (fallback) hozzáadni a Google Cloud Visionon keresztüli felhőalapú felismeréshez azokra az esetekre, amikor az on-device modell nem boldogul. A gyakorlat azt mutatja, hogy a kombinált megközelítés (ML Kit + Cloud Vision) az összesített felismerési pontosságot 92%-ról 98%-ra növeli összetett dokumentumokon.
Az on-device ML — az ML Kit legfőbb különbsége a felhőalapú ML szolgáltatásokhoz képest. Az összes számítás lokálisan, az eszközön történik, ami három alapvető előnnyel jár. Az első — nulla késleltetés: a modell 50–200 ms alatt feldolgozza az adatokat anélkül, hogy várnia kellene a szerver válaszára. A második — internet nélküli működés: a könyvtár repülőmódban is működik, ami kritikus a terepi alkalmazások számára.
A helyi feldolgozás garantálja, hogy a felhasználó fényképei, dokumentumai és személyes adatai soha nem hagyják el az eszközt. Ez különösen fontos az orvosi, pénzügyi és vállalati biztonsági alkalmazások számára, ahol az adatok szerverre küldését szabályozó követelmények tiltják. A Google (2026) statisztikái szerint a felhasználók 78%-a az adatvédelem miatt részesíti előnyben az on-device feldolgozást alkalmazó alkalmazásokat.
A felhőalapú ML megoldásokkal ellentétben, amelyek képeket küldenek a szerverre és mobiladat-forgalmat használnak, az ML Kit nem igényel hálózati kapcsolatot. A forgalommegtakarítás elérheti az 50–200 MB-ot naponta az intenzív képfeldolgozást végző alkalmazások esetén. Az akkumulátor mérsékelten fogy: egy felismerési ciklus 0.5–2% töltést fogyaszt aktív használat óránként.
Az ML Kit köztes helyzetet foglal el a natív ML keretrendszerek (TensorFlow Lite, Core ML) és a felhőszolgáltatások (Google Cloud Vision, AWS Rekognition) között. Hasonlítsuk össze a legfontosabb jellemzőket.
| Jellemző | ML Kit | TensorFlow Lite | Google Cloud Vision |
|---|---|---|---|
| Végrehajtás | Csak on-device | Csak on-device | Felhő |
| Data Science-t igényel | Nem | Igen | Nem |
| Sebesség | 80–200 ms | 50–300 ms | 500–2000 ms |
| Offline működés | Igen | Igen | Nem |
| Pontosság | 94–97% | 95–99% | 98–99% |
| Egyedi modellek | TFLite-on keresztül | Igen | AutoML Vision |
| Ár | Ingyenes | Ingyenes | $1.50/1000 egys. |
A tipikus számítógépes látási feladatokhoz, mint a dokumentumok beolvasása vagy arcok ellenőrzése, az ML Kit az optimális választás az egyszerű integráció miatt. Az összetett, saját neurálisháló-architektúrával rendelkező projektek a TensorFlow Lite-ot igénylik. A felhőszolgáltatások akkor indokoltak, ha maximális pontosságra van szükség.
Amikor az ML Kit és a TensorFlow Lite között választ, vegye figyelembe a fejlesztési sebesség és a rugalmasság arányát. Ha a projektben már van adattudós és betanított modell — használja közvetlenül a TFLite-ot. Ha az ML csupán egy kisegítő funkció (nyugta beolvasása, mosoly ellenőrzése egy szelfin) — az ML Kit 30 perc alatt eredményt ad, egy hét helyett.
A Google (2026) szerint az ML Kit meglévő projektbe történő átlagos bevezetési ideje 4–6 óra az alapszcenárióhoz és 2–3 nap a teljes integrációhoz egyedi modellel. Az esetek 73%-ában a fejlesztők az ML Kit-et pontosan az integráció sebessége miatt választják, nem a modellek maximális pontossága miatt.
Gyakran Ismételt Kérdések
Nem, az ML Kit az összes számítást lokálisan az eszközön végzi. Internet csak a modell kezdeti letöltéséhez szükséges a Google Play Services-en keresztül, ezután a könyvtár teljesen offline működik.
Android (API 24+) és iOS (12.0+). Android esetén a Google Play Services-en keresztüli integrációt, iOS esetén a CocoaPods vagy Swift Package Manager használatát alkalmazzák a modell kézi letöltésével.
Igen, az ML Kit támogatja egyedi TensorFlow Lite modellek importálását a LocalModel vagy RemoteModel osztályokon keresztül. A modellt .tflite formátumba kell konvertálni és optimalizálni mobileszközökre.
ML Kit — egy magas szintű könyvtár kész API-kkal, amely nem igényel ML ismereteket. TensorFlow Lite — egy alacsony szintű futási környezet egyedi modellek futtatásához. Az ML Kit belsőleg a TFLite-ot használja, de elrejti az összetettséget a fejlesztő elől.
Modellek automatikusan frissülnek a Google Play Services-en keresztül Android és az App Store-on keresztül iOS esetén. A Google 6–8 hetente ad ki frissítéseket, javítva a felismerés pontosságát és új nyelveket adva hozzá.
Összegzés
Kulcsrakész mobilalkalmazást fejlesztünk
Az IT Sectr 2017 óta készít iOS és Android alkalmazásokat induló vállalkozásoknak és vállalkozásoknak. Tanácsot adunk, és a legjobb megoldást javasoljuk.
Olvassa el is