ML Kit: mi ez, lehetőségek és hogyan működik

Szerző: IT Sectr Megjelenés: 2026-03-26 Olvasási idő: 8 perc

ML Kit — a Google gépi tanulási könyvtára, amely kész API-kat biztosít szövegek, arcok, tárgyak és vonalkódok felismeréséhez mobileszközökön. A felhőalapú ML megoldásokkal ellentétben az ML Kit az összes számítást lokálisan, az eszközön végzi, biztosítva az internet nélküli működést és a felhasználói adatok bizalmas kezelését. A Google ML Kit Documentation (2026) szerint a könyvtár támogatja az Android és iOS rendszereket, több mint 15 API-t lefedve számítógépes látás és szövegfeldolgozás különböző feladataihoz.

Főbb pontok

  • ML Kit — a Google könyvtára on-device gépi tanuláshoz Android és iOS rendszereken, szerverkapcsolat nélkül
  • 15+ API lefedi a szöveg-, arc- és vonalkódfelismerést, képszegmentálást és pózelemzést
  • Helyi feldolgozás kiküszöböli a hálózati késleltetést és garantálja, hogy az adatok nem hagyják el az eszközt
  • Integráció Gradle függőségeken keresztül Androidhoz és CocoaPods segítségével iOS-hez, minimális inicializáló kóddal
  • Firebase ML kibővíti az ML Kit képességeit felhőmodellekkel az olyan összetettebb feladatokhoz, mint a Vision API

Mi az ML Kit?

ML Kit — egy mobilos SDK könyvtár a Google-tól, amely kész gépi tanulási API-kat biztosít a fejlesztők számára Android és iOS rendszerekhez. 2018-ban mutatták be a Google I/O-n a Firebase részeként, majd önálló SDK-ként vált elérhetővé. Az ML Kit elvonatkoztatja az adattudomány összetettségét: a fejlesztőnek nem kell modelleket tanítania, hiperparamétereket beállítania vagy tenzorszámításokat értenie.

A könyvtár négy fő területet fed le a számítógépes látás és NLP köréből: szövegfelismerés, arcfelismerés, vonalkódolvasás, képelemzés és objektumszegmentálás. Minden API két változatban érhető el — alap (gyorsított) és pontos (kibővített modellel).

Az ML Kit Android esetén a Google Play Services-en keresztül terjesztik, ami lehetővé teszi a modellek frissítését az alkalmazás új verziójának kiadása nélkül. Az egyes API-k letöltési mérete 2 és 15 MB között van, a modell összetettségétől függően. iOS esetén a könyvtárat CocoaPods vagy Swift Package Manager segítségével szállítják, a modell első induláskor történő kézi letöltésével. A Google szerint az összes ML Kit API együttes mérete nem haladja meg a 80 MB-ot, ami elfogadhatóvá teszi a könyvtárat a térfogatkorlátokkal rendelkező mobilalkalmazások számára.

Fő képességek

Az ML Kit API-kat tartalmaz szövegek felismeréséhez latin, cirill és kínai karakterek támogatásával, arcok észleléséhez és követéséhez mosoly és nyitott szemek azonosításával, vonalkódok olvasásához az összes népszerű formátumban, képek elő- és háttérre szegmentálásához, emberi póz elemzéséhez 33 kulcspont alapján és tárgyak felismeréséhez osztályozással. A Google I/O 2025 szerint az ML Kit alapmodelljeinek pontossága eléri a 97%-ot latin szöveg és a 94%-ot arcok esetében.

Az ML Kit fő API-i

Az ML Kit több API-csoportot kínál, amelyek mindegyike a számítógépes látás vagy szövegfeldolgozás egy-egy konkrét feladatát oldja meg. Tekintsük át a három legkeresettebb területet.

Szövegfelismerés

A Text Recognition API lehetővé teszi nyomtatott és kézírásos szöveg kinyerését képekből valós időben. Az API 50+ nyelvvel működik, beleértve a magyart, angolt, kínait és arabot. Az eredmény hierarchikus struktúra formájában érkezik: szövegblokkok → sorok → tokenek az egyes elemek koordinátáival. A Google ML Kit benchmarks (2026) szerint egy közepes kategóriájú eszközön egy képkocka felismerése 80–150 ms-ig tart az alapmodell esetén.

Arcfelismerés

A Face Detection API arcokat észlel képeken és videófolyamban, és akár 17 kulcsfontosságú referenciapontot azonosít: szemek, szemöldök, orr, száj, arc kontúrja. Az API kiszámítja továbbá a mosoly valószínűségét, a szemek nyitottságát és a fej elfordulásának szögét három tengely mentén. A felhőalapú megoldásokkal ellentétben az ML Kit az arcokat kizárólag az eszközön dolgozza fel, anélkül, hogy képeket küldene a szerverre.

Vonalkódolvasás

A Barcode Scanning API az összes elterjedt formátumot támogatja: EAN-13, QR Code, Code 128, PDF417, Data Matrix és Aztec. Az API automatikusan felismeri a kód formátumát és visszaadja annak tartalmát — az egyszerű szövegtől a strukturált adatokig (URL, vCard névjegykártya, geolokációs koordináták). Az olvasási sebesség eléri a 30 képkockát másodpercenként, ami lehetővé teszi az API használatát valós idejű alkalmazásokban.

  • Text Recognition — szöveg kinyerése képekből, 50+ nyelv
  • Face Detection — arcok és kulcspontok észlelése
  • Barcode Scanning — az összes formátum: QR, EAN, Code 128, PDF417
  • Image Labeling — képek osztályozása kategóriák szerint
  • Pose Detection — 33 kulcsfontosságú testpont

Az ML Kit integrálása a projektbe

Az ML Kit csatlakoztatásához egy Android projekthez elegendő a megfelelő függőség hozzáadása a build.gradle fájlhoz és a processzor példányának létrehozása. Nézzük meg az integrációt a Text Recognition API példáján.

Függőségek beállítása

A build.gradle fájlban (alkalmazásszinten) hozzáadjuk az ML Kit Text Recognition függőséget. A könyvtár automatikusan letölti a modellt az első híváskor a Google Play Services-en keresztül.

groovy
dependencies {
    // ML Kit Text Recognition v2
    implementation 'com.google.mlkit:text-recognition:16.0.1'

    // Google Play nélküli eszközökön történő működéshez
    implementation 'com.google.mlkit:text-recognition:16.0.1'
}

Példa használat Kotlinban

A függőségek beállítása után létrehozhat egy TextRecognizer példányt és átadhat neki egy képet InputImage formátumban. Az eredmény RecognizedText objektumokként érkezik.

kotlin
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)

recognizer.process(image)
    .addOnSuccessListener { result ->
        for (block in result.textBlocks) {
            val blockText = block.text
            val lines = block.lines
            // Felismert szöveg feldolgozása
            Log.d("MLKit", "Block: $blockText")
        }
    }
    .addOnFailureListener { e ->
        Log.e("MLKit", "Hiba: $e")
    }

A kód létrehoz egy TextRecognition klienst, átad neki a bitmap képet és aszinkron módon feldolgozza az eredményt. A szövegblokkok egymásba ágyazott sorokat és tokeneket tartalmaznak koordinátákkal, ami lehetővé teszi a megtalált szöveg képre történő közvetlen kiírását.

Az integráció egy fontos szempontja a hibakezelés. Az ML Kit hibát adhat túl sötét kép, elforgatott szöveg vagy memóriahatár túllépése esetén. Javasolt mindig tartalék megoldást (fallback) hozzáadni a Google Cloud Visionon keresztüli felhőalapú felismeréshez azokra az esetekre, amikor az on-device modell nem boldogul. A gyakorlat azt mutatja, hogy a kombinált megközelítés (ML Kit + Cloud Vision) az összesített felismerési pontosságot 92%-ról 98%-ra növeli összetett dokumentumokon.

Az on-device ML előnyei

Az on-device ML — az ML Kit legfőbb különbsége a felhőalapú ML szolgáltatásokhoz képest. Az összes számítás lokálisan, az eszközön történik, ami három alapvető előnnyel jár. Az első — nulla késleltetés: a modell 50–200 ms alatt feldolgozza az adatokat anélkül, hogy várnia kellene a szerver válaszára. A második — internet nélküli működés: a könyvtár repülőmódban is működik, ami kritikus a terepi alkalmazások számára.

Adatok bizalmas kezelése

A helyi feldolgozás garantálja, hogy a felhasználó fényképei, dokumentumai és személyes adatai soha nem hagyják el az eszközt. Ez különösen fontos az orvosi, pénzügyi és vállalati biztonsági alkalmazások számára, ahol az adatok szerverre küldését szabályozó követelmények tiltják. A Google (2026) statisztikái szerint a felhasználók 78%-a az adatvédelem miatt részesíti előnyben az on-device feldolgozást alkalmazó alkalmazásokat.

Forgalom és erőforrások megtakarítása

A felhőalapú ML megoldásokkal ellentétben, amelyek képeket küldenek a szerverre és mobiladat-forgalmat használnak, az ML Kit nem igényel hálózati kapcsolatot. A forgalommegtakarítás elérheti az 50–200 MB-ot naponta az intenzív képfeldolgozást végző alkalmazások esetén. Az akkumulátor mérsékelten fogy: egy felismerési ciklus 0.5–2% töltést fogyaszt aktív használat óránként.

ML Kit vs más ML megoldások

Az ML Kit köztes helyzetet foglal el a natív ML keretrendszerek (TensorFlow Lite, Core ML) és a felhőszolgáltatások (Google Cloud Vision, AWS Rekognition) között. Hasonlítsuk össze a legfontosabb jellemzőket.

JellemzőML KitTensorFlow LiteGoogle Cloud Vision
VégrehajtásCsak on-deviceCsak on-deviceFelhő
Data Science-t igényelNemIgenNem
Sebesség80–200 ms50–300 ms500–2000 ms
Offline működésIgenIgenNem
Pontosság94–97%95–99%98–99%
Egyedi modellekTFLite-on keresztülIgenAutoML Vision
ÁrIngyenesIngyenes$1.50/1000 egys.

A tipikus számítógépes látási feladatokhoz, mint a dokumentumok beolvasása vagy arcok ellenőrzése, az ML Kit az optimális választás az egyszerű integráció miatt. Az összetett, saját neurálisháló-architektúrával rendelkező projektek a TensorFlow Lite-ot igénylik. A felhőszolgáltatások akkor indokoltak, ha maximális pontosságra van szükség.

Amikor az ML Kit és a TensorFlow Lite között választ, vegye figyelembe a fejlesztési sebesség és a rugalmasság arányát. Ha a projektben már van adattudós és betanított modell — használja közvetlenül a TFLite-ot. Ha az ML csupán egy kisegítő funkció (nyugta beolvasása, mosoly ellenőrzése egy szelfin) — az ML Kit 30 perc alatt eredményt ad, egy hét helyett.

A Google (2026) szerint az ML Kit meglévő projektbe történő átlagos bevezetési ideje 4–6 óra az alapszcenárióhoz és 2–3 nap a teljes integrációhoz egyedi modellel. Az esetek 73%-ában a fejlesztők az ML Kit-et pontosan az integráció sebessége miatt választják, nem a modellek maximális pontossága miatt.

Gyakran Ismételt Kérdések

Szükséges internet az ML Kit működéséhez?

Nem, az ML Kit az összes számítást lokálisan az eszközön végzi. Internet csak a modell kezdeti letöltéséhez szükséges a Google Play Services-en keresztül, ezután a könyvtár teljesen offline működik.

Milyen platformokat támogat az ML Kit?

Android (API 24+) és iOS (12.0+). Android esetén a Google Play Services-en keresztüli integrációt, iOS esetén a CocoaPods vagy Swift Package Manager használatát alkalmazzák a modell kézi letöltésével.

Használhatok saját modelleket az ML Kit-ben?

Igen, az ML Kit támogatja egyedi TensorFlow Lite modellek importálását a LocalModel vagy RemoteModel osztályokon keresztül. A modellt .tflite formátumba kell konvertálni és optimalizálni mobileszközökre.

Miben különbözik az ML Kit a TensorFlow Lite-tól?

ML Kit — egy magas szintű könyvtár kész API-kkal, amely nem igényel ML ismereteket. TensorFlow Lite — egy alacsony szintű futási környezet egyedi modellek futtatásához. Az ML Kit belsőleg a TFLite-ot használja, de elrejti az összetettséget a fejlesztő elől.

Hogyan frissülnek az ML Kit modelljei?

Modellek automatikusan frissülnek a Google Play Services-en keresztül Android és az App Store-on keresztül iOS esetén. A Google 6–8 hetente ad ki frissítéseket, javítva a felismerés pontosságát és új nyelveket adva hozzá.

Összegzés

  • ML Kit — a Google könyvtára on-device ML-hez Android és iOS rendszereken, 15+ kész számítógépes látási és NLP API-val
  • Text Recognition nyomtatott és kézírásos szöveget ismer fel 50+ nyelven, akár 97%-os pontossággal
  • Face Detection akár 17 kulcsfontosságú arcpontot azonosít a mosoly és a szemnyitottság értékelésével
  • Barcode Scanning az összes formátumot támogatja: QR, EAN, Code 128, PDF417, Data Matrix
  • Integráció Gradle vagy CocoaPods segítségével minimális kóddal — 3–5 sor az alapszcenárióhoz
  • Adatvédelem — az adatok lokálisan kerülnek feldolgozásra, szerverre küldés nélkül
  • Tipikus feladatokhoz az ML Kit a bevezetés egyszerűsége és a felismerés minőségének optimális egyensúlyát kínálja

Kulcsrakész mobilalkalmazást fejlesztünk

Az IT Sectr 2017 óta készít iOS és Android alkalmazásokat induló vállalkozásoknak és vállalkozásoknak. Tanácsot adunk, és a legjobb megoldást javasoljuk.

Projekt megbeszélése

Olvassa el is