ML Kit — une bibliothèque d'apprentissage automatique de Google qui fournit des API prêtes à l'emploi pour la reconnaissance de texte, de visages, d'objets et de codes-barres sur les appareils mobiles. Contrairement aux solutions ML cloud, ML Kit effectue tous les calculs localement sur l'appareil, garantissant un fonctionnement sans Internet et la confidentialité des données utilisateur. Selon Google ML Kit Documentation (2026), la bibliothèque prend en charge Android et iOS, couvrant plus de 15 API pour diverses tâches de vision par ordinateur et de traitement de texte.
Points clés
ML Kit est une bibliothèque SDK mobile de Google qui fournit aux développeurs des API d'apprentissage automatique prêtes à l'emploi pour Android et iOS. Elle a été présentée en 2018 lors de Google I/O dans le cadre de Firebase, puis est devenue disponible en tant que SDK autonome. ML Kit abstrait la complexité de la Science des Données : le développeur n'a pas besoin de former des modèles, de régler des hyperparamètres ou de comprendre les calculs tensoriels.
La bibliothèque couvre quatre domaines clés de la vision par ordinateur et du TALN : la reconnaissance de texte, la détection de visages, le scan de codes-barres, l'analyse d'images et la segmentation d'objets. Chaque API est proposée en deux variantes — rapide (de base) et précise (avec modèle étendu).
ML Kit est distribué via Google Play Services pour Android, permettant de mettre à jour les modèles sans publier une nouvelle version de l'application. La taille de téléchargement de chaque API varie de 2 à 15 Mo selon la complexité du modèle. Pour iOS, la bibliothèque est fournie via CocoaPods ou Swift Package Manager avec un téléchargement manuel du modèle au premier lancement. Selon Google, la taille totale de toutes les API ML Kit ne dépasse pas 80 Mo, ce qui rend la bibliothèque acceptable pour les applications mobiles avec des limitations de taille.
ML Kit comprend des API pour la reconnaissance de texte avec prise en charge des caractères latins, cyrilliques et CJK, la détection et le suivi des visages avec détection du sourire et des yeux ouverts, le scan de codes-barres de tous les formats populaires, la segmentation d'images en premier et arrière-plan, l'analyse de la posture humaine sur 33 points clés et la reconnaissance d'objets avec classification. Selon Google I/O 2025, la précision des modèles de base de ML Kit atteint 97 % pour le texte latin et 94 % pour les visages.
ML Kit propose plusieurs groupes d'API, chacun résolvant une tâche spécifique de vision par ordinateur ou de traitement de texte. Examinons les trois domaines les plus demandés.
Text Recognition API extrait le texte imprimé et manuscrit des images en temps réel. L'API fonctionne avec plus de 50 langues, dont le russe, l'anglais, le chinois et l'arabe. Les résultats sont renvoyés sous forme de structure hiérarchique : blocs de texte → lignes → jetons avec coordonnées de chaque élément. Selon les benchmarks de Google ML Kit (2026), sur un appareil de milieu de gamme, la reconnaissance d'une seule image prend 80 à 150 ms pour le modèle de base.
Face Detection API détecte les visages dans les images et les flux vidéo, identifiant jusqu'à 17 points de repère clés : yeux, sourcils, nez, bouche et contour du visage. L'API calcule également la probabilité de sourire, l'ouverture des yeux et l'angle de rotation de la tête sur trois axes. Contrairement aux solutions cloud, ML Kit traite les visages strictement sur l'appareil sans envoyer d'images à un serveur.
Barcode Scanning API prend en charge tous les formats courants : EAN-13, QR Code, Code 128, PDF417, Data Matrix et Aztec. L'API détecte automatiquement le format du code et renvoie son contenu — du texte brut aux données structurées (URL, vCard, coordonnées de géolocalisation). La vitesse de scan atteint 30 images par seconde, permettant l'utilisation de l'API dans des applications en temps réel.
Pour ajouter ML Kit à un projet Android, il suffit d'ajouter la dépendance correspondante dans build.gradle et de créer une instance du processeur. Examinons l'intégration en utilisant l'exemple de Text Recognition API.
Dans le fichier build.gradle (niveau application), on ajoute la dépendance pour ML Kit Text Recognition. La bibliothèque télécharge automatiquement le modèle au premier appel via Google Play Services.
dependencies {
// ML Kit Text Recognition v2
implementation 'com.google.mlkit:text-recognition:16.0.1'
// Pour les appareils sans Google Play Services
implementation 'com.google.mlkit:text-recognition:16.0.1'
}
Après avoir configuré les dépendances, on peut créer un TextRecognizer et lui passer une image au format InputImage. Le résultat est renvoyé sous forme d'objets RecognizedText.
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)
recognizer.process(image)
.addOnSuccessListener { result ->
for (block in result.textBlocks) {
val blockText = block.text
val lines = block.lines
// Traitement du texte reconnu
Log.d("MLKit", "Block: $blockText")
}
}
.addOnFailureListener { e ->
Log.e("MLKit", "Error: $e")
}
Le code crée un client TextRecognition, lui passe une image bitmap et traite le résultat de manière asynchrone. Les blocs de texte contiennent des lignes et des jetons imbriqués avec des coordonnées, permettant d'afficher le texte reconnu directement sur l'image.
Un aspect important de l'intégration est la gestion des erreurs. ML Kit peut renvoyer une erreur pour une image trop sombre, un texte tourné ou un dépassement de la limite de mémoire. Il est recommandé d'ajouter toujours un repli vers la reconnaissance cloud via Google Cloud Vision pour les cas où le modèle sur l'appareil échoue. La pratique montre qu'une approche combinée (ML Kit + Cloud Vision) augmente la précision globale de la reconnaissance de 92 % à 98 % sur des documents complexes.
Le ML sur l'appareil est la principale différence entre ML Kit et les services ML cloud. Tous les calculs ont lieu localement sur l'appareil, offrant trois avantages majeurs. Premièrement — latence zéro : le modèle traite les données en 50 à 200 ms sans attendre la réponse du serveur. Deuxièmement — fonctionnement sans Internet : la bibliothèque fonctionne en mode avion, ce qui est crucial pour les applications de terrain.
Le traitement local garantit que les photos, documents et données personnelles de l'utilisateur ne quittent jamais l'appareil. Ceci est particulièrement important pour les applications dans les domaines de la médecine, de la finance et de la sécurité d'entreprise, où l'envoi de données à un serveur est interdit par les exigences réglementaires. Selon les statistiques de Google (2026), 78 % des utilisateurs préfèrent les applications avec traitement sur l'appareil pour des raisons de confidentialité.
Contrairement aux solutions ML cloud qui envoient des images à un serveur et consomment du trafic mobile, ML Kit ne nécessite pas de connexion réseau. L'économie de trafic peut atteindre 50 à 200 Mo par jour pour les applications avec traitement intensif d'images. La consommation de la batterie est modérée : un cycle de reconnaissance consomme 0,5 à 2 % de charge par heure d'utilisation active.
ML Kit occupe une position intermédiaire entre les frameworks ML natifs (TensorFlow Lite, Core ML) et les services cloud (Google Cloud Vision, AWS Rekognition). Comparons les principales caractéristiques.
| Caractéristique | ML Kit | TensorFlow Lite | Google Cloud Vision |
|---|---|---|---|
| Exécution | Sur l'appareil uniquement | Sur l'appareil uniquement | Cloud |
| Nécessite la Science des Données | Non | Oui | Non |
| Vitesse | 80 à 200 ms | 50 à 300 ms | 500 à 2000 ms |
| Fonctionnement hors ligne | Oui | Oui | Non |
| Précision | 94 à 97 % | 95 à 99 % | 98 à 99 % |
| Modèles personnalisés | Via TFLite | Oui | AutoML Vision |
| Prix | Gratuit | Gratuit | 1,50 $/1000 unités |
Pour les tâches typiques de vision par ordinateur comme la numérisation de documents ou la vérification faciale, ML Kit est le choix optimal grâce à sa facilité d'intégration. Les projets complexes avec des architectures de réseaux de neurones personnalisées nécessitent TensorFlow Lite. Les services cloud se justifient lorsque la précision maximale est requise.
Lors du choix entre ML Kit et TensorFlow Lite, tenez compte du compromis entre vitesse de développement et flexibilité. Si le projet a déjà un data scientist et un modèle entraîné, utilisez TFLite directement. Si le ML n'est qu'une fonctionnalité auxiliaire de l'application (scanner un reçu, vérifier un sourire sur un selfie), ML Kit donnera des résultats en 30 minutes au lieu d'une semaine.
Selon Google (2026), le temps moyen d'intégration de ML Kit dans un projet existant est de 4 à 6 heures pour un scénario de base et de 2 à 3 jours pour une intégration complète avec un modèle personnalisé. Dans 73 % des cas, les développeurs choisissent ML Kit précisément pour sa vitesse d'intégration, et non pour la précision maximale des modèles.
Questions fréquentes
Non, ML Kit effectue tous les calculs localement sur l'appareil. Internet n'est nécessaire que pour le téléchargement initial du modèle via Google Play Services, après quoi la bibliothèque fonctionne entièrement hors ligne.
Android (API 24+) et iOS (12.0+). Pour Android, l'intégration se fait via Google Play Services ; pour iOS — via CocoaPods ou Swift Package Manager avec téléchargement manuel du modèle.
Oui, ML Kit prend en charge l'importation de modèles TensorFlow Lite personnalisés via les classes LocalModel ou RemoteModel. Le modèle doit être converti au format .tflite et optimisé pour les appareils mobiles.
ML Kit est une bibliothèque de haut niveau avec des API prêtes à l'emploi qui ne nécessite pas de connaissances en ML. TensorFlow Lite est un environnement d'exécution de bas niveau pour exécuter des modèles personnalisés. ML Kit utilise TFLite en interne mais cache la complexité au développeur.
Les modèles sont mis à jour automatiquement via Google Play Services pour Android et via l'App Store pour iOS. Google publie des mises à jour toutes les 6 à 8 semaines, améliorant la précision de la reconnaissance et ajoutant de nouvelles langues.
Résumé
Nous développerons une application mobile clé en main
IT Sectr crée des applications iOS et Android pour les startups et les entreprises depuis 2017. Nous vous conseillerons et vous proposerons la meilleure solution.
Lisez aussi