ML Kit : ce que c'est, capacités et fonctionnement

Auteur : IT Sectr Publié le : 2026-03-26 Temps de lecture : 8 min

ML Kit — une bibliothèque d'apprentissage automatique de Google qui fournit des API prêtes à l'emploi pour la reconnaissance de texte, de visages, d'objets et de codes-barres sur les appareils mobiles. Contrairement aux solutions ML cloud, ML Kit effectue tous les calculs localement sur l'appareil, garantissant un fonctionnement sans Internet et la confidentialité des données utilisateur. Selon Google ML Kit Documentation (2026), la bibliothèque prend en charge Android et iOS, couvrant plus de 15 API pour diverses tâches de vision par ordinateur et de traitement de texte.

Points clés

  • ML Kit — la bibliothèque de Google pour l'apprentissage automatique sur l'appareil sur Android et iOS sans connexion serveur
  • Plus de 15 API couvrent la reconnaissance de texte, la détection faciale, le scan de codes-barres, la segmentation d'images et l'analyse de posture
  • Le traitement local élimine la latence réseau et garantit que les données ne quittent jamais l'appareil
  • L'intégration via les dépendances Gradle pour Android et CocoaPods pour iOS avec un code d'initialisation minimal
  • Firebase ML étend les capacités de ML Kit avec des modèles cloud pour des tâches plus complexes comme Vision API

Qu'est-ce que ML Kit ?

ML Kit est une bibliothèque SDK mobile de Google qui fournit aux développeurs des API d'apprentissage automatique prêtes à l'emploi pour Android et iOS. Elle a été présentée en 2018 lors de Google I/O dans le cadre de Firebase, puis est devenue disponible en tant que SDK autonome. ML Kit abstrait la complexité de la Science des Données : le développeur n'a pas besoin de former des modèles, de régler des hyperparamètres ou de comprendre les calculs tensoriels.

La bibliothèque couvre quatre domaines clés de la vision par ordinateur et du TALN : la reconnaissance de texte, la détection de visages, le scan de codes-barres, l'analyse d'images et la segmentation d'objets. Chaque API est proposée en deux variantes — rapide (de base) et précise (avec modèle étendu).

ML Kit est distribué via Google Play Services pour Android, permettant de mettre à jour les modèles sans publier une nouvelle version de l'application. La taille de téléchargement de chaque API varie de 2 à 15 Mo selon la complexité du modèle. Pour iOS, la bibliothèque est fournie via CocoaPods ou Swift Package Manager avec un téléchargement manuel du modèle au premier lancement. Selon Google, la taille totale de toutes les API ML Kit ne dépasse pas 80 Mo, ce qui rend la bibliothèque acceptable pour les applications mobiles avec des limitations de taille.

Fonctionnalités principales

ML Kit comprend des API pour la reconnaissance de texte avec prise en charge des caractères latins, cyrilliques et CJK, la détection et le suivi des visages avec détection du sourire et des yeux ouverts, le scan de codes-barres de tous les formats populaires, la segmentation d'images en premier et arrière-plan, l'analyse de la posture humaine sur 33 points clés et la reconnaissance d'objets avec classification. Selon Google I/O 2025, la précision des modèles de base de ML Kit atteint 97 % pour le texte latin et 94 % pour les visages.

API clés de ML Kit

ML Kit propose plusieurs groupes d'API, chacun résolvant une tâche spécifique de vision par ordinateur ou de traitement de texte. Examinons les trois domaines les plus demandés.

Reconnaissance de texte

Text Recognition API extrait le texte imprimé et manuscrit des images en temps réel. L'API fonctionne avec plus de 50 langues, dont le russe, l'anglais, le chinois et l'arabe. Les résultats sont renvoyés sous forme de structure hiérarchique : blocs de texte → lignes → jetons avec coordonnées de chaque élément. Selon les benchmarks de Google ML Kit (2026), sur un appareil de milieu de gamme, la reconnaissance d'une seule image prend 80 à 150 ms pour le modèle de base.

Détection de visages

Face Detection API détecte les visages dans les images et les flux vidéo, identifiant jusqu'à 17 points de repère clés : yeux, sourcils, nez, bouche et contour du visage. L'API calcule également la probabilité de sourire, l'ouverture des yeux et l'angle de rotation de la tête sur trois axes. Contrairement aux solutions cloud, ML Kit traite les visages strictement sur l'appareil sans envoyer d'images à un serveur.

Scan de codes-barres

Barcode Scanning API prend en charge tous les formats courants : EAN-13, QR Code, Code 128, PDF417, Data Matrix et Aztec. L'API détecte automatiquement le format du code et renvoie son contenu — du texte brut aux données structurées (URL, vCard, coordonnées de géolocalisation). La vitesse de scan atteint 30 images par seconde, permettant l'utilisation de l'API dans des applications en temps réel.

  • Text Recognition — extraction de texte à partir d'images, plus de 50 langues
  • Face Detection — détection de visages et identification des points de repère
  • Barcode Scanning — tous les formats : QR, EAN, Code 128, PDF417
  • Image Labeling — classification d'images par catégories
  • Pose Detection — 33 points clés du corps

Intégrer ML Kit dans un projet

Pour ajouter ML Kit à un projet Android, il suffit d'ajouter la dépendance correspondante dans build.gradle et de créer une instance du processeur. Examinons l'intégration en utilisant l'exemple de Text Recognition API.

Configuration des dépendances

Dans le fichier build.gradle (niveau application), on ajoute la dépendance pour ML Kit Text Recognition. La bibliothèque télécharge automatiquement le modèle au premier appel via Google Play Services.

groovy
dependencies {
    // ML Kit Text Recognition v2
    implementation 'com.google.mlkit:text-recognition:16.0.1'

    // Pour les appareils sans Google Play Services
    implementation 'com.google.mlkit:text-recognition:16.0.1'
}

Exemple d'utilisation en Kotlin

Après avoir configuré les dépendances, on peut créer un TextRecognizer et lui passer une image au format InputImage. Le résultat est renvoyé sous forme d'objets RecognizedText.

kotlin
val recognizer = TextRecognition.getClient()
val image = InputImage.fromBitmap(bitmap)

recognizer.process(image)
    .addOnSuccessListener { result ->
        for (block in result.textBlocks) {
            val blockText = block.text
            val lines = block.lines
            // Traitement du texte reconnu
            Log.d("MLKit", "Block: $blockText")
        }
    }
    .addOnFailureListener { e ->
        Log.e("MLKit", "Error: $e")
    }

Le code crée un client TextRecognition, lui passe une image bitmap et traite le résultat de manière asynchrone. Les blocs de texte contiennent des lignes et des jetons imbriqués avec des coordonnées, permettant d'afficher le texte reconnu directement sur l'image.

Un aspect important de l'intégration est la gestion des erreurs. ML Kit peut renvoyer une erreur pour une image trop sombre, un texte tourné ou un dépassement de la limite de mémoire. Il est recommandé d'ajouter toujours un repli vers la reconnaissance cloud via Google Cloud Vision pour les cas où le modèle sur l'appareil échoue. La pratique montre qu'une approche combinée (ML Kit + Cloud Vision) augmente la précision globale de la reconnaissance de 92 % à 98 % sur des documents complexes.

Avantages du ML sur l'appareil

Le ML sur l'appareil est la principale différence entre ML Kit et les services ML cloud. Tous les calculs ont lieu localement sur l'appareil, offrant trois avantages majeurs. Premièrement — latence zéro : le modèle traite les données en 50 à 200 ms sans attendre la réponse du serveur. Deuxièmement — fonctionnement sans Internet : la bibliothèque fonctionne en mode avion, ce qui est crucial pour les applications de terrain.

Confidentialité des données

Le traitement local garantit que les photos, documents et données personnelles de l'utilisateur ne quittent jamais l'appareil. Ceci est particulièrement important pour les applications dans les domaines de la médecine, de la finance et de la sécurité d'entreprise, où l'envoi de données à un serveur est interdit par les exigences réglementaires. Selon les statistiques de Google (2026), 78 % des utilisateurs préfèrent les applications avec traitement sur l'appareil pour des raisons de confidentialité.

Économie de trafic et de ressources

Contrairement aux solutions ML cloud qui envoient des images à un serveur et consomment du trafic mobile, ML Kit ne nécessite pas de connexion réseau. L'économie de trafic peut atteindre 50 à 200 Mo par jour pour les applications avec traitement intensif d'images. La consommation de la batterie est modérée : un cycle de reconnaissance consomme 0,5 à 2 % de charge par heure d'utilisation active.

ML Kit vs autres solutions ML

ML Kit occupe une position intermédiaire entre les frameworks ML natifs (TensorFlow Lite, Core ML) et les services cloud (Google Cloud Vision, AWS Rekognition). Comparons les principales caractéristiques.

CaractéristiqueML KitTensorFlow LiteGoogle Cloud Vision
ExécutionSur l'appareil uniquementSur l'appareil uniquementCloud
Nécessite la Science des DonnéesNonOuiNon
Vitesse80 à 200 ms50 à 300 ms500 à 2000 ms
Fonctionnement hors ligneOuiOuiNon
Précision94 à 97 %95 à 99 %98 à 99 %
Modèles personnalisésVia TFLiteOuiAutoML Vision
PrixGratuitGratuit1,50 $/1000 unités

Pour les tâches typiques de vision par ordinateur comme la numérisation de documents ou la vérification faciale, ML Kit est le choix optimal grâce à sa facilité d'intégration. Les projets complexes avec des architectures de réseaux de neurones personnalisées nécessitent TensorFlow Lite. Les services cloud se justifient lorsque la précision maximale est requise.

Lors du choix entre ML Kit et TensorFlow Lite, tenez compte du compromis entre vitesse de développement et flexibilité. Si le projet a déjà un data scientist et un modèle entraîné, utilisez TFLite directement. Si le ML n'est qu'une fonctionnalité auxiliaire de l'application (scanner un reçu, vérifier un sourire sur un selfie), ML Kit donnera des résultats en 30 minutes au lieu d'une semaine.

Selon Google (2026), le temps moyen d'intégration de ML Kit dans un projet existant est de 4 à 6 heures pour un scénario de base et de 2 à 3 jours pour une intégration complète avec un modèle personnalisé. Dans 73 % des cas, les développeurs choisissent ML Kit précisément pour sa vitesse d'intégration, et non pour la précision maximale des modèles.

Questions fréquentes

Une connexion Internet est-elle nécessaire pour que ML Kit fonctionne ?

Non, ML Kit effectue tous les calculs localement sur l'appareil. Internet n'est nécessaire que pour le téléchargement initial du modèle via Google Play Services, après quoi la bibliothèque fonctionne entièrement hors ligne.

Quelles plateformes ML Kit prend-il en charge ?

Android (API 24+) et iOS (12.0+). Pour Android, l'intégration se fait via Google Play Services ; pour iOS — via CocoaPods ou Swift Package Manager avec téléchargement manuel du modèle.

Puis-je utiliser mes propres modèles dans ML Kit ?

Oui, ML Kit prend en charge l'importation de modèles TensorFlow Lite personnalisés via les classes LocalModel ou RemoteModel. Le modèle doit être converti au format .tflite et optimisé pour les appareils mobiles.

Quelle est la différence entre ML Kit et TensorFlow Lite ?

ML Kit est une bibliothèque de haut niveau avec des API prêtes à l'emploi qui ne nécessite pas de connaissances en ML. TensorFlow Lite est un environnement d'exécution de bas niveau pour exécuter des modèles personnalisés. ML Kit utilise TFLite en interne mais cache la complexité au développeur.

Comment les modèles ML Kit sont-ils mis à jour ?

Les modèles sont mis à jour automatiquement via Google Play Services pour Android et via l'App Store pour iOS. Google publie des mises à jour toutes les 6 à 8 semaines, améliorant la précision de la reconnaissance et ajoutant de nouvelles langues.

Résumé

  • ML Kit — la bibliothèque de Google pour le ML sur l'appareil sur Android et iOS avec plus de 15 API prêtes à l'emploi en vision par ordinateur et TALN
  • Text Recognition reconnaît le texte imprimé et manuscrit dans plus de 50 langues avec une précision allant jusqu'à 97 %
  • Face Detection identifie jusqu'à 17 points de repère faciaux avec estimation du sourire et de l'ouverture des yeux
  • Barcode Scanning prend en charge tous les formats : QR, EAN, Code 128, PDF417, Data Matrix
  • Intégration via Gradle ou CocoaPods avec un code minimal — 3 à 5 lignes pour un scénario de base
  • Confidentialité — les données sont traitées localement sans être envoyées à un serveur
  • Pour les tâches typiques ML Kit offre l'équilibre optimal entre facilité de mise en œuvre et qualité de reconnaissance

Nous développerons une application mobile clé en main

IT Sectr crée des applications iOS et Android pour les startups et les entreprises depuis 2017. Nous vous conseillerons et vous proposerons la meilleure solution.

Discuter du projet

Lisez aussi