TensorFlow Lite — यह क्या है, मुख्य विशेषताएँ और अनुप्रयोग

लेखक: IT Sectr प्रकाशित: 2026-07-17 पढ़ने का समय: 6 मिनट

TensorFlow Lite, TensorFlow फ्रेमवर्क का एक हल्का संस्करण है, जिसे Google द्वारा सीमित कम्प्यूटेशनल संसाधनों वाले मोबाइल और एम्बेडेड उपकरणों पर मशीन लर्निंग मॉडल चलाने के लिए विकसित किया गया है। पूर्ण TensorFlow के विपरीत, TFLite एक विशेष इंटरप्रेटर और .tflite प्रारूप का उपयोग करता है, जो प्रशिक्षण समर्थन के बिना तेज़ इन्फ़रेंस के लिए अनुकूलित है। TensorFlow Lite Guide, 2025 के अनुसार, यह फ्रेमवर्क Android, iOS और Linux पर चलता है और 4 अरब से अधिक उपकरणों पर उपयोग होता है। TensorFlow Lite क्वांटाइज़ेशन, NNAPI, GPU और Core ML डेलीगेट के माध्यम से हार्डवेयर एक्सेलेरेशन का समर्थन करता है।

मुख्य बिंदु

  • TensorFlow Lite मोबाइल और एम्बेडेड उपकरणों पर ऑन-डिवाइस ML के लिए एक हल्का फ्रेमवर्क है।
  • मॉडल TensorFlow SavedModel या Keras से TFLite कन्वर्टर के माध्यम से .tflite प्रारूप में परिवर्तित किए जाते हैं।
  • आकार कम करने के लिए INT8, FP16 क्वांटाइज़ेशन और डायनेमिक क्वांटाइज़ेशन समर्थित है।
  • GPU Delegate, NNAPI और Core ML Delegate के माध्यम से हार्डवेयर एक्सेलेरेशन उपलब्ध है।
  • TFLite Android, iOS और Linux पर Java, C++, Swift और Python में API के साथ काम करता है।

TensorFlow Lite क्या है

TensorFlow Lite सीमित संसाधनों वाले उपकरणों पर मशीन लर्निंग मॉडल चलाने के लिए एक विशेष रनटाइम है। पूर्ण TensorFlow के विपरीत, TFLite प्रशिक्षण या बैकप्रोपेगेशन का समर्थन नहीं करता — केवल इन्फ़रेंस। यह लाइब्रेरी के बाइनरी आकार को न्यूनतम रखने की अनुमति देता है: Android पर बेस इंटरप्रेटर के लिए लगभग 300 KB।

TFLite आर्किटेक्चर .tflite प्रारूप के आसपास बनाया गया है, जो FlatBuffers पर आधारित है। FlatBuffers पार्सिंग चरण के बिना डेटा तक सीधी पहुँच प्रदान करता है, जो सीमित मेमोरी वाले मोबाइल उपकरणों के लिए महत्वपूर्ण है। .tflite प्रारूप में मॉडल में एकल बाइनरी फ़ाइल में गणना ग्राफ, वेट और मेटाडेटा होते हैं।

Google I/O 2024 के अनुसार, TFLite का उपयोग Google Photos, Gboard, YouTube और अन्य Google अनुप्रयोगों में 4 अरब से अधिक उपकरणों के संयुक्त दर्शकों के साथ किया जाता है। यह फ्रेमवर्क सभी प्रमुख आर्किटेक्चर का समर्थन करता है: CNN, RNN, LSTM, Transformer और डेलीगेट के माध्यम से कस्टम ऑपरेशन।

TensorFlow Lite आर्किटेक्चर

TFLite रनटाइम में चार घटक होते हैं। TFLite Converter TensorFlow (SavedModel, Keras, ConcreteFunction) से मॉडल लेता है और इसे वैकल्पिक ऑप्टिमाइज़ेशन के साथ .tflite प्रारूप में परिवर्तित करता है। TFLite Interpreter .tflite फ़ाइल लोड करता है और टेंसर और मेमोरी प्रबंधित करते हुए इन्फ़रेंस करता है।

डेलीगेट ऐसे घटक हैं जो ऑपरेशन निष्पादन को विशेष हार्डवेयर पर स्थानांतरित करते हैं। GPU Delegate OpenGL ES और Metal का उपयोग करता है, NNAPI Delegate Android Neural Networks API का उपयोग करता है, Core ML Delegate Apple Core ML का उपयोग करता है। XNNPACK Delegate ARM CPU पर निष्पादन को अनुकूलित करता है। प्रत्येक डेलीगेट ऑपरेटरों के एक विशिष्ट सेट का समर्थन करता है।

चौथा घटक Task Library है, जो विशिष्ट कार्यों के लिए उच्च-स्तरीय API प्रदान करता है: इमेज क्लासिफिकेशन, ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन, NLU। Task Library Interpreter के ऊपर काम करती है और टेंसर प्रबंधन के विवरणों को छिपाती है।

मॉडल ऑप्टिमाइज़ेशन और क्वांटाइज़ेशन

TFLite क्वांटाइज़ेशन के तीन स्तरों का समर्थन करता है। पूर्ण पूर्णांक INT8 क्वांटाइज़ेशन वेट और एक्टिवेशन को FP32 से 8-बिट पूर्णांक में परिवर्तित करता है। मॉडल का आकार 4 गुना कम हो जाता है, और INT8 समर्थन वाले उपकरणों पर इन्फ़रेंस गति 3 गुना तक बढ़ जाती है। FP16 क्वांटाइज़ेशन न्यूनतम सटीकता हानि के साथ आकार को आधा कर देता है।

डायनेमिक क्वांटाइज़ेशन वेट को INT8 में रखता है लेकिन गणना FP32 में करता है। यह मोड सटीकता के प्रति संवेदनशील मॉडलों के लिए उपयुक्त है और गुणवत्ता बनाए रखते हुए 4x तक आकार कम करता है। Google ML Performance Benchmarks के अनुसार, NLP मॉडल के लिए डायनेमिक क्वांटाइज़ेशन अनुशंसित है।

TFLite क्वांटाइज़ेशन मोड की तुलना

मोडवेट प्रकारएक्टिवेशन प्रकारआकार में कमी
FP32 (बिना क्वांटाइज़ेशन)FP32FP321x
FP16FP16FP322x
डायनेमिक INT8INT8FP324x
पूर्ण INT8INT8INT84x

Android और iOS पर हार्डवेयर एक्सेलेरेशन

Android पर, मुख्य एक्सेलेरेशन तंत्र NNAPI Delegate है, जो Android Neural Networks API के माध्यम से ऑपरेशन निष्पादन को NPU, DSP या GPU पर स्थानांतरित करता है। NNAPI Android 8.1+ वाले उपकरणों पर उपलब्ध है और INT8 और FP16 गणना का समर्थन करता है। Android के लिए GPU Delegate OpenGL ES 3.1+ और Vulkan का उपयोग करता है।

iOS पर, एक्सेलेरेशन Core ML Delegate के माध्यम से प्रदान किया जाता है, जो TFLite ऑपरेशन को Core ML प्रारूप में अनुवादित करता है और उन्हें Apple Neural Engine पर निष्पादित करता है। Apple ML Benchmarking के अनुसार, Core ML Delegate का उपयोग iPhone 15 Pro पर CPU की तुलना में इन्फ़रेंस को 4 गुना तक तेज़ करता है। iOS के लिए GPU Delegate Metal Performance Shaders का उपयोग करता है।

XNNPACK Delegate ARM CPU के लिए एक क्रॉस-प्लेटफ़ॉर्म समाधान है, जो मोबाइल प्रोसेसर के लिए अनुकूलित है। XNNPACK FP32, FP16 और INT8 ऑपरेशन का समर्थन करता है और विशेष हार्डवेयर की आवश्यकता नहीं है। इसे सभी उपकरणों के लिए बेसलाइन डेलीगेट के रूप में अनुशंसित किया जाता है।

TFLite के साथ मॉडल डिप्लॉयमेंट

डिप्लॉयमेंट प्रक्रिया में तीन चरण शामिल हैं। पहला — TFLite Converter के माध्यम से मॉडल को .tflite में परिवर्तित करना। दूसरा — .tflite फ़ाइल को एप्लिकेशन संसाधनों में शामिल करना। Android के लिए, फ़ाइल assets में रखी जाती है; iOS के लिए, Xcode के माध्यम से ऐप बंडल में। तीसरा — Interpreter को आरंभ करना और इन्फ़रेंस करना।

डायनेमिक मॉडल अपडेट के लिए, Google Firebase ML Model Downloading या क्लाउड से कस्टम डाउनलोड तंत्र का उपयोग करने की अनुशंसा करता है। अपडेट की गई .tflite फ़ाइल स्थानीय स्टोरेज में सहेजी जाती है और अगले लॉन्च पर Interpreter में लोड होती है।

डिप्लॉय करते समय, .tflite फ़ाइल आकार पर विचार करना महत्वपूर्ण है। Google Play APK आकार को 200 MB तक सीमित करता है। 50 MB से बड़े मॉडल के लिए, Android App Bundle का उपयोग करने या Play Asset Delivery के माध्यम से मॉडल को अलग से डाउनलोड करने की अनुशंसा की जाती है।

कोड में TFLite के उपयोग के उदाहरण

Android पर Java API के साथ मॉडल लोड करने और चलाने का उदाहरण। assets से .tflite लोड करने के लिए Interpreter.create() और इन्फ़रेंस के लिए run() का उपयोग करें। इनपुट और आउटपुट डेटा बहुआयामी ऐरे या ByteBuffer के रूप में पास किए जाते हैं:

java
import org.tensorflow.lite.Interpreter;
import java.nio.MappedByteBuffer;
import java.io.FileInputStream;
import java.nio.channels.FileChannel;

MappedByteBuffer model = new FileInputStream(
    getAssets().openFd("model.tflite")
).getChannel().map(
    FileChannel.MapMode.READ_ONLY, 0, fc.size()
);

Interpreter interpreter = new Interpreter.create(model);
float[][] input = new float[1][224 * 224 * 3];
float[][] output = new float[1][1000];
interpreter.run(input, output);
interpreter.close();

हार्डवेयर एक्सेलेरेशन के लिए Android पर GPU Delegate का उपयोग करने का उदाहरण। निर्भरता com.android.support:tensorflow-lite-gpu जोड़ें और Interpreter बनाते समय डेलीगेट निर्दिष्ट करें:

java
import org.tensorflow.lite.Interpreter;
import org.tensorflow.lite.gpu.GpuDelegate;

GpuDelegate gpuDelegate = new GpuDelegate.create();
Interpreter.Options options = new Interpreter.Options().addDelegate(gpuDelegate);
Interpreter interpreter = new Interpreter.create(model, options);

// Run inference on the input data
interpreter.run(input, output);

// Release delegate resources after inference
gpuDelegate.close();
interpreter.close();

अक्सर पूछे जाने वाले प्रश्न

TensorFlow और TensorFlow Lite में क्या अंतर है?

TensorFlow प्रशिक्षण और इन्फ़रेंस के लिए एक पूर्ण फ्रेमवर्क है। TensorFlow Lite केवल मोबाइल उपकरणों पर इन्फ़रेंस के लिए है। TFLite .tflite प्रारूप का उपयोग करता है और बैकप्रोपेगेशन का समर्थन नहीं करता।

TFLite में कौन से एक्सेलेरेशन डेलीगेट उपलब्ध हैं?

समर्थित डेलीगेट में GPU Delegate (OpenGL/Metal), NNAPI Delegate (Android), Core ML Delegate (iOS) और XNNPACK Delegate (ARM CPU) शामिल हैं। प्रत्येक डेलीगेट एक विशिष्ट प्रकार के हार्डवेयर के लिए अनुकूलित है।

.tflite मॉडल का आकार कैसे कम करें?

क्वांटाइज़ेशन का उपयोग करें: FP16 आकार 2 गुना कम करता है, INT8 4 गुना। डायनेमिक क्वांटाइज़ेशन, वेट प्रूनिंग और रूपांतरण से पहले मॉडल डिस्टिलेशन भी उपलब्ध है।

क्या TFLite ऑन-डिवाइस प्रशिक्षण का समर्थन करता है?

हाँ, TFLite Model Maker और ऑन-डिवाइस ट्रेनिंग API (प्रयोगात्मक) के माध्यम से। उपयोगकर्ता के उपकरण पर सीधे फाइन-ट्यूनिंग और मॉडल वैयक्तिकरण समर्थित है।

TFLite किस प्रकार के मॉडल का समर्थन करता है?

TFLite CNN, RNN, LSTM, Transformer, मोबाइल आर्किटेक्चर (MobileNet, EfficientNet, YOLO, BERT) और कस्टम ऑपरेशन का समर्थन करता है। सीमा लक्ष्य डेलीगेट में उपलब्ध ऑपरेटर है।

सारांश

  • TensorFlow Lite Google द्वारा मोबाइल और एम्बेडेड उपकरणों पर ऑन-डिवाइस ML के लिए एक हल्का फ्रेमवर्क है।
  • मॉडल TFLite Converter के माध्यम से TensorFlow SavedModel या Keras से .tflite प्रारूप में परिवर्तित किए जाते हैं।
  • INT8 और FP16 क्वांटाइज़ेशन मॉडल के आकार को 4 गुना तक कम करता है और इन्फ़रेंस को 3 गुना तक तेज़ करता है।
  • GPU, NNAPI, Core ML और XNNPACK डेलीगेट के माध्यम से हार्डवेयर एक्सेलेरेशन उपलब्ध है।
  • रनटाइम Android पर लगभग 300 KB लेता है और 4 अरब से अधिक उपकरणों पर चलता है।
  • Task Library क्लासिफिकेशन, डिटेक्शन, सेगमेंटेशन और NLU के लिए तैयार समाधान प्रदान करती है।
  • डायनेमिक अपडेट के लिए, Firebase ML या Play Asset Delivery का उपयोग करें।

हम एक मोबाइल एप्लिकेशन टर्नकी विकसित करेंगे

IT Sectr 2017 से स्टार्टअप और व्यवसायों के लिए iOS और Android एप्लिकेशन बनाता है। हम आपको सलाह देंगे और सर्वोत्तम समाधान प्रस्तावित करेंगे।

परियोजना पर चर्चा करें

यह भी पढ़ें