اسپیچ ریکگنیشن (ASR) ایک خودکار تقریر کی شناخت کی ٹیکنالوجی ہے جو آڈیو سگنل کو ٹیکسٹ ترتیب میں تبدیل کرتی ہے۔ جدید نظام گہری سیکھائی (deep learning) استعمال کرتے ہیں: ایک انکوڈر (Conformer, Whisper, BiLSTM + CTC) آڈیو سپیکٹروگرام کو پوشیدہ حالتوں کی ترتیب میں تبدیل کرتا ہے، ایک ڈی کوڈر (CTC greedy decoding, Beam Search, Transformer decoder) ٹیکسٹ تشکیل دیتا ہے۔ موبائل ایپلیکیشنز میں اسپیچ ریکگنیشن وائس ان پٹ، وائس اسسٹنٹ، خودکار کال ٹرانسکرپشن اور موٹر معذوری والے لوگوں کے لیے رسائی کی خصوصیات کے لیے استعمال ہوتی ہے۔ Google Cloud Speech-to-Text, 2025 کے مطابق، کلاؤڈ ASR SNR > 15 dB پر انگریزی میں 7% اور روسی میں 12% WER حاصل کرتا ہے۔
اہم نکات
خودکار تقریر کی شناخت (ASR) ایک پائپ لائن ہے: آڈیو → پری پروسیسنگ (16 kHz مونو، شور میں کمی، VAD — آواز کی سرگرمی کا پتہ لگانا) → فیچر ایکسٹرکشن (MFCC, LogMel FilterBank) → صوتی ماڈل (نیورل نیٹ ورک: CTC / RNNT / Transducer) → زبان کا ماڈل (LM) → ڈی کوڈنگ (ٹیکسٹ)۔ جدید اینڈ ٹو اینڈ ماڈلز (Whisper, Google USM, Conformer CTC) صوتی ماڈل اور زبان کے ماڈل کو ایک Transformer میں یکجا کرتے ہیں، جو پائپ لائن کو آسان بناتا ہے اور درستگی کو بہتر بناتا ہے۔
موبائل آلات کے لیے ASR آرکیٹیکچر: CTC (Connectionist Temporal Classification) — تیز، آڈیو ٹیکسٹ alignment کی ضرورت نہیں، Vosk اور Android مقامی میں استعمال ہوتا ہے۔ RNNT (Recurrent Neural Network Transducer) — سٹریمنگ ASR، کم لیٹنسی (Google USM)۔ Conformer — CNN + Transformer کا ہائبرڈ، بہترین درستگی لیکن بھاری: Whisper Medium (769M پیرامیٹرز) — 30–60x لیٹنسی۔ آن ڈیوائس کے لیے CTC ترجیح ہے: Vosk CTC ماڈل 50–100 MB لیتے ہیں، لیٹنسی 0.3–0.8x ریئل ٹائم۔
ASR میٹرکس: WER (ورڈ ایرر ریٹ) — ریفرنس کے مقابلے میں تبدیل، حذف اور داخل کردہ الفاظ کا فیصد۔ Google Cloud ASR — 7% WER (EN)، 12% (RU)۔ Vosk — 13% (RU)، 9% (EN)۔ Whisper Small — 6% (EN)، 10% (RU)۔ CER (کریکٹر ایرر ریٹ) — اسی طرح، حرف کی سطح پر۔ ریئل ٹائم فیکٹر (RTF) — پروسیسنگ کا وقت / آڈیو کی مدت۔ RTF < 1 — ریئل ٹائم سے تیز۔ RTF < 0.3 — ریئل ٹائم ASR۔ وائس ان پٹ کے لیے RTF < 1 ضروری، ٹرانسکرپشن کے لیے RTF < 3۔
| ASR حل | WER (EN) | WER (RU) | RTF | آن ڈیوائس |
|---|---|---|---|---|
| Google Cloud ASR | 7% | 12% | 0.3 | نہیں |
| Android SpeechRecognizer | 8% | 13% | 0.5–1 | ہاں (ہائبرڈ) |
| SFSpeechRecognizer | 7% | 12% | 0.3–0.8 | ہاں (iOS 17 سے) |
| Vosk (vosk-model-small-ru) | 9% | 13% | 0.3–0.8 | ہاں |
| Whisper Small | 6% | 10% | 2–6 | ہاں |
VAD (آواز کی سرگرمی کا پتہ لگانا) — آواز کی سرگرمی کا پتہ لگانا، تقریر کو خاموشی اور شور سے الگ کرتا ہے۔ WebRTC VAD موبائل ASR کے لیے معیار ہے: 30 ms فریم، تین موڈ (0, 1, 2 — قدامت پسند سے جارحانہ تک)۔ VAD RTF کو 1.5–3x کم کرتا ہے (غیر تقریری حصوں کو چھوڑتا ہے)۔ Silero VAD (MIT) ایک نیورل VAD ہے، WebRTC (94% بمقابلہ 85% ROC AUC) سے زیادہ درست، 5–10 ms لیٹنسی، TFLite اور Core ML۔ پروڈکشن ASR کے لیے VAD → ASR کاسکیڈ استعمال کریں: یہ غلط مثبت کو کم کرتا ہے اور پروسیسنگ کو تیز کرتا ہے۔
Android SpeechRecognizer تقریر کی شناخت کے لیے Android SDK میں بنی ہوئی کلاس ہے۔ یہ دو موڈ میں کام کرتی ہے: کلاؤڈ (Google سرور) — اعلی درستگی، انٹرنیٹ درکار؛ آن ڈیوائس (Android 10+ سے) — GBoard ایمبیڈڈ ASR ماڈل، 20+ زبانیں، WER 15–18%۔ SpeechRecognizer تقریر کے دوران درمیانی نتائج (جزوی نتائج) اور حتمی ٹیکسٹ لوٹاتا ہے۔ RecognizerIntent.EXTRA_LANGUAGE کے ذریعے 60+ زبانیں سپورٹ کرتا ہے۔ وائس ان پٹ کے لیے تجویز کردہ — تیز انٹیگریشن، مفت۔
SpeechRecognizer API: SpeechRecognizer.createSpeechRecognizer(context) کے ذریعے تخلیق۔ RecognizerIntent.ACTION_RECOGNIZE_SPEECH کے ساتھ Intent جس میں extras ہیں: LANGUAGE_MODEL_FREE_FORM (آزاد متن) یا LANGUAGE_MODEL_WEB_SEARCH (تلاش کے سوالات)۔ RecognitionListener کے ذریعے نتائج: onReadyForSpeech → onBeginningOfSpeech → onRmsChanged → onPartialResults → onResults۔ مسلسل شناخت (ہمیشہ سننے کا موڈ) کے لیے — onResults کے بعد شناخت کنندہ کو دوبارہ شروع کریں۔ بیٹری بچانے کے لیے onDeviceOnly = true استعمال کریں۔
// Android SpeechRecognizer
val recognizer = SpeechRecognizer.createSpeechRecognizer(context)
recognizer.setRecognitionListener(object : RecognitionListener {
override fun onResults(results: Bundle) {
val text = results
.getStringArrayList(SpeechRecognizer.RESULTS_RECOGNITION)
?.firstOrNull() ?: ""
showResult(text)
}
override fun onPartialResults(partialResults: Bundle) {
val partial = partialResults
.getStringArrayList(SpeechRecognizer.RESULTS_RECOGNITION)
?.firstOrNull() ?: ""
showPartial(partial)
}
})
val intent = Intent(RecognizerIntent.ACTION_RECOGNIZE_SPEECH).apply {
putExtra(RecognizerIntent.EXTRA_LANGUAGE_MODEL,
RecognizerIntent.LANGUAGE_MODEL_FREE_FORM)
putExtra(RecognizerIntent.EXTRA_LANGUAGE, "ru-RU")
}
recognizer.startListening(intent)
Android پر آن ڈیوائس بمقابلہ کلاؤڈ: آن ڈیوائس انٹرنیٹ کے بغیر کام کرتا ہے (Android 10+، Pixel 4+، Samsung S20+)۔ کلاؤڈ زیادہ درست ہے (Google Neural Network ASM Model) لیکن لیٹنسی زیادہ ہے (نیٹ ورک سمیت 300–800 ms)۔ وائس ان پٹ کے لیے ہائبرڈ طریقہ استعمال کریں: نیٹ ورک نہ ہونے پر آن ڈیوائس پر فال بیک کے ساتھ کلاؤڈ۔ Android SpeechRecognizer RecognizerIntent.EXTRA_PREFER_OFFLINE کی بنیاد پر خود بخود موڈ منتخب کرتا ہے۔ زیادہ سے زیادہ رازداری کے لیے — onDeviceOnly = true سیٹ کریں (لیکن روسی کے لیے درستگی 15–18% WER ہے)۔
SFSpeechRecognizer iOS، macOS اور watchOS پر تقریر کی شناخت کے لیے Apple کا فریم ورک ہے۔ iOS 10 سے دستیاب۔ آن ڈیوائس موڈ — iOS 17 سے (مقامی ماڈل، انٹرنیٹ کی ضرورت نہیں)۔ 60+ زبانیں سپورٹ کرتا ہے۔ درستگی: WER 7–12% (آن ڈیوائس — 12–15%)۔ SFSpeechRecognizer Speech.framework کے ذریعے دستیاب ہے — اضافی SDK کی ضرورت نہیں۔ SFSpeechRecognizer.requestAuthorization کے ذریعے اجازت کی درخواست۔
SFSpeechRecognizer API: SFSpeechRecognizer(locale: Locale(identifier: "ru_RU")) → SFSpeechAudioBufferRecognitionRequest (لائیو آڈیو) یا SFSpeechURLRecognitionRequest (آڈیو فائل)۔ SFSpeechRecognitionTaskDelegate (didHypothesizeTranscription — جزوی، didFinishRecognition — حتمی) کے ساتھ recognitionTask(with:delegate:) کے ذریعے سٹریمنگ۔ آن ڈیوائس موڈ: request.requiresOnDeviceRecognition = true۔ iOS 15+ کے لیے: request.shouldReportPartialResults = true (کم لیٹنسی کے ساتھ سٹریمنگ نتیجہ)۔
let recognizer = SFSpeechRecognizer(locale: Locale(identifier: "ru_RU"))
guard recognizer.isAvailable else { return }
let request = SFSpeechAudioBufferRecognitionRequest()
request.requiresOnDeviceRecognition = true
request.shouldReportPartialResults = true
recognitionTask = recognizer.recognitionTask(with: request) { result, error in
if let result = result {
let text = result.bestTranscription.formattedString
let isFinal = result.isFinal
DispatchQueue.main.async {
textView.text = text
}
}
}
audioEngine.inputNode.installTap(config: bufferConfig) { buffer, _ in
request.append(buffer)
}
audioEngine.prepare()
try audioEngine.start()
SFSpeechRecognizer بمقابلہ Android SpeechRecognizer: SFSpeechRecognizer میں دوبارہ شروع کیے بغیر مقامی سٹریمنگ ہے (Android کو بار بار startListening کی ضرورت ہے)۔ iOS پر آن ڈیوائس iOS 17 سے (Android پر Android 10 سے) دستیاب ہے۔ دونوں کو صارف کی اجازت درکار ہے (iOS کے لیے NSMicrophoneUsageDescription + NSSpeechRecognitionUsageDescription، Android کے لیے RECORD_AUDIO)۔ SFSpeechRecognizer انگریزی میں زیادہ درست ہے (آن ڈیوائس)، Android SpeechRecognizer روسی میں زیادہ درست ہے (کلاؤڈ)۔ iOS 17 سے پہلے آن ڈیوائس دستیاب نہیں — انٹرنیٹ درکار۔ iOS 17+ کے لیے آن ڈیوائس روسی کے لیے WER 12–14% دیتا ہے۔
Vosk Alpha Cephei کی ایک اوپن سورس ASR لائبریری ہے آف لائن تقریر کی شناخت کے لیے۔ یہ Kaldi ASR toolkit + CTC ماڈلز پر مبنی ہے۔ 20+ زبانیں سپورٹ کرتی ہے: روسی، انگریزی، جرمن، فرانسیسی، ہسپانوی، چینی، عربی۔ ماڈل 50 MB (چھوٹا — 50 MB, ru) سے 1.2 GB (بڑا — 1.2 GB, en) تک۔ Vosk Android (JNI)، iOS (C++ ریپر)، Linux، Windows، Raspberry Pi پر کام کرتا ہے۔ RTF: فلیگ شپ آلات پر 0.3–0.8۔ Vosk مکمل آف لائن ASR کے لیے بہترین انتخاب ہے۔
Vosk API: VoskWaveformModelLoader (ماڈل لوڈنگ) → VoskWaveformRecognizer (شناخت کنندہ تخلیق) → recognizer.createGrammar(list) یا recognizer.getResult() / recognizer.getPartialResult()۔ گرامر سپورٹ (مقررہ کمانڈ سیٹ) — GrammarRecogniser — RTF 0.1–0.3 دیتا ہے (3x تیز)۔ وائس ان پٹ کے لیے آزاد شناخت (getResult) استعمال کریں۔ وائس کمانڈز کے لیے — GrammarRecogniser (کمانڈز پر 99% درستگی)۔ Vosk اسپیکر کی شناخت (آواز ویکٹر تجزیہ) بھی سپورٹ کرتا ہے۔
// Vosk offline ASR
val model = VoskModel("model/vosk-model-small-ru-0.22")
model.load()
val recognizer = VoskRecognizer(model, 16000.0f)
recognizer.setWords(true)
audioRecord.startRecording()
while (isListening) {
val buffer = ByteArray(3200) // 100ms audio
audioRecord.read(buffer, 0, buffer.size)
if (recognizer.acceptWaveform(buffer)) {
val result = recognizer.result // JSON
text += JSONObject(result).getString("text")
}
}
Vosk بمقابلہ کلاؤڈ ASR: Vosk مکمل آف لائن ہے — رازداری، صفر لیٹنسی، مفت۔ کلاؤڈ (Google, Yandex) پیچیدہ منظرناموں (شور، لہجہ) میں زیادہ درست ہے — WER 3–5% کم۔ Vosk اس کے لیے مثالی ہے: انٹرنیٹ کے بغیر وائس ان پٹ، رسائی کی ایپس، کال ٹرانسکرپشن (رازداری)۔ کلاؤڈ ASR وائس اسسٹنٹ کے لیے ہے جہاں درستگی رازداری سے زیادہ اہم ہے۔ سفارش: آف لائن کے لیے Vosk، آن لائن کے لیے SFSpeechRecognizer (iOS) / SpeechRecognizer (Android) — مختلف منظرناموں کے لیے طریقوں کو یکجا کریں۔
Whisper OpenAI کا تقریر کی شناخت کا ماڈل ہے، جو 680,000 گھنٹے آڈیو (کثیر لسانی، 99 زبانیں) پر تربیت یافتہ ہے۔ سائز میں دستیاب: tiny (39M, WER 10% EN, 15% RU), small (244M, WER 6% EN, 10% RU), medium (769M, WER 4.5% EN, 8% RU)۔ Whisper Core ML (iOS, ANE) اور TFLite (Android, GPU) کے ذریعے موبائل آلات پر چلتا ہے۔ Whisper tiny: CPU پر RTF 4–10، GPU پر RTF 0.5–2 (Android)۔ Whisper small: GPU پر RTF 2–6۔ Whisper medium — RTF 8–15، صرف غیر ریئل ٹائم کے لیے۔
iOS پر Whisper (Core ML): Apple MLX Whisper — Core ML اور MLX (Apple Neural Engine) کے لیے Whisper کا نفاذ۔ iPhone 15 Pro پر Whisper tiny Core ML: RTF 0.3–0.8 (ریئل ٹائم سے تیز!)۔ Whisper small Core ML: RTF 1–3۔ Whisper Core ML A17 Pro (Neural Engine 35 TOPS) پر ANE استعمال کرتا ہے۔ Hugging Face Transformers → coremltools-whisper کے ذریعے Core ML میں برآمد۔ سٹریمنگ کے لیے WhisperStitcher (چنکنگ + سٹچنگ) استعمال کریں۔ iOS پر Whisper سب سے درست آن ڈیوائس ASR ہے (WER 6% EN, 10% RU)۔
// Whisper Core ML on iOS
import MLXWhisper
let model = try WhisperModel(from: "whisper-tiny")
let audio = try AudioUtils.loadAudio(url: audioURL)
let segments = try model.transcribe(audio: Audio, options: TranscribeOptions(
language: "ru",
wordTimestamps: true,
temperature: 0.0
))
for segment in segments {
print(segment.text) // final text with timestamps
}
Whisper بمقابلہ Vosk: Whisper زیادہ درست ہے (6% بمقابلہ 9% WER EN)، 99 زبانیں سپورٹ کرتا ہے، زبان کی شناخت، اوقاف اور جذبات کی شناخت شامل ہے۔ Whisper بھاری ہے (39M–769M بمقابلہ 50M Vosk)، ریئل ٹائم میں سست (RTF 0.5–6 بمقابلہ 0.3–0.8)۔ Whisper tiny رفتار میں Vosk کے برابر ہے (RTF 0.5–2 GPU)۔ Vosk ہلکا، تیز، سٹریمنگ ریئل ٹائم کے لیے بہتر ہے۔ Whisper ایک بار کی ٹرانسکرپشن کے لیے ہے جہاں درستگی رفتار پر ترجیح رکھتی ہے۔ Vosk ریئل ٹائم وائس ان پٹ کے لیے ہے۔ حتمی ٹیکسٹ کے لیے Whisper، انٹرایکٹو استعمال کے لیے Vosk استعمال کریں۔
وائس ٹیکسٹ ان پٹ — ASR کا سب سے وسیع استعمال: پیغامات، تلاش کے سوالات، نوٹس ڈکٹیٹ کرنا۔ ضرورت: RTF < 1 (ریئل ٹائم)، جزوی نتائج (بولتے ہوئے ٹیکسٹ دیکھنا)۔ Android Gboard اور iOS کی بورڈ میں بلٹ ان ASR ہے (آن ڈیوائس، WER 12–18%)۔ کسٹم نفاذ کے لیے Android SpeechRecognizer / SFSpeechRecognizer استعمال کریں۔ زیادہ سے زیادہ درستگی کے لیے — کلاؤڈ ASR + Vosk فال بیک۔ روسی میں 98% درستگی کے ساتھ وائس ان پٹ کے لیے — Vosk (آف لائن) + Yandex SpeechKit (آن لائن) یکجا کریں۔
کال اور میٹنگ ٹرانسکرپشن — خودکار ٹرانسکرپٹ بنانے کے لیے ASR۔ ضروریات: کوئی لیٹنسی ضرورت نہیں، WER < 10%، اسپیکر ڈائیرائزیشن (کون بول رہا ہے)۔ Whisper Small (آف لائن) + pyannote-audio (ڈائیرائزیشن) ٹرانسکرپشن کے لیے معیاری اسٹیک ہے۔ iOS پر — Whisper Core ML (RTF 1–3, WER 6–10%)۔ Android پر — Whisper TFLite (RTF 2–6, WER 8–12%) یا Google Cloud ASR + ڈائیرائزیشن۔ رازداری کے لیے (کالز سرور پر نہیں جاتیں) — ڈیوائس پر Whisper۔ ڈائیرائزیشن درستگی: 80–90% DER۔
وائس اسسٹنٹ — Siri (SFSpeechRecognizer), Google Assistant (Android SpeechRecognizer), Alexa (آن ڈیوائس ASR)۔ کسٹم اسسٹنٹ: ASR → NLU (قدرتی زبان کی سمجھ) → عمل → TTS۔ ASR پہلا مرحلہ ہے — پوری چین کی درستگی کا تعین کرتا ہے۔ NLU کے لیے RASA، Snips NLU (آن ڈیوائس) یا کلاؤڈ NLU (Dialogflow, Amazon Lex) استعمال کریں۔ TTS کے لیے: Android TTS / iOS AVSpeechSynthesizer۔ آن ڈیوائس وائس اسسٹنٹ (Vosk + RASA + TTS) مکمل طور پر نجی ہے، انٹرنیٹ کے بغیر کام کرتا ہے، فی درخواست لیٹنسی < 2 سیکنڈ۔
// Voice assistant with Android SpeechRecognizer + TTS
recognizer.setRecognitionListener(object : RecognitionListener {
override fun onResults(results: Bundle) {
val query = results.getStringArrayList(
SpeechRecognizer.RESULTS_RECOGNITION
)?.firstOrNull() ?: return
val intentResult = nluService.classify(query)
textToSpeech.speak(intentResult.response)
executeAction(intentResult.action)
}
})
موٹر معذوری والے لوگوں کے لیے رسائی — اسپیچ ریکگنیشن ایپ کو آواز سے کنٹرول کرنے کی اجازت دیتی ہے: رابطے کھولنا، پیغام بھیجنا، نمبر ڈائل کرنا۔ Android Voice Access اور iOS Switch Control + VoiceOver بلٹ ان حل ہیں۔ کسٹم نفاذ کے لیے: GrammarRecogniser (Vosk) مقررہ کمانڈ سیٹ (50–100 جملے) کے ساتھ — RTF 0.1–0.3، 99% درستگی۔ Vosk Grammar BNF فارمیٹ میں گرامر کی تعریف کرنے کی اجازت دیتا ہے۔ رسائی کے لیے رفتار اہم ہے — Vosk Grammar آزاد شناخت سے 5x تیز ہے اور کم بیٹری استعمال کرتا ہے۔
اکثر پوچھے گئے سوالات
شور دبانے کا استعمال کریں (WebRTC NS — Android میں بلٹ ان، iOS AVAudioSession)۔ غیر تقریری حصوں کو کاٹنے کے لیے VAD لگائیں۔ بیمفارمنگ (سمتی ریکارڈنگ) یا ملٹی مائکروفون اری والے مائکروفون کے ذریعے SNR بڑھائیں۔ Whisper شور کے خلاف زیادہ مزاحم ہے (شور کے ساتھ 680K گھنٹے پر تربیت یافتہ)۔ WebRTC کے ذریعے شور دبانے والا Vosk 50 dB شور پر +5% WER دیتا ہے۔ پروڈکشن کے لیے اپنی ایپلیکیشن کے شور کے حالات کے ساتھ ٹیسٹ کریں۔
ہاں، iOS 17 سے SFSpeechRecognizer آن ڈیوائس موڈ (requiresOnDeviceRecognition = true) سپورٹ کرتا ہے۔ iOS 16 اور پرانے پر آن ڈیوائس دستیاب نہیں — Siri/Gboard ASR کے لیے انٹرنیٹ درکار ہے۔ متبادل: C++ ریپر کے ذریعے Vosk (آف لائن, WER 12–15%), Whisper Core ML (آف لائن, WER 6–10%, لیٹنسی 2–6x)۔ iOS 16- پر وائس ان پٹ کے لیے Vosk استعمال کریں۔ Whisper Core ML آڈیو فائل ٹرانسکرپشن کے لیے ہے (ریئل ٹائم نہیں)۔ تمام حل مکمل طور پر نجی ہیں اور انٹرنیٹ کے بغیر کام کرتے ہیں۔
Android SpeechRecognizer RecognizerIntent.EXTRA_LANGUAGE کے ذریعے 60+ زبانیں سپورٹ کرتا ہے۔ مکمل فہرست ڈیوائس پر Locale.getAvailableLocales() سے متعین ہوتی ہے۔ روسی، انگریزی، جرمن، فرانسیسی، ہسپانوی، اطالوی ہمیشہ دستیاب ہیں۔ چینی، جاپانی، کوریائی ڈیوائس ماڈل پر منحصر ہے۔ آن ڈیوائس موڈ (Android 10+) — 20+ زبانیں۔ Vosk (20 زبانیں) اور SFSpeechRecognizer (60 زبانیں) کے برعکس، Android SpeechRecognizer Google Play Services ورژن پر منحصر ہے۔
ماڈل ایڈاپٹیشن استعمال کریں: 100+ گھنٹے ڈومین آڈیو پر Whisper فائن ٹیوننگ (Hugging Face Trainer)۔ Vosk — زبان کے ماڈل (ARPA فارمیٹ) کو ڈومین ٹیکسٹ کارپس (100K+ جملے) سے بدلیں۔ Google Cloud ASR — phrase hints (ڈومین الفاظ, DL=0/1/2)۔ SFSpeechRecognizer — contextualStrings (اشارہ سٹرنگز کی اری) کے ساتھ SFSpeechRecognitionTaskDelegate۔ ڈومین ایڈاپٹیشن مخصوص اصطلاحات کے لیے درستگی کو 15–30% WER بہتر بناتا ہے۔ کم از کم: ٹرانسکرپشن کے ساتھ 500 ڈومین آڈیو فائلیں۔
WER = (S + D + I) / N، جہاں S — تبدیلیاں، D — حذف، I — داخل، N — ریفرنس ٹیکسٹ میں الفاظ کی تعداد۔ مثال: ریفرنس = «ہیلو کیسے ہو»، پیشن گوئی = «ہیلو کیا کر رہے ہو» → S=1 (کیسے→کیا)، D=1 (حذف «ہو»؟)، I=0 → WER = 2/3 = 66%۔ حساب کے لیے jiwer لائبریری (Python) یا WER Calculator (JavaScript) استعمال کریں۔ CER حرف کی سطح پر اسی طرح ہے۔ روسی کے لیے الفاظ کی لمبائی کی وجہ سے CER WER سے 20–30% کم ہے۔
خلاصہ
ہم ایک موبائل ایپلیکیشن ٹرنکی تیار کریں گے
IT Sectr 2017 سے اسٹارٹ اپس اور کاروبار کے لیے iOS اور Android ایپلیکیشنز بناتا ہے۔ ہم آپ کو مشورہ دیں گے اور بہترین حل تجویز کریں گے۔
مزید پڑھیں