การรู้จำข้อความในแอปพลิเคชัน — คืออะไร, OCR และ Vision

ผู้แต่ง: IT Sectr เผยแพร่เมื่อ: 2026-07-18 เวลาอ่าน: 10 นาที

การรู้จำข้อความ (OCR — การรู้จำอักขระด้วยแสง) เป็นเทคโนโลยีสำหรับแยกข้อความที่พิมพ์หรือเขียนด้วยมือจากรูปภาพและสตรีมวิดีโอ ในการพัฒนามือถือ การรู้จำข้อความใช้สำหรับการแปลงเอกสารเป็นดิจิทัล การจำป้ายทะเบียน การอ่านนามบัตร และการแปลข้อความแบบเรียลไทม์ โซลูชัน OCR มือถือหลักได้แก่: ML Kit Text Recognition (Google), Vision Framework (Apple), Tesseract OCR (โอเพนซอร์ส) ตามข้อมูลของ Google ML Kit, 2025 Text Recognition V2 ประมวลผลหนึ่งเฟรมใน 10–30 มิลลิวินาที ด้วยความแม่นยำ 96% สำหรับอักษรละติน และ 91% สำหรับอักษรซีริลลิก

ประเด็นสำคัญ

  • การรู้จำข้อความ — การแยกข้อความจากรูปภาพและวิดีโอ (OCR)
  • ML Kit Text Recognition — 45+ ภาษา, ความแม่นยำ 96% (ละติน), 10–30 มิลลิวินาที
  • Apple Vision — VNRecognizeTextRequest, 13+ ภาษา, iOS ดั้งเดิม
  • Tesseract — OCR โอเพนซอร์ส, 100+ ภาษา, 50–200 มิลลิวินาที, CPU
  • เรียลไทม์ — สูงสุด 30 FPS ด้วย CameraX/AVFoundation บนอุปกรณ์สมัยใหม่

การรู้จำข้อความคืออะไร: หลักการ OCR

การรู้จำข้อความ (OCR) เป็นกระบวนการคอมพิวเตอร์วิทัศน์ที่แปลงภาพข้อความเป็นอักขระที่เครื่องอ่านได้ OCR ประกอบด้วยขั้นตอน: การประมวลผลภาพล่วงหน้า (การทำไบนารี, deskew, การแก้ไขความเอียง), การแบ่งส่วน (การแบ่งเป็นบรรทัด คำ อักขระ), การรู้จำ (การจำแนกแต่ละอักขระ) และการประมวลผลภายหลัง (การตรวจสอบพจนานุกรม การแก้ไขข้อผิดพลาด) ระบบ OCR สมัยใหม่ (ML Kit, Vision) ใช้โครงข่ายประสาทเทียมแบบครบวงจรที่รวมทุกขั้นตอน

ประเภทของ OCR: ข้อความที่พิมพ์ — การรู้จำข้อความที่พิมพ์จากเอกสาร ป้าย หน้าจอ — ความแม่นยำ 95–99%; ข้อความที่เขียนด้วยมือ — การรู้จำลายมือเขียน — ความแม่นยำ 80–90% สำหรับละติน, 70–80% สำหรับซีริลลิก; ข้อความในฉาก — ข้อความในฉากธรรมชาติ: หมายเลขบ้าน ป้ายถนน ชื่อร้านค้า — ยากที่สุดเนื่องจากการบิดเบือนเชิงเปอร์สเปคทีฟและการสะท้อนแสง

CRNN + CTC Loss — สถาปัตยกรรมที่ใช้ในโมเดล OCR สมัยใหม่ โครงข่ายประสาทแบบสังวัตนาการและเกิดซ้ำ (CNN + LSTM) แยกคุณลักษณะของภาพ ในขณะที่ Connectionist Temporal Classification ถอดรหัสลำดับอักขระโดยไม่จำเป็นต้องแบ่งส่วนล่วงหน้า CRNN ทำงานกับข้อความทุกความยาวและทนทานต่อความเอียงและการบิดเบือน ตาม arXiv (2025) โมเดล CRNN มีความแม่นยำ 97.5% บนเกณฑ์มาตรฐาน ICDAR 2019

โซลูชัน OCRความแม่นยำความเร็วภาษาแพลตฟอร์ม
ML Kit V296%10–30 มิลลิวินาที45+Android, iOS
Apple Vision95%10–40 มิลลิวินาที13+iOS, macOS
Tesseract 590%50–200 มิลลิวินาที100+ข้ามแพลตฟอร์ม
Google Cloud Vision98%500–1000 มิลลิวินาที200+เซิร์ฟเวอร์ (API)

CRNN สำหรับอุปกรณ์มือถือ — ML Kit ใช้โมเดล MobileNetV2 + CRNN กับการหาปริมาณ INT8 โมเดลมีขนาด 2–5 MB (แฝง) และทำงานบน GPU/NPU ผ่าน TFLite Delegate ต่างจาก Tesseract (ไปป์ไลน์แบบคลาสสิก) OCR แบบโครงข่ายประสาทเทียมไม่จำเป็นต้องแบ่งส่วนอักขระแยกต่างหากและทนทานต่อสัญญาณรบกวนมากกว่า ข้อเสีย: ต้องใช้ GPU หรือ NPU สำหรับเรียลไทม์ — บน CPU เพียงอย่างเดียว ความเร็วลดลงเหลือ 5–10 FPS

ML Kit Text Recognition บน Android และ iOS

ML Kit Text Recognition เป็นเครื่องมือ OCR หลักสำหรับแอปพลิเคชันมือถือ มีให้เลือกสองเวอร์ชัน: V2 (อิงละติน — ปรับให้เหมาะสมสำหรับละติน ซีริลลิก ตัวเลข) และ V1 (ละติน + CJK — ญี่ปุ่น จีน เกาหลี แต่ช้ากว่า) V2 ใช้โมเดล CRNN แบบครบวงจร V1 ใช้ CNN + LSTM ที่เก่ากว่า Google แนะนำ V2 สำหรับทุกกรณี ยกเว้นเมื่อจำเป็นต้องรู้จำ CJK

โครงสร้างผลลัพธ์ของ ML Kit: Text → TextBlock → Line → Element (Word/Symbol) แต่ละระดับมีกรอบขอบเขต ค่าความเชื่อมั่น (0..1) และข้อความที่รู้จำ Text เป็นออบเจกต์รากที่มี fullText (ข้อความที่รู้จำทั้งหมดในบรรทัดเดียว) TextBlock เป็นบล็อกข้อความเชิงตรรกะ (ย่อหน้า คอลัมน์) Line เป็นบรรทัดข้อความ Element เป็นคำหรือสัญลักษณ์ ใช้ confidence เพื่อกรองการรู้จำที่ไม่แม่นยำ

kotlin
// ML Kit Text Recognition V2
val recognizer = TextRecognition.getClient(
    TextRecognizerOptions.DEFAULT_OPTIONS
)

recognizer.process(inputImage)
    .addOnSuccessListener { text ->
        val fullText = text.text
        text.textBlocks.forEach { block ->
            val blockText = block.text
            val blockRect = block.boundingBox
            block.lines.forEach { line ->
                line.elements.forEach { element ->
                    val word = element.text
                    val confidence = element.confidence
                }
            }
        }
    }
    .addOnFailureListener { error -> /* error */ }

การรู้จำข้อความบน iOS ผ่าน ML Kit: API คล้ายกับ Android แต่ใช้ UIImage/CVPixelBuffer แทน InputImage ML Kit ใช้ Apple Neural Engine บน A12+ โดยอัตโนมัติผ่าน Core ML Delegate สำหรับ iOS ML Kit Text Recognition V2 มีความเร็ว 15–30 มิลลิวินาทีบน iPhone 15 Pro เพื่อประสิทธิภาพสูงสุด ให้แปลง UIImage เป็น CVPixelBuffer ก่อนส่ง — ซึ่งจะลดโอเวอร์เฮดการแปลง

Apple Vision Framework: VNRecognizeTextRequest

Apple Vision Framework ให้ OCR ดั้งเดิมผ่าน VNRecognizeTextRequest (iOS 13+) Vision OCR ใช้ Apple Neural Engine (ANE) และไม่ต้องใช้ SDK เพิ่มเติม รองรับ 13 ภาษา (EN, FR, IT, DE, ES, PT, ZH, JP, KO, RU, AR, TH, VI) Vision ตรวจจับภาษาของข้อความโดยอัตโนมัติ (การแก้ไขภาษา) และรองรับหลายภาษาในเฟรมเดียว ความเร็ว — 10–40 มิลลิวินาทีบน A16+

คุณสมบัติของ Vision OCR: recognitionLevel (เร็ว vs แม่นยำ), automaticLanguageDetection, customWords (เพิ่มคำศัพท์เฉพาะ), supportsTop candidates (ตัวเลือกการรู้จำหลายแบบสำหรับข้อความเบลอ) โหมดเร็วให้ความแม่นยำ 90% ที่ 10–20 มิลลิวินาที โหมดแม่นยำให้ 95% ที่ 30–50 มิลลิวินาที สำหรับการผลิต ใช้โหมดแม่นยำพร้อมกรองตาม confidence >= 0.5

swift
import Vision

let request = VNRecognizeTextRequest { request, error in
    guard let observations = request.results as? [VNRecognizedTextObservation] else { return }
    for observation in observations {
        let topCandidate = observation.topCandidates(1).first
        let text = topCandidate?.string ?? ""
        let confidence = topCandidate?.confidence ?? 0
        let boundingBox = observation.boundingBox
    }
}
request.recognitionLevel = .accurate
request.usesLanguageCorrection = true

let handler = VNImageRequestHandler(cgImage: cgImage, orientation: .up)
try handler.perform([request])

Vision vs ML Kit บน iOS: Vision เร็วกว่าบนอุปกรณ์รุ่นเก่า (iPhone X–13) เนื่องจาก ANE ในตัว ML Kit แม่นยำกว่าบนฉากที่ซับซ้อน (การบิดเบือน ความเอียง การสะท้อนแสง) เนื่องจากโมเดลของ Google ที่ฝึกฝนด้วยภาพ scene text นับล้าน Vision ไม่รองรับค่าความเชื่อมั่นสำหรับอักขระเดี่ยว (เฉพาะคำ) ซึ่งจำกัดการกรอง สำหรับเอกสาร — Vision (เร็วกว่า) สำหรับ scene text — ML Kit (แม่นยำกว่า)

Tesseract OCR: ทางเลือกโอเพนซอร์ส

Tesseract OCR เป็นเอนจินรู้จำข้อความโอเพนซอร์สที่พัฒนาโดย HP (1985–1998) และดูแลโดย Google (2006+) Tesseract 5 (อิง LSTM) ใช้สถาปัตยกรรมโครงข่ายประสาทเทียม CRNN ซึ่งให้ความแม่นยำเพิ่มขึ้นอย่างมากเมื่อเทียบกับ Tesseract 4 (คลาสสิก + LSTM) Tesseract รองรับ 100+ ภาษา รวมถึงซีริลลิก อาหรับ ฮิบรู และ CJK สำหรับ Android — tess-two (ฟอร์ก) สำหรับ iOS — swift-tesseract

ข้อเสียของ Tesseract: ความเร็ว 50–200 มิลลิวินาทีต่อเฟรม (CPU เท่านั้น ไม่มีการเร่ง GPU) ต้องการการประมวลผลภาพล่วงหน้า (การทำไบนารี deskew การตรวจจับทิศทาง) ก่อนส่งไปยังเอนจิน ไม่มีการตรวจจับข้อความในตัว — ต้องส่งขอบเขตภาพ (มักใช้ร่วมกับ OpenCV Text Detection หรือ EAST) Tesseract มีความแม่นยำ 90% สำหรับเอกสารที่สะอาด และ ~70% สำหรับ scene text

เมื่อใดควรเลือก Tesseract: หากแอปทำงานบนอุปกรณ์ที่ไม่มี Google Play (Huawei) ต้องการรองรับภาษาที่หายาก (สันสกฤต ฮิบรู) หรือต้องการปรับแต่งไปป์ไลน์ OCR อย่างสมบูรณ์ (ฝึกอบรมด้วยฟอนต์ที่กำหนดเอง) สำหรับกรณีอื่นๆ ทั้งหมด ML Kit หรือ Vision เร็วกว่า แม่นยำกว่า และต้องการโค้ดน้อยกว่า Tesseract เป็นตัวเลือกที่สมเหตุสมผลก็ต่อเมื่อมีข้อจำกัดเกี่ยวกับ SDK ของบุคคลที่สาม

kotlin
// Tesseract OCR via tess-two
val tess = TessBaseAPI()
tess.init(dataPath, "rus+eng")
tess.pageSegMode = TessBaseAPI.PageSegMode.PSM_AUTO

val bitmap = BitmapFactory.decodeResource(resources, R.drawable.text)
val gray = Bitmap.createBitmap(bitmap.width, bitmap.height, Bitmap.Config.ARGB_8888)
OpenCV.process(bitmap, gray) // การทำไบนารี + การแก้ไขความเอียง

tess.setImage(gray)
val result = tess.utF8Text
tess.recycle()

การประมวลผลล่วงหน้าสำหรับ Tesseract เป็นสิ่งจำเป็น: แปลงเป็นระดับสีเทา การทำไบนารี (Otsu หรือ Adaptive) การแก้ไขความเอียง (deskew) การลบสัญญาณรบกวน (median blur) หากไม่มีการประมวลผลล่วงหน้า ความแม่นยำของ Tesseract จะลดลงเหลือ 50–60% ใช้ OpenCV สำหรับการประมวลผลล่วงหน้า: Imgproc.cvtColor → Imgproc.threshold → Imgproc.erode/dilate → Core.rotate (deskew) สำหรับเอกสารที่มีพื้นหลังสม่ำเสมอ การทำไบนารีก็เพียงพอ สำหรับ scene text จำเป็นต้องใช้ไปป์ไลน์แบบเต็ม

การประมวลผลภาพล่วงหน้าสำหรับ OCR

คุณภาพของภาพ เป็นปัจจัยหลักสำหรับความแม่นยำของ OCR ML Kit และ Vision มีการประมวลผลล่วงหน้าในตัว แต่สำหรับกรณีที่ยาก (ภาพมืด เบลอ รับแสงมากเกินไป) การประมวลผลเพิ่มเติมช่วยเพิ่มความแม่นยำ 10–15% เทคนิคหลัก: การเพิ่มความคมชัด (CLAHE), การทำให้คมชัด (unsharp mask), การแก้ไขเปอร์สเปคทีฟ (perspective transform), การลบเงาและการสะท้อนแสง

CLAHE (การปรับสมดุลฮิสโตแกรมแบบปรับตัวแบบจำกัดคอนทราสต์) — การปรับสมดุลฮิสโตแกรมแบบปรับตัวที่ปรับปรุงคอนทราสต์ในพื้นที่เฉพาะ CLAHE มีประสิทธิภาพสำหรับภาพถ่ายเอกสารที่มีแสงไม่สม่ำเสมอ (ส่วนหนึ่งในเงา ส่วนหนึ่งสว่าง) OpenCV Core.createCLAHE ด้วย clipLimit=2.0 และ tileGridSize=(8,8) ให้ผลลัพธ์ที่ดีที่สุดสำหรับ OCR หลัง CLAHE ความแม่นยำของ ML Kit บนเอกสารมืดเพิ่มขึ้นจาก 70% เป็น 88%

การแก้ไขเปอร์สเปคทีฟ — จำเป็นสำหรับภาพถ่ายเอกสารที่ถ่ายในมุมเอียง ใช้ OpenCV findHomography + warpPerspective เพื่อจัดแนวเอกสาร สำหรับการตรวจจับขอบเอกสารอัตโนมัติ ใช้ Canny edge detection + findContours + approxPolyDP หลังจากการแก้ไขเปอร์สเปคทีฟ ความแม่นยำของ OCR เพิ่มขึ้น 20–30% สำหรับภาพที่ถ่ายในมุม >30°

kotlin
// CLAHE + การประมวลผลล่วงหน้า OpenCV
val mat = Mat()
Utils.bitmapToMat(bitmap, mat)
Imgproc.cvtColor(mat, mat, Imgproc.COLOR_RGB2GRAY)

val clahe = Imgproc.createCLAHE(2.0, Size(8.0, 8.0))
clahe.apply(mat, mat)

Imgproc.GaussianBlur(mat, mat, Size(3.0, 3.0), 0.0)
Imgproc.threshold(mat, mat, 0.0, 255.0, Imgproc.THRESH_BINARY or Imgproc.THRESH_OTSU)

val processedBitmap = Bitmap.createBitmap(mat.cols(), mat.rows(), Bitmap.Config.ARGB_8888)
Utils.matToBitmap(mat, processedBitmap)

การตรวจจับข้อความก่อน OCR — สำหรับ scene text ให้ใช้ EAST (ตัวตรวจจับข้อความในฉากที่มีประสิทธิภาพและแม่นยำ) หรือ CRAFT (การรับรู้ขอบเขตอักขระสำหรับการตรวจจับข้อความ) ก่อนส่งไปยัง OCR EAST ตรวจจับกรอบขอบเขตข้อความในฉากภายใน 5–15 มิลลิวินาที CRAFT แม่นยำกว่า (97%) แต่ช้ากว่า (50–100 มิลลิวินาที) การตรวจจับข้อความช่วยให้กรองพื้นที่ที่ไม่มีข้อความและส่งเฉพาะขอบเขตที่เกี่ยวข้องไปยัง OCR ซึ่งช่วยเร่งการประมวลผลโดยรวม

การประยุกต์ใช้ OCR ในแอปมือถือ

การสแกนเอกสาร — การประยุกต์ใช้ OCR ที่แพร่หลายที่สุด แอปสแกน (CamScanner, Adobe Scan, Google Drive) ใช้ ML Kit หรือ Vision เพื่อรู้จำข้อความจากภาพถ่ายเอกสาร ไปป์ไลน์ทั่วไป: การตรวจจับขอบเอกสาร → การแก้ไขเปอร์สเปคทีฟ → การประมวลผล CLAHE → OCR → การจัดรูปแบบ (PDF, DOCX) ML Kit Text Recognition V2 จัดการได้ใน 100–200 มิลลิวินาทีต่อหน้า A4

การแปลข้อความแบบเรียลไทม์ — การรวมกันของ OCR และการแปลด้วยเครื่อง Google Translate, Microsoft Translator, Yandex Translate ใช้ ML Kit หรือ Vision เพื่อรู้จำข้อความจากกล้องและวางซ้อนคำแปลบนข้อความต้นฉบับ (การแปล AR) ข้อกำหนด: ความหน่วง < 200 มิลลิวินาทีเพื่อ UX ที่สะดวกสบาย ML Kit V2 + NNAPI ให้ 30–80 มิลลิวินาทีต่อเฟรม โดยเหลือพื้นที่สำหรับการแปลและการเรนเดอร์

การป้อนข้อมูลอัตโนมัติ — OCR สำหรับแยกข้อมูลจากนามบัตร บัตรธนาคาร บัตรประจำตัว ML Kit รู้จำข้อความ จากนั้นการประมวลผลภายหลังจะแยกวิเคราะห์โครงสร้าง: ชื่อ โทรศัพท์ อีเมล (นามบัตร) หรือหมายเลขบัตร วันหมดอายุ CVV (บัตรชำระเงิน) สำหรับนามบัตร ให้ใช้นิพจน์ปกติหลัง OCR สำหรับบัตรธนาคาร — โมเดล ML เฉพาะทาง (เสียเงิน ~99% ความแม่นยำ)

swift
// OCR + การแปล AR (แบบง่าย)
let request = VNRecognizeTextRequest { req, _ in
    guard let results = req.results as? [VNRecognizedTextObservation] else { return }
    for observation in results {
        let text = observation.topCandidates(1).first?.string ?? ""
        let rect = observation.boundingBox
        // การแปลและการเรนเดอร์ AR บนสี่เหลี่ยม
        DispatchQueue.main.async {
            overlayView.showTranslation(text, at: rect)
        }
    }
}
request.recognitionLevel = .fast
request.usesLanguageCorrection = false

OCR สำหรับผู้ที่มีความบกพร่องทางการมองเห็น — เทคโนโลยีช่วยเหลือ: แอปอ่านข้อความจากบรรจุภัณฑ์ เมนู ป้ายออกเสียง ใช้ ML Kit OCR + Text-to-Speech (Android TTS / iOS AVSpeechSynthesizer) ข้อกำหนดหลัก — เรียลไทม์ด้วยความหน่วงต่ำ (< 100 มิลลิวินาที) Seeing AI (Microsoft) และ Envision AI ใช้แนวทางนี้ สำหรับแอปการช่วยเหลือ ให้ใช้โหมดการรู้จำเร็วและอย่ากรองตามค่าความเชื่อมั่น — ข้อความใดๆ ก็มีค่าสำหรับผู้ใช้

คำถามที่พบบ่อย

การรู้จำข้อความ (OCR) ในแอปพลิเคชันมือถือคืออะไร?

การรู้จำข้อความ (OCR) เป็นเทคโนโลยีที่ช่วยให้แอปอ่านข้อความจากรูปภาพและวิดีโอ กล้องสมาร์ทโฟนจับภาพ โครงข่ายประสาทเทียมบนอุปกรณ์รู้จำอักขระและส่งคืนข้อความที่เครื่องอ่านได้ ในแอปมือถือ OCR ใช้สำหรับการสแกนเอกสาร การแปลด้วยกล้อง การป้อนข้อมูลจากนามบัตร และการสร้างอินเทอร์เฟซที่เข้าถึงได้สำหรับผู้ที่มีความบกพร่องทางการมองเห็น

OCR ใดดีที่สุดสำหรับ Android: ML Kit หรือ Tesseract?

ML Kit Text Recognition เป็นตัวเลือกที่ดีที่สุดสำหรับ Android: ความแม่นยำ 96% ความเร็ว 10–30 มิลลิวินาที 45 ภาษา การเร่ง GPU ผ่าน NNAPI ค้นหาข้อความในทุกทิศทาง Tesseract เป็นทางเลือกโอเพนซอร์ส (ความแม่นยำ 90% 100+ ภาษา CPU) เหมาะสำหรับอุปกรณ์ที่ไม่มี Google Play หรือภาษาที่หายาก สำหรับ 95% ของโปรเจกต์ ให้เลือก ML Kit — เร็วกว่า แม่นยำกว่า และไม่ต้องการการประมวลผลภาพล่วงหน้า

จำเป็นต้องใช้อินเทอร์เน็ตสำหรับ OCR บนอุปกรณ์มือถือหรือไม่?

ไม่ ML Kit Text Recognition, Apple Vision และ Tesseract ทำงานบนอุปกรณ์ทั้งหมด ML Kit สามารถดาวน์โหลดโมเดลเมื่อเริ่มต้นครั้งแรก (โหมดดาวน์โหลด) หลังจากนั้นทำงานออฟไลน์ Apple Vision ถูกสร้างไว้ใน iOS และไม่ต้องการอินเทอร์เน็ต Tesseract ออฟไลน์อย่างสมบูรณ์ OCR บนคลาวด์ (Google Cloud Vision, AWS Textract) ทำงานผ่านอินเทอร์เน็ต แต่ไม่ได้ใช้ในแอปพลิเคชันเรียลไทม์บนมือถือ

ML Kit Text Recognition รองรับภาษาใดบ้าง?

ML Kit Text Recognition V2 รองรับ 45+ ภาษาจากกลุ่มละตินและซีริลลิก: อังกฤษ รัสเซีย เยอรมัน ฝรั่งเศส สเปน อิตาลี โปรตุเกส โปแลนด์ ยูเครน โรมาเนีย ตุรกี และอื่นๆ V1 (CJK) รองรับเพิ่มเติมจีน ญี่ปุ่น เกาหลี รายการทั้งหมด — ในเอกสารประกอบ TextRecognizerOptions สำหรับการรู้จำอาหรับหรือฮิบรู ให้ใช้ Tesseract (>100 ภาษา)

จะปรับปรุงความแม่นยำของ OCR บนภาพถ่ายเอกสารได้อย่างไร?

วิธีการหลัก: การจัดแนวเอกสาร (การแก้ไขเปอร์สเปคทีฟผ่าน OpenCV), การเพิ่มความคมชัด (CLAHE), การทำให้คมชัด (unsharp mask), แสงที่ดี (การปรับรับแสงอัตโนมัติต่อเนื่อง), การรักษาเสถียรภาพกล้อง (OIS/EIS) ML Kit จัดการการบิดเบือนพื้นฐานได้เอง แต่สำหรับเอกสารที่มีการบิดเบือนเชิงเปอร์สเปคทีฟ (>30°) การประมวลผลล่วงหน้าช่วยเพิ่มความแม่นยำ 20–30% ใช้โหมดการรู้จำเร็วสำหรับวิดีโอ

สรุป

  • การรู้จำข้อความ — OCR บนอุปกรณ์มือถือ: ข้อความพิมพ์ ลายมือ ข้อความในฉาก
  • ML Kit V2 — ความแม่นยำ 96%, 45+ ภาษา, 10–30 มิลลิวินาที, การเร่ง GPU/NPU
  • Apple Vision — OCR ดั้งเดิมของ iOS (iOS 13+), 13 ภาษา, ผ่าน ANE
  • Tesseract 5 — โอเพนซอร์ส, 100+ ภาษา, 50–200 มิลลิวินาที (CPU), ทางเลือกสำหรับ Huawei
  • การประมวลผลล่วงหน้า — CLAHE, deskew, การแก้ไขเปอร์สเปคทีฟเพิ่มความแม่นยำ 10–30%
  • เรียลไทม์ — สูงสุด 30 FPS ผ่าน CameraX/AVFoundation ด้วย ML Kit หรือ Vision
  • บนอุปกรณ์ — การคำนวณทั้งหมดในเครื่อง รับประกันความเป็นส่วนตัวของข้อมูล

เราจะพัฒนาแอปพลิเคชันบนมือถือแบบครบวงจร

IT Sectr สร้างแอปพลิเคชัน iOS และ Android สำหรับสตาร์ทอัพและธุรกิจตั้งแต่ปี 2017 เราจะให้คำแนะนำและเสนอวิธีแก้ปัญหาที่ดีที่สุดแก่คุณ

ปรึกษาโครงการ

อ่านเพิ่มเติม