التعرف الضوئي على الأحرف

فيديو يوضح عملية المسح الضوئي والتعرف الضوئي على الأحرف (OCR) في الوقت الفعلي باستخدام ماسح ضوئي محمول

التعرف الضوئي على الأحرف ( OCR ) أو قارئ الأحرف الضوئي هو التحويل الإلكتروني أو الميكانيكي لصور النصوص المكتوبة أو المكتوبة بخط اليد أو المطبوعة إلى نص مشفر آليًا، سواء كان ذلك من مستند ممسوح ضوئيًا، أو صورة لمستند، أو صورة لمشهد (على سبيل المثال، النص الموجود على اللافتات واللوحات الإعلانية في صورة لمنظر طبيعي)، أو من نص الترجمة المصاحبة للصورة (على سبيل المثال: من بث تلفزيوني). [ 1 ]

تُستخدم تقنية التعرف الضوئي على الأحرف (OCR ) على نطاق واسع كطريقة لإدخال البيانات من السجلات الورقية المطبوعة ، سواءً كانت وثائق جوازات سفر، أو فواتير، أو كشوف حسابات بنكية ، أو إيصالات إلكترونية، أو بطاقات عمل، أو بريد، أو بيانات مطبوعة، أو أي وثائق مناسبة أخرى . وهي طريقة شائعة لرقمنة النصوص المطبوعة، مما يتيح تحريرها إلكترونيًا، والبحث فيها، وتخزينها بشكل أكثر إحكامًا، وعرضها عبر الإنترنت، واستخدامها في عمليات المعالجة الآلية مثل الحوسبة الإدراكية ، والترجمة الآلية ، وتحويل النص إلى كلام (المستخرج) ، واستخراج البيانات الرئيسية، واستخراج النصوص . وتُعدّ تقنية التعرف الضوئي على الأحرف مجالًا بحثيًا في التعرف على الأنماط ، والذكاء الاصطناعي ، ورؤية الحاسوب .  

كانت الإصدارات الأولى تتطلب تدريبًا باستخدام صور لكل حرف، وتعمل على خط واحد في كل مرة. أما الآن، فقد أصبحت الأنظمة المتقدمة القادرة على إنتاج دقة عالية لمعظم الخطوط شائعة، وتدعم مجموعة متنوعة من تنسيقات ملفات الصور . [ 2 ] بعض الأنظمة قادرة على إعادة إنتاج مخرجات منسقة تُحاكي الصفحة الأصلية بدقة، بما في ذلك الصور والأعمدة والمكونات الأخرى غير النصية.

تاريخ

يمكن إرجاع بدايات تقنية التعرف الضوئي على الأحرف إلى تقنيات التلغراف وتطوير أجهزة القراءة للمكفوفين. [ 3 ] في عام 1914، طوّر إيمانويل غولدبرغ جهازًا يقرأ الأحرف ويحولها إلى شفرة التلغراف القياسية. [ 4 ] في الوقت نفسه، طوّر إدموند فورنييه دالب جهاز "أوبتوفون" ، وهو ماسح ضوئي محمول باليد، يُصدر عند تحريكه على صفحة مطبوعة نغمات تتوافق مع أحرف أو رموز محددة. [ 5 ]

في أواخر عشرينيات وثلاثينيات القرن العشرين، طوّر إيمانويل غولدبرغ ما أسماه "الآلة الإحصائية" للبحث في أرشيفات الميكروفيلم باستخدام نظام التعرف الضوئي على الرموز. وفي عام ١٩٣١، مُنح براءة اختراع أمريكية رقم ١٨٣٨٣٨٩ لهذا الاختراع. [ ٦ ] وقد استحوذت شركة آي بي إم على براءة الاختراع . [ ٧ ]

في عام ١٩٧٤، أسس راي كورزويل شركة كورزويل لمنتجات الحاسوب، وواصل تطوير تقنية التعرف الضوئي على الأحرف متعددة الخطوط (OMNI -font OCR)، القادرة على التعرف على النصوص المطبوعة بأي خط تقريبًا. (يُنسب الفضل غالبًا إلى كورزويل في اختراع هذه التقنية، إلا أنها كانت قيد الاستخدام من قبل شركات أخرى، بما في ذلك كومبيوسكان، في أواخر الستينيات والسبعينيات. [ ٣ ] [ ٨ ] ) استخدم كورزويل هذه التقنية لإنشاء جهاز قراءة للمكفوفين، حيث يقرأ الحاسوب النصوص بصوت عالٍ. تضمن الجهاز ماسحًا ضوئيًا مسطحًا من نوع CCD وجهازًا لتحويل النص إلى كلام. في ١٣ يناير ١٩٧٦، تم الكشف عن المنتج النهائي خلال مؤتمر صحفي حظي بتغطية إعلامية واسعة، برئاسة كورزويل وقادة الاتحاد الوطني للمكفوفين . في عام ١٩٧٨، بدأت شركة كورزويل لمنتجات الحاسوب ببيع نسخة تجارية من برنامج التعرف الضوئي على الأحرف. كانت شركة ليكسيس نيكسيس من أوائل العملاء، واشترت البرنامج لتحميل المستندات القانونية والصحفية على قواعد بياناتها الإلكترونية الناشئة. بعد عامين، باع كورزويل شركته لشركة زيروكس ، التي قامت بدورها بفصلها لاحقًا تحت اسم سكان سوفت ، والتي اندمجت بدورها مع شركة نوانس كوميونيكيشنز .

في العقد الأول من الألفية الثانية، أصبحت تقنية التعرف الضوئي على الحروف (OCR) متاحة كخدمات عبر الإنترنت وعبر الحوسبة السحابية ، [ 9 ] وفي تطبيقات الهواتف المحمولة مثل الترجمة الفورية لللافتات الأجنبية على الهواتف الذكية . [ 10 ] ومع ظهور الهواتف الذكية والنظارات الذكية ، أصبح بالإمكان استخدام تقنية التعرف الضوئي على الحروف في تطبيقات الأجهزة المحمولة المتصلة بالإنترنت والتي تستخرج النصوص الملتقطة باستخدام كاميرا الجهاز. [ 11 ] [ 12 ]

التطبيقات

تم تطوير محركات التعرف الضوئي على الأحرف (OCR) لتصبح تطبيقات برمجية متخصصة في مواضيع مختلفة مثل الإيصالات والفواتير والشيكات ووثائق الفوترة القانونية.

يمكن استخدام البرنامج من أجل:

  • إدخال البيانات الخاصة بالمستندات التجارية، مثل الشيكات وجوازات السفر والفواتير وكشوف الحسابات المصرفية والإيصالات.
  • التعرف التلقائي على لوحات الأرقام
  • التعرف على جوازات السفر واستخراج المعلومات في المطارات
  • استخراج المعلومات الرئيسية تلقائيًا من وثائق التأمين [ 13 ] [ 14 ] [ 15 ]
  • التعرف على إشارات المرور [ 16 ]
  • استخراج معلومات بطاقة العمل إلى قائمة جهات الاتصال [ 17 ]
  • إنشاء نسخ نصية من المستندات المطبوعة، على سبيل المثال مسح الكتب ضوئيًا لمشروع غوتنبرغ
  • جعل الصور الإلكترونية للمستندات المطبوعة قابلة للبحث، على سبيل المثال كتب جوجل
  • تحويل الكتابة اليدوية في الوقت الفعلي للتحكم في جهاز كمبيوتر ( الحوسبة بالقلم )
  • التغلب على أنظمة CAPTCHA المضادة للبرامج الآلية أو اختبار مدى متانتها ، على الرغم من أنها مصممة خصيصًا لمنع التعرف الضوئي على الأحرف (OCR). [ 18 ] [ 19 ] [ 20 ]
  • التكنولوجيا المساعدة للمستخدمين المكفوفين وضعاف البصر
  • كتابة تعليمات المركبات من خلال تحديد صور التصميم بمساعدة الحاسوب (CAD) في قاعدة البيانات التي تتناسب مع تصميم المركبة أثناء تغيرها في الوقت الفعلي.
  • جعل المستندات الممسوحة ضوئيًا قابلة للبحث عن طريق تحويلها إلى ملفات PDF
  • ترجمة ملفات الصور التي تحتوي على نص [ 21 ] [ 22 ] [ 23 ]

تتوفر أنظمة التعرف الضوئي على الأحرف التجارية والمفتوحة المصدر المختلفة لمعظم أنظمة الكتابة الشائعة ، بما في ذلك اللاتينية والسيريلية والعربية والعبرية والهندية والبنغالية (بانغلا) وديفاناغاري والتاميلية والصينية واليابانية والكورية؛

الأنواع

تُعدّ تقنية التعرّف الضوئي على الأحرف (OCR) عمليةً غير متصلة بالإنترنت، تُحلّل مستندًا ثابتًا. وتتوفر خدمات سحابية تُقدّم خدمة واجهة برمجة تطبيقات (API) للتعرّف الضوئي على الأحرف عبر الإنترنت. يُمكن استخدام تحليل حركة الكتابة اليدوية كمدخلات للتعرّف عليها . [ 24 ] فبدلًا من الاكتفاء بأشكال الأحرف والكلمات، تستطيع هذه التقنية رصد الحركة، مثل ترتيب رسم المقاطع ، واتجاهها، ونمط وضع القلم ورفعه. تُسهم هذه المعلومات الإضافية في زيادة دقة العملية. تُعرف هذه التقنية أيضًا باسم "التعرّف على الأحرف عبر الإنترنت"، و"التعرّف على الأحرف الديناميكي"، و"التعرّف على الأحرف في الوقت الفعلي"، و"التعرّف الذكي على الأحرف".

التقنيات

المعالجة المسبقة

غالباً ما تقوم برامج التعرف الضوئي على الحروف (OCR) بمعالجة الصور مسبقاً لتحسين فرص التعرف الناجح. وتشمل التقنيات ما يلي: [ 25 ]

  • إزالة الانحراف - إذا لم تتم محاذاة المستند بشكل صحيح عند مسحه ضوئيًا، فقد يلزم إمالته بضع درجات في اتجاه عقارب الساعة أو عكس اتجاه عقارب الساعة لجعل أسطر النص أفقية أو رأسية تمامًا. 
  • إزالة الشوائب إزالة البقع الإيجابية والسلبية، وتنعيم الحواف 
  • التحويل إلى صورة ثنائية - تحويل الصورة من ملونة أو رمادية إلى صورة بالأبيض والأسود (تُسمى صورة ثنائية لوجود لونين فقط). تُنفذ هذه العملية كطريقة بسيطة لفصل النص (أو أي عنصر آخر مطلوب في الصورة) عن الخلفية. [ 26 ] يُعد التحويل إلى صورة ثنائية ضروريًا لأن معظم خوارزميات التعرف التجارية تعمل فقط على الصور الثنائية، نظرًا لسهولة ذلك. [ 27 ] بالإضافة إلى ذلك، تؤثر فعالية التحويل إلى صورة ثنائية بشكل كبير على جودة التعرف على الأحرف، ويتم اتخاذ قرارات دقيقة عند اختيار طريقة التحويل المستخدمة لنوع الصورة المدخلة؛ لأن جودة الطريقة المستخدمة للحصول على النتيجة الثنائية تعتمد على نوع الصورة (مستند ممسوح ضوئيًا، صورة نصية ، وثيقة تاريخية متدهورة، إلخ). [ 28 ] [ 29 ] 
  • إزالة الخطوط - تنظيف المربعات والخطوط غير المتعلقة بالرموز 
  • تحليل التخطيط أو تقسيم المناطق تحديد الأعمدة والفقرات والعناوين وما إلى ذلك ككتل منفصلة. وهو أمر بالغ الأهمية بشكل خاص في التخطيطات والجداول متعددة الأعمدة . 
  • الكشف عن الخطوط والكلمات - إنشاء خط أساس لأشكال الكلمات والحروف، وفصل الكلمات حسب الضرورة. 
  • التعرف على النصوص في المستندات متعددة اللغات، قد يتغير النص على مستوى الكلمات، وبالتالي، فإن تحديد النص ضروري قبل استدعاء تقنية التعرف الضوئي على الحروف (OCR) المناسبة للتعامل مع النص المحدد. [ 30 ] 
  • عزل الأحرف أو تجزئتها - بالنسبة للتعرف الضوئي على الأحرف لكل حرف، يجب فصل الأحرف المتعددة المتصلة بسبب تشوهات الصورة؛ يجب توصيل الأحرف المفردة التي تنقسم إلى أجزاء متعددة بسبب التشوهات. 
  • توحيد نسبة العرض إلى الارتفاع والمقياس [ 31 ]

يتم تقسيم الخطوط ذات المسافة الثابتة بين الأحرف بسهولة نسبية عن طريق محاذاة الصورة مع شبكة منتظمة بناءً على نقاط تقاطع خطوط الشبكة الرأسية مع المناطق السوداء بأقل قدر ممكن. أما بالنسبة للخطوط المتناسبة ، فتُستخدم تقنيات أكثر تعقيدًا لأن المسافة البيضاء بين الأحرف قد تكون أحيانًا أكبر من المسافة بين الكلمات، وقد تتقاطع الخطوط الرأسية مع أكثر من حرف واحد. [ 32 ]

التعرف على النصوص

يوجد نوعان أساسيان من خوارزميات التعرف الضوئي على الأحرف (OCR)، والتي قد تنتج قائمة مرتبة من الأحرف المرشحة. [ 33 ]

تستخدم برامج مثل Cuneiform و Tesseract أسلوبًا ثنائي المراحل للتعرف على الأحرف. تُعرف المرحلة الثانية بالتعرف التكيفي، وتعتمد على أشكال الأحرف التي تم التعرف عليها بدقة عالية في المرحلة الأولى لتحسين التعرف على الأحرف المتبقية في المرحلة الثانية. يُعد هذا مفيدًا للخطوط غير المألوفة أو عمليات المسح الضوئي منخفضة الجودة حيث يكون الخط مشوهًا (مثلًا، ضبابيًا أو باهتًا). [ 32 ]

اعتبارًا من عام 2024تتضمن برامج التعرف الضوئي على الحروف الحديثة Google Docs OCR و ABBYY FineReader وTransym، بالإضافة إلى محركات مفتوحة المصدر مثل Tesseract 5 (الذي قدم محرك تعرف قائم على LSTM) [ 37 ] وPaddleOCR (مجموعة أدوات OCR متعددة اللغات تدعم أكثر من 80 لغة) [ 38 ] وTrOCR (نموذج قائم على المحولات طورته مايكروسوفت للتعرف على النصوص المكتوبة بخط اليد والمطبوعة) [ 39 ] [ 40 ] . وتستخدم برامج أخرى مثل OCRopus وTesseract شبكات عصبية مُدرَّبة على التعرف على أسطر كاملة من النص بدلاً من التركيز على الأحرف المفردة.

تعتمد تقنية التعرف الضوئي على الأحرف التكراري (OCR) على اقتطاع المستند تلقائيًا إلى أقسام بناءً على تخطيط الصفحة. ثم يُجرى التعرف الضوئي على الأحرف على كل قسم على حدة باستخدام عتبات متغيرة لمستوى ثقة الأحرف لزيادة دقة التعرف الضوئي على الأحرف على مستوى الصفحة إلى أقصى حد. وقد مُنحت براءة اختراع لهذه الطريقة من مكتب براءات الاختراع الأمريكي. [ 41 ]

يمكن تخزين نتيجة التعرف الضوئي على الأحرف (OCR) بتنسيق ALTO القياسي، وهو مخطط XML مخصص تحتفظ به مكتبة الكونغرس الأمريكية . ومن التنسيقات الشائعة الأخرى hOCR و PAGE XML .

للاطلاع على قائمة ببرامج التعرف الضوئي على الأحرف، انظر مقارنة برامج التعرف الضوئي على الأحرف .

المعالجة اللاحقة

يمكن تحسين دقة التعرف الضوئي على الحروف (OCR) إذا تم تقييد المخرجات بمعجم - وهو قائمة بالكلمات المسموح بظهورها في المستند. [ 25 ] قد يشمل هذا، على سبيل المثال، جميع كلمات اللغة الإنجليزية، أو معجمًا تقنيًا خاصًا بمجال معين. قد تُشكل هذه التقنية مشكلة إذا احتوى المستند على كلمات غير موجودة في المعجم، مثل الأسماء العلمية . يستخدم برنامج Tesseract قاموسه للتأثير على خطوة تجزئة الأحرف، لتحسين الدقة. [ 32 ] 

قد يكون دفق الإخراج عبارة عن دفق نص عادي أو ملف من الأحرف، ولكن أنظمة التعرف الضوئي على الأحرف الأكثر تطوراً يمكنها الحفاظ على التخطيط الأصلي للصفحة وإنتاج، على سبيل المثال، ملف PDF مشروح يتضمن كلاً من الصورة الأصلية للصفحة وتمثيل نصي قابل للبحث.

يمكن لتحليل الجوار القريب الاستفادة من ترددات التواجد المشترك لتصحيح الأخطاء، وذلك بملاحظة أن كلمات معينة غالباً ما تُرى معاً. [ 42 ] على سبيل المثال، عبارة "واشنطن العاصمة" أكثر شيوعاً في اللغة الإنجليزية من عبارة "وزارة الإصلاحيات في واشنطن".

إن معرفة قواعد اللغة التي يتم فحصها يمكن أن تساعد أيضًا في تحديد ما إذا كانت الكلمة على الأرجح فعلًا أم اسمًا، على سبيل المثال، مما يسمح بدقة أكبر.

كما تم استخدام خوارزمية مسافة ليفنشتاين في المعالجة اللاحقة للتعرف الضوئي على الأحرف لتحسين النتائج من واجهة برمجة تطبيقات التعرف الضوئي على الأحرف. [ 43 ]

تحسينات خاصة بالتطبيق

في السنوات الأخيرة، بدأت كبرى شركات تكنولوجيا التعرف الضوئي على الأحرف (OCR) بتطوير أنظمة OCR لتحسين كفاءة التعامل مع أنواع محددة من المدخلات. فإلى جانب استخدام معجم خاص بالتطبيق، يمكن تحقيق أداء أفضل من خلال مراعاة قواعد العمل، والتعبيرات القياسية، أو المعلومات الغنية الموجودة في الصور الملونة. تُعرف هذه الاستراتيجية باسم "التعرف الضوئي على الأحرف الموجه للتطبيقات" أو "التعرف الضوئي على الأحرف المخصص"، وقد طُبقت على التعرف الضوئي على الأحرف للوحات ترخيص السيارات ، والفواتير ، ولقطات الشاشة ، وبطاقات الهوية ، ورخص القيادة ، وقطاع صناعة السيارات .

قامت صحيفة نيويورك تايمز بتطوير تقنية التعرف الضوئي على الحروف (OCR) لتصبح أداة خاصة بها أطلقت عليها اسم " مساعد المستندات" ، والتي تُمكّن فريق الأخبار التفاعلي من تسريع معالجة المستندات التي تحتاج إلى مراجعة. وتشير الصحيفة إلى أن هذه الأداة تُمكّنها من معالجة ما يصل إلى 5400 صفحة في الساعة، استعدادًا لمراجعة المراسلين لمحتوياتها. [ 44 ]

حلول بديلة

توجد عدة تقنيات لحل مشكلة التعرف على الأحرف بوسائل أخرى غير خوارزميات التعرف الضوئي على الأحرف المحسنة.

فرض مدخلات أفضل

تتيح الخطوط الخاصة، مثل خطوط OCR-A و OCR-B و MICR ، ذات الأحجام والمسافات والأشكال المميزة المحددة بدقة، دقةً أعلى أثناء نسخ الشيكات المصرفية. صُممت العديد من محركات التعرف الضوئي على الأحرف (OCR) البارزة لالتقاط النصوص بخطوط شائعة الاستخدام مثل Arial وTimes New Roman، وهي غير قادرة على التقاط النصوص بهذه الخطوط المتخصصة والمختلفة تمامًا عن الخطوط الشائعة الاستخدام. وبما أن برنامج Google Tesseract قابل للتدريب على التعرف على الخطوط الجديدة، فإنه يستطيع التعرف على خطوط OCR-A وOCR-B وMICR. [ 45 ]

الرموز البريدية السوفيتية

حقول التمشيط عبارة عن مربعات مطبوعة مسبقًا تُشجع على الكتابة بشكل أوضح - حرف واحد في كل مربع. [ 42 ] غالبًا ما تُطبع هذه الحقول بلون قابل للمسح ، مما يُسهل إزالته بواسطة نظام التعرف الضوئي على الحروف (OCR). [ 42 ] استُخدمت هذه التقنية في الاتحاد السوفيتي السابق، حيث كانت الرموز البريدية رقمية، وكانت هناك مربعات موحدة في أسفل جميع الأظرف، يقوم المستخدم فيها بطباعة الأرقام عن طريق توصيل النقاط. [ 46 ] 

استخدم نظام التشغيل بالم مجموعة خاصة من الرموز، تُعرف باسم "غرافيتي" ، وهي مشابهة للأحرف الإنجليزية المطبوعة ولكنها مُبسّطة أو مُعدّلة لتسهيل التعرف عليها على أجهزة النظام ذات القدرات الحاسوبية المحدودة. وكان على المستخدمين تعلّم كيفية كتابة هذه الرموز الخاصة.

يُقيّد التعرف الضوئي على الأحرف القائم على المناطق الصورة بجزء محدد من المستند. ويُشار إلى هذا النوع غالبًا باسم التعرف الضوئي على الأحرف القائم على القوالب .

التعهيد الجماعي

يُمكن الاستعانة بالبشر في عمليات التعرف على الأحرف لمعالجة الصور بسرعة، تمامًا مثل تقنية التعرف الضوئي على الأحرف (OCR) المُعتمدة على الحاسوب، ولكن بدقة أعلى من تلك التي تُحققها الحواسيب. ومن الأنظمة العملية في هذا المجال منصة Amazon Mechanical Turk و reCAPTCHA . وقد طورت المكتبة الوطنية الفنلندية واجهةً إلكترونيةً تُمكّن المستخدمين من تصحيح النصوص المُعالجة بتقنية OCR وفقًا لمعيار ALTO. [ 47 ] كما استُخدمت الاستعانة بالبشر ليس فقط للتعرف على الأحرف مباشرةً، بل لدعوة مطوري البرامج لتطوير خوارزميات معالجة الصور، على سبيل المثال، من خلال استخدام مسابقات الترتيب . [ 48 ]

دقة

تكرار كلمتي laft و last في قاعدة بيانات جوجل n-grams ، في وثائق إنجليزية من عام 1700 إلى عام 1900، استنادًا إلى عمليات مسح OCR لمجموعة "English 2009"
تكرار كلمتي laft و last في قاعدة بيانات n-grams الخاصة بجوجل ، استنادًا إلى عمليات مسح OCR لمجموعة "English 2012" [ 49 ]
يتم تحويل البحث عن الكلمات التي تحتوي على حرف S طويل في اللغة الإنجليزية 2012 أو ما بعدها إلى حرف S.

بتكليف من وزارة الطاقة الأمريكية (DOE)، كان معهد أبحاث علوم المعلومات (ISRI) مهمته تعزيز تحسين التقنيات الآلية لفهم المستندات المطبوعة آليًا، وقد أجرى الاختبار السنوي الأكثر موثوقية لدقة التعرف الضوئي على الأحرف (OCR) من عام 1992 إلى عام 1996. [ 50 ]

لا تزال دقة التعرف على النصوص المكتوبة بالخط اللاتيني غير كاملة حتى مع توفر صور واضحة. خلصت إحدى الدراسات التي اعتمدت على التعرف على صفحات صحف من القرن التاسع عشر وأوائل القرن العشرين إلى أن دقة التعرف الضوئي على الحروف (OCR) لبرامج OCR التجارية تتراوح بين 81% و99%؛ [ 51 ] ويمكن تحقيق الدقة الكاملة من خلال المراجعة البشرية أو التحقق من صحة قاموس البيانات. ولا تزال مجالات أخرى - بما في ذلك التعرف على الكتابة اليدوية، والكتابة المتصلة ، والنصوص المطبوعة بخطوط أخرى (خاصةً أحرف لغات شرق آسيا التي تتكون من عدة ضربات للحرف الواحد) - موضع بحث مكثف. وتُستخدم قاعدة بيانات MNIST بشكل شائع لاختبار قدرة الأنظمة على التعرف على الأرقام المكتوبة بخط اليد.  

يمكن قياس معدلات الدقة بعدة طرق، وتؤثر طريقة القياس بشكل كبير على معدل الدقة المُبلغ عنه. على سبيل المثال، إذا لم يُستخدم سياق الكلمة (معجم الكلمات) لتصحيح البرامج التي تعثر على كلمات غير موجودة، فقد يؤدي معدل خطأ في الأحرف بنسبة 1% (دقة 99%) إلى معدل خطأ بنسبة 5% أو أسوأ إذا اعتمد القياس على ما إذا تم التعرف على كل كلمة كاملة دون أي أحرف خاطئة. [ 52 ] يُعد استخدام مجموعة بيانات كبيرة بما يكفي أمرًا بالغ الأهمية في حلول التعرف على الكتابة اليدوية القائمة على الشبكات العصبية. من ناحية أخرى، يُعد إنتاج مجموعات بيانات طبيعية أمرًا معقدًا للغاية ويستغرق وقتًا طويلاً. [ 53 ]

من الأمثلة على الصعوبات الكامنة في رقمنة النصوص القديمة عدم قدرة تقنية التعرف الضوئي على الحروف (OCR) على التمييز بين حرفي " s" الطويل و"f". [ 54 ] [ 49 ]

تُعدّ معدلات التعرف على النصوص المكتوبة بخط اليد المتصل أقل من معدلات التعرف على النصوص المطبوعة . ومن غير المرجح تحقيق معدلات أعلى للتعرف على النصوص المتصلة بشكل عام دون استخدام معلومات سياقية أو نحوية. على سبيل المثال، يُعدّ التعرف على الكلمات الكاملة من القاموس أسهل من محاولة تحليل الأحرف الفردية من النص المتصل. تُعدّ قراءة خانة المبلغ في الشيك (والتي تكون دائمًا رقمًا مكتوبًا) مثالًا على كيفية زيادة معدلات التعرف بشكل كبير باستخدام قاموس أصغر. ببساطة، لا تحتوي أشكال الأحرف المتصلة الفردية على معلومات كافية للتعرف بدقة (أكثر من 98%) على جميع النصوص المتصلة المكتوبة بخط اليد.

تتيح معظم البرامج للمستخدمين تحديد "مستويات الثقة". وهذا يعني أنه إذا لم يحقق البرنامج مستوى الدقة المطلوب، فسيتم إخطار المستخدم لإجراء مراجعة يدوية.

يُطلق أحيانًا على الخطأ الناتج عن مسح OCR اسم " scanno" (قياسًا على مصطلح "typo" ). [ 55 ] [ 56 ]

يونيكود

تمت إضافة الأحرف التي تدعم تقنية التعرف الضوئي على الأحرف (OCR) إلى معيار Unicode في يونيو 1993، مع إصدار النسخة 1.1.

بعض هذه الأحرف يتم تعيينها من خطوط خاصة بـ MICR أو OCR-A أو OCR-B .

التعرف الضوئي على الأحرف [1] [2] مخطط رموز اتحاد يونيكود الرسمي (PDF)
 0123456789أبجدهـF
U+244x
U+245x
ملحوظات
1. ^ اعتبارًا من إصدار يونيكود 17.0
2. ^ تشير المناطق الرمادية إلى نقاط الترميز غير المخصصة

انظر أيضاً

مراجع

  1. "مستند OCR" . Haven OnDemand . مؤرشف من الأصل في 15 أبريل 2016.
  2. "تنسيقات الوسائط المدعومة" . هيفن أون ديماند . مؤرشف من الأصل في 19 أبريل 2016.
  3. 1 2 شانتز، هربرت ف. (1982). تاريخ التعرف الضوئي على الأحرف (OCR ). [مانشستر سنتر، فيرمونت]: جمعية مستخدمي تقنيات التعرف. ISBN 9780943072012.
  4. ^ دافالي ، سونيتا فيكرانت (2017). تقنيات متقدمة لكشف الرسائل غير المرغوب فيها وتصفيتها استنادًا إلى الصور . هيرشي، بنسلفانيا: IGI العالمية. ص. 91. ردمك  9781683180142.
  5. دالب، EEF (1 يوليو 1914). "حول جهاز قراءة ضوئي" . وقائع الجمعية الملكية أ: العلوم الرياضية والفيزيائية والهندسية . 90 (619): 373-375 . Bibcode : 1914RSPSA..90..373D . doi : 10.1098/rspa.1914.0061 .
  6. US1838389A ، إيمانويل غولدبيرغ، "آلة إحصائية"، صدرت في 29 ديسمبر 1931 
  7. "غرفة أخبار IBM - 28 يوليو 2009: IBM تستحوذ على SPSS Inc. لتزويد العملاء بقدرات التحليلات التنبؤية - الولايات المتحدة" . www-03.ibm.com . 28 يوليو 2009. مؤرشف من الأصل في 31 يوليو 2009. تم الاطلاع عليه في 9 يناير 2026 .
  8. "تاريخ التعرف الضوئي على الأحرف". مجلة معالجة البيانات . 12 : 46. 1970.
  9. "ما هي تقنية التعرف الضوئي على الأحرف (OCR)؟" . شركة IBM . مؤرشف من الأصل في 2 مارس 2026. تم الاطلاع عليه في 7 يوليو 2026 .
  10. "Word Lens يترجم النصوص في الوقت الفعلي" . سي بي إس نيوز . 3 يونيو 2014. تم الاطلاع عليه في 7 يوليو 2026 .
  11. "استخراج النصوص من الصور باستخدام تقنية التعرف الضوئي على الحروف (OCR) على نظام أندرويد" . 27 يونيو 2015. مؤرشف من الأصل في 15 مارس 2016.
  12. " [ شرح ] التعرف الضوئي على الحروف على نظارات جوجل" . 23 أكتوبر 2014. مؤرشف من الأصل في 5 مارس 2016.
  13. سينغ، ريتشا؛ شارما، فيكرانت؛ كاشياب، ريخا؛ مانوال، مانيكا (14 مارس 2024). "التصنيف الآلي للمستندات متعددة الصفحات واستخراج المعلومات لتطبيقات التأمين باستخدام تقنيات التعلم العميق". المؤتمر الدولي الحادي عشر لعام 2024 حول الموثوقية وتقنيات المعلومات والاتصالات والتحسين (الاتجاهات والتوجهات المستقبلية) (ICRITO) . معهد مهندسي الكهرباء والإلكترونيات. الصفحات 1-7 . رمز Bibcode : 2024icri.confQ..96S . doi : 10.1109/ICRITO61523.2024.10522111 . ISBN  979-8-3503-5035-7.
  14. دوس، ياسمين؛ بوبكر، ألفة (1 يناير 2026)، "استخلاص المعلومات الأساسية من وثائق التأمين الطبي: دراسة مقارنة بين تقنيات التعرف الضوئي على الأحرف وتقنيات أخرى لا تعتمد على هذه التقنية" ، الذكاء الاصطناعي وعلوم البيانات في الرعاية الصحية 5.0 ، دار النشر الأكاديمية، ص 145-159 ، doi : 10.1016/B978-0-443-36556-0.00013-3 ، ISBN  978-0-443-36556-0تم الاطلاع عليه بتاريخ 23 يونيو 2026
  15. أرورا، شرادها؛ باندي، مرينال؛ أرورا، مامتا؛ غوبتا، كومال؛ شارما، فينيت؛ ناغبال، لاكشاي (1 يناير 2024). "رقمنة وثائق التأمين الصحي لتسوية المطالبات إلكترونيًا باستخدام نظام إدارة وثائق ذكي" . وقائع علوم الحاسوب . المؤتمر الدولي للتعلم الآلي وهندسة البيانات (ICMLDE 2023). 235 : 1319-1331 . doi : 10.1016/j.procs.2024.04.125 . ISSN 1877-0509 . 
  16. زينغ، تشينغ-آن (2015). الاتصالات اللاسلكية والشبكات والتطبيقات: وقائع مؤتمر WCNA 2014. سبرينغر. ISBN 978-81-322-2580-5.
  17. " [ جافا سكريبت ] استخدام تقنية التعرف الضوئي على الأحرف واستخراج الكيانات للبحث عن الشركات على لينكد إن" . 22 يوليو 2014. مؤرشف من الأصل في 17 أبريل 2016.
  18. "كيفية فك رموز التحقق (CAPTCHA)" . andrewt.net. 28 يونيو 2006. تم الاطلاع عليه في 16 يونيو 2013 .
  19. "كسر نظام التحقق المرئي CAPTCHA" . Cs.sfu.ca. 10 ديسمبر 2002. تم الاطلاع عليه في 16 يونيو 2013 .
  20. ريسيج، جون (23 يناير 2009). "جون ريسيج - التعرف الضوئي على الأحرف والشبكات العصبية في جافا سكريبت" . Ejohn.org . تم الاطلاع عليه في 16 يونيو 2013 .
  21. إغنات، أوانا؛ مايلارد، جان؛ تشودري، فيشراف؛ غوزمان، فرانسيسكو (2022). "تحسين الترجمة الآلية للغات ذات الموارد المحدودة باستخدام تقنية التعرف الضوئي على الحروف" . نتائج رابطة اللغويات الحاسوبية . رابطة اللغويات الحاسوبية: 1164-1174 . doi : 10.18653/v1/2022.findings-acl.92 .
  22. راميا، ساتيابريا؛ ليونغ، تان يو؛ جايابالان، مانوج (2015). "الكشف عن الصور النصية باستخدام تقنية التعرف الضوئي على الأحرف للترجمة الإنجليزية والنطق باستخدام نظام أندرويد". مؤتمر IEEE الطلابي للبحث والتطوير (SCOReD) لعام 2015. IEEE. الصفحات 272-277 . Bibcode : 2015scor.conf...42R . doi : 10.1109/SCORED.2015.7449339 . ISBN  978-1-4673-9572-4.
  23. أفلي، هيثم؛ واي، آندي (2016). هينريش، إرهارد؛ هينريش، ماري؛ تريبل، ثورستن (محررون). "دمج التعرف الضوئي على الأحرف والترجمة الآلية للوثائق التاريخية" . وقائع ورشة عمل موارد وأدوات تكنولوجيا اللغة للعلوم الإنسانية الرقمية (LT4DH) . أوساكا، اليابان: اللجنة المنظمة لمؤتمر COLING 2016: 109-116 .
  24. تابيرت، سي سي؛ سوين، سي واي؛ واكاهارا، تي. (1990). "أحدث التقنيات في التعرف على الكتابة اليدوية عبر الإنترنت". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 12 (8): 787. Bibcode : 1990ITPAM..12..787T . doi : 10.1109/34.57669 . S2CID 42920826 . 
  25. 1 2 "التعرف الضوئي على الأحرف (OCR) - كيف يعمل" . Nicomsoft.com . تم الاطلاع عليه في 16 يونيو 2013 .
  26. سيزجين، محمد؛ سانكور، بولنت (2004). "دراسة استقصائية حول تقنيات تحديد عتبة الصور وتقييم الأداء الكمي" (ملف PDF) . مجلة التصوير الإلكتروني . 13 (1): 146. Bibcode : 2004JEI....13..146S . doi : 10.1117/1.1631315 . مؤرشف من الأصل (ملف PDF) في 16 أكتوبر 2015. تم الاطلاع عليه في 2 مايو 2015 .
  27. غوبتا، مايا ر.؛ جاكوبسون، ناثانيال ب.؛ غارسيا، إريك ك. (2007). "تحويل الصور إلى ثنائية ومعالجة الصور المسبقة للبحث في الوثائق التاريخية باستخدام تقنية التعرف الضوئي على الحروف" (ملف PDF) . التعرف على الأنماط . 40 (2): 389. رمز Bibcode : 2007PatRe..40..389G . doi : 10.1016/j.patcog.2006.04.043 . مؤرشف من الأصل (ملف PDF) في 16 أكتوبر 2015. تم الاطلاع عليه في 2 مايو 2015 .
  28. تريير، أويفيند دو؛ جاين، أنيل ك. (1995). "التقييم الموجه نحو الهدف لأساليب التحويل إلى ثنائي" (ملف PDF) . معاملات IEEE في تحليل الأنماط والذكاء الآلي . 17 (12): 1191-1201 . رمز Bibcode : 1995ITPAM..17.1191T . doi : 10.1109/34.476511 . مؤرشف (ملف PDF) من الأصل في 16 أكتوبر 2015. تم الاسترجاع في 2 مايو 2015 .
  29. ميليايف، سيرجي؛ بارينوفا، أولغا؛ نوفيكوفا، تاتيانا؛ كوهلي، بوشميت؛ ليمبيتسكي، فيكتور (2013). "تحويل الصور إلى صور ثنائية لفهم النصوص من البداية إلى النهاية في الصور الطبيعية". المؤتمر الدولي الثاني عشر لتحليل المستندات والتعرف عليها، 2013 (ملف PDF) . الصفحات 128-132 . doi : 10.1109/ICDAR.2013.33 . ISBN  978-0-7695-4999-6S2CID 8947361. مؤرشف (PDF) من الأصل بتاريخ 13 نوفمبر 2017. تم الاطلاع عليه بتاريخ 2 مايو 2015 . 
  30. باتي، ب.ب.؛ راماكريشنان، أ.ج. (29 مايو 1987). "تحديد متعدد النصوص على مستوى الكلمات". رسائل التعرف على الأنماط . 29 (9): 1218-1229 . رمز Bibcode : 2008PaReL..29.1218P . doi : 10.1016/j.patrec.2008.01.027 .
  31. "التعرف الضوئي على الأحرف الأساسي في OpenCV | داميلز" . Blog.damiles.com. 20 نوفمبر 2008. تم الاطلاع عليه في 16 يونيو 2013 .
  32. 1 2 3 سميث، راي (2007). "نظرة عامة على محرك التعرف الضوئي على الأحرف Tesseract" (ملف PDF) . مؤرشف من الأصل (ملف PDF) في 28 سبتمبر 2010. تم الاطلاع عليه في 23 مايو 2013 .
  33. "مقدمة عن تقنية التعرف الضوئي على الأحرف" . Dataid.com . تم الاطلاع عليه بتاريخ 16 يونيو 2013 .
  34. "كيف يعمل برنامج التعرف الضوئي على الحروف" . OCRWizard. مؤرشف من الأصل في 16 أغسطس 2009. تم الاطلاع عليه في 16 يونيو 2013 .
  35. هازرا، تابان كومار؛ سينغ، دهريندرا براتاب؛ داغا، نيكنج (2017). "التعرف الضوئي على الأحرف باستخدام خوارزمية أقرب جار (KNN) على مجموعة بيانات صور مخصصة". المؤتمر السنوي الثامن للأتمتة الصناعية والهندسة الكهروميكانيكية (IEMECON) لعام 2017. معهد مهندسي الكهرباء والإلكترونيات (IEEE). الصفحات 110-114 . doi : 10.1109/IEMECON.2017.8079572 . ISBN  978-1-5386-2215-5.
  36. أونغ، فيرونيكا؛ سوهارتونو، ديروين (1 مارس 2016). "استخدام خوارزمية أقرب جار في التعرف الضوئي على الأحرف" . كوم تك: تطبيقات الحاسوب والرياضيات والهندسة . 7 (1): 53. doi : 10.21512/comtech.v7i1.2223 . ISSN 2476-907X . 
  37. tesseract-ocr/tesseract ، tesseract-ocr، 27 مارس 2026 ، تم استرجاعه في 27 مارس 2026
  38. PaddlePaddle/PaddleOCR ، PaddlePaddle، 27 مارس 2026 ، تم الاطلاع عليه في 27 مارس 2026
  39. ^ لي، مينغهاو؛ الوقف، تنغشاو؛ تشن، جينغي. كوي، لي؛ لو، ييجوان؛ فلورنسيو، ديني؛ تشانغ، تشا؛ لي، تشوجون؛ فورو وي (6 سبتمبر 2022)، TrOCR: التعرف البصري على الأحرف القائم على المحولات باستخدام نماذج مدربة مسبقًا ، أرخايف : 2109.10282
  40. آصفي، مهدي (ديسمبر 2016). "التعرف الضوئي على الأحرف كخدمة: تقييم تجريبي لتقنية التعرف الضوئي على الأحرف في مستندات جوجل، وبرنامج Tesseract، وبرنامج ABBYY FineReader، وبرنامج Transym" . ResearchGate .
  41. "كيف تلتقط أفضل تقنيات التعرف الضوئي على الأحرف 99.91% من البيانات" . www.bisok.com . تاريخ الاطلاع: 27 مايو 2021 .
  42. وودفورد ، كريس ( 30 يناير 2012). "كيف تعمل تقنية التعرف الضوئي على الحروف (OCR) في مسح المستندات؟" . موقع Explain that Stuff . تاريخ الاسترجاع: 16 يونيو 2013 .
  43. "كيفية تحسين نتائج واجهة برمجة تطبيقات التعرف الضوئي على الأحرف عند استخراج النص من صورة؟ - مجتمع مطوري Haven OnDemand" . مؤرشف من الأصل بتاريخ 22 مارس 2016.
  44. فير، تيف (26 مارس 2019). "كيف تصفحنا 900 صفحة من وثائق كوهين في أقل من 10 دقائق" . صحيفة نيويورك تايمز . الرقم الدولي الموحد للدوريات 0362-4331 . تاريخ الاطلاع: 16 يونيو 2023 . 
  45. "درب مكعبك" . درب مكعبك . 20 سبتمبر 2018. تم الاطلاع عليه في 20 سبتمبر 2018 .
  46. ويلكس، يوريك (2019). الذكاء الاصطناعي: سحر حديث أم مستقبل خطير؟ لندن، إنجلترا. ص 98. ISBN  9781785-78-516-0.{{cite book}}: CS1 maint: موقع الناشر مفقود ( رابط )
  47. "ما فائدة محرر النصوص التفاعلي بتقنية التعرف الضوئي على الحروف (OCR) عبر الإنترنت؟ - Fenno-Ugrica" . 21 فبراير 2014.
  48. ريدل، سي.؛ زانيبي، ر.؛ هيرست، إم. إيه.؛ تشو، إس.؛ مينيتي، إم.؛ كروسان، ج.؛ ميتلسكي، آي.؛ لاخاني، ك. (20 فبراير 2016). "الكشف عن الأشكال وعلامات الأجزاء في براءات الاختراع: تطوير خوارزميات معالجة الصور القائمة على المنافسة". المجلة الدولية لتحليل المستندات والتعرف عليها . 19 (2): 155. arXiv : 1410.6751 . doi : 10.1007/s10032-016-0260-8 . S2CID 11873638 . 
  49. ١ ٢ " عارض Ngram من كتب جوجل" . books.google.com . تم الاطلاع عليه في ٢٠ يوليو ٢٠٢٣. عندما أنشأنا مجموعات نصوص Ngram Viewer الأصلية في عام ٢٠٠٩، لم تكن تقنية التعرف الضوئي على الحروف (OCR) لدينا جيدة بما فيه الكفاية [...]. كان هذا واضحًا بشكل خاص في اللغة الإنجليزية قبل القرن التاسع عشر، حيث كان يُفسَّر حرف s الأوسط الممدود (ſ) غالبًا على أنه f، [...]. إليكم دليل على التحسينات التي أجريناها منذ ذلك الحين، باستخدام عامل تشغيل مجموعة النصوص لمقارنة إصدارات ٢٠٠٩ و٢٠١٢ و٢٠١٩ [...]
  50. "الرمز والبيانات لتقييم دقة التعرف الضوئي على الأحرف، أصلاً من جامعة نيفادا، لاس فيغاس/معهد أبحاث نظم المعلومات" . أرشيف جوجل للرموز البرمجية.
  51. هولي، روز (أبريل 2009). "إلى أي مدى يمكن أن تصل الجودة؟ تحليل وتحسين دقة التعرف الضوئي على الحروف في برامج رقمنة الصحف التاريخية واسعة النطاق" . مجلة D-Lib . تم الاطلاع عليه في 5 يناير 2014 .
  52. سوين، سي واي؛ بلاموندون، آر؛ تابيرت، إيه؛ توماسين، إيه؛ وارد، جيه آر؛ ياماموتو، ك. (29 مايو 1987). التحديات المستقبلية في الكتابة اليدوية وتطبيقات الحاسوب . الندوة الدولية الثالثة حول الكتابة اليدوية وتطبيقات الحاسوب، مونتريال، 29 مايو 1987. تم الاطلاع عليه في 3 أكتوبر 2008 .
  53. محسني، مائدة حاجي آغا؛ عزمي، رضا؛ لايغي، كامران؛ مالكي، سجاد (2019). مقارنة بين مجموعات البيانات المُصنّعة والطبيعية في حلول الكتابة اليدوية القائمة على الشبكات العصبية . ITCT عبر Civilica.
  54. كابيداكيس، سارانتوس؛ مازوريك، سيزاري؛ ويرلا، مارسين (2015). البحث والتكنولوجيا المتقدمة للمكتبات الرقمية (ملف PDF) . سبرينغر. ص 257. doi : 10.1007/978-3-319-24592-8 . ISBN  9783319245928تمت أرشفة هذا النص من المصدر الأصلي في 3 نوفمبر 2025.
  55. أتكينسون، كريستين هـ. (2015). "إعادة ابتكار الأدبيات غير المتعلقة ببراءات الاختراع لأغراض براءات الاختراع الصيدلانية". محلل براءات الاختراع الصيدلانية . 4 (5): 371-375 . doi : 10.4155/ppa.15.21 . PMID 26389649 . 
  56. "سكانو" . الهدهد . مايو 2001.