التصنيف الزمني للاتصالي
التصنيف الزمني الترابطي ( CTC ) هو دالة خسارة وتمثيل للمخرجات يُستخدم لتدريب الشبكات العصبية على مهام تصنيف التسلسلات حيث لا تتزامن المدخلات والمخرجات زمنيًا. يمكن استخدامه في مهام مثل التعرف على الكتابة اليدوية عبر الإنترنت [ 1 ] أو التعرف على الكلام . يشير CTC إلى المخرجات والتقييم، وهو مستقل عن بنية الشبكة العصبية الأساسية. تم تقديمه في عام 2006. [ 2 ]
المدخلات عبارة عن سلسلة من الملاحظات، والمخرجات عبارة عن سلسلة من التصنيفات، والتي قد تتضمن مخرجات فارغة. تكمن صعوبة التدريب في وجود عدد أكبر بكثير من الملاحظات مقارنةً بالتصنيفات. على سبيل المثال، في الصوت الكلامي، قد توجد شرائح زمنية متعددة تتوافق مع صوت واحد. ولأننا لا نعرف مدى توافق التسلسل الملاحظ مع التصنيفات المستهدفة، فإننا نتوقع توزيعًا احتماليًا في كل خطوة زمنية. [ 3 ] تتميز شبكة CTC بمخرج مستمر (مثل دالة softmax )، والذي يتم ضبطه من خلال التدريب لنمذجة احتمالية التصنيف. لا تحاول شبكة CTC تعلم الحدود والتوقيتات: تُعتبر تسلسلات التصنيفات متكافئة إذا اختلفت فقط في التوافق، مع تجاهل الفراغات. يمكن أن تحدث تسلسلات التصنيفات المتكافئة بطرق عديدة، مما يجعل عملية التقييم مهمة معقدة، ولكن توجد خوارزمية فعالة للتقدم والتراجع لحل هذه المشكلة.
ويمكن بعد ذلك استخدام نتائج CTC مع خوارزمية الانتشار العكسي لتحديث أوزان الشبكة العصبية.
تشمل الأساليب البديلة للشبكة العصبية المجهزة بـ CTC نموذج ماركوف المخفي (HMM).
في عام 2009، كانت شبكة LSTM المدربة باستخدام تصنيف زمني اتصالي (CTC) أول شبكة عصبية متكررة تفوز بمسابقات التعرف على الأنماط عندما فازت بالعديد من المسابقات في التعرف على الكتابة اليدوية المتصلة . [ 4 ] [ 5 ]
في عام 2014، استخدمت شركة بايدو الصينية شبكة عصبية متكررة ثنائية الاتجاه (وليست شبكة LSTM) مدربة على دالة خسارة CTC لكسر معيار مجموعة بيانات التعرف على الكلام 2S09 Switchboard Hub5'00 [ 6 ] دون استخدام أي من طرق معالجة الكلام التقليدية. [ 7 ]
في عام 2015، تم استخدامه في البحث الصوتي والإملاء من جوجل على أجهزة أندرويد . [ 8 ]
يقتصر نظام CTC على المحاذاة الرتيبة، وهو ما لا يمثل مشكلة في التعرف على الصوت، ولكنه قد يمثل مشكلة في الترجمة اللغوية، حيث قد تتطابق الكلمات اللاحقة في اللغة (أ) مع الكلمات السابقة في اللغة (ب)، نظرًا لاختلاف ترتيب الكلمات بين اللغات المختلفة. [ 3 ]
مراجع
- ↑ ليويكي، ماركوس؛ غريفز، أليكس ؛ بونكه، هورست؛ شميدهوبر، يورغن (2007). "نهج جديد للتعرف على الكتابة اليدوية عبر الإنترنت قائم على شبكات الذاكرة طويلة المدى ثنائية الاتجاه". في وقائع المؤتمر الدولي التاسع لتحليل المستندات والتعرف عليها، ICDAR 2007. CiteSeerX 10.1.1.139.5852 .
- ↑ غريفز، أليكس ؛ فرنانديز، سانتياغو؛ غوميز، فاوستينو؛ شميدهوبر، يورغن (2006). "التصنيف الزمني الترابطي: تصنيف بيانات التسلسل غير المجزأة باستخدام الشبكات العصبية المتكررة". وقائع المؤتمر الدولي للتعلم الآلي، ICML 2006 : 369-376 . CiteSeerX 10.1.1.75.6306 .
- 1 2 حنون، عوني (27 نوفمبر 2017). "نمذجة التسلسل باستخدام CTC". ديستيل . 2 (11). arXiv : 1508.01211 . doi : 10.23915/distill.00008 . ISSN 2476-0757 .
- ↑ شميدهوبر، يورغن (يناير 2015). " التعلم العميق في الشبكات العصبية: نظرة عامة". الشبكات العصبية . 61 : 85-117 . arXiv : 1404.7828 . doi : 10.1016/j.neunet.2014.09.003 . PMID 25462637. S2CID 11715509 .
- ↑ غريفز، أليكس؛ شميدهوبر، يورغن (2009). "التعرف على الكتابة اليدوية دون اتصال بالإنترنت باستخدام الشبكات العصبية المتكررة متعددة الأبعاد" . في: كولر، د.؛ شورمانز، د .؛ بينجيو، ي .؛ بوتو، ل. (محررون). التطورات في أنظمة معالجة المعلومات العصبية . المجلد 21. مؤسسة أنظمة معالجة المعلومات العصبية (NIPS). الصفحات 545-552 .
- ↑ "2000 HUB5 English Evaluation Speech - Linguistic Data Consortium" . catalog.ldc.upenn.edu .
- ↑ حنون، عوني؛ كيس، كارل؛ كاسبر، جاريد. كاتانزارو، بريان؛ دياموس، جريج. إلسن، إريك؛ برينجر ، ريان. ساتيش، سانجيف؛ سينجوبتا ، شوبو (17 ديسمبر 2014). “الكلام العميق: توسيع نطاق التعرف على الكلام من البداية إلى النهاية”. أرخايف : 1412.5567 [ cs.CL ].
- ↑ ساك، هاشم؛ سينيور، أندرو؛ راو، كانيشكا؛ بوفاي، فرانسواز؛ شالكويك، يوهان (سبتمبر 2015). "البحث الصوتي من جوجل: أسرع وأكثر دقة" .
روابط خارجية
- القسم 16.4، "CTC" في كتاب معالجة الكلام واللغة لجورافسكي ومارتن ، الطبعة الثالثة
- حنون، عوني (27 نوفمبر 2017). "نمذجة التسلسل باستخدام CTC" . ديستيل . 2 (11): e8. doi : 10.23915/distill.00008 . ISSN 2476-0757 .
- الشبكات العصبية الاصطناعية
