النموذج الصوتي

يُستخدم نموذج صوتي في التعرف التلقائي على الكلام لتمثيل العلاقة بين الإشارة الصوتية والوحدات الصوتية أو غيرها من الوحدات اللغوية التي تُكوّن الكلام. يُستخلص هذا النموذج من مجموعة من التسجيلات الصوتية ونصوصها المكتوبة. ويتم إنشاؤه من خلال أخذ تسجيلات صوتية للكلام، ونصوصها المكتوبة، واستخدام برامج لإنشاء تمثيلات إحصائية للأصوات التي تُكوّن كل كلمة.

خلفية

تستخدم أنظمة التعرف على الكلام الحديثة نموذجًا صوتيًا ونموذجًا لغويًا لتمثيل الخصائص الإحصائية للكلام. يُمثل النموذج الصوتي العلاقة بين الإشارة الصوتية والوحدات الصوتية في اللغة، بينما يُمثل النموذج اللغوي تسلسلات الكلمات. يُدمج هذان النموذجان للحصول على أفضل تسلسلات الكلمات التي تتوافق مع مقطع صوتي مُحدد.

تعتمد معظم أنظمة التعرف على الكلام الحديثة على معالجة الصوت في أجزاء صغيرة تُعرف بالإطارات، ويبلغ طول كل إطار منها حوالي 10 مللي ثانية. ويمكن تحويل إشارة الصوت الخام من كل إطار بتطبيق معامل ميل-تردد سيبستروم . وتُعرف معاملات هذا التحويل بمعاملات ميل-تردد سيبستروم (MFCCs)، وتُستخدم كمدخل للنموذج الصوتي إلى جانب خصائص أخرى.

أدى استخدام الشبكات العصبية الالتفافية مؤخراً إلى تحسينات كبيرة في النمذجة الصوتية. [ 1 ]

خصائص الصوت الكلامي

يمكن ترميز الصوت بمعدلات أخذ عينات مختلفة (أي عينات في الثانية - الأكثر شيوعًا هي: 8، 16، 32، 44.1، 48، و96  كيلوهرتز)، وبعدد بتات مختلف لكل عينة (الأكثر شيوعًا هي: 8 بت، 16 بت، 24 بت، أو 32 بت). تعمل محركات التعرف على الكلام بأفضل شكل إذا تم تدريب النموذج الصوتي الذي تستخدمه باستخدام صوت تم تسجيله بنفس معدل أخذ العينات/عدد البتات لكل عينة المستخدم في الكلام المراد التعرف عليه.

التعرف على الكلام عبر الهاتف

يُعدّ عرض النطاق الترددي المتاح لنقل الكلام العاملَ المُحدِّد لتقنية التعرّف على الكلام عبر الهاتف . فعلى سبيل المثال، لا يتجاوز عرض النطاق الترددي للهاتف الأرضي القياسي 64  كيلوبت/ثانية عند معدل أخذ عينات 8  كيلوهرتز و8 بتات لكل عينة (8000 عينة في الثانية × 8 بتات لكل عينة = 64000 بت/ثانية). لذا، يتطلب التعرّف على الكلام عبر الهاتف تدريب النماذج الصوتية باستخدام  ملفات صوتية بتردد 8 كيلوهرتز و8 بتات.

في حالة نقل الصوت عبر بروتوكول الإنترنت ، يحدد برنامج الترميز معدل أخذ العينات/عدد البتات لكل عينة في نقل الكلام. تتطلب برامج الترميز ذات معدل أخذ العينات/عدد البتات لكل عينة الأعلى لنقل الكلام (مما يحسن جودة الصوت) نماذج صوتية مدربة ببيانات صوتية تتوافق مع معدل أخذ العينات/عدد البتات لكل عينة.

التعرف على الكلام عبر أجهزة الكمبيوتر المكتبية

بالنسبة للتعرف على الكلام على جهاز كمبيوتر مكتبي عادي، فإن العامل المحدد هو بطاقة الصوت . تستطيع معظم بطاقات الصوت اليوم التسجيل بمعدلات أخذ عينات تتراوح بين 16 و48  كيلوهرتز للصوت، بمعدلات بت تتراوح بين 8 و16 بت لكل عينة، والتشغيل بمعدل يصل إلى 96  كيلوهرتز.

كقاعدة عامة، يعمل محرك التعرف على الكلام بشكل أفضل مع النماذج الصوتية المدربة على بيانات صوتية مسجلة بمعدلات أخذ عينات/بتات لكل عينة أعلى. لكن استخدام صوت بمعدل أخذ عينات/بتات لكل عينة مرتفع للغاية قد يبطئ محرك التعرف. لذا، لا بد من إيجاد حل وسط. وبالتالي، بالنسبة للتعرف على الكلام على أجهزة الكمبيوتر المكتبية، فإن المعيار الحالي هو النماذج الصوتية المدربة على بيانات صوتية مسجلة بمعدلات أخذ عينات تبلغ 16  كيلوهرتز/16  بت لكل عينة.

مراجع

  1. T. Sainath et al. ., "الشبكات العصبية الالتفافية لـ LVCSR"، ICASSP ، 2013.