معالجة الكلام
معالجة الكلام هي دراسة إشارات الكلام وطرق معالجتها. تُعالج هذه الإشارات عادةً في تمثيل رقمي ، لذا يمكن اعتبار معالجة الكلام حالة خاصة من معالجة الإشارات الرقمية ، تُطبق على إشارات الكلام . تشمل جوانب معالجة الكلام اكتساب إشارات الكلام ومعالجتها وتخزينها ونقلها وإخراجها. تتضمن مهام معالجة الكلام المختلفة التعرف على الكلام ، وتوليف الكلام ، وتحديد هوية المتحدث ، وتحسين جودة الكلام ، والتعرف على المتحدث ، وغيرها. [ 1 ]
تاريخ
ركزت المحاولات المبكرة لمعالجة الكلام والتعرف عليه بشكل أساسي على فهم عدد قليل من العناصر الصوتية البسيطة ، مثل حروف العلة. في عام 1952، طور ثلاثة باحثين في مختبرات بيل، وهم ستيفن بالاشيك، و ر. بيدولف، و ك. هـ. ديفيس، نظامًا قادرًا على التعرف على الأرقام التي ينطقها متحدث واحد. [ 2 ] وقد نُشرت أعمال رائدة في مجال التعرف على الكلام باستخدام تحليل طيفه في أربعينيات القرن العشرين. [ 3 ]
طُرحت خوارزمية الترميز التنبؤي الخطي (LPC)، وهي خوارزمية لمعالجة الكلام، لأول مرة من قِبل فوميتادا إيتاكورا من جامعة ناغويا وشوزو سايتو من شركة نيبون للتلغراف والهاتف (NTT) في عام 1966. [ 4 ] وشهد هذا المجال تطورات إضافية في تقنية LPC على يد بيشنو س. أتال ومانفريد ر. شرودر في مختبرات بيل خلال سبعينيات القرن الماضي. [ 4 ] وشكّلت LPC الأساس لتقنية الصوت عبر بروتوكول الإنترنت (VoIP)، [ 4 ] بالإضافة إلى رقائق توليف الكلام ، مثل رقائق الكلام LPC من شركة تكساس إنسترومنتس المستخدمة في ألعاب Speak & Spell منذ عام 1978. [ 5 ]
كان برنامج Dragon Dictate، الذي طُرح عام 1990، من أوائل منتجات التعرف على الكلام المتاحة تجاريًا. وفي عام 1992، استخدمت شركة AT&T تقنية طوّرها لورانس رابينر وآخرون في مختبرات بيل ضمن خدمة معالجة المكالمات الصوتية، لتوجيه المكالمات دون تدخل بشري. وبحلول ذلك الوقت، كان مخزون هذه الأنظمة اللغوي أكبر من متوسط مخزون اللغة البشرية. [ 6 ]
بحلول أوائل العقد الأول من القرن الحادي والعشرين، بدأت استراتيجية معالجة الكلام السائدة في التحول من نماذج ماركوف المخفية إلى الشبكات العصبية الحديثة والتعلم العميق . [ 7 ]
في عام ٢٠١٢، أثبت جيفري هينتون وفريقه في جامعة تورنتو أن الشبكات العصبية العميقة تتفوق بشكل ملحوظ على الأنظمة التقليدية القائمة على نماذج ماركوف المخفية (HMM) في مهام التعرف على الكلام المتواصل ذي المفردات الكبيرة. وقد أدى هذا الإنجاز إلى انتشار واسع النطاق لتقنيات التعلم العميق في الصناعة. [ ٨ ] [ ٩ ]
بحلول منتصف العقد الثاني من القرن الحادي والعشرين، قامت شركات مثل جوجل ومايكروسوفت وأمازون وآبل بدمج أنظمة التعرف على الكلام المتقدمة في مساعديها الافتراضيين مثل مساعد جوجل وكورتانا وأليكسا وسيري . [ 10 ] استخدمت هذه الأنظمة نماذج التعلم العميق لتوفير تفاعلات صوتية أكثر طبيعية ودقة .
ساهم تطوير النماذج القائمة على المحولات، مثل نموذج BERT (تمثيلات المشفر ثنائي الاتجاه من المحولات) من جوجل ونموذج GPT (المحولات التوليدية المدربة مسبقًا) من OpenAI، في توسيع آفاق معالجة اللغة الطبيعية والتعرف على الكلام. وقد مكّنت هذه النماذج من فهم الكلام بشكل أكثر وعيًا بالسياق وأكثر ثراءً من الناحية الدلالية. [ 8 ] وفي السنوات الأخيرة، اكتسبت نماذج التعرف على الكلام الشاملة شعبية واسعة. تُبسط هذه النماذج عملية التعرف على الكلام من خلال تحويل المدخلات الصوتية مباشرةً إلى مخرجات نصية، متجاوزةً بذلك خطوات وسيطة مثل استخراج الميزات والنمذجة الصوتية. وقد ساهم هذا النهج في تبسيط عملية التطوير وتحسين الأداء. [ 11 ]
التقنيات
التواء زمني ديناميكي
تُعدّ تقنية مطابقة الوقت الديناميكية (DTW) خوارزمية لقياس التشابه بين سلسلتين زمنيتين ، قد تختلفان في السرعة. وبشكل عام، تُعتبر DTW طريقة لحساب التطابق الأمثل بين سلسلتين زمنيتين معطيتين (مثل السلاسل الزمنية) مع مراعاة قيود وقواعد محددة. ويُشار إلى التطابق الأمثل بأنه التطابق الذي يُلبي جميع القيود والقواعد، والذي يتميز بأقل تكلفة، حيث تُحسب التكلفة كمجموع الفروق المطلقة بين قيم كل زوج من المؤشرات المتطابقة.
نماذج ماركوف المخفية
يمكن تمثيل نموذج ماركوف المخفي بأبسط شبكة بايزية ديناميكية . يهدف هذا النموذج إلى تقدير متغير خفي x(t) بمعلومية قائمة من المشاهدات y(t). بتطبيق خاصية ماركوف ، فإن التوزيع الاحتمالي الشرطي للمتغير الخفي x ( t ) عند الزمن t ، بمعلومية قيم المتغير الخفي x عند جميع الأزمنة، يعتمد فقط على قيمة المتغير الخفي x ( t -1). وبالمثل، فإن قيمة المتغير المرصود y ( t ) تعتمد فقط على قيمة المتغير الخفي x ( t ) (كلاهما عند الزمن t ).
الشبكات العصبية الاصطناعية
تعتمد الشبكة العصبية الاصطناعية على مجموعة من الوحدات أو العقد المتصلة، تُسمى الخلايا العصبية الاصطناعية ، والتي تُحاكي بشكلٍ تقريبي الخلايا العصبية في الدماغ البيولوجي . كل وصلة، كالمشابك العصبية في الدماغ البيولوجي ، قادرة على نقل إشارة من خلية عصبية اصطناعية إلى أخرى. تستطيع الخلية العصبية الاصطناعية التي تستقبل إشارةً ما معالجتها، ثم إرسال إشارة إلى خلايا عصبية اصطناعية أخرى متصلة بها. في تطبيقات الشبكات العصبية الاصطناعية الشائعة، تكون الإشارة عند وصلة بين الخلايا العصبية الاصطناعية عددًا حقيقيًا ، ويتم حساب خرج كل خلية عصبية اصطناعية بواسطة دالة غير خطية لمجموع مدخلاتها.
المعالجة الواعية بالمرحلة
يُفترض غالبًا أن الطور عشوائي، ولكنه يحتوي على معلومات مفيدة. التفاف الطور: [ 12 ] يمكن إدخاله بسبب القفزات الدورية على. فك الطور (انظر، [ 13 ] الفصل 2.3؛ الطور والتردد اللحظي )، يمكن التعبير عنه على النحو التالي: [ 12 ] [ 14 ]، أينالطور الخطي ((وهو التحول الزمني في كل إطار من إطارات التحليل).يمثل مساهمة الطور من القناة الصوتية ومصدر الطور. [ 14 ] يمكن استخدام تقديرات الطور المُستخلصة لتقليل الضوضاء: التنعيم الزمني للطور اللحظي [ 15 ] ومشتقاته الزمنية ( التردد اللحظي ) والترددية ( تأخير المجموعة )، [ 16 ] وتنعيم الطور عبر التردد. [ 16 ] يمكن لمُقدِّرات السعة والطور المُدمجة استعادة الكلام بدقة أكبر بناءً على افتراض توزيع فون ميزس للطور. [ 14 ]
التطبيقات
انظر أيضاً
مراجع
- ^ شهيد الله، ماريلاند؛ باتينو، خوسيه. كورنيل، صامويل. يين، رويكينج؛ سيفاسانكاران، سونيت؛ بريدين، هيرفيه. كورشونوف، بافيل؛ بروتي، أليسيو؛ سيريزيل، رومان؛ فنسنت، إيمانويل؛ إيفانز، نيكولاس. مارسيل، سيباستيان. سكوارتيني، ستيفانو؛ باراس ، كلود (2019/11/06). “التقديم السريع إلى ديهارد الثاني: المساهمات والدروس المستفادة”. أرخايف : 1911.02388 [ eess.AS ].
- ↑ جوانغ، ب.-هـ.؛ رابينر، ل. ر. (2006)، "التعرف على الكلام، التلقائي: التاريخ"، موسوعة اللغة واللسانيات ، إلسيفير، ص 806-819 ، doi : 10.1016/b0-08-044854-2/00906-8 ، ISBN 9780080448541
- ↑ مياسنيكوف، ل. ل.؛ مياسنيكوفا، ي. ن. (1970). التعرف التلقائي على نمط الصوت (باللغة الروسية). لينينغراد: إنيرجيا.
- 1 2 3 غراي، روبرت م. (2010). "تاريخ الكلام الرقمي في الوقت الحقيقي على شبكات الحزم: الجزء الثاني من الترميز التنبؤي الخطي وبروتوكول الإنترنت" (ملف PDF) . أسس واتجاهات معالجة الإشارات . 3 (4): 203-303 . doi : 10.1561/2000000036 . ISSN 1932-8346 .
- ↑ "VC&G - مقابلة VC&G: بعد 30 عامًا، يتحدث ريتشارد ويغينز عن تطوير Speak & Spell" .
- ↑ هوانغ، شويدونغ؛ بيكر، جيمس؛ ريدي، راج (1 يناير 2014). "منظور تاريخي للتعرف على الكلام". مجلة اتصالات رابطة آلات الحوسبة . 57 (1): 94-103 . doi : 10.1145/2500887 . ISSN 0001-0782 . S2CID 6175701 .
- ↑ فوروي، ساداوكي (2005). "خمسون عامًا من التقدم في أبحاث التعرف على الكلام والمتحدث" . مجلة ECTI للمعاملات في تكنولوجيا الحاسوب والمعلومات . 1 (2): 64-74 . doi : 10.37936/ecti-cit.200512.51834 . ISSN 2286-9131 .
- 1 2 "الشبكات العصبية العميقة للنمذجة الصوتية في التعرف على الكلام" (ملف PDF) . 2019-07-23 . تم الاطلاع عليه بتاريخ 2024-11-05 .
- ↑ "التعرف على الكلام باستخدام الشبكات العصبية المتكررة العميقة" (ملف PDF) . 23-07-2019 . تاريخ الاسترجاع: 05-11-2024 .
- ↑ هوي، ماثيو ب. (2018). "أليكسا، سيري، كورتانا، وغيرها: مقدمة عن المساعدين الصوتيين". مجلة الخدمات المرجعية الطبية الفصلية . 37 (1): 81-88 . doi : 10.1080/02763869.2018.1404391 . ISSN 1540-9597 . PMID 29327988 .
- ↑ هاجيوارا، ماساتو (21-12-2021). معالجة اللغة الطبيعية في العالم الحقيقي: تطبيقات عملية مع التعلم العميق . سايمون وشوستر. ISBN 978-1-63835-039-2.
- مولاي ، بيجمان؛ كولمر ، جوزيف (أغسطس 2015). "تقدير الطور في تحسين الكلام أحادي القناة: الحدود - الإمكانات". معاملات IEEE/ACM في معالجة الصوت والكلام واللغة . 23 (8): 1283-1294 . Bibcode : 2015ITASL..23.1283M . doi : 10.1109/TASLP.2015.2430820 . ISSN 2329-9290 . S2CID 13058142 .
- ↑ مولاي، بيجمان؛ كولمر، جوزيف؛ ستال، يوهانس؛ ماير، فلوريان (2017). معالجة الإشارات أحادية القناة الواعية بالطور في الاتصالات الكلامية: النظرية والتطبيق . تشيتشستر: وايلي. ISBN 978-1-119-23882-9.
- 1 2 3 كولمر، جوزيف؛ مولاي، بيجمان (أبريل 2015). "تقدير الطور التوافقي في تحسين الكلام أحادي القناة باستخدام توزيع فون ميزس ونسبة الإشارة إلى الضوضاء المسبقة". المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات (ICASSP)، 2015. IEEE. الصفحات 5063-5067 .
- ↑ كولمر، جوزيف؛ مولاي، بيجمان (مايو 2015). "تقدير الطور في تحسين الكلام أحادي القناة باستخدام تحليل الطور". رسائل معالجة الإشارات IEEE . 22 (5): 598-602 . Bibcode : 2015ISPL...22..598K . doi : 10.1109/LSP.2014.2365040 . ISSN 1070-9908 . S2CID 15503015 .
- مولاي ، بيجمان؛ سعيدي، رحيم؛ ستيليانو، يانيس (يوليو 2016). "تطورات في معالجة الإشارات الواعية بالطور في الاتصالات الكلامية" . الاتصالات الكلامية . 81 : 1-29 . doi : 10.1016/j.specom.2016.04.002 . ISSN 0167-6393 . S2CID 17409161. تاريخ الاسترجاع: 3 ديسمبر 2017 .
- معالجة الكلام
- خطاب
- معالجة الإشارات
