تيميت

TIMIT عبارة عن مجموعة من النصوص المكتوبة صوتيًا ومعجميًا لمتحدثي اللغة الإنجليزية الأمريكية من مختلف الأجناس واللهجات. وقد تم تحديد كل عنصر مكتوب زمنيًا.

صُمم نظام TIMIT لتعزيز المعرفة الصوتية والنطقية وأنظمة التعرف التلقائي على الكلام. وقد تم تطويره بتكليف من وكالة مشاريع الأبحاث الدفاعية المتقدمة (DARPA) ، وكان تصميم مجموعة البيانات جهدًا مشتركًا بين معهد ماساتشوستس للتكنولوجيا ، ومعهد ستانفورد للأبحاث الدولية ( SRI International ) ، وشركة تكساس إنسترومنتس (TI). سُجل الكلام في شركة تكساس إنسترومنتس، وكُتب في معهد ماساتشوستس للتكنولوجيا، وجرى التحقق منه وإعداده للنشر من قِبل المعهد الوطني للمعايير والتكنولوجيا (NIST). [ 1 ] كما توجد نسخة منه تعمل بنطاق ترددي محدود عبر الهاتف تُسمى NTIMIT (شبكة TIMIT).

لا تتوفر مجموعتا بيانات TIMIT و NTIMIT مجانًا - إما أن تكون عضوية اتحاد البيانات اللغوية أو دفع مبلغ مالي للوصول إلى مجموعة البيانات.

بيانات

يحتوي مشروع TIMIT على ما يقارب 5 ساعات من التسجيلات الصوتية، تتضمن 10 جمل لكل متحدث من أصل 630 متحدثًا. تم اختيار الجمل عشوائيًا من مجموعة بيانات تضم 2342 جملة. كان المتحدثون من الناطقين الأصليين باللغة الإنجليزية الأمريكية، مصنفين ضمن 8 مناطق لهجية رئيسية: نيو إنجلاند، والشمالية، وشمال ميدلاند، وجنوب ميدلاند، والجنوبية، ومدينة نيويورك، والغربية، وأبناء العسكريين (الذين تنقلوا بين المناطق). كان 70% من المتحدثين ذكورًا و30% إناثًا. [ 2 ]

تم تسجيل الصوت في غرفة تسجيل معزولة صوتيًا في شركة تكساس إنسترومنتس، باستخدام نظام حاسوبي شبه آلي (ستيرويدز) للتحكم في عرض التعليمات للمتحدث والتسجيل. استُخدمت في التسجيلات ثنائية القنوات ميكروفون Sennheiser HMD 414 مثبت على سماعة الرأس، وميكروفون ضغط Brüel & Kjær 1/2 بوصة بعيد المدى (رقم 4165). تمت رقمنة الصوت بمعدل عينة 20  كيلوهرتز، ثم خُفِّض معدل العينة إلى 16  كيلوهرتز. [ 2 ]

تاريخ

كانت مجموعة بيانات TIMIT الهاتفية محاولة مبكرة لإنشاء قاعدة بيانات تحتوي على عينات صوتية. [ 3 ] نُشرت عام 1988 على قرص مضغوط ، وتتألف من 10 جمل فقط لكل متحدث. قرأ كل متحدث جملتين من اللهجة المحلية، بالإضافة إلى 8 جمل أخرى مختارة من مجموعة أكبر. [ 4 ] يبلغ متوسط ​​طول كل جملة 3 ثوانٍ، وقد نطق بها 630 متحدثًا مختلفًا. [ 5 ] كانت هذه أول محاولة بارزة في إنشاء وتوزيع مجموعة بيانات صوتية ، وقد بلغت تكلفة المشروع الإجمالية 1.5 مليون دولار أمريكي. [ 6 ]

تم إصدار تحديث في أكتوبر 1990. وقد تضمن [ 2 ]

  • مجموعة كاملة تضم 630 متحدثًا؛
  • مراجعة وتصحيح النصوص المنسوخة؛
  • نسخ الكلمات مع محاذاة الكلمات؛
  • ملفات الموجات الصوتية ذات رأس NIST SPHERE وبرامج معالجة الرؤوس؛
  • قاموس صوتي؛
  • مجموعات فرعية جديدة للاختبار والتدريب متوازنة لتغطية اللهجات والصوتيات؛
  • توثيق أكثر شمولاً.

الاسم الكامل للمشروع هو DARPA-TIMIT Acoustic-Phonetic Continuous Speech Corpus [ 7 ] ، ويرمز اختصار TIMIT إلى Texas Instruments/Massachusetts Institute of Technology. والسبب الرئيسي لإنشاء هذه المجموعة من بيانات الكلام عبر الهاتف هو تدريب برامج التعرف على الكلام . في تحدي Blizzard، كان على البرامج المختلفة تحويل التسجيلات الصوتية إلى بيانات نصية، وقد استُخدمت مجموعة بيانات TIMIT كمعيار مرجعي موحد. [ 8 ]

انظر أيضاً

مراجع

  1. فيشر، ويليام م.؛ دودينغتون، جورج ر.؛ غودي-مارشال، كاثلين م. (1986). "قاعدة بيانات داربا لأبحاث التعرف على الكلام: المواصفات والوضع الحالي". وقائع ورشة عمل داربا حول التعرف على الكلام . الصفحات 93-99 . 
  2. 1 2 3 غاروفولو، جون س.؛ لاميل، ل. ف.؛ فيشر، و. م.؛ فيسكوس، جوناثان ج.؛ باليت، د. س.؛ دالغرين، نانسي ل. (1993-02-01). "مجموعة بيانات الكلام المتواصل الصوتي-الصوتي من داربا تيميت. قرص الكلام 1-1.1 من المعهد الوطني للمعايير والتكنولوجيا" (ملف PDF) . تقرير داخلي/مشترك بين الوكالات من المعهد الوطني للمعايير والتكنولوجيا . 93 (4930): 27403. رمز Bibcode : 1993STIN...9327403G .المجال العامتتضمن هذه المقالة نصًا من هذا المصدر، وهو متاح للعموم .
  3. موراليس، نيكولاس وتيجيدور، خافيير وغاريدو، خافيير وكولاس، خوسيه وتوليدانو، دوروتيو ت (2008). "STC-TIMIT: توليد مدونة هاتفية أحادية القناة". وقائع المؤتمر الدولي السادس لموارد اللغة وتقييمها (LREC'08) : 391-395 .{{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  4. لوري ف. لاميل وروبرت هـ. كاسل وستيفاني سينيف (1986). تطوير قاعدة بيانات الكلام: تصميم وتحليل المدونة الصوتية-الفونتية (تقرير فني). داربا (SAIC-86/1546).
  5. جون س. غاروفولو ولوري ف. لاميل وويليام م. فيشر وجوناثان ج. فيسكوس وديفيد س. باليت ونانسي ل. دالغرين (1993). داربا تيميت (تقرير فني). المعهد الوطني للمعايير والتكنولوجيا. doi : 10.6028/nist.ir.4930 .
  6. ناتانون تشانتشاوتشاي وكريستوفر سييري وجافيت ديبرا وهونغوي دينغ ويوي جيانغ وسيشي لياو ومارك ليبرمان وجوناثان رايت وجياهونغ يوان وجوهونغ زان ويوقينغ زان (2018). GlobalTIMIT: مجموعات بيانات صوتية-نطقية للغات العالم . Interspeech 2018. ISCA. doi : 10.21437/interspeech.2018-1185 .
  7. باور، باتريك وشيلر، ديفيد وفينغشيدت، تيم (2010). WTIMIT: مجموعة بيانات TIMIT الصوتية المنقولة عبر شبكة الجيل الثالث AMR واسعة النطاق للهواتف المحمولة . LREC.{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  8. ساودا، كي وأساي، شياكي وهاشيموتو، كي وأورا، كييتشيرو وتوكودا، كييتشي (2016). نظام NITech لتحويل النص إلى كلام لتحدي بليزارد 2016. ورشة عمل تحدي بليزارد 2016.{{cite conference}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )