الصوت التوليدي

منحنيات الصوت

يشير الصوت التوليدي إلى إنشاء ملفات صوتية من قواعد بيانات تحتوي على مقاطع صوتية . وتختلف هذه التقنية عن الأصوات المُصنّعة مثل سيري من آبل أو أليكسا من أمازون ، والتي تستخدم مجموعة من المقاطع الصوتية التي يتم تجميعها معًا عند الطلب.

تعتمد تقنية الصوت التوليدي على استخدام الشبكات العصبية لتعلم الخصائص الإحصائية لمصدر الصوت، ثم إعادة إنتاج تلك الخصائص. [ 1 ]

تداعيات

باستخدام هذه التقنية، يمكن محاكاة صوت الشخص لينطق بعبارات ربما لم ينطق بها قط. وهذا قد يؤدي إلى استخدام نسخة اصطناعية من صوت شخصية عامة ضدها. [ 2 ]

تكنولوجيا

تستخدم أنظمة الصوت التوليدية الحديثة بنىً متنوعة للتعلم العميق. ومن أبرز هذه البنى استخدام الشبكات التوليدية التنافسية (GANs)، حيث يتنافس نموذجان من نماذج التعلم الآلي لإنتاج صوت واقعي. وتشمل البنى الأخرى WaveNet ، التي تستخدم الالتفافات السببية المتوسعة لنمذجة أشكال الموجات الصوتية الخام، وتطبيقات مثل 15.ai ، التي أثبتت في عام 2020 قدرتها على استنساخ الأصوات باستخدام 15 ثانية فقط من بيانات التدريب من خلال بنى شبكات عصبية متخصصة. [ 3 ] [ 4 ]

انظر أيضاً

مراجع

  1. "الأخبار الكاذبة: لم تروا شيئاً بعد" . مجلة الإيكونوميست . يوليو 2017. تاريخ الاسترجاع: 1 يوليو 2017 .
  2. زوتكين، د.ن.؛ شما، س.أ.؛ رو، ب.؛ دورايسوامي، ر.؛ ديفيس، ل.س. (أبريل 2003). "معالجة درجة الصوت ونبرته باستخدام التمثيل القشري للصوت". وقائع المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات لعام 2003، IEEE. (ICASSP '03) . المجلد 5. الصفحات V-517-20. doi : 10.1109/ICASSP.2003.1200020 . ISBN   978-0-7803-7663-2. S2CID 10372569 . 
  3. تشاندراسيتا، ريوندي (21 يناير 2021). "إنشاء عبارات صوتية لشخصياتك المفضلة باستخدام التعلم الآلي" . نحو علم البيانات . مؤرشف من الأصل في 21 يناير 2021. تم الاطلاع عليه في 18 ديسمبر 2024 .
  4. تيميتوب، يوسف (10 ديسمبر 2024). "مبتكر 15.ai يكشف رحلته من مشروع في معهد ماساتشوستس للتكنولوجيا إلى ظاهرة على الإنترنت" . صحيفة الغارديان . لاغوس، نيجيريا. مؤرشف من الأصل في 28 ديسمبر 2024. تم الاطلاع عليه في 25 ديسمبر 2024 .