الحوسبة الصوتية

الحوسبة الصوتية هي التخصص الذي يقوم بتطوير الأجهزة أو البرامج لمعالجة المدخلات الصوتية. [ 1 ]
ويشمل ذلك العديد من المجالات الأخرى بما في ذلك التفاعل بين الإنسان والحاسوب ، والحوسبة الحوارية ، واللغويات ، ومعالجة اللغة الطبيعية ، والتعرف التلقائي على الكلام ، وتوليف الكلام ، وهندسة الصوت ، ومعالجة الإشارات الرقمية ، والحوسبة السحابية ، وعلم البيانات ، والأخلاق ، والقانون ، وأمن المعلومات .
أصبحت الحوسبة الصوتية ذات أهمية متزايدة في العصر الحديث، خاصة مع ظهور مكبرات الصوت الذكية مثل Amazon Echo و Google Assistant ، والتحول نحو الحوسبة بدون خوادم ، وتحسين دقة التعرف على الكلام ونماذج تحويل النص إلى كلام .
تاريخ
للحوسبة الصوتية تاريخ عريق. [ 2 ] ففي البداية، شرع علماء مثل فولفغانغ كيمبلين في بناء أجهزة نطق لإنتاج أولى الأصوات الكلامية الاصطناعية. وقد أدى ذلك إلى مزيد من العمل من قبل توماس إديسون لتسجيل الصوت باستخدام أجهزة الإملاء وإعادة تشغيله في بيئات الشركات. وفي خمسينيات وستينيات القرن العشرين، كانت هناك محاولات بدائية لبناء أنظمة آلية للتعرف على الكلام من قبل مختبرات بيل وشركة آي بي إم وغيرها. ومع ذلك، لم تصبح أنظمة التعرف على الكلام ذات أهمية إلا في ثمانينيات القرن العشرين، عندما استُخدمت نماذج ماركوف المخفية للتعرف على ما يصل إلى 1000 كلمة.
| تاريخ | حدث |
|---|---|
| 1784 | ابتكر فولفغانغ فون كيمبلين آلة الكلام الصوتية الميكانيكية. |
| 1879 | توماس إديسون يخترع أول آلة إملاء . |
| 1952 | أصدرت شركة Bell Labs جهاز Audrey ، القادر على التعرف على الأرقام المنطوقة بدقة 90%. |
| 1962 | يستطيع برنامج IBM Shoebox التعرف على ما يصل إلى 16 كلمة. |
| 1971 | تم ابتكار هاربي ، التي تستطيع فهم أكثر من 1000 كلمة. |
| 1986 | يستخدم برنامج IBM Tangora نماذج ماركوف المخفية للتنبؤ بالصوتيات في الكلام. |
| 2006 | بدأت وكالة الأمن القومي أبحاثاً في مجال اكتشاف الكلمات المفتاحية أثناء المحادثات العادية. |
| 2008 | أطلقت جوجل تطبيقًا صوتيًا، مما أتاح التعرف على الكلام للأجهزة المحمولة. |
| 2011 | أطلقت آبل مساعدها الصوتي سيري على أجهزة آيفون |
| 2014 | أطلقت أمازون جهاز Amazon Echo لجعل الحوسبة الصوتية ذات صلة بالجمهور بشكل عام. |
في عام 2011 تقريبًا، ظهرت سيري على هواتف آيفون من آبل كأول مساعد صوتي متاح للمستهلكين. أدى هذا الابتكار إلى تحول جذري نحو بناء بنى حوسبة تعتمد على الصوت بشكل أساسي. أطلقت سوني جهاز بلاي ستيشن 4 في أمريكا الشمالية عام 2013 (أكثر من 70 مليون جهاز)، وأطلقت أمازون جهاز أمازون إيكو عام 2014 (أكثر من 30 مليون جهاز)، وأطلقت مايكروسوفت كورتانا (2015 - 400 مليون مستخدم لنظام ويندوز 10)، وأطلقت جوجل مساعد جوجل (2016 - مليارا مستخدم نشط شهريًا على هواتف أندرويد)، وأطلقت آبل جهاز هوم بود (2018 - بيع 500 ألف جهاز ومليار جهاز نشط بنظام iOS/سيري). هذه التحولات، إلى جانب التطورات في البنية التحتية السحابية (مثل خدمات أمازون السحابية ) وبرامج الترميز ، رسخت مجال الحوسبة الصوتية وجعلته ذا أهمية بالغة للجمهور.
الأجهزة
يتكون جهاز الكمبيوتر الصوتي من مكونات مادية وبرمجية لمعالجة المدخلات الصوتية.
تجدر الإشارة إلى أن أجهزة الكمبيوتر الصوتية لا تحتاج بالضرورة إلى شاشة، كما هو الحال في جهاز أمازون إيكو التقليدي . في تطبيقات أخرى، يمكن استخدام أجهزة الكمبيوتر المحمولة التقليدية أو الهواتف المحمولة كأجهزة كمبيوتر صوتية. علاوة على ذلك، ازداد عدد واجهات أجهزة الكمبيوتر الصوتية مع ظهور الأجهزة التي تدعم إنترنت الأشياء ، مثل تلك الموجودة في السيارات وأجهزة التلفزيون.
اعتبارًا من سبتمبر 2018، يوجد حاليًا أكثر من 20000 نوع من الأجهزة المتوافقة مع أمازون أليكسا. [ 3 ]
برمجة
يمكن لبرامج الحوسبة الصوتية قراءة/كتابة وتسجيل وتنظيف وتشفير/فك تشفير وتشغيل وتحويل ونسخ وضغط ونشر وتحديد ميزات ونمذجة وعرض ملفات الصوت.
فيما يلي بعض حزم البرامج الشائعة المتعلقة بالحوسبة الصوتية:
| اسم الحزمة | وصف |
|---|---|
| FFmpeg | لتحويل ملفات الصوت من تنسيق إلى آخر (مثل .WAV --> .MP3) . [ 4 ] |
| جرأة | لتسجيل الصوت وتصفيته. [ 5 ] |
| SoX | لمعالجة الملفات الصوتية وإزالة الضوضاء البيئية. [ 6 ] |
| مجموعة أدوات اللغة الطبيعية | [ 7 ] لعرض النصوص التي تتضمن أشياء مثل أجزاء الكلام . |
| LibROSA | لتصور مخططات الطيف الصوتي للملفات الصوتية وتحديد خصائصها. [ 8 ] |
| أوبن سمايل | لإضفاء خصائص على الملفات الصوتية باستخدام أشياء مثل معاملات سيبستروم تردد ميل. [ 9 ] |
| أبو الهول بجامعة كارنيجي ميلون | لتحويل ملفات الصوت إلى نص. [ 10 ] |
| Pyttsx3 | لتشغيل ملفات الصوت (تحويل النص إلى كلام). [ 11 ] |
| قبة كريبتودوم | لتشفير وفك تشفير الملفات الصوتية. [ 12 ] |
| أوديو فلوكس | لتحليل الصوت والموسيقى، واستخراج الميزات. [ 13 ] |
التطبيقات
تتنوع تطبيقات الحوسبة الصوتية لتشمل العديد من القطاعات، بما في ذلك المساعدين الصوتيين، والرعاية الصحية، والتجارة الإلكترونية، والتمويل، وسلاسل التوريد، والزراعة، وتحويل النص إلى كلام، والأمن، والتسويق، ودعم العملاء، والتوظيف، والحوسبة السحابية، والميكروفونات، ومكبرات الصوت، والبث الصوتي (البودكاست). ومن المتوقع أن تنمو تقنية الصوت بمعدل نمو سنوي مركب يتراوح بين 19 و25% بحلول عام 2025، مما يجعلها قطاعًا جذابًا للشركات الناشئة والمستثمرين على حد سواء. [ 14 ]
الاعتبارات القانونية
تختلف قوانين تسجيل المكالمات الهاتفية بين الولايات الأمريكية . ففي بعض الولايات، يُسمح بتسجيل المحادثة بموافقة طرف واحد فقط، بينما في ولايات أخرى يُشترط الحصول على موافقة جميع الأطراف.
علاوة على ذلك، يُعدّ قانون حماية خصوصية الأطفال على الإنترنت (COPPA) قانونًا هامًا لحماية القاصرين الذين يستخدمون الإنترنت. ومع تزايد عدد القاصرين الذين يتفاعلون مع أجهزة الحوسبة الصوتية (مثل أمازون أليكسا)، خففت لجنة التجارة الفيدرالية في 23 أكتوبر 2017 من قواعد قانون COPPA بحيث يُسمح للأطفال بإجراء عمليات بحث وأوامر صوتية. [ 15 ] [ 16 ]
أخيرًا، يُعدّ قانون حماية البيانات العامة (GDPR) قانونًا أوروبيًا جديدًا يُنظّم الحق في النسيان والعديد من البنود الأخرى لمواطني الاتحاد الأوروبي. كما يُوضّح القانون ضرورة أن تُحدّد الشركات إجراءات واضحة للحصول على الموافقة في حال تسجيل أي صوت، وأن تُحدّد الغرض من هذه التسجيلات ونطاق استخدامها، كاستخدامها لأغراض التدريب مثلاً. وقد رُفعت معايير الموافقة الصحيحة بموجب قانون حماية البيانات العامة، إذ يجب أن تكون الموافقة حرة ومحددة ومستنيرة وواضحة لا لبس فيها؛ ولم تعد الموافقة الضمنية كافية. [ 17 ]
مؤتمرات بحثية
توجد العديد من المؤتمرات البحثية المتعلقة بالحوسبة الصوتية. ومن بينها:
- المؤتمر الدولي للصوتيات والكلام ومعالجة الإشارات
- Interspeech [ 18 ]
- AVEC [ 19 ]
- المؤتمر الدولي لهندسة الكهرباء والإلكترونيات حول التعرف التلقائي على الوجه والإيماءات [ 20 ]
- ACII2019 المؤتمر الدولي الثامن حول الحوسبة العاطفية والتفاعل الذكي [ 21 ]
مجتمع المطورين
يحتوي مساعد جوجل على ما يقرب من 2000 إجراء اعتبارًا من يناير 2018. [ 22 ]
يوجد أكثر من 50000 مهارة من مهارات أليكسا حول العالم اعتبارًا من سبتمبر 2018. [ 23 ]
في يونيو 2017، أطلقت جوجل AudioSet، [ 24 ] وهي مجموعة ضخمة من مقاطع صوتية مدتها 10 ثوانٍ، مُصنّفة من قِبل بشر، مأخوذة من فيديوهات يوتيوب. تحتوي المجموعة على 1,010,480 مقطع فيديو لملفات كلام بشري، أي ما مجموعه 2,793.5 ساعة. [ 25 ] وقد تم إطلاقها كجزء من مؤتمر IEEE ICASSP 2017. [ 26 ]
في نوفمبر 2017، أطلقت مؤسسة موزيلا مشروع الصوت المشترك، وهو عبارة عن مجموعة من ملفات الصوت للمساهمة في مجتمع التعلم الآلي مفتوح المصدر الأوسع. [ 27 ] [ 28 ] يبلغ حجم بنك الصوت حاليًا 12 جيجابايت، ويحتوي على أكثر من 500 ساعة من بيانات الصوت باللغة الإنجليزية جُمعت من 112 دولة منذ انطلاق المشروع في يونيو 2017. [ 29 ] وقد أسفرت هذه المجموعة من البيانات بالفعل عن مشاريع إبداعية مثل نموذج DeepSpeech، وهو نموذج مفتوح المصدر لنسخ الصوت. [ 30 ]
انظر أيضاً
مراجع
- ↑ شووبل، ج. (2018). مقدمة في الحوسبة الصوتية باستخدام بايثون. بوسطن؛ سياتل، أتلانتا: مختبرات نيورولكس. https://neurolex.ai/voicebook
- ↑ بويد، كلارك (30 أغسطس 2019). "تقنية التعرف على الكلام: الماضي والحاضر والمستقبل" . مجلة الشركات الناشئة . تاريخ الاسترجاع: 10 يناير 2025 .
- ↑ كينسيلا، بريت (2018-09-02). "أمازون أليكسا لديها الآن 50,000 مهارة حول العالم، وتعمل مع 20,000 جهاز، وتستخدمها 3,500 علامة تجارية" . Voicebot.ai . تم الاطلاع عليه بتاريخ 2025-01-10 .
- ↑ FFmpeg. https://www.ffmpeg.org/
- ↑ أوداسيتي. https://www.audacityteam.org/
- ↑ SoX. https://sox.sourceforge.net/
- ^ نلتك. https://www.nltk.org/
- ^ ليبروسا. https://librosa.github.io/librosa/
- ↑ أوبن سمايل. https://www.audeering.com/technology/opensmile/
- ↑ "PocketSphinx هو محرك خفيف الوزن للتعرف على الكلام، مُصمم خصيصًا للأجهزة المحمولة، ولكنه يعمل بكفاءة مماثلة على أجهزة الكمبيوتر المكتبية: Cmusphinx/Pocketsphinx" . GitHub . 29 مارس 2020.
- ^ بيتسكس3. https://github.com/nateshmbhat/pyttsx3
- ↑ بايكريبتودوم. https://pycryptodome.readthedocs.io/en/latest/
- ↑ أوديو فلوكس. https://github.com/libAudioFlux/audioFlux/
- ↑ "سوق التعرف على الكلام والصوت العالمي: توقعات 2018 حتى 2025 - من المتوقع أن يبلغ معدل النمو السنوي المركب 25.7% - ResearchAndMarkets.com" . مؤرشف من الأصل بتاريخ 19 يناير 2024. تم الاطلاع عليه بتاريخ 10 يناير 2025 .
- ↑ كولدوي، ديفين (24 أكتوبر 2017). "لجنة التجارة الفيدرالية تخفف قواعد قانون حماية خصوصية الأطفال على الإنترنت (COPPA) ليتمكن الأطفال من إجراء عمليات بحث وأوامر صوتية" . تيك كرانش . تم الاطلاع عليه بتاريخ 10 يناير 2025 .
- ↑ "السجل الفيدرالي :: طلب الوصول" . 8 ديسمبر 2017.
- ^ اياب. https://iapp.org/news/a/how-do-the-rules-on-audio-recording-change-under-the-gdpr/
- ↑ مؤتمر إنترسبيتش 2018. http://interspeech2018.org/
- ↑ "الندوة الدولية الرابعة عشرة حول التحكم المتقدم بالمركبات - المتحدثون، الجلسات، جدول الأعمال" . www.eventyco.com . تاريخ الاطلاع: 10 يناير 2025 .
- ↑ 2018 FG. https://fg2018.cse.sc.edu/ مؤرشف بتاريخ 11 مايو 2018 في أرشيف الإنترنت (Wayback Machine)
- ↑ مؤتمر ASCII 2019. http://acii-conf.org/2019/
- ↑ موتشلر، آفا (24 يناير 2018). "يصل إجمالي عدد مستخدمي تطبيق مساعد جوجل إلى ما يقارب 2400 مستخدم. لكن هذا ليس العدد الحقيقي، بل هو 1719 مستخدمًا" . Voicebot.ai . تاريخ الاسترجاع: 10 يناير 2025 .
- ↑ كينسيلا، بريت (2018-09-02). "أمازون أليكسا لديها الآن 50,000 مهارة حول العالم، وتعمل مع 20,000 جهاز، وتستخدمها 3,500 علامة تجارية" . Voicebot.ai . تم الاطلاع عليه بتاريخ 2025-01-10 .
- ↑ مجموعة جوجل الصوتية. https://research.google.com/audioset/
- ↑ "مجموعة الصوت" . research.google.com . تم الاطلاع عليه بتاريخ 10 يناير 2025 .
- ↑ جيميك، جيه إف، إليس، دي بي، فريدمان، دي، جانسن، إيه، لورانس، دبليو، مور، وريتر، إم. (مارس 2017). مجموعة الصوت: أنطولوجيا ومجموعة بيانات مصنفة بشريًا للأحداث الصوتية. في المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات (ICASSP)، 2017، معهد مهندسي الكهرباء والإلكترونيات (الصفحات 776-780). معهد مهندسي الكهرباء والإلكترونيات.
- ↑ مشروع الصوت المشترك. https://voice.mozilla.org/ مؤرشف بتاريخ 27 فبراير 2020 في أرشيف الإنترنت
- ↑ "الإعلان عن الإصدار الأولي لنموذج التعرف على الكلام مفتوح المصدر ومجموعة بيانات الصوت من موزيلا | مدونة موزيلا" . blog.mozilla.org . تاريخ الاسترجاع: 10 يناير 2025 .
- ↑ سيُشكّل مستودع بيانات الصوت الضخم لدى موزيلا مستقبل التعلّم الآلي. https://opensource.com/article/18/4/common-voice
- ↑ ديب سبيتش. https://github.com/mozilla/DeepSpeech
- التعرف على الكلام
- تاريخ التفاعل بين الإنسان والحاسوب
- تقنية الصوت
- معالجة اللغة الطبيعية
- اللغويات الحاسوبية
- مجالات الدراسة الحاسوبية
