ترميز الكلام
ترميز الكلام هو تطبيق لضغط البيانات على الإشارات الصوتية الرقمية التي تحتوي على كلام . يستخدم ترميز الكلام تقدير المعلمات الخاصة بالكلام باستخدام تقنيات معالجة الإشارات الصوتية لنمذجة إشارة الكلام، بالإضافة إلى خوارزميات ضغط البيانات العامة لتمثيل المعلمات الناتجة في دفق بتات مضغوط. [ 1 ]
من التطبيقات الشائعة لترميز الكلام الاتصالات الهاتفية المتنقلة وتقنية الصوت عبر بروتوكول الإنترنت (VoIP). [ 2 ] تُعد تقنية الترميز التنبؤي الخطي (LPC) أكثر تقنيات ترميز الكلام استخدامًا في الاتصالات الهاتفية المتنقلة ، بينما تُعد تقنيتا الترميز التنبؤي الخطي (LPC) وتحويل جيب التمام المنفصل المعدل (MDCT) الأكثر استخدامًا في تطبيقات VoIP .
تتشابه التقنيات المستخدمة في ترميز الكلام مع تلك المستخدمة في ضغط البيانات الصوتية وترميز الصوت ، حيث يُستعان بفهم علم النفس الصوتي لنقل البيانات ذات الصلة بالجهاز السمعي البشري فقط. فعلى سبيل المثال، في ترميز الكلام بنطاق التردد الصوتي ، تُنقل المعلومات الموجودة في نطاق التردد من 400 إلى 3500 هرتز فقط، ولكن الإشارة المُعاد بناؤها تحتفظ بفهم كافٍ .
يختلف ترميز الكلام عن أشكال ترميز الصوت الأخرى في أن الكلام إشارة أبسط من الإشارات الصوتية الأخرى، وتتوفر معلومات إحصائية حول خصائصه. ونتيجةً لذلك، قد تكون بعض المعلومات السمعية ذات الصلة في ترميز الصوت العام غير ضرورية في سياق ترميز الكلام. يركز ترميز الكلام على الحفاظ على وضوح الكلام وجاذبيته مع استخدام كمية محدودة من البيانات المرسلة. [ 3 ] إضافةً إلى ذلك، تتطلب معظم تطبيقات الكلام تأخيرًا منخفضًا في الترميز، لأن زمن الاستجابة يؤثر سلبًا على التفاعل الكلامي. [ 4 ]
فئات
تنقسم برامج ترميز الكلام إلى فئتين: [ 5 ]
- مشفرات الموجات
- المجال الزمني: PCM ، ADPCM
- مجال التردد: ترميز النطاق الفرعي ، ATRAC
- مشفرات الصوت
يُنظر إلى ضغط العينات على أنه شكل من أشكال ترميز الكلام
يمكن اعتبار خوارزميتي قانون A وقانون μ المستخدمتين في نظام الاتصالات الرقمية G.711 PCM بمثابة مقدمة مبكرة لترميز الكلام، حيث تتطلبان 8 بتات فقط لكل عينة، لكنهما توفران دقة تصل فعليًا إلى 12 بتًا . [ 7 ] يتوافق الضغط اللوغاريتمي مع الإدراك السمعي البشري، إذ يُسمع ضجيج منخفض السعة بالتزامن مع إشارة كلام منخفضة السعة، ولكنه يُحجب بضجيج عالي السعة. على الرغم من أن هذا قد يُحدث تشويهًا غير مقبول في الإشارة الموسيقية، إلا أن الطبيعة الحادة لموجات الكلام، بالإضافة إلى بنية التردد البسيطة للكلام كموجة دورية ذات تردد أساسي واحد مع نبضات ضجيج إضافية بين الحين والآخر، تجعل خوارزميات الضغط الفوري البسيطة هذه مقبولة للكلام.
جُرِّبت مجموعة واسعة من الخوارزميات الأخرى في ذلك الوقت، معظمها من متغيرات تعديل دلتا ، ولكن بعد دراسة متأنية، اختار مصممو أنظمة الهاتف الرقمي المبكرة خوارزميتي A-law/μ-law. في ذلك الوقت، شكّل خفض عرض النطاق الترددي بنسبة 33% مع تعقيد منخفض للغاية حلاً هندسياً ممتازاً. ولا يزال أداؤها الصوتي مقبولاً، ولم تكن هناك حاجة لاستبدالها في شبكة الهاتف الثابتة.
في عام 2008، تم توحيد معيار برنامج الترميز G.711.1 ، الذي يتميز ببنية قابلة للتوسع، من قبل الاتحاد الدولي للاتصالات (ITU-T). معدل أخذ العينات المدخلة هو 16 كيلو هرتز. [ 8 ]
ضغط الكلام الحديث
استُلهمت معظم الجهود اللاحقة في مجال ضغط الكلام من الأبحاث العسكرية في مجال الاتصالات الرقمية لأجهزة الراديو العسكرية الآمنة ، حيث استُخدمت معدلات بيانات منخفضة للغاية لتحقيق التشغيل الفعال في بيئة لاسلكية معادية. في الوقت نفسه، توفرت قدرة معالجة أكبر بكثير ، في شكل دوائر VLSI ، مقارنةً بما كان متاحًا لتقنيات الضغط السابقة. ونتيجةً لذلك، استطاعت خوارزميات ضغط الكلام الحديثة استخدام تقنيات أكثر تعقيدًا بكثير مما كان متاحًا في ستينيات القرن الماضي لتحقيق نسب ضغط أعلى بكثير.
تعتمد خوارزميات ترميز الكلام الأكثر استخدامًا على الترميز التنبؤي الخطي (LPC). [ 9 ] وعلى وجه الخصوص، يُعدّ ترميز التنبؤ الخطي المُثار بالترميز (CELP) القائم على LPC ، والذي يُستخدم على سبيل المثال في معيار GSM ، أكثر أنظمة ترميز الكلام شيوعًا . في CELP، تُقسّم عملية النمذجة إلى مرحلتين: مرحلة تنبؤ خطي تُنمذج الغلاف الطيفي، ومرحلة أخرى تعتمد على دفتر الترميز لنمذجة الباقي من نموذج التنبؤ الخطي. في CELP، تُحسب معاملات التنبؤ الخطي (LPC) وتُكمّم، عادةً على شكل أزواج طيفية خطية (LSPs). بالإضافة إلى ترميز الكلام الفعلي للإشارة، غالبًا ما يكون من الضروري استخدام ترميز القناة للإرسال، لتجنب الفقد الناتج عن أخطاء الإرسال. وللحصول على أفضل نتائج ترميز شاملة، تُختار طرق ترميز الكلام وترميز القناة في أزواج، مع حماية البتات الأكثر أهمية في دفق بيانات الكلام بواسطة ترميز قناة أكثر قوة.
يُستخدم تحويل جيب التمام المنفصل المعدل (MDCT) في تقنية LD-MDCT المستخدمة في تنسيق AAC -LD الذي تم تقديمه في عام 1999. [ 10 ] ومنذ ذلك الحين، تم اعتماد MDCT على نطاق واسع في تطبيقات الصوت عبر بروتوكول الإنترنت (VoIP)، مثل برنامج ترميز الصوت واسع النطاق G.729.1 الذي تم تقديمه في عام 2006، [ 11 ] وبرنامج FaceTime من Apple (باستخدام AAC-LD) الذي تم تقديمه في عام 2010، [ 12 ] وبرنامج ترميز CELT الذي تم تقديمه في عام 2011. [ 13 ]
أوبوس هو برنامج مجاني لترميز الصوت. يجمع بين خوارزمية SILK القائمة على LPC والموجهة نحو الكلام ، وخوارزمية CELT القائمة على MDCT ذات زمن الاستجابة المنخفض، حيث ينتقل بينهما أو يدمجهما حسب الحاجة لتحقيق أقصى كفاءة. [ 14 ] [ 15 ] يُستخدم على نطاق واسع في مكالمات VoIP عبر واتساب . [ 16 ] [ 17 ] [ 18 ] كما يستخدم جهاز ألعاب الفيديو بلاي ستيشن 4 برنامج أوبوس في نظام الدردشة الجماعية لشبكة بلاي ستيشن . [ 19 ]
تم عرض عدد من برامج الترميز ذات معدلات بت منخفضة للغاية. يُستخدم برنامج الترميز 2 ، الذي يعمل بمعدلات بت منخفضة تصل إلى 450 بت/ثانية ، في هواية الراديو. [ 20 ] يستخدم حلف الناتو حاليًا برنامج MELPe ، الذي يوفر كلامًا مفهومًا بمعدل 600 بت/ثانية وما دون. [ 21 ] كما ظهرت أيضًا أساليب الترميز الصوتي العصبي: يُقدم برنامج Lyra من جوجل جودة "غريبة نوعًا ما" بمعدل 3 كيلوبت/ثانية . [ 22 ] يستخدم برنامج Satin من مايكروسوفت أيضًا التعلم الآلي، ولكنه يستخدم معدل بت قابل للتعديل أعلى وهو واسع النطاق. [ 23 ]
الحقول الفرعية
- ترميز الصوت واسع النطاق
- الترميز التنبؤي الخطي (LPC)
- تقنية AMR-WB لشبكات WCDMA
- VMR- WB لشبكات CDMA2000
- Speex و IP-MR و SILK (جزء من Opus ) و USAC/xHE-AAC للاتصال الصوتي عبر بروتوكول الإنترنت ومؤتمرات الفيديو
- تحويل جيب التمام المنفصل المعدل (MDCT)
- تعديل رمز النبض التفاضلي التكيفي (ADPCM)
- G.722 لتقنية VoIP
- ترميز الكلام العصبي
- Lyra (Google): يستخدم الإصدار الأول إعادة بناء الشبكة العصبية للطيف اللوغاريتمي-ميل؛ الإصدار الثاني هو مشفر تلقائي من النهاية إلى النهاية .
- ساتان (مايكروسوفت)
- LPCNet (Mozilla, Xiph): إعادة بناء الشبكة العصبية لميزات LPC [ 24 ]
- ترميز الصوت ذو النطاق الضيق
- LPC
- ADPCM
- G.726 لتقنية VoIP
- الإثارة متعددة النطاقات (MBE)
- AMBE+ للراديو الرقمي المحمول والهاتف الفضائي
- برنامج الترميز 2
انظر أيضاً
مراجع
- ↑ أرجونا راميريز، م.؛ مينام، م. (2003). "ترميز الكلام بمعدل بت منخفض". موسوعة وايلي للاتصالات، جي جي بروكيس، محرر . 3. نيويورك: وايلي: 1299-1308 .
- ↑ M. Arjona Ramírez و M. Minami، "التكنولوجيا والمعايير لأساليب التشفير الصوتي منخفضة معدل البت"، في كتيب شبكات الحاسوب، H. Bidgoli، محرر، نيويورك: وايلي، 2011، المجلد 2، الصفحات 447-467.
- ↑ ب. كرون، "تقييم برامج تشفير الكلام،" في ترميز الكلام وتوليفه، دبليو باستيان كلاين وك.ك. باليوال، إد.، أمستردام: إلسفير ساينس، 1995، الصفحات من 467 إلى 494.
- ↑ جيه إتش تشين، آر في كوكس، واي-سي لين، إن إس جايانت، وإم جيه ميلشنر، مُشفِّر CELP منخفض التأخير لمعيار ترميز الكلام CCITT بسرعة 16 كيلوبت/ثانية. مجلة IEEE للمجالات المختارة في الاتصالات 10(5): 830-849، يونيو 1992.
- ↑ "سو هيون باي، ECE 8873 ضغط البيانات ونمذجتها، معهد جورجيا للتكنولوجيا، 2004" . مؤرشف من الأصل في 7 سبتمبر 2006.
- ^ زغيدور، نيل؛ لوبس، أليخاندرو؛ عمران، أحمد؛ سكوجلاند، يناير؛ تاغلياساكي، ماركو (2022). “SoundStream: برنامج ترميز الصوت العصبي الشامل”. معاملات IEEE/ACM المتعلقة بمعالجة الصوت والكلام واللغة . 30 : 495– 507. أرخايف : 2107.03312 . دوى : 10.1109/TASLP.2021.3129994 . S2CID 236149944 .
- ↑ جايانت، إن إس؛ نول، بي. (1984). الترميز الرقمي للأشكال الموجية . إنجلوود كليفس: برنتيس هول.
- ↑ G.711.1 : امتداد مضمن واسع النطاق لتعديل رمز النبض G.711 ، الاتحاد الدولي للاتصالات - تقييس الاتصالات، 2012 ، تم الاطلاع عليه بتاريخ 24-12-2022
- ↑ غوبتا، شيبرا (مايو 2016). "تطبيق معاملات MFCC في التعرف على المتحدث المستقل عن النص" (ملف PDF) . المجلة الدولية للبحوث المتقدمة في علوم الحاسوب وهندسة البرمجيات . 6 (5): 805-810 (806). ISSN 2277-128X . S2CID 212485331. مؤرشف من الأصل (ملف PDF) بتاريخ 18 أكتوبر 2019. تم الاطلاع عليه بتاريخ 18 أكتوبر 2019 .
- ↑ شنيل، ماركوس؛ شميدت، ماركوس؛ جاندر، مانويل؛ ألبرت، توبياس؛ جايجر، رالف؛ روبيلا، فيسا؛ إكستراند، بير؛ برنارد، جريل (أكتوبر 2008). MPEG-4 Enhanced Low Delay AAC - معيار جديد للاتصالات عالية الجودة (ملف PDF) . المؤتمر 125 لجمعية هندسة الصوت. معهد فراونهوفر لأنظمة الدوائر المتكاملة . جمعية هندسة الصوت . تاريخ الاسترجاع: 20 أكتوبر 2019 .
- ↑ ناغيريدي، سيفانارايانا (2008). معالجة إشارات الصوت والفاكس عبر بروتوكول الإنترنت (VoIP) . جون وايلي وأولاده . ص 69. ISBN 9780470377864.
- ↑ دانيال إران ديلجر (8 يونيو 2010). "نظرة داخلية على آيفون 4: مكالمات الفيديو عبر فيس تايم" . AppleInsider . تم الاطلاع عليه في 9 يونيو 2010 .
- ↑ عرض تقديمي لبرنامج ترميز CELT مؤرشف بتاريخ 2011-08-07 في Wayback Machine بواسطة تيموثي ب. تيريبيري (65 دقيقة من الفيديو، انظر أيضًا شرائح العرض التقديمي بصيغة PDF)
- ↑ "برنامج ترميز أوبوس" . أوبوس (الصفحة الرئيسية). مؤسسة Xiph.org . تم الاطلاع عليه في 31 يوليو 2012 .
- ↑ فالين، جان مارك؛ ماكسويل، غريغوري؛ تيريبري، تيموثي ب.؛ فوس، كوين (أكتوبر 2013). ترميز موسيقي عالي الجودة ومنخفض التأخير في برنامج ترميز أوبوس . المؤتمر 135 لجمعية هندسة الصوت . arXiv : 1602.04845 .
- ↑ ليدن، جون (27 أكتوبر 2015). "كشف النقاب عن واتساب: فحص خبايا تطبيق استنزاف المعلومات" . ذا ريجستر . تم الاطلاع عليه بتاريخ 19 أكتوبر 2019 .
- ↑ حضرة، سوديب؛ ماتيتي، برابهاكر (13-16 سبتمبر 2017). "التحديات في الطب الشرعي الروبوت" . في ثامبي، سابو م.؛ بيريز، جريجوريو مارتينيز؛ وستفال، كارلوس بيكر. هو، جيانكون؛ مروحة، تشون الأول. مارمول، فيليكس جوميز (محرران). الأمن في الحوسبة والاتصالات: الندوة الدولية الخامسة، SSCC 2017 . سبرينغر. ص 286-299 (290). دوى : 10.1007/978-981-10-6898-0_24 . رقم ISBN 9789811068980.
- ↑ سريفاستافا، سوراب رانجان؛ دوبي، ساشين؛ شريفاستايا، جولشان؛ شارما، كافيتا (2019). "التحديات الأمنية الناجمة عن الهواتف الذكية: قضايا ودراسات حالة وسبل الوقاية" . في: لي، داك-نهونغ؛ كومار، راغفيندرا؛ ميشرا، بروجو كيشور؛ تشاتيرجي، جيوتير موي؛ خاري، مانجو (محررون). الأمن السيبراني في الحوسبة المتوازية والموزعة: مفاهيم وتقنيات وتطبيقات ودراسات حالة . جون وايلي وأولاده. الصفحات 187-206 (200). doi : 10.1002/9781119488330.ch12 . ISBN 9781119488057. S2CID 214034702 .
- ↑ "البرمجيات مفتوحة المصدر المستخدمة في بلاي ستيشن 4" . شركة سوني للترفيه التفاعلي . تم الاطلاع عليه بتاريخ 11 ديسمبر 2017 .
- ↑ "GitHub - Codec2" . GitHub . نوفمبر 2019.
- ↑ آلان مكري، "إطار عمل قابل للتطوير لترميز صوتي باستخدام التكميم المتجهي التنبؤي المشترك لمعاملات MELP"، في وقائع المؤتمر الدولي IEEE للصوتيات والكلام ومعالجة الإشارات، 2006، الصفحات 705-708، تولوز، فرنسا
- ↑ باكلي، إيان (2021-04-08). "جوجل تُعلن عن برنامج ترميز الكلام منخفض معدل البت Lyra" . MakeUseOf . تاريخ الاسترجاع: 2022-07-21 .
- ↑ ليفنت-ليفي، تساهي (19 أبريل 2021). "ليرا، ساتين، ومستقبل برامج ترميز الصوت في WebRTC" . BlogGeek.me . تاريخ الاسترجاع: 21 يوليو 2022 .
- ↑ "LPCNet: توليف الكلام العصبي الفعال" . مؤسسة Xiph.Org. 8 أغسطس 2023.
روابط خارجية
- برامج ترميز الكلام
- ضغط البيانات
