صوت مزيف بتقنية التزييف العميق

مقطع صوتي بتقنية التزييف العميق يحاكي صوت دونالد ترامب

تقنية التزييف الصوتي العميق ، والتي تُعرف أيضاً باسم استنساخ الصوت أو الصوت المُزيّف ، هي تطبيق للذكاء الاصطناعي مصمم لتوليد كلام يُحاكي بشكل مُقنع أشخاصاً مُحددين، وغالباً ما يقوم بتوليف عبارات أو جمل لم ينطقوا بها أبداً. [ 1 ] [ 2 ] [ 3 ] [ 4 ]

طُوِّرت هذه التقنية في البداية بهدف تحسين جوانب مختلفة من حياة الإنسان، ولها تطبيقات عملية مثل إنتاج الكتب الصوتية ومساعدة الأفراد الذين فقدوا أصواتهم لأسباب طبية . [ 5 ] [ 6 ] إضافةً إلى ذلك، لها استخدامات تجارية، تشمل إنشاء مساعدين رقميين شخصيين، وأنظمة تحويل النص إلى كلام ذات صوت طبيعي ، وخدمات ترجمة كلامية متقدمة . [ 7 ] وكما هو الحال مع أشكال التزييف العميق الأخرى، واجهت تقنية التزييف العميق الصوتي انتقادات لاستخدامها في عمليات الاحتيال والتصيد الإلكتروني وحملات التضليل .

فئات

يمكن تقسيم التزييف الصوتي العميق إلى ثلاث فئات مختلفة:

يعتمد على إعادة التشغيل

تُعدّ تقنية التزييف العميق القائمة على إعادة التشغيل أعمالاً خبيثة تهدف إلى إعادة إنتاج تسجيل صوت المتحدث. [ 8 ]

يوجد نوعان: الكشف عن طريق المجال البعيد والكشف عن طريق القص واللصق . في الكشف عن طريق المجال البعيد، يُشغَّل تسجيل صوتي للضحية كمقطع اختبار على هاتف يعمل بدون استخدام اليدين. [ 9 ] أما في الكشف عن طريق القص واللصق، فيتم تزييف الجملة المطلوبة من نظام يعتمد على النص. [ 10 ] ويمكن استخدام التحقق من هوية المتحدث المعتمد على النص للدفاع ضد الهجمات القائمة على إعادة التشغيل. [ 8 ] [ 11 ] ومن التقنيات الحديثة للكشف عن هجمات إعادة التشغيل الشاملة استخدام الشبكات العصبية الالتفافية العميقة . [ 12 ]

أساس اصطناعي

مخطط توضيحي للنهج القائم على التركيب لإنشاء مقاطع صوتية مزيفة
مخطط النهج القائم على التركيب

يشير التصنيف القائم على توليف الكلام إلى الإنتاج الاصطناعي للكلام البشري، باستخدام برامج أو أجهزة حاسوبية. يشمل توليف الكلام تحويل النص إلى كلام، والذي يهدف إلى تحويل النص إلى كلام مقبول وطبيعي في الوقت الفعلي، [ 13 ] مما يجعل الصوت متوافقًا مع النص المدخل، باستخدام قواعد الوصف اللغوي للنص.

يتألف النظام الكلاسيكي من هذا النوع من ثلاث وحدات: نموذج تحليل نصي، ونموذج صوتي، ومُشفِّر صوتي . عادةً ما تتطلب عملية التوليد خطوتين أساسيتين. أولاً، من الضروري جمع ملفات صوتية خام نقية ومنظمة جيدًا مع النص المكتوب للجملة الصوتية الأصلية. ثانيًا، يجب تدريب نموذج تحويل النص إلى كلام باستخدام هذه البيانات لبناء نموذج توليد صوتي اصطناعي.

على وجه التحديد، يُعد النص المكتوب بصوت المتحدث المستهدف مدخلاً لنموذج التوليد. تقوم وحدة تحليل النصوص بمعالجة النص المدخل وتحويله إلى خصائص لغوية. بعد ذلك، تستخرج الوحدة الصوتية معلمات المتحدث المستهدف من البيانات الصوتية بناءً على الخصائص اللغوية التي أنشأتها وحدة تحليل النصوص. [ 14 ] وأخيرًا، يتعلم مُشفّر الصوت إنشاء موجات صوتية بناءً على معلمات الخصائص الصوتية. يتم إنشاء ملف الصوت النهائي، متضمنًا الصوت المُحاكى المُصنّع بصيغة الموجة الصوتية، مما يُنتج صوتًا مُحاكيًا لأصوات العديد من المتحدثين، حتى أولئك الذين لم يشاركوا في التدريب.

كان أول إنجاز في هذا المجال هو شبكة WaveNet [ 15 ] ، وهي شبكة عصبية لتوليد موجات صوتية خام قادرة على محاكاة خصائص العديد من المتحدثين المختلفين. وقد تفوقت على هذه الشبكة على مر السنين أنظمة أخرى [ 16 ] [ 17 ] [ 18 ] [ 19 ] [ 20 ] [ 21 ] تُنتج أصواتًا اصطناعية واقعية للغاية في متناول الجميع. [ 22 ]

تعتمد تقنية تحويل النص إلى كلام بشكل كبير على جودة مجموعة البيانات الصوتية المستخدمة في تشغيل النظام، وإنشاء مجموعة بيانات صوتية كاملة مكلف. ومن عيوبها الأخرى أنها لا تتعرف على النقاط أو الأحرف الخاصة. كما أن مشكلة الغموض قائمة، إذ قد تحمل كلمتان مكتوبتان بنفس الطريقة معاني مختلفة.

قائم على التقليد

مخطط توضيحي لنهج المحاكاة المستخدم في توليد مقاطع صوتية مزيفة
مخطط النهج القائم على التقليد

تقنية التزييف العميق الصوتي القائمة على المحاكاة هي طريقة لتحويل الكلام الأصلي لمتحدث ما - المتحدث الأصلي - ليبدو وكأنه كلام متحدث آخر - المتحدث المستهدف. [ 23 ] تعتمد خوارزمية المحاكاة على أخذ إشارة صوتية كمدخل وتعديلها بتغيير أسلوبها أو نبرتها أو خصائصها الصوتية، في محاولة لتقليد الصوت المستهدف دون تغيير المعلومات اللغوية. [ 24 ] تُعرف هذه التقنية أيضًا باسم تحويل الصوت.

كثيرًا ما يُخلط بين هذه الطريقة والطريقة السابقة القائمة على التركيب، لعدم وجود فصل واضح بينهما فيما يتعلق بعملية التوليد. في الواقع، تُعدّل كلتا الطريقتين الخصائص الصوتية والطيفية وأسلوبية لإشارة الصوت الكلامي، لكن الطريقة القائمة على المحاكاة عادةً ما تُبقي النص المُدخل والمُخرج دون تغيير. ويتحقق ذلك بتغيير طريقة نطق الجملة لتتوافق مع خصائص المتحدث المستهدف. [ 25 ]

يمكن محاكاة الأصوات بعدة طرق، منها استخدام أشخاص ذوي أصوات مشابهة لمحاكاة المتحدث الأصلي. وفي السنوات الأخيرة، شاع استخدام شبكات عصبية محددة تُسمى الشبكات التوليدية التنافسية (GAN) نظرًا لمرونتها وجودة نتائجها العالية. [ 8 ] [ 23 ]

ثم يتم تحويل الإشارة الصوتية الأصلية لقول خطاب في الصوت المستهدف باستخدام طريقة توليد التقليد التي تولد خطابًا جديدًا، يظهر في الصوت المزيف.

أساليب الكشف

تحدد مهمة الكشف عن التزييف العميق للصوت ما إذا كان الصوت الكلامي المعطى حقيقيًا أم مزيفًا.

في الآونة الأخيرة، أصبح هذا الموضوع موضوعاً ساخناً في مجتمع أبحاث الطب الشرعي ، في محاولة لمواكبة التطور السريع لتقنيات التزييف.

بشكل عام، يمكن تقسيم أساليب كشف التزييف العميق إلى فئتين بناءً على الجانب الذي تستخدمه لإنجاز مهمة الكشف. تركز الأولى على الجوانب الأساسية، باحثةً عن التشوهات التي تُدخلها مولدات الصوت على مستوى العينة. أما الثانية، فتركز على خصائص أكثر تعقيدًا تمثل جوانب أكثر تعقيدًا، مثل المحتوى الدلالي لتسجيل الصوت.

رسم تخطيطي يوضح الإطار المعتاد المستخدم لتنفيذ مهمة الكشف عن التزييف العميق للصوت.
إطار عمل عام للكشف عن التزييف العميق الصوتي

تم تطوير العديد من نماذج التعلم الآلي باستخدام استراتيجيات مختلفة للكشف عن الصوت المزيف. في أغلب الأحيان، تتبع هذه الخوارزميات إجراءً من ثلاث خطوات:

  1. يجب معالجة كل تسجيل صوتي للكلام مسبقًا وتحويله إلى خصائص صوتية مناسبة؛
  2. يتم إدخال الميزات المحسوبة في نموذج الكشف، الذي يقوم بالعمليات اللازمة، مثل عملية التدريب، الضرورية للتمييز بين الصوت الكلامي الحقيقي والمزيف؛
  3. تُغذّى المخرجات إلى الوحدة النهائية لإنتاج احتمالية تنبؤية لفئة الصوت المزيف أو الحقيقي . ووفقًا لتسمية تحدي ASVspoof [ 26 ] ، يُشار إلى الصوت المزيف بمصطلح "Spoof"، بينما يُطلق على الصوت الحقيقي اسم "Bonafide".

على مر السنين، أظهر العديد من الباحثين أن أساليب التعلم الآلي أكثر دقة من أساليب التعلم العميق، بغض النظر عن الميزات المستخدمة. [ 14 ] ومع ذلك، لم يتم التأكد من قابلية التوسع لأساليب التعلم الآلي بسبب التدريب المكثف واستخراج الميزات يدويًا، خاصةً مع وجود العديد من الملفات الصوتية. في المقابل، عند استخدام خوارزميات التعلم العميق، يلزم إجراء تحويلات محددة على الملفات الصوتية لضمان قدرة الخوارزميات على التعامل معها.

تركز معظم الدراسات المتعلقة بالكشف عن التزييف العميق على اللغة الإنجليزية. ولا تزال الأبحاث حول اللغات الأكثر انتشارًا، مثل الصينية والإسبانية، محدودة. كما أن اللغتين الهندية والعربية لم تحظيا بالدراسة الكافية. وتُظهر نماذج الكشف المدربة أساسًا على اللغة الإنجليزية أداءً أقل عند اختبارها على ملفات صوتية بلغات أخرى. ويؤثر اختلاف اللهجات أيضًا على دقة الكشف. فالاختلافات في النطق المرتبطة بمناطق أو فئات سكانية محددة تؤثر على مدى قدرة النماذج على تحديد الكلام المُصنّع. [ 27 ]

هناك العديد من التطبيقات مفتوحة المصدر لأساليب الكشف المختلفة، [ 28 ] [ 29 ] [ 30 ] وعادة ما تقوم العديد من مجموعات البحث بنشرها على خدمة استضافة عامة مثل GitHub .

المخاوف والتدابير المضادة

أثار تزايد سهولة الوصول إلى تقنية التزييف الصوتي العميق مخاوف بشأن استخدامها في عمليات الاحتيال وحملات التضليل . [ 3 ] [ 31 ] إذ يمكن استخدامها كتقنية انتحال صوت منطقي ، [ 32 ] حيث يمكن استغلالها للتأثير على الرأي العام لأغراض الدعاية أو التشهير أو الإرهاب . تُنقل كميات هائلة من التسجيلات الصوتية يوميًا عبر الإنترنت، ويُعدّ اكتشاف التزييف أمرًا بالغ الصعوبة. [ 10 ] وقد استهدف مهاجمو التزييف الصوتي العميق أفرادًا ومنظمات، بمن فيهم سياسيون وحكومات. [ 33 ]

في عام 2019، انتحل محتالون باستخدام الذكاء الاصطناعي صوت الرئيس التنفيذي لشركة طاقة ألمانية، ووجهوا الرئيس التنفيذي لفرعها في المملكة المتحدة لتحويل 220 ألف يورو . [ 34 ] وفي أوائل عام 2020، انتحلت التقنية نفسها شخصية مدير شركة ضمن مخطط مُحكم أقنع مدير فرع بتحويل 35 مليون دولار. [ 35 ]

بحسب استطلاع عالمي أجرته شركة مكافي عام 2023 ، أفاد واحد من كل عشرة أشخاص بتعرضه لعملية احتيال باستخدام الذكاء الاصطناعي لاستنساخ الصوت؛ وأفاد 77% من هؤلاء الضحايا بخسارة أموالهم نتيجةً لهذه العملية. [ 36 ] [ 37 ] كما قد تشكل تقنية التزييف الصوتي العميق خطرًا على أنظمة التعرف على الصوت المستخدمة حاليًا من قبل المؤسسات المالية. [ 38 ] [ 39 ] وفي مارس 2023، أصدرت لجنة التجارة الفيدرالية الأمريكية تحذيرًا للمستهلكين بشأن استخدام الذكاء الاصطناعي لتزييف صوت أحد أفراد الأسرة في حالة استغاثة يطلب المال. [ 40 ]

في أكتوبر/تشرين الأول 2023، خلال افتتاح مؤتمر حزب العمال البريطاني في ليفربول ، تم تسريب تسجيل صوتي مُفبرك بتقنية التزييف العميق لزعيم حزب العمال كير ستارمر ، يُظهره زوراً وهو يسيء لفظياً إلى موظفيه وينتقد ليفربول. [ 41 ] وفي الشهر نفسه، تم تسريب تسجيل صوتي مُفبرك بتقنية التزييف العميق للسياسي السلوفاكي ميخال شيميكا، يُزعم زوراً أنه يُظهره وهو يناقش سُبل التلاعب بالانتخابات المقبلة. [ 42 ]

خلال حملة الانتخابات التمهيدية الرئاسية للحزب الديمقراطي في ولاية نيو هامبشاير عام 2024 ، تلقى أكثر من 20 ألف ناخب مكالمات آلية منسوبة إلى الرئيس جو بايدن، مُنتحلاً شخصيته بواسطة الذكاء الاصطناعي ، تحثهم على عدم التصويت. [ 43 ] [ 44 ] وصرح المدعي العام لولاية نيو هامبشاير بأن هذا يُعد انتهاكًا لقوانين الانتخابات في الولاية، وزعم تورط شركتي لايف كوربوريشن ولينغو تيليكوم. [ 45 ] في فبراير 2024، حظرت لجنة الاتصالات الفيدرالية الأمريكية استخدام الذكاء الاصطناعي لتزييف الأصوات في المكالمات الآلية. [ 46 ] [ 47 ] وفي الشهر نفسه، اعترف المستشار السياسي ستيف كرامر بأنه كلف بإجراء هذه المكالمات مقابل 500 دولار. وقال إنه أراد لفت الانتباه إلى ضرورة وضع قواعد تنظم استخدام الذكاء الاصطناعي في الحملات السياسية. [ 48 ] وفي مايو، صرحت لجنة الاتصالات الفيدرالية بأن كرامر انتهك القانون الفيدرالي بانتحاله رقم شخصية سياسية محلية، واقترحت غرامة قدرها 6 ملايين دولار. وجهت أربع مقاطعات في ولاية نيو هامبشاير اتهامات جنائية إلى كريمر بتهمة قمع الناخبين، وانتحال شخصية مرشح، وهي جنحة. [ 49 ]

في عام 2024، لفت اليوتيوبر جيف جيرلينج الأنظار بعد أن لاحظ استنساخ صوته دون موافقته من قِبل شركة الإلكترونيات إليكرو، [ 50 ] [ 51 ] وقامت الشركة لاحقًا بالاعتذار وحذف المحتوى المخالف. [ 52 ] وقد استُشهد بتجربة جيرلينج كحالة كان من المفترض أن تعالجها تقنية كشف التشابه الخاصة بيوتيوب عند إطلاقها في عام 2025. [ 53 ] [ 54 ]

الدعاية التي ترعاها الدولة

في فبراير 2023، وثّقت شركة الأبحاث "غرافيكا" أول حالة معروفة لجهات موالية للدولة تستخدم مذيعين إخباريين مُولّدين بواسطة الذكاء الاصطناعي لنشر معلومات مضللة سياسياً. أنشأت شبكة الدعاية الصينية "سباموفلاج" مذيعين إخباريين وهميين باسمي "أليكس" و"آنا" باستخدام برنامج "سينثيسيا" للذكاء الاصطناعي. ظهر المذيعان المُزيّفان في مقاطع فيديو نُشرت على فيسبوك وتويتر ويوتيوب بدءاً من أواخر عام 2022. روّجت مقاطع الفيديو لروايات مؤيدة للصين وانتقدت الولايات المتحدة. بلغت تكلفة العملية حوالي 30 دولاراً شهرياً لاشتراك برنامج الذكاء الاصطناعي. شملت مؤشرات الكشف أنماط الكلام الآلية، وأخطاء مزامنة الشفاه، والأخطاء النحوية في ترجمة الفيديو. [ 55 ]

التحديات المفتوحة واتجاهات البحث المستقبلية

يُعدّ التزييف الصوتي العميق مجالًا بحثيًا حديثًا للغاية. ولهذا السبب، توجد إمكانيات عديدة للتطوير والتحسين، فضلًا عن المخاطر المحتملة التي قد تنجم عن تبني هذه التقنية في حياتنا اليومية. وفيما يلي أهم هذه المخاطر.

أظهرت دراسة شاملة أجريت عام 2023 حول كشف التزييف العميق الصوتي أن أنظمة الكشف تواجه تحديات كبيرة في التعميم عبر طرق التوليد المختلفة والظروف الصوتية. [ 27 ]

تقنية التزييف العميق

فيما يتعلق بعملية التوليد، فإن الجانب الأكثر أهمية هو مصداقية الضحية، أي الجودة الإدراكية للتزييف العميق الصوتي.

تُحدد عدة مقاييس مستوى دقة توليد الصوت المُفبرك بتقنية التزييف العميق، وأكثرها استخدامًا هو متوسط ​​رأي المستخدم (MOS)، وهو المتوسط ​​الحسابي لتقييمات المستخدمين. عادةً، يتضمن الاختبار المراد تقييمه تقييمًا إدراكيًا للجمل المُنشأة بواسطة خوارزميات توليد الكلام المختلفة. وقد أظهر هذا المؤشر أن الصوت المُنشأ بواسطة خوارزميات مُدربة على متحدث واحد يحصل على متوسط ​​رأي مستخدم أعلى. [ 25 ] [ 15 ] [ 56 ] [ 57 ] [ 20 ]

يلعب معدل أخذ العينات دورًا أساسيًا في كشف وإنتاج التزييف الصوتي العميق. حاليًا، يبلغ معدل أخذ العينات في مجموعات البيانات المتاحة حوالي 16  كيلوهرتز، مما يقلل جودة الكلام بشكل ملحوظ. ويمكن أن تؤدي زيادة معدل أخذ العينات إلى إنتاج صوت بجودة أعلى. [ 18 ]

في مارس 2020، أظهر باحثٌ من معهد ماساتشوستس للتكنولوجيا قدرةً فائقةً على توليد مقاطع صوتية مُزيّفة بتقنية التزييف العميق باستخدام تطبيق 15.ai ، وهو تطبيق ويب قادر على توليد كلام عالي الجودة باستخدام 15 ثانية فقط من بيانات التدريب، [ 58 ] [ 59 ] مقارنةً بالأنظمة السابقة التي كانت تتطلب عشرات الساعات. [ 60 ] اعتمد النظام نموذجًا موحدًا متعدد المتحدثين، مما مكّن من التدريب المتزامن لأصوات متعددة من خلال تضمينات المتحدث، ما سمح للنموذج بتعلّم الأنماط المشتركة بين الأصوات المختلفة حتى عندما تفتقر الأصوات الفردية إلى أمثلة لسياقات عاطفية معينة. [ 61 ] دمجت المنصة تحليل المشاعر من خلال DeepMoji للتعبير العاطفي، ودعمت التحكم الدقيق في النطق عبر النسخ الصوتي ARPABET . [ 62 ] وقد أكدت OpenAI لاحقًا في عام 2024 معيار كفاءة البيانات البالغ 15 ثانية. [ 63 ]

كشف التزييف العميق

بالتركيز على جزء الكشف، فإن أحد نقاط الضعف الرئيسية التي تؤثر على النماذج الحديثة هو اللغة المعتمدة.

تركز معظم الدراسات على اكتشاف التزييف العميق الصوتي في اللغة الإنجليزية، ولا تولي اهتمامًا كبيرًا للغات الأكثر انتشارًا مثل الصينية والإسبانية، [ 64 ] وكذلك الهندية والعربية.

من الضروري أيضًا مراعاة عوامل أخرى تتعلق باللهجات المختلفة التي تمثل طريقة النطق المرتبطة ارتباطًا وثيقًا بفرد أو مكان أو دولة معينة. في مجالات صوتية أخرى، مثل التعرف على المتحدث ، وُجد أن اللهجة تؤثر بشكل كبير على الأداء [ 65 لذا من المتوقع أن تؤثر هذه السمة على أداء النماذج حتى في مهمة الكشف هذه.

بالإضافة إلى ذلك، أدت المعالجة المسبقة المفرطة للبيانات الصوتية إلى تكلفة حسابية باهظة وغير مستدامة في كثير من الأحيان. لهذا السبب، اقترح العديد من الباحثين اتباع نهج التعلم الذاتي [ 66 ] ، الذي يتعامل مع البيانات غير المصنفة ليعمل بكفاءة في مهام الكشف، ويُحسّن قابلية توسع النموذج، ويُقلل في الوقت نفسه التكلفة الحسابية. علاوة على ذلك، يكمن عامل أساسي في التعامل مع هجمات التزييف غير المعروفة في استخدام استراتيجيات فعّالة لزيادة البيانات، والتي تُعرّض النموذج لنطاق أوسع من التباين الصوتي، وتُعزز قدرته على التعميم على ظروف هجوم غير مسبوقة. [ 67 ]

لا يزال تدريب واختبار النماذج باستخدام بيانات صوتية حقيقية مجالاً غير متطور. في الواقع، يمكن أن يؤدي استخدام الصوت مع ضوضاء خلفية من العالم الحقيقي إلى زيادة متانة نماذج الكشف عن الصوت الزائف.

بالإضافة إلى ذلك، يتركز معظم الجهد على كشف التزييف العميق الصوتي القائم على التركيب، وقليل من الدراسات تحلل التزييف العميق القائم على التقليد بسبب الصعوبة المتأصلة في عملية التوليد. [ 10 ]

الدفاع ضد التزييف العميق

على مر السنين، كان هناك ازدياد في التقنيات التي تهدف إلى الدفاع ضد الأعمال الخبيثة التي قد تنجم عن التزييف العميق الصوتي، مثل سرقة الهوية والتلاعب بخطابات حكام البلاد.

لمنع التزييف العميق، يقترح البعض استخدام تقنية سلسلة الكتل (البلوك تشين) وغيرها من تقنيات السجلات الموزعة (DLT) لتحديد مصدر البيانات وتتبع المعلومات. [ 14 ] [ 68 ] [ 69 ] [ 70 ]

كما تم اقتراح استخلاص ومقارنة الإشارات العاطفية التي تتوافق مع المشاعر المُدركة من المحتوى الرقمي لمكافحة التزييف العميق. [ 71 ] [ 72 ] [ 73 ]

ثمة جانب بالغ الأهمية آخر يتعلق بتخفيف حدة هذه المشكلة. فقد اقتُرح أن يكون من الأفضل حصر بعض أدوات الكشف الخاصة بمن يحتاجونها فقط، مثل أدوات التحقق من الحقائق للصحفيين. [ 8 ] وبهذه الطريقة، لن يعرف منشئو نماذج التوليد، ربما لأغراض خبيثة، تحديدًا ما هي الخصائص التي تُسهّل كشف التزييف العميق، [ 8 ] مما يُثني المهاجمين المحتملين.

ولتحسين عملية الكشف، يحاول الباحثون تعميم العملية، [ 74 ] والبحث عن تقنيات المعالجة المسبقة التي تُحسّن الأداء واختبار دوال الخسارة المختلفة المستخدمة في التدريب. [ 32 ] [ 75 ]

في يناير 2023، طبّقت الصين لوائح تلزم بوضع علامات واضحة على محتوى التزييف العميق. تحظر هذه اللوائح استخدام تقنية التوليف العميق لإنتاج أو نشر الأخبار الكاذبة. ويتعين على مزودي الخدمات التحقق من هويات المستخدمين والاحتفاظ بسجلات المحتوى. وتمثل هذه اللوائح أحد أوائل الأطر الحكومية الشاملة التي تستهدف تحديدًا تقنية التزييف العميق. [ 76 ]

برامج البحث

تعمل العديد من المجموعات البحثية حول العالم على كشف التلاعبات الإعلامية، مثل التزييف العميق الصوتي، وكذلك التزييف العميق للصور والفيديوهات. وعادةً ما تحظى هذه المشاريع بدعم من جهات تمويل عامة أو خاصة، وترتبط ارتباطًا وثيقًا بالجامعات والمؤسسات البحثية.

لهذا الغرض، تدير وكالة مشاريع البحوث الدفاعية المتقدمة (DARPA) برنامج التحليل الدلالي الجنائي (SemaFor). [ 77 ] [ 78 ] وبالاستفادة من بعض الأبحاث من برنامج التحليل الإعلامي الجنائي (MediFor) [ 79 ] [ 80 ] ، التابع أيضاً لوكالة DARPA، سيتعين على خوارزميات الكشف الدلالي هذه تحديد ما إذا كان قد تم إنشاء كائن وسائط أو التلاعب به، وذلك لأتمتة تحليل مصدر الوسائط والكشف عن النية الكامنة وراء تزييف المحتوى المتنوع. [ 81 ] [ 77 ]

يُعدّ برنامج "الحفاظ على مصداقية وسائل الإعلام في عصر الذكاء الاصطناعي" (PREMIER) [ 82 ] برنامجًا بحثيًا آخر، وهو مموّل من وزارة التعليم والجامعات والبحث العلمي الإيطالية (MIUR) وتُديره خمس جامعات إيطالية. ويسعى برنامج PREMIER إلى تطوير مناهج هجينة مبتكرة للحصول على أدوات كشف جنائية أكثر قابلية للتفسير وأمانًا. [ 83 ]

مجموعة بيانات DEEP-VOICE [ 84 ] متاحة للعموم، وهي مخصصة لأغراض البحث لتطوير أنظمة قادرة على كشف توليد الكلام باستخدام الشبكات العصبية من خلال عملية تُعرف باسم تحويل الصوت القائم على الاسترجاع (RVC). وقد أظهرت الأبحاث الأولية وجود اختلافات عديدة ذات دلالة إحصائية بين خصائص الكلام البشري والكلام المُولّد بواسطة خوارزميات الذكاء الاصطناعي.

التحديات العامة

في السنوات القليلة الماضية، تم تنظيم العديد من التحديات لدفع هذا المجال من أبحاث التزييف العميق الصوتي إلى الأمام.

يُعدّ تحدي ASVspoof [ 26 ] ، وهو تحدّي التحقق التلقائي من هوية المتحدثين ومكافحة التزييف، أشهر تحدٍّ عالمي. وهو مبادرة مجتمعية تُقام كل سنتين، وتهدف إلى تعزيز الاهتمام بالتزييف وتطوير تدابير لمكافحته. [ 85 ]

ومن التحديات الحديثة الأخرى تقنية الكشف عن التزييف العميق الصوتي (ADD ) [ 86 ] ، والتي تأخذ في الاعتبار المواقف المزيفة في سيناريو أقرب إلى الواقع. [ 87 ]

كما أن تحدي تحويل الصوت [ 88 ] هو تحدٍ نصف سنوي، تم إنشاؤه مع الحاجة إلى مقارنة أنظمة وأساليب تحويل الصوت المختلفة باستخدام نفس بيانات الصوت.

إذن مراجعة الاستخدام الموسع

في 22 مايو 2025، زُعم أن منتج شركة هويا ، ريد سبيك، استخدم تسجيلات صوتية للممثلة غايان بوتر عام 2021، والتي كانت تعتقد حينها أنها ستُستخدم فقط في برامج تسهيل الوصول والتعليم الإلكتروني، ولكنها متاحة الآن للجمهور بصوت إيونا ، وتُستخدم كمذيعة في قطارات سكوت ريل . [ 89 ] [ 90 ] [ 91 ] وقد حلّت هذه التسجيلات محل رسائل قديمة سجلها فليتشر ماذرز دون إذنها. [ 92 ] في 25 أغسطس 2025، أعلنت سكوت ريل أنها ستستبدل الصوت المُدخَل بالذكاء الاصطناعي في القطارات، ولكن لم يُؤكَّد بعد ما إذا كان هذا التسجيل سيكون بشريًا أم صوتًا آخر مُدرَّبًا بالذكاء الاصطناعي. [ 93 ]

انظر أيضاً

مراجع

  1. سميث، هانا؛ مانستيد، كاثرين (1 أبريل 2020). التزييف العميق المُسلّح: الأمن القومي والديمقراطية . المجلد  28. المعهد الأسترالي للسياسة الاستراتيجية . الصفحات 11-13 . الرقم الدولي الموحد للدوريات 2209-9689 .  
  2. ليو، سيوي (2020). "كشف التزييف العميق: التحديات الحالية والخطوات التالية". ورش عمل المؤتمر الدولي للوسائط المتعددة والمعرض IEEE لعام 2020 (ICMEW) . الصفحات 1-6 . arXiv : 2003.09234 . doi : 10.1109/icmew46912.2020.9105991 . ISBN  978-1-7281-1485-9. S2CID 214605906 . 
  3. 1 2 دياكوبولوس، نيكولاس؛ جونسون، ديبورا (يونيو 2020). "استباق ومعالجة الآثار الأخلاقية لتقنية التزييف العميق في سياق الانتخابات" . الإعلام الجديد والمجتمع . 23 (7) (نُشر في 5 يونيو 2020 ): 2072-2098 . doi : 10.1177/1461444820925811 . ISSN 1461-4448 . S2CID 226196422 .  
  4. ^ ميرفي ، مارجي (20 فبراير 2024). "Deepfake Audio Boom يستغل الذكاء الاصطناعي لشركة ناشئة تبلغ قيمتها مليار دولار" . بلومبرج.
  5. تشادها، أنوباما؛ كومار، فايبهاف؛ كاشياب، سونو؛ غوبتا، مايانك (2021)، "التزييف العميق: نظرة عامة" ، في سينغ، براديب كومار؛ ويرزتشون، سلافومير ت.؛ تانوار، سوديب؛ غانزا، ماريا (محررون)، وقائع المؤتمر الدولي الثاني حول الحوسبة والاتصالات والأمن السيبراني ، سلسلة محاضرات في الشبكات والأنظمة، المجلد 203، سنغافورة: سبرينغر سنغافورة، الصفحات 557-566 ، doi : 10.1007/978-981-16-0733-2_39 ، ISBN   978-981-16-0732-5، S2CID 236666289 ، تم استرجاعه بتاريخ 29-06-2022 
  6. «أعاد الذكاء الاصطناعي صوت فال كيلمر. لكن النقاد يخشون إساءة استخدام هذه التقنية» . صحيفة واشنطن بوست . ISSN 0190-8286 . تاريخ الاطلاع: 29 يونيو 2022 . 
  7. إتيان، فانيسا (19 أغسطس 2021). "فال كيلمر يستعيد صوته بعد معركته مع سرطان الحلق باستخدام تقنية الذكاء الاصطناعي: استمع إلى النتائج" . PEOPLE.com . تم الاطلاع عليه بتاريخ 1 يوليو 2022 .
  8. 1 2 3 4 5 خانجاني، زهرة؛ واتسون، غابرييل؛ جانجا، فاندانا ب. (2021-11-28). "ما مدى عمق التزييف؟ التركيز على التزييف العميق الصوتي: دراسة استقصائية". arXiv : 2111.14203 [ cs.SD ].
  9. برادان، سوادهين؛ صن، وي؛ بيغ، غفران؛ تشيو، ليلي (9 سبتمبر 2019). "مكافحة هجمات إعادة التشغيل ضد المساعدين الصوتيين" . وقائع مؤتمر ACM حول التقنيات التفاعلية والمتنقلة والقابلة للارتداء والمنتشرة . 3 (3): 100:1–100:26. doi : 10.1145/3351258 . S2CID 202159551 . 
  10. 1 2 3 باليستيروس، دورا م.؛ رودريجيز أورتيجا، يوحنا؛ رينزا، دييغو؛ آرسي ، جونزالو (2021-12-01). "Deep4SNet: التعلم العميق لتصنيف الكلام المزيف" . الأنظمة المتخصصة مع التطبيقات . 184 115465. دوى : 10.1016/j.eswa.2021.115465 . ردمك 0957-4174 . S2CID 237659479 .  
  11. فيلالبا، خيسوس؛ ليدا، إدواردو (2011). "منع هجمات إعادة التشغيل على أنظمة التحقق من المتحدث". مؤتمر كارناهان لتكنولوجيا الأمن 2011. الصفحات 1-8 . doi : 10.1109/CCST.2011.6095943 . ISBN  978-1-4577-0903-6. S2CID 17048213 . 
  12. توم، فرانسيس؛ جاين، موهيت؛ داي، براسينجيت (2018-09-02). "الكشف الشامل عن هجمات إعادة تشغيل الصوت باستخدام الشبكات العصبية التلافيفية العميقة مع آلية الانتباه" . مؤتمر Interspeech 2018. ISCA: 681–685 . doi : 10.21437/Interspeech.2018-2279 . S2CID 52187155 . 
  13. تان، شو؛ تشين، تاو؛ سونغ، فرانك؛ ليو، تي-يان (2021-07-23). ​​"دراسة استقصائية حول توليف الكلام العصبي". arXiv : 2106.15561 [ eess.AS ].
  14. ١ ٢ ٣ المطيري، زينب؛ الجبرين، هبة (٢٠٢٢-٠٥-٠٤). "مراجعة لأساليب الكشف الحديثة عن التزييف العميق الصوتي: التحديات والاتجاهات المستقبلية" . الخوارزميات . ١٥ (٥): ١٥٥. doi : 10.3390/a15050155 . ISSN 1999-4893 . 
  15. 1 2 أورد، آرون فان دن؛ ديليمان، ساندر؛ زين، هيجا؛ سيمونيان، كارين؛ فينيالس، أوريول. جريفز، اليكس. كالشبرينر، نال؛ كبير، أندرو؛ كافوكوغلو ، كوراي (2016/09/19). “WaveNet: نموذج توليدي للصوت الخام”. أرخايف : 1609.03499 [ cs.SD ].
  16. ^ كوتشاييف، أوليكسي؛ لي، جايسون؛ نجوين، هوين؛ هرينشوك، أوليكسي؛ ليري، ريان. جينسبيرغ، بوريس؛ كريمان، صموئيل؛ بيلييف، ستانيسلاف؛ لافروخين، فيتالي؛ كوك، جاك؛ كاستونجواي ، باتريس (2019/09/13). “NeMo: مجموعة أدوات لبناء تطبيقات الذكاء الاصطناعي باستخدام الوحدات العصبية”. أرخايف : 1909.09577 [ cs.LG ].
  17. وانغ، يوكسوان؛ سكيري-ريان، آر جيه؛ ستانتون، ديزي؛ وو، يونغهوي؛ فايس، رون جيه؛ جايتلي، نافديب؛ يانغ، زونغهينغ؛ شياو، يينغ؛ تشين، تشيفنغ؛ بينجيو، سامي؛ لي، كوك (2017-04-06). "تاكوترون: نحو توليف الكلام من البداية إلى النهاية". arXiv : 1703.10135 [ cs.CL ].
  18. 1 2 برينجر، رايان؛ فالي، رافائيل؛ كاتانزارو، برايان (30-10-2018). "WaveGlow: شبكة توليدية قائمة على التدفق لتوليف الكلام". arXiv : 1811.00002 [ cs.SD ].
  19. فاسكيز، شون؛ لويس، مايك (2019-06-04). "MelNet: نموذج توليدي للصوت في مجال التردد". arXiv : 1906.01083 [ eess.AS ].
  20. 1 2 بينغ، وي؛ بينغ، كاينان؛ غيبانسكي، أندرو؛ أريك، سيركان أو.؛ ​​كانان، أجاي؛ نارانغ، شاران؛ رايمان، جوناثان؛ ميلر، جون (2018-02-22). "Deep Voice 3: Scaling text-to-peech with Convolutional Series Learning". arXiv : 1710.07654 [ cs.SD ].
  21. ^ رن، يي؛ روان، يانغجون؛ تان، شو؛ تشين، تاو؛ تشاو، شنغ؛ تشاو، تشو؛ ليو ، تي يان (2019/11/20). "FastSpeech: تحويل النص إلى كلام سريع وقوي ويمكن التحكم فيه". أرخايف : 1905.09263 [ cs.CL ].
  22. ^ نينغ، ييشوانغ؛ هو شنغ. وو، تشى يونغ؛ شينغ، تشونشياو؛ تشانغ ، ليانغ جي (يناير 2019). "مراجعة لتركيب الكلام القائم على التعلم العميق" . العلوم التطبيقية . 9 (19): 4050. دوى : 10.3390/app9194050 . ISSN 2076-3417 . 
  23. 1 2 رودريغيز-أورتيغا، يوهانا؛ باليستيروس، دورا ماريا؛ رينزا، دييغو (2020). "نموذج تعلم آلي لكشف الأصوات المزيفة" . في فلوريس، هيكتور؛ ميسرا، سانجاي (محرران). المعلوماتية التطبيقية . سلسلة اتصالات في علوم الحاسوب والمعلومات. المجلد 1277. تشام: دار نشر سبرينغر الدولية. الصفحات 3-13 . doi : 10.1007/978-3-030-61702-8_1 . ISBN   978-3-030-61702-8. S2CID 226283369 . 
  24. تشانغ، مينغيانغ؛ وانغ، شين؛ فانغ، فومينغ؛ لي، هايتشو؛ ياماغيشي، جونيتشي (2019-04-07). "إطار تدريب مشترك لتحويل النص إلى كلام وتحويل الصوت باستخدام تاكوترون متعدد المصادر وويف نت". arXiv : 1903.12389 [ eess.AS ].
  25. 1 2 سيركان، أ. أريك؛ جيتونغ، تشين؛ كاينان، بينغ؛ وي، بينغ؛ يانكي، تشو (2018). "استنساخ الصوت العصبي باستخدام عدد قليل من العينات" . التطورات في أنظمة معالجة المعلومات العصبية (NeurIPS 2018) . 31 (نُشر في 12 أكتوبر 2018): 10040-10050 . arXiv : 1802.06006 .
  26. 1 2 "| ASVspoof" . www.asvspoof.org . تم الاطلاع عليه بتاريخ 1 يوليو 2022 .
  27. 1 2 يي، جيانغيان؛ تاو، جيانهوا؛ باي، يي؛ تيان، زيتشيانغ؛ فان ، تشوانينج (2023). “الكشف عن الصوت العميق: استطلاع”. أرخايف : 2308.14970 [ cs.SD ].
  28. similar-ai/Resemblyzer ، Resemble AI، 30-06-2022 ، تم الاطلاع عليه بتاريخ 01-07-2022
  29. mendaxfz (2022-06-28)، كشف الصوت الاصطناعي ، تم الاطلاع عليه بتاريخ 2022-07-01
  30. هوا، غوانغ (29-06-2022)، الكشف عن الكلام الاصطناعي من البداية إلى النهاية ، تم الاطلاع عليه بتاريخ 01-07-2022
  31. كارامانسيون، كيفن ماثي (يونيو 2022). "استكشاف المعلومات المضللة/المغلوطة في تنسيق الصوت المنشور في البودكاست: دراسة حالة سبوتيفاي". المؤتمر الدولي لإنترنت الأشياء والإلكترونيات والميكاترونيات (IEMTRONICS) لعام 2022. الصفحات 1-6 . doi : 10.1109/IEMTRONICS55184.2022.9795760 . ISBN  978-1-6654-8684-2. S2CID 249903722 . 
  32. 1 2 تشين، تيانشيانغ؛ كومار، أفروش؛ ناغارشيث، باراف؛ سيفارامان، غانيش؛ خوري، إيلي (2020-11-01). "تعميم كشف التزييف العميق الصوتي" . ورشة عمل التعرف على المتحدث واللغة (أوديسي 2020) . ISCA: 132-137 . doi : 10.21437/Odyssey.2020-19 . S2CID 219492826 . 
  33. سواجاناكورن، سوباسورن؛ سيتز، ستيفن م.؛ كيملماخر-شليزرمان، إيرا (2017-07-20). "توليف أوباما: تعلم مزامنة الشفاه من الصوت" . معاملات ACM في الرسومات . 36 (4): 95:1–95:13. doi : 10.1145/3072959.3073640 . ISSN 0730-0301 . S2CID 207586187 .  
  34. ستوب، كاثرين. "استخدم المحتالون الذكاء الاصطناعي لتقليد صوت الرئيس التنفيذي في قضية جريمة إلكترونية غير عادية" . صحيفة وول ستريت جورنال . تاريخ الاسترجاع: 26 مايو 2024 .
  35. بريستر، توماس. "المحتالون يستنسخون صوت مدير الشركة في عملية سطو على بنك بقيمة 35 مليون دولار، حسبما اكتشفت الشرطة" . فوربس . تم الاطلاع عليه بتاريخ 29 يونيو 2022 .
  36. "الذكاء الاصطناعي التوليدي يجعل عمليات الاحتيال الصوتي أسهل تصديقاً" . أكسيوس . ١٣ يونيو ٢٠٢٣. تم الاطلاع عليه بتاريخ ١٦ يونيو ٢٠٢٣ .
  37. بان، إيمي (15 مايو 2023). "المحتالون الاصطناعيون - يلجأ مجرمو الإنترنت إلى استنساخ الصوت بالذكاء الاصطناعي لابتكار نوع جديد من عمليات الاحتيال" . مدونة مكافي . تم الاطلاع عليه بتاريخ 16 يونيو 2023 .
  38. كوكس، جوزيف (23 فبراير 2023). "كيف تمكنت من اختراق حساب مصرفي باستخدام صوت مُولّد بالذكاء الاصطناعي" . فايس . تم الاطلاع عليه بتاريخ 16 يونيو 2023 .
  39. إيفرشيد، نيك؛ تايلور، جوش (16 مارس 2023). "الذكاء الاصطناعي قادر على خداع تقنية التعرف على الصوت المستخدمة للتحقق من الهوية من قبل سنترلينك ومكتب الضرائب الأسترالي" . صحيفة الغارديان . تاريخ الاسترجاع: 16 يونيو 2023 .
  40. "يستخدم المحتالون الذكاء الاصطناعي لتعزيز خططهم للطوارئ العائلية" . نصائح المستهلك . 17 مارس 2023. تاريخ الاطلاع: 26 مايو 2024 .
  41. "تم نشر تسجيل صوتي مزيف بتقنية التزييف العميق للسير كير ستارمر في اليوم الأول من مؤتمر حزب العمال" .
  42. ميكر، مورغان. "التزييف العميق في انتخابات سلوفاكيا يُظهر أن الذكاء الاصطناعي يُشكل خطرًا على الديمقراطية" . وايرد .
  43. "يواجه المستشار السياسي الذي يقف وراء مكالمة آلية مزيفة منسوبة إلى بايدن اتهامات في نيو هامبشاير" .
  44. «مستشار سياسي متهم بتوظيف ساحر لإرسال رسائل مزعجة للناخبين عبر مكالمات مزيفة منسوبة لبايدن» . القانون والجريمة . ١٥ مارس ٢٠٢٤. تاريخ الاطلاع: ٢٣ مايو ٢٠٢٤ .
  45. ديفيد رايت؛ برايان فونغ؛ برايان فونغ (6 فبراير 2024). "مدعي عام ولاية نيو هامبشاير يعلن عن ربط مكالمة آلية مزيفة باسم بايدن بشركات مقرها تكساس" . سي إن إن .
  46. برايان فونغ (8 فبراير 2024). "لجنة الاتصالات الفيدرالية تصوّت لحظر المكالمات الآلية الاحتيالية التي تستخدم أصواتًا مُولّدة بالذكاء الاصطناعي" . سي إن إن.
  47. "لجنة الاتصالات الفيدرالية تحظر استخدام الأصوات المُولّدة بالذكاء الاصطناعي في المكالمات الآلية | لجنة الاتصالات الفيدرالية" . www.fcc.gov . 2024-02-08 . تاريخ الاطلاع: 2024-05-26 .
  48. كريمر، مارسيا (26 فبراير 2024). "ستيف كريمر يشرح سبب استخدامه للذكاء الاصطناعي لانتحال شخصية الرئيس بايدن في نيو هامبشاير - سي بي إس نيويورك" . www.cbsnews.com . تاريخ الاطلاع: 23 مايو 2024 .
  49. "يواجه مستشار سياسي اتهامات وغرامات بسبب المكالمات الآلية المزيفة التي تدعي أنها تزعم أن بايدن قد قام بها" .
  50. جروكوت، مات (26 سبتمبر 2024). "شركة تستخدم صوت أحد مستخدمي يوتيوب بتقنية الذكاء الاصطناعي دون موافقته" . بيتا بيكسل . تاريخ الاسترجاع: 12 مارس 2026 .
  51. «سرقوا صوتي باستخدام الذكاء الاصطناعي (تحديث: ردّ إليكرو)» . يوتيوب . ٢١ سبتمبر ٢٠٢٤. تاريخ الاطلاع : ١٢ مارس ٢٠٢٦ .
  52. "الجانب المظلم لاستنساخ الصوت بالذكاء الاصطناعي" . يوتيوب . 25 سبتمبر 2024. تم الاطلاع عليه بتاريخ 12 مارس 2026 .
  53. فورستال، لورين (21 أكتوبر 2025). "إطلاق تقنية الكشف عن التشابه على يوتيوب رسميًا" . تيك كرانش . تم الاطلاع عليه بتاريخ 12 مارس 2026 .
  54. ديسرومو، جيف (21 أكتوبر 2025). "يوتيوب تُطلق رسميًا تقنية كشف التشابه للمبدعين" . نحن وسائل التواصل الاجتماعي . تم الاطلاع عليه بتاريخ 12 مارس 2026 .
  55. التزييف العميق حتى تنجح (ملف PDF) (تقرير). غرافيكا. فبراير 2023.
  56. كونغ، جونغيل؛ كيم، جايهيون؛ باي، جايكيونغ (2020-10-23). ​​"HiFi-GAN: شبكات الخصومة التوليدية لتوليف الكلام بكفاءة ودقة عالية". arXiv : 2010.05646 [ cs.SD ].
  57. ^ كومار، كوندان. كومار، ريثيش. دي بواسيير، تيبولت؛ جيستين، لوكاس. تيوه، وي تشن؛ سوتيلو، خوسيه؛ دي بريبيسون، الكسندر؛ بنجيو، يوشوا؛ كورفيل ، آرون (2019/12/08). “MelGAN: شبكات الخصومة التوليدية للتوليف الموجي الشرطي”. أرخايف : 1910.06711 [ eess.AS ].
  58. نغ، أندرو (1 أبريل 2020). "استنساخ الصوت للجماهير" . DeepLearning.AI . مؤرشف من الأصل في 28 ديسمبر 2024. تم الاطلاع عليه في 22 ديسمبر 2024 .
  59. تشاندراسيتا، ريوندي (21 يناير 2021). "إنشاء عبارات صوتية لشخصياتك المفضلة باستخدام التعلم الآلي" . نحو علم البيانات . مؤرشف من الأصل في 21 يناير 2021. تم الاطلاع عليه في 18 ديسمبر 2024 .
  60. "عينات صوتية من "التدريب شبه الخاضع للإشراف لتحسين كفاءة البيانات في توليف الكلام من البداية إلى النهاية"" . 2018-08-30. مؤرشف من الأصل بتاريخ 2020-11-11 . تم الاسترجاع بتاريخ 2022-06-05 .
  61. تيميتوب، يوسف (10 ديسمبر 2024). "مبتكر 15.ai يكشف رحلته من مشروع في معهد ماساتشوستس للتكنولوجيا إلى ظاهرة على الإنترنت" . صحيفة الغارديان . لاغوس، نيجيريا. مؤرشف من الأصل في 28 ديسمبر 2024. تم الاطلاع عليه في 25 ديسمبر 2024 .
  62. ^ كوروساوا، يوكي (19 يناير 2021). "ゲ ム キ ャ ラ 音 声読 み 上 げ ソ フ ト 「15.ai」公開中.『تحت حكاية』や『بوابة』のキャラに好きなセリフを言ってもらえる[ برنامج قراءة صوت شخصيات اللعبة "15.ai" متوفر الآن. احصل على شخصيات من Undertale وPortal لتقول سطورك المرغوبة ] . أوتوماتون (باللغة اليابانية). مؤرشفة من الأصلي في 19 يناير 2021 . تم الاطلاع عليه بتاريخ 18 ديسمبر 2024 .
  63. "مواجهة تحديات وفرص الأصوات الاصطناعية" . OpenAI . 9 مارس 2024. مؤرشف من الأصل في 25 نوفمبر 2024. تم الاطلاع عليه في 18 ديسمبر 2024 .
  64. Babbel.com؛ GmbH، الدرس التاسع. "اللغات العشر الأكثر انتشارًا في العالم" . مجلة Babbel . تاريخ الاسترجاع: 30 يونيو 2022 .
  65. نجفيان، مريم؛ راسل، مارتن (سبتمبر 2020). "التعرف التلقائي على اللهجة كأداة تحليلية للتعرف التلقائي على الكلام المقاوم للهجة" . اتصالات الكلام . 122 : 44-55 . doi : 10.1016/j.specom.2020.05.003 . S2CID 225778214 . 
  66. ^ ليو، شياو؛ تشانغ، فانجين؛ هو، زينيو؛ ميان، لي؛ وانغ، تشاويو؛ تشانغ، جينغ. تانغ، جي (2021). “التعلم الخاضع للإشراف الذاتي: توليدي أو مقارن”. معاملات IEEE على المعرفة وهندسة البيانات . 35 (1): 857– 876. أرخايف : 2006.08218 . دوى : 10.1109/TKDE.2021.3090866 . ردمك 1558-2191 . S2CID 219687051 .  
  67. ريمون، إنبال؛ غال، أورين؛ بيرموتير، حاييم (2025). "كشف التزييف العميق: الاستفادة من التحسينات وتغير الميزات للكشف عن الكلام المزيف". arXiv : 2501.05545 [ cs.SD ].
  68. رشيد، محمد مأمونور؛ لي، سوك هوان؛ كوون، كي ريونغ (2021). "تقنية سلسلة الكتل لمكافحة التزييف العميق وحماية سلامة الفيديو/الصورة" . مجلة الجمعية الكورية للوسائط المتعددة . 24 (8): 1044-1058 . doi : 10.9717/kmms.2021.24.8.1044 . ISSN 1229-7771 . 
  69. فراغا-لاماس، باولا؛ فرنانديز-كاراميس، تياغو م. (2019-10-20). "الأخبار الكاذبة، والمعلومات المضللة، والتزييف العميق: الاستفادة من تقنيات السجلات الموزعة وتقنية سلسلة الكتل لمكافحة الخداع الرقمي والواقع المزيف". مجلة متخصصي تكنولوجيا المعلومات . 22 (2): 53-59 . arXiv : 1904.05386 . doi : 10.1109/MITP.2020.2977589 .
  70. كي تشان، كريستوفر تشون؛ كومار، فيمال؛ ديلاني، ستيفن؛ غوتشو، مونخجارغال (سبتمبر 2020). "مكافحة التزييف العميق: الشبكات العصبية متعددة الطبقات طويلة المدى وتقنية سلسلة الكتل كدليل على أصالة الوسائط الرقمية". المؤتمر الدولي المشترك بين معهد مهندسي الكهرباء والإلكترونيات والاتحاد الدولي للاتصالات لعام 2020 حول الذكاء الاصطناعي من أجل الخير (AI4G) . الصفحات 55-62 . doi : 10.1109/AI4G50087.2020.9311067 . ISBN  978-1-7281-7031-2. S2CID 231618774 . 
  71. ميتال، تريشا؛ بهاتاشاريا، أوتاران؛ تشاندرا، روهان؛ بيرا، أنيكيت؛ مانوشا، دينيش (12 أكتوبر 2020)، "العواطف لا تكذب: طريقة للكشف عن التزييف العميق السمعي البصري باستخدام الإشارات العاطفية" ، وقائع المؤتمر الدولي الثامن والعشرين لجمعية آلات الحوسبة حول الوسائط المتعددة ، نيويورك، نيويورك، الولايات المتحدة الأمريكية: جمعية آلات الحوسبة، الصفحات 2823-2832 ، doi : 10.1145/3394171.3413570 ، ISBN  978-1-4503-7988-5، S2CID 220935571 ، تم استرجاعه بتاريخ 29-06-2022 
  72. كونتي، إيمانويل؛ سالفي، دافيدي؛ بوريللي، كلارا؛ هوسلر، برايان؛ بيستاجيني، باولو؛ أنتوناتشي، فابيو؛ سارتي، أوغوستو؛ ستام، ماثيو سي؛ توبارو، ستيفانو (23 مايو 2022). "الكشف عن الكلام المُزيّف بتقنية التزييف العميق من خلال التعرّف على المشاعر: منهج دلالي". المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات (ICASSP) لعام 2022، الصادر عن معهد مهندسي الكهرباء والإلكترونيات ( IEEE). سنغافورة: معهد مهندسي الكهرباء والإلكترونيات. الصفحات 8962-8966 . doi : 10.1109/ICASSP43922.2022.9747186 . hdl : 11311/1220518 . ISBN  978-1-6654-0540-9. S2CID 249436701 . 
  73. هوسلر، برايان؛ سالفي، دافيد؛ موراي، أنتوني؛ أنتوناتشي، فابيو؛ بيستاجيني، باولو؛ توبارو، ستيفانو؛ ستام، ماثيو سي. (يونيو 2021). "هل تشعر تقنية التزييف العميق بالعواطف؟ منهج دلالي للكشف عن التزييف العميق من خلال التناقضات العاطفية". مؤتمر IEEE/CVF لعام 2021 حول ورش عمل رؤية الحاسوب والتعرف على الأنماط (CVPRW) . ناشفيل، تينيسي، الولايات المتحدة الأمريكية: IEEE. الصفحات 1013-1022 . doi : 10.1109/CVPRW53098.2021.00112 . hdl : 11311/1183572 . ISBN  978-1-6654-4899-4. S2CID 235679849 . 
  74. ^ مولر، نيكولاس م. زيمبين، بافيل؛ ديكمان، فرانزيسكا؛ فروغيار، آدم؛ بوتنغر ، كونستانتين (2022/04/21). “هل يتم تعميم اكتشاف Deepfake الصوتي؟”. أرخايف : 2203.16263 [ cs.SD ].
  75. تشانغ، يو؛ جيانغ، فاي؛ دوان، تشياو (2021). "التعلم أحادي الفئة للكشف عن انتحال الصوت الاصطناعي". رسائل معالجة الإشارات IEEE . 28 : 937-941 . arXiv : 2010.13995 . Bibcode : 2021ISPL...28..937Z . doi : 10.1109/LSP.2021.3076358 . ISSN 1558-2361 . S2CID 235077416 .  
  76. "لوائح التوليف العميق لإدارة الفضاء الإلكتروني الصينية" . يناير 2023.
  77. 1 2 "SAM.gov" . sam.gov . تم الاسترجاع في 29-06-2022 .
  78. "برنامج سيمافور" . www.darpa.mil . تم الاطلاع عليه بتاريخ 1 يوليو 2022 .
  79. "برنامج داربا ميديفور" . govtribe.com . تم الاطلاع عليه بتاريخ 29-06-2022 .
  80. "برنامج MediFor" . www.darpa.mil . تم الاطلاع عليه بتاريخ 1 يوليو 2022 .
  81. «داربا تعلن عن اختيار فرق بحثية لبرنامج الطب الشرعي الدلالي» . www.darpa.mil . تاريخ الاطلاع: 1 يوليو 2022 .
  82. "PREMIER" . sites.google.com . تم الاطلاع عليه بتاريخ 2022-07-01 .
  83. "مشروع بريمير" . sites.google.com . تم الاطلاع عليه بتاريخ 29-06-2022 .
  84. بيرد، جوردان ج.؛ لطفي، أحمد (2023). "الكشف في الوقت الحقيقي عن الكلام المُولّد بالذكاء الاصطناعي لتحويل الصوت بتقنية التزييف العميق". arXiv : 2308.12734 [ cs.SD ].
  85. ^ ياماغيشي، جونيتشي؛ وانغ، شين؛ توديسكو، ماسيميليانو؛ شهيد الله، ماريلاند؛ باتينو، خوسيه. نوتش، أندرياس؛ ليو، شيويتشن؛ لي، كونغ آيك؛ كينونين، تومي؛ إيفانز، نيكولاس. ديلجادو ، هيكتور (2021-09-01). “ASVspoof 2021: تسريع التقدم في اكتشاف الكلام المخادع والمزيف العميق”. أرخايف : 2109.00537 [ eess.AS ].
  86. "الكشف عن التزييف العميق الصوتي: ICASSP 2022" . جمعية معالجة الإشارات التابعة لمعهد مهندسي الكهرباء والإلكترونيات . 17 ديسمبر 2021. تاريخ الاسترجاع: 1 يوليو 2022 .
  87. ^ يي، جيانغيان؛ فو، رويبو؛ تاو، جيانهوا؛ ني، شواي؛ ما، هاوكسين؛ وانغ، تشنغ لونغ. وانغ تاو. تيان، زينجكون؛ باي، يي؛ فان، كونهانج؛ ليانغ ، شان (2022/02/26). “إضافة 2022: أول تحدي للكشف عن التوليف العميق للصوت”. أرخايف : 2202.08433 [ cs.SD ].
  88. "ورشة عمل مشتركة لتحدي بليزارد وتحدي تحويل الصوت 2020 - SynSIG" . www.synsig.org . مؤرشف من الأصل بتاريخ 2022-07-02 . تم الاطلاع عليه بتاريخ 2022-07-01 .
  89. "«توقفوا عن استخدام صوتي» - المذيع الجديد لشركة سكوت ريل هو نسخة مُستنسخة مني بواسطة الذكاء الاصطناعي . بي بي سي نيوز . 27 مايو 2025. تاريخ الاطلاع: 28 مايو 2025 .
  90. «المعلقة الصوتية غايان بوتر تحث شركة سكوت ريل على إزالة صوتها من الإعلانات الجديدة التي تستخدم الذكاء الاصطناعي» . سكاي نيوز . تاريخ الاطلاع: ٢٨ مايو ٢٠٢٥ .
  91. إنجلش، ديفيد ليسك | بول (27 مايو 2025). "ممثلة تشعر بأنها تعرضت للخداع من قبل نظام التعليق الصوتي الجديد المدعوم بالذكاء الاصطناعي لشركة سكوت ريل" . www.thetimes.com . تاريخ الاطلاع: 28 مايو 2025 .
  92. «لقد قمتُ بالأداء الصوتي لقطارات سكوت ريل لمدة 20 عامًا، وتم استبدالي بالذكاء الاصطناعي دون إبلاغي» . صحيفة ذا ناشيونال . 30 مايو 2025. تاريخ الاطلاع: 17 أغسطس 2025 .
  93. «سكوت ريل تستبدل نظام الذكاء الاصطناعي الصوتي المثير للجدل في القطارات» . بي بي سي نيوز . 25 أغسطس 2025. تاريخ الاطلاع: 27 أغسطس 2025 .