بلو
خوارزمية BLEU ( التقييم الثنائي اللغة ) هي خوارزمية لتقييم جودة النصوص المترجمة آليًا من لغة طبيعية إلى أخرى. تُعتبر الجودة هي مدى تطابق مخرجات الآلة مع مخرجات الإنسان: "كلما اقتربت الترجمة الآلية من الترجمة البشرية الاحترافية، كانت أفضل" - هذه هي الفكرة الأساسية وراء خوارزمية BLEU.تم ابتكار مقياس BLEU في شركة IBM عام 2001، وكان من أوائل المقاييس التي ادعت وجود ارتباط قوي بينها وبين الأحكام البشرية للجودة.ولا يزال أحد أكثر المقاييس الآلية وغير المكلفة شيوعًا.
تُحسب الدرجات لكل مقطع مترجم على حدة - عادةً ما يكون جملة - بمقارنته بمجموعة من الترجمات المرجعية عالية الجودة. ثم يُحسب متوسط هذه الدرجات على كامل النص للوصول إلى تقدير للجودة الإجمالية للترجمة. ولا يُؤخذ في الاعتبار وضوح النص أو صحته النحوية.
تُنتج خوارزمية BLEU دائمًا قيمة عددية بين 0 و1. تشير هذه القيمة إلى مدى تشابه النص المرشح مع النصوص المرجعية، حيث تدل القيم الأقرب إلى 1 على نصوص أكثر تشابهًا. نادرًا ما تحصل الترجمات البشرية على درجة 1، لأن ذلك يعني أن النص المرشح مطابق تمامًا لإحدى الترجمات المرجعية. لهذا السبب، ليس من الضروري الحصول على درجة 1. نظرًا لوجود فرص أكبر للمطابقة، فإن إضافة ترجمات مرجعية إضافية ستزيد من درجة BLEU.
التعريف الرياضي
الإعداد الأساسي
تتطلب المحاولة الأساسية الأولى لتحديد درجة BLEU وسيطين: سلسلة مرشحةوقائمة بسلاسل المراجعالفكرة هي أنينبغي أن تكون قريبة من 1 عندمايشبه إلىوإلا فإنها تقترب من الصفر.
على سبيل المثال، تشبه درجة BLEU محاولة مدرس لغة تقييم جودة ترجمة أحد الطلابمن خلال التحقق من مدى تطابقها مع الإجابات المرجعية.
بما أنه في معالجة اللغة الطبيعية ، يجب تقييم مجموعة كبيرة من السلاسل المرشحة، فيجب تعميم درجة BLEU إلى الحالة التي يكون فيها لدينا قائمة من M من السلاسل المرشحة (تسمى " مجموعة النصوص ").ولكل سلسلة مرشحة، قائمة بسلاسل المرشحين المرجعية.
بفرض أي سلسلة نصيةوأي عدد صحيح، نُعرّف مجموعة n-grams الخاصة بها على أنهالاحظ أنها مجموعة من العناصر الفريدة، وليست مجموعة متعددة تسمح بوجود عناصر زائدة، بحيث، على سبيل المثال،.
بافتراض وجود سلسلتين نصيتينحدد عدد السلاسل الفرعيةأن يكون عدد مرات الظهوركجزء من. على سبيل المثال،.
الآن، قم بتحديد مجموعة بيانات مرشحة، ومجموعة النصوص المرشحة المرجعيةحيث كل.
دقة n-gram المعدلة
عرّف دالة دقة n-gram المعدلة على النحو التاليإنّ نموذج n-gram المعدّل، الذي يبدو معقداً، ليس سوى تعميم مباشر للحالة النموذجية: جملة مرشحة واحدة وجملة مرجعية واحدة. في هذه الحالة، يكونللوصول إلى هذا التعبير، نبدأ بمجموع عدد الكلمات المتجاورة (n-gram) الأكثر وضوحًا: يقيس هذا المقدار عدد الجمل المكونة من n-grams في الجملة المرجعية التي يتم تكرارها في الجملة المرشحة. لاحظ أننا نحسب السلاسل الفرعية المكونة من n-grams ، وليس الجمل المكونة من n-grams . على سبيل المثال، عندماجميع السلاسل الفرعية المكونة من 2 في(ab و ba) يظهران فيثلاث مرات لكل منهما، لذا فإن العدد هو 6 وليس 2.
في الحالة المذكورة أعلاه، يكون النص المرشح قصيرًا جدًا. بدلًا من ظهوره ثلاث مراتيحتوي على واحد فقط، لذلك نضيف دالة الحد الأدنى لتصحيح ذلك:لا يمكن استخدام مجموع هذا العدد للمقارنة بين الجمل، لأنه غير مُعَيَّر. فإذا كانت كل من الجملة المرجعية والجملة المرشحة طويلتين، فقد يكون العدد كبيرًا، حتى لو كانت الجملة المرشحة ذات جودة رديئة للغاية. لذلك نقوم بتطبيعه.يتم التوحيد بحيث يكون دائمًا رقمًا فيمما يسمح بإجراء مقارنات ذات مغزى بين مجموعات النصوص. تكون قيمته صفرًا إذا لم تكن أي من السلاسل الفرعية المكونة من n- في النص المرشح موجودة في النص المرجعي. وتكون قيمته واحدًا إذا ظهرت كل سلسلة n-gram في النص المرشح في النص المرجعي، على الأقل بنفس عدد مرات ظهورها في النص المرشح. وعلى وجه الخصوص، إذا كان النص المرشح سلسلة فرعية من النص المرجعي، فإن قيمته تكون واحدًا.
عقوبة الإيجاز
إن دقة n-gram المعدلة تعطي درجة عالية بشكل غير مبرر للسلاسل المرشحة التي تعتبر " تلغرافية "، أي تحتوي على جميع n-grams من السلاسل المرجعية، ولكن لأقل عدد ممكن من المرات.
من أجل معاقبة السلاسل المرشحة القصيرة جدًا، حدد عقوبة الإيجاز على النحو التالي:أينهو الجانب الإيجابي من.
- متىعقوبة الإيجازوهذا يعني أننا لا نعاقب المرشحين ذوي المؤهلات الطويلة، وإنما نعاقب المرشحين ذوي المؤهلات القصيرة فقط.
- متىعقوبة الإيجاز
يمثل طول مجموعة النصوص المرشحة، أيأينهو طول.
يمثل طول مجموعة النصوص المرجعية الفعالة ، أيأينأي الجملة منطوله أقرب ما يكون إلىقدر الإمكان.
الصيغة النهائية
لا يوجد تعريف واحد لـ BLEU، بل مجموعة كاملة من التعريفات، يتم تحديدها بواسطة متجه الترجيح.هو توزيع احتمالي على، إنه،، و.
مع خيار، درجة BLEU هيبعبارة أخرى، هو المتوسط الهندسي المرجح لجميع دقة نماذج n-gram المعدلة، مضروبًا في معامل الاختصار. نستخدم المتوسط الهندسي المرجح، بدلًا من المتوسط الحسابي المرجح، لتفضيل مجموعات النصوص المرشحة التي تُعتبر جيدة في آنٍ واحد وفقًا لدقة نماذج n-gram المتعددة.
الخيار الأكثر شيوعًا، وهو الخيار الموصى به في الورقة الأصلية، هو[ 1 ]
الخوارزمية
ويتضح ذلك في المثال التالي من بابينيني وآخرون (2002):
| مُرَشَّح | ال | ال | ال | ال | ال | ال | ال |
|---|---|---|---|---|---|---|---|
| المرجع 1 | ال | قطة | يكون | على | ال | حصيرة | |
| المرجع 2 | هناك | يكون | أ | قطة | على | ال | حصيرة |
من بين الكلمات السبع في الترجمة المرشحة، تظهر جميعها في الترجمات المرجعية. وبالتالي، تُمنح الترجمة المرشحة دقة أحادية الكلمات تبلغ،
أينعدد الكلمات من النص المرشح التي تم العثور عليها في المرجع، ويمثل هذا العدد الإجمالي للكلمات في النص المرشح. وهذه درجة مثالية، على الرغم من أن الترجمة المرشحة أعلاه لا تحتفظ إلا بجزء ضئيل من محتوى أي من المرجعين.
التعديل الذي يُجريه خوارزمية BLEU بسيط للغاية. فلكل كلمة في الترجمة المرشحة، تأخذ الخوارزمية أقصى عدد إجمالي لها.في أي من الترجمات المرجعية. في المثال أعلاه، تظهر كلمة "the" مرتين في المرجع 1، ومرة واحدة في المرجع 2. وبالتالي.
بالنسبة للترجمة المرشحة، العدديتم اقتطاع كل كلمة إلى حد أقصى قدرهبالنسبة لتلك الكلمة. في هذه الحالة، "the" لهاو، هكذايتم اقتطاعها إلى 2. هذه الأعداد المقتطعةثم تُجمع النتائج على جميع الكلمات المميزة في الترجمة المرشحة. بعد ذلك، يُقسم هذا المجموع على العدد الإجمالي للكلمات المفردة في الترجمة المرشحة. في المثال أعلاه، ستكون درجة دقة الكلمات المفردة المُعدّلة كما يلي:
لكن عمليًا، لا يُعدّ استخدام الكلمات المفردة كوحدة للمقارنة مثاليًا. بدلًا من ذلك، يحسب BLEU نفس مقياس الدقة المُعدّل باستخدام n-grams . الطول الذي له "أعلى ارتباط بالأحكام البشرية أحادية اللغة".تبين أن النتيجة أربعة. وتُستخدم درجات الكلمات المفردة لتقييم مدى كفاية الترجمة، أي كمية المعلومات المحفوظة. أما درجات الكلمات الطويلة فتُستخدم لتقييم سلاسة الترجمة، أو مدى تشابهها مع اللغة الإنجليزية السليمة.
| نموذج | مجموعة غرامات | نتيجة |
|---|---|---|
| يونيغرام | "الـ", "الـ", "قطة" | |
| أحاديات الحروف المجمعة | "the"*2، "cat"*1 | |
| ثنائيات الكلمات | "الـ"، "القطة" |
مثال على ترجمة مرشحة لنفس المراجع المذكورة أعلاه قد يكون كالتالي:
- القطة
في هذا المثال، ستكون دقة الكلمات المفردة المعدلة كما يلي:
بما أن كلمتي "the" و"cat" تظهران مرة واحدة لكل منهما في النص المرشح، فإن العدد الإجمالي للكلمات هو كلمتان. ستكون دقة الثنائيات المعدلة كالتالي:كما هو الحال مع الكلمة الثنائية، تظهر كلمة "القطة" مرة واحدة في المرشح. وقد أشير إلى أن الدقة عادة ما تقترن بالاستدعاء للتغلب على هذه المشكلة.، كما سيكون استدعاء الكلمات المفردة في هذا المثالأوتكمن المشكلة في أنه نظرًا لوجود ترجمات مرجعية متعددة، فقد تؤدي الترجمة السيئة بسهولة إلى تضخيم الاستدعاء، مثل الترجمة التي تتكون من جميع الكلمات في كل مرجع.
لحساب درجة المجموعة الكاملة، تُدمج درجات الدقة المُعدّلة للمقاطع باستخدام المتوسط الهندسي مضروبًا في معامل جزاء الإيجاز لمنع المقاطع القصيرة جدًا من الحصول على درجة عالية جدًا. لنفترض أن r هو الطول الإجمالي لمجموعة النصوص المرجعية، و c هو الطول الإجمالي لمجموعة نصوص الترجمة.، وتُطبق عقوبة الإيجاز، والتي تُعرّف بأنها(في حالة وجود جمل مرجعية متعددة، يُعتبر r مجموع أطوال الجمل التي تكون أطوالها أقرب إلى أطوال الجمل المرشحة. ومع ذلك، في نسخة المقياس المستخدمة في تقييمات NIST قبل عام 2009، تم استخدام أقصر جملة مرجعية بدلاً من ذلك.)
يُعدّ iBLEU نسخة تفاعلية من BLEU تُمكّن المستخدم من فحص نتائج BLEU التي حصلت عليها الترجمات المرشحة بصريًا. كما يُتيح مقارنة نظامين مختلفين بطريقة بصرية وتفاعلية، وهو أمر مفيد لتطوير الأنظمة.
أداء
كثيراً ما ورد أن مقياس BLEU يرتبط ارتباطاً وثيقاً بالحكم البشري.ولا يزال معيارًا لتقييم أي مقياس تقييم جديد. ومع ذلك، فقد وُجهت إليه بعض الانتقادات. فقد لوحظ أنه على الرغم من قدرته من حيث المبدأ على تقييم ترجمات أي لغة، إلا أن معيار BLEU، بصيغته الحالية، لا يستطيع التعامل مع اللغات التي تفتقر إلى حدود الكلمات.صُمم هذا النظام ليُستخدم مع عدة مراجع للترجمة، ولكنه عمليًا يُستخدم مع مرجع واحد فقط. [ 2 ] يُعرف نظام BLEU باعتماده الكبير على تقنية التجزئة ، والنتائج المحققة باستخدام تقنيات مختلفة غير قابلة للمقارنة (وهو أمر غالبًا ما يُغفل عنه)؛ ولتحسين إمكانية التكرار والمقارنة، تم تصميم نسخة SacreBLEU. [ 2 ]
لقد قيل أنه على الرغم من أن BLEU له مزايا كبيرة، إلا أنه لا يوجد ضمان بأن الزيادة في درجة BLEU هي مؤشر على تحسن جودة الترجمة.
انظر أيضاً
ملحوظات
- ^ بابينيني، ك.، وآخرون (2002)
- ^ بابينيني، ك.، وآخرون (2002)
- ^ كوفلين، د. (2003)
- ^ بابينيني، ك.، وآخرون (2002)
- ^ بابينيني، ك.، وآخرون (2002)
- ^ بابينيني، ك.، وآخرون (2002)
- ^ كوفلين، د. (2003)
- ^ دودينغتون، ج. (2002)
- ^ دينوال، إي. وليباج، واي. (2005)
- ^ كاليسون-بيرش، سي.، أوزبورن، إم. وكوهن، بي. (2006)
- ^ لي، أ. وبرزيبوكي، م. (2005)
- ^ كاليسون-بيرش، سي.، أوزبورن، إم. وكوهن، بي. (2006)
- ^ لين، سي. وأوتش، إف. (2004)
- ^ كاليسون-بيرش، سي.، أوزبورن، إم. وكوهن، بي. (2006)
- ^ مادناني، ن. (2011)
مراجع
- ↑Papineni, Kishore; Roukos, Salim; Ward, Todd; Zhu, Wei-Jing (2001). "BLEU". Proceedings of the 40th Annual Meeting on Association for Computational Linguistics - ACL '02. Morristown, NJ, USA: Association for Computational Linguistics: 311. doi:10.3115/1073083.1073135. S2CID 11080756.
- 12Marie, Benjamin (5 November 2022). "BLEU: A Misunderstood Metric from Another Age". Towards Data Science.
Bibliography
- Papineni, K.; Roukos, S.; Ward, T.; Zhu, W. J. (2002). BLEU: a method for automatic evaluation of machine translation(PDF). ACL-2002: 40th Annual meeting of the Association for Computational Linguistics. pp. 311–318. CiteSeerX 10.1.1.19.9416.
- Papineni, K., Roukos, S., Ward, T., Henderson, J and Reeder, F. (2002). "Corpus-based Comprehensive and Diagnostic MT Evaluation: Initial Arabic, Chinese, French, and Spanish ResultsArchived 2016-03-04 at the Wayback Machine" in Proceedings of Human Language Technology 2002, San Diego, pp. 132–137
- Callison-Burch, C., Osborne, M. and Koehn, P. (2006) "Re-evaluating the Role of BLEU in Machine Translation ResearchArchived 2008-12-04 at the Wayback Machine" in 11th Conference of the European Chapter of the Association for Computational Linguistics: EACL 2006 pp. 249–256
- Doddington, G. (2002) "Automatic evaluation of machine translation quality using n-gram cooccurrence statisticsArchived 2013-10-12 at the Wayback Machine" in Proceedings of the Human Language Technology Conference (HLT), San Diego, CA pp. 128–132
- Coughlin, D. (2003) "Correlating Automated and Human Assessments of Machine Translation QualityArchived 2008-09-06 at the Wayback Machine" in MT Summit IX, New Orleans, USA pp. 23–27
- Denoual, E. and Lepage, Y. (2005) "BLEU in characters: towards automatic MT evaluation in languages without word delimitersArchived 2011-07-18 at the Wayback Machine" in Companion Volume to the Proceedings of the Second International Joint Conference on Natural Language Processing pp. 81–86
- Lee, A. and Przybocki, M. (2005) NIST 2005 machine translation evaluation official results
- لين، سي. وأوتش، إف. (2004) " التقييم التلقائي لجودة الترجمة الآلية باستخدام أطول تسلسل فرعي مشترك وإحصائيات تخطي الثنائيات مؤرشفة في 2008-07-05 على Wayback Machine " في وقائع الاجتماع السنوي الثاني والأربعين لجمعية اللغويات الحاسوبية .
- مادناني، ن. (2011). " iBLEU: التقييم التفاعلي وتصحيح أخطاء أنظمة الترجمة الآلية الإحصائية " في "وقائع المؤتمر الدولي الخامس لمعهد مهندسي الكهرباء والإلكترونيات حول الحوسبة الدلالية (Demos)، بالو ألتو، كاليفورنيا"، الصفحات 213-214
روابط خارجية
- BLEU - محاضرة تقييم ثنائية اللغة ضمن دورة الترجمة الآلية، مقدمة من معهد كارلسروه للتكنولوجيا ، عبر منصة كورسيرا.
- تقييم الترجمة الآلية
