بلو

خوارزمية BLEU ( التقييم الثنائي اللغة ) هي خوارزمية لتقييم جودة النصوص المترجمة آليًا من لغة طبيعية إلى أخرى. تُعتبر الجودة هي مدى تطابق مخرجات الآلة مع مخرجات الإنسان: "كلما اقتربت الترجمة الآلية من الترجمة البشرية الاحترافية، كانت أفضل" - هذه هي الفكرة الأساسية وراء خوارزمية BLEU.تم ابتكار مقياس BLEU في شركة IBM عام 2001، وكان من أوائل المقاييس التي ادعت وجود ارتباط قوي بينها وبين الأحكام البشرية للجودة.ولا يزال أحد أكثر المقاييس الآلية وغير المكلفة شيوعًا.

تُحسب الدرجات لكل مقطع مترجم على حدة - عادةً ما يكون جملة - بمقارنته بمجموعة من الترجمات المرجعية عالية الجودة. ثم يُحسب متوسط ​​هذه الدرجات على كامل النص للوصول إلى تقدير للجودة الإجمالية للترجمة. ولا يُؤخذ في الاعتبار وضوح النص أو صحته النحوية.

تُنتج خوارزمية BLEU دائمًا قيمة عددية بين 0 و1. تشير هذه القيمة إلى مدى تشابه النص المرشح مع النصوص المرجعية، حيث تدل القيم الأقرب إلى 1 على نصوص أكثر تشابهًا. نادرًا ما تحصل الترجمات البشرية على درجة 1، لأن ذلك يعني أن النص المرشح مطابق تمامًا لإحدى الترجمات المرجعية. لهذا السبب، ليس من الضروري الحصول على درجة 1. نظرًا لوجود فرص أكبر للمطابقة، فإن إضافة ترجمات مرجعية إضافية ستزيد من درجة BLEU.

التعريف الرياضي

الإعداد الأساسي

تتطلب المحاولة الأساسية الأولى لتحديد درجة BLEU وسيطين: سلسلة مرشحةy^{\displaystyle {\hat {y}}}وقائمة بسلاسل المراجع(y(1)،...،y(شمال)){\displaystyle (y^{(1)},...,y^{(N)})}الفكرة هي أنبلهـيو(y^؛y(1)،...،y(شمال)){\displaystyle BLEU({\hat {y}};y^{(1)},...,y^{(N)})}ينبغي أن تكون قريبة من 1 عندماy^{\displaystyle {\hat {y}}}يشبه إلىy(1)،...،y(شمال){\displaystyle ذ^{(1)},...,ص^{(N)}}وإلا فإنها تقترب من الصفر.

على سبيل المثال، تشبه درجة BLEU محاولة مدرس لغة تقييم جودة ترجمة أحد الطلابy^{\displaystyle {\hat {y}}}من خلال التحقق من مدى تطابقها مع الإجابات المرجعيةy(1)،...،y(شمال){\displaystyle ذ^{(1)},...,ص^{(N)}}.

بما أنه في معالجة اللغة الطبيعية ، يجب تقييم مجموعة كبيرة من السلاسل المرشحة، فيجب تعميم درجة BLEU إلى الحالة التي يكون فيها لدينا قائمة من M من السلاسل المرشحة (تسمى " مجموعة النصوص ").(y^(1)،،y^(م)){\displaystyle ({\hat {y}}^{(1)},\cdots ,{\hat {y}}^{(M)})}ولكل سلسلة مرشحةy^(أنا){\displaystyle {\hat {y}}^{(i)}}، قائمة بسلاسل المرشحين المرجعيةSأنا:=(y(أنا،1)،...،y(أنا،شمالأنا)){\displaystyle S_{i}:=(y^{(i,1)},...,y^{(i,N_{i})})}.

بفرض أي سلسلة نصيةy=y1y2yك{\displaystyle y=y_{1}y_{2}\cdots y_{K}}وأي عدد صحيحن1{\displaystyle n\geq 1}، نُعرّف مجموعة n-grams الخاصة بها على أنهاجين(y)={y1yن،y2yن+1،،yك-ن+1yك}{\displaystyle G_{n}(y)=\{y_{1}\cdots y_{n},y_{2}\cdots y_{n+1},\cdots ,y_{K-n+1}\cdots y_{K}\}}لاحظ أنها مجموعة من العناصر الفريدة، وليست مجموعة متعددة تسمح بوجود عناصر زائدة، بحيث، على سبيل المثال،جي2(أبأب)={أب،بأ}{\displaystyle G_{2}(abab)=\{ab,ba\}}.

بافتراض وجود سلسلتين نصيتينs،y{\displaystyle s,y}حدد عدد السلاسل الفرعيةج(s،y){\displaystyle C(s,y)}أن يكون عدد مرات الظهورs{\displaystyle s}كجزء منy{\displaystyle y}. على سبيل المثال،ج(أب،أبجبأب)=2{\displaystyle C(ab,abcbab)=2}.

الآن، قم بتحديد مجموعة بيانات مرشحةS^:=(y^(1)،،y^(م)){\displaystyle {\hat {S}}:=({\hat {y}}^{(1)},\cdots ,{\hat {y}}^{(M)})}، ومجموعة النصوص المرشحة المرجعيةS=(S1،،Sم){\displaystyle S=(S_{1},\cdots ,S_{M})}حيث كلSأنا:=(y(أنا،1)،...،y(أنا،شمالأنا)){\displaystyle S_{i}:=(y^{(i,1)},...,y^{(i,N_{i})})}.

دقة n-gram المعدلة

عرّف دالة دقة n-gram المعدلة على النحو التاليصن(S^؛S):=أنا=1مsجين(y^(أنا))مين(ج(s،y^(أنا))،الأعلىySأناج(s،y))أنا=1مsجين(y^(أنا))ج(s،y^(أنا)){\displaystyle p_{n}({\hat {S}};S):={\frac {\sum _{i=1}^{M}\sum _{s\in G_{n}({\hat {y}}^{(i)})}\min(C(s,{\hat {y}}^{(i)}),\max _{y\in S_{i}}C(s,y))}{\sum _{i=1}^{M}\sum _{s\in G_{n}({\hat {y}}^{(i)})}C(s,{\hat {y}}^{(i)})}}}إنّ نموذج n-gram المعدّل، الذي يبدو معقداً، ليس سوى تعميم مباشر للحالة النموذجية: جملة مرشحة واحدة وجملة مرجعية واحدة. في هذه الحالة، يكونصن({y^}؛{y})=sجين(y^)مين(ج(s،y^)،ج(s،y))sجين(y^)ج(s،y^){\displaystyle p_{n}(\{{\hat {y}}\};\{y\})={\frac {\sum _{s\in G_{n}({\hat {y}})}\min(C(s,{\hat {y}}),C(s,y))}{\sum _{s\in G_{n}({\hat {y}})}C(s,{\hat {ص}})}}}للوصول إلى هذا التعبير، نبدأ بمجموع عدد الكلمات المتجاورة (n-gram) الأكثر وضوحًا:sجين(y^)ج(s،y)=عدد السلاسل الفرعية ذات n- في y^ التي تظهر في y{\displaystyle \sum _{s\in G_{n}({\hat {y}})}C(s,y)={\text{عدد السلاسل الفرعية ذات n- في }}{\hat {y}}{\text{ التي تظهر في }}y} يقيس هذا المقدار عدد الجمل المكونة من n-grams في الجملة المرجعية التي يتم تكرارها في الجملة المرشحة. لاحظ أننا نحسب السلاسل الفرعية المكونة من n-grams ، وليس الجمل المكونة من n-grams . على سبيل المثال، عندماy^=أبأ،y=أبأبأبأ،ن=2{\displaystyle {\hat {y}}=aba,y=abababa,n=2}جميع السلاسل الفرعية المكونة من 2 فيy^{\displaystyle {\hat {y}}}(ab و ba) يظهران فيy{\displaystyle y}ثلاث مرات لكل منهما، لذا فإن العدد هو 6 وليس 2.

في الحالة المذكورة أعلاه، يكون النص المرشح قصيرًا جدًا. بدلًا من ظهوره ثلاث مراتأب{\displaystyle ab}يحتوي على واحد فقط، لذلك نضيف دالة الحد الأدنى لتصحيح ذلك:sجين(y^)مين(ج(s،y^)،ج(s،y)){\displaystyle {\sum _{s\in G_{n}({\hat {y}})}\min(C(s,{\hat {y}}),C(s,y))}}لا يمكن استخدام مجموع هذا العدد للمقارنة بين الجمل، لأنه غير مُعَيَّر. فإذا كانت كل من الجملة المرجعية والجملة المرشحة طويلتين، فقد يكون العدد كبيرًا، حتى لو كانت الجملة المرشحة ذات جودة رديئة للغاية. لذلك نقوم بتطبيعه.sجين(y^)مين(ج(s،y^)،ج(s،y))sجين(y^)ج(s،y^){\displaystyle {\frac {\sum _{s\in G_{n}({\hat {y}})}\min(C(s,{\hat {y}}),C(s,y))}{\sum _{s\in G_{n}({\hat {y}})}C(s,{\hat {y}})}}}يتم التوحيد بحيث يكون دائمًا رقمًا في[0،1]{\displaystyle [0,1]}مما يسمح بإجراء مقارنات ذات مغزى بين مجموعات النصوص. تكون قيمته صفرًا إذا لم تكن أي من السلاسل الفرعية المكونة من n- في النص المرشح موجودة في النص المرجعي. وتكون قيمته واحدًا إذا ظهرت كل سلسلة n-gram في النص المرشح في النص المرجعي، على الأقل بنفس عدد مرات ظهورها في النص المرشح. وعلى وجه الخصوص، إذا كان النص المرشح سلسلة فرعية من النص المرجعي، فإن قيمته تكون واحدًا.

عقوبة الإيجاز

إن دقة n-gram المعدلة تعطي درجة عالية بشكل غير مبرر للسلاسل المرشحة التي تعتبر " تلغرافية "، أي تحتوي على جميع n-grams من السلاسل المرجعية، ولكن لأقل عدد ممكن من المرات.

من أجل معاقبة السلاسل المرشحة القصيرة جدًا، حدد عقوبة الإيجاز على النحو التالي:بP(S^؛S):=هـ-(ر/ج-1)+{\displaystyle BP({\hat {S}};S):=e^{-(r/c-1)^{+}}}أين(ر/ج-1)+=الأعلى(0،ر/ج-1){\displaystyle (r/c-1)^{+}=\max(0,r/c-1)}هو الجانب الإيجابي منر/ج-1{\displaystyle r/c-1}.

  • متىرج{\displaystyle r\leq c}عقوبة الإيجازبP=1{\displaystyle BP=1}وهذا يعني أننا لا نعاقب المرشحين ذوي المؤهلات الطويلة، وإنما نعاقب المرشحين ذوي المؤهلات القصيرة فقط.
  • متىر>ج{\displaystyle r>c}عقوبة الإيجازبP=هـ1-ر/ج{\displaystyle BP=e^{1-r/c}}

ج{\displaystyle c}يمثل طول مجموعة النصوص المرشحة، أيج:=أنا=1م|y^(أنا)|{\displaystyle c:=\sum _{i=1}^{M}|{\hat {y}}^{(i)}|}أين|y|{\displaystyle |y|}هو طولy{\displaystyle y}.

ر{\displaystyle r}يمثل طول مجموعة النصوص المرجعية الفعالة ، أير:=أنا=1م|y(أنا،ج)|{\displaystyle r:=\sum _{i=1}^{M}|y^{(i,j)}|}أينy(أنا،ج)=argمينySأنا||y|-|y^(أنا)||{\displaystyle y^{(i,j)}=\arg \min _{y\in S_{i}}||y|-|{\hat {y}}^{(i)}||}أي الجملة منSأنا{\displaystyle S_{i}}طوله أقرب ما يكون إلى|y^(أنا)|{\displaystyle |{\hat {y}}^{(i)}|}قدر الإمكان.

الصيغة النهائية

لا يوجد تعريف واحد لـ BLEU، بل مجموعة كاملة من التعريفات، يتم تحديدها بواسطة متجه الترجيح.w:=(w1،w2،){\displaystyle w:=(w_{1},w_{2},\cdots )}هو توزيع احتمالي على{1،2،3،}{\displaystyle \{1,2,3,\cdots \}}، إنه،أنا=1wأنا=1{\displaystyle \sum _{i=1}^{\infty }w_{i}=1}، وأنا{1،2،3،}،wأنا[0،1]{\displaystyle \forall i\in \{1,2,3,\cdots \},w_{i}\in [0,1]}.

مع خيارw{\displaystyle w}، درجة BLEU هيبلهـيوw(S^؛S):=بP(S^؛S)خبرة(ن=1wنlnصن(S^؛S)){\displaystyle BLEU_{w}({\hat {S}};S):=BP({\hat {S}};S)\cdot \exp \left(\sum _{n=1}^{\infty }w_{n}\ln p_{n}({\hat {S}};S)\right)}بعبارة أخرى، هو المتوسط ​​الهندسي المرجح لجميع دقة نماذج n-gram المعدلة، مضروبًا في معامل الاختصار. نستخدم المتوسط ​​الهندسي المرجح، بدلًا من المتوسط ​​الحسابي المرجح، لتفضيل مجموعات النصوص المرشحة التي تُعتبر جيدة في آنٍ واحد وفقًا لدقة نماذج n-gram المتعددة.

الخيار الأكثر شيوعًا، وهو الخيار الموصى به في الورقة الأصلية، هوw1==w4=14{\displaystyle w_{1}=\cdots =w_{4}={\frac {1}{4}}}[ 1 ]

الخوارزمية

ويتضح ذلك في المثال التالي من بابينيني وآخرون (2002):

مثال على مخرجات ترجمة آلية رديئة ذات دقة عالية
مُرَشَّحالالالالالالال
المرجع 1القطةيكونعلىالحصيرة
المرجع 2هناكيكونأقطةعلىالحصيرة

من بين الكلمات السبع في الترجمة المرشحة، تظهر جميعها في الترجمات المرجعية. وبالتالي، تُمنح الترجمة المرشحة دقة أحادية الكلمات تبلغ،

P=مwت=77=1{\displaystyle P={\frac {m}{w_{t}}}={\frac {7}{7}}=1}

أين م{\displaystyle ~m}عدد الكلمات من النص المرشح التي تم العثور عليها في المرجع، و wت{\displaystyle ~w_{t}}يمثل هذا العدد الإجمالي للكلمات في النص المرشح. وهذه درجة مثالية، على الرغم من أن الترجمة المرشحة أعلاه لا تحتفظ إلا بجزء ضئيل من محتوى أي من المرجعين.

التعديل الذي يُجريه خوارزمية BLEU بسيط للغاية. فلكل كلمة في الترجمة المرشحة، تأخذ الخوارزمية أقصى عدد إجمالي لها. ممأx{\displaystyle ~m_{max}}في أي من الترجمات المرجعية. في المثال أعلاه، تظهر كلمة "the" مرتين في المرجع 1، ومرة ​​واحدة في المرجع 2. وبالتالي ممأx=2{\displaystyle ~m_{max}=2}.

بالنسبة للترجمة المرشحة، العددمw{\displaystyle m_{w}}يتم اقتطاع كل كلمة إلى حد أقصى قدرهممأx{\displaystyle m_{max}}بالنسبة لتلك الكلمة. في هذه الحالة، "the" لها مw=7{\displaystyle ~m_{w}=7}و ممأx=2{\displaystyle ~m_{max}=2}، هكذا مw{\displaystyle ~m_{w}}يتم اقتطاعها إلى 2. هذه الأعداد المقتطعة مw{\displaystyle ~m_{w}}ثم تُجمع النتائج على جميع الكلمات المميزة في الترجمة المرشحة. بعد ذلك، يُقسم هذا المجموع على العدد الإجمالي للكلمات المفردة في الترجمة المرشحة. في المثال أعلاه، ستكون درجة دقة الكلمات المفردة المُعدّلة كما يلي:

P=27{\displaystyle P={\frac {2}{7}}}

لكن عمليًا، لا يُعدّ استخدام الكلمات المفردة كوحدة للمقارنة مثاليًا. بدلًا من ذلك، يحسب BLEU نفس مقياس الدقة المُعدّل باستخدام n-grams . الطول الذي له "أعلى ارتباط بالأحكام البشرية أحادية اللغة".تبين أن النتيجة أربعة. وتُستخدم درجات الكلمات المفردة لتقييم مدى كفاية الترجمة، أي كمية المعلومات المحفوظة. أما درجات الكلمات الطويلة فتُستخدم لتقييم سلاسة الترجمة، أو مدى تشابهها مع اللغة الإنجليزية السليمة.

مقارنة مقاييس المرشح "القطة"
نموذجمجموعة غراماتنتيجة
يونيغرام"الـ", "الـ", "قطة"1+1+13=1{\displaystyle {\frac {1+1+1}{3}}=1}
أحاديات الحروف المجمعة"the"*2، "cat"*11+12+1=23{\displaystyle {\frac {1+1}{2+1}}={\frac {2}{3}}}
ثنائيات الكلمات"الـ"، "القطة"0+12=12{\displaystyle {\frac {0+1}{2}}={\frac {1}{2}}}

مثال على ترجمة مرشحة لنفس المراجع المذكورة أعلاه قد يكون كالتالي:

القطة

في هذا المثال، ستكون دقة الكلمات المفردة المعدلة كما يلي:

P=12+12=22{\displaystyle P={\frac {1}{2}}+{\frac {1}{2}}={\frac {2}{2}}}

بما أن كلمتي "the" و"cat" تظهران مرة واحدة لكل منهما في النص المرشح، فإن العدد الإجمالي للكلمات هو كلمتان. ستكون دقة الثنائيات المعدلة كالتالي:1/1{\displaystyle 1/1}كما هو الحال مع الكلمة الثنائية، تظهر كلمة "القطة" مرة واحدة في المرشح. وقد أشير إلى أن الدقة عادة ما تقترن بالاستدعاء للتغلب على هذه المشكلة.، كما سيكون استدعاء الكلمات المفردة في هذا المثال3/6{\displaystyle 3/6}أو2/7{\displaystyle 2/7}تكمن المشكلة في أنه نظرًا لوجود ترجمات مرجعية متعددة، فقد تؤدي الترجمة السيئة بسهولة إلى تضخيم الاستدعاء، مثل الترجمة التي تتكون من جميع الكلمات في كل مرجع.

لحساب درجة المجموعة الكاملة، تُدمج درجات الدقة المُعدّلة للمقاطع باستخدام المتوسط ​​الهندسي مضروبًا في معامل جزاء الإيجاز لمنع المقاطع القصيرة جدًا من الحصول على درجة عالية جدًا. لنفترض أن r هو الطول الإجمالي لمجموعة النصوص المرجعية، و c هو الطول الإجمالي لمجموعة نصوص الترجمة.جر{\displaystyle c\leq r}، وتُطبق عقوبة الإيجاز، والتي تُعرّف بأنهاهـ(1-ر/ج){\displaystyle e^{(1-r/c)}}(في حالة وجود جمل مرجعية متعددة، يُعتبر r مجموع أطوال الجمل التي تكون أطوالها أقرب إلى أطوال الجمل المرشحة. ومع ذلك، في نسخة المقياس المستخدمة في تقييمات NIST قبل عام 2009، تم استخدام أقصر جملة مرجعية بدلاً من ذلك.)

يُعدّ iBLEU نسخة تفاعلية من BLEU تُمكّن المستخدم من فحص نتائج BLEU التي حصلت عليها الترجمات المرشحة بصريًا. كما يُتيح مقارنة نظامين مختلفين بطريقة بصرية وتفاعلية، وهو أمر مفيد لتطوير الأنظمة.

أداء

كثيراً ما ورد أن مقياس BLEU يرتبط ارتباطاً وثيقاً بالحكم البشري.ولا يزال معيارًا لتقييم أي مقياس تقييم جديد. ومع ذلك، فقد وُجهت إليه بعض الانتقادات. فقد لوحظ أنه على الرغم من قدرته من حيث المبدأ على تقييم ترجمات أي لغة، إلا أن معيار BLEU، بصيغته الحالية، لا يستطيع التعامل مع اللغات التي تفتقر إلى حدود الكلمات.صُمم هذا النظام ليُستخدم مع عدة مراجع للترجمة، ولكنه عمليًا يُستخدم مع مرجع واحد فقط. [ 2 ] يُعرف نظام BLEU باعتماده الكبير على تقنية التجزئة ، والنتائج المحققة باستخدام تقنيات مختلفة غير قابلة للمقارنة (وهو أمر غالبًا ما يُغفل عنه)؛ ولتحسين إمكانية التكرار والمقارنة، تم تصميم نسخة SacreBLEU. [ 2 ]

لقد قيل أنه على الرغم من أن BLEU له مزايا كبيرة، إلا أنه لا يوجد ضمان بأن الزيادة في درجة BLEU هي مؤشر على تحسن جودة الترجمة.

انظر أيضاً

ملحوظات

  1. ^ بابينيني، ك.، وآخرون (2002)
  2. ^ بابينيني، ك.، وآخرون (2002)
  3. ^ كوفلين، د. (2003)
  4. ^ بابينيني، ك.، وآخرون (2002)
  5. ^ بابينيني، ك.، وآخرون (2002)
  6. ^ بابينيني، ك.، وآخرون (2002)
  7. ^ كوفلين، د. (2003)
  8. ^ دودينغتون، ج. (2002)
  9. ^ دينوال، إي. وليباج، واي. (2005)
  10. ^ كاليسون-بيرش، سي.، أوزبورن، إم. وكوهن، بي. (2006)
  11. ^ لي، أ. وبرزيبوكي، م. (2005)
  12. ^ كاليسون-بيرش، سي.، أوزبورن، إم. وكوهن، بي. (2006)
  13. ^ لين، سي. وأوتش، إف. (2004)
  14. ^ كاليسون-بيرش، سي.، أوزبورن، إم. وكوهن، بي. (2006)
  15. ^ مادناني، ن. (2011)

مراجع

  1. Papineni, Kishore; Roukos, Salim; Ward, Todd; Zhu, Wei-Jing (2001). "BLEU". Proceedings of the 40th Annual Meeting on Association for Computational Linguistics - ACL '02. Morristown, NJ, USA: Association for Computational Linguistics: 311. doi:10.3115/1073083.1073135. S2CID 11080756.
  2. 12Marie, Benjamin (5 November 2022). "BLEU: A Misunderstood Metric from Another Age". Towards Data Science.

Bibliography