درجة F

الدقة والاستدعاء

في التحليل الإحصائي لأنظمة التصنيف الثنائي واسترجاع المعلومات ، يُعدّ مقياس F ( أو مقياس F) مؤشرًا على الأداء التنبؤي. يُحسب هذا المقياس من دقة الاختبار واستدعائه ، حيث تمثل الدقة عدد النتائج الإيجابية الصحيحة مقسومًا على إجمالي عدد العينات التي تم التنبؤ بأنها إيجابية، بما في ذلك تلك التي لم يتم تحديدها بشكل صحيح، بينما يمثل الاستدعاء عدد النتائج الإيجابية الصحيحة مقسومًا على إجمالي عدد العينات التي كان ينبغي تحديدها على أنها إيجابية. تُعرف الدقة أيضًا بالقيمة التنبؤية الإيجابية ، ويُعرف الاستدعاء بالحساسية في التصنيف الثنائي التشخيصي.

يمثل مقياس F1 المتوسط ​​التوافقي للدقة والاستدعاء. وبالتالي، فهو يمثل كلاً من الدقة والاستدعاء بشكل متناظر في مقياس واحد .Fβ{\displaystyle F_{\beta }}يطبق نظام التقييم أوزاناً إضافية، حيث يُقيّم أحد عنصري الدقة أو الاستدعاء أكثر من الآخر.

أعلى قيمة ممكنة لدرجة F هي 1.0، مما يشير إلى دقة واستدعاء مثاليين، وأدنى قيمة ممكنة هي 0، إذا كانت الدقة أو الاستدعاء صفرًا.

أصل الكلمة

يُعتقد أن اسم مقياس F قد سُمي على اسم دالة F مختلفة وردت في كتاب فان ريسبرجن، عندما تم تقديمها في المؤتمر الرابع لفهم الرسائل (MUC-4، 1992). [ 1 ]

تعريف

مقياس F التقليدي أو درجة F المتوازنة ( درجة F 1 ) هو المتوسط ​​التوافقي للدقة والاستدعاء: [ 2 ]

F1=2رهـجألل-1+صرهـجأناsأناoن-1=2صرهـجأناsأناoنرهـجأللصرهـجأناsأناoن+رهـجألل=2تيP2تيP+FP+Fشمال{\displaystyle F_{1}={\frac {2}{\mathrm {استدعاء} ^{-1}+\mathrm {precision} ^{-1}}}=2{\frac {\mathrm {precision} \cdot \mathrm {استدعاء} {\mathrm {precision} +\mathrm {استدعاء} }}= {\frac {2\mathrm {TP} }{2\mathrm {TP} +\mathrm {FP} +\mathrm {FN} }}}

مع الدقة = TP / (TP + FP) والاستدعاء = TP / (TP + FN) ، يترتب على ذلك أن بسط F 1 هو مجموع بسطيهما ومقام F 1 هو مجموع مقاميهما.

إذا كانت FP=FN

F1=2تيP2تيP+2FP=تيPتيP+FP{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FP} }}={\frac {\mathrm {TP} }{\mathrm {TP} +\mathrm {FP} }}}

أو

F1=2تيP2تيP+2Fشمال=تيPتيP+Fشمال{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FN} }}={\frac {\mathrm {TP} }{\mathrm {TP} +\mathrm {FN} }}}

إذن، F1 = الدقة = الاستدعاء

إذا كان TP=FP=FN

F1=2تيP2تيP+2FP=2تيP4تيP=12=0.5{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FP} }}={\frac {2\mathrm {TP} }{4\mathrm {TP} }}={\frac {1}{2}}=0.5}

أو

F1=2تيP2تيP+2Fشمال=2تيP4تيP=12=0.5{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FN} }}={\frac {2\mathrm {TP} }{4\mathrm {TP} }}={\frac {1}{2}}=0.5}

لرؤيتها كمتوسط ​​توافقي، لاحظ أنF1-1=12(رهـجألل-1+صرهـجأناsأناoن-1){\displaystyle F_{1}^{-1}={\frac {1}{2}}(\mathrm {recall} ^{-1}+\mathrm {precision} ^{-1})}.

درجة F β

درجة F أكثر عمومية،Fβ{\displaystyle F_{\beta }}، الذي يستخدم عاملاً حقيقياً موجباًβ{\displaystyle \beta }، أينβ{\displaystyle \beta }يتم اختيارها بحيث يتم أخذ الاستدعاء في الاعتبارβ{\displaystyle \beta }في أوقات لا تقل أهمية عن الدقة، ما يلي:

Fβ=β2+1(β2رهـجألل-1)+صرهـجأناsأناoن-1=(1+β2)صرهـجأناsأناoنرهـجألل(β2صرهـجأناsأناoن)+رهـجألل{\displaystyle F_{\beta }={\frac {\beta ^{2}+1}{(\beta ^{2}\cdot \mathrm {recall} ^{-1})+\mathrm {precision} ^{-1}}}={\frac {(1+\beta ^{2})\cdot \mathrm {precision} \cdot \mathrm {recall} }{(\beta ^{2}\cdot \mathrm {precision} )+\mathrm {recall} }}}

ولرؤية ذلك كمتوسط ​​توافقي مرجح، لاحظ أنFβ-1=1β+β-1(βرهـجألل-1+β-1صرهـجأناsأناoن-1){\displaystyle F_{\beta }^{-1}={\frac {1}{\beta +\beta ^{-1}}}(\beta \cdot \mathrm {recall} ^{-1}+\beta ^{-1}\cdot \mathrm {precision} ^{-1})}.

فيما يتعلق بأخطاء النوع الأول والنوع الثاني، يصبح الأمر كالتالي:

Fβ=(1+β2)تيP(1+β2)تيP+β2Fشمال+FP=(1+β2)تيP(تيP+Fشمال)β2+(تيP+FP){\displaystyle F_{\beta }={\frac {(1+\beta ^{2})\cdot \mathrm {TP} }{(1+\beta ^{2})\cdot \mathrm {TP} +\beta ^{2}\cdot \mathrm {FN} +\mathrm {FP} }}\,={\frac {(1+\beta ^{2})\cdot \mathrm {TP} }{(\mathrm {TP} +\mathrm {FN} )\cdot \beta ^{2}+(\mathrm {TP} +\mathrm {FP} )}}\,}

قيمتان شائعتان الاستخدام لـβ{\displaystyle \beta }هما 2، حيث يرجح الاستدعاء على الدقة، و 1/2، حيث يرجح الاستدعاء على الدقة.

تم اشتقاق مقياس F بحيثFβ{\displaystyle F_{\beta }}"يقيس مدى فعالية عملية الاسترجاع بالنسبة للمستخدم الذي يقوم بإرفاقβ{\displaystyle \beta }"التذكر أهم من الدقة بأضعاف". [ 3 ] وهو يستند إلى مقياس فعالية فان ريسبرجن

هـ=1-(αص+1-αر)-1{\displaystyle E=1-\left({\frac {\alpha }{p}}+{\frac {1-\alpha }{r}}\right)^{-1}}

علاقتهما هي:Fβ=1-هـ{\displaystyle F_{\beta }=1-E}أينα=11+β2{\displaystyle \alpha ={\frac {1}{1+\beta ^{2}}}}

الاختبارات التشخيصية

يرتبط هذا بمجال التصنيف الثنائي حيث يُطلق على الاستدعاء غالبًا اسم "الحساسية".

الحالة المتوقعةالمصادر: [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ]
إجمالي عدد السكان = P + Nنتيجة إيجابية متوقعةالنتيجة المتوقعة سلبيةمستوى المعلومات ، مستوى معلومات وكيل المراهنات (BM) = TPR + TNR − 1عتبة الانتشار ( PT) =TPR × FPR − FPR / TPR − FPR
الحالة الفعلية
موجب حقيقي (P) [ أ ]إيجابي حقيقي (TP)، تم تسجيله [ ب ]النتيجة السلبية الخاطئة ، الخطأ، التقليل من شأن المشكلةمعدل الإيجابية الحقيقية (TPR)، الاستدعاء ، الحساسية (SEN)، احتمال الكشف  ، معدل  الإصابة ، القدرة  = TP / P = 1 − FNRمعدل النتائج السلبية الكاذبة (FNR)، معدل الخطأ  من النوع الثاني [ c ] = FN / P = 1 − TPR
السالب الحقيقي (N) [ d ]إيجابي كاذب ، إنذار كاذب، مبالغة في التقديرسلبي حقيقي (TN)، رفض صحيح [ هـ ]معدل الإنذار الكاذب (FPR)، احتمال  الإنذار  الكاذب  ، خطأ النوع الأول الناتج [ f ] = FP / N = 1 − TNRمعدل السلبية الحقيقية (TNR)، والنوعية (SPC)، والانتقائية = TN / N = 1 − FPR
الانتشار = P / P + Nالقيمة التنبؤية الإيجابية (PPV)، الدقة = TP / TP + FP = 1 − FDRمعدل الإغفال الخاطئ (FOR) = FN / TN + FN = 1 − NPVنسبة الاحتمالية الإيجابية (LR+) = TPR / FPRنسبة الاحتمالية السلبية (LR−) = FNR / TNR
الدقة (ACC) = TP + TN / P + Nمعدل الاكتشاف الخاطئ (FDR) = FP / TP + FP = 1 − PPVالقيمة التنبؤية السلبية (NPV) = TN / TN + FN = 1 − FORالتمييز (MK)، دلتا P ( Δ p) = PPV + NPV − 1نسبة احتمالات التشخيص ( DOR ) = LR + / LR− = TP × TN / FP × FN
الدقة المتوازنة (BA) = TPR + TNR / 2النتيجة F1 = 2 PPV × TPR / PPV + TPR = 2 TP / 2 TP + FP + FNمؤشر فولكس-مالوز (FM) = PPV × TPRمعامل ارتباط فاي أو ماثيوز (MCC) = معدل الإيجابية الحقيقية × معدل السلبية الحقيقية × القيمة التنبؤية الإيجابية × القيمة التنبؤية السلبية - معدل السلبية الكاذبة × معدل الإيجابية الكاذبة × معدل الإيجابية الكاذبة × معدل الاكتشاف الخاطئدرجة التهديد (TS)، مؤشر النجاح الحرج (CSI)، مؤشر جاكارد = TP / TP + FN + FP
  1. عدد الحالات الإيجابية الحقيقية في البيانات
  2. نتيجة اختبار تشير بشكل صحيح إلى وجود حالة أو سمة معينة
  3. خطأ من النوع الثاني: نتيجة اختبار تشير خطأً إلى غياب شرط أو سمة معينة.
  4. عدد الحالات السلبية الحقيقية في البيانات
  5. نتيجة اختبار تشير بشكل صحيح إلى عدم وجود حالة أو سمة معينة
  6. خطأ من النوع الأول: نتيجة اختبار تشير بشكل خاطئ إلى وجود شرط أو سمة معينة.
مخطط المتوسط ​​التوافقي المعياري حيث يمثل المحور السيني الدقة، ويمثل المحور الصادي الاستدعاء، ويمثل المحور الرأسي درجة F1 ، بنقاط مئوية
منحنى الدقة والاستدعاء: يتم ترميز النقاط من عتبات مختلفة بالألوان، وتُبرز النقطة ذات درجة F المثلى باللون الأحمر.

اعتماد درجة F على عدم توازن الفئات

منحنى الدقة والاستدعاء، وبالتاليFβ{\displaystyle F_{\beta }}تعتمد النتيجة بشكل صريح على النسبة ر{\displaystyle r}من حالات الاختبار الإيجابية إلى السلبية. [ 12 ] هذا يعني أن مقارنة درجة F عبر مسائل مختلفة بنسب فئات متباينة أمرٌ إشكالي. إحدى طرق معالجة هذه المشكلة (انظر على سبيل المثال، Siblini et al.، 2020 [ 13 ] ) هي استخدام نسبة فئات قياسية.ر0{\displaystyle r_{0}}عند إجراء مثل هذه المقارنات.

التطبيقات

يُستخدم مقياس F-score بشكل شائع في مجال استرجاع المعلومات لقياس أداء البحث وتصنيف المستندات وتصنيف الاستعلامات . [ 14 ] وهو ذو أهمية خاصة في التطبيقات التي تُعنى بشكل أساسي بالفئة الإيجابية، حيث تكون هذه الفئة نادرة نسبيًا مقارنةً بالفئة السلبية.

ركزت الدراسات السابقة بشكل أساسي على مقياس F1 ، ولكن مع انتشار محركات البحث واسعة النطاق، تغيرت أهداف الأداء لتركز بشكل أكبر إما على الدقة أو الاستدعاء [ 15 ] وهكذاFβ{\displaystyle F_{\beta }}يُلاحظ ذلك في تطبيقات واسعة النطاق.

يُستخدم مقياس F أيضًا في التعلّم الآلي . [ 16 ] ومع ذلك، لا تأخذ مقاييس F في الحسبان النتائج السلبية الحقيقية، لذا قد يُفضّل استخدام مقاييس أخرى مثل معامل ارتباط ماثيوز ، أو معامل المعلومات، أو معامل كابا لكوهين لتقييم أداء المصنّف الثنائي. [ 17 ]

لقد تم استخدام مقياس F على نطاق واسع في أدبيات معالجة اللغة الطبيعية، [ 18 ] كما هو الحال في تقييم التعرف على الكيانات المسماة وتقسيم الكلمات .

ملكيات

يمثل مقياس F1 معامل دايس لمجموعة العناصر المسترجعة ومجموعة العناصر ذات الصلة. [ 19 ]

  • تتقارب قيمة F1 للمصنف الذي يتنبأ دائمًا بالفئة الإيجابية إلى 1 مع زيادة احتمال الفئة الإيجابية.
  • إن قيمة F1 لمصنف يتنبأ دائمًا بالفئة الإيجابية تساوي 2 * نسبة_الفئة_الإيجابية / (1 + نسبة_الفئة_الإيجابية)، حيث أن الاستدعاء يساوي 1، والدقة تساوي نسبة الفئة الإيجابية. [ 20 ]
  • إذا كان نموذج التسجيل غير مفيد (لا يمكنه التمييز بين الفئة الإيجابية والفئة السلبية) فإن العتبة المثلى هي 0 بحيث يتم التنبؤ بالفئة الإيجابية دائمًا.
  • تكون قيمة F1 مقعرة بالنسبة لمعدل الإيجابية الحقيقية. [ 21 ]

نقد

ينتقد ديفيد هاند وآخرون الاستخدام الواسع النطاق لمقياس F1 لأنه يولي أهمية متساوية للدقة والاستدعاء. عمليًا، تترتب على أنواع مختلفة من التصنيفات الخاطئة تكاليف متفاوتة. بعبارة أخرى، تُعد الأهمية النسبية للدقة والاستدعاء جانبًا من جوانب المشكلة. [ 22 ]

بحسب دافيد تشيكو وجوزيبي جورمان، فإن درجة F1 أقل صدقًا وإفادة من معامل ارتباط ماثيوز (MCC) في تصنيف التقييم الثنائي. [ 23 ]

أشار ديفيد إم دبليو باورز إلى أن مقياس F1 يتجاهل النتائج السلبية الصحيحة، وبالتالي فهو مضلل بالنسبة للفئات غير المتوازنة، في حين أن مقياسي كابا والارتباط متناظران ويقيّمان كلا اتجاهي التنبؤ - حيث يتنبأ المصنف بالفئة الحقيقية، وتتنبأ الفئة الحقيقية بتنبؤ المصنف - مقترحًا مقياسين منفصلين للفئات المتعددة، وهما " المعلوماتية" و "التمييزية" ، لكل اتجاه، مع ملاحظة أن متوسطهما الهندسي هو الارتباط. [ 24 ]

من بين الانتقادات الموجهة لمقياس F1 عدم تناظره، ما يعني أنه قد تتغير قيمته عند تغيير تصنيف مجموعة البيانات، حيث تُسمى العينات "الإيجابية" "سلبية" والعكس صحيح. ويُعالج هذا الانتقاد بتعريف مقياس P4 ، الذي يُشار إليه أحيانًا على أنه امتداد متناظر لمقياس F1 . [ 25 ]

أخيرًا، يرى كلٌّ من فيرير [ 26 ] وديرلاند وآخرون [ 27 ] أن التكلفة المتوقعة (أو ما يُقابلها، المنفعة المتوقعة) هي المقياس الوحيد المُعتمد لتقييم قرارات التصنيف، لما لها من مزايا عديدة مقارنةً بمقياس F ومعامل الارتباط ماثيوز. وتُبيّن الدراستان أن مقياس F قد يُؤدي إلى استنتاجات خاطئة حول الجودة المطلقة والنسبية للأنظمة.

الفرق عن مؤشر فولكس-مالوز

بينما يمثل مقياس F المتوسط ​​التوافقي للاستدعاء والدقة، فإن مؤشر Fowlkes–Mallows هو المتوسط ​​الهندسي لهما . [ 28 ]

توسيع نطاق التصنيف متعدد الفئات

يُستخدم مقياس F أيضًا لتقييم مسائل التصنيف التي تضم أكثر من فئتين ( التصنيف متعدد الفئات ). وتتمثل إحدى الطرق الشائعة في حساب متوسط ​​مقياس F لكل فئة، بهدف الحصول على قياس متوازن للأداء. [ 29 ]

ماكرو F1

مقياس F1 الكلي هو متوسط ​​مقياس F1 الكلي الذي يهدف إلى قياس الأداء بشكل متوازن. لحساب مقياس F1 الكلي، تم استخدام صيغتين مختلفتين للمتوسط: مقياس F1 لمتوسطات الدقة والاستدعاء (الحسابية) لكل فئة، أو المتوسط ​​الحسابي لمقياس F1 لكل فئة، حيث تُظهر الصيغة الأخيرة خصائص أفضل. [ 30 ]

مايكرو إف 1

يمثل مقياس F1 الجزئي المتوسط ​​التوافقي للدقة الجزئية والاستدعاء الجزئي . في تصنيف الفئات المتعددة أحادي التصنيف، تتساوى الدقة الجزئية مع الاستدعاء الجزئي، وبالتالي فإن مقياس F1 الجزئي يساوي كليهما. مع ذلك، وخلافًا للاعتقاد الشائع، فإن مقياس F1 الجزئي لا يساوي الدقة عمومًا ، لأن الدقة تأخذ في الحسبان النتائج السلبية الصحيحة بينما لا يأخذها مقياس F1 الجزئي في الحسبان. [ 31 ]

انظر أيضاً

مراجع

  1. ساساكي، ي. (2007). "حقيقة مقياس F" (ملف PDF) . مجلة Teach Tutor Mater . المجلد  1، العدد  5، الصفحات 1-5 . 
  2. عزيز طه، عبد (2015). "مقاييس تقييم تجزئة الصور الطبية ثلاثية الأبعاد: التحليل والاختيار والأداة" . مجلة BMC للتصوير الطبي . 15 (29) 29: 1-28 . doi : 10.1186/s12880-015-0068-x . PMC 4533825. PMID 26263899 .  
  3. ^ فان ريسبرجن، سي جيه (1979). استرجاع المعلومات (الطبعة الثانية ). بتروورث هاينمان. 
  4. فوسيت، توم (2006). "مقدمة في تحليل منحنى ROC" (ملف PDF) . رسائل التعرف على الأنماط . 27 (8): 861-874 . doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . 
  5. بروفوست، فوستر؛ توم فاوست (2013-08-01). "علم البيانات للأعمال: ما تحتاج إلى معرفته حول استخراج البيانات والتفكير التحليلي للبيانات" . أورايلي ميديا، إنك .
  6. باورز، ديفيد إم دبليو (2011). "التقييم: من الدقة والاستدعاء ومقياس F إلى منحنى ROC والمعلوماتية والتمييز والارتباط" . مجلة تقنيات التعلم الآلي . 2 (1): 37-63 .
  7. تينغ، كاي مينغ (2011). ساموت، كلود؛ ويب، جيفري آي. (محرران). موسوعة تعلم الآلة . سبرينغر. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
  8. بروكس، هارولد؛ براون، بارب؛ إيبرت، بيث؛ فيرو، كريس؛ جوليف، إيان؛ كوه، تيه-يونغ؛ روبير، بول؛ ستيفنسون، ديفيد (26 يناير 2015). "الفريق العامل المشترك بين برنامج أبحاث الطقس العالمي (WWRP) وبرنامج أبحاث الأرصاد الجوية الوطنية (WGNE) المعني بأبحاث التحقق من التنبؤات" . التعاون من أجل أبحاث الطقس والمناخ الأسترالية . المنظمة العالمية للأرصاد الجوية . تاريخ الاسترجاع: 17 يوليو 2019 .
  9. شيكو د، جورمان ج (يناير 2020). "مزايا معامل ارتباط ماثيوز (MCC) مقارنةً بدرجة F1 ودقة تقييم التصنيف الثنائي" . بي إم سي جينوميكس . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .  
  10. شيكو د، تويتش ن، جورمان ج (فبراير 2021). "معامل ارتباط ماثيوز (MCC) أكثر موثوقية من دقة التوازن، ومعلومات وكيل المراهنات، والتمييز في تقييم مصفوفة الارتباك ثنائية الفئة" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .  
  11. ثروت أ. (أغسطس 2018). "أساليب تقييم التصنيف" . الحوسبة التطبيقية والمعلوماتية . 17 : 168-192 . doi : 10.1016/j.aci.2018.08.003 .
  12. ^ برابيك ، يناير. كوماريك، توماس؛ الفرنك، فويتتش؛ ماتشليكا، لوكاش (2020). “في تقييم النموذج في ظل اختلال التوازن الطبقي غير الثابت”. المؤتمر الدولي للعلوم الحاسوبية . سبرينغر. ص 74 – 87. أرخايف : 2001.05571 . دوى : 10.1007/978-3-030-50423-6_6 . 
  13. سيبيليني، و.؛ فريري، ج.؛ هي-غيلتون، ل.؛ أوبليه، ف.؛ وانغ، ي. كيو. (2020). "إتقان مقاييسك من خلال المعايرة". في م. بيرتهولد؛ أ. فيلدرز؛ ج. كريمبل (محررون). التطورات في تحليل البيانات الذكية الثامن عشر . سبرينغر. ص 457-469 . arXiv : 1909.02827 . doi : 10.1007/978-3-030-44584-3_36 . 
  14. بيتزل، ستيفن م. (2006). حول فهم وتصنيف استعلامات الويب (أطروحة دكتوراه). معهد إلينوي للتكنولوجيا. CiteSeerX 10.1.1.127.634 . 
  15. X. Li; Y.-Y. Wang; A. Acero (يوليو 2008). تعلم نية الاستعلام من رسوم بيانية منتظمة للنقرات . وقائع المؤتمر الحادي والثلاثين لـ SIGIR . ص 339. doi : 10.1145/1390334.1390393 . ISBN  9781605581644. S2CID 8482989 . 
  16. انظر، على سبيل المثال، تقييم.
  17. باورز، ديفيد م. و (2015). "ما لا يقيسه مقياس F". arXiv : 1503.06410 [ cs.IR ].
  18. ديركزينسكي، ل. (2016). التكاملية، ودرجة F، وتقييم معالجة اللغة الطبيعية . وقائع المؤتمر الدولي حول موارد اللغة وتقييمها .
  19. مانينغ، كريستوفر (1 أبريل 2009). مقدمة في استرجاع المعلومات (ملف PDF) . التمرين 8.7: مطبعة جامعة كامبريدج. ص 200. تاريخ الاسترجاع: 18 يوليو 2022 . {{cite book}}: CS1 maint: location ( link )
  20. "ما هو المستوى الأساسي لدرجة F1 لمصنف ثنائي؟ "
  21. زاكاري تشيس ليبتون؛ إلكان، تشارلز؛ ناراياناسوامي، بالاكريشنان (2014). "تحديد عتبة المصنفات لزيادة درجة F1 إلى أقصى حد". arXiv : 1402.1892 [ stat.ML ].
  22. هاند، ديفيد (مايو 2018). "ملاحظة حول استخدام مقياس F لتقييم خوارزميات ربط السجلات - الأبعاد" . app.dimensions.ai . 28 (3): 539–547 . doi : 10.1007/s11222-017-9746-6 . hdl : 10044/1/46235 . S2CID 38782128. تاريخ الاسترجاع: 8 ديسمبر 2018 . 
  23. شيكو د، جورمان ج (يناير 2020). "مزايا معامل ارتباط ماثيوز (MCC) مقارنةً بدرجة F1 ودقة تقييم التصنيف الثنائي" . بي إم سي جينوميكس . 21 (6) 6. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .  
  24. باورز، ديفيد إم دبليو (2011). "التقييم: من الدقة والاستدعاء ودرجة F إلى منحنى ROC والمعلوماتية والتمييز والارتباط". مجلة تقنيات التعلم الآلي . 2 (1): 37-63 . hdl : 2328/27165 .
  25. سيتارز، ميكولاي (2023). "توسيع مقياس F1، نهج احتمالي". التطورات في الذكاء الاصطناعي والتعلم الآلي . 03 (2): 1025-1038 . arXiv : 2210.11997 . doi : 10.54364/AAIML.2023.1161 .
  26. فيرير إل (فبراير 2025). "لا حاجة إلى بدائل مخصصة: التكلفة المتوقعة هي مقياس تصنيف مبدئي متعدد الأغراض" . معاملات بحوث التعلم الآلي .
  27. دايرلاند ك، لوندرفولد أ.س، بورتا مانا ب (مايو 2022). "هل يصمد التقييم أمام التقييم؟ نهج قائم على المبادئ الأساسية لتقييم المصنفات". arXiv : 2302.12006 [ cs.LG ].
  28. ثروت أ (أغسطس 2018). "أساليب تقييم التصنيف" . الحوسبة التطبيقية والمعلوماتية . 17 : 168-192 . doi : 10.1016/j.aci.2018.08.003 .
  29. أوبيتز، يوري (2024). "نظرة فاحصة على مقاييس تقييم التصنيف وتأمل نقدي في ممارسات التقييم الشائعة" . معاملات رابطة اللغويات الحاسوبية . 12 : 820-836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
  30. ج. أوبيتز؛ س. بيرست (2019). "ماكرو إف 1 وماكرو إف 1". arXiv : 1911.03347 [ stat.ML ].
  31. براونلي، جيسون (7 سبتمبر 2021). "4.3 - مقياس F1 الجزئي". التصنيف غير المتوازن باستخدام بايثون: مقاييس أفضل، موازنة الفئات المنحرفة، التعلم الحساس للتكلفة . إتقان تعلم الآلة. ص 40. ISBN  979-8468452240.