درجة F

في التحليل الإحصائي لأنظمة التصنيف الثنائي واسترجاع المعلومات ، يُعدّ مقياس F ( أو مقياس F) مؤشرًا على الأداء التنبؤي. يُحسب هذا المقياس من دقة الاختبار واستدعائه ، حيث تمثل الدقة عدد النتائج الإيجابية الصحيحة مقسومًا على إجمالي عدد العينات التي تم التنبؤ بأنها إيجابية، بما في ذلك تلك التي لم يتم تحديدها بشكل صحيح، بينما يمثل الاستدعاء عدد النتائج الإيجابية الصحيحة مقسومًا على إجمالي عدد العينات التي كان ينبغي تحديدها على أنها إيجابية. تُعرف الدقة أيضًا بالقيمة التنبؤية الإيجابية ، ويُعرف الاستدعاء بالحساسية في التصنيف الثنائي التشخيصي.
يمثل مقياس F1 المتوسط التوافقي للدقة والاستدعاء. وبالتالي، فهو يمثل كلاً من الدقة والاستدعاء بشكل متناظر في مقياس واحد .يطبق نظام التقييم أوزاناً إضافية، حيث يُقيّم أحد عنصري الدقة أو الاستدعاء أكثر من الآخر.
أعلى قيمة ممكنة لدرجة F هي 1.0، مما يشير إلى دقة واستدعاء مثاليين، وأدنى قيمة ممكنة هي 0، إذا كانت الدقة أو الاستدعاء صفرًا.
أصل الكلمة
يُعتقد أن اسم مقياس F قد سُمي على اسم دالة F مختلفة وردت في كتاب فان ريسبرجن، عندما تم تقديمها في المؤتمر الرابع لفهم الرسائل (MUC-4، 1992). [ 1 ]
تعريف
مقياس F التقليدي أو درجة F المتوازنة ( درجة F 1 ) هو المتوسط التوافقي للدقة والاستدعاء: [ 2 ]
مع الدقة = TP / (TP + FP) والاستدعاء = TP / (TP + FN) ، يترتب على ذلك أن بسط F 1 هو مجموع بسطيهما ومقام F 1 هو مجموع مقاميهما.
إذا كانت FP=FN
أو
إذن، F1 = الدقة = الاستدعاء
إذا كان TP=FP=FN
أو
لرؤيتها كمتوسط توافقي، لاحظ أن.
درجة F β
درجة F أكثر عمومية،، الذي يستخدم عاملاً حقيقياً موجباً، أينيتم اختيارها بحيث يتم أخذ الاستدعاء في الاعتبارفي أوقات لا تقل أهمية عن الدقة، ما يلي:
ولرؤية ذلك كمتوسط توافقي مرجح، لاحظ أن.
فيما يتعلق بأخطاء النوع الأول والنوع الثاني، يصبح الأمر كالتالي:
قيمتان شائعتان الاستخدام لـهما 2، حيث يرجح الاستدعاء على الدقة، و 1/2، حيث يرجح الاستدعاء على الدقة.
تم اشتقاق مقياس F بحيث"يقيس مدى فعالية عملية الاسترجاع بالنسبة للمستخدم الذي يقوم بإرفاق"التذكر أهم من الدقة بأضعاف". [ 3 ] وهو يستند إلى مقياس فعالية فان ريسبرجن
علاقتهما هي:أين
الاختبارات التشخيصية
يرتبط هذا بمجال التصنيف الثنائي حيث يُطلق على الاستدعاء غالبًا اسم "الحساسية".
| الحالة المتوقعة | المصادر: [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ] | ||||
| إجمالي عدد السكان = P + N | نتيجة إيجابية متوقعة | النتيجة المتوقعة سلبية | مستوى المعلومات ، مستوى معلومات وكيل المراهنات (BM) = TPR + TNR − 1 | عتبة الانتشار ( PT) = √ TPR × FPR − FPR / TPR − FPR | |
الحالة الفعلية | موجب حقيقي (P) [ أ ] | إيجابي حقيقي (TP)، تم تسجيله [ ب ] | النتيجة السلبية الخاطئة ، الخطأ، التقليل من شأن المشكلة | معدل الإيجابية الحقيقية (TPR)، الاستدعاء ، الحساسية (SEN)، احتمال الكشف ، معدل الإصابة ، القدرة = TP / P = 1 − FNR | معدل النتائج السلبية الكاذبة (FNR)، معدل الخطأ من النوع الثاني [ c ] = FN / P = 1 − TPR |
| السالب الحقيقي (N) [ d ] | إيجابي كاذب ، إنذار كاذب، مبالغة في التقدير | سلبي حقيقي (TN)، رفض صحيح [ هـ ] | معدل الإنذار الكاذب (FPR)، احتمال الإنذار الكاذب ، خطأ النوع الأول الناتج [ f ] = FP / N = 1 − TNR | معدل السلبية الحقيقية (TNR)، والنوعية (SPC)، والانتقائية = TN / N = 1 − FPR | |
| الانتشار = P / P + N | القيمة التنبؤية الإيجابية (PPV)، الدقة = TP / TP + FP = 1 − FDR | معدل الإغفال الخاطئ (FOR) = FN / TN + FN = 1 − NPV | نسبة الاحتمالية الإيجابية (LR+) = TPR / FPR | نسبة الاحتمالية السلبية (LR−) = FNR / TNR | |
| الدقة (ACC) = TP + TN / P + N | معدل الاكتشاف الخاطئ (FDR) = FP / TP + FP = 1 − PPV | القيمة التنبؤية السلبية (NPV) = TN / TN + FN = 1 − FOR | التمييز (MK)، دلتا P ( Δ p) = PPV + NPV − 1 | نسبة احتمالات التشخيص ( DOR ) = LR + / LR− = TP × TN / FP × FN | |
| الدقة المتوازنة (BA) = TPR + TNR / 2 | النتيجة F1 = 2 PPV × TPR / PPV + TPR = 2 TP / 2 TP + FP + FN | مؤشر فولكس-مالوز (FM) = √ PPV × TPR | معامل ارتباط فاي أو ماثيوز (MCC) = √ معدل الإيجابية الحقيقية × معدل السلبية الحقيقية × القيمة التنبؤية الإيجابية × القيمة التنبؤية السلبية - √ معدل السلبية الكاذبة × معدل الإيجابية الكاذبة × معدل الإيجابية الكاذبة × معدل الاكتشاف الخاطئ | درجة التهديد (TS)، مؤشر النجاح الحرج (CSI)، مؤشر جاكارد = TP / TP + FN + FP | |
- ↑ عدد الحالات الإيجابية الحقيقية في البيانات
- ↑ نتيجة اختبار تشير بشكل صحيح إلى وجود حالة أو سمة معينة
- ↑ خطأ من النوع الثاني: نتيجة اختبار تشير خطأً إلى غياب شرط أو سمة معينة.
- ↑ عدد الحالات السلبية الحقيقية في البيانات
- ↑ نتيجة اختبار تشير بشكل صحيح إلى عدم وجود حالة أو سمة معينة
- ↑ خطأ من النوع الأول: نتيجة اختبار تشير بشكل خاطئ إلى وجود شرط أو سمة معينة.


اعتماد درجة F على عدم توازن الفئات
منحنى الدقة والاستدعاء، وبالتاليتعتمد النتيجة بشكل صريح على النسبة من حالات الاختبار الإيجابية إلى السلبية. [ 12 ] هذا يعني أن مقارنة درجة F عبر مسائل مختلفة بنسب فئات متباينة أمرٌ إشكالي. إحدى طرق معالجة هذه المشكلة (انظر على سبيل المثال، Siblini et al.، 2020 [ 13 ] ) هي استخدام نسبة فئات قياسية.عند إجراء مثل هذه المقارنات.
التطبيقات
يُستخدم مقياس F-score بشكل شائع في مجال استرجاع المعلومات لقياس أداء البحث وتصنيف المستندات وتصنيف الاستعلامات . [ 14 ] وهو ذو أهمية خاصة في التطبيقات التي تُعنى بشكل أساسي بالفئة الإيجابية، حيث تكون هذه الفئة نادرة نسبيًا مقارنةً بالفئة السلبية.
ركزت الدراسات السابقة بشكل أساسي على مقياس F1 ، ولكن مع انتشار محركات البحث واسعة النطاق، تغيرت أهداف الأداء لتركز بشكل أكبر إما على الدقة أو الاستدعاء [ 15 ] وهكذايُلاحظ ذلك في تطبيقات واسعة النطاق.
يُستخدم مقياس F أيضًا في التعلّم الآلي . [ 16 ] ومع ذلك، لا تأخذ مقاييس F في الحسبان النتائج السلبية الحقيقية، لذا قد يُفضّل استخدام مقاييس أخرى مثل معامل ارتباط ماثيوز ، أو معامل المعلومات، أو معامل كابا لكوهين لتقييم أداء المصنّف الثنائي. [ 17 ]
لقد تم استخدام مقياس F على نطاق واسع في أدبيات معالجة اللغة الطبيعية، [ 18 ] كما هو الحال في تقييم التعرف على الكيانات المسماة وتقسيم الكلمات .
ملكيات
يمثل مقياس F1 معامل دايس لمجموعة العناصر المسترجعة ومجموعة العناصر ذات الصلة. [ 19 ]
- تتقارب قيمة F1 للمصنف الذي يتنبأ دائمًا بالفئة الإيجابية إلى 1 مع زيادة احتمال الفئة الإيجابية.
- إن قيمة F1 لمصنف يتنبأ دائمًا بالفئة الإيجابية تساوي 2 * نسبة_الفئة_الإيجابية / (1 + نسبة_الفئة_الإيجابية)، حيث أن الاستدعاء يساوي 1، والدقة تساوي نسبة الفئة الإيجابية. [ 20 ]
- إذا كان نموذج التسجيل غير مفيد (لا يمكنه التمييز بين الفئة الإيجابية والفئة السلبية) فإن العتبة المثلى هي 0 بحيث يتم التنبؤ بالفئة الإيجابية دائمًا.
- تكون قيمة F1 مقعرة بالنسبة لمعدل الإيجابية الحقيقية. [ 21 ]
نقد
ينتقد ديفيد هاند وآخرون الاستخدام الواسع النطاق لمقياس F1 لأنه يولي أهمية متساوية للدقة والاستدعاء. عمليًا، تترتب على أنواع مختلفة من التصنيفات الخاطئة تكاليف متفاوتة. بعبارة أخرى، تُعد الأهمية النسبية للدقة والاستدعاء جانبًا من جوانب المشكلة. [ 22 ]
بحسب دافيد تشيكو وجوزيبي جورمان، فإن درجة F1 أقل صدقًا وإفادة من معامل ارتباط ماثيوز (MCC) في تصنيف التقييم الثنائي. [ 23 ]
أشار ديفيد إم دبليو باورز إلى أن مقياس F1 يتجاهل النتائج السلبية الصحيحة، وبالتالي فهو مضلل بالنسبة للفئات غير المتوازنة، في حين أن مقياسي كابا والارتباط متناظران ويقيّمان كلا اتجاهي التنبؤ - حيث يتنبأ المصنف بالفئة الحقيقية، وتتنبأ الفئة الحقيقية بتنبؤ المصنف - مقترحًا مقياسين منفصلين للفئات المتعددة، وهما " المعلوماتية" و "التمييزية" ، لكل اتجاه، مع ملاحظة أن متوسطهما الهندسي هو الارتباط. [ 24 ]
من بين الانتقادات الموجهة لمقياس F1 عدم تناظره، ما يعني أنه قد تتغير قيمته عند تغيير تصنيف مجموعة البيانات، حيث تُسمى العينات "الإيجابية" "سلبية" والعكس صحيح. ويُعالج هذا الانتقاد بتعريف مقياس P4 ، الذي يُشار إليه أحيانًا على أنه امتداد متناظر لمقياس F1 . [ 25 ]
أخيرًا، يرى كلٌّ من فيرير [ 26 ] وديرلاند وآخرون [ 27 ] أن التكلفة المتوقعة (أو ما يُقابلها، المنفعة المتوقعة) هي المقياس الوحيد المُعتمد لتقييم قرارات التصنيف، لما لها من مزايا عديدة مقارنةً بمقياس F ومعامل الارتباط ماثيوز. وتُبيّن الدراستان أن مقياس F قد يُؤدي إلى استنتاجات خاطئة حول الجودة المطلقة والنسبية للأنظمة.
الفرق عن مؤشر فولكس-مالوز
بينما يمثل مقياس F المتوسط التوافقي للاستدعاء والدقة، فإن مؤشر Fowlkes–Mallows هو المتوسط الهندسي لهما . [ 28 ]
توسيع نطاق التصنيف متعدد الفئات
يُستخدم مقياس F أيضًا لتقييم مسائل التصنيف التي تضم أكثر من فئتين ( التصنيف متعدد الفئات ). وتتمثل إحدى الطرق الشائعة في حساب متوسط مقياس F لكل فئة، بهدف الحصول على قياس متوازن للأداء. [ 29 ]
ماكرو F1
مقياس F1 الكلي هو متوسط مقياس F1 الكلي الذي يهدف إلى قياس الأداء بشكل متوازن. لحساب مقياس F1 الكلي، تم استخدام صيغتين مختلفتين للمتوسط: مقياس F1 لمتوسطات الدقة والاستدعاء (الحسابية) لكل فئة، أو المتوسط الحسابي لمقياس F1 لكل فئة، حيث تُظهر الصيغة الأخيرة خصائص أفضل. [ 30 ]
مايكرو إف 1
يمثل مقياس F1 الجزئي المتوسط التوافقي للدقة الجزئية والاستدعاء الجزئي . في تصنيف الفئات المتعددة أحادي التصنيف، تتساوى الدقة الجزئية مع الاستدعاء الجزئي، وبالتالي فإن مقياس F1 الجزئي يساوي كليهما. مع ذلك، وخلافًا للاعتقاد الشائع، فإن مقياس F1 الجزئي لا يساوي الدقة عمومًا ، لأن الدقة تأخذ في الحسبان النتائج السلبية الصحيحة بينما لا يأخذها مقياس F1 الجزئي في الحسبان. [ 31 ]
انظر أيضاً
مراجع
- ↑ ساساكي، ي. (2007). "حقيقة مقياس F" (ملف PDF) . مجلة Teach Tutor Mater . المجلد 1، العدد 5، الصفحات 1-5 .
- ↑ عزيز طه، عبد (2015). "مقاييس تقييم تجزئة الصور الطبية ثلاثية الأبعاد: التحليل والاختيار والأداة" . مجلة BMC للتصوير الطبي . 15 (29) 29: 1-28 . doi : 10.1186/s12880-015-0068-x . PMC 4533825. PMID 26263899 .
- ^ فان ريسبرجن، سي جيه (1979). استرجاع المعلومات (الطبعة الثانية ). بتروورث هاينمان.
- ↑ فوسيت، توم (2006). "مقدمة في تحليل منحنى ROC" (ملف PDF) . رسائل التعرف على الأنماط . 27 (8): 861-874 . doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 .
- ↑ بروفوست، فوستر؛ توم فاوست (2013-08-01). "علم البيانات للأعمال: ما تحتاج إلى معرفته حول استخراج البيانات والتفكير التحليلي للبيانات" . أورايلي ميديا، إنك .
- ↑ باورز، ديفيد إم دبليو (2011). "التقييم: من الدقة والاستدعاء ومقياس F إلى منحنى ROC والمعلوماتية والتمييز والارتباط" . مجلة تقنيات التعلم الآلي . 2 (1): 37-63 .
- ↑ تينغ، كاي مينغ (2011). ساموت، كلود؛ ويب، جيفري آي. (محرران). موسوعة تعلم الآلة . سبرينغر. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
- ↑ بروكس، هارولد؛ براون، بارب؛ إيبرت، بيث؛ فيرو، كريس؛ جوليف، إيان؛ كوه، تيه-يونغ؛ روبير، بول؛ ستيفنسون، ديفيد (26 يناير 2015). "الفريق العامل المشترك بين برنامج أبحاث الطقس العالمي (WWRP) وبرنامج أبحاث الأرصاد الجوية الوطنية (WGNE) المعني بأبحاث التحقق من التنبؤات" . التعاون من أجل أبحاث الطقس والمناخ الأسترالية . المنظمة العالمية للأرصاد الجوية . تاريخ الاسترجاع: 17 يوليو 2019 .
- ↑ شيكو د، جورمان ج (يناير 2020). "مزايا معامل ارتباط ماثيوز (MCC) مقارنةً بدرجة F1 ودقة تقييم التصنيف الثنائي" . بي إم سي جينوميكس . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .
- ↑ شيكو د، تويتش ن، جورمان ج (فبراير 2021). "معامل ارتباط ماثيوز (MCC) أكثر موثوقية من دقة التوازن، ومعلومات وكيل المراهنات، والتمييز في تقييم مصفوفة الارتباك ثنائية الفئة" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .
- ↑ ثروت أ. (أغسطس 2018). "أساليب تقييم التصنيف" . الحوسبة التطبيقية والمعلوماتية . 17 : 168-192 . doi : 10.1016/j.aci.2018.08.003 .
- ^ برابيك ، يناير. كوماريك، توماس؛ الفرنك، فويتتش؛ ماتشليكا، لوكاش (2020). “في تقييم النموذج في ظل اختلال التوازن الطبقي غير الثابت”. المؤتمر الدولي للعلوم الحاسوبية . سبرينغر. ص 74 – 87. أرخايف : 2001.05571 . دوى : 10.1007/978-3-030-50423-6_6 .
- ↑ سيبيليني، و.؛ فريري، ج.؛ هي-غيلتون، ل.؛ أوبليه، ف.؛ وانغ، ي. كيو. (2020). "إتقان مقاييسك من خلال المعايرة". في م. بيرتهولد؛ أ. فيلدرز؛ ج. كريمبل (محررون). التطورات في تحليل البيانات الذكية الثامن عشر . سبرينغر. ص 457-469 . arXiv : 1909.02827 . doi : 10.1007/978-3-030-44584-3_36 .
- ↑ بيتزل، ستيفن م. (2006). حول فهم وتصنيف استعلامات الويب (أطروحة دكتوراه). معهد إلينوي للتكنولوجيا. CiteSeerX 10.1.1.127.634 .
- ↑ X. Li; Y.-Y. Wang; A. Acero (يوليو 2008). تعلم نية الاستعلام من رسوم بيانية منتظمة للنقرات . وقائع المؤتمر الحادي والثلاثين لـ SIGIR . ص 339. doi : 10.1145/1390334.1390393 . ISBN 9781605581644. S2CID 8482989 .
- ↑ انظر، على سبيل المثال، تقييم.
- ↑ باورز، ديفيد م. و (2015). "ما لا يقيسه مقياس F". arXiv : 1503.06410 [ cs.IR ].
- ↑ ديركزينسكي، ل. (2016). التكاملية، ودرجة F، وتقييم معالجة اللغة الطبيعية . وقائع المؤتمر الدولي حول موارد اللغة وتقييمها .
- ↑ مانينغ، كريستوفر (1 أبريل 2009). مقدمة في استرجاع المعلومات (ملف PDF) . التمرين 8.7: مطبعة جامعة كامبريدج. ص 200. تاريخ الاسترجاع: 18 يوليو 2022 .
{{cite book}}: CS1 maint: location ( link ) - ↑ "ما هو المستوى الأساسي لدرجة F1 لمصنف ثنائي؟ "
- ↑ زاكاري تشيس ليبتون؛ إلكان، تشارلز؛ ناراياناسوامي، بالاكريشنان (2014). "تحديد عتبة المصنفات لزيادة درجة F1 إلى أقصى حد". arXiv : 1402.1892 [ stat.ML ].
- ↑ هاند، ديفيد (مايو 2018). "ملاحظة حول استخدام مقياس F لتقييم خوارزميات ربط السجلات - الأبعاد" . app.dimensions.ai . 28 (3): 539–547 . doi : 10.1007/s11222-017-9746-6 . hdl : 10044/1/46235 . S2CID 38782128. تاريخ الاسترجاع: 8 ديسمبر 2018 .
- ↑ شيكو د، جورمان ج (يناير 2020). "مزايا معامل ارتباط ماثيوز (MCC) مقارنةً بدرجة F1 ودقة تقييم التصنيف الثنائي" . بي إم سي جينوميكس . 21 (6) 6. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .
- ↑ باورز، ديفيد إم دبليو (2011). "التقييم: من الدقة والاستدعاء ودرجة F إلى منحنى ROC والمعلوماتية والتمييز والارتباط". مجلة تقنيات التعلم الآلي . 2 (1): 37-63 . hdl : 2328/27165 .
- ↑ سيتارز، ميكولاي (2023). "توسيع مقياس F1، نهج احتمالي". التطورات في الذكاء الاصطناعي والتعلم الآلي . 03 (2): 1025-1038 . arXiv : 2210.11997 . doi : 10.54364/AAIML.2023.1161 .
- ↑ فيرير إل (فبراير 2025). "لا حاجة إلى بدائل مخصصة: التكلفة المتوقعة هي مقياس تصنيف مبدئي متعدد الأغراض" . معاملات بحوث التعلم الآلي .
- ↑ دايرلاند ك، لوندرفولد أ.س، بورتا مانا ب (مايو 2022). "هل يصمد التقييم أمام التقييم؟ نهج قائم على المبادئ الأساسية لتقييم المصنفات". arXiv : 2302.12006 [ cs.LG ].
- ↑ ثروت أ (أغسطس 2018). "أساليب تقييم التصنيف" . الحوسبة التطبيقية والمعلوماتية . 17 : 168-192 . doi : 10.1016/j.aci.2018.08.003 .
- ↑ أوبيتز، يوري (2024). "نظرة فاحصة على مقاييس تقييم التصنيف وتأمل نقدي في ممارسات التقييم الشائعة" . معاملات رابطة اللغويات الحاسوبية . 12 : 820-836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
- ↑ ج. أوبيتز؛ س. بيرست (2019). "ماكرو إف 1 وماكرو إف 1". arXiv : 1911.03347 [ stat.ML ].
- ↑ براونلي، جيسون (7 سبتمبر 2021). "4.3 - مقياس F1 الجزئي". التصنيف غير المتوازن باستخدام بايثون: مقاييس أفضل، موازنة الفئات المنحرفة، التعلم الحساس للتكلفة . إتقان تعلم الآلة. ص 40. ISBN 979-8468452240.
- معالجة اللغة الطبيعية الإحصائية
- تقييم الترجمة الآلية
- النسب الإحصائية
- إحصاءات موجزة لجداول التوافق
- معايير التجميع
