مقاييس التقييم (استرجاع المعلومات)
تقيّم معايير تقييم نظام استرجاع المعلومات مدى كفاءة الفهرس أو محرك البحث أو قاعدة البيانات في عرض نتائج من مجموعة موارد تلبي استفسار المستخدم. ولذلك، فهي أساسية لنجاح أنظمة المعلومات والمنصات الرقمية.
يُعدّ مدى ملاءمة النتائج المُسترجعة استجابةً للاستعلام العاملَ الأهمّ في تحديد فعالية النظام بالنسبة للمستخدمين. [ 1 ] ويمكن تقييم نجاح نظام استرجاع المعلومات من خلال مجموعة من المعايير، تشمل الملاءمة، والسرعة، ورضا المستخدم، وسهولة الاستخدام، والكفاءة، والموثوقية. [ 2 ] ويمكن تصنيف مقاييس التقييم بطرقٍ مختلفة، منها التقييم غير المتصل بالإنترنت أو المتصل به، والتقييم القائم على المستخدم أو القائم على النظام، وتشمل هذه المقاييس أساليب مثل رصد سلوك المستخدم، ومجموعات الاختبار، والدقة والاستدعاء، والنتائج المُستقاة من مجموعات اختبار مرجعية مُعدة مسبقًا.
ينبغي أن يشمل تقييم نظام استرجاع المعلومات التحقق من صحة المقاييس المستخدمة، أي تقييم مدى كفاءتها في قياس ما صُممت لقياسه، ومدى ملاءمة النظام لحالة الاستخدام المقصودة. [ 3 ] تُستخدم المقاييس عمومًا في سياقين: التجربة عبر الإنترنت، التي تقيّم تفاعلات المستخدمين مع نظام البحث، والتقييم خارج الإنترنت، الذي يقيس فعالية نظام استرجاع المعلومات على مجموعة بيانات ثابتة غير متصلة بالإنترنت.
خلفية
تتمتع أساليب الفهرسة والتصنيف، التي تُسهم في استرجاع المعلومات، بتاريخ طويل يعود إلى أقدم المكتبات والمجموعات. وقد بدأ التقييم المنهجي لفعاليتها بجدية في خمسينيات القرن الماضي مع التوسع السريع في الإنتاج البحثي في القطاعات العسكرية والحكومية والتعليمية، وظهور الفهارس المحوسبة. في ذلك الوقت، كان هناك عدد من أنظمة الفهرسة والتصنيف والفهرسة المختلفة قيد التشغيل، والتي كانت مكلفة الإنتاج، ولم يكن من الواضح أيها الأكثر فعالية. [ 4 ]
بدأ سيريل كليفيردون ، أمين مكتبة كلية الطيران في كرانفيلد بإنجلترا، سلسلة من التجارب على أساليب فهرسة واسترجاع المطبوعات، فيما يُعرف بنموذج كرانفيلد أو اختبارات كرانفيلد، والتي أرست معيارًا لتقييم أنظمة استرجاع المعلومات لسنوات عديدة. [ 4 ] طوّر كليفيردون اختبارًا يُسمى "البحث عن العناصر المعروفة" للتحقق مما إذا كان نظام استرجاع المعلومات يُعيد الوثائق المعروفة بملاءمتها أو صحتها لعملية بحث مُحددة. أرست تجارب كليفيردون عددًا من الجوانب الرئيسية اللازمة لتقييم أنظمة استرجاع المعلومات: مجموعة اختبار، ومجموعة من الاستعلامات، ومجموعة من العناصر ذات الصلة المُحددة مُسبقًا، والتي تُحدد مجتمعةً الدقة والاستدعاء.
شكل نهج كليفردون مخططًا لسلسلة مؤتمرات استرجاع النصوص الناجحة التي بدأت في عام 1992.
التطبيقات
يُعدّ تقييم أنظمة استرجاع المعلومات أساسيًا لنجاح أي محرك بحث، بما في ذلك البحث عبر الإنترنت، والبحث في مواقع الويب، وقواعد البيانات، وفهارس المكتبات. تُستخدم مقاييس التقييم في دراسات سلوك المعلومات ، واختبارات سهولة الاستخدام ، وتقييمات تكاليف الأعمال وكفاءتها. وقد ركّزت أبحاث استرجاع المعلومات بشكل أساسي على قياس فعالية هذه الأنظمة، استنادًا إلى مجموعات اختبارية مُدمجة مع مقاييس التقييم. [ 5 ] وقد أُنشئت العديد من المؤتمرات الأكاديمية التي تُركّز تحديدًا على مقاييس التقييم، ومنها مؤتمر استرجاع النصوص (TREC)، ومؤتمر ومختبرات منتدى التقييم (CLEF)، والمؤتمر الوطني لاسترجاع المعلومات (NTCIR).
القياسات عبر الإنترنت
تُستخلص المقاييس الإلكترونية عادةً من سجلات البحث. وتُستخدم هذه المقاييس غالباً لتحديد مدى نجاح اختبار A/B .
معدل التخلي عن الجلسة
معدل التخلي عن الجلسة هو نسبة جلسات البحث التي لا تؤدي إلى نقرة.
نسبة النقر إلى الظهور
نسبة النقر إلى الظهور (CTR) هي نسبة المستخدمين الذين ينقرون على رابط معين إلى إجمالي عدد المستخدمين الذين يشاهدون صفحة أو بريدًا إلكترونيًا أو إعلانًا. وتُستخدم عادةً لقياس نجاح حملة إعلانية عبر الإنترنت لموقع ويب معين، بالإضافة إلى فعالية حملات البريد الإلكتروني. [ 6 ]
معدل نجاح الجلسة
يقيس معدل نجاح الجلسة نسبة جلسات المستخدمين التي تؤدي إلى نجاح. غالبًا ما يعتمد تعريف "النجاح" على السياق، ولكن في مجال البحث، يُقاس النجاح عادةً باستخدام مدة بقاء المستخدم كعامل أساسي إلى جانب تفاعل المستخدم الثانوي، على سبيل المثال، يُعتبر نسخ المستخدم لعنوان URL للنتيجة نتيجة ناجحة، وكذلك النسخ واللصق من المقتطف.
معدل النتائج صفر
معدل النتائج الصفرية ( ZRR ) هو نسبة صفحات نتائج محركات البحث (SERPs) التي لم تُظهر أي نتائج. يشير هذا المقياس إما إلى مشكلة في استرجاع البيانات، أو إلى أن المعلومات التي يتم البحث عنها غير موجودة في الفهرس.
المقاييس غير المتصلة بالإنترنت
تُستخلص المقاييس غير المتصلة بالإنترنت عادةً من جلسات تقييم مدى الصلة، حيث يُقيّم المُقيّمون جودة نتائج البحث. ويمكن استخدام مقاييس ثنائية (ذات صلة/غير ذات صلة) ومتعددة المستويات (مثلًا، الصلة من 0 إلى 5) لتقييم كل مستند يتم عرضه استجابةً للاستعلام. عمليًا، قد تكون الاستعلامات غير محددة بدقة ، وقد تتفاوت درجات الصلة. على سبيل المثال، يوجد غموض في الاستعلام "المريخ": فالمُقيّم لا يعرف ما إذا كان المستخدم يبحث عن كوكب المريخ ، أو لوح شوكولاتة مارس ، أو المغني برونو مارس ، أو الإله الروماني مارس .
دقة
الدقة هي نسبة المستندات المسترجعة ذات الصلة باحتياجات المستخدم من المعلومات.
في التصنيف الثنائي ، تُشابه الدقة القيمة التنبؤية الإيجابية . تأخذ الدقة جميع المستندات المسترجعة في الحسبان. ويمكن أيضًا تقييمها بالنظر فقط إلى أفضل النتائج التي يُرجعها النظام باستخدام Precision@k .
تجدر الإشارة إلى أن معنى واستخدام "الدقة" في مجال استرجاع المعلومات يختلف عن تعريف الدقة والضبط في فروع أخرى من العلوم والإحصاء .
يتذكر
الاسترجاع هو نسبة المستندات ذات الصلة بالاستعلام التي يتم استرجاعها بنجاح.
في التصنيف الثنائي، يُطلق على الاستدعاء غالبًا اسم الحساسية . لذا يمكن اعتباره احتمال استرجاع مستند ذي صلة بواسطة الاستعلام .
من السهل تحقيق استرجاع بنسبة 100% عن طريق إرجاع جميع المستندات استجابةً لأي استعلام. لذا، فإن الاسترجاع وحده لا يكفي، بل يجب قياس عدد المستندات غير ذات الصلة أيضًا، على سبيل المثال عن طريق حساب الدقة.
يسقط
نسبة المستندات غير ذات الصلة التي يتم استرجاعها، من إجمالي المستندات غير ذات الصلة المتاحة:
في التصنيف الثنائي، يُعدّ التسرب عكس الخصوصية ، وهو يساويويمكن النظر إليه على أنه احتمال استرجاع مستند غير ذي صلة بواسطة الاستعلام .
من السهل تحقيق نسبة فشل 0% عن طريق إرجاع صفر من المستندات استجابةً لأي استعلام.
مقياس F / درجة F
المتوسط التوافقي المرجح للدقة والاستدعاء، أو مقياس F التقليدي أو درجة F المتوازنة هو:
يُعرف هذا أيضًا باسمالقياس، لأن الاستدعاء والدقة متساويان في الأهمية.
الصيغة العامة للأعداد الحقيقية غير السالبةيكون:
هناك مقياسان آخران شائعا الاستخدام من مقاييس F وهما:المقياس، الذي يزن البيانات ويتذكر ضعف ما يتذكره المقياس الدقيق، ومقياس يعطي وزناً للدقة ضعف وزن الاستدعاء.
تم اشتقاق مقياس F بواسطة فان ريسبرجن (1979) بحيث"يقيس مدى فعالية عملية الاسترجاع بالنسبة للمستخدم الذي يقوم بإرفاق"يُعدّ التذكّر أكثر أهمية من الدقة". وهو يستند إلى مقياس فعالية فان ريسبرجنعلاقتهما هي:
- أين
بما أن مقياس F يجمع المعلومات من كل من الدقة والاستدعاء، فهو طريقة لتمثيل الأداء العام دون عرض رقمين.
دقة متوسطة
الدقة والاستدعاء مقياسان أحاديان يعتمدان على قائمة المستندات الكاملة التي يُرجعها النظام. بالنسبة للأنظمة التي تُرجع تسلسلًا مُرتبًا من المستندات، يُستحسن أيضًا مراعاة ترتيب عرض هذه المستندات. من خلال حساب الدقة والاستدعاء عند كل موضع في التسلسل المُرتب للمستندات، يُمكن رسم منحنى الدقة والاستدعاء، حيث تُمثل الدقةكدالة للاستدعاء. تحسب الدقة المتوسطة القيمة المتوسطة لـخلال الفترة منل: [ 7 ]
هذه هي المساحة تحت منحنى الدقة والاستدعاء. ويتم استبدال هذا التكامل عمليًا بمجموع محدود على كل موضع في التسلسل المصنف للمستندات:
أينيمثل هذا الترتيب في تسلسل المستندات المسترجعة،هو عدد المستندات المسترجعة،الدقة عند القطعفي القائمة، وهل التغيير في استدعاء العناصرل[ 7 ]
هذا المجموع المحدود يعادل ما يلي:
أينهي دالة مؤشر تساوي 1 إذا كان العنصر في المرتبة[ 8 ] يُشير هذا إلى مستند ذي صلة، وإلا يُشير إلى صفر. [ 8 ] لاحظ أن المتوسط يُحسب على المستندات ذات الصلة ضمن أفضل k مستند تم استرجاعها، وأن المستندات ذات الصلة التي لم يتم استرجاعها تحصل على درجة دقة تساوي صفرًا.
يختار بعض المؤلفين الاستقراءوظيفة لتقليل تأثير "التموجات" في المنحنى. [ 9 ] [ 10 ] على سبيل المثال، في تحدي PASCAL Visual Object Classes (وهو معيار قياسي لاكتشاف الكائنات في رؤية الحاسوب) حتى عام 2010 [ 11 ]، تم حساب متوسط الدقة عن طريق حساب متوسط الدقة على مجموعة من مستويات الاستدعاء المتباعدة بالتساوي {0، 0.1، 0.2، ... 1.0}: [ 9 ] [ 10 ]
أينهي دقة مُستكمَلة تأخذ أقصى دقة على جميع عمليات الاستدعاء الأكبر من:
- .
البديل هو اشتقاق تحليليتعتمد هذه الوظيفة على افتراض توزيع بارامتري معين لقيم القرار الأساسية. على سبيل المثال، يمكن الحصول على منحنى دقة-استدعاء ثنائي طبيعي بافتراض أن قيم القرار في كلا الفئتين تتبع توزيعًا غاوسيًا. [ 12 ]
يُعطى الحد الأدنى لمتوسط الاحتمالية الممكنة لمهمة تصنيف معينة بالصيغة التالية:
الدقة عند k
في مجال استرجاع المعلومات الحديث (على نطاق الويب)، لم يعد الاستدعاء مقياسًا ذا جدوى، إذ تحتوي العديد من الاستعلامات على آلاف المستندات ذات الصلة، وقلة من المستخدمين مهتمون بقراءتها جميعًا. لا تزال دقة الوصول إلى k مستند (P@k) مقياسًا مفيدًا (على سبيل المثال، P@10 أو "الدقة عند 10" تشير إلى عدد النتائج ذات الصلة ضمن أفضل 10 مستندات مسترجعة)، لكنها لا تأخذ في الحسبان مواقع المستندات ذات الصلة ضمن أفضل k مستند. [ 14 ] ومن أوجه القصور الأخرى أنه في استعلام يحتوي على عدد أقل من k من النتائج ذات الصلة، حتى النظام المثالي سيحصل على درجة أقل من 1. [ 15 ] من الأسهل حساب الدرجة يدويًا، إذ يكفي فحص أفضل k نتيجة فقط لتحديد مدى صلتها بالموضوع.
دقة R
تتطلب دقة R معرفة جميع المستندات ذات الصلة بالاستعلام. عدد المستندات ذات الصلة،تُستخدم قيمة R كحد فاصل للحساب، وتختلف هذه القيمة من استعلام لآخر. على سبيل المثال، إذا كان هناك 15 مستندًا ذا صلة بكلمة "أحمر" في مجموعة بيانات (R=15)، فإن دقة R لكلمة "أحمر" تنظر إلى أفضل 15 مستندًا يتم إرجاعها، وتحسب عدد المستندات ذات الصلة.ويحول ذلك إلى نسبة أهمية:[ 16 ]
لاحظ أن دقة R تعادل الدقة عندالموضع رقم (P@)) والاستدعاء فيالموضع رقم -th. [ 15 ]
من الناحية التجريبية، غالباً ما يكون هذا المقياس مرتبطاً ارتباطاً وثيقاً بمتوسط الدقة. [ 15 ]
متوسط الدقة المتوسطة
متوسط الدقة (MAP) لمجموعة من الاستعلامات هو متوسط درجات الدقة لكل استعلام.
حيث Q هو عدد الاستعلامات.
الربح التراكمي المخفض
تستخدم خوارزمية DCG مقياسًا متدرجًا لأهمية المستندات من مجموعة النتائج لتقييم فائدة المستند، أو مدى استفادة المستخدم منه، بناءً على موقعه في قائمة النتائج. تقوم فكرة DCG على أن المستندات ذات الصلة العالية التي تظهر في أسفل قائمة نتائج البحث يجب معاقبتها، حيث يتم تخفيض قيمة الأهمية المتدرجة بشكل لوغاريتمي يتناسب مع موقع النتيجة. [ 17 ]
تراكمت نقاط DCG في رتبة معينةيُعرَّف على النحو التالي:
بما أن حجم مجموعة النتائج قد يختلف بين الاستعلامات أو الأنظمة المختلفة، فإن النسخة المعيارية من DCG تستخدم DCG مثاليًا لمقارنة الأداء. ولتحقيق هذه الغاية، تقوم بفرز مستندات قائمة النتائج حسب الصلة، مما ينتج عنه DCG مثالي في الموضع p (، مما يؤدي إلى توحيد النتيجة:
يمكن حساب متوسط قيم nDCG لجميع الاستعلامات للحصول على مقياس لأداء خوارزمية الترتيب. لاحظ أنه في خوارزمية ترتيب مثالية، فإنسيكون الأمر مماثلاً لـينتج عن ذلك قيمة nDCG تساوي 1.0. جميع حسابات nDCG هي قيم نسبية في الفترة من 0.0 إلى 1.0، وبالتالي فهي قابلة للمقارنة بين الاستعلامات. [ 18 ]
تدابير أخرى
- متوسط الرتبة المتبادلة
- bpref - مقياس قائم على التجميع لعدد المستندات ذات الصلة التي يتم ترتيبها قبل المستندات غير ذات الصلة [ 16 ]
- GMAP - المتوسط الهندسي للدقة المتوسطة (لكل موضوع) [ 16 ]
- التدابير القائمة على الصلة الهامشية وتنوع الوثائق - انظر الصلة (استرجاع المعلومات) § المشاكل والبدائل
- مقاييس كل من الصلة والمصداقية (للأخبار المزيفة في نتائج البحث) [ 19 ]
- معدل الإصابة
التصور
تتضمن طرق عرض أداء استرجاع المعلومات ما يلي:
- الرسوم البيانية التي ترسم الدقة على محور واحد والاستدعاء على المحور الآخر [ 16 ]
- الرسوم البيانية لمتوسط الدقة عبر مواضيع مختلفة [ 16 ]
- منحنى خصائص تشغيل المستقبل (منحنى ROC)
- مصفوفة الارتباك
مقاييس عدم الصلة
عدد الاستعلامات في كل مرة
يقيس معدل استخدام نظام البحث عدد الاستعلامات التي تُجرى عليه شهريًا/يوميًا/ساعيًا/دقيقيًا/ثانيًا. ويمكن استخدامه لتشخيص أي ارتفاع مفاجئ في الاستعلامات، أو ببساطة كمعيار أساسي للمقارنة مع مقاييس أخرى، مثل زمن استجابة الاستعلام. فعلى سبيل المثال، قد يُستخدم ارتفاع حركة الاستعلامات لتفسير ارتفاع زمن استجابة الاستعلام.
انظر أيضاً
مراجع
- ↑ كارترت، بن؛ فوريس، إيلين م. (2011)، "نظرة عامة على تقييم استرجاع المعلومات" ، في لوبو، ميهاي؛ ماير، كاتيا؛ تايت، جون؛ تريب، أنتوني ج. (محررون)، التحديات الحالية في استرجاع معلومات براءات الاختراع ، برلين، هايدلبرغ: سبرينغر، ص 69-85 ، doi : 10.1007/978-3-642-19231-9_3 ، ISBN 978-3-642-19231-9تم الاطلاع عليه بتاريخ 9 ديسمبر 2022
- ↑ كلوف، ب.؛ ساندرسون، م. (15-06-2013). "تقييم أداء أنظمة استرجاع المعلومات باستخدام مجموعات الاختبار" . بحث المعلومات . تم الاسترجاع في 09-12-2022 .
- ↑ كارلغرين، جوسي (2019). "اعتماد معايير التقييم المنهجية في البيئات التشغيلية" (ملف PDF) . استرجاع المعلومات في عالم متغير . تم الاطلاع عليه بتاريخ 27 يونيو 2022 .
- 1 2 هارمان، دونا (2011). تقييم استرجاع المعلومات . محاضرات توليفية حول مفاهيم المعلومات واسترجاعها وخدماتها. تشام، سويسرا: سبرينغر. doi : 10.1007/978-3-031-02276-0 . ISBN 978-3-031-02276-0. S2CID 207318946 .
- ↑ ساندرسون، مارك (2010). "تقييم أنظمة استرجاع المعلومات بناءً على جمع البيانات" . أسس واتجاهات في استرجاع المعلومات . 4 (4): 247-375 . doi : 10.1561/1500000009 . ISSN 1554-0669 .
- ↑ قاموس جمعية التسويق الأمريكية .تم الاطلاع عليه بتاريخ 2012-11-02. وقد أقر مجلس معايير المساءلة التسويقية (MASB) هذا التعريف كجزء من مشروع اللغة المشتركة في التسويق المستمر. تمت أرشفته بتاريخ 2019-04-05 في Wayback Machine .
- 1 2 تشو، مو (2004). "الاستدعاء، والدقة، ومتوسط الدقة" (ملف PDF) . مؤرشف من الأصل (ملف PDF) بتاريخ 2011-05-04.
{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal= - ↑ توربين، أندرو؛ شولر، فالك (2006). "أداء المستخدم مقابل مقاييس الدقة لمهام البحث البسيطة" . وقائع المؤتمر الدولي السنوي التاسع والعشرين لجمعية ACM SIGIR حول البحث والتطوير في استرجاع المعلومات . نيويورك، نيويورك: ACM. الصفحات 11-18 . CiteSeerX 10.1.1.533.4100 . doi : 10.1145/1148170.1148176 . ISBN 978-1-59593-369-0. S2CID 9810253 .
- 1 2 إيفرهام، مارك؛ فان غول، لوك؛ ويليامز، كريستوفر كي آي؛ وين، جون؛ زيسرمان، أندرو (يونيو 2010). "تحدي فئات الكائنات المرئية في لغة باسكال (VOC)" (ملف PDF) . المجلة الدولية لرؤية الحاسوب . 88 (2): 303-338 . doi : 10.1007/s11263-009-0275-4 . hdl : 20.500.11820/88a29de3-6220-442b-ab2d-284210cf72d6 . S2CID 4246903. مؤرشف من النسخة الأصلية (PDF) بتاريخ 20 نوفمبر 2011. تم الاطلاع عليه بتاريخ 29 أغسطس 2011 .
- 1 2 مانينغ، كريستوفر د.؛ راغافان، برابهاكار؛ شوتز، هينريش (2008). مقدمة في استرجاع المعلومات . مطبعة جامعة كامبريدج.
- ↑ "مجموعة أدوات تطوير تحدي فئات الكائنات المرئية في لغة باسكال 2012 (VOC2012)" . host.robots.ox.ac.uk . تم الاطلاع عليه بتاريخ 23 مارس 2019 .
- ↑ KH Brodersen, CS Ong, KE Stephan, JM Buhmann (2010). فرضية التوزيع الثنائي الطبيعي على منحنيات الدقة والاستدعاء. مؤرشف في 8 ديسمبر 2012 على موقع Wayback Machine . وقائع المؤتمر الدولي العشرين للتعرف على الأنماط ، 4263-4266.
- ↑ بويد، ك.، ديفيس، ج.، بيج، د.، وكوستا، ف.س. (2012). المنطقة غير القابلة للتحقيق في فضاء الدقة والاستدعاء وتأثيرها على التقييم التجريبي. وقائع المؤتمر الدولي للتعلم الآلي. المؤتمر الدولي للتعلم الآلي، 2012، ص 349.
- ↑ كاليرفو، يارفيلين (2017). "أساليب تقييم استرجاع المعلومات لاسترجاع الوثائق ذات الصلة العالية" (ملف PDF) . منتدى ACM SIGIR . 51، 2 : 243-250 .
- 1 2 3 كريستوفر د. مانينغ؛ برابهاكار راغافان وهينريش شوتز (2009). "الفصل الثامن: التقييم في استرجاع المعلومات" (PDF) . تم الاسترجاع 2015/06/14 . جزء من مقدمة في استرجاع المعلومات
- 1 2 3 4 5 "مقاييس التقييم المشتركة" (ملف PDF) . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 16-09-2008.
- ^ جارفيلين، كاليرفو؛ كيكالاينن، جانا (2000). "طرق تقييم علاقات المستثمرين لاسترجاع الوثائق ذات الصلة العالية" . سيجير . ACM: 41– 48. دوى : 10.1145 / 345508.345545 . رقم ISBN 978-1-58113-226-7.
- ^ جارفيلين، كاليرفو؛ كيكالاينن، جانا (2002). "التقييم المتراكم القائم على المكاسب لتقنيات الأشعة تحت الحمراء" . معاملات ACM على نظم المعلومات . 20 (4): 422-446 . دوى : 10.1145 / 582415.582418 . ردمك 1046-8188 .
- ↑ سي. ليوما؛ جيه جي سيمونسن؛ بي. لارسن (2017). "مقاييس تقييم الملاءمة والمصداقية في القوائم المصنفة" (ملف PDF) . مؤرشف من الأصل (ملف PDF) بتاريخ 13 مارس 2018. تم الاطلاع عليه بتاريخ 12 مارس 2018 .وقائع المؤتمر الدولي لجمعية ACM SIGIR حول نظرية استرجاع المعلومات ، 91-98.
- استرجاع المعلومات
- تقييم استرجاع المعلومات
- محركات البحث على الإنترنت
