عامل الشذوذ المحلي
في مجال الكشف عن الحالات الشاذة ، يُعد عامل الشذوذ المحلي ( LOF ) خوارزمية اقترحها ماركوس إم. برونيج، وهانز-بيتر كريجل ، وريموند تي. نج، ويورج ساندر في عام 2000 لإيجاد نقاط البيانات الشاذة عن طريق قياس الانحراف المحلي لنقطة بيانات معينة بالنسبة لجيرانها. [ 1 ]
تشترك خوارزمية LOF في بعض المفاهيم مع خوارزميتي DBSCAN و OPTICS مثل مفهومي "مسافة النواة" و"مسافة الوصول"، واللذان يستخدمان لتقدير الكثافة المحلية. [ 2 ]
الفكرة الأساسية

يعتمد عامل الشذوذ المحلي على مفهوم الكثافة المحلية، حيث تُحدد المحلية من خلال أقرب k جار، وتُستخدم المسافة بينهم لتقدير الكثافة. وبمقارنة الكثافة المحلية لجسم ما بالكثافات المحلية لجيرانه، يمكن تحديد المناطق ذات الكثافة المتشابهة، والنقاط ذات الكثافة الأقل بكثير من جيرانها. وتُعتبر هذه النقاط شذوذًا .
تُقدَّر الكثافة المحلية بالمسافة النموذجية التي يمكن عندها الوصول إلى نقطة ما من جيرانها. يُعد تعريف "مسافة الوصول" المستخدم في خوارزمية LOF مقياسًا إضافيًا لإنتاج نتائج أكثر استقرارًا داخل المجموعات. وتتضمن "مسافة الوصول" المستخدمة في خوارزمية LOF بعض التفاصيل الدقيقة التي غالبًا ما تُعتبر غير صحيحة في المصادر الثانوية، مثل كتاب إيثم ألبيدين. [ 3 ]
التعريف الرسمي
يتركلنفترض أن المسافة بين الجسم A وجاره الأقرب رقم k هي . لاحظ أن مجموعة الجيران الأقرب k تشمل جميع الأجسام على هذه المسافة، والتي قد يزيد عددها عن k جسم في حالة التعادل . نرمز إلى مجموعة الجيران الأقرب k بالرمز ..

تُستخدم هذه المسافة لتحديد ما يسمى بمسافة الوصول :
بعبارة أخرى، مسافة الوصول لجسم أ من جسم ب هي المسافة الحقيقية بين الجسمين، ولكن على الأقلمن B. تُعتبر الكائنات التي تنتمي إلى أقرب k جار لـ B (أي "جوهر" B ، انظر تحليل التجميع DBSCAN ) متساوية البعد. والسبب في ذلك هو تقليل التقلبات الإحصائية بين جميع النقاط A القريبة من B ، حيث يؤدي زيادة قيمة k إلى زيادة تأثير التنعيم. [ 1 ] لاحظ أن هذا ليس بُعدًا بالمعنى الرياضي، لأنه غير متناظر. (على الرغم من أنه من الأخطاء الشائعة [ 4 ] استخدام دائمًاوهذا ينتج عنه طريقة مختلفة قليلاً، يشار إليها باسم Simplified-LOF [ 4 ] )
تُعرَّف كثافة إمكانية الوصول المحلية للكائن A بواسطة
وهو مقلوب متوسط مسافة الوصول للكائن A من جيرانه. لاحظ أنه ليس متوسط مسافة الوصول للجيران من A (والذي سيكون بحكم التعريف هو)، ولكن المسافة التي يمكن عندها "الوصول" إلى النقطة A من جيرانها. ومع وجود نقاط مكررة، يمكن أن تصبح هذه القيمة لانهائية.
ثم تتم مقارنة كثافات إمكانية الوصول المحلية مع كثافات الجيران باستخدام
وهي متوسط كثافة الوصول المحلي للجيران مقسومًا على كثافة الوصول المحلي للكائن نفسه. تشير قيمة تقارب 1 إلى أن الكائن مماثل لجيرانه (وبالتالي ليس قيمة شاذة). تشير قيمة أقل من 1 إلى منطقة ذات كثافة أعلى (والتي ستكون قيمة داخلية)، بينما تشير القيم الأكبر بكثير من 1 إلى قيم شاذة.
يعني كثافة مماثلة للجيران،
يعني كثافة أعلى من المناطق المجاورة (داخلية)،
يعني كثافة أقل من الجيران (قيمة شاذة).
المزايا

بفضل منهجها المحلي، تستطيع خوارزمية LOF تحديد القيم الشاذة في مجموعة البيانات، والتي لا تُعتبر شاذة في مناطق أخرى من نفس المجموعة. على سبيل المثال، تُعتبر نقطة تقع على مسافة "قصيرة" من مجموعة كثيفة للغاية قيمة شاذة، بينما قد تُظهر نقطة داخل مجموعة متفرقة مسافات مماثلة من جيرانها.
على الرغم من أن الحدس الهندسي لخوارزمية LOF ينطبق فقط على فضاءات المتجهات منخفضة الأبعاد، إلا أنه يمكن تطبيق الخوارزمية في أي سياق يمكن فيه تعريف دالة عدم التشابه. وقد أثبتت التجارب فعاليتها العالية في العديد من الإعدادات، وغالبًا ما تتفوق على المنافسين، على سبيل المثال في كشف اختراقات الشبكات [ 5 ] وعلى بيانات التصنيف المعيارية المعالجة [ 6 ] .
يمكن تعميم عائلة طرق LOF بسهولة وتطبيقها على مشاكل أخرى متنوعة، مثل اكتشاف القيم الشاذة في البيانات الجغرافية أو تدفقات الفيديو أو شبكات التأليف. [ 4 ]
العيوب والتوسعات
القيم الناتجة هي قيم قسمة يصعب تفسيرها. تشير القيمة 1 أو أقل إلى نقطة داخلية واضحة، ولكن لا توجد قاعدة واضحة لتحديد متى تكون النقطة شاذة. في مجموعة بيانات واحدة، قد تكون القيمة 1.1 شاذة بالفعل، بينما في مجموعة بيانات أخرى ومع معلمات مختلفة (مع تقلبات محلية قوية)، قد تظل القيمة 2 نقطة داخلية. يمكن أن تحدث هذه الاختلافات أيضًا داخل مجموعة البيانات الواحدة بسبب موضعية الطريقة. توجد امتدادات لـ LOF تحاول تحسينها في هذه الجوانب:
- تعتمد خوارزمية تجميع الميزات للكشف عن القيم الشاذة [ 7 ] على تطبيق خوارزمية LOF على إسقاطات متعددة، ثم تجمع النتائج لتحسين جودة الكشف في الأبعاد العالية. تُعد هذه الخوارزمية أول نهج للتعلم الجماعي في الكشف عن القيم الشاذة، وللاطلاع على متغيرات أخرى، يُرجى مراجعة المرجع [ 8 ] .
- تُعدّ طريقة احتمالية القيم الشاذة المحلية (LoOP) [ 9 ] طريقةً مُشتقةً من طريقة LOF، ولكنها تستخدم إحصاءات محلية غير مكلفة لتقليل حساسيتها لاختيار المعامل k . بالإضافة إلى ذلك، يتم تحجيم القيم الناتجة إلى نطاق يتراوح بين 0 و1 .
- يقترح تفسير وتوحيد درجات القيم الشاذة [ 10 ] توحيد درجات القيم الشاذة LOF إلى الفترة [0:1] باستخدام القياس الإحصائي لزيادة قابلية الاستخدام ويمكن اعتبارها نسخة محسنة من أفكار LoOP.
- يقترح [ 11 ] طرقًا لقياس التشابه والتنوع في طرق بناء مجموعات الكشف عن القيم الشاذة المتقدمة باستخدام متغيرات LOF وخوارزميات أخرى وتحسين نهج تجميع الميزات الذي تمت مناقشته أعلاه.
- إعادة النظر في اكتشاف القيم الشاذة المحلية: نظرة معممة على مفهوم المحلية مع تطبيقات لاكتشاف القيم الشاذة في البيانات المكانية والفيديوهات والشبكات [ 4 ]، حيث يناقش هذا البحث النمط العام في مختلف طرق اكتشاف القيم الشاذة المحلية (بما في ذلك، على سبيل المثال، LOF، ونسخة مبسطة من LOF، وLoOP)، ويستخلص منه إطارًا عامًا. ثم يُطبق هذا الإطار، على سبيل المثال، لاكتشاف القيم الشاذة في البيانات الجغرافية، وتدفقات الفيديو، وشبكات التأليف.
مراجع
- 1 2 برونينغ، م.م.؛ كريغل، هـ.-ب .؛ نغ، ر.ت.؛ ساندر، ج. (2000). LOF: تحديد القيم الشاذة المحلية القائمة على الكثافة (ملف PDF) . وقائع مؤتمر ACM SIGMOD الدولي لإدارة البيانات لعام 2000. SIGMOD . الصفحات 93-104 . doi : 10.1145/335191.335388 . ISBN 1-58113-217-4.
- ↑ برونينغ، م.م.؛ كريغل، هـ.-ب .؛ نغ، ر.ت.؛ ساندر، ج.ر. (1999). "OPTICS-OF: تحديد القيم الشاذة المحلية" (ملف PDF) . مبادئ استخراج البيانات واكتشاف المعرفة . سلسلة محاضرات في علوم الحاسوب. المجلد 1704. الصفحات 262-270 . doi : 10.1007/978-3-540-48247-5_28 . ISBN 978-3-540-66490-1.
- ↑ ألبيدين، إيثم (2020). مقدمة في تعلم الآلة ( الطبعة الرابعة). كامبريدج، ماساتشوستس. ISBN 978-0-262-04379-3. OCLC 1108782604 .
{{cite book}}: CS1 maint: موقع الناشر مفقود ( رابط ) - 1 2 3 4 شوبرت، إي.؛ زيمك، أ.؛ كريغل، هـ. -ب. (2012). "إعادة النظر في الكشف عن القيم الشاذة المحلية: نظرة معممة على المحلية مع تطبيقات للكشف عن القيم الشاذة المكانية والفيديو والشبكية". استخراج البيانات واكتشاف المعرفة . 28 : 190-237 . doi : 10.1007/s10618-012-0300-z . S2CID 19036098 .
- ↑ لازاريفيتش، أ.؛ أوزغور، أ.؛ إرتوز، ل.؛ سريفاستافا، ج.؛ كومار، ف. (2003). "دراسة مقارنة لأنظمة كشف الشذوذ في كشف اختراق الشبكات" (ملف PDF) . وقائع المؤتمر الدولي لجمعية الرياضيات التطبيقية والصناعية (SIAM) لعام 2003 حول استخراج البيانات . الصفحات 25-36 . doi : 10.1137/1.9781611972733.3 . ISBN 978-0-89871-545-3أُرشف من النسخة الأصلية (PDF) بتاريخ 17 يوليو 2013. تم الاطلاع عليه بتاريخ 14 مايو 2010 .
- ↑ كامبوس، غيلهيرمي أو.؛ زيميك، آرثر؛ ساندر، يورغ؛ كامبيلو، ريكاردو جيه جي بي؛ ميسينكوفا، باربورا؛ شوبرت، إريك؛ أسنت، إيرا؛ هول، مايكل إي. (2016). "حول تقييم الكشف غير الخاضع للإشراف عن القيم الشاذة: المقاييس، ومجموعات البيانات، ودراسة تجريبية". استخراج البيانات واكتشاف المعرفة . 30 (4): 891-927 . doi : 10.1007/s10618-015-0444-8 . ISSN 1384-5810 . S2CID 1952214 .
- ↑ لازاريفيتش، أ.؛ كومار، ف. (2005). "تجميع الميزات للكشف عن القيم الشاذة". وقائع المؤتمر الدولي الحادي عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة في استخراج البيانات . الصفحات 157-166 . doi : 10.1145/1081870.1081891 . ISBN 159593135X. S2CID 2054204 .
- ↑ زيمك، أ.؛ كامبيلو، ر. ج. ج. ب.؛ ساندر، ج. ر. (2014). "مجموعات للكشف عن القيم الشاذة غير الخاضعة للإشراف". نشرة ACM SIGKDD Explorations الإخبارية . 15 : 11-22 . doi : 10.1145/2594473.2594476 . S2CID 8065347 .
- ↑ كريجل، هـ.-ب .؛ كروجر، ب.؛ شوبرت، إ.؛ زيمك، أ. (2009). "LoOP: احتمالات القيم الشاذة المحلية". وقائع المؤتمر الثامن عشر لجمعية ACM حول إدارة المعلومات والمعرفة (ملف PDF) . CIKM '09. الصفحات 1649-1652 . doi : 10.1145/1645953.1646195 . ISBN 978-1-60558-512-3.
- ↑ كريجل، إتش بي ؛ كروجر، بي؛ شوبرت، إي؛ زيمك، إيه (2011). تفسير وتوحيد درجات القيم الشاذة . وقائع المؤتمر الدولي لجمعية الرياضيات التطبيقية والصناعية (SIAM) لعام 2011 حول استخراج البيانات. الصفحات 13-24 . CiteSeerX 10.1.1.232.2719 . doi : 10.1137/1.9781611972818.2 . ISBN 978-0-89871-992-5.
- ↑ شوبرت، إي.؛ ووجدانوفسكي، ر.؛ زيمك، أ.؛ كريجل، هـ.ب. (2012). حول تقييم تصنيفات القيم الشاذة ودرجاتها . وقائع المؤتمر الدولي لجمعية الرياضيات التطبيقية والصناعية (SIAM) لعام 2012 حول استخراج البيانات. الصفحات 1047-1058 . CiteSeerX 10.1.1.300.7205 . doi : 10.1137/1.9781611972825.90 . ISBN 978-1-61197-232-0.
- القيم الشاذة إحصائياً
- استخراج البيانات
- خوارزميات التعلم الآلي
