الفهرسة العشوائية

الفهرسة العشوائية هي طريقة لتقليل الأبعاد وإطار حسابي للدلالات التوزيعية ، تستند إلى فكرة أن تطبيقات نموذج فضاء المتجهات عالي الأبعاد غير عملية، وأن النماذج لا تحتاج إلى أن تنمو في الأبعاد عند مواجهة عناصر جديدة (مثل المصطلحات الجديدة)، وأنه يمكن إسقاط نموذج عالي الأبعاد في فضاء ذي أبعاد أقل دون المساس بمقاييس مسافة L2 إذا تم اختيار الأبعاد الناتجة بشكل مناسب.

هذه هي الفكرة الأساسية لمنهج الإسقاط العشوائي لتقليل الأبعاد، والذي صيغ لأول مرة في معضلة جونسون-ليندنستراوس ، ويشترك التجزئة الحساسة للموقع في بعض هذه الأفكار. أما الفهرسة العشوائية، كما تُستخدم في تمثيل اللغة، فتعود أصولها إلى أعمال بنتي كانيرفا [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] حول الذاكرة الموزعة المتفرقة ، ويمكن وصفها بأنها صياغة تدريجية للإسقاط العشوائي. [ 6 ]

يمكن أيضًا التحقق من أن الفهرسة العشوائية هي تقنية إسقاط عشوائي لبناء الفضاءات الإقليدية، أي الفضاءات المتجهة المعيارية L2. [ 7 ] في الفضاءات الإقليدية، يتم توضيح الإسقاطات العشوائية باستخدام مبرهنة جونسون-ليندنشتراوس. [ 8 ]

تُوسّع تقنية TopSig [ 9 ] نموذج الفهرسة العشوائية لإنتاج متجهات ثنائية للمقارنة مع دالة تشابه مسافة هامينغ . تُستخدم هذه التقنية لتحسين أداء استرجاع المعلومات وتجميع المستندات . وفي سياق بحثي مماثل، تم اقتراح فهرسة الأعداد الصحيحة العشوائية لمانهاتن (RMII) [ 10 ] لتحسين أداء الطرق التي تستخدم مسافة مانهاتن بين وحدات النص. تُولّد العديد من طرق الفهرسة العشوائية التشابه بشكل أساسي من خلال التواجد المشترك للعناصر في مجموعة النصوص. بينما تُولّد الفهرسة العشوائية الانعكاسية (RRI) [ 11 ] التشابه من خلال التواجد المشترك ومن خلال التواجد المشترك مع عناصر أخرى.

مراجع

  1. كانيرفا، بنتي، كريستوفرسون، جان وهولست، أندرس (2000): الفهرسة العشوائية لعينات النصوص للتحليل الدلالي الكامن ، وقائع المؤتمر السنوي الثاني والعشرين لجمعية العلوم المعرفية، ص 1036. ماوا، نيو جيرسي: إيرلبوم، 2000.
  2. سالغرين، ماغنوس (2005) مقدمة في الفهرسة العشوائية ، وقائع ورشة عمل أساليب وتطبيقات الفهرسة الدلالية في المؤتمر الدولي السابع للمصطلحات وهندسة المعرفة، TKE 2005، 16 أغسطس، كوبنهاغن، الدنمارك
  3. Sahlgren, Magnus, Holst, Anders and Pentti Kanerva (2008) Permutations as a Means to Encode Order in Word Space , In Proceedings of the 30th Annual Conference of the Cognitive Science Society: 1300-1305.
  4. كانيرفا، بنتي (2009) الحوسبة فائقة الأبعاد: مقدمة للحوسبة في التمثيل الموزع باستخدام المتجهات العشوائية عالية الأبعاد ، الحوسبة المعرفية، المجلد 1، العدد 2، ص 139-159.
  5. جوشي، أديتيا، يوهان هالسيث، وبنتي كانيرفا. " التعرف على اللغة باستخدام الفهرسة العشوائية ". arXiv preprint arXiv:1412.7026 (2014).
  6. Recchia, Gabriel, et al. " ترميز المعلومات المتسلسلة في نماذج الفضاء المتجهي للدلالات: مقارنة التمثيل المخفض الهولوغرافي والتبديل العشوائي ." (2010): 865-870.
  7. قاسمي زاده، بهرانج وهاندشوه، سيجرفيلد. (2014) فهرسة مانهاتن العشوائية ، في وقائع ورشة العمل الدولية الخامسة والعشرين حول تطبيقات قواعد البيانات وأنظمة الخبراء.
  8. جونسون، دبليو. وليندنشتراوس، ج. (1984) امتدادات خرائط ليبشيتز إلى فضاء هيلبرت ، في الرياضيات المعاصرة. الجمعية الرياضية الأمريكية، المجلد 26، الصفحات 189-206.
  9. Geva, S. & De Vries, CM (2011) TopSig: Topology Preserving Document Signatures , In Proceedings of Conference on Information and Knowledge Management 2011, 24–28 October 2011, Glasgow, Scotland.
  10. قاسمي زاده، بهرانج. وهاندشوه، سيغفريد. (2014) فهرسة الأعداد الصحيحة العشوائية في مانهاتن: بناء فضاء متجه معياري L1 تزايدي ، في وقائع مؤتمر 2014 حول الأساليب التجريبية في معالجة اللغة الطبيعية (EMNLP)، الصفحات 1713-1723، 25-29 أكتوبر 2014، الدوحة، قطر.
  11. Cohen T., Schvaneveldt Roger & Widdows Dominic (2009) Reflective Random Indexing and indirect inference: a scalable method for discovery of implicit connections , Journal of Biomedical Informatics, 43(2):240-56.