تعلم الأنطولوجيا
يُعرَّف تعلّم الأنطولوجيا ( استخراج الأنطولوجيا ، أو توليد الأنطولوجيا ، أو اكتساب الأنطولوجيا ) بأنه عملية إنشاء الأنطولوجيات بشكل آلي أو شبه آلي ، وتشمل استخراج مصطلحات المجال ذي الصلة والعلاقات بين المفاهيم التي تمثلها هذه المصطلحات من مجموعة نصوص باللغة الطبيعية، وتشفيرها بلغة أنطولوجية لتسهيل استرجاعها. ونظرًا لأن بناء الأنطولوجيات يدويًا عملية شاقة للغاية وتستغرق وقتًا طويلًا، فهناك دافع قوي لأتمتة هذه العملية.
تبدأ العملية عادةً باستخراج المصطلحات والمفاهيم أو العبارات الاسمية من النص العادي باستخدام معالجات لغوية مثل تحديد أجزاء الكلام وتقسيم العبارات . ثم تُستخدم تقنيات إحصائية [ 1 ] أو رمزية [ 2 ] [ 3 ] لاستخراج بصمات العلاقات ، والتي غالباً ما تعتمد على تقنيات استخراج المصطلحات العامة القائمة على الأنماط [ 4 ] أو التعريفات [ 5 ] .
إجراء
يُستخدم تعلّم الأنطولوجيا (OL) لاستخراج الأنطولوجيات الكاملة من نصوص اللغة الطبيعية بشكل شبه تلقائي. [ 6 ] [ 7 ] عادةً ما تُقسّم هذه العملية إلى المهام الثماني التالية، والتي لا تُطبّق جميعها بالضرورة في كل نظام لتعلّم الأنطولوجيا.
استخراج مصطلحات المجال
خلال خطوة استخلاص مصطلحات المجال ، تُستخلص المصطلحات الخاصة بالمجال، والتي تُستخدم في الخطوة التالية (اكتشاف المفاهيم) لاستخلاص المفاهيم. يمكن تحديد المصطلحات ذات الصلة، على سبيل المثال، عن طريق حساب قيم TF/IDF أو تطبيق طريقة C-value/NC-value. يجب على خبير في المجال تصفية قائمة المصطلحات الناتجة. في الخطوة اللاحقة، على غرار حل الإحالات في استخلاص المعلومات ، يحدد نظام التعلم الآلي المرادفات، لأنها تشترك في نفس المعنى وبالتالي تُشير إلى نفس المفهوم. ولذلك، فإن أكثر الطرق شيوعًا هي التجميع وتطبيق مقاييس التشابه الإحصائي.
اكتشاف المفاهيم
في خطوة اكتشاف المفاهيم، تُجمّع المصطلحات في وحدات تحمل معنى، والتي تُقابل تجريدًا للعالم وبالتالي للمفاهيم . المصطلحات المُجمّعة هي هذه المصطلحات الخاصة بالمجال ومرادفاتها، والتي تم تحديدها في خطوة استخراج مصطلحات المجال.
اشتقاق التسلسل الهرمي للمفاهيم
في خطوة استخلاص التسلسل الهرمي للمفاهيم، يحاول نظام التعلم المفتوح ترتيب المفاهيم المستخرجة في بنية تصنيفية. ويتحقق ذلك غالبًا باستخدام أساليب التجميع الهرمي غير الخاضعة للإشراف. ولأن نتائج هذه الأساليب غالبًا ما تكون غير دقيقة، تُضاف خطوة إشراف، مثل تقييم المستخدم. ثمة طريقة أخرى لاستخلاص التسلسل الهرمي للمفاهيم، وهي استخدام أنماط متعددة تُشير إلى علاقة التبعية أو التضمين . تُشير أنماط مثل "X، أي Y" أو "X هو Y" إلى أن X فئة فرعية من Y. يمكن تحليل هذه الأنماط بكفاءة، لكنها غالبًا ما تظهر بشكل غير كافٍ لاستخلاص عدد كافٍ من علاقات التبعية أو التضمين. ولذلك، طُوّرت أساليب إعادة التوزيع (Bootstrap) التي تتعلم هذه الأنماط تلقائيًا، مما يضمن تغطية أوسع.
تعلم العلاقات غير التصنيفية
في خطوة تعلم العلاقات غير التصنيفية، تُستخلص العلاقات التي لا تُعبّر عن أي تبعية أو تداخل. ومن أمثلة هذه العلاقات: "يعمل لدى" أو "يتواجد في". هناك منهجان شائعان لحل هذه المهمة الفرعية. يعتمد المنهج الأول على استخلاص الارتباطات المجهولة، والتي تُسمى بشكل مناسب في خطوة لاحقة. أما المنهج الثاني فيستخلص الأفعال، التي تُشير إلى علاقة بين الكيانات، ممثلة بالكلمات المحيطة بها. يجب تقييم نتائج كلا المنهجين من قِبل متخصص في علم الوجود لضمان دقتها.
اكتشاف القواعد
أثناء عملية اكتشاف القواعد ، تُولَّد [ 8 ] بديهيات (وصف رسمي للمفاهيم) للمفاهيم المستخرجة. ويمكن تحقيق ذلك، على سبيل المثال، من خلال تحليل البنية النحوية لتعريف باللغة الطبيعية وتطبيق قواعد التحويل على شجرة التبعية الناتجة. وتكون نتيجة هذه العملية قائمة بديهيات، تُترجم لاحقًا إلى وصف للمفهوم. ثم يُقيِّم عالم الأنطولوجيا هذا الناتج.
مجموعة سكانية من علم الوجود
في هذه المرحلة، يتم إثراء الأنطولوجيا بنماذج للمفاهيم والخصائص. ولإثراء الأنطولوجيا بنماذج المفاهيم، تُستخدم طرق تعتمد على مطابقة الأنماط المعجمية النحوية. أما نماذج الخصائص، فتُضاف من خلال تطبيق طرق التمهيد ، التي تجمع مجموعات العلاقات.
امتداد التسلسل الهرمي للمفاهيم
في هذه الخطوة، يحاول نظام التصنيف الأنطولوجي توسيع البنية التصنيفية لأنطولوجيا موجودة بإضافة مفاهيم جديدة. ويمكن القيام بذلك بطريقة خاضعة للإشراف باستخدام مصنف مُدرَّب، أو بطريقة غير خاضعة للإشراف من خلال تطبيق مقاييس التشابه .
اكتشاف الإطارات والأحداث
أثناء عملية الكشف عن الإطار/الحدث، يحاول نظام OL استخلاص العلاقات المعقدة من النص، مثل: من انطلق، ومن أين، وإلى أي مكان، ومتى. وتتراوح الأساليب من تطبيق خوارزمية SVM مع طرق النواة إلى تصنيف الأدوار الدلالية (SRL) [ 9 ] إلى تقنيات التحليل الدلالي العميق. [ 10 ]
أدوات
Dog4Dag (مولد أنطولوجيا دريسدن للرسوم البيانية الموجهة غير الدورية) هو إضافة لإنشاء الأنطولوجيا لبرنامجي Protégé 4.1 و OBOEdit 2.1. تتيح هذه الإضافة إنشاء المصطلحات، وإنشاء المصطلحات الشقيقة، وإنشاء التعريفات، واستقراء العلاقات. وبفضل تكاملها مع Protégé 4.1 و OBO-Edit 2.1، تسمح Dog4Dag بتوسيع الأنطولوجيا لجميع تنسيقات الأنطولوجيا الشائعة (مثل OWL و OBO). وتقتصر هذه الإضافة بشكل كبير على توسيع خدمات البحث في EBI و Bio Portal. [ 11 ]
انظر أيضاً
فهرس
- ب. بويتيلار، ب. سيميانو (محرران). تعلم الأنطولوجيا والسكان: سد الفجوة بين النص والمعرفة ، معلومات سلسلة الحدود في الذكاء الاصطناعي والتطبيقات ، دار نشر IOS، 2008.
- ب. بويتيلار، ب. سيميانو، وب. ماغنيني (محررون). تعلم الأنطولوجيا من النص: الأساليب والتقييم والتطبيقات ، معلومات سلسلة الحدود في الذكاء الاصطناعي والتطبيقات ، دار نشر IOS، 2005.
- وونغ، و. (2009)، " تعلم الأنطولوجيات الخفيفة من النصوص عبر مجالات مختلفة باستخدام الويب كمعرفة أساسية ". أطروحة دكتوراه في الفلسفة، جامعة غرب أستراليا.
- وونغ، و.، ليو، و.، وبنامون، م. (2012)، " تعلم الأنطولوجيا من النص: نظرة إلى الماضي وإلى المستقبل ". مجلة ACM Computing Surveys، المجلد 44، العدد 4، الصفحات 20:1-20:36.
- توماس واشتر، جوتز فابيان، مايكل شرودر: DOG4DAG: توليد علم الوجود شبه الآلي في OBO-Edit وProtégé. SWAT4LS لندن، 2011. دوى : 10.1145/2166896.2166926
مراجع
- ↑ أ. مايدش وس. ستاب. تعلم الأنطولوجيات للويب الدلالي . في ورشة عمل الويب الدلالي 2001.
- ↑ روبرتو نافيلي وباولا فيلاردي . تعلم أنطولوجيات المجال من مستودعات المستندات ومواقع الويب المخصصة ، اللغويات الحاسوبية، 30 (2)، مطبعة معهد ماساتشوستس للتكنولوجيا، 2004، ص 151-179.
- ↑ P.Velardi, S.Faralli, R.Navigli. OntoLearn Reloaded: A Graph-based Algorithm for Taxonomy Induction . Computational Linguistics, 39(3), MIT Press,2013, pp.665-707.
- ↑ مارتي أ. هيرست. الاستحواذ التلقائي على المرادفات من مجموعات النصوص الكبيرة . في وقائع المؤتمر الدولي الرابع عشر للغويات الحاسوبية، الصفحات 539-545، نانت، فرنسا، يوليو 1992.
- ↑ R.Navigli, P. Velardi. Learning Word-Class Lattices for Definition and Publicym Extraction .Proc.of the 48th Annual Meeting of the Association for Computational Linguistics (ACL 2010), Uppsala, Sweden, July 11–16 2010, pp.1318-1327.
- ↑ سيميانو، فيليب؛ فولكر، جوهانا؛ ستودر، رودي (2006). "الأنطولوجيات عند الطلب؟ - وصف لأحدث التقنيات والتطبيقات والتحديات والاتجاهات في تعلم الأنطولوجيا من النصوص"، المعلومات، العلوم والممارسة ، 57، ص 315-320، http://people.aifb.kit.edu/pci/Publications/iwp06.pdf%5B%5D (تم الاطلاع عليه بتاريخ 18/06/2012).
- ↑ وونغ، و.، ليو، و.، وبنامون، م. (2012)، " تعلم الأنطولوجيا من النص: نظرة إلى الماضي وإلى المستقبل ". مجلة ACM Computing Surveys، المجلد 44، العدد 4، الصفحات 20:1-20:36.
- ↑ جوهانا فولكر؛ باسكال هيتزلر ؛ سيميانو، فيليب (2007). "اكتساب بديهيات OWL DL من الموارد المعجمية"، وقائع المؤتمر الأوروبي الرابع حول الويب الدلالي ، ص 670-685، http://smartweb.dfki.de/Vortraege/lexo_2007.pdf (تم الاطلاع عليه: 18.06.2012).
- ↑ كوبولا ب.؛ جانجيمي أ.؛ غليوزو أ.؛ بيكا د.؛ بريسوتي ف. (2009). " الكشف عن الإطارات عبر الويب الدلالي "، وقائع المؤتمر الأوروبي للويب الدلالي (ESWC2009)، سبرينغر، 2009.
- ↑ بريسوتي ف.؛ درايتشيو ف.؛ جانجيمي أ. (2009). " استخلاص المعرفة بناءً على نظرية تمثيل الخطاب والأطر اللغوية "، وقائع مؤتمر هندسة المعرفة وإدارة المعرفة (EKAW2012)، سلسلة محاضرات في علوم الحاسوب، سبرينغر، 2012.
- ^ توماس واشتر، جوتز فابيان، مايكل شرودر: DOG4DAG: توليد علم الوجود شبه الآلي في OBO-Edit وProtégé. SWAT4LS لندن، 2011. دوى : 10.1145/2166896.2166926 http://www.biotec.tu-dresden.de/research/schroeder/dog4dag/
- معالجة اللغة الطبيعية
- تعلم الأنطولوجيا (علوم الحاسوب)
