استخلاص المعرفة

استخلاص المعرفة هو عملية إنشاء المعرفة من مصادر منظمة ( قواعد البيانات العلائقية ، XML ) وغير منظمة ( نصوص ، مستندات، صور ). يجب أن تكون المعرفة الناتجة بتنسيق قابل للقراءة والتفسير آليًا، وأن تُمثل المعرفة بطريقة تُسهل الاستدلال. على الرغم من تشابهها المنهجي مع استخلاص المعلومات في معالجة اللغة الطبيعية وعمليات الاستخراج والتحويل والتحميل ، إلا أن المعيار الأساسي هو أن نتيجة الاستخلاص تتجاوز مجرد إنشاء معلومات منظمة أو تحويلها إلى مخطط علائقي . فهي تتطلب إما إعادة استخدام المعرفة الرسمية الموجودة (إعادة استخدام المعرفات أو الأنطولوجيات ) أو إنشاء مخطط بناءً على بيانات المصدر.

كانت مجموعة RDB2RDF التابعة لاتحاد شبكة الويب العالمية [ 1 ] تعمل على توحيد لغة لاستخراج أطر وصف الموارد (RDF) من قواعد البيانات العلائقية . ومن الأمثلة الشائعة الأخرى لاستخراج المعرفة تحويل ويكيبيديا إلى بيانات منظمة ، وكذلك ربطها بالمعرفة الموجودة (انظر DBpedia و Freebase ).

ملخص

بعد توحيد لغات تمثيل المعرفة مثل RDF و OWL ، أُجريت أبحاثٌ كثيرة في هذا المجال، لا سيما فيما يتعلق بتحويل قواعد البيانات العلائقية إلى RDF، وحلّ الهويات ، واكتشاف المعرفة ، وتعلم الأنطولوجيا. تعتمد العملية العامة على أساليب تقليدية لاستخراج المعلومات، مثل استخراج البيانات وتحويلها وتحميلها (ETL)، والتي تحوّل البيانات من مصادرها إلى تنسيقات مُهيكلة. وبالتالي، يُسهم فهم كيفية تفاعل هذه البيانات وتعلمها من بعضها البعض في فهم كيفية تفاعلها وتعلمها من بعضها.

يمكن استخدام المعايير التالية لتصنيف المناهج في هذا الموضوع (بعضها لا يأخذ في الاعتبار سوى الاستخراج من قواعد البيانات العلائقية): [ 2 ]

مصدرما هي مصادر البيانات التي يتم تغطيتها: النصوص، قواعد البيانات العلائقية، XML، CSV
معرضكيف يتم توضيح المعرفة المستخرجة (ملف الأنطولوجيا، قاعدة البيانات الدلالية)؟ وكيف يمكن الاستعلام عنها؟
التزامنهل تُنفَّذ عملية استخلاص المعرفة مرة واحدة لإنتاج نسخة احتياطية، أم تتم مزامنة النتيجة مع المصدر؟ ثابتة أم ديناميكية؟ هل تُعاد كتابة التغييرات التي تُجرى على النتيجة (ثنائية الاتجاه)؟
إعادة استخدام المفرداتتستطيع الأداة إعادة استخدام المفردات الموجودة في عملية الاستخراج. على سبيل المثال، يمكن ربط عمود الجدول 'firstName' بـ foaf:firstName. بعض الطرق الآلية لا تستطيع ربط المفردات.
الأتمتةمدى مساعدة/أتمتة عملية الاستخراج. يدوي، واجهة مستخدم رسومية، شبه آلي، آلي بالكامل.
يتطلب ذلك أنطولوجيا المجاليلزم وجود أنطولوجيا موجودة مسبقًا لربطها بها. لذلك إما أن يتم إنشاء ربط أو يتم تعلم مخطط من المصدر ( تعلم الأنطولوجيا ).

أمثلة

ربط الكيانات

  1. تقوم DBpedia Spotlight و OpenCalais و Dandelion dataTXT و Zemanta API و Extractiv و PoolParty Extractor بتحليل النصوص الحرة من خلال التعرف على الكيانات المسماة، ثم تقوم بإزالة الغموض عن المرشحين من خلال حل الأسماء وربط الكيانات التي تم العثور عليها بمستودع المعرفة DBpedia [ 3 ] ( عرض توضيحي لـ Dandelion dataTXT مؤرشف في 2013-11-02 على Wayback Machine أو عرض توضيحي لـ DBpedia Spotlight على الويب أو عرض توضيحي لـ PoolParty Extractor ).

دعا الرئيس أوباما يوم الأربعاء الكونغرس إلى تمديد الإعفاء الضريبي للطلاب الذي تم تضمينه في حزمة التحفيز الاقتصادي للعام الماضي، بحجة أن هذه السياسة توفر مساعدة أكثر سخاءً.

بما أن الرئيس أوباما مرتبط بمورد بيانات مرتبطة في DBpedia ، يمكن استرجاع معلومات إضافية تلقائيًا، ويمكن لمُستدل دلالي، على سبيل المثال، استنتاج أن الكيان المذكور من نوع "شخص" (باستخدام برنامج FOAF ) ومن نوع " رؤساء الولايات المتحدة" (باستخدام YAGO ). أمثلة مضادة: طرق تتعرف فقط على الكيانات أو ترتبط بمقالات ويكيبيديا وغيرها من المصادر التي لا توفر استرجاعًا إضافيًا للبيانات المنظمة والمعرفة الرسمية.

قواعد البيانات العلائقية إلى RDF

  1. تُعدّ أدوات مثل Triplify وD2R Server و Ultrawrap ( المؤرشفة بتاريخ 27 نوفمبر 2016 على Wayback Machine ) و Virtuoso RDF Views أدواتٍ لتحويل قواعد البيانات العلائقية إلى RDF. وتتيح هذه الأدوات إعادة استخدام المصطلحات والأنطولوجيات الموجودة أثناء عملية التحويل. عند تحويل جدول علائقي نموذجي يُسمى " users" ، يجب أن يُوفّر عمود واحد (مثل " name ") أو مجموعة من الأعمدة (مثل "first_name " و "last_name ") مُعرّف URI للكيان المُنشأ. ويُستخدم عادةً المفتاح الأساسي. ويمكن استخراج كل عمود آخر كعلاقة مع هذا الكيان. [ 4 ] ثم تُستخدم الخصائص ذات الدلالات المُحددة رسميًا (ويُعاد استخدامها) لتفسير المعلومات. على سبيل المثال، يمكن تعريف عمود في جدول "user" يُسمى " mardizedTo" كعلاقة متناظرة، ويمكن تحويل عمود " homepage" إلى خاصية من مُفردات FOAF تُسمى foaf:homepage ، مما يُؤهله ليكون خاصية وظيفية عكسية . بعد ذلك، يمكن تحويل كل مدخل في جدول المستخدمين إلى نسخة من الصنف foaf:Person (مجموعة الأنطولوجيا). بالإضافة إلى ذلك، يمكن إنشاء معرفة المجال (في شكل أنطولوجيا) من status_id ، إما عن طريق قواعد مُنشأة يدويًا (إذا كان status_id يساوي 2، فإن المدخل ينتمي إلى صنف Teacher) أو عن طريق طرق (شبه) آلية ( تعلم الأنطولوجيا ). إليك مثال على التحويل:
اسممتزوج منالصفحة الرئيسيةstatus_id
بيترماريhttps://example.org/Peters_page1
كلاوسإيفاhttps://example.org/Claus_page2
بيتر : متزوج من : ماري . متزوج من بومة : خاصية متناظرة . بيتر أحمق : الصفحة الرئيسية < https://example.org/Peters_page > . بيتر أ أحمق : شخص . بيتر أ : طالب . كلاوس أ : معلم .

استخراج البيانات من المصادر المهيكلة إلى RDF

مطابقة 1:1 من جداول/عروض قواعد البيانات العلائقية إلى كيانات/سمات/قيم RDF

عند بناء تمثيل RDB لمجال مشكلة ما، غالبًا ما تكون نقطة البداية هي مخطط علاقات الكيانات (ERD). عادةً، يُمثَّل كل كيان بجدول قاعدة بيانات، ويصبح كل سمة من سمات الكيان عمودًا في ذلك الجدول، وتُشار إلى العلاقات بين الكيانات بواسطة مفاتيح خارجية. يُحدد كل جدول عادةً فئة معينة من الكيانات، ويُمثل كل عمود إحدى سماتها. يصف كل صف في الجدول مثيلًا لكيان، يتم تحديده بشكل فريد بواسطة مفتاح أساسي. تُشكل صفوف الجدول مجتمعةً مجموعة كيانات. في تمثيل RDF مكافئ لمجموعة الكيانات نفسها:

  • كل عمود في الجدول يمثل سمة (أي شرط).
  • تمثل كل قيمة في العمود قيمة سمة (أي كائن).
  • يمثل كل مفتاح صف معرف كيان (أي موضوع)
  • يمثل كل صف مثيلًا للكيان
  • يتم تمثيل كل صف (مثيل الكيان) في RDF بواسطة مجموعة من الثلاثيات ذات موضوع مشترك (معرف الكيان).

لذا، لعرض عرض مكافئ بناءً على دلالات RDF، ستكون خوارزمية التعيين الأساسية كما يلي:

  1. أنشئ فئة RDFS لكل جدول
  2. قم بتحويل جميع المفاتيح الأساسية والمفاتيح الخارجية إلى معرّفات موارد موحدة (IRIs).
  3. قم بتعيين معرف موارد موحد (IRI) لكل عمود.
  4. قم بتعيين مُسند rdf:type لكل صف، واربطه بمعرف موارد موحد (IRI) لفئة RDFS يتوافق مع الجدول.
  5. لكل عمود ليس جزءًا من مفتاح أساسي أو مفتاح خارجي، قم بإنشاء ثلاثية تحتوي على معرف IRI للمفتاح الأساسي كموضوع، ومعرف IRI للعمود كمسند، وقيمة العمود ككائن.

يمكن العثور على إشارة مبكرة إلى هذا الربط الأساسي أو المباشر في مقارنة تيم بيرنرز لي بين نموذج ER ونموذج RDF. [ 4 ]

عمليات ربط معقدة لقواعد البيانات العلائقية بصيغة RDF

تُتيح عملية الربط المباشر المذكورة أعلاه عرض البيانات القديمة بصيغة RDF بطريقة مباشرة، ويمكن إجراء تحسينات إضافية لتعزيز فائدة مخرجات RDF بما يتناسب مع حالات الاستخدام المحددة. عادةً ما تُفقد المعلومات أثناء تحويل مخطط علاقات الكيانات (ERD) إلى جداول علائقية (يمكن الاطلاع على التفاصيل في عدم تطابق المعاوقة بين الكائنات والعلاقات )، مما يستدعي إعادة هندستها . من الناحية المفاهيمية، يمكن اتباع نهجين لاستخراج المعلومات. يحاول النهج الأول استخراج أو تعلم مخطط OWL من مخطط قاعدة البيانات المُعطى. استخدمت الأساليب المبكرة عددًا ثابتًا من قواعد الربط المُنشأة يدويًا لتحسين الربط المباشر. [ 5 ] [ 6 ] [ 7 ] أما الأساليب الأكثر تطورًا فتستخدم طرقًا استدلالية أو خوارزميات تعلم لاستنتاج معلومات المخطط (تتداخل هذه الأساليب مع تعلم الأنطولوجيا ). بينما تحاول بعض المناهج استخلاص المعلومات من البنية المتأصلة في مخطط SQL [ 8 ] (تحليل المفاتيح الخارجية على سبيل المثال)، يحلل البعض الآخر المحتوى والقيم في الجداول لإنشاء تسلسلات هرمية مفاهيمية [ 9 ] (على سبيل المثال، الأعمدة ذات القيم القليلة مرشحة لتصبح فئات). ويسعى الاتجاه الثاني إلى ربط المخطط ومحتوياته بأنطولوجيا مجال موجودة مسبقًا (انظر أيضًا: مواءمة الأنطولوجيا ). مع ذلك، غالبًا ما تكون أنطولوجيا المجال المناسبة غير موجودة، ويتعين إنشاؤها أولًا.

XML

بما أن XML مُهيكلة على شكل شجرة، يُمكن تمثيل أي بيانات بسهولة في RDF، المُهيكلة على شكل رسم بياني. يُعد XML2RDF مثالًا على منهجية تستخدم عُقد RDF الفارغة لتحويل عناصر وسمات XML إلى خصائص RDF. مع ذلك، يُعد الموضوع أكثر تعقيدًا كما هو الحال في قواعد البيانات العلائقية. في الجدول العلائقي، يُعتبر المفتاح الأساسي مُرشحًا مثاليًا ليصبح موضوعًا للثلاثيات المُستخرجة. أما عنصر XML، فيُمكن تحويله - بحسب السياق - كموضوع أو مُسند أو كائن لثلاثية. يُمكن استخدام XSLT كلغة تحويل قياسية لتحويل XML إلى RDF يدويًا.

استعراض الأساليب / الأدوات

اسممصدر البياناتعرض البياناتمزامنة البياناتلغة رسم الخرائطإعادة استخدام المفرداتأتمتة الخرائط.علم الوجود المطلوب للمجاليستخدم واجهة المستخدم الرسومية
رسم خرائط مباشرة للبيانات العلائقية إلى RDFالبيانات العلائقيةSPARQL/ETLمتحركغير متوفرخطأ شنيعأوتوماتيكيخطأ شنيعخطأ شنيع
CSV2RDF4LODملف CSVETLثابتRDFحقيقييدويخطأ شنيعخطأ شنيع
CoNLL-RDFTSV، CoNLLتدفق SPARQL/RDFثابتلا أحدحقيقيتلقائي (خاص بالمجال، لحالات الاستخدام في تكنولوجيا اللغة، يحافظ على العلاقات بين الصفوف)خطأ شنيعخطأ شنيع
Convert2RDFملف نصي مفصولETLثابتRDF/DAMLحقيقييدويخطأ شنيعحقيقي
خادم D2Rقاعدة البيانات العلائقيةSPARQLثنائي الاتجاهخريطة D2Rحقيقييدويخطأ شنيعخطأ شنيع
دارت جريدقاعدة البيانات العلائقيةلغة الاستعلام الخاصةمتحركأداة بصريةحقيقييدويخطأ شنيعحقيقي
داتا ماسترقاعدة البيانات العلائقيةETLثابتملكية خاصةحقيقييدويحقيقيحقيقي
إضافة RDF من جوجل ريفاينCSV، XMLETLثابتلا أحدشبه أوتوماتيكيخطأ شنيعحقيقي
كريكتورXMLETLثابتXSLTحقيقييدويحقيقيخطأ شنيع
مابونتوقاعدة البيانات العلائقيةETLثابتملكية خاصةحقيقييدويحقيقيخطأ شنيع
التحولاتقاعدة البيانات العلائقيةETLثابتلغة رسم الخرائط الخاصة القائمة على XMLحقيقييدويخطأ شنيعحقيقي
MappingMasterملف CSVETLثابتMappingMasterحقيقيواجهة المستخدم الرسوميةخطأ شنيعحقيقي
ODEMapsterقاعدة البيانات العلائقيةETLثابتملكية خاصةحقيقييدويحقيقيحقيقي
إضافة استيراد ملفات CSV من OntoWiki - مكعبات البيانات والجداولملف CSVETLثابتمفردات مكعب بيانات RDFحقيقيشبه أوتوماتيكيخطأ شنيعحقيقي
مستخرج حفلات المسابح (PPX)XML، نصالبيانات المرتبطةمتحركRDF (SKOS)حقيقيشبه أوتوماتيكيحقيقيخطأ شنيع
RDBToOntoقاعدة البيانات العلائقيةETLثابتلا أحدخطأ شنيعبالإضافة إلى ذلك، يتمتع المستخدم بفرصة ضبط النتائج بدقة، وذلك بفضل التشغيل التلقائي.خطأ شنيعحقيقي
RDF 123ملف CSVETLثابتخطأ شنيعخطأ شنيعيدويخطأ شنيعحقيقي
RDOTEقاعدة البيانات العلائقيةETLثابتSQLحقيقييدويحقيقيحقيقي
لغة OWL العلائقيةقاعدة البيانات العلائقيةETLثابتلا أحدخطأ شنيعأوتوماتيكيخطأ شنيعخطأ شنيع
T2LDملف CSVETLثابتخطأ شنيعخطأ شنيعأوتوماتيكيخطأ شنيعخطأ شنيع
مفردات مكعب بيانات RDFالبيانات الإحصائية متعددة الأبعاد في جداول البياناتمفردات مكعب البياناتحقيقييدويخطأ شنيع
مُلحّن توب بريدملف CSVETLثابتSKOSخطأ شنيعشبه أوتوماتيكيخطأ شنيعحقيقي
تضاعف ثلاث مراتقاعدة البيانات العلائقيةالبيانات المرتبطةمتحركSQLحقيقييدويخطأ شنيعخطأ شنيع
تمت أرشفة Ultrawrap بتاريخ 27 نوفمبر 2016 في Wayback Machineقاعدة البيانات العلائقيةSPARQL/ETLمتحركR2RMLحقيقيشبه أوتوماتيكيخطأ شنيعحقيقي
عرض Virtuoso RDFقاعدة البيانات العلائقيةSPARQLمتحركلغة المخططات الوصفيةحقيقيشبه أوتوماتيكيخطأ شنيعحقيقي
مستغل بارعمصادر البيانات المنظمة وشبه المنظمةSPARQLمتحركVirtuoso PL & XSLTحقيقيشبه أوتوماتيكيخطأ شنيعخطأ شنيع
فيزاقاعدة البيانات العلائقيةRDQLمتحركSQLحقيقييدويحقيقيحقيقي
XLWrap: تحويل جداول البيانات إلى RDFملف CSVETLثابتبناء الجملة المثلثيحقيقييدويخطأ شنيعخطأ شنيع
تحويل XML إلى RDFXMLETLثابتخطأ شنيعخطأ شنيعأوتوماتيكيخطأ شنيعخطأ شنيع

مستخلص من مصادر اللغة الطبيعية

تُشفّر غالبية المعلومات الواردة في وثائق الأعمال (حوالي 80% [ 10 ] ) بلغة طبيعية، وبالتالي فهي غير مُهيكلة. ونظرًا لأن البيانات غير المُهيكلة تُشكّل تحديًا لاستخلاص المعرفة، فإنّ ذلك يتطلّب أساليب أكثر تعقيدًا، والتي غالبًا ما تُقدّم نتائج أقل جودة مقارنةً بالبيانات المُهيكلة. مع ذلك، فإنّ إمكانية الحصول على كمّ هائل من المعرفة المُستخلصة تُعوّض عن زيادة التعقيد وانخفاض جودة الاستخلاص. في ما يلي، يُقصد بمصادر اللغة الطبيعية مصادر المعلومات التي تُقدّم فيها البيانات بشكل غير مُهيكل كنص عادي. إذا كان النص المُقدّم مُضمّنًا في مستند ترميز (مثل مستند HTML)، فإنّ الأنظمة المذكورة عادةً ما تُزيل عناصر الترميز تلقائيًا.

التوصيف اللغوي / معالجة اللغة الطبيعية (NLP)

كخطوة تمهيدية لاستخلاص المعرفة، قد يكون من الضروري إجراء عملية ترميز لغوي باستخدام أداة واحدة أو أكثر من أدوات معالجة اللغة الطبيعية . عادةً ما تعتمد الوحدات الفردية في سير عمل معالجة اللغة الطبيعية على تنسيقات خاصة بالأداة للإدخال والإخراج، ولكن في سياق استخلاص المعرفة، تم تطبيق تنسيقات منظمة لتمثيل الترميزات اللغوية.

تشمل مهام معالجة اللغة الطبيعية النموذجية ذات الصلة باستخلاص المعرفة ما يلي:

  • تحديد أجزاء الكلام (POS)
  • التجريد اللغوي (LEMMA) أو التفرع (STEM)
  • إزالة الغموض عن معاني الكلمات (WSD، المرتبطة بالتعليق الدلالي أدناه)
  • التعرف على الكيانات المسماة (NER، انظر أيضًا IE أدناه)
  • التحليل النحوي، وغالبًا ما يعتمد على التبعيات النحوية (DEP)
  • التحليل النحوي السطحي (CHUNK): إذا كانت الأداء يمثل مشكلة، فإن التجزئة تؤدي إلى استخراج سريع للأسماء والعبارات الأخرى.
  • حل الإحالة (انظر حل الإحالة في IE أدناه، ولكن يُنظر إليه هنا على أنه مهمة إنشاء روابط بين الإشارات النصية بدلاً من الربط بين ذكر كيان ما وتمثيل مجرد لهذا الكيان)
  • تصنيف الأدوار الدلالية (SRL، المتعلقة باستخراج العلاقات؛ لا ينبغي الخلط بينها وبين الشرح الدلالي كما هو موضح أدناه)
  • تحليل الخطاب (العلاقات بين الجمل المختلفة، ونادراً ما يستخدم في التطبيقات العملية)

في معالجة اللغات الطبيعية، تُعرض هذه البيانات عادةً بصيغة TSV (صيغة CSV مع استخدام علامة الجدولة كفواصل)، والتي تُعرف غالبًا بصيغة CoNLL. ولأغراض استخلاص المعرفة، تم إنشاء عروض RDF لهذه البيانات وفقًا لمعايير المجتمع التالية:

تتضمن التنسيقات الأخرى الخاصة بكل منصة ما يلي:

  • تنسيق تبادل LAPPS (LIF، المستخدم في شبكة LAPPS) [ 16 ] [ 17 ]
  • تنسيق التعليقات التوضيحية لمعالجة اللغة الطبيعية (NAF، المستخدم في نظام إدارة سير العمل NewsReader) [ 18 ] [ 19 ]

استخلاص المعلومات التقليدي (IE)

يُعدّ استخلاص المعلومات التقليدي [ 20 ] تقنيةً من تقنيات معالجة اللغة الطبيعية، حيث يستخلص المعلومات من نصوص اللغة الطبيعية عادةً، ويُهيكلها بطريقة مناسبة. يجب تحديد أنواع المعلومات المراد استخلاصها في نموذج قبل بدء العملية، ولذلك فإن عملية استخلاص المعلومات التقليدية برمتها تعتمد على المجال. وينقسم استخلاص المعلومات إلى المهام الفرعية الخمس التالية.

تتمثل مهمة التعرف على الكيانات المسماة في التعرف على جميع الكيانات المسماة الموجودة في نص ما وتصنيفها (أي إسناد كيان مسمى إلى فئة محددة مسبقًا). ويتم ذلك من خلال تطبيق أساليب قائمة على القواعد النحوية أو نماذج إحصائية.

تُحدد عملية حلّ الإحالة الكيانات المتكافئة، التي تم التعرف عليها بواسطة تقنية التعرف على الكيانات المسماة، داخل النص. يوجد نوعان رئيسيان من علاقات التكافؤ. الأول يتعلق بالعلاقة بين كيانين مختلفين ممثلين (مثل IBM Europe وIBM)، والثاني يتعلق بالعلاقة بين كيان ومراجعه الإشارية (مثل it وIBM). ويمكن التعرف على كلا النوعين من خلال عملية حلّ الإحالة.

أثناء إنشاء عنصر القالب، يحدد نظام IE الخصائص الوصفية للكيانات، والتي يتم التعرف عليها بواسطة NER و CO. تتوافق هذه الخصائص مع الصفات العادية مثل الأحمر أو الكبير.

يُحدد بناء علاقات القوالب العلاقات الموجودة بين عناصر القالب. يمكن أن تكون هذه العلاقات من أنواع متعددة، مثل علاقات العمل أو علاقات التواجد، مع اشتراط أن يتوافق كل من المجال والنطاق مع الكيانات.

في سيناريو النموذج، سيتم تحديد أحداث الإنتاج، الموصوفة في النص، وهيكلتها فيما يتعلق بالكيانات، المعترف بها بواسطة NER و CO والعلاقات، المحددة بواسطة TR.

استخلاص المعلومات القائم على علم الوجود (OBIE)

يُعدّ استخلاص المعلومات القائم على الأنطولوجيا [ 10 ] فرعًا من فروع استخلاص المعلومات، حيث تُستخدم أنطولوجيا واحدة على الأقل لتوجيه عملية استخلاص المعلومات من النصوص اللغوية الطبيعية. يستخدم نظام OBIE أساليب استخلاص المعلومات التقليدية لتحديد المفاهيم والحالات والعلاقات بين الأنطولوجيات المستخدمة في النص، والتي سيتم تنظيمها في أنطولوجيا بعد العملية. وبالتالي، تُشكّل الأنطولوجيات المُدخلة نموذج المعلومات المراد استخلاصها. [ 21 ]

تعلم الأنطولوجيا (OL)

تعلم الأنطولوجيا هو عملية إنشاء الأنطولوجيات بشكل آلي أو شبه آلي، بما في ذلك استخراج مصطلحات المجال ذي الصلة من النصوص اللغوية الطبيعية. ونظرًا لأن بناء الأنطولوجيات يدويًا عملية شاقة للغاية وتستغرق وقتًا طويلاً، فهناك دافع قوي لأتمتة هذه العملية.

التوصيف الدلالي (SA)

أثناء عملية الترميز الدلالي، [ 22 ] يُضاف إلى نص اللغة الطبيعية بيانات وصفية (غالبًا ما تُمثَّل بصيغة RDFa )، مما يجعل دلالات المصطلحات الواردة فيه قابلة للفهم الآلي. في هذه العملية، التي تُجرى عادةً بشكل شبه آلي، تُستخلص المعرفة بمعنى أنه يتم إنشاء رابط بين المصطلحات المعجمية، على سبيل المثال، والمفاهيم من الأنطولوجيات. وبالتالي، تُكتسب معرفة بالمعنى المقصود للمصطلح في السياق المُعالَج، ومن ثمّ يُرسى معنى النص على بيانات قابلة للقراءة الآلية مع القدرة على استخلاص الاستنتاجات. عادةً ما يُقسَّم الترميز الدلالي إلى المهمتين الفرعيتين التاليتين.

  1. استخلاص المصطلحات
  2. ربط الكيانات

على مستوى استخراج المصطلحات، تُستخرج المصطلحات المعجمية من النص. ولتحقيق ذلك، يقوم مُجزئ الكلمات أولاً بتحديد حدود الكلمات وحل الاختصارات. بعد ذلك، تُستخرج المصطلحات من النص، التي تُطابق مفهومًا معينًا، بمساعدة معجم خاص بالمجال لربطها في عملية ربط الكيانات.

في ربط الكيانات [ 23 يتم إنشاء رابط بين المصطلحات المعجمية المستخرجة من النص المصدر والمفاهيم من أنطولوجيا أو قاعدة معرفية مثل DBpedia . ولتحقيق ذلك، يتم الكشف عن المفاهيم المرشحة المناسبة لمختلف معاني المصطلح بمساعدة معجم. وأخيرًا، يتم تحليل سياق المصطلحات لتحديد أنسب طريقة لإزالة الغموض وربط المصطلح بالمفهوم الصحيح.

تجدر الإشارة إلى أن "التعليق الدلالي" في سياق استخراج المعرفة لا ينبغي الخلط بينه وبين التحليل الدلالي كما هو مفهوم في معالجة اللغة الطبيعية (يشار إليه أيضًا باسم "التعليق الدلالي"): يهدف التحليل الدلالي إلى تمثيل كامل وقابل للقراءة آليًا للغة الطبيعية، في حين أن التعليق الدلالي بمعنى استخراج المعرفة لا يتناول سوى جانب أساسي جدًا من ذلك.

أدوات

يمكن استخدام المعايير التالية لتصنيف الأدوات التي تستخرج المعرفة من النصوص اللغوية الطبيعية.

مصدرما هي تنسيقات الإدخال التي يمكن معالجتها بواسطة الأداة (مثل النص العادي أو HTML أو PDF)؟
نموذج الوصولهل يمكن للأداة الاستعلام عن مصدر البيانات أم أنها تتطلب نسخة كاملة من البيانات لعملية الاستخراج؟
مزامنة البياناتهل نتيجة عملية الاستخراج متزامنة مع المصدر؟
يستخدم أنطولوجيا الإخراجهل تربط الأداة النتيجة بعلم الوجود؟
أتمتة رسم الخرائطما مدى أتمتة عملية الاستخراج (يدوية، شبه آلية، أو آلية بالكامل)؟
يتطلب علم الوجودهل تحتاج الأداة إلى أنطولوجيا للاستخراج؟
يستخدم واجهة المستخدم الرسوميةهل توفر الأداة واجهة مستخدم رسومية؟
يقتربما هو النهج الذي تستخدمه الأداة (IE، OBIE، OL أو SA)؟
الكيانات المستخرجةما هي أنواع الكيانات (مثل الكيانات المسماة أو المفاهيم أو العلاقات) التي يمكن استخراجها بواسطة الأداة؟
التقنيات التطبيقيةما هي التقنيات المستخدمة (مثل معالجة اللغة الطبيعية، والأساليب الإحصائية، والتجميع، أو التعلم الآلي
نموذج الإخراجما هو النموذج المستخدم لتمثيل نتيجة الأداة (مثل RDF أو OWL)؟
النطاقات المدعومةما هي المجالات المدعومة (مثل الاقتصاد أو علم الأحياء)؟
اللغات المدعومةما هي اللغات التي يمكن معالجتها (مثل الإنجليزية أو الألمانية)؟

يوضح الجدول التالي بعض الأدوات المستخدمة لاستخراج المعرفة من مصادر اللغة الطبيعية.

اسممصدرنموذج الوصولمزامنة البياناتيستخدم أنطولوجيا الإخراجأتمتة رسم الخرائطيتطلب علم الوجوديستخدم واجهة المستخدم الرسوميةيقتربالكيانات المستخرجةالتقنيات التطبيقيةنموذج الإخراجالنطاقات المدعومةاللغات المدعومة
[ 24 ]نص عادي، HTML، XML، SGMLأحمقلانعمأوتوماتيكينعمنعمأيالكيانات المسماة، والعلاقات، والأحداثالقواعد اللغويةملكية خاصةمستقل عن المجالالإنجليزية، الإسبانية، العربية، الصينية، الإندونيسية
AlchemyAPI [ 25 ]نص عادي، HTMLأوتوماتيكينعمجنوب أفريقيامتعدد اللغات
آني [ 26 ]نص عاديأحمقنعمنعمأيخوارزميات الحالة المحدودةمتعدد اللغات
آسيام [ 27 ]نص عاديأحمقشبه أوتوماتيكينعمOLالمفاهيم، التسلسل الهرمي للمفاهيممعالجة اللغة الطبيعية، التجميع
استخلاص الشدة الشامل [ 28 ]أوتوماتيكيأيالكيانات المسماة، والعلاقات، والأحداثمعالجة اللغة الطبيعية
واجهة برمجة تطبيقات Dandelionنص عادي، HTML، عنوان URLاستراحةلالاأوتوماتيكيلانعمجنوب أفريقياالكيانات المسماة، والمفاهيمالأساليب الإحصائيةJSONمستقل عن المجالمتعدد اللغات
تسليط الضوء على DBpedia [ 29 ]نص عادي، HTMLتفريغ، SPARQLنعمنعمأوتوماتيكيلانعمجنوب أفريقياشرح لكل كلمة، وشرح للكلمات غير المتوقفةمعالجة اللغات الطبيعية، الأساليب الإحصائية، التعلم الآليRDFaمستقل عن المجالإنجليزي
EntityClassifier.euنص عادي، HTMLأحمقنعمنعمأوتوماتيكيلانعمIE، OL، SAشرح لكل كلمة، وشرح للكلمات غير المتوقفةالقواعد النحوية القائمة على القواعدXMLمستقل عن المجالالإنجليزية، الألمانية، الهولندية
فريد [ 30 ]نص عاديتفريغ، واجهة برمجة تطبيقات RESTنعمنعمأوتوماتيكيلانعمأنماط تصميم الأنطولوجيا، دلالات الإطار ، IE، OL، SAشرح NIF أو EarMark (متعدد) الكلمات، المسندات، الحالات، الدلالات التركيبية، تصنيفات المفاهيم، الأطر، الأدوار الدلالية، العلاقات التعبيرية، الأحداث، الأسلوب، الزمن، ربط الكيانات، ربط الأحداث، المشاعرمعالجة اللغة الطبيعية، والتعلم الآلي، والقواعد الاستدلاليةRDF/OWLمستقل عن المجالالإنجليزية، واللغات الأخرى عبر الترجمة
iDocument [ 31 ]HTML، PDF، DOCSPARQLنعمنعمأوبيالحالات، قيم الخصائصمعالجة اللغة الطبيعيةشخصي، تجاري
مستخرج NetOwl [ 32 ]نص عادي، HTML، XML، SGML، PDF، مايكروسوفت أوفيسأحمقلانعممعادلةنعمنعمأيالكيانات المسماة، والعلاقات، والأحداثمعالجة اللغة الطبيعيةXML، JSON، RDF-OWL، وغيرهانطاقات متعددةالإنجليزية، العربية، الصينية (المبسطة والتقليدية)، الفرنسية، الكورية، الفارسية (الفارسية والدارية)، الروسية، الإسبانية
تمت أرشفة OntoGen في 30 مارس 2010 على Wayback Machine [ 33 ]شبه أوتوماتيكينعمOLالمفاهيم، التسلسل الهرمي للمفاهيم، العلاقات غير التصنيفية، الأمثلةمعالجة اللغة الطبيعية، والتعلم الآلي، والتجميع
تمت أرشفة OntoLearn في 2017-08-09 على Wayback Machine [ 34 ]نص عادي، HTMLأحمقلانعمأوتوماتيكينعملاOLالمفاهيم، التسلسل الهرمي للمفاهيم، الأمثلةمعالجة اللغة الطبيعية، الأساليب الإحصائيةملكية خاصةمستقل عن المجالإنجليزي
OntoLearn Reloadedنص عادي، HTMLأحمقلانعمأوتوماتيكينعملاOLالمفاهيم، التسلسل الهرمي للمفاهيم، الأمثلةمعالجة اللغة الطبيعية، الأساليب الإحصائيةملكية خاصةمستقل عن المجالإنجليزي
OntoSyphon [ 35 ]HTML، PDF، DOCتفريغ، استعلامات محركات البحثلانعمأوتوماتيكينعملاأوبيالمفاهيم، العلاقات، الأمثلةمعالجة اللغة الطبيعية، الأساليب الإحصائيةRDFمستقل عن المجالإنجليزي
تم أرشفة ontoX في 27-05-2016 على Wayback Machine [ 36 ]نص عاديأحمقلانعمشبه أوتوماتيكينعملاأوبيالحالات، قيم خصائص نوع البياناتالأساليب القائمة على الاستدلالملكية خاصةمستقل عن المجالمستقل عن اللغة
أوبن كاليسنص عادي، HTML، XMLأحمقلانعمأوتوماتيكينعملاجنوب أفريقياإضافة تعليقات توضيحية للكيانات، إضافة تعليقات توضيحية للأحداث، إضافة تعليقات توضيحية للحقائقمعالجة اللغة الطبيعية، والتعلم الآليRDFمستقل عن المجالالإنجليزية، الفرنسية، الإسبانية
مستخرج PoolParty [ 37 ]نص عادي، HTML، DOC، ODTأحمقلانعمأوتوماتيكينعمنعمأوبيالكيانات المسماة، والمفاهيم، والعلاقات، والمفاهيم التي تصنف النص، والإضافاتمعالجة اللغات الطبيعية، والتعلم الآلي، والأساليب الإحصائيةRDF، OWLمستقل عن المجالالإنجليزية، الألمانية، الإسبانية، الفرنسية
روسوكانص عادي، HTML، XML، SGML، PDF، مايكروسوفت أوفيسأحمقنعمنعممعادلةلانعمأياستخراج الكيانات المسماة، وحلّ الكيانات، واستخراج العلاقات، والخصائص، والمفاهيم، وتحليل المشاعر متعدد المتجهات ، والوسم الجغرافي، وتحديد اللغةمعالجة اللغة الطبيعية، والتعلم الآليXML، JSON، POJO، RDFنطاقات متعددةمتعدد اللغات (أكثر من 200 لغة)
سكوبينص عادي، HTMLأحمقلانعمأوتوماتيكيلالاأوبيالحالات، وقيم الخصائص، وأنواع RDFSمعالجة اللغة الطبيعية، والتعلم الآليRDF، RDFaمستقل عن المجالالإنجليزية، الألمانية
SemTag [ 38 ] [ 39 ]HTMLأحمقلانعمأوتوماتيكينعملاجنوب أفريقياالتعلم الآليسجل قاعدة البياناتمستقل عن المجالمستقل عن اللغة
تم أرشفة smart FIX بتاريخ 17 مايو 2016 على موقع Wayback Machine.نص عادي، HTML، PDF، DOC، بريد إلكترونيأحمقنعملاأوتوماتيكيلانعمأوبيالكيانات المسماةمعالجة اللغة الطبيعية، والتعلم الآليملكية خاصةمستقل عن المجالالإنجليزية، الألمانية، الفرنسية، الهولندية، البولندية
Text2Onto [ 40 ]نص عادي، HTML، PDFأحمقنعملاشبه أوتوماتيكينعمنعمOLالمفاهيم، التسلسل الهرمي للمفاهيم، العلاقات غير التصنيفية، الأمثلة، البديهياتمعالجة اللغات الطبيعية، الأساليب الإحصائية، التعلم الآلي، الأساليب القائمة على القواعدبُومَةمستقل عن المجالالإنجليزية، الألمانية، الإسبانية
تحويل النص إلى كائن مرئي [ 41 ]نص عادي، HTML، PDF، PostScriptأحمقشبه أوتوماتيكينعمنعمOLالمفاهيم، التسلسل الهرمي للمفاهيم، العلاقات غير التصنيفية، الكيانات المعجمية التي تشير إلى المفاهيم، الكيانات المعجمية التي تشير إلى العلاقاتمعالجة اللغات الطبيعية، والتعلم الآلي، والتجميع، والأساليب الإحصائيةالألمانية
ذات نيدلنص عاديأحمقأوتوماتيكيلاالمفاهيم، العلاقات، التسلسل الهرميمعالجة اللغة الطبيعية، ملكية خاصةJSONنطاقات متعددةإنجليزي
آلة ويكي [ 42 ]نص عادي، HTML، PDF، DOCأحمقلانعمأوتوماتيكينعمنعمجنوب أفريقياشرح الأسماء العلمية، شرح الأسماء الشائعةالتعلم الآليRDFaمستقل عن المجالالإنجليزية، الألمانية، الإسبانية، الفرنسية، البرتغالية، الإيطالية، الروسية
مكتشف الأشياء [ 43 ]أيالكيانات المسماة، والعلاقات، والأحداثمتعدد اللغات

اكتشاف المعرفة

يُعرّف اكتشاف المعرفة بأنه عملية البحث التلقائي في كميات هائلة من البيانات عن أنماط يمكن اعتبارها معرفةً بالبيانات . [ 44 ] ويُشار إليه غالبًا باستخلاص المعرفة من البيانات المُدخلة. وقد نشأ اكتشاف المعرفة من مجال استخراج البيانات ، ويرتبط به ارتباطًا وثيقًا من حيث المنهجية والمصطلحات. [ 45 ]

يُعدّ اكتشاف المعرفة، المعروف أيضًا باكتشاف المعرفة في قواعد البيانات (KDD)، الفرع الأكثر شهرةً في مجال استخراج البيانات . وكما هو الحال في العديد من أشكال اكتشاف المعرفة الأخرى، يُنشئ هذا الفرع تجريدات لبيانات الإدخال. وقد تُصبح المعرفة المُكتسبة من خلال هذه العملية بيانات إضافية يُمكن استخدامها في مزيد من التطبيقات والاكتشافات. غالبًا ما تكون نتائج اكتشاف المعرفة غير قابلة للتنفيذ، لذا تهدف تقنيات مثل استخراج البيانات الموجه بالمجال [ 46 ] إلى اكتشاف وتقديم المعرفة والرؤى القابلة للتنفيذ.

يُعدّ اكتشاف المعرفة تطبيقًا واعدًا آخر في مجال تحديث البرمجيات ، واكتشاف نقاط الضعف، والامتثال، والذي يتضمن فهم مكونات البرمجيات الحالية. ترتبط هذه العملية بمفهوم الهندسة العكسية . عادةً ما تُعرض المعرفة المُستقاة من البرمجيات الحالية في شكل نماذج يُمكن إجراء استعلامات مُحددة عليها عند الحاجة. تُعدّ علاقة الكيانات صيغة شائعة لتمثيل المعرفة المُستقاة من البرمجيات الحالية. طوّرت مجموعة إدارة الكائنات (OMG) مواصفات نموذج اكتشاف المعرفة (KDM) الذي يُعرّف أنطولوجيا لأصول البرمجيات وعلاقاتها بهدف اكتشاف المعرفة في الشيفرة البرمجية الحالية. يرتبط اكتشاف المعرفة من أنظمة البرمجيات الحالية، والمعروف أيضًا باسم استخراج البرمجيات ، ارتباطًا وثيقًا باستخراج البيانات ، نظرًا لما تحتويه مكونات البرمجيات الحالية من قيمة هائلة لإدارة المخاطر والقيمة التجارية ، وهما عنصران أساسيان لتقييم وتطوير أنظمة البرمجيات. بدلًا من استخراج مجموعات البيانات الفردية ، يركز استخراج البرمجيات على البيانات الوصفية ، مثل تدفقات العمليات (مثل تدفقات البيانات، وتدفقات التحكم، وخرائط الاستدعاءات)، والبنية، ومخططات قواعد البيانات، وقواعد/شروط/عمليات العمل.

بيانات الإدخال

تنسيقات الإخراج

انظر أيضاً

للمزيد من القراءة

مراجع

  1. مجموعة عمل RDB2RDF، الموقع الإلكتروني: http://www.w3.org/2001/sw/rdb2rdf/ ، الميثاق: http://www.w3.org/2009/08/rdb2rdf-charter ، R2RML: لغة ربط RDB بـ RDF: http://www.w3.org/TR/r2rml/
  2. مخرجات LOD2 EU 3.1.1: استخلاص المعرفة من المصادر المنظمة http://static.lod2.eu/Deliverables/deliverable-3.1.1.pdf مؤرشفة بتاريخ 27 أغسطس 2011 في Wayback Machine
  3. "الحياة في سحابة البيانات المترابطة" . www.opencalais.com. مؤرشف من الأصل بتاريخ ٢٤ نوفمبر ٢٠٠٩. تم الاطلاع عليه بتاريخ ١٠ نوفمبر ٢٠٠٩. لدى ويكيبيديا نسخة مترابطة من البيانات تُسمى DBpedia. تحتوي DBpedia على نفس المعلومات المنظمة الموجودة في ويكيبيديا، ولكنها مترجمة إلى صيغة قابلة للقراءة آليًا.
  4. 1 2 تيم بيرنرز لي (1998)، "قواعد البيانات العلائقية على الويب الدلالي" . تم الاسترجاع: 20 فبراير 2011.
  5. هو وآخرون (2007)، "اكتشاف روابط بسيطة بين مخططات قواعد البيانات العلائقية والأنطولوجيات"، في وقائع المؤتمر الدولي السادس للويب الدلالي (ISWC 2007)، والمؤتمر الآسيوي الثاني للويب الدلالي (ASWC 2007)، سلسلة محاضرات علوم الحاسوب 4825، الصفحات 225-238، بوسان، كوريا، 11-15 نوفمبر 2007. http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.97.6934&rep=rep1&type=pdf
  6. ر. غاوي ون. كولوت (2007)، "توليد ربط قواعد البيانات بالأنطولوجيا لتحقيق التوافق الدلالي". في ورشة العمل الدولية الثالثة حول توافق قواعد البيانات (InterDB 2007). http://le2i.cnrs.fr/IMG/publications/InterDB07-Ghawi.pdf
  7. لي وآخرون (2005) "طريقة شبه آلية لاكتساب الأنطولوجيا للويب الدلالي"، WAIM، المجلد 3739 من سلسلة محاضرات في علوم الحاسوب، الصفحات 209-220. سبرينغر. doi : 10.1007/11563952_19
  8. تيرميزي وآخرون (2008)، "ترجمة تطبيقات SQL إلى الويب الدلالي"، سلسلة محاضرات في علوم الحاسوب، المجلد 5181/2008 (تطبيقات قواعد البيانات وأنظمة الخبراء). http://citeseer.ist.psu.edu/viewdoc/download;jsessionid=15E8AB2A37BD06DAE59255A1AC3095F0?doi=10.1.1.140.3169&rep=rep1&type=pdf
  9. فريد سرباح (2008). "تعلم المستودعات الدلالية عالية التنظيم من قواعد البيانات العلائقية"، الويب الدلالي: البحوث والتطبيقات، المجلد 5021 من سلسلة محاضرات في علوم الحاسوب، سبرينغر، برلين/هايدلبرغ. http://www.tao-project.eu/resources/publications/cerbah-learning-highly-structured-semantic-repositories-from-relational-databases.pdf مؤرشف بتاريخ 20 يوليو 2011 على موقع Wayback Machine
  10. 1 2 ويمالاسوريا، دايا سي؛ دو، ديجينغ (2010). "استخراج المعلومات القائم على الأنطولوجيا: مقدمة ومسح للمناهج الحالية"، مجلة علوم المعلومات ، 36(3)، ص 306-323، http://ix.cs.uoregon.edu/~dou/research/papers/jis09.pdf (تم الاطلاع عليه: 18.06.2012).
  11. "صيغة تبادل معالجة اللغة الطبيعية (NIF) 2.0 - نظرة عامة ووثائق" . persistence.uni-leipzig.org . تم الاطلاع عليه بتاريخ 2020-06-05 .
  12. هيلمان، سيباستيان؛ ليمان، ينس؛ أوير، سورين؛ برومر، مارتن (2013). "دمج معالجة اللغة الطبيعية باستخدام البيانات المرتبطة". في: علاني، حارث؛ كاجال، لالانا؛ فوكوي، أشيل؛ غروث، بول؛ بييمان، كريس؛ باريرا، جوزيان خافيير؛ أرويو، لورا؛ نوي، ناتاشا؛ ويلتي، كريس (محررون). الويب الدلالي - المؤتمر الدولي للويب الدلالي 2013. سلسلة محاضرات في علوم الحاسوب. المجلد 7908. برلين، هايدلبرغ: سبرينغر. الصفحات 98-113 . doi : 10.1007/978-3-642-41338-4_7 . ISBN   978-3-642-41338-4.
  13. فيرسبور، كارين ؛ ليفينغستون، كيفن (يوليو 2012). "نحو تكييف الشروح اللغوية مع صيغ الشروح الأكاديمية على الويب الدلالي" . وقائع ورشة العمل السادسة للشروح اللغوية . جيجو، جمهورية كوريا: جمعية اللغويات الحاسوبية: 75-84 .
  14. أكولي-ريبو/conll-rdf ، ACoLi، 27-05-2020 ، استرجاعها 2020-06-05
  15. تشياركوس، كريستيان؛ فاث، كريستيان (2017). "CoNLL-RDF: مجموعات بيانات مرتبطة بطريقة ملائمة لمعالجة اللغة الطبيعية" . في: غراسيا، خورخي؛ بوند، فرانسيس؛ مكراي، جون ب.؛ بويتيلار، بول؛ تشياركوس، كريستيان؛ هيلمان، سيباستيان (محررون). اللغة والبيانات والمعرفة . سلسلة محاضرات في علوم الحاسوب. المجلد 10318. تشام: دار نشر سبرينغر الدولية. الصفحات 74-88 . doi : 10.1007/978-3-319-59888-8_6 . ISBN   978-3-319-59888-8.
  16. فيرهاجن، مارك؛ سودرمان، كيث؛ وانغ، دي؛ إيدي، نانسي؛ شي، تشونكي؛ رايت، جوناثان؛ بوستيجوفسكي، جيمس (2016). "صيغة تبادل LAPPS" . في: موراكامي، يوهي؛ لين، دونغهوي (محرران). البنية التحتية العالمية لخدمات اللغات . سلسلة محاضرات في علوم الحاسوب. المجلد 9442. تشام: دار نشر سبرينغر الدولية. الصفحات 33-47 . doi : 10.1007/978-3-319-31468-6_3 . ISBN   978-3-319-31468-6.
  17. "شبكة تطبيقات اللغة | منصة خدمة ويب لتطوير وبحوث معالجة اللغة الطبيعية" . تم الاطلاع عليه بتاريخ 2020-06-05 .
  18. قارئ الأخبار/NAF ، قارئ الأخبار، 25 مايو 2020 ، تم الاطلاع عليه في 5 يونيو 2020
  19. فوسن، بيك؛ أغيري، رودريغو؛ ألدابي، إيتزيار؛ سيبولسكا، أغاتا؛ فان إرب، ماريكي؛ فوكينز، أنتسكي؛ لابارا، إيغويتز؛ مينارد، آن-ليز؛ بالميرو أبروسيو، أليسيو؛ ريغاو، جيرمان؛ روسبوشر، ماركو (15 أكتوبر 2016). "قارئ الأخبار: استخدام موارد المعرفة في آلة قراءة متعددة اللغات لتوليد المزيد من المعرفة من تدفقات ضخمة من الأخبار" . أنظمة قائمة على المعرفة . 110 : 60-85 . doi : 10.1016/j.knosys.2016.07.013 . hdl : 1871.1/cbc310a9-677c-42ce-a84b-c59ebb344cc3 . ISSN 0950-7051 . 
  20. كونينغهام، هاميش (2005). "استخراج المعلومات، آليًا"، موسوعة اللغة واللسانيات ، 2، ص 665 - 677، http://gate.ac.uk/sale/ell2/ie/main.pdf (تم الاطلاع عليه: 18.06.2012).
  21. شيكو، د؛ ماسيرولي، م (2016). "التنبؤ بأولويات الشروح الوظيفية للجينات وتحديد أولوياتها باستخدام علم الوجود" . معاملات IEEE /ACM في علم الأحياء الحاسوبي والمعلوماتية الحيوية . 13 (2): 248-260 . doi : 10.1109/TCBB.2015.2459694 . PMID 27045825. S2CID 2795344 .  
  22. إردمان، م.؛ مايدش، ألكسندر؛ شنور، هـ.-ب.؛ ستاب، ستيفن (2000). "من التعليق الدلالي اليدوي إلى شبه الآلي: حول أدوات التعليق النصي القائمة على الأنطولوجيا"، وقائع مؤتمر COLING ، http://www.ida.liu.se/ext/epa/cis/2001/002/paper.pdf (تم الاطلاع عليه بتاريخ 18/06/2012).
  23. راو، ديليب؛ ماكنامي، بول؛ دريدز، مارك (2011). "ربط الكيانات: إيجاد الكيانات المستخرجة في قاعدة المعرفة"، استخراج المعلومات وتلخيصها من مصادر متعددة ولغات متعددة ، http://www.cs.jhu.edu/~delip/entity-linking.pdf (تم الاطلاع عليه بتاريخ 18/06/2012).
  24. شركة روكيت سوفتوير (2012). "تقنية لاستخراج المعلومات من النصوص"، http://www.rocketsoftware.com/products/aerotext مؤرشف في 21-06-2013 في Wayback Machine (تم استرجاعه: 18-06-2012).
  25. Orchestr8 (2012): "نظرة عامة على AlchemyAPI"، http://www.alchemyapi.com/api مؤرشف في 2016-05-13 في Wayback Machine (تم استرجاعه: 18.06.2012).
  26. جامعة شيفيلد (2011). "ANNIE: نظام استخراج معلومات شبه جديد"، http://gate.ac.uk/sale/tao/splitch6.html#chap:annie (تم الاطلاع عليه بتاريخ: 18.06.2012).
  27. شبكة التميز ILP. "ASIUM (LRI)"، http://www-ai.ijs.si/~ilpnet2/systems/asium.html (تم الاطلاع عليه: 18.06.2012).
  28. Attensity (2012). "الاستخلاص الشامل"، http://www.attensity.com/products/technology/semantic-server/exhaustive-extraction/ مؤرشف بتاريخ 11-07-2012 في Wayback Machine (تم استرجاعه بتاريخ 18-06-2012).
  29. مينديز، بابلو ن.؛ جاكوب، ماكس؛ غارسيا سيلفا، أندريس؛ بيزر، كريستيان (2011). "DBpedia Spotlight: Shedding Light on the Web of Documents"، وقائع المؤتمر الدولي السابع حول الأنظمة الدلالية ، ص 1-8، http://www.wiwiss.fu-berlin.de/en/institute/pwo/bizer/research/publications/Mendes-Jakob-GarciaSilva-Bizer-DBpediaSpotlight-ISEM2011.pdf مؤرشف بتاريخ 5 أبريل 2012 في Wayback Machine (تم الاطلاع عليه بتاريخ 18 يونيو 2012).
  30. ^ جانجيمي ، ألدو. بريسوتي، فالنتينا؛ ريفورجياتو ريكوبيرو، دييغو؛ نوزوليز، أندريا جيوفاني؛ درايتشيو، فرانشيسكو؛ مونجيوفي، ميسيل (2016). "قراءة آلة الويب الدلالية باستخدام فريد"، مجلة الويب الدلالية ، دوى : 10.3233/SW-160240 ، http://www.semantic-web-journal.net/system/files/swj1379.pdf
  31. أدريان، بنيامين؛ ماوس، هيكو؛ دينجل، أندرياس (2009). "iDocument: استخدام الأنطولوجيات لاستخراج المعلومات من النصوص"، http://www.dfki.uni-kl.de/~maus/dok/AdrianMausDengel09.pdf (تم الاطلاع عليه بتاريخ: 18/06/2012).
  32. شركة SRA الدولية (2012). "مستخرج NetOwl"، http://www.sra.com/netowl/entity-extraction/ مؤرشف بتاريخ 24-09-2012 في Wayback Machine (تم استرجاعه بتاريخ 18-06-2012).
  33. فورتونا، بلاز؛ جروبيلنيك، ماركو؛ ملادينيتش، دونيا (2007). "OntoGen: محرر أنطولوجي شبه آلي"، وقائع مؤتمر 2007 حول واجهة الإنسان، الجزء 2 ، ص 309-318، http://analytics.ijs.si/~blazf/papers/OntoGen2_HCII2007.pdf مؤرشف في 18 سبتمبر 2013 على موقع Wayback Machine (تم الاطلاع عليه بتاريخ 18 يونيو 2012).
  34. ميسيكوف، ميشيل؛ نافيلي، روبرتو؛ فيلاردي، باولا (2002). "نهج متكامل لتعلم وهندسة أنطولوجيا الويب"، مجلة الكمبيوتر ، 35(11)، ص 60-63، http://wwwusers.di.uniroma1.it/~velardi/IEEE_C.pdf مؤرشف في 19-05-2017 على موقع Wayback Machine (تم استرجاعه في 18-06-2012).
  35. ماكدويل، لوك ك.؛ كافاريلا، مايكل (2006). "استخراج المعلومات المدفوع بالأنطولوجيا باستخدام OntoSyphon"، وقائع المؤتمر الدولي الخامس حول الويب الدلالي ، ص 428-444، http://turing.cs.washington.edu/papers/iswc2006McDowell-final.pdf (تم الاطلاع عليه: 18.06.2012).
  36. يلدز، بورجو؛ ميكش، سيلفيا (2007). "ontoX - طريقة لاستخراج المعلومات القائمة على الأنطولوجيا"، وقائع المؤتمر الدولي لعام 2007 حول العلوم الحاسوبية وتطبيقاتها ، 3، ص 660-673، http://publik.tuwien.ac.at/files/pub-inf_4769.pdf مؤرشف في 2017-07-05 على Wayback Machine (تم استرجاعه: 18.06.2012).
  37. semanticweb.org (2011). "PoolParty Extractor"، http://semanticweb.org/wiki/PoolParty_Extractor مؤرشف بتاريخ 2016-03-04 في Wayback Machine (تم استرجاعه: 18.06.2012).
  38. ديل، ستيفن؛ إيرون، نداف؛ جيبسون، ديفيد؛ جروهل، دانيال؛ جوها، ر.؛ جينجران، أنانت؛ كانونجو، تاباس؛ راجاغوبالان، سريدهار؛ تومكينز، أندرو؛ توملين، جون أ.؛ زين، جيسون ي. (2003). "SemTag و Seeker: بناء الويب الدلالي عبر الشرح الدلالي الآلي"، وقائع المؤتمر الدولي الثاني عشر حول شبكة الويب العالمية ، ص 178-186، http://www2003.org/cdrom/papers/refereed/p831/p831-dill.html (تم الاطلاع عليه بتاريخ 18/06/2012).
  39. أورين، فيكتوريا؛ سيميانو، فيليب؛ إيريا، خوسيه؛ هاندشوه، سيغفريد؛ فارغاس-فيرا، ماريا؛ موتا، إنريكو؛ سيرافينيا، فابيو (2006). "التعليق الدلالي لإدارة المعرفة: المتطلبات ومسح لأحدث التقنيات"، دلالات الويب: العلوم والخدمات والوكلاء على شبكة الويب العالمية ، 4(1)، ص 14-28، http://staffwww.dcs.shef.ac.uk/people/J.Iria/iria_jws06.pdf ، (تم الاطلاع عليه بتاريخ 18/06/2012).
  40. سيميانو، فيليب؛ فولكر، جوهانا (2005). "Text2Onto - إطار عمل لتعلم الأنطولوجيا واكتشاف التغيير القائم على البيانات"، وقائع المؤتمر الدولي العاشر لتطبيقات اللغة الطبيعية على نظم المعلومات ، 3513، ص 227-238، http://www.cimiano.de/Publications/2005/nldb05/nldb05.pdf (تم الاطلاع عليه: 18.06.2012).
  41. مايدش، ألكسندر؛ فولز، رافائيل (2001). "إطار استخراج وصيانة الأنطولوجيا Text-To-Onto"، وقائع المؤتمر الدولي لهندسة البيانات التابع لمعهد مهندسي الكهرباء والإلكترونيات ، http://users.csc.calpoly.edu/~fkurfess/Events/DM-KM-01/Volz.pdf (تم الاطلاع عليه بتاريخ 18/06/2012).
  42. ربط الآلات. "نتصل بسحابة البيانات المفتوحة المرتبطة"، http://thewikimachine.fbk.eu/html/index.html مؤرشف في 19-07-2012 في Wayback Machine (تم استرجاعه: 18-06-2012).
  43. أنظمة Inxight الفيدرالية (2008). "Inxight ThingFinder و ThingFinder Professional"، http://inxightfedsys.com/products/sdks/tf/ مؤرشف بتاريخ 29-06-2012 في Wayback Machine (تم استرجاعه بتاريخ 18-06-2012).
  44. فراولي ويليام ف. وآخرون (1992)، "اكتشاف المعرفة في قواعد البيانات: نظرة عامة"، مجلة الذكاء الاصطناعي (المجلد 13، العدد 3)، 57-70 (النسخة الكاملة على الإنترنت: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1011 مؤرشفة في 2016-03-04 على Wayback Machine )
  45. فياض وآخرون (1996)، "من استخراج البيانات إلى اكتشاف المعرفة في قواعد البيانات"، مجلة الذكاء الاصطناعي (المجلد 17، العدد 3)، 37-54 (النسخة الكاملة متاحة على الإنترنت: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1230 ، مؤرشفة بتاريخ 4 مايو 2016 في أرشيف الإنترنت Wayback Machine).
  46. كاو، ل. (2010). "استخراج البيانات الموجه بالمجال: التحديات والآفاق". معاملات IEEE في هندسة المعرفة والبيانات . 22 (6): 755-769 . CiteSeerX 10.1.1.190.8427 . doi : 10.1109/tkde.2010.32 . S2CID 17904603 .