استخلاص المعرفة
استخلاص المعرفة هو عملية إنشاء المعرفة من مصادر منظمة ( قواعد البيانات العلائقية ، XML ) وغير منظمة ( نصوص ، مستندات، صور ). يجب أن تكون المعرفة الناتجة بتنسيق قابل للقراءة والتفسير آليًا، وأن تُمثل المعرفة بطريقة تُسهل الاستدلال. على الرغم من تشابهها المنهجي مع استخلاص المعلومات في معالجة اللغة الطبيعية وعمليات الاستخراج والتحويل والتحميل ، إلا أن المعيار الأساسي هو أن نتيجة الاستخلاص تتجاوز مجرد إنشاء معلومات منظمة أو تحويلها إلى مخطط علائقي . فهي تتطلب إما إعادة استخدام المعرفة الرسمية الموجودة (إعادة استخدام المعرفات أو الأنطولوجيات ) أو إنشاء مخطط بناءً على بيانات المصدر.
كانت مجموعة RDB2RDF التابعة لاتحاد شبكة الويب العالمية [ 1 ] تعمل على توحيد لغة لاستخراج أطر وصف الموارد (RDF) من قواعد البيانات العلائقية . ومن الأمثلة الشائعة الأخرى لاستخراج المعرفة تحويل ويكيبيديا إلى بيانات منظمة ، وكذلك ربطها بالمعرفة الموجودة (انظر DBpedia و Freebase ).
ملخص
بعد توحيد لغات تمثيل المعرفة مثل RDF و OWL ، أُجريت أبحاثٌ كثيرة في هذا المجال، لا سيما فيما يتعلق بتحويل قواعد البيانات العلائقية إلى RDF، وحلّ الهويات ، واكتشاف المعرفة ، وتعلم الأنطولوجيا. تعتمد العملية العامة على أساليب تقليدية لاستخراج المعلومات، مثل استخراج البيانات وتحويلها وتحميلها (ETL)، والتي تحوّل البيانات من مصادرها إلى تنسيقات مُهيكلة. وبالتالي، يُسهم فهم كيفية تفاعل هذه البيانات وتعلمها من بعضها البعض في فهم كيفية تفاعلها وتعلمها من بعضها.
يمكن استخدام المعايير التالية لتصنيف المناهج في هذا الموضوع (بعضها لا يأخذ في الاعتبار سوى الاستخراج من قواعد البيانات العلائقية): [ 2 ]
| مصدر | ما هي مصادر البيانات التي يتم تغطيتها: النصوص، قواعد البيانات العلائقية، XML، CSV |
|---|---|
| معرض | كيف يتم توضيح المعرفة المستخرجة (ملف الأنطولوجيا، قاعدة البيانات الدلالية)؟ وكيف يمكن الاستعلام عنها؟ |
| التزامن | هل تُنفَّذ عملية استخلاص المعرفة مرة واحدة لإنتاج نسخة احتياطية، أم تتم مزامنة النتيجة مع المصدر؟ ثابتة أم ديناميكية؟ هل تُعاد كتابة التغييرات التي تُجرى على النتيجة (ثنائية الاتجاه)؟ |
| إعادة استخدام المفردات | تستطيع الأداة إعادة استخدام المفردات الموجودة في عملية الاستخراج. على سبيل المثال، يمكن ربط عمود الجدول 'firstName' بـ foaf:firstName. بعض الطرق الآلية لا تستطيع ربط المفردات. |
| الأتمتة | مدى مساعدة/أتمتة عملية الاستخراج. يدوي، واجهة مستخدم رسومية، شبه آلي، آلي بالكامل. |
| يتطلب ذلك أنطولوجيا المجال | يلزم وجود أنطولوجيا موجودة مسبقًا لربطها بها. لذلك إما أن يتم إنشاء ربط أو يتم تعلم مخطط من المصدر ( تعلم الأنطولوجيا ). |
أمثلة
ربط الكيانات
- تقوم DBpedia Spotlight و OpenCalais و Dandelion dataTXT و Zemanta API و Extractiv و PoolParty Extractor بتحليل النصوص الحرة من خلال التعرف على الكيانات المسماة، ثم تقوم بإزالة الغموض عن المرشحين من خلال حل الأسماء وربط الكيانات التي تم العثور عليها بمستودع المعرفة DBpedia [ 3 ] ( عرض توضيحي لـ Dandelion dataTXT مؤرشف في 2013-11-02 على Wayback Machine أو عرض توضيحي لـ DBpedia Spotlight على الويب أو عرض توضيحي لـ PoolParty Extractor ).
دعا الرئيس أوباما يوم الأربعاء الكونغرس إلى تمديد الإعفاء الضريبي للطلاب الذي تم تضمينه في حزمة التحفيز الاقتصادي للعام الماضي، بحجة أن هذه السياسة توفر مساعدة أكثر سخاءً.
- بما أن الرئيس أوباما مرتبط بمورد بيانات مرتبطة في DBpedia ، يمكن استرجاع معلومات إضافية تلقائيًا، ويمكن لمُستدل دلالي، على سبيل المثال، استنتاج أن الكيان المذكور من نوع "شخص" (باستخدام برنامج FOAF ) ومن نوع " رؤساء الولايات المتحدة" (باستخدام YAGO ). أمثلة مضادة: طرق تتعرف فقط على الكيانات أو ترتبط بمقالات ويكيبيديا وغيرها من المصادر التي لا توفر استرجاعًا إضافيًا للبيانات المنظمة والمعرفة الرسمية.
قواعد البيانات العلائقية إلى RDF
- تُعدّ أدوات مثل Triplify وD2R Server و Ultrawrap ( المؤرشفة بتاريخ 27 نوفمبر 2016 على Wayback Machine ) و Virtuoso RDF Views أدواتٍ لتحويل قواعد البيانات العلائقية إلى RDF. وتتيح هذه الأدوات إعادة استخدام المصطلحات والأنطولوجيات الموجودة أثناء عملية التحويل. عند تحويل جدول علائقي نموذجي يُسمى " users" ، يجب أن يُوفّر عمود واحد (مثل " name ") أو مجموعة من الأعمدة (مثل "first_name " و "last_name ") مُعرّف URI للكيان المُنشأ. ويُستخدم عادةً المفتاح الأساسي. ويمكن استخراج كل عمود آخر كعلاقة مع هذا الكيان. [ 4 ] ثم تُستخدم الخصائص ذات الدلالات المُحددة رسميًا (ويُعاد استخدامها) لتفسير المعلومات. على سبيل المثال، يمكن تعريف عمود في جدول "user" يُسمى " mardizedTo" كعلاقة متناظرة، ويمكن تحويل عمود " homepage" إلى خاصية من مُفردات FOAF تُسمى foaf:homepage ، مما يُؤهله ليكون خاصية وظيفية عكسية . بعد ذلك، يمكن تحويل كل مدخل في جدول المستخدمين إلى نسخة من الصنف foaf:Person (مجموعة الأنطولوجيا). بالإضافة إلى ذلك، يمكن إنشاء معرفة المجال (في شكل أنطولوجيا) من status_id ، إما عن طريق قواعد مُنشأة يدويًا (إذا كان status_id يساوي 2، فإن المدخل ينتمي إلى صنف Teacher) أو عن طريق طرق (شبه) آلية ( تعلم الأنطولوجيا ). إليك مثال على التحويل:
| اسم | متزوج من | الصفحة الرئيسية | status_id |
|---|---|---|---|
| بيتر | ماري | https://example.org/Peters_page | 1 |
| كلاوس | إيفا | https://example.org/Claus_page | 2 |
بيتر : متزوج من : ماري . متزوج من بومة : خاصية متناظرة . بيتر أحمق : الصفحة الرئيسية < https://example.org/Peters_page > . بيتر أ أحمق : شخص . بيتر أ : طالب . كلاوس أ : معلم .استخراج البيانات من المصادر المهيكلة إلى RDF
مطابقة 1:1 من جداول/عروض قواعد البيانات العلائقية إلى كيانات/سمات/قيم RDF
عند بناء تمثيل RDB لمجال مشكلة ما، غالبًا ما تكون نقطة البداية هي مخطط علاقات الكيانات (ERD). عادةً، يُمثَّل كل كيان بجدول قاعدة بيانات، ويصبح كل سمة من سمات الكيان عمودًا في ذلك الجدول، وتُشار إلى العلاقات بين الكيانات بواسطة مفاتيح خارجية. يُحدد كل جدول عادةً فئة معينة من الكيانات، ويُمثل كل عمود إحدى سماتها. يصف كل صف في الجدول مثيلًا لكيان، يتم تحديده بشكل فريد بواسطة مفتاح أساسي. تُشكل صفوف الجدول مجتمعةً مجموعة كيانات. في تمثيل RDF مكافئ لمجموعة الكيانات نفسها:
- كل عمود في الجدول يمثل سمة (أي شرط).
- تمثل كل قيمة في العمود قيمة سمة (أي كائن).
- يمثل كل مفتاح صف معرف كيان (أي موضوع)
- يمثل كل صف مثيلًا للكيان
- يتم تمثيل كل صف (مثيل الكيان) في RDF بواسطة مجموعة من الثلاثيات ذات موضوع مشترك (معرف الكيان).
لذا، لعرض عرض مكافئ بناءً على دلالات RDF، ستكون خوارزمية التعيين الأساسية كما يلي:
- أنشئ فئة RDFS لكل جدول
- قم بتحويل جميع المفاتيح الأساسية والمفاتيح الخارجية إلى معرّفات موارد موحدة (IRIs).
- قم بتعيين معرف موارد موحد (IRI) لكل عمود.
- قم بتعيين مُسند rdf:type لكل صف، واربطه بمعرف موارد موحد (IRI) لفئة RDFS يتوافق مع الجدول.
- لكل عمود ليس جزءًا من مفتاح أساسي أو مفتاح خارجي، قم بإنشاء ثلاثية تحتوي على معرف IRI للمفتاح الأساسي كموضوع، ومعرف IRI للعمود كمسند، وقيمة العمود ككائن.
يمكن العثور على إشارة مبكرة إلى هذا الربط الأساسي أو المباشر في مقارنة تيم بيرنرز لي بين نموذج ER ونموذج RDF. [ 4 ]
عمليات ربط معقدة لقواعد البيانات العلائقية بصيغة RDF
تُتيح عملية الربط المباشر المذكورة أعلاه عرض البيانات القديمة بصيغة RDF بطريقة مباشرة، ويمكن إجراء تحسينات إضافية لتعزيز فائدة مخرجات RDF بما يتناسب مع حالات الاستخدام المحددة. عادةً ما تُفقد المعلومات أثناء تحويل مخطط علاقات الكيانات (ERD) إلى جداول علائقية (يمكن الاطلاع على التفاصيل في عدم تطابق المعاوقة بين الكائنات والعلاقات )، مما يستدعي إعادة هندستها . من الناحية المفاهيمية، يمكن اتباع نهجين لاستخراج المعلومات. يحاول النهج الأول استخراج أو تعلم مخطط OWL من مخطط قاعدة البيانات المُعطى. استخدمت الأساليب المبكرة عددًا ثابتًا من قواعد الربط المُنشأة يدويًا لتحسين الربط المباشر. [ 5 ] [ 6 ] [ 7 ] أما الأساليب الأكثر تطورًا فتستخدم طرقًا استدلالية أو خوارزميات تعلم لاستنتاج معلومات المخطط (تتداخل هذه الأساليب مع تعلم الأنطولوجيا ). بينما تحاول بعض المناهج استخلاص المعلومات من البنية المتأصلة في مخطط SQL [ 8 ] (تحليل المفاتيح الخارجية على سبيل المثال)، يحلل البعض الآخر المحتوى والقيم في الجداول لإنشاء تسلسلات هرمية مفاهيمية [ 9 ] (على سبيل المثال، الأعمدة ذات القيم القليلة مرشحة لتصبح فئات). ويسعى الاتجاه الثاني إلى ربط المخطط ومحتوياته بأنطولوجيا مجال موجودة مسبقًا (انظر أيضًا: مواءمة الأنطولوجيا ). مع ذلك، غالبًا ما تكون أنطولوجيا المجال المناسبة غير موجودة، ويتعين إنشاؤها أولًا.
XML
بما أن XML مُهيكلة على شكل شجرة، يُمكن تمثيل أي بيانات بسهولة في RDF، المُهيكلة على شكل رسم بياني. يُعد XML2RDF مثالًا على منهجية تستخدم عُقد RDF الفارغة لتحويل عناصر وسمات XML إلى خصائص RDF. مع ذلك، يُعد الموضوع أكثر تعقيدًا كما هو الحال في قواعد البيانات العلائقية. في الجدول العلائقي، يُعتبر المفتاح الأساسي مُرشحًا مثاليًا ليصبح موضوعًا للثلاثيات المُستخرجة. أما عنصر XML، فيُمكن تحويله - بحسب السياق - كموضوع أو مُسند أو كائن لثلاثية. يُمكن استخدام XSLT كلغة تحويل قياسية لتحويل XML إلى RDF يدويًا.
استعراض الأساليب / الأدوات
| اسم | مصدر البيانات | عرض البيانات | مزامنة البيانات | لغة رسم الخرائط | إعادة استخدام المفردات | أتمتة الخرائط. | علم الوجود المطلوب للمجال | يستخدم واجهة المستخدم الرسومية |
|---|---|---|---|---|---|---|---|---|
| رسم خرائط مباشرة للبيانات العلائقية إلى RDF | البيانات العلائقية | SPARQL/ETL | متحرك | غير متوفر | خطأ شنيع | أوتوماتيكي | خطأ شنيع | خطأ شنيع |
| CSV2RDF4LOD | ملف CSV | ETL | ثابت | RDF | حقيقي | يدوي | خطأ شنيع | خطأ شنيع |
| CoNLL-RDF | TSV، CoNLL | تدفق SPARQL/RDF | ثابت | لا أحد | حقيقي | تلقائي (خاص بالمجال، لحالات الاستخدام في تكنولوجيا اللغة، يحافظ على العلاقات بين الصفوف) | خطأ شنيع | خطأ شنيع |
| Convert2RDF | ملف نصي مفصول | ETL | ثابت | RDF/DAML | حقيقي | يدوي | خطأ شنيع | حقيقي |
| خادم D2R | قاعدة البيانات العلائقية | SPARQL | ثنائي الاتجاه | خريطة D2R | حقيقي | يدوي | خطأ شنيع | خطأ شنيع |
| دارت جريد | قاعدة البيانات العلائقية | لغة الاستعلام الخاصة | متحرك | أداة بصرية | حقيقي | يدوي | خطأ شنيع | حقيقي |
| داتا ماستر | قاعدة البيانات العلائقية | ETL | ثابت | ملكية خاصة | حقيقي | يدوي | حقيقي | حقيقي |
| إضافة RDF من جوجل ريفاين | CSV، XML | ETL | ثابت | لا أحد | شبه أوتوماتيكي | خطأ شنيع | حقيقي | |
| كريكتور | XML | ETL | ثابت | XSLT | حقيقي | يدوي | حقيقي | خطأ شنيع |
| مابونتو | قاعدة البيانات العلائقية | ETL | ثابت | ملكية خاصة | حقيقي | يدوي | حقيقي | خطأ شنيع |
| التحولات | قاعدة البيانات العلائقية | ETL | ثابت | لغة رسم الخرائط الخاصة القائمة على XML | حقيقي | يدوي | خطأ شنيع | حقيقي |
| MappingMaster | ملف CSV | ETL | ثابت | MappingMaster | حقيقي | واجهة المستخدم الرسومية | خطأ شنيع | حقيقي |
| ODEMapster | قاعدة البيانات العلائقية | ETL | ثابت | ملكية خاصة | حقيقي | يدوي | حقيقي | حقيقي |
| إضافة استيراد ملفات CSV من OntoWiki - مكعبات البيانات والجداول | ملف CSV | ETL | ثابت | مفردات مكعب بيانات RDF | حقيقي | شبه أوتوماتيكي | خطأ شنيع | حقيقي |
| مستخرج حفلات المسابح (PPX) | XML، نص | البيانات المرتبطة | متحرك | RDF (SKOS) | حقيقي | شبه أوتوماتيكي | حقيقي | خطأ شنيع |
| RDBToOnto | قاعدة البيانات العلائقية | ETL | ثابت | لا أحد | خطأ شنيع | بالإضافة إلى ذلك، يتمتع المستخدم بفرصة ضبط النتائج بدقة، وذلك بفضل التشغيل التلقائي. | خطأ شنيع | حقيقي |
| RDF 123 | ملف CSV | ETL | ثابت | خطأ شنيع | خطأ شنيع | يدوي | خطأ شنيع | حقيقي |
| RDOTE | قاعدة البيانات العلائقية | ETL | ثابت | SQL | حقيقي | يدوي | حقيقي | حقيقي |
| لغة OWL العلائقية | قاعدة البيانات العلائقية | ETL | ثابت | لا أحد | خطأ شنيع | أوتوماتيكي | خطأ شنيع | خطأ شنيع |
| T2LD | ملف CSV | ETL | ثابت | خطأ شنيع | خطأ شنيع | أوتوماتيكي | خطأ شنيع | خطأ شنيع |
| مفردات مكعب بيانات RDF | البيانات الإحصائية متعددة الأبعاد في جداول البيانات | مفردات مكعب البيانات | حقيقي | يدوي | خطأ شنيع | |||
| مُلحّن توب بريد | ملف CSV | ETL | ثابت | SKOS | خطأ شنيع | شبه أوتوماتيكي | خطأ شنيع | حقيقي |
| تضاعف ثلاث مرات | قاعدة البيانات العلائقية | البيانات المرتبطة | متحرك | SQL | حقيقي | يدوي | خطأ شنيع | خطأ شنيع |
| تمت أرشفة Ultrawrap بتاريخ 27 نوفمبر 2016 في Wayback Machine | قاعدة البيانات العلائقية | SPARQL/ETL | متحرك | R2RML | حقيقي | شبه أوتوماتيكي | خطأ شنيع | حقيقي |
| عرض Virtuoso RDF | قاعدة البيانات العلائقية | SPARQL | متحرك | لغة المخططات الوصفية | حقيقي | شبه أوتوماتيكي | خطأ شنيع | حقيقي |
| مستغل بارع | مصادر البيانات المنظمة وشبه المنظمة | SPARQL | متحرك | Virtuoso PL & XSLT | حقيقي | شبه أوتوماتيكي | خطأ شنيع | خطأ شنيع |
| فيزا | قاعدة البيانات العلائقية | RDQL | متحرك | SQL | حقيقي | يدوي | حقيقي | حقيقي |
| XLWrap: تحويل جداول البيانات إلى RDF | ملف CSV | ETL | ثابت | بناء الجملة المثلثي | حقيقي | يدوي | خطأ شنيع | خطأ شنيع |
| تحويل XML إلى RDF | XML | ETL | ثابت | خطأ شنيع | خطأ شنيع | أوتوماتيكي | خطأ شنيع | خطأ شنيع |
مستخلص من مصادر اللغة الطبيعية
تُشفّر غالبية المعلومات الواردة في وثائق الأعمال (حوالي 80% [ 10 ] ) بلغة طبيعية، وبالتالي فهي غير مُهيكلة. ونظرًا لأن البيانات غير المُهيكلة تُشكّل تحديًا لاستخلاص المعرفة، فإنّ ذلك يتطلّب أساليب أكثر تعقيدًا، والتي غالبًا ما تُقدّم نتائج أقل جودة مقارنةً بالبيانات المُهيكلة. مع ذلك، فإنّ إمكانية الحصول على كمّ هائل من المعرفة المُستخلصة تُعوّض عن زيادة التعقيد وانخفاض جودة الاستخلاص. في ما يلي، يُقصد بمصادر اللغة الطبيعية مصادر المعلومات التي تُقدّم فيها البيانات بشكل غير مُهيكل كنص عادي. إذا كان النص المُقدّم مُضمّنًا في مستند ترميز (مثل مستند HTML)، فإنّ الأنظمة المذكورة عادةً ما تُزيل عناصر الترميز تلقائيًا.
التوصيف اللغوي / معالجة اللغة الطبيعية (NLP)
كخطوة تمهيدية لاستخلاص المعرفة، قد يكون من الضروري إجراء عملية ترميز لغوي باستخدام أداة واحدة أو أكثر من أدوات معالجة اللغة الطبيعية . عادةً ما تعتمد الوحدات الفردية في سير عمل معالجة اللغة الطبيعية على تنسيقات خاصة بالأداة للإدخال والإخراج، ولكن في سياق استخلاص المعرفة، تم تطبيق تنسيقات منظمة لتمثيل الترميزات اللغوية.
تشمل مهام معالجة اللغة الطبيعية النموذجية ذات الصلة باستخلاص المعرفة ما يلي:
- تحديد أجزاء الكلام (POS)
- التجريد اللغوي (LEMMA) أو التفرع (STEM)
- إزالة الغموض عن معاني الكلمات (WSD، المرتبطة بالتعليق الدلالي أدناه)
- التعرف على الكيانات المسماة (NER، انظر أيضًا IE أدناه)
- التحليل النحوي، وغالبًا ما يعتمد على التبعيات النحوية (DEP)
- التحليل النحوي السطحي (CHUNK): إذا كانت الأداء يمثل مشكلة، فإن التجزئة تؤدي إلى استخراج سريع للأسماء والعبارات الأخرى.
- حل الإحالة (انظر حل الإحالة في IE أدناه، ولكن يُنظر إليه هنا على أنه مهمة إنشاء روابط بين الإشارات النصية بدلاً من الربط بين ذكر كيان ما وتمثيل مجرد لهذا الكيان)
- تصنيف الأدوار الدلالية (SRL، المتعلقة باستخراج العلاقات؛ لا ينبغي الخلط بينها وبين الشرح الدلالي كما هو موضح أدناه)
- تحليل الخطاب (العلاقات بين الجمل المختلفة، ونادراً ما يستخدم في التطبيقات العملية)
في معالجة اللغات الطبيعية، تُعرض هذه البيانات عادةً بصيغة TSV (صيغة CSV مع استخدام علامة الجدولة كفواصل)، والتي تُعرف غالبًا بصيغة CoNLL. ولأغراض استخلاص المعرفة، تم إنشاء عروض RDF لهذه البيانات وفقًا لمعايير المجتمع التالية:
- تنسيق تبادل معالجة اللغة الطبيعية (NIF، للعديد من أنواع التعليقات التوضيحية الشائعة) [ 11 ] [ 12 ]
- التعليقات التوضيحية على الويب (WA، والتي تستخدم غالبًا لربط الكيانات) [ 13 ]
- CoNLL-RDF (للتعليقات التوضيحية الممثلة أصلاً بتنسيقات TSV) [ 14 ] [ 15 ]
تتضمن التنسيقات الأخرى الخاصة بكل منصة ما يلي:
استخلاص المعلومات التقليدي (IE)
يُعدّ استخلاص المعلومات التقليدي [ 20 ] تقنيةً من تقنيات معالجة اللغة الطبيعية، حيث يستخلص المعلومات من نصوص اللغة الطبيعية عادةً، ويُهيكلها بطريقة مناسبة. يجب تحديد أنواع المعلومات المراد استخلاصها في نموذج قبل بدء العملية، ولذلك فإن عملية استخلاص المعلومات التقليدية برمتها تعتمد على المجال. وينقسم استخلاص المعلومات إلى المهام الفرعية الخمس التالية.
- التعرف على الكيانات المسماة (NER)
- حل الإحالة المرجعية (CO)
- إنشاء عنصر القالب (TE)
- بناء العلاقات باستخدام القوالب (TR)
- إنتاج سيناريو نموذجي (ST)
تتمثل مهمة التعرف على الكيانات المسماة في التعرف على جميع الكيانات المسماة الموجودة في نص ما وتصنيفها (أي إسناد كيان مسمى إلى فئة محددة مسبقًا). ويتم ذلك من خلال تطبيق أساليب قائمة على القواعد النحوية أو نماذج إحصائية.
تُحدد عملية حلّ الإحالة الكيانات المتكافئة، التي تم التعرف عليها بواسطة تقنية التعرف على الكيانات المسماة، داخل النص. يوجد نوعان رئيسيان من علاقات التكافؤ. الأول يتعلق بالعلاقة بين كيانين مختلفين ممثلين (مثل IBM Europe وIBM)، والثاني يتعلق بالعلاقة بين كيان ومراجعه الإشارية (مثل it وIBM). ويمكن التعرف على كلا النوعين من خلال عملية حلّ الإحالة.
أثناء إنشاء عنصر القالب، يحدد نظام IE الخصائص الوصفية للكيانات، والتي يتم التعرف عليها بواسطة NER و CO. تتوافق هذه الخصائص مع الصفات العادية مثل الأحمر أو الكبير.
يُحدد بناء علاقات القوالب العلاقات الموجودة بين عناصر القالب. يمكن أن تكون هذه العلاقات من أنواع متعددة، مثل علاقات العمل أو علاقات التواجد، مع اشتراط أن يتوافق كل من المجال والنطاق مع الكيانات.
في سيناريو النموذج، سيتم تحديد أحداث الإنتاج، الموصوفة في النص، وهيكلتها فيما يتعلق بالكيانات، المعترف بها بواسطة NER و CO والعلاقات، المحددة بواسطة TR.
استخلاص المعلومات القائم على علم الوجود (OBIE)
يُعدّ استخلاص المعلومات القائم على الأنطولوجيا [ 10 ] فرعًا من فروع استخلاص المعلومات، حيث تُستخدم أنطولوجيا واحدة على الأقل لتوجيه عملية استخلاص المعلومات من النصوص اللغوية الطبيعية. يستخدم نظام OBIE أساليب استخلاص المعلومات التقليدية لتحديد المفاهيم والحالات والعلاقات بين الأنطولوجيات المستخدمة في النص، والتي سيتم تنظيمها في أنطولوجيا بعد العملية. وبالتالي، تُشكّل الأنطولوجيات المُدخلة نموذج المعلومات المراد استخلاصها. [ 21 ]
تعلم الأنطولوجيا (OL)
تعلم الأنطولوجيا هو عملية إنشاء الأنطولوجيات بشكل آلي أو شبه آلي، بما في ذلك استخراج مصطلحات المجال ذي الصلة من النصوص اللغوية الطبيعية. ونظرًا لأن بناء الأنطولوجيات يدويًا عملية شاقة للغاية وتستغرق وقتًا طويلاً، فهناك دافع قوي لأتمتة هذه العملية.
التوصيف الدلالي (SA)
أثناء عملية الترميز الدلالي، [ 22 ] يُضاف إلى نص اللغة الطبيعية بيانات وصفية (غالبًا ما تُمثَّل بصيغة RDFa )، مما يجعل دلالات المصطلحات الواردة فيه قابلة للفهم الآلي. في هذه العملية، التي تُجرى عادةً بشكل شبه آلي، تُستخلص المعرفة بمعنى أنه يتم إنشاء رابط بين المصطلحات المعجمية، على سبيل المثال، والمفاهيم من الأنطولوجيات. وبالتالي، تُكتسب معرفة بالمعنى المقصود للمصطلح في السياق المُعالَج، ومن ثمّ يُرسى معنى النص على بيانات قابلة للقراءة الآلية مع القدرة على استخلاص الاستنتاجات. عادةً ما يُقسَّم الترميز الدلالي إلى المهمتين الفرعيتين التاليتين.
على مستوى استخراج المصطلحات، تُستخرج المصطلحات المعجمية من النص. ولتحقيق ذلك، يقوم مُجزئ الكلمات أولاً بتحديد حدود الكلمات وحل الاختصارات. بعد ذلك، تُستخرج المصطلحات من النص، التي تُطابق مفهومًا معينًا، بمساعدة معجم خاص بالمجال لربطها في عملية ربط الكيانات.
في ربط الكيانات [ 23 ]، يتم إنشاء رابط بين المصطلحات المعجمية المستخرجة من النص المصدر والمفاهيم من أنطولوجيا أو قاعدة معرفية مثل DBpedia . ولتحقيق ذلك، يتم الكشف عن المفاهيم المرشحة المناسبة لمختلف معاني المصطلح بمساعدة معجم. وأخيرًا، يتم تحليل سياق المصطلحات لتحديد أنسب طريقة لإزالة الغموض وربط المصطلح بالمفهوم الصحيح.
تجدر الإشارة إلى أن "التعليق الدلالي" في سياق استخراج المعرفة لا ينبغي الخلط بينه وبين التحليل الدلالي كما هو مفهوم في معالجة اللغة الطبيعية (يشار إليه أيضًا باسم "التعليق الدلالي"): يهدف التحليل الدلالي إلى تمثيل كامل وقابل للقراءة آليًا للغة الطبيعية، في حين أن التعليق الدلالي بمعنى استخراج المعرفة لا يتناول سوى جانب أساسي جدًا من ذلك.
أدوات
يمكن استخدام المعايير التالية لتصنيف الأدوات التي تستخرج المعرفة من النصوص اللغوية الطبيعية.
| مصدر | ما هي تنسيقات الإدخال التي يمكن معالجتها بواسطة الأداة (مثل النص العادي أو HTML أو PDF)؟ |
| نموذج الوصول | هل يمكن للأداة الاستعلام عن مصدر البيانات أم أنها تتطلب نسخة كاملة من البيانات لعملية الاستخراج؟ |
| مزامنة البيانات | هل نتيجة عملية الاستخراج متزامنة مع المصدر؟ |
| يستخدم أنطولوجيا الإخراج | هل تربط الأداة النتيجة بعلم الوجود؟ |
| أتمتة رسم الخرائط | ما مدى أتمتة عملية الاستخراج (يدوية، شبه آلية، أو آلية بالكامل)؟ |
| يتطلب علم الوجود | هل تحتاج الأداة إلى أنطولوجيا للاستخراج؟ |
| يستخدم واجهة المستخدم الرسومية | هل توفر الأداة واجهة مستخدم رسومية؟ |
| يقترب | ما هو النهج الذي تستخدمه الأداة (IE، OBIE، OL أو SA)؟ |
| الكيانات المستخرجة | ما هي أنواع الكيانات (مثل الكيانات المسماة أو المفاهيم أو العلاقات) التي يمكن استخراجها بواسطة الأداة؟ |
| التقنيات التطبيقية | ما هي التقنيات المستخدمة (مثل معالجة اللغة الطبيعية، والأساليب الإحصائية، والتجميع، أو التعلم الآلي )؟ |
| نموذج الإخراج | ما هو النموذج المستخدم لتمثيل نتيجة الأداة (مثل RDF أو OWL)؟ |
| النطاقات المدعومة | ما هي المجالات المدعومة (مثل الاقتصاد أو علم الأحياء)؟ |
| اللغات المدعومة | ما هي اللغات التي يمكن معالجتها (مثل الإنجليزية أو الألمانية)؟ |
يوضح الجدول التالي بعض الأدوات المستخدمة لاستخراج المعرفة من مصادر اللغة الطبيعية.
| اسم | مصدر | نموذج الوصول | مزامنة البيانات | يستخدم أنطولوجيا الإخراج | أتمتة رسم الخرائط | يتطلب علم الوجود | يستخدم واجهة المستخدم الرسومية | يقترب | الكيانات المستخرجة | التقنيات التطبيقية | نموذج الإخراج | النطاقات المدعومة | اللغات المدعومة |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| [ 24 ] | نص عادي، HTML، XML، SGML | أحمق | لا | نعم | أوتوماتيكي | نعم | نعم | أي | الكيانات المسماة، والعلاقات، والأحداث | القواعد اللغوية | ملكية خاصة | مستقل عن المجال | الإنجليزية، الإسبانية، العربية، الصينية، الإندونيسية |
| AlchemyAPI [ 25 ] | نص عادي، HTML | أوتوماتيكي | نعم | جنوب أفريقيا | متعدد اللغات | ||||||||
| آني [ 26 ] | نص عادي | أحمق | نعم | نعم | أي | خوارزميات الحالة المحدودة | متعدد اللغات | ||||||
| آسيام [ 27 ] | نص عادي | أحمق | شبه أوتوماتيكي | نعم | OL | المفاهيم، التسلسل الهرمي للمفاهيم | معالجة اللغة الطبيعية، التجميع | ||||||
| استخلاص الشدة الشامل [ 28 ] | أوتوماتيكي | أي | الكيانات المسماة، والعلاقات، والأحداث | معالجة اللغة الطبيعية | |||||||||
| واجهة برمجة تطبيقات Dandelion | نص عادي، HTML، عنوان URL | استراحة | لا | لا | أوتوماتيكي | لا | نعم | جنوب أفريقيا | الكيانات المسماة، والمفاهيم | الأساليب الإحصائية | JSON | مستقل عن المجال | متعدد اللغات |
| تسليط الضوء على DBpedia [ 29 ] | نص عادي، HTML | تفريغ، SPARQL | نعم | نعم | أوتوماتيكي | لا | نعم | جنوب أفريقيا | شرح لكل كلمة، وشرح للكلمات غير المتوقفة | معالجة اللغات الطبيعية، الأساليب الإحصائية، التعلم الآلي | RDFa | مستقل عن المجال | إنجليزي |
| EntityClassifier.eu | نص عادي، HTML | أحمق | نعم | نعم | أوتوماتيكي | لا | نعم | IE، OL، SA | شرح لكل كلمة، وشرح للكلمات غير المتوقفة | القواعد النحوية القائمة على القواعد | XML | مستقل عن المجال | الإنجليزية، الألمانية، الهولندية |
| فريد [ 30 ] | نص عادي | تفريغ، واجهة برمجة تطبيقات REST | نعم | نعم | أوتوماتيكي | لا | نعم | أنماط تصميم الأنطولوجيا، دلالات الإطار ، IE، OL، SA | شرح NIF أو EarMark (متعدد) الكلمات، المسندات، الحالات، الدلالات التركيبية، تصنيفات المفاهيم، الأطر، الأدوار الدلالية، العلاقات التعبيرية، الأحداث، الأسلوب، الزمن، ربط الكيانات، ربط الأحداث، المشاعر | معالجة اللغة الطبيعية، والتعلم الآلي، والقواعد الاستدلالية | RDF/OWL | مستقل عن المجال | الإنجليزية، واللغات الأخرى عبر الترجمة |
| iDocument [ 31 ] | HTML، PDF، DOC | SPARQL | نعم | نعم | أوبي | الحالات، قيم الخصائص | معالجة اللغة الطبيعية | شخصي، تجاري | |||||
| مستخرج NetOwl [ 32 ] | نص عادي، HTML، XML، SGML، PDF، مايكروسوفت أوفيس | أحمق | لا | نعم | معادلة | نعم | نعم | أي | الكيانات المسماة، والعلاقات، والأحداث | معالجة اللغة الطبيعية | XML، JSON، RDF-OWL، وغيرها | نطاقات متعددة | الإنجليزية، العربية، الصينية (المبسطة والتقليدية)، الفرنسية، الكورية، الفارسية (الفارسية والدارية)، الروسية، الإسبانية |
| تمت أرشفة OntoGen في 30 مارس 2010 على Wayback Machine [ 33 ] | شبه أوتوماتيكي | نعم | OL | المفاهيم، التسلسل الهرمي للمفاهيم، العلاقات غير التصنيفية، الأمثلة | معالجة اللغة الطبيعية، والتعلم الآلي، والتجميع | ||||||||
| تمت أرشفة OntoLearn في 2017-08-09 على Wayback Machine [ 34 ] | نص عادي، HTML | أحمق | لا | نعم | أوتوماتيكي | نعم | لا | OL | المفاهيم، التسلسل الهرمي للمفاهيم، الأمثلة | معالجة اللغة الطبيعية، الأساليب الإحصائية | ملكية خاصة | مستقل عن المجال | إنجليزي |
| OntoLearn Reloaded | نص عادي، HTML | أحمق | لا | نعم | أوتوماتيكي | نعم | لا | OL | المفاهيم، التسلسل الهرمي للمفاهيم، الأمثلة | معالجة اللغة الطبيعية، الأساليب الإحصائية | ملكية خاصة | مستقل عن المجال | إنجليزي |
| OntoSyphon [ 35 ] | HTML، PDF، DOC | تفريغ، استعلامات محركات البحث | لا | نعم | أوتوماتيكي | نعم | لا | أوبي | المفاهيم، العلاقات، الأمثلة | معالجة اللغة الطبيعية، الأساليب الإحصائية | RDF | مستقل عن المجال | إنجليزي |
| تم أرشفة ontoX في 27-05-2016 على Wayback Machine [ 36 ] | نص عادي | أحمق | لا | نعم | شبه أوتوماتيكي | نعم | لا | أوبي | الحالات، قيم خصائص نوع البيانات | الأساليب القائمة على الاستدلال | ملكية خاصة | مستقل عن المجال | مستقل عن اللغة |
| أوبن كاليس | نص عادي، HTML، XML | أحمق | لا | نعم | أوتوماتيكي | نعم | لا | جنوب أفريقيا | إضافة تعليقات توضيحية للكيانات، إضافة تعليقات توضيحية للأحداث، إضافة تعليقات توضيحية للحقائق | معالجة اللغة الطبيعية، والتعلم الآلي | RDF | مستقل عن المجال | الإنجليزية، الفرنسية، الإسبانية |
| مستخرج PoolParty [ 37 ] | نص عادي، HTML، DOC، ODT | أحمق | لا | نعم | أوتوماتيكي | نعم | نعم | أوبي | الكيانات المسماة، والمفاهيم، والعلاقات، والمفاهيم التي تصنف النص، والإضافات | معالجة اللغات الطبيعية، والتعلم الآلي، والأساليب الإحصائية | RDF، OWL | مستقل عن المجال | الإنجليزية، الألمانية، الإسبانية، الفرنسية |
| روسوكا | نص عادي، HTML، XML، SGML، PDF، مايكروسوفت أوفيس | أحمق | نعم | نعم | معادلة | لا | نعم | أي | استخراج الكيانات المسماة، وحلّ الكيانات، واستخراج العلاقات، والخصائص، والمفاهيم، وتحليل المشاعر متعدد المتجهات ، والوسم الجغرافي، وتحديد اللغة | معالجة اللغة الطبيعية، والتعلم الآلي | XML، JSON، POJO، RDF | نطاقات متعددة | متعدد اللغات (أكثر من 200 لغة) |
| سكوبي | نص عادي، HTML | أحمق | لا | نعم | أوتوماتيكي | لا | لا | أوبي | الحالات، وقيم الخصائص، وأنواع RDFS | معالجة اللغة الطبيعية، والتعلم الآلي | RDF، RDFa | مستقل عن المجال | الإنجليزية، الألمانية |
| SemTag [ 38 ] [ 39 ] | HTML | أحمق | لا | نعم | أوتوماتيكي | نعم | لا | جنوب أفريقيا | التعلم الآلي | سجل قاعدة البيانات | مستقل عن المجال | مستقل عن اللغة | |
| تم أرشفة smart FIX بتاريخ 17 مايو 2016 على موقع Wayback Machine. | نص عادي، HTML، PDF، DOC، بريد إلكتروني | أحمق | نعم | لا | أوتوماتيكي | لا | نعم | أوبي | الكيانات المسماة | معالجة اللغة الطبيعية، والتعلم الآلي | ملكية خاصة | مستقل عن المجال | الإنجليزية، الألمانية، الفرنسية، الهولندية، البولندية |
| Text2Onto [ 40 ] | نص عادي، HTML، PDF | أحمق | نعم | لا | شبه أوتوماتيكي | نعم | نعم | OL | المفاهيم، التسلسل الهرمي للمفاهيم، العلاقات غير التصنيفية، الأمثلة، البديهيات | معالجة اللغات الطبيعية، الأساليب الإحصائية، التعلم الآلي، الأساليب القائمة على القواعد | بُومَة | مستقل عن المجال | الإنجليزية، الألمانية، الإسبانية |
| تحويل النص إلى كائن مرئي [ 41 ] | نص عادي، HTML، PDF، PostScript | أحمق | شبه أوتوماتيكي | نعم | نعم | OL | المفاهيم، التسلسل الهرمي للمفاهيم، العلاقات غير التصنيفية، الكيانات المعجمية التي تشير إلى المفاهيم، الكيانات المعجمية التي تشير إلى العلاقات | معالجة اللغات الطبيعية، والتعلم الآلي، والتجميع، والأساليب الإحصائية | الألمانية | ||||
| ذات نيدل | نص عادي | أحمق | أوتوماتيكي | لا | المفاهيم، العلاقات، التسلسل الهرمي | معالجة اللغة الطبيعية، ملكية خاصة | JSON | نطاقات متعددة | إنجليزي | ||||
| آلة ويكي [ 42 ] | نص عادي، HTML، PDF، DOC | أحمق | لا | نعم | أوتوماتيكي | نعم | نعم | جنوب أفريقيا | شرح الأسماء العلمية، شرح الأسماء الشائعة | التعلم الآلي | RDFa | مستقل عن المجال | الإنجليزية، الألمانية، الإسبانية، الفرنسية، البرتغالية، الإيطالية، الروسية |
| مكتشف الأشياء [ 43 ] | أي | الكيانات المسماة، والعلاقات، والأحداث | متعدد اللغات |
اكتشاف المعرفة
يُعرّف اكتشاف المعرفة بأنه عملية البحث التلقائي في كميات هائلة من البيانات عن أنماط يمكن اعتبارها معرفةً بالبيانات . [ 44 ] ويُشار إليه غالبًا باستخلاص المعرفة من البيانات المُدخلة. وقد نشأ اكتشاف المعرفة من مجال استخراج البيانات ، ويرتبط به ارتباطًا وثيقًا من حيث المنهجية والمصطلحات. [ 45 ]
يُعدّ اكتشاف المعرفة، المعروف أيضًا باكتشاف المعرفة في قواعد البيانات (KDD)، الفرع الأكثر شهرةً في مجال استخراج البيانات . وكما هو الحال في العديد من أشكال اكتشاف المعرفة الأخرى، يُنشئ هذا الفرع تجريدات لبيانات الإدخال. وقد تُصبح المعرفة المُكتسبة من خلال هذه العملية بيانات إضافية يُمكن استخدامها في مزيد من التطبيقات والاكتشافات. غالبًا ما تكون نتائج اكتشاف المعرفة غير قابلة للتنفيذ، لذا تهدف تقنيات مثل استخراج البيانات الموجه بالمجال [ 46 ] إلى اكتشاف وتقديم المعرفة والرؤى القابلة للتنفيذ.
يُعدّ اكتشاف المعرفة تطبيقًا واعدًا آخر في مجال تحديث البرمجيات ، واكتشاف نقاط الضعف، والامتثال، والذي يتضمن فهم مكونات البرمجيات الحالية. ترتبط هذه العملية بمفهوم الهندسة العكسية . عادةً ما تُعرض المعرفة المُستقاة من البرمجيات الحالية في شكل نماذج يُمكن إجراء استعلامات مُحددة عليها عند الحاجة. تُعدّ علاقة الكيانات صيغة شائعة لتمثيل المعرفة المُستقاة من البرمجيات الحالية. طوّرت مجموعة إدارة الكائنات (OMG) مواصفات نموذج اكتشاف المعرفة (KDM) الذي يُعرّف أنطولوجيا لأصول البرمجيات وعلاقاتها بهدف اكتشاف المعرفة في الشيفرة البرمجية الحالية. يرتبط اكتشاف المعرفة من أنظمة البرمجيات الحالية، والمعروف أيضًا باسم استخراج البرمجيات ، ارتباطًا وثيقًا باستخراج البيانات ، نظرًا لما تحتويه مكونات البرمجيات الحالية من قيمة هائلة لإدارة المخاطر والقيمة التجارية ، وهما عنصران أساسيان لتقييم وتطوير أنظمة البرمجيات. بدلًا من استخراج مجموعات البيانات الفردية ، يركز استخراج البرمجيات على البيانات الوصفية ، مثل تدفقات العمليات (مثل تدفقات البيانات، وتدفقات التحكم، وخرائط الاستدعاءات)، والبنية، ومخططات قواعد البيانات، وقواعد/شروط/عمليات العمل.
بيانات الإدخال
تنسيقات الإخراج
انظر أيضاً
للمزيد من القراءة
- شيكو، د؛ ماسيرولي، م (2016). "التنبؤ بأولويات الشروح الوظيفية للجينات وتحديد أولوياتها باستخدام علم الوجود" . مجلة IEEE /ACM للمعاملات في علم الأحياء الحاسوبي والمعلوماتية الحيوية . 13 (2): 248-260 . doi : 10.1109/TCBB.2015.2459694 . PMID 27045825. S2CID 2795344 .
مراجع
- ↑ مجموعة عمل RDB2RDF، الموقع الإلكتروني: http://www.w3.org/2001/sw/rdb2rdf/ ، الميثاق: http://www.w3.org/2009/08/rdb2rdf-charter ، R2RML: لغة ربط RDB بـ RDF: http://www.w3.org/TR/r2rml/
- ↑ مخرجات LOD2 EU 3.1.1: استخلاص المعرفة من المصادر المنظمة http://static.lod2.eu/Deliverables/deliverable-3.1.1.pdf مؤرشفة بتاريخ 27 أغسطس 2011 في Wayback Machine
- ↑ "الحياة في سحابة البيانات المترابطة" . www.opencalais.com. مؤرشف من الأصل بتاريخ ٢٤ نوفمبر ٢٠٠٩. تم الاطلاع عليه بتاريخ ١٠ نوفمبر ٢٠٠٩.
لدى ويكيبيديا نسخة مترابطة من البيانات تُسمى DBpedia. تحتوي DBpedia على نفس المعلومات المنظمة الموجودة في ويكيبيديا، ولكنها مترجمة إلى صيغة قابلة للقراءة آليًا.
- 1 2 تيم بيرنرز لي (1998)، "قواعد البيانات العلائقية على الويب الدلالي" . تم الاسترجاع: 20 فبراير 2011.
- ↑ هو وآخرون (2007)، "اكتشاف روابط بسيطة بين مخططات قواعد البيانات العلائقية والأنطولوجيات"، في وقائع المؤتمر الدولي السادس للويب الدلالي (ISWC 2007)، والمؤتمر الآسيوي الثاني للويب الدلالي (ASWC 2007)، سلسلة محاضرات علوم الحاسوب 4825، الصفحات 225-238، بوسان، كوريا، 11-15 نوفمبر 2007. http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.97.6934&rep=rep1&type=pdf
- ↑ ر. غاوي ون. كولوت (2007)، "توليد ربط قواعد البيانات بالأنطولوجيا لتحقيق التوافق الدلالي". في ورشة العمل الدولية الثالثة حول توافق قواعد البيانات (InterDB 2007). http://le2i.cnrs.fr/IMG/publications/InterDB07-Ghawi.pdf
- ↑ لي وآخرون (2005) "طريقة شبه آلية لاكتساب الأنطولوجيا للويب الدلالي"، WAIM، المجلد 3739 من سلسلة محاضرات في علوم الحاسوب، الصفحات 209-220. سبرينغر. doi : 10.1007/11563952_19
- ↑ تيرميزي وآخرون (2008)، "ترجمة تطبيقات SQL إلى الويب الدلالي"، سلسلة محاضرات في علوم الحاسوب، المجلد 5181/2008 (تطبيقات قواعد البيانات وأنظمة الخبراء). http://citeseer.ist.psu.edu/viewdoc/download;jsessionid=15E8AB2A37BD06DAE59255A1AC3095F0?doi=10.1.1.140.3169&rep=rep1&type=pdf
- ↑ فريد سرباح (2008). "تعلم المستودعات الدلالية عالية التنظيم من قواعد البيانات العلائقية"، الويب الدلالي: البحوث والتطبيقات، المجلد 5021 من سلسلة محاضرات في علوم الحاسوب، سبرينغر، برلين/هايدلبرغ. http://www.tao-project.eu/resources/publications/cerbah-learning-highly-structured-semantic-repositories-from-relational-databases.pdf مؤرشف بتاريخ 20 يوليو 2011 على موقع Wayback Machine
- 1 2 ويمالاسوريا، دايا سي؛ دو، ديجينغ (2010). "استخراج المعلومات القائم على الأنطولوجيا: مقدمة ومسح للمناهج الحالية"، مجلة علوم المعلومات ، 36(3)، ص 306-323، http://ix.cs.uoregon.edu/~dou/research/papers/jis09.pdf (تم الاطلاع عليه: 18.06.2012).
- ↑ "صيغة تبادل معالجة اللغة الطبيعية (NIF) 2.0 - نظرة عامة ووثائق" . persistence.uni-leipzig.org . تم الاطلاع عليه بتاريخ 2020-06-05 .
- ↑ هيلمان، سيباستيان؛ ليمان، ينس؛ أوير، سورين؛ برومر، مارتن (2013). "دمج معالجة اللغة الطبيعية باستخدام البيانات المرتبطة". في: علاني، حارث؛ كاجال، لالانا؛ فوكوي، أشيل؛ غروث، بول؛ بييمان، كريس؛ باريرا، جوزيان خافيير؛ أرويو، لورا؛ نوي، ناتاشا؛ ويلتي، كريس (محررون). الويب الدلالي - المؤتمر الدولي للويب الدلالي 2013. سلسلة محاضرات في علوم الحاسوب. المجلد 7908. برلين، هايدلبرغ: سبرينغر. الصفحات 98-113 . doi : 10.1007/978-3-642-41338-4_7 . ISBN 978-3-642-41338-4.
- ↑ فيرسبور، كارين ؛ ليفينغستون، كيفن (يوليو 2012). "نحو تكييف الشروح اللغوية مع صيغ الشروح الأكاديمية على الويب الدلالي" . وقائع ورشة العمل السادسة للشروح اللغوية . جيجو، جمهورية كوريا: جمعية اللغويات الحاسوبية: 75-84 .
- ↑ أكولي-ريبو/conll-rdf ، ACoLi، 27-05-2020 ، استرجاعها 2020-06-05
- ↑ تشياركوس، كريستيان؛ فاث، كريستيان (2017). "CoNLL-RDF: مجموعات بيانات مرتبطة بطريقة ملائمة لمعالجة اللغة الطبيعية" . في: غراسيا، خورخي؛ بوند، فرانسيس؛ مكراي، جون ب.؛ بويتيلار، بول؛ تشياركوس، كريستيان؛ هيلمان، سيباستيان (محررون). اللغة والبيانات والمعرفة . سلسلة محاضرات في علوم الحاسوب. المجلد 10318. تشام: دار نشر سبرينغر الدولية. الصفحات 74-88 . doi : 10.1007/978-3-319-59888-8_6 . ISBN 978-3-319-59888-8.
- ↑ فيرهاجن، مارك؛ سودرمان، كيث؛ وانغ، دي؛ إيدي، نانسي؛ شي، تشونكي؛ رايت، جوناثان؛ بوستيجوفسكي، جيمس (2016). "صيغة تبادل LAPPS" . في: موراكامي، يوهي؛ لين، دونغهوي (محرران). البنية التحتية العالمية لخدمات اللغات . سلسلة محاضرات في علوم الحاسوب. المجلد 9442. تشام: دار نشر سبرينغر الدولية. الصفحات 33-47 . doi : 10.1007/978-3-319-31468-6_3 . ISBN 978-3-319-31468-6.
- ↑ "شبكة تطبيقات اللغة | منصة خدمة ويب لتطوير وبحوث معالجة اللغة الطبيعية" . تم الاطلاع عليه بتاريخ 2020-06-05 .
- ↑ قارئ الأخبار/NAF ، قارئ الأخبار، 25 مايو 2020 ، تم الاطلاع عليه في 5 يونيو 2020
- ↑ فوسن، بيك؛ أغيري، رودريغو؛ ألدابي، إيتزيار؛ سيبولسكا، أغاتا؛ فان إرب، ماريكي؛ فوكينز، أنتسكي؛ لابارا، إيغويتز؛ مينارد، آن-ليز؛ بالميرو أبروسيو، أليسيو؛ ريغاو، جيرمان؛ روسبوشر، ماركو (15 أكتوبر 2016). "قارئ الأخبار: استخدام موارد المعرفة في آلة قراءة متعددة اللغات لتوليد المزيد من المعرفة من تدفقات ضخمة من الأخبار" . أنظمة قائمة على المعرفة . 110 : 60-85 . doi : 10.1016/j.knosys.2016.07.013 . hdl : 1871.1/cbc310a9-677c-42ce-a84b-c59ebb344cc3 . ISSN 0950-7051 .
- ↑ كونينغهام، هاميش (2005). "استخراج المعلومات، آليًا"، موسوعة اللغة واللسانيات ، 2، ص 665 - 677، http://gate.ac.uk/sale/ell2/ie/main.pdf (تم الاطلاع عليه: 18.06.2012).
- ↑ شيكو، د؛ ماسيرولي، م (2016). "التنبؤ بأولويات الشروح الوظيفية للجينات وتحديد أولوياتها باستخدام علم الوجود" . معاملات IEEE /ACM في علم الأحياء الحاسوبي والمعلوماتية الحيوية . 13 (2): 248-260 . doi : 10.1109/TCBB.2015.2459694 . PMID 27045825. S2CID 2795344 .
- ↑ إردمان، م.؛ مايدش، ألكسندر؛ شنور، هـ.-ب.؛ ستاب، ستيفن (2000). "من التعليق الدلالي اليدوي إلى شبه الآلي: حول أدوات التعليق النصي القائمة على الأنطولوجيا"، وقائع مؤتمر COLING ، http://www.ida.liu.se/ext/epa/cis/2001/002/paper.pdf (تم الاطلاع عليه بتاريخ 18/06/2012).
- ↑ راو، ديليب؛ ماكنامي، بول؛ دريدز، مارك (2011). "ربط الكيانات: إيجاد الكيانات المستخرجة في قاعدة المعرفة"، استخراج المعلومات وتلخيصها من مصادر متعددة ولغات متعددة ، http://www.cs.jhu.edu/~delip/entity-linking.pdf (تم الاطلاع عليه بتاريخ 18/06/2012).
- ↑ شركة روكيت سوفتوير (2012). "تقنية لاستخراج المعلومات من النصوص"، http://www.rocketsoftware.com/products/aerotext مؤرشف في 21-06-2013 في Wayback Machine (تم استرجاعه: 18-06-2012).
- ↑ Orchestr8 (2012): "نظرة عامة على AlchemyAPI"، http://www.alchemyapi.com/api مؤرشف في 2016-05-13 في Wayback Machine (تم استرجاعه: 18.06.2012).
- ↑ جامعة شيفيلد (2011). "ANNIE: نظام استخراج معلومات شبه جديد"، http://gate.ac.uk/sale/tao/splitch6.html#chap:annie (تم الاطلاع عليه بتاريخ: 18.06.2012).
- ↑ شبكة التميز ILP. "ASIUM (LRI)"، http://www-ai.ijs.si/~ilpnet2/systems/asium.html (تم الاطلاع عليه: 18.06.2012).
- ↑ Attensity (2012). "الاستخلاص الشامل"، http://www.attensity.com/products/technology/semantic-server/exhaustive-extraction/ مؤرشف بتاريخ 11-07-2012 في Wayback Machine (تم استرجاعه بتاريخ 18-06-2012).
- ↑ مينديز، بابلو ن.؛ جاكوب، ماكس؛ غارسيا سيلفا، أندريس؛ بيزر، كريستيان (2011). "DBpedia Spotlight: Shedding Light on the Web of Documents"، وقائع المؤتمر الدولي السابع حول الأنظمة الدلالية ، ص 1-8، http://www.wiwiss.fu-berlin.de/en/institute/pwo/bizer/research/publications/Mendes-Jakob-GarciaSilva-Bizer-DBpediaSpotlight-ISEM2011.pdf مؤرشف بتاريخ 5 أبريل 2012 في Wayback Machine (تم الاطلاع عليه بتاريخ 18 يونيو 2012).
- ^ جانجيمي ، ألدو. بريسوتي، فالنتينا؛ ريفورجياتو ريكوبيرو، دييغو؛ نوزوليز، أندريا جيوفاني؛ درايتشيو، فرانشيسكو؛ مونجيوفي، ميسيل (2016). "قراءة آلة الويب الدلالية باستخدام فريد"، مجلة الويب الدلالية ، دوى : 10.3233/SW-160240 ، http://www.semantic-web-journal.net/system/files/swj1379.pdf
- ↑ أدريان، بنيامين؛ ماوس، هيكو؛ دينجل، أندرياس (2009). "iDocument: استخدام الأنطولوجيات لاستخراج المعلومات من النصوص"، http://www.dfki.uni-kl.de/~maus/dok/AdrianMausDengel09.pdf (تم الاطلاع عليه بتاريخ: 18/06/2012).
- ↑ شركة SRA الدولية (2012). "مستخرج NetOwl"، http://www.sra.com/netowl/entity-extraction/ مؤرشف بتاريخ 24-09-2012 في Wayback Machine (تم استرجاعه بتاريخ 18-06-2012).
- ↑ فورتونا، بلاز؛ جروبيلنيك، ماركو؛ ملادينيتش، دونيا (2007). "OntoGen: محرر أنطولوجي شبه آلي"، وقائع مؤتمر 2007 حول واجهة الإنسان، الجزء 2 ، ص 309-318، http://analytics.ijs.si/~blazf/papers/OntoGen2_HCII2007.pdf مؤرشف في 18 سبتمبر 2013 على موقع Wayback Machine (تم الاطلاع عليه بتاريخ 18 يونيو 2012).
- ↑ ميسيكوف، ميشيل؛ نافيلي، روبرتو؛ فيلاردي، باولا (2002). "نهج متكامل لتعلم وهندسة أنطولوجيا الويب"، مجلة الكمبيوتر ، 35(11)، ص 60-63، http://wwwusers.di.uniroma1.it/~velardi/IEEE_C.pdf مؤرشف في 19-05-2017 على موقع Wayback Machine (تم استرجاعه في 18-06-2012).
- ↑ ماكدويل، لوك ك.؛ كافاريلا، مايكل (2006). "استخراج المعلومات المدفوع بالأنطولوجيا باستخدام OntoSyphon"، وقائع المؤتمر الدولي الخامس حول الويب الدلالي ، ص 428-444، http://turing.cs.washington.edu/papers/iswc2006McDowell-final.pdf (تم الاطلاع عليه: 18.06.2012).
- ↑ يلدز، بورجو؛ ميكش، سيلفيا (2007). "ontoX - طريقة لاستخراج المعلومات القائمة على الأنطولوجيا"، وقائع المؤتمر الدولي لعام 2007 حول العلوم الحاسوبية وتطبيقاتها ، 3، ص 660-673، http://publik.tuwien.ac.at/files/pub-inf_4769.pdf مؤرشف في 2017-07-05 على Wayback Machine (تم استرجاعه: 18.06.2012).
- ↑ semanticweb.org (2011). "PoolParty Extractor"، http://semanticweb.org/wiki/PoolParty_Extractor مؤرشف بتاريخ 2016-03-04 في Wayback Machine (تم استرجاعه: 18.06.2012).
- ↑ ديل، ستيفن؛ إيرون، نداف؛ جيبسون، ديفيد؛ جروهل، دانيال؛ جوها، ر.؛ جينجران، أنانت؛ كانونجو، تاباس؛ راجاغوبالان، سريدهار؛ تومكينز، أندرو؛ توملين، جون أ.؛ زين، جيسون ي. (2003). "SemTag و Seeker: بناء الويب الدلالي عبر الشرح الدلالي الآلي"، وقائع المؤتمر الدولي الثاني عشر حول شبكة الويب العالمية ، ص 178-186، http://www2003.org/cdrom/papers/refereed/p831/p831-dill.html (تم الاطلاع عليه بتاريخ 18/06/2012).
- ↑ أورين، فيكتوريا؛ سيميانو، فيليب؛ إيريا، خوسيه؛ هاندشوه، سيغفريد؛ فارغاس-فيرا، ماريا؛ موتا، إنريكو؛ سيرافينيا، فابيو (2006). "التعليق الدلالي لإدارة المعرفة: المتطلبات ومسح لأحدث التقنيات"، دلالات الويب: العلوم والخدمات والوكلاء على شبكة الويب العالمية ، 4(1)، ص 14-28، http://staffwww.dcs.shef.ac.uk/people/J.Iria/iria_jws06.pdf ، (تم الاطلاع عليه بتاريخ 18/06/2012).
- ↑ سيميانو، فيليب؛ فولكر، جوهانا (2005). "Text2Onto - إطار عمل لتعلم الأنطولوجيا واكتشاف التغيير القائم على البيانات"، وقائع المؤتمر الدولي العاشر لتطبيقات اللغة الطبيعية على نظم المعلومات ، 3513، ص 227-238، http://www.cimiano.de/Publications/2005/nldb05/nldb05.pdf (تم الاطلاع عليه: 18.06.2012).
- ↑ مايدش، ألكسندر؛ فولز، رافائيل (2001). "إطار استخراج وصيانة الأنطولوجيا Text-To-Onto"، وقائع المؤتمر الدولي لهندسة البيانات التابع لمعهد مهندسي الكهرباء والإلكترونيات ، http://users.csc.calpoly.edu/~fkurfess/Events/DM-KM-01/Volz.pdf (تم الاطلاع عليه بتاريخ 18/06/2012).
- ↑ ربط الآلات. "نتصل بسحابة البيانات المفتوحة المرتبطة"، http://thewikimachine.fbk.eu/html/index.html مؤرشف في 19-07-2012 في Wayback Machine (تم استرجاعه: 18-06-2012).
- ↑ أنظمة Inxight الفيدرالية (2008). "Inxight ThingFinder و ThingFinder Professional"، http://inxightfedsys.com/products/sdks/tf/ مؤرشف بتاريخ 29-06-2012 في Wayback Machine (تم استرجاعه بتاريخ 18-06-2012).
- ↑ فراولي ويليام ف. وآخرون (1992)، "اكتشاف المعرفة في قواعد البيانات: نظرة عامة"، مجلة الذكاء الاصطناعي (المجلد 13، العدد 3)، 57-70 (النسخة الكاملة على الإنترنت: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1011 مؤرشفة في 2016-03-04 على Wayback Machine )
- ↑ فياض وآخرون (1996)، "من استخراج البيانات إلى اكتشاف المعرفة في قواعد البيانات"، مجلة الذكاء الاصطناعي (المجلد 17، العدد 3)، 37-54 (النسخة الكاملة متاحة على الإنترنت: http://www.aaai.org/ojs/index.php/aimagazine/article/viewArticle/1230 ، مؤرشفة بتاريخ 4 مايو 2016 في أرشيف الإنترنت Wayback Machine).
- ↑ كاو، ل. (2010). "استخراج البيانات الموجه بالمجال: التحديات والآفاق". معاملات IEEE في هندسة المعرفة والبيانات . 22 (6): 755-769 . CiteSeerX 10.1.1.190.8427 . doi : 10.1109/tkde.2010.32 . S2CID 17904603 .
- اقتصاد المعرفة
- نقل المعرفة
- اقتصاد المعلومات
- معالجة اللغة الطبيعية
