التنقيب المفاهيمي

يُعدّ استخراج المفاهيم نشاطًا يُسفر عن استخلاص المفاهيم من الوثائق . وتتضمن حلول هذه المهمة عادةً جوانب من الذكاء الاصطناعي والإحصاء ، مثل استخراج البيانات واستخراج النصوص . [ 1 ] [ 2 ] ولأنّ الوثائق عادةً ما تكون عبارة عن سلسلة غير مُهيكلة من الكلمات والرموز الأخرى (بدلاً من المفاهيم)، فإنّ المشكلة ليست بسيطة ، ولكنها قد تُقدّم رؤى قيّمة حول معنى الوثائق ومصدرها وتشابهها.

طُرق

تقليديًا، يتم تحويل الكلمات إلى مفاهيم باستخدام قاموس المرادفات [ 3 ] ، وفي التقنيات الحاسوبية، يُلاحظ الاتجاه نفسه. تُصمم قواميس المرادفات إما خصيصًا لهذه المهمة، أو تعتمد على نموذج لغوي موجود مسبقًا، يرتبط عادةً بشبكة WordNet التابعة لجامعة برينستون .

غالباً ما تكون دلالات الكلمات على المفاهيم [ 4 ] غامضة . ففي العادة، ترتبط كل كلمة في لغة معينة بعدة مفاهيم محتملة. ويستخدم البشر السياق لتوضيح المعاني المختلفة لنص معين، حيث تعجز أنظمة الترجمة الآلية المتاحة عن استنتاج السياق بسهولة.

أما لأغراض استخراج المفاهيم، فإن هذه الغموضات تميل إلى أن تكون أقل أهمية مما هي عليه في الترجمة الآلية، لأنه في المستندات الكبيرة تميل الغموضات إلى أن تتلاشى، كما هو الحال مع استخراج النصوص.

توجد العديد من التقنيات المستخدمة لإزالة الغموض . ومن الأمثلة على ذلك التحليل اللغوي للنص، واستخدام معلومات تردد ارتباط الكلمات والمفاهيم التي يمكن استنتاجها من مجموعات نصوص ضخمة. ومؤخراً، ظهرت تقنيات تعتمد على التشابه الدلالي بين المفاهيم المحتملة والسياق، وحظيت باهتمام الأوساط العلمية.

التطبيقات

اكتشاف وفهرسة المستندات المتشابهة في مجموعات كبيرة من النصوص

من النتائج المترتبة على حساب إحصائيات الوثائق في مجال المفاهيم، بدلاً من مجال الكلمات، أن المفاهيم تُشكّل هياكل شجرية طبيعية تستند إلى التضمين والتجزئة . يمكن استخدام هذه الهياكل لتوليد إحصائيات عضوية شجرية بسيطة، تُستخدم لتحديد موقع أي وثيقة في فضاء مفاهيمي إقليدي . إذا أُخذ حجم الوثيقة في الاعتبار كبعد إضافي لهذا الفضاء، يُمكن إنشاء نظام فهرسة فائق الكفاءة. تُستخدم هذه التقنية حاليًا تجاريًا لتحديد مواقع الوثائق القانونية المتشابهة في مجموعة بيانات تضم 2.5 مليون وثيقة.

تجميع المستندات حسب الموضوع

يمكن استخدام تقنيات التجميع الرقمي القياسية في "فضاء المفاهيم" كما هو موضح أعلاه لتحديد مواقع المستندات وفهرستها وفقًا للموضوع المستنتج. وتُعد هذه التقنيات أكثر كفاءةً من الناحية العددية من تقنيات استخراج النصوص ، كما أنها تميل إلى أن تكون أكثر سهولةً في الفهم، حيث إنها تتوافق بشكل أفضل مع مقاييس التشابه التي قد يُنشئها الإنسان.

انظر أيضاً

مراجع

  1. يوين-هسين تسينغ، تشون-ين تشانغ، شو-نو تشانغ راندغرين، وكارل-يوهان راندغرين، " استخراج خرائط المفاهيم من الأخبار لقياس الثقافة العلمية المدنية في وسائل الإعلام "", Computers and Education, Vol. 55, No. 1, August 2010, pp. 165-177.
  2. لي، كيكيان؛ تشا، هان وين؛ سو، يو؛ يان، شيفنغ (نوفمبر 2018). "استخراج المفاهيم عبر التضمين" . المؤتمر الدولي لهندسة الكهرباء والإلكترونيات (IEEE) لعام 2018 حول استخراج البيانات (ICDM) . IEEE. الصفحات 267-276 . doi : 10.1109/icdm.2018.00042 . ISBN  978-1-5386-9159-5. S2CID 52841398 . 
  3. Yuen-Hsien Tseng, " Automatic Thesaurus Generation for Chinese Documents ", Journal of the American Society for Information Science and Technology, Vol. 53, No. 13, Nov. 2002, pp. 1130-1138.
  4. Yuen-Hsien Tseng, " Generic Title Labeling for Clustered Documents ", Expert Systems With Applications, Vol. 37, No. 3, 15 March 2010, pp. 2247-2254 .