وورد نت

WordNet هي قاعدة بيانات معجمية للعلاقات الدلالية بين الكلمات، تربط الكلمات بعلاقات دلالية تشمل المرادفات ، والكلمات ذات المعنى الأعمق ، والكلمات ذات المعنى الجزئي . تُجمع المرادفات في مجموعات مرادفة مع تعريفات موجزة وأمثلة استخدام. يمكن اعتبارها بذلك مزيجًا وامتدادًا للقاموس والمعجم . يُستخدم WordNet بشكل أساسي في تحليل النصوص الآلي وتطبيقات الذكاء الاصطناعي . أُنشئت WordNet لأول مرة باللغة الإنجليزية [ 2 ] ، وقد تم إصدار قاعدة بيانات WordNet الإنجليزية وأدواتها البرمجية بموجب ترخيص مشابه لترخيص BSD ، وهي متاحة للتنزيل مجانًا. صدر آخر إصدار رسمي من جامعة برينستون عام 2011. لا تخطط برينستون حاليًا لإصدار أي نسخ جديدة بسبب مشاكل تتعلق بالموظفين والتمويل [ 3 ] . لا تزال الإصدارات الجديدة تُصدر سنويًا عبر موقع Open English WordNet الإلكتروني. حتى عام 2024 تقريبًا، كانت هناك نسخة متاحة عبر الإنترنت من خلال wordnet.princeton.edu. تم إيقاف دعم تلك النسخة من WordNet، ولكن تتوفر نسخة جديدة عبر الإنترنت على en-word.net. توجد الآن شبكات الكلمات بأكثر من 200 لغة. [ 4 ]

التاريخ وأعضاء الفريق

أُنشئت شبكة WordNet لأول مرة عام 1985، باللغة الإنجليزية فقط، في مختبر العلوم المعرفية بجامعة برينستون تحت إشراف أستاذ علم النفس جورج أرميتاج ميلر . ثم تولت إدارتها لاحقًا كريستيان فيلباوم . مُوِّل المشروع في البداية من قِبَل مكتب البحوث البحرية الأمريكي، ثم لاحقًا من قِبَل وكالات حكومية أمريكية أخرى، بما في ذلك وكالة مشاريع البحوث الدفاعية المتقدمة (DARPA) ، والمؤسسة الوطنية للعلوم ، ومكتب التقنيات الثورية (الذي كان يُعرف سابقًا باسم نشاط البحث والتطوير المتقدم)، ومنظمة REFLEX. حصل جورج ميلر وكريستيان فيلباوم على جائزة أنطونيو زامبولي لعام 2006 تقديرًا لجهودهما في تطوير WordNet.

رابطة ووردنت العالمية هي منظمة غير ربحية توفر منصة لمناقشة ومشاركة وربط شبكات ووردنت لجميع لغات العالم. كريستيان فيلباوم وبيك ث. ج. م. فوسن هما الرئيسان المشاركان لها. [ 5 ]

محتويات قاعدة البيانات

مثال على إدخال "هامبرغر" في WordNet

تحتوي قاعدة البيانات على 155327 كلمة منظمة في 175979 مجموعة مرادفات ، بإجمالي 207016 زوجًا من الكلمات والمعاني؛ ويبلغ حجمها في شكل مضغوط حوالي 12 ميجابايت . [ 3 ]

وهي تشمل الفئات المعجمية الأسماء والأفعال والصفات والظروف ، لكنها تتجاهل حروف الجر وأدوات التعريف والكلمات الوظيفية الأخرى .

تُجمّع الكلمات من نفس الفئة المعجمية، والتي تُعتبر مترادفة تقريبًا، في مجموعات مرادفة ، تشمل الكلمات البسيطة بالإضافة إلى تراكيب لغوية مثل "تناول الطعام بالخارج" و"مشاركة السيارة". تُخصص المعاني المختلفة للكلمة متعددة المعاني لمجموعات مرادفة مختلفة. يُوضّح معنى المجموعة المرادفة بشرح تعريفي موجز ومثال أو أكثر على استخدامها. مثال على مجموعة مرادفات للصفات:

جيد، مناسب، ناضج – (الأكثر ملاءمة أو مناسب لغرض معين؛ "وقت مناسب لزراعة الطماطم"؛ "الوقت المناسب للتحرك"؛ "حان الوقت لإجراء تغييرات اجتماعية كبيرة").

ترتبط جميع المجموعات المترادفة من خلال علاقات دلالية. وتشمل هذه العلاقات، التي لا تشترك فيها جميع الفئات المعجمية، ما يلي:

  • الأسماء
    • الاسم العام : يُعتبر Y اسمًا عامًا لـ X إذا كان كل X نوعًا من Y ( الكلب اسم عام للكلب )
    • الاسم الضمني : يُعتبر Y اسمًا ضمنيًا لـ X إذا كان كل Y نوعًا من X ( الكلب اسم ضمني لـ الكلبية )
    • المصطلح المنسق : يكون Y مصطلحًا منسقًا لـ X إذا كان X و Y يشتركان في اسم عام ( الذئب مصطلح منسق للكلب ، والكلب مصطلح منسق للذئب ).
    • الكلّية : يكون Y كلًّاية لـ X إذا كان X جزءًا من Y ( المبنى كلًّاية للنافذة ) .
    • الجزء المشتق : يُعتبر Y جزءًا مشتقًا من X إذا كان Y جزءًا من X ( النافذة جزء مشتق من المبنى ).
  • الأفعال
    • الاسم العام : الفعل Y هو اسم عام للفعل X إذا كان النشاط X نوعًا من Y ( الإدراك اسم عام للاستماع )
    • المَتَوَصِّل : الفعل Y هو مَتَوَصِّل للفعل X إذا كان النشاط Y يقوم بـ X بطريقة ما ( التلعثم هو مَتَوَصِّل للتحدث ).
    • الاستلزام : الفعل Y يستلزم الفعل X إذا كان القيام بـ X يستلزم القيام بـ Y ( النوم يستلزم الشخير ).
    • المصطلح المنسق : الفعل Y هو مصطلح منسق للفعل X إذا كان X و Y يشتركان في كلمة عامة ( التأتأة مصطلح منسق للصراخ ، والصراخ مصطلح منسق للتأتأة ).

تنطبق هذه العلاقات الدلالية على جميع أعضاء المجموعات المترادفة المرتبطة. ويمكن أيضًا ربط أعضاء المجموعات المترادفة (الكلمات) بعلاقات معجمية. على سبيل المثال، يرتبط (أحد معاني) الاسم "director" (مخرج) (أحد معاني) الفعل "direct" (يوجه) الذي اشتُق منه عبر رابط "صرفي دلالي".

تحاول وظائف الصرف في البرنامج الموزع مع قاعدة البيانات استنتاج الجذر اللغوي للكلمة من مدخلات المستخدم. تُخزَّن الصيغ الشاذة في قائمة، فعلى سبيل المثال، البحث عن كلمة "ate" سيعيد "eat " .

بنية المعرفة

تُصنَّف الأسماء والأفعال في تسلسلات هرمية، تُحدَّد بعلاقات التضمين أو علاقات "هو نوع من" . على سبيل المثال، يوجد أحد معاني كلمة "كلب" وفقًا لتسلسل التضمين؛ وتمثل الكلمات في المستوى نفسه أعضاءً في مجموعة المرادفات. ولكل مجموعة من المرادفات فهرس فريد.

  • كلب، كلب منزلي، كانيس فاميلياريس
    • كلبيّ، كلبيّ
      • آكل اللحوم
        • مشيمي، ثدييات مشيمية، ثدييات حقيقية، ثدييات حقيقية
          • الثدييات
            • الفقاريات، الجمجمة
              • الحبليات
                • حيوان، كائن حي، وحش، حيوان ضخم، مخلوق، حيوانات
                  • ...

على المستوى الأعلى، تُنظَّم هذه التسلسلات الهرمية في 25 "شجرة" للمبتدئين للأسماء و15 للأفعال (تُسمى ملفات معجمية على مستوى الصيانة). وترتبط جميعها بمجموعة مرادفات فريدة للمبتدئين، تُسمى "الكيان". وتكون التسلسلات الهرمية للأسماء أعمق بكثير من التسلسلات الهرمية للأفعال.

لا تُنظَّم الصفات في هياكل هرمية. بل يُشكِّل قطبان ثنائيان متضادان "مركزيان" مثل "ساخن" و"بارد"، بينما ترتبط المرادفات "التابعة" مثل "مُبخِّر" و"بارد" بقطبيهما عبر علاقة "تشابه". ويمكن تصوُّر الصفات بهذه الطريقة على أنها "أثقال" وليست "أشجارًا".

الجوانب النفسية اللغوية

كان الهدف الأولي لمشروع WordNet هو بناء قاعدة بيانات معجمية تتوافق مع نظريات الذاكرة الدلالية البشرية التي طُوّرت في أواخر الستينيات. أشارت التجارب النفسية إلى أن المتحدثين ينظمون معرفتهم بالمفاهيم بطريقة اقتصادية وهرمية. بدا أن وقت الاسترجاع اللازم للوصول إلى المعرفة المفاهيمية مرتبط ارتباطًا مباشرًا بعدد المستويات الهرمية التي يحتاج المتحدث إلى "اجتيازها" للوصول إلى تلك المعرفة. وهكذا، يستطيع المتحدثون التحقق بسرعة أكبر من قدرة طيور الكناري على التغريد لأنها من الطيور المغردة، لكنهم يحتاجون إلى وقت أطول قليلًا للتحقق من قدرتها على الطيران (حيث يتعين عليهم الوصول إلى مفهوم "طائر" على المستوى الأعلى)، ووقتًا أطول للتحقق من امتلاكها جلدًا (مما يتطلب البحث عبر مستويات متعددة من التضمين، وصولًا إلى "حيوان"). [ 6 ] مع أن هذه التجارب اللغوية النفسية والنظريات الكامنة وراءها قد تعرضت للنقد، إلا أن بعض جوانب تنظيم WordNet تتوافق مع الأدلة التجريبية. على سبيل المثال، يؤثر فقدان القدرة على تسمية الأشياء بشكل انتقائي على قدرة المتحدثين على إنتاج كلمات من فئة دلالية محددة، وهي تسلسل هرمي في شبكة الكلمات. وقد وُجد أن الصفات المتضادة (الصفات المركزية في شبكة الكلمات ضمن بنية الدمبل) تتكرر معًا بشكل أكثر بكثير من الصدفة، وهي حقيقة وُجد أنها تنطبق على العديد من اللغات.

كعلم وجودي معجمي

يُطلق على WordNet أحيانًا اسم "أنطولوجيا"، وهو ادعاء شائع لم يُقدمه مُنشئوها. يُمكن تفسير علاقات التضمين/التفصيل بين مجموعات المرادفات الاسمية على أنها علاقات تخصص بين الفئات المفاهيمية. بعبارة أخرى، يُمكن تفسير WordNet واستخدامه كأنطولوجيا معجمية بالمعنى العلمي . مع ذلك، ينبغي تصحيح هذه الأنطولوجيا قبل استخدامها، لاحتوائها على مئات من التناقضات الدلالية الأساسية؛ على سبيل المثال، هناك: (أ) تخصصات مشتركة لفئات حصرية، و(ب) تكرارات في التسلسل الهرمي للتخصصات. علاوة على ذلك، يتطلب تحويل WordNet إلى أنطولوجيا معجمية قابلة للاستخدام في تمثيل المعرفة عادةً: (أ)  تمييز علاقات التخصص إلى علاقات " نوع فرعي من" و "مثال من "، و(ب)  ربط مُعرّفات فريدة بديهية بكل فئة. على الرغم من أن هذه التصحيحات والتحويلات قد تم إجراؤها وتوثيقها كجزء من دمج WordNet  1.7 في قاعدة المعرفة القابلة للتحديث بشكل تعاوني لـ WebKB-2، [ 7 ] فإن معظم المشاريع التي تدعي إعادة استخدام WordNet للتطبيقات القائمة على المعرفة (عادةً، استرجاع المعلومات الموجهة نحو المعرفة) تعيد استخدامه مباشرة.

تم تحويل WordNet أيضًا إلى مواصفات رسمية، من خلال منهجية هجينة من أسفل إلى أعلى ومن أعلى إلى أسفل لاستخراج علاقات الارتباط منها تلقائيًا وتفسير هذه الارتباطات من حيث مجموعة من العلاقات المفاهيمية، المحددة رسميًا في علم الوجود التأسيسي DOLCE . [ 8 ]

في معظم الأعمال التي تدّعي دمج WordNet في الأنطولوجيات، لم يقتصر الأمر على تصحيح محتوى WordNet عند الضرورة، بل أُعيد تفسيره وتحديثه بشكل جذري كلما كان ذلك مناسبًا. وقد تجلّى ذلك، على سبيل المثال، عند إعادة هيكلة الأنطولوجيا العليا لـ WordNet [ 9 ] وفقًا لمنهجية OntoClean ، أو عند استخدامها كمصدر أساسي لبناء الفئات الدنيا لأنطولوجيا SENSUS.

القيود

أكثر القيود شيوعًا في WordNet (والموارد المشابهة مثل ImageNet ) هو أن بعض العلاقات الدلالية أنسب للمفاهيم الملموسة منها للمفاهيم المجردة. [ 10 ] على سبيل المثال، من السهل إنشاء علاقات بين المصطلحات الفرعية والمصطلحات العامة لتوضيح أن " الصنوبر " نوع من " الشجرة "، و"الشجرة" نوع من " النبات "، و"النبات" نوع من " الكائن الحي "، لكن من الصعب تصنيف المشاعر مثل "الخوف" أو "السعادة" ضمن علاقات بين المصطلحات الفرعية والمصطلحات العامة بنفس الدقة والوضوح.

تُعدّ العديد من المفاهيم في WordNet خاصة بلغاتٍ مُحدّدة، وأعلى نسبة دقة مُسجّلة للربط بين اللغات هي 94%. [ 11 ] تظهر المرادفات، والمصطلحات الفرعية، والمصطلحات الجزئية، والمتضادات في جميع اللغات التي لديها WordNet حتى الآن، لكن العلاقات الدلالية الأخرى خاصة بكل لغة. [ 12 ] هذا يُحدّ من إمكانية التشغيل البيني بين اللغات. مع ذلك، يجعل هذا WordNet مصدرًا قيّمًا لتسليط الضوء على الاختلافات بين اللغات ودراستها، لذا لا يُشكّل هذا بالضرورة قيدًا على جميع حالات الاستخدام.

لا تتضمن قاعدة بيانات WordNet معلومات عن أصل الكلمات أو نطقها، كما أنها تحتوي على معلومات محدودة فقط حول استخدامها. وتهدف WordNet إلى تغطية معظم الكلمات الشائعة الاستخدام، ولا تتضمن الكثير من المصطلحات المتخصصة.

يُعدّ WordNet المعجم الحاسوبي الأكثر استخدامًا للغة الإنجليزية في تحديد معاني الكلمات (WSD)، وهي مهمة تهدف إلى إسناد المعاني المناسبة للسياق (أي أعضاء مجموعات المرادفات) للكلمات في النص. [ 13 ] ومع ذلك، يُقال إن WordNet يُشفّر الفروق الدلالية بدقة متناهية. هذه المشكلة تمنع أنظمة تحديد معاني الكلمات من تحقيق مستوى أداء يُضاهي أداء البشر، الذين لا يتفقون دائمًا عند مواجهة مهمة اختيار معنى من قاموس يُطابق كلمة في سياق معين. وقد تمّت معالجة مشكلة الدقة هذه من خلال اقتراح أساليب تجميع تُجمّع تلقائيًا المعاني المتشابهة للكلمة نفسها. [ 14 ] [ 15 ] [ 16 ]

محتوى مسيء

تتضمن قاعدة بيانات WordNet كلمات قد تُعتبر مهينة أو مسيئة. [ 17 ] قد يتغير تفسير الكلمة بمرور الوقت وبين المجموعات الاجتماعية ، لذا لا يُمكن لـ WordNet دائمًا تعريف كلمة ما بأنها " مهينة " أو "مسيئة" بمعزل عن سياقها. لذلك، يجب على مستخدمي WordNet تطبيق أساليبهم الخاصة لتحديد الكلمات المسيئة أو المهينة.

مع ذلك، ينطبق هذا القيد على مصادر معجمية أخرى كالقواميس والمعاجم ، التي تحتوي أيضاً على كلمات مهينة ومسيئة. تشير بعض القواميس إلى الكلمات المهينة ، لكنها لا تشمل جميع السياقات التي قد تكون فيها الكلمات مقبولة أو مسيئة لمختلف الفئات الاجتماعية. لذا، يتعين على مستخدمي القواميس استخدام أساليبهم الخاصة لتحديد جميع الكلمات المسيئة.

شبكات الكلمات المرخصة مقابل شبكات الكلمات المفتوحة

تم إنشاء بعض شبكات الكلمات لاحقًا للغات أخرى. وقد أدرج مسحٌ أُجري عام 2012 شبكات الكلمات ومدى توافرها. [ 18 ] وفي محاولةٍ لنشر استخدام شبكات الكلمات، دأب مجتمع شبكة الكلمات العالمية على إعادة ترخيص شبكات كلماته تدريجيًا إلى نطاق مفتوح ، حيث يمكن للباحثين والمطورين الوصول بسهولة إلى شبكات الكلمات واستخدامها كموارد لغوية لتوفير المعرفة الأنطولوجية والمعجمية في مهام معالجة اللغة الطبيعية .

توفر شبكة الكلمات متعددة اللغات المفتوحة [ 19 ] إمكانية الوصول إلى شبكات كلمات مرخصة بترخيص مفتوح بلغات متعددة. يرتبط الإصدار الأول بشبكة كلمات برينستون للغة الإنجليزية، بينما يستخدم الإصدار الثاني فهرسًا مستقلاً (الفهرس التعاوني متعدد اللغات). [ 19 ] والهدف هو تسهيل استخدام شبكات الكلمات بلغات متعددة.

التطبيقات

تم استخدام WordNet لعدد من الأغراض في أنظمة المعلومات، بما في ذلك إزالة الغموض عن معاني الكلمات ، واسترجاع المعلومات ، والتصنيف التلقائي للنصوص ، والتلخيص التلقائي للنصوص ، والترجمة الآلية ، وحتى توليد ألغاز الكلمات المتقاطعة التلقائي.

يُستخدم WordNet بشكل شائع لتحديد مدى تشابه الكلمات. وقد طُرحت خوارزميات متنوعة، منها قياس المسافة بين الكلمات ومجموعات المرادفات في بنية WordNet البيانية، وذلك عن طريق عدّ عدد الروابط بين مجموعات المرادفات. وتقوم الفكرة على أنه كلما تقاربت كلمتان أو مجموعتا مرادفات، تقارب معناهما. وقد طُبّق عدد من خوارزميات تشابه الكلمات القائمة على WordNet في حزمة Perl تُسمى WordNet::Similarity، [ 20 ] وفي حزمة Python تُسمى NLTK . [ 21 ] وتشمل تقنيات التشابه الأكثر تطورًا القائمة على WordNet تقنية ADW، [ 22 ] والتي يتوفر تطبيقها بلغة Java . كما يُمكن استخدام WordNet لربط المفردات الأخرى. [ 23 ]

واجهات

تحتفظ جامعة برينستون بقائمة من المشاريع ذات الصلة [ 24 ] والتي تتضمن روابط لبعض واجهات برمجة التطبيقات المستخدمة على نطاق واسع والمتاحة للوصول إلى WordNet باستخدام لغات البرمجة والبيئات المختلفة.

ترتبط شبكة WordNet بالعديد من قواعد بيانات الويب الدلالي . كما يُعاد استخدام WordNet بشكل شائع عبر عمليات الربط بين مجموعات المرادفات في WordNet وفئات الأنطولوجيات. وفي أغلب الأحيان، يتم ربط فئات المستوى الأعلى فقط في WordNet.

رابطة شبكة الكلمات العالمية

رابطة شبكات الكلمات العالمية (GWA) [ 25 ] هي منظمة عامة غير ربحية توفر منصة لمناقشة شبكات الكلمات ومشاركتها وربطها بجميع لغات العالم. كما تشجع الرابطة على توحيد معايير شبكات الكلمات بين اللغات، لضمان اتساقها في حصر مجموعات المرادفات في اللغات البشرية. وتحتفظ الرابطة بقائمة بشبكات الكلمات المطورة حول العالم. [ 26 ]

لغات أخرى

  • ورد نت عربي : [ 27 ] [ 28 ] ورد نت للغة العربية .
  • علم الوجود العربي ، وهو علم وجود لغوي له نفس بنية شبكة الكلمات، ويتم ربطه بها.
  • أنتج مشروع BalkaNet [ 29 ] شبكات WordNet لست لغات أوروبية (البلغارية، والتشيكية، واليونانية، والرومانية، والتركية، والصربية). ولأجل هذا المشروع، طُوّر محرر WordNet مجاني قائم على لغة XML. هذا المحرر، VisDic، لم يعد قيد التطوير النشط، ولكنه لا يزال يُستخدم لإنشاء شبكات WordNet متنوعة. أما خليفته، DEBVisDic، فهو تطبيق يعمل بنظام العميل والخادم، ويُستخدم حاليًا لتحرير العديد من شبكات WordNet (الهولندية في مشروع Cornetto، والبولندية، والمجرية، والعديد من اللغات الأفريقية، والصينية).
  • BulNet هي نسخة بلغارية من WordNet تم تطويرها في قسم اللغويات الحاسوبية التابع لمعهد اللغة البلغارية ، الأكاديمية البلغارية للعلوم. [ 30 ]
  • CWN (Wordnet الصينية أو 中文詞彙網路) مدعومة من جامعة تايوان الوطنية . [ 31 ]
  • أنتج مشروع يورو وورد نت [ 32 ] شبكات كلمات لعدة لغات أوروبية وربطها ببعضها؛ إلا أنها غير متاحة مجانًا. ويسعى مشروع غلوبال وورد نت إلى تنسيق إنتاج وربط شبكات الكلمات لجميع اللغات. [ 33 ] وقد أعلنت مطبعة جامعة أكسفورد ، ناشرة قاموس أكسفورد الإنجليزي ، عن خططها لإنتاج منصة إلكترونية منافسة لـ وورد نت.
  • FinnWordNet هي نسخة فنلندية من WordNet حيث تمت ترجمة جميع مدخلات WordNet الإنجليزية الأصلية. [ 34 ]
  • GermaNet هي نسخة ألمانية من WordNet طورتها جامعة توبنغن. [ 35 ]
  • IndoWordNet [ 36 ] عبارة عن قاعدة معرفية معجمية مرتبطة بشبكات الكلمات لـ 18 لغة مجدولة في الهند، وهي: الأسامية ، البنغالية ، البودو ، الغوجاراتية ، الهندية ، الكانادية ، الكشميرية ، الكونكانية ، المالايالامية ، الميتية ( مانيبوري)، الماراثية ، النيبالية ، الأوديا ، البنجابية ، السنسكريتية ، التاميلية ، التيلجو و الأردية .
  • JAWS (مجموعة فرعية أخرى من WordNet)، وهي نسخة فرنسية أخرى من WordNet [ 37 ] تم بناؤها باستخدام Wiktionary والمساحات الدلالية
  • WordNet Bahasa : WordNet للغة الملايو والإندونيسية، تم تطويره بواسطة جامعة نانيانغ للتكنولوجيا .
  • شبكة الكلمات المالايالامية ، التي طورتها جامعة كوشين للعلوم والتكنولوجيا . [ 38 ]
  • يدمج المستودع المركزي متعدد اللغات (MCR) في نفس إطار عمل EuroWordNet شبكات الكلمات من الإسبانية والكتالونية والباسكية والجاليكية والبرتغالية المرتبطة باللغة الإنجليزية. [ 39 ]
  • مشروع MultiWordNet، [ 40 ] عبارة عن شبكة كلمات متعددة اللغات تهدف إلى إنتاج شبكة كلمات إيطالية متوافقة بشكل كبير مع شبكة كلمات برينستون.
  • OpenDutchWordNet، [ 41 ] هي قاعدة بيانات دلالية معجمية هولندية.
  • OpenWN-PT هي نسخة برازيلية برتغالية من WordNet الأصلية متاحة للتنزيل مجانًا بموجب ترخيص CC-BY-SA. [ 42 ]
  • plWordNet [ 43 ] هو نسخة باللغة البولندية من WordNet تم تطويرها بواسطة جامعة فروتسواف للتكنولوجيا .
  • PolNet [ 44 ] هي نسخة باللغة البولندية من WordNet تم تطويرها بواسطة جامعة آدم ميكيفيتش في بوزنان (موزعة بموجب ترخيص CC BY-NC-ND 3.0).

أتاحت مشاريع مثل BalkaNet و EuroWordNet إمكانية إنشاء شبكات كلمات مستقلة مرتبطة بالشبكة الأصلية. ومن هذه المشاريع شبكة الكلمات الروسية، التي رعتها جامعة سانت بطرسبرغ الحكومية لوسائل الاتصال [ 45 ] وقادها إس. أ. يابلونسكي [ 46 ] ، وشبكة Russnet [ 47 ] التي رعتها جامعة سانت بطرسبرغ الحكومية .

  • UWN هي قاعدة معرفية معجمية متعددة اللغات يتم إنشاؤها تلقائيًا، وتوسع WordNet لتشمل أكثر من مليون كلمة في العديد من اللغات المختلفة. [ 48 ]
  • WOLF (WordNet Libre du Français)، نسخة فرنسية من WordNet. [ 49 ]

البيانات المرتبطة

  • BabelNet ، [ 50 ] شبكة دلالية متعددة اللغات كبيرة جدًا تحتوي على ملايين المفاهيم التي تم الحصول عليها من خلال دمج WordNet وWikipedia باستخدام خوارزمية رسم الخرائط التلقائية.
  • يحتوي علم الوجود SUMO [ 51 ] على خريطة يدوية كاملة[ 52 ] بين جميع مجموعات المرادفات في WordNet وجميع SUMO (بما في ذلك أنطولوجيات المجال الخاصة بها، عندما تحتوي WordNet على معنى كلمة لمصطلح SUMO معين) والتي يمكن تصفحها على سبيل المثال.
  • OpenCyc ، [ 53 ] وهو عبارة عن أنطولوجيا مفتوحة وقاعدة معرفية للمعرفة اليومية الشائعة، يحتوي على 12000 مصطلح مرتبط بمجموعات مرادفات WordNet.
  • دولتشي [ 54 ] هي الوحدة الأولى من مكتبة أنطولوجيات وندر ويب الأساسية (WFOL). طُوِّرت هذه الأنطولوجيا العليا وفقًا لمبادئ أنطولوجية صارمة مستوحاة من التراث الفلسفي، مع تركيز واضح على اللغة والإدراك. أما أونتو وورد نت [ 55 ] فهي نتاج مواءمة تجريبية للمستوى الأعلى من وورد نت مع دولتشي. ويُقترح أن هذه المواءمة قد تُفضي إلى وورد نت "مُحسَّن أنطولوجيًا"، يهدف إلى أن يكون أكثر دقة من الناحية المفاهيمية، وأكثر شفافية من الناحية الإدراكية، وأكثر قابلية للاستخدام بكفاءة في تطبيقات متعددة.
  • DBpedia ، [ 56 ] وهي قاعدة بيانات للمعلومات المنظمة، مرتبطة بـ WordNet.
  • يُعدّ مشروع eXtended WordNet [ 57 ] مشروعًا في جامعة تكساس في دالاس ، ويهدف إلى تحسين WordNet من خلال التحليل الدلالي للشروح، مما يجعل المعلومات الواردة في هذه التعريفات متاحة لأنظمة معالجة المعرفة الآلية. وهو متاح مجانًا بموجب ترخيص مشابه لترخيص WordNet.
  • أنتج مشروع GCIDE قاموسًا من خلال دمج قاموس ويبستر المتاح للعموم من عام 1913 مع بعض تعريفات WordNet ومواد قدمها متطوعون. وقد تم إصداره بموجب رخصة حقوق النشر العامة GPL .
  • ImageNet هي قاعدة بيانات للصور مُنظمة وفقًا لتسلسل WordNet الهرمي (حاليًا الأسماء فقط)، حيث يتم تمثيل كل عقدة من التسلسل الهرمي بملايين الصور. [ 58 ] حاليًا، تحتوي على أكثر من 500 صورة لكل عقدة في المتوسط.
  • تم التخلي عن BioWordnet، وهو امتداد طبي حيوي لـ Wordnet، بسبب مشاكل تتعلق بالاستقرار عبر الإصدارات. [ 59 ]
  • WikiTax2WordNet، تعيين بين مجموعات WordNet وفئات Wikipedia . [ 60 ]
  • WordNet++، وهو مورد يتضمن أكثر من ملايين الروابط الدلالية التي تم جمعها من ويكيبيديا وربط أزواج من مجموعات المرادفات في WordNet. [ 61 ]
  • SentiWordNet، وهو مورد لدعم تطبيقات استخراج الآراء تم الحصول عليه عن طريق تصنيف جميع مجموعات المرادفات في WordNet 3.0 وفقًا لدرجاتها المقدرة من الإيجابية والسلبية والحياد. [ 62 ]
  • ColorDict هو تطبيق أندرويد للهواتف المحمولة يستخدم قاعدة بيانات Wordnet وغيرها، مثل ويكيبيديا.
  • UBY-LMF قاعدة بيانات تضم 10 موارد، بما في ذلك WordNet.
  • TaxoLLaMa هو نموذج قائم على WordNet مصمم لتعزيز قدرة نماذج اللغة على التقاط المعرفة المعجمية الدلالية.
  • FrameNet هي قاعدة بيانات معجمية تشترك في بعض أوجه التشابه مع WordNet وتشير إليها.
  • إطار الترميز المعجمي (LMF) هو معيار ISO مُحدد ضمن اللجنة الفنية 37 التابعة لها، ويهدف إلى تعريف إطار عمل معياري مشترك لبناء المعاجم، بما في ذلك WordNet. تُسمى مجموعة LMF الخاصة بـ WordNet باسم Wordnet-LMF. وقد تم تطبيقها ضمن مشروع كيوتو. [ 63 ]
  • برنامج UNL هو مشروع تحت رعاية الأمم المتحدة يهدف إلى توحيد البيانات المعجمية الدلالية للعديد من اللغات لاستخدامها في أنظمة الترجمة الآلية واستخراج المعلومات .
  • موقع MeaningMonkey هو قاموس مجاني على الإنترنت يعتمد على قاعدة بيانات WordNet.
  • Dictionary.video هو قاموس فيديو يركز على النطق. أما الجزء النصي منه فهو مستمد من WordNet.

التوزيعات

يتم توزيع قاعدة بيانات WordNet كحزمة قاموس (عادةً ملف واحد) للبرامج التالية:

انظر أيضاً

مراجع

  1. "أخبار ووردنت" .
  2. جي إيه ميلر، آر. بيكويث، سي دي فيلباوم، دي. غروس، كيه. ميلر. 1990. ووردنت: قاعدة بيانات معجمية على الإنترنت. المجلة الدولية لعلم المعاجم. 3، 4، ص 235-244.
  3. 1 2 "إحصائيات WordNet" . Wordnet.princeton.edu . تم الاطلاع عليه بتاريخ 22-06-2018 .
  4. "شبكات الكلمات في العالم" . الرابطة العالمية لشبكات الكلمات . تم الاطلاع عليه بتاريخ 19 يناير 2020 .
  5. "نبذة عن رابطة ووردنت العالمية" . ووردنت العالمية . تم الاطلاع عليه بتاريخ 19 يناير 2020 .
  6. كولينز أ.، كويليان إم آر 1972. تجارب على الذاكرة الدلالية وفهم اللغة. في الإدراك في التعلم والذاكرة . وايلي، نيويورك.
  7. "دمج WordNet 1.7 في WebKB-2" . Webkb.org . تم الاطلاع عليه بتاريخ 11 مارس 2014 .
  8. غانغيمي، أ.؛ نافيلي، ر.؛ فيلاردي، ب. (2003). مشروع OntoWordNet: توسيع وتأصيل العلاقات المفاهيمية في WordNet (ملف PDF) . كاتانيا، صقلية (إيطاليا). ص 820-838 . {{cite book}}تم |work=تجاهله ( مساعدة ) صيانة CS1: موقع الناشر مفقود ( رابط )
  9. أولتراماري، أ.؛ جانجيمي، أ.؛ غوارينو، ن.؛ ماسولو، س. (2002). إعادة هيكلة المستوى الأعلى لشبكة WordNet: منهج OntoClean . ورشة عمل OntoLex'2، الأنطولوجيات وقواعد المعرفة المعجمية (LREC 2002). لاس بالماس، إسبانيا. ص 17-26 . CiteSeerX 10.1.1.19.6574 .  
  10. ^ رودنيكا ، إيوا. بوند، فرانسيس؛ جرابوسكي، لوكاسز؛ بياسيكي، ماسيج؛ بيوتروسكي، تاديوش (2018). “المنظور المعجمي على Wordnet لرسم خرائط Wordnet”. وقائع مؤتمر WordNet العالمي التاسع (GWC 2018) : 210.
  11. بوند، فرانسيس؛ فوستر، رايان (2013). " ربط وتوسيع شبكة كلمات متعددة اللغات مفتوحة" (ملف PDF) . وقائع الاجتماع السنوي الحادي والخمسين لجمعية اللغويات الحاسوبية : 1352-1362 . تم الاطلاع عليه بتاريخ 20 يناير 2020 .
  12. ^ فلباوم ، كريستيان. فوسن، بيك (2012). “التحديات التي تواجه شبكة Wordnet متعددة اللغات”. الموارد اللغوية والتقييم . 46 (2): 313-326 . دوى : 10.1007 / s10579-012-9186-z . S2CID 10117946 . 
  13. ر. نافيلي. إزالة الغموض عن معاني الكلمات: دراسة استقصائية ، مجلة ACM Computing Surveys ، 41(2)، 2009، ص 1-69
  14. إي. أغيري، أو. لوبيز. 2003. تجميع معاني كلمات WordNet. في وقائع مؤتمر التطورات الحديثة في اللغة الطبيعية (RANLP'03) ، بوروفيتز، بلغاريا، ص 121-130.
  15. R. Navigli. التجميع ذو المعنى للمعاني يساعد على تعزيز أداء إزالة الغموض عن معاني الكلمات ، في وقائع الاجتماع السنوي الرابع والأربعين لجمعية اللغويات الحاسوبية بالاشتراك مع المؤتمر الدولي الحادي والعشرين للغويات الحاسوبية (COLING-ACL 2006) ، سيدني، أستراليا، 17-21 يوليو 2006، ص 105-112.
  16. R. Snow, S. Prakash, D. Jurafsky, AY Ng. 2007. Learning to Merge Word Senses , In Proc. of the 2007 Joint Conference on Empirical Methods in Natural Language Processing and Computational Natural Language Learning (EMNLP-CoNLL) , Prague, Czech Republic, pp. 1005–1014.
  17. وونغ، جوليا كاري (18 سبتمبر 2019). "تطبيق ImageNet Roulette الشهير لالتقاط صور السيلفي بدا ممتعًا - إلى أن وجه لي إهانة عنصرية" . صحيفة الغارديان . تاريخ الاسترجاع: 14 أكتوبر 2022 .
  18. فرانسيس بوند وكيونغ هي بايك 2012أ. دراسة استقصائية لشبكات الكلمات وتراخيصها . في وقائع المؤتمر العالمي السادس لشبكات الكلمات (GWC 2012). ماتسو. 64-71
  19. 1 2 "Open Multilingual Wordnet" . omwn.org . تم الاطلاع عليه بتاريخ 13 مارس 2026 .
  20. "تيد بيدرسن - WordNet::Similarity" . D.umn.edu. 2008-06-16 . تم الاطلاع عليه بتاريخ 2014-03-11 .
  21. معالجة اللغة الطبيعية باستخدام بايثون NLTK /
  22. MT Pilehvar، D. Jurgens و R. Navigli. Align، Disambiguate و Walk: A Unified Approach for Measuring Semantic Similarity. . Proc. of the 51st Annual Meeting of the Association for Computational Linguistics (ACL 2013), Sofia, Bulgaria, August 4–9, 2013, pp. 1341–1351.
  23. ^ بالاتور أ، وآخرون . (2014). “ربط المفردات الجغرافية من خلال WordNet”. حوليات نظم المعلومات الجغرافية . 20 (2): 73– 84. أرخايف : 1404.5372 . بيب كود : 2014AnGIS..20...73B . دوى : 10.1080/19475683.2014.904440 . S2CID 9246582 .  
  24. "مشاريع ذات صلة - WordNet - مشاريع ذات صلة" . Wordnet.princeton.edu. 2014-01-06 . تم الاطلاع عليه بتاريخ 2018-06-22 .
  25. جمعية غلوبال ووردنت (2010-02-04). "globalwordnet.org" . globalwordnet.org . تم الاطلاع عليه بتاريخ 2014-03-11 .
  26. "شبكات الكلمات في العالم" . مؤرشف من الأصل بتاريخ 21-10-2011.
  27. بلاك دبليو، الكاتب إس، رودريغيز إتش، الخليفة إم، فوسن بي، بيس إيه، بيرتران إم، فيلباوم سي، (2006) مشروع شبكة الكلمات العربية، وقائع مؤتمر LREC 2006
  28. لحسن أبو النور، كريم بوزوبا، باولو روسو (2013) حول تقييم وتحسين تغطية وسهولة استخدام شبكة الكلمات العربية، موارد اللغة والتقييم 47(3) ص 891-917
  29. د. توفيس، د. كريستيا، س. ستامو. 2004. بالكانِت: الأهداف، والأساليب، والنتائج، والآفاق. نظرة عامة. مؤرشف بتاريخ 18-07-2011 في أرشيف الإنترنت . المجلة الرومانية للعلوم والتكنولوجيا والمعلومات (عدد خاص عن بالكانِت) ، 7(1-2)، ص 9-43.
  30. "BulNet" . dcl.bas.bg. تم الاطلاع عليه بتاريخ 2015-05-07 .
  31. ^ الصفحة الرسمية لـ Wordnet الصينية (中文詞彙網路) في جامعة تايوان الوطنية
  32. بي. فوسن، محرر. 1998. يورو وورد نت: قاعدة بيانات متعددة اللغات مع شبكات دلالية معجمية. كلوير، دوردريخت، هولندا.
  33. "رابطة ووردنت العالمية" . Globalwordnet.org. 2010-02-04 . تم الاطلاع عليه بتاريخ 2014-01-05 .
  34. "FinnWordNet – شبكة الكلمات الفنلندية - قسم اللغويات العامة" . Ling.helsinki.fi . تم الاطلاع عليه بتاريخ 5 يناير 2014 .
  35. "GermaNet" . Sfs.uni-tuebingen.de. مؤرشف من الأصل بتاريخ 18-05-2015 . تم الاطلاع عليه بتاريخ 11-03-2014 .
  36. بوشباك بهاتاشاريا، إندوووردنت، مؤتمر هندسة الموارد المعجمية 2010 (LREC 2010)، مالطا، مايو 2010.
  37. سي. موتون، جي. دي شاليندار. 2010. JAWS  : مجرد مجموعة فرعية أخرى من WordNet . في وقائع مؤتمر TALN 2010 .
  38. الموقع الإلكتروني
  39. "MCR 3.0 | Adimen" . Adimen.si.ehu.es . تم الاطلاع عليه بتاريخ 21-03-2022 .
  40. إي. بيانتا، إل. بنتيفولجي، سي. جيراردي. 2002. MultiWordNet: تطوير قاعدة بيانات متعددة اللغات متوافقة . في وقائع المؤتمر الدولي الأول حول Global WordNet ، ميسور، الهند، ص 21-25.
  41. "Open Dutch WordNet" . Wordpress.let.vupr.nl. 2015-10-28 . تم الاطلاع عليه بتاريخ 2022-03-21 .
  42. "arademaker/openWordnet-PT — GitHub" . Github.com . تم الاطلاع عليه بتاريخ 2014-01-05 .
  43. "الصفحة الرسمية" . مؤرشفة من الأصل بتاريخ 12-05-2015 . تم الاطلاع عليها بتاريخ 03-07-2014 .
  44. الصفحة الرسمية
  45. "Русский WordNet" . Pgups.ru. مؤرشف من الأصل بتاريخ 2013-11-05 . تم الاطلاع عليه بتاريخ 2014-01-05 .
  46. بالكوفا، فالنتينا؛ سوخونوغوف، أندريه؛ يابلونسكي، سيرجي (2003). "شبكة الكلمات الروسية من تدوين UML إلى تطبيق قاعدة بيانات الإنترنت/الإنترانت" (ملف PDF) . وقائع مؤتمر GWC 2004 : 31-38 . تاريخ الاسترجاع: 12 مارس 2017 .
  47. ^ "RussNet: الصفحة الرئيسية" . Project.phil.spbu.ru . تم الاسترجاع 2014/03/11 .
  48. ^ "UWN: نحو شبكة Wordnet عالمية متعددة اللغات - D5: قواعد البيانات وأنظمة المعلومات (Max-Planck-Institut für Informatik)" . Mpi-inf.mpg.de. 2011-08-14 . تم الاسترجاع 2014/01/05 .
  49. س. بينوا، ف. دارجا. 2008. بناء شبكة كلمات فرنسية مجانية من موارد متعددة اللغات . في وقائع مؤتمر Ontolex 2008 ، مراكش، المغرب.
  50. R. Navigli, SP Ponzetto. BabelNet: بناء شبكة دلالية متعددة اللغات كبيرة جدًا . وقائع الاجتماع السنوي الثامن والأربعين لجمعية اللغويات الحاسوبية (ACL 2010)، أوبسالا، السويد، 11-16 يوليو 2010، ص 216-225.
  51. آي. نايلز، أ. بيس 2001. نحو أنطولوجيا عليا قياسية: أنطولوجيا كبيرة للويب الدلالي وتطبيقاتها . في وقائع المؤتمر الدولي الثاني حول الأنطولوجيا الرسمية في نظم المعلومات (FOIS-2001) .
  52. آي. نايلز، أ. بيس 2003. ربط المعاجم والأنطولوجيات: رسم خريطة WordNet للأنطولوجيا العليا المدمجة المقترحة ، في وقائع المؤتمر الدولي لهندسة المعلومات والمعرفة التابع لمعهد مهندسي الكهرباء والإلكترونيات ، الصفحات 412-416
  53. إس. ريد ود. لينات. 2002. رسم خرائط الأنطولوجيات في Cyc. مؤرشف في 13 يونيو 2004 على Wayback Machine . في وقائع ورشة عمل مؤتمر AAAI 2002 حول الأنطولوجيات للويب الدلالي ، إدمونتون، كندا، 2002
  54. ماسولو، سي.، بورغو، إس.، غانغيمي، أ.، غوارينو، ن.، أولتراماري، أ.، شنايدر، إل إس 2002. مُخرَج WonderWeb D17. مكتبة WonderWeb للأنطولوجيات الأساسية وأنطولوجيا DOLCE . تقرير (الإصدار 2.0، 15-08-2002)
  55. جانجيمي، أ.، غوارينو، ن.، ماسولو، س.، أولتراماري، أ. 2003. تحسين WordNet باستخدام DOLCE . في مجلة الذكاء الاصطناعي 24(3): خريف 2003، ص 13-24.
  56. سي. بيزر، ج. ليمان، ج. كوبيلاروف، س. أوير، سي. بيكر، ر. سيغانياك، س. هيلمان، دي بي بيديا - نقطة تبلور لشبكة البيانات . مؤرشف في 2010-02-02 على موقع Wayback Machine . دلالات الويب، 7(3)، 2009، ص 154-165
  57. إس إم هاراباجيو، جي إيه ميلر، دي آي مولدوفان. 1999. WordNet 2 – مورد مُحسَّن صرفيًا ودلاليًا. مؤرشف بتاريخ 2004-07-04 في Wayback Machine . في وقائع ورشة عمل ACL SIGLEX: توحيد الموارد المعجمية ، الصفحات 1-8.
  58. ج. دينغ، و. دونغ، ر. سوشر، ل. لي، ك. لي، ل. فاي-فاي. ImageNet: قاعدة بيانات صور هرمية واسعة النطاق. مؤرشفة بتاريخ 3 أكتوبر 2014 على موقع Wayback Machine . ضمن وقائع مؤتمر IEEE لعام 2009 حول رؤية الحاسوب والتعرف على الأنماط.
  59. م. بوبرات، إ. بيسوانجر، يو. هان. 2008. بناء شبكة BIOWORDNET باستخدام تنسيقات بيانات WORDNET وبنية برمجيات WORDNET - قصة فشل . في وقائع ورشة عمل هندسة البرمجيات والاختبار وضمان الجودة لمعالجة اللغة الطبيعية ، الصفحات 31-39.
  60. S. Ponzetto, R. Navigli. Large-Scale Taxonomy Mapping for Restructuring and Integrating Wikipedia , In Proc. of the 21st International Joint Conference on Artificial Intelligence (IJCAI 2009) , Pasadena, California, July 14-17th, 2009, pp. 2083–2088.
  61. SP Ponzetto, R. Navigli. إزالة الغموض عن معاني الكلمات الغنية بالمعرفة والتي تنافس الأنظمة الخاضعة للإشراف . في وقائع الاجتماع السنوي الثامن والأربعين لجمعية اللغويات الحاسوبية (ACL)، 2010، ص 1522-1531.
  62. س. باتشانيلا، أ. إسولي، و ف. سيباستياني. SentiWordNet 3.0: مورد معجمي مُحسَّن لتحليل المشاعر واستخراج الآراء. مؤرشف بتاريخ 22 يوليو 2011 على موقع Wayback Machine . في وقائع المؤتمر السابع حول موارد اللغة وتقييمها (LREC'10)، فاليتا، ماتو غروسو، 2010، الصفحات 2200-2204.
  63. بيك فوسن، كلوديا سوريا، مونيكا موناتشيني: Wordnet-LMF: تمثيل قياسي لشبكات الكلمات متعددة اللغات، في LMF Lexical Markup Framework ، تحرير جيل فرانكوبولو، ISTE / Wiley 2013 ( ISBN 978-1-84821-430-9)
  64. "Babylon WordNet" . Babylon.com . تم الاطلاع عليه بتاريخ 11-03-2014 .
  65. "GoldenDict - تصفح القواميس على موقع Sourceforge.net" . Sourceforge.net. 2010-12-01 . تم الاطلاع عليه بتاريخ 2014-01-05 .
  66. "Lingoes WordNet" . Lingoes.net. 2007-11-16 . تم الاطلاع عليه بتاريخ 2014-03-11 .