مورد لغوي
في علم اللغويات وتكنولوجيا اللغة ، يُعرَّف المورد اللغوي بأنه "مجموعة من المواد اللغوية المستخدمة في بناء وتحسين و/أو تقييم تطبيقات معالجة اللغة، (...) في الدراسات والتطبيقات البحثية اللغوية واللغوية." [ 1 ]
وفقًا لبيرد وسيمونز (2003)، [ 2 ] يشمل ذلك
- البيانات، أي "أي معلومات توثق أو تصف لغة ما، مثل دراسة منشورة، أو ملف بيانات حاسوبي، أو حتى صندوق أحذية مليء ببطاقات فهرسة مكتوبة بخط اليد. ويمكن أن تتراوح المعلومات في محتواها من تسجيلات صوتية غير محللة إلى نصوص منسوخة ومُعلّقة بالكامل إلى قواعد نحوية وصفية كاملة"، [ 2 ]
- الأدوات، أي "الموارد الحاسوبية التي تسهل إنشاء بيانات اللغة أو عرضها أو الاستعلام عنها أو استخدامها بأي شكل آخر"، [ 2 ] و
- النصيحة، أي "أي معلومات حول مصادر البيانات الموثوقة، والأدوات المناسبة في حالة معينة، والممارسات الواجب اتباعها عند إنشاء بيانات جديدة". ويُشار إلى هذا الجانب الأخير عادةً باسم "أفضل الممارسات" أو "المعايير (المجتمعية)". [ 2 ]
بمعنى أضيق، يُطبق مصطلح "مورد اللغة" تحديداً على الموارد المتاحة في شكل رقمي، ويشمل ذلك (أ) مجموعات البيانات (النصية، والوسائط المتعددة/الوسائط المتعددة، والبيانات المعجمية، والقواعد النحوية، ونماذج اللغة، وما إلى ذلك) في شكل قابل للقراءة آلياً، و(ب) الأدوات/التقنيات/الخدمات المستخدمة في معالجتها وإدارتها. [ 1 ]
التصنيف
حتى مايو 2020، لم يتم وضع تصنيف معياري واسع الانتشار لموارد اللغة (تشمل المقترحات الحالية LREMap ، [ 3 ] و METASHARE، [ 4 ] وتصنيف LLOD للبيانات ). تشمل الفئات المهمة لموارد اللغة ما يلي:
- بيانات
- الموارد المعجمية ، على سبيل المثال، القواميس المقروءة آلياً ،
- المدونات اللغوية ، أي المجموعات الرقمية لبيانات اللغة الطبيعية،
- قواعد البيانات اللغوية مثل مجموعة البيانات المرتبطة عبر اللغات ،
- أدوات
- التعليقات اللغوية وأدوات إنشاء هذه التعليقات بطريقة يدوية أو شبه آلية (مثل أدوات التعليق على النصوص المترجمة بين السطور مثل Toolbox و FLEx ، أو أدوات توثيق اللغة الأخرى )،
- تطبيقات للبحث والاسترجاع في مثل هذه البيانات ( أنظمة إدارة المدونات اللغوية )، وللتعليق الآلي ( تحديد أجزاء الكلام ، والتحليل النحوي ، والتحليل الدلالي ، وما إلى ذلك).
- البيانات الوصفية والمفردات
- المفردات، ومستودعات المصطلحات اللغوية وبيانات اللغة الوصفية، على سبيل المثال، MetaShare (لبيانات موارد اللغة الوصفية)، [ 4 ] وسجل فئات البيانات ISO 12620 (للسمات اللغوية، وهياكل البيانات، والتعليقات التوضيحية داخل مورد لغوي)، [ 5 ] أو قاعدة بيانات Glottolog (معرفات تنوعات اللغة وقاعدة البيانات الببليوغرافية). [ 6 ]
نشر وتوزيع وإنشاء موارد اللغة
كان من أهم اهتمامات مجتمع موارد اللغة تطوير البنى التحتية والمنصات لعرض موارد اللغة ومناقشتها ونشرها. ومن بين المساهمات المختارة في هذا الصدد ما يلي:
- سلسلة من المؤتمرات الدولية حول موارد اللغة وتقييمها (LREC)،
- رابطة موارد اللغة الأوروبية (ELRA، ومقرها الاتحاد الأوروبي)، واتحاد البيانات اللغوية (LDC، ومقره الولايات المتحدة)، واللتان تمثلان منصات تجارية لاستضافة ونشر موارد اللغة،
- مجتمع أرشيفات اللغات المفتوحة (OLAC) ، الذي يوفر ويجمع بيانات وصفية لموارد اللغة،
- مجلة موارد اللغة وتقييمها (LREJ)، [ 7 ]
- شبكة اللغات الأوروبية هي منصة أوروبية لتقنيات اللغة (مثل الخدمات) والبيانات والموارد.
أما فيما يتعلق بتطوير المعايير وأفضل الممارسات لموارد اللغة، فإن هذه الأمور تخضع لجهود العديد من المجموعات المجتمعية وجهود التقييس، بما في ذلك
- اللجنة الفنية رقم 37 التابعة للمنظمة الدولية للمقاييس : المصطلحات وموارد اللغة والمحتوى الأخرى ( ISO/TC 37 )، التي تعمل على وضع معايير لجميع جوانب موارد اللغة،
- مجموعة W3C لأفضل الممارسات للبيانات المفتوحة المرتبطة متعددة اللغات (BPMLOD)، [ 8 ] تعمل على توصيات أفضل الممارسات لنشر موارد اللغة كبيانات مرتبطة أو في RDF ،
- مجموعة W3C المجتمعية للبيانات المرتبطة بتكنولوجيا اللغة (LD4LT)، [ 9 ] تعمل على التعليقات اللغوية على الويب وبيانات تعريف موارد اللغة،
- مجموعة مجتمع W3C Ontology-Lexica ( OntoLex )، [ 10 ] تعمل على الموارد المعجمية،
- مجموعة العمل اللغوية المفتوحة التابعة لمؤسسة المعرفة المفتوحة ، والتي تعمل على وضع اتفاقيات لنشر وربط موارد اللغة المفتوحة ، وتطوير سحابة البيانات اللغوية المفتوحة المرتبطة ، [ 11 ]
- مبادرة ترميز النصوص (TEI) ، [ 12 ] تعمل على مواصفات قائمة على XML لموارد اللغة والنصوص المحررة رقميًا.
مراجع
- 1 2 LD4LT (2020)، أنطولوجيا Metashare كما أنشأها فريق مجتمع LD4LT، مؤرشفة في 10 فبراير 2023 على Wayback Machine ، مجموعة مجتمع W3C، البيانات المرتبطة لتقنية اللغة (LD4LT)، فرع التطوير، إصدار 10 مارس 2020
- 1 2 3 4 بيرد، ستيفن؛ سيمونز، غاري (1 نوفمبر 2003). "توسيع بيانات دبلن كور الوصفية لدعم وصف واكتشاف موارد اللغة". الحوسبة والعلوم الإنسانية . 37 (4): 375-388 . arXiv : cs/0308022 . Bibcode : 2003cs........8022B . doi : 10.1023/A:1025720518994 . ISSN 1572-8412 . S2CID 5969663 .
- ↑ كالزولاري، ن.، ديل غراتا، ر.، فرانكوبولو، ج.، مارياني، ج.، روبينو، ف.، روسو، إ.، وسوريا، س. (مايو 2012). خريطة الموارد البيئية الأقل. مواءمة أوصاف الموارد المجتمعية . في LREC (ص 1084-1089).
- 1 2 مكراي، جون ب.؛ لابروبولو، بيني؛ غراسيا، خورخي؛ فيليغاس، مارتا؛ رودريغيز-دونسيل، فيكتور؛ سيميانو، فيليب (2015). "أنطولوجيا واحدة لربطها جميعًا: أنطولوجيا META-SHARE OWL لتوافق مجموعات البيانات اللغوية على الويب". في: غاندون، فابيان؛ غيريه، كريستوف؛ فيلاتا، سيرينا؛ بريسلين، جون؛ فارون-زوكر، كاثرين؛ زيمرمان، أنطوان (محررون). الويب الدلالي: فعاليات ESWC 2015 المصاحبة . سلسلة محاضرات في علوم الحاسوب. المجلد 9341. تشام: دار نشر سبرينغر الدولية. الصفحات 271-282 . doi : 10.1007/978-3-319-25639-9_42 . رقم الكتاب المعياري الدولي (ISBN) 978-3-319-25639-9.
- ↑ كيمبس-سنايدرز، م.، ويندهوير، م.، ويتنبرغ، ب.، ورايت، إس إي (2008). ISOcat: تجميع فئات البيانات في بيئات متنوعة . في المؤتمر الدولي السادس لموارد اللغة وتقييمها (LREC 2008) .
- ↑ نوردوف، سيباستيان (2012)، "البيانات المترابطة لأبحاث التنوع اللغوي: Glottolog/Langdoc وASJP Online"، في: تشياركوس، كريستيان؛ نوردوف، سيباستيان؛ هيلمان، سيباستيان (محررون)، البيانات المترابطة في اللغويات: تمثيل وربط بيانات اللغة وبياناتها الوصفية ، سبرينغر، ص 191-200 ، doi : 10.1007/978-3-642-28249-2_18 ، ISBN 978-3-642-28249-2
- ↑ "موارد اللغة وتقييمها" . سبرينغر . تم الاطلاع عليه بتاريخ 13-05-2020 .
- ↑ "أفضل الممارسات لمجموعة مجتمع البيانات المفتوحة المرتبطة متعددة اللغات" . www.w3.org . 2 أكتوبر 2015. تم الاطلاع عليه بتاريخ 13 مايو 2020 .
- ↑ "مجموعة البيانات المرتبطة لتكنولوجيا اللغة" . www.w3.org . 26 يونيو 2015. تم الاطلاع عليه بتاريخ 13 مايو 2020 .
- ↑ "مجموعة مجتمع علم الوجود والمعجم" . www.w3.org . 10 مايو 2016. تم الاطلاع عليه بتاريخ 13 مايو 2020 .
- ↑ "البيانات المفتوحة المرتبطة لغوياً" .
- ↑ "مبادرة ترميز النصوص: TEI" . tei-c.org . تم الاطلاع عليه بتاريخ 13 مايو 2020 .
- معالجة اللغة الطبيعية
- اللغويات الحاسوبية
