اكتشاف البيانات الوصفية
في مجال البيانات الوصفية ، يُعرف اكتشاف البيانات الوصفية (أو جمع البيانات الوصفية ) بأنه عملية استخدام أدوات آلية لاكتشاف دلالات عنصر بيانات في مجموعات البيانات. وتنتهي هذه العملية عادةً بمجموعة من عمليات الربط بين عناصر مصدر البيانات وسجل مركزي للبيانات الوصفية . ويُعرف اكتشاف البيانات الوصفية أيضًا باسم مسح البيانات الوصفية. [ 1 ]
تصنيف خوارزميات مطابقة البيانات الوصفية
توجد فئات متميزة لاكتشاف البيانات الوصفية الآلي:
المطابقة المعجمية
- التطابق التام - حيث يتم ربط عناصر البيانات بناءً على الاسم الدقيق لعمود في قاعدة البيانات، أو اسم عنصر XML، أو تسمية على الشاشة. على سبيل المثال، إذا كان اسم عمود في قاعدة البيانات هو "PersonBirthDate"، وكان اسم عنصر بيانات في سجل البيانات الوصفية هو نفسه "PersonBirthDate"، فيمكن للأدوات الآلية استنتاج أن عمود قاعدة البيانات له نفس دلالة (معنى) عنصر البيانات في سجل البيانات الوصفية.
- مطابقة المرادفات - حيث لا يتم إعطاء أداة الاكتشاف اسمًا واحدًا فقط، بل مجموعة من المرادفات.
- مطابقة الأنماط - في هذه الحالة، تُزوَّد الأدوات بمجموعة من الأنماط المعجمية التي يمكنها مطابقتها. على سبيل المثال، قد تبحث الأدوات عن "*gender*" أو "*sex*".
المطابقة الدلالية
تحاول المطابقة الدلالية استخدام الدلالات لربط البيانات المستهدفة بعناصر البيانات المسجلة .
- التشابه الدلالي - تعتمد هذه الخوارزمية على قاعدة بيانات للتقارب المفاهيمي للكلمات. على سبيل المثال، يستطيع نظام WordNet تصنيف مدى تقارب الكلمات مفاهيميًا. فعلى سبيل المثال، قد تكون المصطلحات "شخص" و"فرد" و"إنسان" مفاهيم متشابهة للغاية.
المطابقة الإحصائية
تستخدم المطابقة الإحصائية إحصاءات حول مصادر البيانات والبيانات نفسها لاستخلاص أوجه التشابه مع عناصر البيانات المسجلة.
- تحليل القيم المميزة - من خلال تحليل جميع القيم المميزة في عمود ما، يمكن تحديد مدى تشابهها مع عنصر بيانات مسجل. على سبيل المثال، إذا كان العمود يحتوي على قيمتين مميزتين فقط هما "ذكر" و"أنثى"، فيمكن ربط ذلك بـ "PersonGenderCode".
- تحليل توزيع البيانات - من خلال تحليل توزيع القيم داخل عمود واحد ومقارنة هذا التوزيع بعناصر البيانات المعروفة، يمكن استنتاج وجود رابط دلالي.
بحث
- مشروع INDUS في جامعة ولاية أيوا .
- ميركوري - نظام إدارة البيانات الوصفية الموزعة واكتشاف البيانات الذي تم تطويره في مختبر أوك ريدج الوطني DAAC . [ 2 ]
- المكتبة الرقمية الوطنية للهند .
انظر أيضاً
مراجع
- ↑ كوفيلد، ميلاني. "LibGuides: Metadata Basics: Harvesting" . guides.lib.utexas.edu . تم الاطلاع عليه بتاريخ 2025-06-04 .
- ↑ ديفاراكوندا، ر.، بالانيسامي، ج.، ويلسون، ب.، وغرين، ج. (2010)، "ميركوري: نظام قابل لإعادة الاستخدام لإدارة البيانات الوصفية، واكتشاف البيانات، والوصول إليها" ، معلوماتية علوم الأرض ، 3 (1)، سبرينغر برلين / هايدلبرغ: 87-94 ، Bibcode : 2010ESIn....3...87D ، doi : 10.1007/s12145-010-0050-7 ، S2CID 27597035
{{citation}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
للمزيد من القراءة
- أنظمة تحليل البيانات الضخمة من مركز سان دييغو للحوسبة الفائقة، يونيو 1997
- ورقة بيضاء من شركة IBM حول اكتشاف البيانات الوصفية للمؤسسات
- ورقة بيضاء حول إدارة البيانات الوصفية [ تم حذف الرابط ] - من إعداد شركة إسكواير للابتكارات
- أ. غراهام، ريبيكا (1 سبتمبر 2001). "استخلاص البيانات الوصفية" . مجلة التقنية المكتبية . 19 (3). دار إميرالد للنشر . الرقم الدولي الموحد للدوريات 0737-8831 .
- سيميوني، فابيو؛ ياكيتشي، مراد؛ نيلي، ستيف؛ كريستاني، فابيو (3 ديسمبر 2007). "استخلاص البيانات الوصفية لاسترجاع المعلومات الموزعة القائمة على المحتوى" . مجلة الجمعية الأمريكية لعلوم وتكنولوجيا المعلومات . 59 (1). منشورات وايلي : 12-24 . doi : 10.1002/asi.20694 . eISSN 1532-2890 .
- ناغ، روبن؛ جوهاثاكورتا، راهول (31 ديسمبر 2024). "استخلاص البيانات الوصفية: تطبيقاتها وتأثيرها في النشر الرقمي" . دراسات حالة الوصول المفتوح . 1 (4). الرقم الدولي الموحد للدوريات الإلكترونية 3067-0349 .
فئة :
- البيانات الوصفية
