برنامج التعدين (قاعدة البيانات)

AMiner (المعروف سابقًا باسم ArnetMiner ) هي خدمة مجانية عبر الإنترنت تُستخدم لفهرسة البيانات العلمية الضخمة والبحث عنها واستخراجها .

ملخص

صُمم برنامج AMiner (ArnetMiner) للبحث عن البيانات واستخراجها من المنشورات الأكاديمية على الإنترنت ، مستخدمًا تحليل الشبكات الاجتماعية لتحديد الروابط بين الباحثين والمؤتمرات والمنشورات. [ 1 ] وهذا يُمكّنه من تقديم خدمات مثل البحث عن الخبراء، والبحث الجغرافي، وتحليل الاتجاهات، والتوصية بالمراجعين، والبحث عن الروابط، والبحث عن المقررات الدراسية، وتقييم الأداء الأكاديمي، ونمذجة المواضيع.

تم إنشاء نظام AMiner كمشروع بحثي في ​​تحليل التأثير الاجتماعي، وتصنيف الشبكات الاجتماعية، واستخراج البيانات منها. وقد نُشرت العديد من الأبحاث المحكمة نتيجةً لتطوير هذا النظام. ويعمل النظام منذ أكثر من ثلاث سنوات، وقد فهرس بيانات 130 مليون باحث وأكثر من 265 مليون منشور. [ 2 ] وقد مُوِّل هذا البحث من قِبَل البرنامج الوطني الصيني للبحث والتطوير في مجال التقنيات المتقدمة، ومؤسسة العلوم الوطنية الصينية .

يُستخدم برنامج AMiner على نطاق واسع في الأوساط الأكاديمية لتحديد العلاقات بين الأبحاث واستخلاص الارتباطات الإحصائية المتعلقة بها وبالباحثين. وقد حظي البرنامج بأكثر من 10 ملايين عملية وصول مستقلة من عناوين IP من 220 دولة ومنطقة. كما استُخدم في منصة SciVerse التابعة لدار النشر Elsevier ، [ 3 ] وفي مؤتمرات أكاديمية مثل SIGKDD وICDM وPKDD وWSDM.

عملية

يستخرج برنامج AMiner تلقائيًا ملف تعريف الباحث من الإنترنت. فهو يجمع الصفحات ذات الصلة ويحددها، ثم يستخدم منهجية موحدة لاستخراج البيانات من الوثائق المحددة. كما يستخرج المنشورات من المكتبات الرقمية على الإنترنت باستخدام قواعد استدلالية.

يدمج هذا النظام ملفات تعريف الباحثين المستخرجة مع منشوراتهم، مستخدماً اسم الباحث كمعرّف. وقد طُرح إطار عمل احتمالي لمعالجة مشكلة غموض الأسماء في عملية الدمج. تُخزّن البيانات المدمجة في قاعدة بيانات معرفية لشبكة الباحثين (RNKB).

أما المنتجات الرئيسية الأخرى في هذا المجال فهي Google Scholar و Scirus التابع لدار النشر Elsevier ومشروع CiteSeer مفتوح المصدر.

تاريخ

تم إطلاق هذا المشروع من قِبل البروفيسور جي تانغ من جامعة تسينغهوا في الصين، وكان أول مشروع له في مارس 2006. فيما يلي قائمة بالتحديثات التي أُجريت عليه خلال السنوات الماضية:

  • مارس 2006، الإصدار 0.1، تشمل الوظائف تحديد خصائص الباحثين، والبحث عن الخبراء، والبحث عن المؤتمرات، والبحث عن المنشورات. تم تطوير النظام باستخدام لغة بيرل؛
  • أغسطس 2006، الإصدار 1.0، تمت إعادة تنفيذ النظام بلغة جافا؛
  • يوليو 2007، الإصدار 2.0، تشمل الوظائف الجديدة استخراج اهتمامات الباحثين، والبحث عن الارتباطات، وإيجاد أوراق المسح (غير متوفر الآن)؛
  • أبريل 2008، الإصدار 3.0، تشمل الوظائف الجديدة فهم الاستعلام ، وواجهة المستخدم الرسومية الجديدة، وتحليل سجل البحث؛
  • نوفمبر 2008، الإصدار 4.0، تشمل الوظائف الجديدة البحث في الرسوم البيانية، ونمذجة المواضيع، واستخراج معلومات التمويل من NSF/NSFC ؛
  • أبريل 2009، الإصدار 5.0، تشمل الوظائف الجديدة تحرير الملف الشخصي، وخدمة API المفتوحة، والبحث في Bole، والبحث عن الدورات (غير متوفر حاليًا)؛
  • ديسمبر 2009، الإصدار 6.0، تشمل الوظائف الجديدة تقييم الأداء الأكاديمي، وتعليقات المستخدمين، وتحليل المؤتمرات؛
  • مايو 2010، الإصدار 7.0، تشمل الوظائف الجديدة إزالة الغموض عن الأسماء، وتوصية مراجع الأوراق، وإنشاء ArnetPage؛
  • في مارس 2012، تم إصدار النسخة الثانية، التي أعيد تسميتها إلى AMiner، وأعيدت كتابة جميع الأكواد وإعادة تصميم واجهة المستخدم الرسومية. تشمل الوظائف الجديدة: البحث الجغرافي، ومنصة ArnetAPP.
  • في يونيو 2014، تم إصدار النسخة الثانية، التي أعيد تسميتها إلى AMiner، وأعيدت كتابة جميع الأكواد وإعادة تصميم واجهة المستخدم الرسومية. تشمل الوظائف الجديدة: البحث الجغرافي، ومنصة ArnetAPP.
  • في ديسمبر 2015، تم إطلاق نسخة جديدة تمامًا على الإنترنت.
  • في مايو 2017، تم إطلاق النسخة الاحترافية عبر الإنترنت.
  • أبريل 2018، تشمل الوظائف الجديدة تحليل الاتجاهات، [ 4 ] وإلغاء غموض الأسماء القائم على التعلم العميق [ 5 ]

موارد

نشرت AMiner العديد من مجموعات البيانات لأغراض البحث الأكاديمي، بما في ذلك Open Academic Graph، [ 6 ] وDBLP+citation [ 7 ] ( مجموعة بيانات تُضيف الاستشهادات إلى بيانات DBLP من مشروع الببليوغرافيا الرقمية والمكتبة )، وName Disambiguation، [ 8 ] وSocial Tie Analysis. [ 9 ] لمزيد من مجموعات البيانات المتاحة ورموز المصادر للبحث، يُرجى الرجوع إلى [ 10 ] .

انظر أيضاً

مراجع

  1. جي تانغ؛ جينغ تشانغ؛ ليمين ياو؛ جوانزي لي؛ لي تشانغ؛ تشونغ سو (2008). "ArnetMiner" . وقائع المؤتمر الدولي الرابع عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات . نيويورك: ACM. الصفحات 990-998 . doi : 10.1145/1401890.1402008 . ISBN  9781605581934. S2CID 3348552 . 
  2. "Arnetminer: مقدمة" . تم الاطلاع عليه بتاريخ 17 ديسمبر 2020 .
  3. "SciVerse - HUB - Home" . تم الاطلاع عليه بتاريخ 24 أبريل 2012 .{{cite web}}: CS1 maint: deprecated archiveal service ( link )
  4. "تحليل الاتجاهات" . تم الاطلاع عليه بتاريخ 24 ديسمبر 2018 .
  5. يوتاو تشانغ؛ فانجين تشانغ؛ بيران ياو؛ جي تانغ (2018). "إزالة الغموض عن الأسماء في AMiner" . وقائع المؤتمر الدولي الرابع والعشرين لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات . لندن: ACM. الصفحات 1002-1011 . doi : 10.1145/3219819.3219859 . ISBN  9781450355520. S2CID 207579405 . 
  6. "Open Academic Graph" . تم الاطلاع عليه بتاريخ 24 ديسمبر 2018 .
  7. "العلاقة بين أوراق DBLP والاستشهادات" . تم الاطلاع عليه بتاريخ 24 ديسمبر 2018 .
  8. "توضيح الأسماء" . تم الاطلاع عليه بتاريخ 24 أبريل 2012 .
  9. "استنتاج الروابط الاجتماعية في الشبكات الكبيرة" . تم الاطلاع عليه بتاريخ 24 أبريل 2012 .
  10. "البيانات المفتوحة والرموز البرمجية من ArnetMiner" . تم الاطلاع عليه بتاريخ 24 أبريل 2012 .

للمزيد من القراءة

  • جي تانغ، جينغ تشانغ، ليمين ياو، جوانزي لي، لي تشانغ، تشونغ سو. أرنتماينر: استخراج البيانات من الشبكات الاجتماعية الأكاديمية وتحليلها. ضمن وقائع المؤتمر الدولي الرابع عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات (SIGKDD'2008).
  • تشي وانغ، جياوي هان ، يونتاو جيا، جي تانغ ، دو تشانغ، يينتاو يو، وجينغي غو. استخراج علاقات المشرف والمتدرب من شبكات النشر البحثي. في وقائع المؤتمر الدولي السادس عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات (SIGKDD'2010).
  • جي تانغ ، جيمينغ صن، تشي وانغ، وزي يانغ. تحليل التأثير الاجتماعي في الشبكات واسعة النطاق. في وقائع المؤتمر الدولي الخامس عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات (SIGKDD'2009). الصفحات  807-816.
  • جي تانغ ، رومينغ جين، وجينغ تشانغ. منهجية نمذجة المواضيع ودمجها في إطار عمل المشي العشوائي للبحث الأكاديمي. في وقائع المؤتمر الدولي لعام 2008 التابع لمعهد مهندسي الكهرباء والإلكترونيات حول استخراج البيانات (ICDM'2008). الصفحات  1055-1060.
  • جي تانغ ، ليمين ياو، دو تشانغ، وجينغ تشانغ. نهج مُدمج لتوصيف مستخدمي الويب. معاملات ACM لاكتشاف المعرفة من البيانات (TKDD)، (المجلد 5، العدد 1)، المقالة 2 (ديسمبر 2010)، 44 صفحة.
  • يوتاو تشانغ، فانجين تشانغ، بيران ياو، وجي تانغ . إزالة الغموض عن الأسماء في برنامج AMiner: التجميع، والصيانة، والتدخل البشري. في وقائع المؤتمر الدولي الرابع والعشرين لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات (KDD'18). الصفحات  1002-1011.