ألفا غو زيرو

ألفا غو زيرو هو نسخة من برنامج ألفا غو، التابع لشركة ديب مايند والمتخصص في لعبة غو . نشر فريق ألفا غو مقالًا في مجلة نيتشر في أكتوبر 2017، قدّم فيه ألفا غو زيرو، وهي نسخة تم إنشاؤها دون استخدام بيانات من مباريات بشرية، وتتفوق على جميع النسخ السابقة. [ 1 ] من خلال اللعب ضد نفسه، حقق ألفا غو زيرو ما يلي: تفوق على قوة ألفا غو لي في ثلاثة أيام بفوزه في 100 مباراة مقابل لا شيء؛ ووصل إلى مستوى ألفا غو ماستر في 21 يومًا؛ وتجاوز جميع النسخ السابقة في 40 يومًا. [ 2 ]

يُعدّ تدريب الذكاء الاصطناعي دون استخدام مجموعات بيانات مستمدة من خبراء بشريين ذا أهمية بالغة لتطوير ذكاء اصطناعي يتمتع بقدرات خارقة، إذ غالبًا ما تكون بيانات الخبراء "مكلفة أو غير موثوقة أو ببساطة غير متوفرة". [ 3 ] صرّح ديميس هاسابيس ، المؤسس المشارك والرئيس التنفيذي لشركة ديب مايند، بأنّ قوة ألفا غو زيرو تكمن في "عدم تقييده بحدود المعرفة البشرية". [ 4 ] علاوة على ذلك، تفوّق أداء ألفا غو زيرو على نماذج التعلّم العميق المعزز القياسية (مثل تطبيقات شبكة كيو العميقة [ 5 ] ) بفضل دمجه لخوارزمية بحث مونت كارلو الشجرية . وأشار ديفيد سيلفر ، أحد أوائل مؤلفي أوراق ديب مايند المنشورة في مجلة نيتشر حول ألفا غو، إلى إمكانية تعميم خوارزميات الذكاء الاصطناعي من خلال الاستغناء عن الحاجة إلى التعلّم من البشر. [ 6 ]

طوّرت جوجل لاحقًا برنامج AlphaZero ، وهو نسخة معمّمة من AlphaGo Zero، قادرة على لعب الشطرنج والشوجي بالإضافة إلى لعبة غو. [ 7 ] في ديسمبر 2017، تفوّق AlphaZero على نسخة AlphaGo Zero التي خضعت لتدريب لمدة ثلاثة أيام، بفوزه في 60 مباراة مقابل 40، وبعد 8 ساعات من التدريب، تفوّق على AlphaGo Lee وفقًا لمقياس Elo . كما هزم AlphaZero برنامجًا رائدًا في الشطرنج ( Stockfish ) وبرنامجًا رائدًا في الشوجي ( Elmo ). [ 8 ] [ 9 ]

بنيان

الشبكة في برنامج AlphaGo Zero هي شبكة ResNet ذات رأسين. [ 1 ] : الملحق: الطرق

  • يأخذ جذع الشبكة كمدخل تمثيلًا موترًا بحجم 17 × 19 × 19 للوحة لعبة Go.
    • تمثل القنوات الثمانية مواقع أحجار اللاعب الحالي خلال الخطوات الزمنية الثماني الأخيرة. (1 إذا كان هناك حجر، 0 خلاف ذلك. إذا كانت الخطوة الزمنية تسبق بداية اللعبة، فإن جميع المواقع تكون 0).
    • تمثل القنوات الثمانية مواقع أحجار اللاعب الآخر خلال الخطوات الزمنية الثمانية الأخيرة.
    • القناة 1 تكون قيمتها 1 بالكامل إذا كان اللون الأسود سيتحرك، و0 فيما عدا ذلك.
  • الجسم عبارة عن ResNet يحتوي إما على 20 أو 40 كتلة متبقية و 256 قناة.
  • هناك رأسان، رأس السياسة ورأس القيمة.
    • يُخرج رأس السياسة مصفوفة لوجيت بحجم19×19+1{\displaystyle 19\times 19+1}، وهو ما يمثل لوجيت القيام بحركة في إحدى النقاط، بالإضافة إلى لوجيت المرور .
    • يُخرج رأس القيمة رقمًا في النطاق(-1،+1){\displaystyle (-1,+1)}، وهو ما يمثل النتيجة المتوقعة للاعب الحالي. -1 يمثل خسارة اللاعب الحالي، و+1 يمثل فوزه.

تمرين

تم تدريب الشبكة العصبية لبرنامج AlphaGo Zero باستخدام TensorFlow ، مع 64 وحدة معالجة رسومية (GPU) و19 خادمًا لمعاملات وحدة المعالجة المركزية (CPU). واستُخدمت أربع وحدات معالجة تناظرية (TPU) فقط للاستدلال. في البداية، لم تكن الشبكة العصبية تعرف شيئًا عن لعبة Go سوى قواعدها . وعلى عكس الإصدارات السابقة من AlphaGo، لم يكن Zero يدرك سوى أحجار اللوحة، دون وجود حالات استثنائية نادرة مُبرمجة بشريًا للمساعدة في التعرف على وضعيات لوحة Go غير المألوفة. انخرط الذكاء الاصطناعي في التعلم المعزز ، حيث لعب ضد نفسه حتى تمكن من توقع تحركاته وكيف ستؤثر هذه التحركات على نتيجة اللعبة. [ 10 ] في الأيام الثلاثة الأولى، لعب AlphaGo Zero 4.9 مليون مباراة ضد نفسه على التوالي بسرعة. [ 11 ] ويبدو أنه طور المهارات اللازمة للتغلب على أفضل اللاعبين البشريين في غضون أيام قليلة فقط، بينما استغرق برنامج AlphaGo السابق شهورًا من التدريب للوصول إلى المستوى نفسه. [ 12 ]

وفقًا لـ Epoch.ai، بلغت تكلفة التدريب 3e23 FLOPs. [ 13 ]

للمقارنة، قام الباحثون أيضًا بتدريب نسخة من برنامج AlphaGo Zero باستخدام ألعاب بشرية، وهي AlphaGo Master، ووجدوا أنها تعلمت بسرعة أكبر، ولكن أداءها كان أسوأ على المدى الطويل. [ 14 ] قدمت شركة DeepMind نتائجها الأولية في ورقة بحثية إلى مجلة Nature في أبريل 2017، والتي نُشرت لاحقًا في أكتوبر 2017. [ 1 ]

تكلفة الأجهزة

وقد تم تقدير تكلفة الأجهزة لنظام AlphaGo Zero واحد في عام 2017، بما في ذلك وحدات المعالجة الموترية الأربعة، بحوالي 25 مليون دولار. [ 15 ]

التطبيقات

بحسب هاسابيس، من المرجح أن تكون خوارزميات ألفا غو أكثر فائدةً في المجالات التي تتطلب بحثًا ذكيًا في فضاء هائل من الاحتمالات، مثل طي البروتينات (انظر ألفا فولد ) أو محاكاة التفاعلات الكيميائية بدقة. [ 16 ] وربما تكون تقنيات ألفا غو أقل فائدة في المجالات التي يصعب محاكاتها، مثل تعلم قيادة السيارة. [ 17 ] وقد صرّحت ديب مايند في أكتوبر 2017 أنها بدأت بالفعل العمل بنشاط على محاولة استخدام تقنية ألفا غو زيرو لطي البروتينات، وأعلنت أنها ستنشر قريبًا نتائج جديدة. [ 18 ] [ 19 ]

استقبال

حظي برنامج AlphaGo Zero بتقدير واسع النطاق باعتباره تقدماً كبيراً، حتى بالمقارنة مع سابقه الرائد، AlphaGo. وصف أورين إتزيوني من معهد ألين للذكاء الاصطناعي برنامج AlphaGo Zero بأنه "نتيجة تقنية مبهرة للغاية" من حيث "قدرتهم على إنجازه، وقدرتهم على تدريب النظام في غضون 40 يوماً، على أربع وحدات معالجة Tensor Processing Units (TPUs)". [ 10 ] ووصفته صحيفة الغارديان بأنه "إنجاز كبير في مجال الذكاء الاصطناعي"، مستشهدةً بإيليني فاسيلاكي من جامعة شيفيلد وتوم ميتشل من جامعة كارنيجي ميلون ، اللذين وصفاه بأنه إنجاز رائع و"إنجاز هندسي متميز" على التوالي. [ 17 ] ووصف مارك بيسكي من جامعة سيدني برنامج AlphaGo Zero بأنه "تقدم تكنولوجي كبير" يأخذنا إلى "مجال غير مكتشف". [ 20 ]

حذّر غاري ماركوس ، عالم النفس بجامعة نيويورك ، من أن برنامج ألفا غو، على حد علمنا، قد يحتوي على "معرفة ضمنية لدى المبرمجين حول كيفية بناء آلات لحل مسائل مثل لعبة غو"، وسيحتاج إلى اختباره في مجالات أخرى قبل التأكد من فعالية بنيته الأساسية في مجالات تتجاوز لعبة غو. في المقابل، تُبدي شركة ديب مايند "ثقةً في إمكانية تعميم هذا النهج على عدد كبير من المجالات". [ 11 ]

ردًا على التقارير، قال لي سيدول ، لاعب الغو الكوري الجنوبي المحترف : "لم تكن النسخة السابقة من ألفا غو مثالية، وأعتقد أن هذا هو سبب تطوير ألفا غو زيرو". وعن إمكانات تطوير ألفا غو، قال لي إنه سينتظر ليرى، لكنه أشار أيضًا إلى أنه سيؤثر على لاعبي الغو الشباب. وقال موك جين سيوك ، مدير المنتخب الكوري الجنوبي الوطني للغو، إن عالم الغو بدأ بالفعل في محاكاة أساليب لعب النسخ السابقة من ألفا غو واستلهام أفكار جديدة منها، وهو يأمل أن تنبثق أفكار جديدة من ألفا غو زيرو. وأضاف موك أن التوجهات العامة في عالم الغو تتأثر الآن بأسلوب لعب ألفا غو. وقال: "في البداية، كان من الصعب فهمه، وشعرت تقريبًا وكأنني ألعب ضد كائن فضائي. لكن مع اكتسابي خبرة كبيرة، اعتدت عليه". وتابع: "لقد تجاوزنا الآن مرحلة مناقشة الفجوة بين قدرات ألفا غو والبشر، فالمسألة الآن بين أجهزة الكمبيوتر". وبحسب التقارير، فقد بدأ موك بالفعل بتحليل أسلوب لعب ألفا غو زيرو مع لاعبين من المنتخب الوطني. قال موك: "على الرغم من أننا شاهدنا بضع مباريات فقط، إلا أننا شعرنا بأن برنامج ألفا غو زيرو يلعب بشكل أقرب إلى الإنسان من سابقيه". [ 21 ] وعلق لاعب الغو الصيني المحترف كي جي على الإنجازات الرائعة للبرنامج الجديد قائلاً: "إن برنامج ألفا غو الذي يتعلم ذاتيًا هو الأقوى. يبدو البشر غير ضروريين أمام قدرته على التحسين الذاتي". [ 22 ]

مقارنة مع الإصدارات السابقة

التكوين والقوة [ 23 ]
الإصداراتأجهزة التشغيل [ 24 ]تصنيف إيلومباريات
مُعجب ببرنامج AlphaGo176 وحدة معالجة رسومية ، [ 2 ] موزعة3144 [ 1 ]5-0 ضد فان هوي
ألفا غو لي48 وحدة معالجة رسومية ، [ 2 ] موزعة3739 [ 1 ]4-1 ضد لي سيدول
خبير ألفاجو4 وحدات معالجة حرارية، [ 2 ] جهاز واحد4858 [ 1 ]60-0 ضد اللاعبين المحترفين؛

قمة مستقبل لعبة Go

ألفا غو زيرو (40 يومًا)4 وحدات معالجة حرارية، [ 2 ] جهاز واحد5185 [ 1 ]100-0 ضد ألفا غو لي

89:11 ضد سيد ألفاغو

ألفا زيرو (34 ساعة)4 وحدات معالجة حرارية، جهاز واحد [ 8 ]4430 (تقديري) [ 8 ]60:40 ضد ألفاغو زيرو لمدة 3 أيام

ألفا زيرو

في 5 ديسمبر 2017، نشر فريق ديب مايند نسخة أولية على موقع arXiv ، قدّموا فيها برنامج AlphaZero، وهو برنامج يستخدم نهج AlphaGo Zero المعمم، والذي حقق في غضون 24 ساعة مستوىً خارقاً في الشطرنج والشوجي والجو ، متغلبًا على برامج أبطال العالم، Stockfish و Elmo ، ونسخة AlphaGo Zero التي تم تطويرها لمدة 3 أيام في كل حالة. [ 8 ]

يُعدّ برنامج AlphaZero (AZ) نسخةً أكثر عموميةً من خوارزمية AlphaGo Zero (AGZ) ، وهو قادر على لعب الشوغي والشطرنج بالإضافة إلى لعبة غو. وتشمل الاختلافات بين AZ و AGZ ما يلي: [ 8 ]

  • لدى AZ قواعد مُبرمجة مسبقًا لضبط معلمات البحث الفائقة .
  • يتم الآن تحديث الشبكة العصبية باستمرار.
  • يمكن أن تنتهي لعبة الشطرنج (على عكس لعبة غو) بالتعادل؛ لذلك يمكن لـ AZ أن يأخذ في الاعتبار إمكانية حدوث مباراة تعادل.

يتوفر برنامج مفتوح المصدر يُدعى Leela Zero ، مبني على أفكار من أوراق بحثية حول AlphaGo. وهو يستخدم وحدة معالجة رسومية (GPU) بدلاً من وحدات معالجة الموتر (TPU) التي تعتمد عليها الإصدارات الحديثة من AlphaGo.

مراجع

  1. 1 2 3 4 5 6 7 سيلفر، ديفيد ؛ شريتويزر، جوليان؛ سيمونيان، كارين؛ أنتونوغلو، يوانيس؛ هوانغ، آجا ؛ غويز، آرثر؛ هوبرت، توماس؛ بيكر، لوكاس؛ لاي، ماثيو؛ بولتون، أدريان؛ تشين، يوتيان ؛ ليليكراب، تيموثي؛ فان، هوي ؛ سيفري، لوران؛ دريش، جورج فان دن؛ غريبيل، ثور؛ هاسابيس، ديميس (19 أكتوبر 2017). "إتقان لعبة غو دون معرفة بشرية" (ملف PDF) . مجلة نيتشر . 550 (7676): 354-359 . Bibcode : 2017Natur.550..354S . doi : 10.1038/nature24270 . ISSN 0028-0836 . PMID 29052630. S2CID 205261034. مؤرشف (PDF) من الأصل بتاريخ 18 يوليو 2018. تم الاطلاع عليه بتاريخ 2 سبتمبر 2019 .   رمز الوصول المغلق
  2. 1 2 3 4 5 حسابيس، ديميس ؛ سيفر، ديفيد (18 أكتوبر 2017). "ألفا غو زيرو: التعلم من الصفر" . الموقع الرسمي لشركة ديب مايند . مؤرشف من الأصل في 19 أكتوبر 2017. تم الاطلاع عليه في 19 أكتوبر 2017 .
  3. «إنجاز جوجل الجديد في برنامج ألفا غو قد ينقل الخوارزميات إلى آفاق لم يبلغها البشر» . ياهو! فاينانس . ١٩ أكتوبر ٢٠١٧. مؤرشف من الأصل في ١٩ أكتوبر ٢٠١٧. تم الاطلاع عليه في ١٩ أكتوبر ٢٠١٧ .
  4. كنابتون، سارة (18 أكتوبر 2017). "ألفا غو زيرو: حاسوب جوجل ديب مايند العملاق يتعلم 3000 عام من المعرفة البشرية في 40 يومًا" . صحيفة التلغراف . مؤرشف من الأصل في 19 أكتوبر 2017. تم الاطلاع عليه في 19 أكتوبر 2017 .
  5. mnj12 (7 يوليو 2021)، mnj12/chessDeepLearning ، تم الاطلاع عليه في 7 يوليو 2021{{citation}}: صيانة CS1: الأسماء الرقمية: قائمة المؤلفين ( رابط )
  6. "يتعلم برنامج ديب مايند ألفا غو زيرو ذاتيًا دون تدخل بشري" . زد نت . ١٩ أكتوبر ٢٠١٧. مؤرشف من الأصل في ٢٠ أكتوبر ٢٠١٧. تم الاطلاع عليه في ٢٠ أكتوبر ٢٠١٧ .
  7. سيلفر، ديفيد؛ هوبرت، توماس؛ شريتويزر، جوليان (2017). "إتقان الشطرنج والشوجي باللعب الذاتي باستخدام خوارزمية عامة للتعلم المعزز" (ملف PDF) . تم الاطلاع عليه بتاريخ 4 أغسطس 2025 .
  8. 1 2 3 4 5 سيلفر، ديفيد ؛ هوبرت، توماس؛ شريتويزر، جوليان؛ أنطونوغلو، يوانيس؛ لاي، ماثيو؛ غيز، آرثر؛ لانكتوت، مارك؛ سيفري، لوران؛ كوماران، دارشان ؛ غريبيل، ثور؛ ليليكرب، تيموثي؛ سيمونيان، كارين؛ هاسابيس، ديميس (5 ديسمبر 2017). "إتقان الشطرنج والشوجي باللعب الذاتي باستخدام خوارزمية عامة للتعلم المعزز". arXiv : 1712.01815 [ cs.AI ].
  9. كنابتون، سارة؛ واتسون، ليون (6 ديسمبر 2017). "معرفة البشر الكاملة بالشطرنج وتجاوزها بواسطة برنامج ألفا زيرو من ديب مايند في أربع ساعات" . صحيفة التلغراف . مؤرشف من الأصل في 2 ديسمبر 2020. تم الاطلاع عليه في 5 أبريل 2018 .
  10. 1 2 غرينماير، لاري. "الذكاء الاصطناعي ضد الذكاء الاصطناعي: ألفا غو زيرو، الذي تعلم ذاتيًا، يهزم سلفه" . مجلة ساينتفك أمريكان . مؤرشف من الأصل في 19 أكتوبر 2017. تم الاطلاع عليه في 20 أكتوبر 2017 .
  11. 1 2 "يتعلم الكمبيوتر لعب لعبة غو بمستويات خارقة للطبيعة 'بدون معرفة بشرية'"" . NPR . ١٨ أكتوبر ٢٠١٧. مؤرشف من الأصل في ٢٠ أكتوبر ٢٠١٧. تم الاسترجاع في ٢٠ أكتوبر ٢٠١٧. "
  12. "إنجاز جوجل الجديد في برنامج ألفا غو قد ينقل الخوارزميات إلى آفاق لم يبلغها البشر" . مجلة فورتشن . ١٩ أكتوبر ٢٠١٧. مؤرشف من الأصل في ١٩ أكتوبر ٢٠١٧. تم الاطلاع عليه في ٢٠ أكتوبر ٢٠١٧ .
  13. "بيانات عن نماذج الذكاء الاصطناعي البارزة" . إيبوك إيه آي . 19 يونيو 2024. تم الاطلاع عليه بتاريخ 29 نوفمبر 2024 .
  14. «هذا البرنامج الحاسوبي قادر على هزيمة البشر في لعبة غو - دون أي توجيه بشري» . مجلة ساينس | الجمعية الأمريكية لتقدم العلوم . ١٨ أكتوبر ٢٠١٧. مؤرشف من الأصل في ٢ فبراير ٢٠٢٢. تم الاطلاع عليه بتاريخ ٢٠ أكتوبر ٢٠١٧ .
  15. جيبني، إليزابيث (18 أكتوبر 2017). "الذكاء الاصطناعي المُتعلّم ذاتيًا هو الأفضل حتى الآن في لعبة غو الاستراتيجية" . أخبار نيتشر . doi : 10.1038/nature.2017.22858 . مؤرشف من الأصل في 1 مايو 2020. تم الاسترجاع في 10 مايو 2020 .
  16. «أحدث تقنيات الذكاء الاصطناعي قادرة على إنجاز الأمور دون الحاجة إلى تعليم» . مجلة الإيكونوميست . مؤرشف من الأصل بتاريخ 19 أكتوبر 2017. تم الاطلاع عليه بتاريخ 20 أكتوبر 2017 .
  17. 1 2 سامبل، إيان (18 أكتوبر 2017). "«إنها قادرة على خلق المعرفة بنفسها»: جوجل تكشف النقاب عن ذكاء اصطناعي يتعلم ذاتيًا . صحيفة الغارديان . مؤرشف من الأصل بتاريخ 19 أكتوبر 2017. تم الاطلاع عليه بتاريخ 20 أكتوبر 2017 .
  18. "«إنها قادرة على خلق المعرفة بنفسها»: جوجل تكشف النقاب عن ذكاء اصطناعي يتعلم ذاتيًا . صحيفة الغارديان . ١٨ أكتوبر ٢٠١٧. مؤرشف من الأصل في ١٩ أكتوبر ٢٠١٧. تم الاطلاع عليه بتاريخ ٢٦ ديسمبر ٢٠١٧ .
  19. كنابتون، سارة (18 أكتوبر 2017). "ألفا غو زيرو: حاسوب جوجل ديب مايند العملاق يتعلم 3000 عام من المعرفة البشرية في 40 يومًا" . صحيفة التلغراف . مؤرشف من الأصل في 15 ديسمبر 2017. تم الاطلاع عليه في 26 ديسمبر 2017 .
  20. "كيف يمكن للذكاء الاصطناعي الجديد من جوجل أن يعلّم نفسه كيف يهزمك في أكثر الألعاب تعقيدًا" . هيئة الإذاعة الأسترالية . ١٩ أكتوبر ٢٠١٧. مؤرشف من الأصل في ٢٠ أكتوبر ٢٠١٧. تم الاطلاع عليه في ٢٠ أكتوبر ٢٠١٧ .
  21. "لاعبو لعبة غو متحمسون لبرنامج ألفا غو زيرو 'الأكثر شبهاً بالبشر'" . كوريا بيزواير . ١٩ أكتوبر ٢٠١٧. مؤرشف من الأصل في ٢١ أكتوبر ٢٠١٧. تم الاطلاع عليه في ٢١ أكتوبر ٢٠١٧ .
  22. «نسخة جديدة من برنامج ألفا غو قادرة على إتقان لعبة وي تشي دون مساعدة بشرية» . وكالة أنباء الصين . ١٩ أكتوبر ٢٠١٧. مؤرشف من الأصل في ١٩ أكتوبر ٢٠١٧. تم الاطلاع عليه في ٢١ أكتوبر ٢٠١٧ .
  23. "[柯洁战败解密]AlphaGo Master最新架构和算法،谷歌云与TPU拆解" (بالصينية). سوهو . 24 مايو 2017 أرشفة من الأصلي في 17 سبتمبر 2017 . تم الاسترجاع في 1 يونيو 2017 .
  24. قد تكون الأجهزة المستخدمة أثناء التدريب أكثر قوة بشكل ملحوظ