موزيرو

MuZero هو برنامج حاسوبي طورته شركة DeepMind ، التابعة لشركة جوجل والمتخصصة في أبحاث الذكاء الاصطناعي ، لإتقان الألعاب دون معرفة قواعدها وآلياتها. [ 1 ] [ 2 ] [ 3 ] تضمن إصداره عام 2019 معايير لقياس أدائه في ألعاب Go والشطرنج والشوجي ، بالإضافة إلى مجموعة من 57 لعبة مختلفة من ألعاب أتاري . تعتمد خوارزمية البرنامج على نهج مشابه لنهج AlphaZero ، حيث يتم استخدام مزيج من البحث القائم على الشجرة ونموذج مُدرَّب. وقد حقق MuZero أداءً مماثلاً لأداء AlphaZero في الشطرنج والشوجي، وتفوق عليه في لعبة Go ، كما تفوق على أحدث التقنيات في إتقان مجموعة من 57 لعبة من ألعاب أتاري (بيئة التعلم في صالات الألعاب)، وهي بيئة معقدة بصريًا.

تم تدريب MuZero من خلال اللعب الذاتي ، دون الوصول إلى القواعد أو كتب الافتتاح أو قواعد بيانات نهاية اللعبة. استخدمت الخوارزمية المدربة نفس البنية الالتفافية والمتبقية المستخدمة في AlphaZero، ولكن مع عدد خطوات حسابية أقل بنسبة 20% لكل عقدة في شجرة البحث. [ 4 ]

تاريخ

يكتشف برنامج MuZero بنفسه كيفية بناء نموذج وفهمه انطلاقاً من المبادئ الأساسية.

ديفيد سيلفر، ديب مايند، وايرد [ 5 ]

في 19 نوفمبر 2019، أصدر فريق DeepMind نسخة أولية تقدم MuZero.

مشتق من ألفا زيرو

يُعدّ MuZero (MZ) مزيجًا من التخطيط عالي الأداء لخوارزمية AlphaZero (AZ) مع أساليب التعلّم المعزز غير المعتمد على النماذج. يتيح هذا المزيج تدريبًا أكثر كفاءة في أنظمة التخطيط التقليدية، مثل لعبة Go، مع القدرة على التعامل مع مجالات ذات مدخلات أكثر تعقيدًا في كل مرحلة، مثل ألعاب الفيديو المرئية.

تم اشتقاق MuZero مباشرة من كود AZ، ويشترك معه في قواعد ضبط المعلمات الفائقة . تشمل الاختلافات بين النهجين ما يلي: [ 6 ]

  • تعتمد عملية التخطيط في AZ على محاكاة . تعرف هذه المحاكاة قواعد اللعبة، ويجب برمجتها بشكل صريح. ثم تقوم شبكة عصبية بالتنبؤ بالسياسة وقيمة أي موقع مستقبلي. تُستخدم المعرفة التامة بقواعد اللعبة في نمذجة انتقالات الحالة في شجرة البحث، والإجراءات المتاحة عند كل عقدة، وإنهاء فرع من فروع الشجرة. أما MZ فلا تملك إمكانية الوصول إلى القواعد، بل تتعلمها باستخدام الشبكات العصبية.
  • لدى AZ نموذج واحد للعبة (من حالة اللوحة إلى التنبؤات)؛ لدى MZ نماذج منفصلة لتمثيل الحالة الحالية (من حالة اللوحة إلى تضمينها الداخلي)، وديناميكيات الحالات (كيف تغير الإجراءات تمثيلات حالات اللوحة)، والتنبؤ بالسياسة وقيمة الموقف المستقبلي (بالنظر إلى تمثيل الحالة).
  • قد يكون النموذج الخفي لـ MZ معقدًا، وقد يتبين أنه قادر على استضافة العمليات الحسابية؛ ويُعد استكشاف تفاصيل النموذج الخفي في نسخة مدربة من MZ موضوعًا يستحق الاستكشاف في المستقبل.
  • لا تتوقع خوارزمية MZ لعبة ثنائية اللاعبين يفوز فيها الفائز بكل شيء. فهي تعمل مع سيناريوهات التعلم المعزز القياسية، بما في ذلك بيئات الوكيل الواحد مع مكافآت وسيطة مستمرة، قد تكون ذات قيمة عشوائية ومع خصم زمني. أما خوارزمية AZ فقد صُممت لألعاب ثنائية اللاعبين يمكن الفوز فيها أو التعادل أو الخسارة.

مقارنة مع R2D2

كانت أحدث التقنيات السابقة لتعلم لعب مجموعة ألعاب أتاري هي R2D2، وهي تقنية إعادة التشغيل المتكررة الموزعة DQN. [ 7 ]

تفوق MuZero على كل من متوسط ​​أداء R2D2 ومتوسط ​​أدائه في جميع الألعاب، على الرغم من أنه لم يكن أفضل في كل لعبة.

التدريب والنتائج

استخدم MuZero 16 وحدة معالجة موترات من الجيل الثالث (TPUs) للتدريب، و1000 وحدة معالجة موترات للعب الذاتي لألعاب الطاولة، مع 800 محاكاة لكل خطوة و8 وحدات معالجة موترات للتدريب و32 وحدة معالجة موترات للعب الذاتي لألعاب أتاري، مع 50 محاكاة لكل خطوة.

استخدمت ألفا زيرو 64 وحدة معالجة من الجيل الثاني للتدريب، و5000 وحدة معالجة من الجيل الأول للعب الذاتي. ونظرًا لتحسن تصميم وحدات المعالجة (حيث أن رقائق الجيل الثالث أقوى بمرتين من رقائق الجيل الثاني، مع مزيد من التقدم في عرض النطاق الترددي والشبكات بين الرقائق في الوحدة)، فإن هذه الإعدادات التدريبية متقاربة.

تم تدريب الروبوت R2D2 لمدة 5 أيام من خلال 2 مليون خطوة تدريبية.

النتائج الأولية

حقق MuZero أداءً مماثلاً لأداء AlphaZero في الشطرنج والشوجي بعد حوالي مليون خطوة تدريبية. كما حقق أداءً مماثلاً لأداء AZ في لعبة غو بعد 500 ألف خطوة تدريبية، وتفوق عليه بمليون خطوة. وحقق أيضاً أداءً مماثلاً لأداء R2D2 المتوسط ​​والوسيط في جميع ألعاب أتاري بعد 500 ألف خطوة تدريبية، وتفوق عليه بمليون خطوة، مع أنه لم يحقق أداءً جيداً في 6 ألعاب من هذه المجموعة.

اعتُبرت MuZero تطورًا هامًا مقارنةً بـ AlphaZero، وخطوةً عامة نحو الأمام في تقنيات التعلم غير الخاضع للإشراف. [ 8 ] [ 9 ] واعتُبر هذا العمل بمثابة تطوير لفهم كيفية بناء الأنظمة من مكونات أصغر، وهو تطوير على مستوى الأنظمة أكثر من كونه تطويرًا للتعلم الآلي البحت. [ 10 ]

على الرغم من أن فريق التطوير لم ينشر سوى الشفرة الزائفة، إلا أن فيرنر دوفود أنتج تطبيقًا مفتوح المصدر بناءً على ذلك. [ 11 ]

تم استخدام MuZero كتطبيق مرجعي في أعمال أخرى، على سبيل المثال كوسيلة لتوليد سلوك قائم على النموذج. [ 12 ]

في أواخر عام 2021، تم اقتراح نسخة أكثر كفاءة من برنامج MuZero، أطلق عليها اسم EfficientZero. وقد حققت هذه النسخة "أداءً بشريًا متوسطًا بنسبة 194.3% وأداءً وسيطًا بنسبة 109.0% على معيار Atari 100k بعد ساعتين فقط من تجربة اللعب في الوقت الفعلي". [ 13 ]

في أوائل عام 2022، تم اقتراح نسخة معدلة من MuZero للعب الألعاب العشوائية (على سبيل المثال 2048 ، الطاولة )، تسمى Stochastic MuZero، والتي تستخدم ديناميكيات الحالة اللاحقة ورموز الصدفة لمراعاة الطبيعة العشوائية للبيئة عند تدريب شبكة الديناميكيات. [ 14 ]

في فبراير 2022، أعلنت شركة ديب مايند عن أول تطبيق لتقنية MuZero في مهمة واقعية، وذلك بالتعاون مع يوتيوب لتحسين ضغط الفيديو في برنامج الترميز VP9 مفتوح المصدر. وقد استبدلت نسخةٌ تُسمى MuZero-RC آلية التحكم الافتراضية في معدل البت في VP9، حيث اختارت معيار التكميم لكل إطار، وحققت انخفاضًا في معدل البت بنسبة 4% في المتوسط ​​عبر مجموعة متنوعة من مقاطع الفيديو دون أي تدهور في الجودة. [ 15 ]

انظر أيضاً

مراجع

  1. ويغرز، كايل (20 نوفمبر 2019). "برنامج MuZero من DeepMind يُعلّم نفسه كيفية الفوز في ألعاب أتاري والشطرنج والشوجي والجو" . VentureBeat . تاريخ الاسترجاع: 22 يوليو 2020 .
  2. فريدل، فريدريك. "MuZero يفهم الشطرنج، القواعد وكل شيء" . ChessBase GmbH . تم الاطلاع عليه بتاريخ 22 يوليو 2020 .
  3. رودريغيز، خيسوس. "ديب مايند تكشف النقاب عن موزيرو، عميل جديد أتقن الشطرنج والشوجي وأتاري والجو دون معرفة القواعد" . كي دي ناغتس . تم الاطلاع عليه بتاريخ 22 يوليو 2020 .
  4. ^ شريتويزر ، جوليان. أنتونوغلو، يوانيس؛ هيوبرت، توماس. سيمونيان، كارين؛ سيفري، لوران؛ شميت، سيمون. جويز، آرثر؛ لوكهارت، إدوارد. هاسابيس، ديميس؛ جريبيل، ثور؛ ليليكراب ، تيموثي (2020). "إتقان Atari وGo والشطرنج والشوغي من خلال التخطيط باستخدام نموذج مكتسب". طبيعة . 588 (7839): 604–609 . أرخايف : 1911.08265 . بيب كود : 2020Natur.588..604S . دوى : 10.1038/s41586-020-03051-4 . بميد 33361790 . S2CID 208158225 .  
  5. "ما يمكن أن يعلمنا إياه برنامج ألفا غو عن كيفية تعلم الناس" . مجلة وايرد . الرقم الدولي الموحد للدوريات 1059-1028 . تاريخ الاسترجاع: 25 ديسمبر 2020 . 
  6. سيلفر، ديفيد ؛ هوبرت، توماس؛ شريتويزر، جوليان؛ أنطونوغلو، يوانيس؛ لاي، ماثيو؛ غيز، آرثر؛ لانكتوت، مارك؛ سيفري، لوران؛ كوماران، دارشان ؛ غريبيل، ثور؛ ليليكرب، تيموثي؛ سيمونيان، كارين؛ هاسابيس، ديميس (5 ديسمبر 2017). "إتقان الشطرنج والشوجي باللعب الذاتي باستخدام خوارزمية عامة للتعلم المعزز". arXiv : 1712.01815 [ cs.AI ].
  7. كابتوروفسكي، ستيفن؛ أوستروفسكي، جورج؛ كوان، جون؛ مونوس، ريمي؛ دابني، ويل. إعادة تشغيل الخبرة المتكررة في التعلم المعزز الموزع . المؤتمر الدولي للتعلم المعزز 2019 - عبر Open Review.
  8. شاه، روهين (27 نوفمبر 2019). " [ AN #75 ] : حل ألغاز أتاري وجو باستخدام نماذج الألعاب المُتعلمة، وأفكار من موظف في معهد أبحاث المعلوماتية - LessWrong 2.0" . www.lesswrong.com . تاريخ الاسترجاع: 7 يونيو 2020 .
  9. وو، جون. "التعلم المعزز، شريك التعلم العميق" . فوربس . تم الاسترجاع في 15 يوليو 2020 .
  10. "التعلم الآلي والروبوتات: رؤيتي (المتحيزة) لحالة المجال في عام 2019" . cachestocaches.com . تم الاطلاع عليه بتاريخ 15 يوليو 2020 .
  11. دوفو، فيرنر (2020-07-15)، werner-duvaud/muzero-general ، تم الاطلاع عليه بتاريخ 2020-07-15
  12. فان سيجن، هارم؛ نيكوي، هادي؛ راكاه، إيفان؛ تشاندار، ساراث (2020-07-06). "ندم LoCA: مقياس متسق لتقييم السلوك القائم على النموذج في التعلم المعزز". arXiv : 2007.03158 [ cs.stat ].
  13. يي، ويروي؛ ليو، شاوهواي؛ كوروتاش، ثانارد؛ أبيل، بيتر؛ غاو، يانغ (2021-12-11). "إتقان ألعاب أتاري ببيانات محدودة". arXiv : 2111.00210 [ cs.LG ].
  14. أنتونوغلو، يوانيس؛ شريتويزر، جوليان؛ أوزير، سرجيل؛ هوبرت، توماس؛ سيلفر، ديفيد (28 يناير 2022). "التخطيط في البيئات العشوائية باستخدام نموذج مُدرَّب" . تم الاسترجاع في 12 ديسمبر 2023 .
  15. "الخطوة الأولى لشركة MuZero من البحث إلى العالم الحقيقي" . ديب مايند. 11 فبراير 2022. تم الاطلاع عليه في 20 يونيو 2026 .