التعلم العميق المعزز

التعلم المعزز العميق ( deep RL ) هو فرع من فروع التعلم الآلي يجمع بين التعلم المعزز (RL) والتعلم العميق . يدرس التعلم المعزز مشكلة تعلم وكيل حاسوبي اتخاذ القرارات من خلال التجربة والخطأ. يدمج التعلم المعزز العميق التعلم العميق في الحل، مما يسمح للوكلاء باتخاذ القرارات من بيانات إدخال غير منظمة دون الحاجة إلى هندسة يدوية لمساحة الحالة . تستطيع خوارزميات التعلم المعزز العميق استيعاب مدخلات ضخمة جدًا (مثل كل بكسل يُعرض على الشاشة في لعبة فيديو) وتحديد الإجراءات التي يجب تنفيذها لتحسين هدف معين (مثل زيادة نقاط اللعبة). وقد استُخدم التعلم المعزز العميق في مجموعة متنوعة من التطبيقات، بما في ذلك على سبيل المثال لا الحصر: الروبوتات ، وألعاب الفيديو ، ومعالجة اللغات الطبيعية ، ورؤية الحاسوب ، [ 1 ] والتعليم، والنقل، والتمويل، والرعاية الصحية . [ 2 ]

ملخص

التعلم العميق

رسم توضيحي لشبكة عصبية اصطناعية أساسية

التعلم العميق هو شكل من أشكال التعلم الآلي يحوّل مجموعة من المدخلات إلى مجموعة من المخرجات عبر شبكة عصبية اصطناعية . وقد أثبتت أساليب التعلم العميق، التي غالبًا ما تستخدم التعلم الخاضع للإشراف مع مجموعات بيانات مصنفة، قدرتها على حل المهام التي تتضمن التعامل مع بيانات إدخال أولية معقدة وعالية الأبعاد (مثل الصور) مع تقليل الحاجة إلى هندسة الميزات اليدوية مقارنةً بالأساليب السابقة، مما أتاح تقدمًا ملحوظًا في العديد من المجالات، بما في ذلك رؤية الحاسوب ومعالجة اللغة الطبيعية . في العقد الماضي، حقق التعلم المعزز العميق نتائج باهرة في مجموعة واسعة من المشكلات، بدءًا من الألعاب الفردية والمتعددة اللاعبين مثل لعبة غو ، وألعاب أتاري ، ودوتا 2 ، وصولًا إلى الروبوتات. [ 3 ]

التعلم المعزز

رسم توضيحي يشرح الحلقة المتكررة في خوارزميات التعلم المعزز
رسم تخطيطي للحلقة المتكررة في خوارزميات التعلم المعزز

التعلم المعزز هو عملية يتعلم فيها العامل اتخاذ القرارات من خلال التجربة والخطأ. غالبًا ما يتم نمذجة هذه المشكلة رياضيًا كعملية قرار ماركوف (MDP)، حيث يكون العامل في كل خطوة زمنية في حالةs{\displaystyle s}، يتخذ إجراءًأ{\displaystyle a}، ويحصل على مكافأة قياسية وينتقل إلى الحالة التاليةs{\displaystyle s'}وفقًا لديناميكيات البيئةص(s|s،أ){\displaystyle p(s'|s,a)}يحاول الوكيل تعلم سياسة معينةπ(أ|s){\displaystyle \pi (a|s)}أو رسم خريطة من الملاحظات إلى الإجراءات، بهدف تعظيم عوائدها (مجموع المكافآت المتوقعة). في التعلم المعزز (على عكس التحكم الأمثل )، لا تملك الخوارزمية سوى إمكانية الوصول إلى الديناميكيات.ص(s|s،أ){\displaystyle p(s'|s,a)}من خلال أخذ العينات.

التعلم العميق المعزز

في العديد من مشاكل صنع القرار العملية، الدولs{\displaystyle s}تكون معظم عمليات ماركوف للقرار (MDP) ذات أبعاد عالية (مثل الصور الملتقطة بكاميرا أو تدفق البيانات الخام من مستشعر روبوت) ولا يمكن حلها باستخدام خوارزميات التعلم المعزز التقليدية. تُدمج خوارزميات التعلم المعزز العميق التعلم العميق لحل عمليات ماركوف للقرار هذه، وغالبًا ما تمثل السياسة.π(أ|s){\displaystyle \pi (a|s)}أو وظائف أخرى متعلمة كشبكة عصبية وتطوير خوارزميات متخصصة تعمل بشكل جيد في هذا السياق.

تاريخ

مع تزايد الاهتمام بالشبكات العصبية بدءًا من منتصف ثمانينيات القرن الماضي، نما الاهتمام بالتعلم العميق المعزز، حيث تُستخدم الشبكة العصبية في التعلم المعزز لتمثيل السياسات أو دوال القيمة. ولأن عملية اتخاذ القرار بأكملها في مثل هذا النظام، بدءًا من أجهزة الاستشعار وصولًا إلى المحركات في الروبوت أو العامل، تتم عبر شبكة عصبية واحدة ، يُطلق عليه أحيانًا اسم التعلم المعزز الشامل. [ 4 ] كان برنامج TD-Gammon ، الذي طُوّر عام 1992 للعب الطاولة ، أحد أوائل التطبيقات الناجحة للتعلم المعزز باستخدام الشبكات العصبية . [ 5 ] استُخدمت أربعة مدخلات لعدد القطع من لون معين في موقع معين على اللوحة، ليصبح المجموع 198 إشارة إدخال. وبفضل افتقاره للمعرفة المسبقة، تعلمت الشبكة لعب اللعبة بمستوى متوسط ​​من خلال اللعب الذاتي و TD(λ{\displaystyle \lambda }) .

ساهمت الكتب المدرسية الرائدة لساتون وبارتو حول التعلم المعزز، [ 6 ] وبيرتسيكاس وتسيتيكليس حول البرمجة العصبية الديناميكية، [ 7 ] وغيرهم [ 8 ] في تطوير المعرفة والاهتمام بهذا المجال.

أظهرت مجموعة كاتسوناري شيباتا أن وظائف متنوعة تظهر في هذا الإطار، [ 9 ] [ 10 ] [ 11 ] بما في ذلك التعرف على الصور، وثبات اللون، وحركة المستشعرات (التعرف النشط)، والتنسيق بين اليد والعين وحركة وصول اليد، وتفسير أنشطة الدماغ، ونقل المعرفة، والذاكرة، [ 12 ] والانتباه الانتقائي، والتنبؤ، والاستكشاف. [ 10 ] [ 13 ]

ابتداءً من عام 2012 تقريباً، أدت ثورة التعلم العميق إلى زيادة الاهتمام باستخدام الشبكات العصبية العميقة كمقاربات للدوال في مختلف المجالات. وقد أدى ذلك إلى تجدد اهتمام الباحثين باستخدام الشبكات العصبية العميقة لتعلم دوال السياسة والقيمة و/أو Q الموجودة في خوارزميات التعلم المعزز الحالية.

ابتداءً من عام 2013 تقريبًا، حققت شركة DeepMind نتائج مبهرة في مجال التعلم باستخدام التعلم المعزز العميق (Deep RL) للعب ألعاب فيديو أتاري . [ 14 ] [ 15 ] اعتمد برنامج تشغيل الكمبيوتر على شبكة عصبية مُدرَّبة باستخدام خوارزمية التعلم المعزز العميق، وهي نسخة متعمقة من خوارزمية Q-learning أطلقوا عليها اسم شبكات Q العميقة (DQN)، حيث كانت نتيجة اللعبة هي المكافأة. استخدموا شبكة عصبية تلافيفية عميقة لمعالجة 4 إطارات من وحدات البكسل RGB (84×84) كمدخلات. تم تعلم جميع الألعاب الـ 49 باستخدام نفس بنية الشبكة وبأقل قدر من المعرفة المسبقة، متفوقةً على الطرق المنافسة في جميع الألعاب تقريبًا، ومحققةً أداءً يُضاهي أو يفوق أداء مُختبِر ألعاب بشري محترف. [ 15 ]

بلغ التعلم العميق المعزز إنجازًا بارزًا آخر في عام 2015 عندما أصبح برنامج AlphaGo ، [ 16 ] وهو برنامج حاسوبي مُدرَّب على التعلم العميق المعزز للعب لعبة Go ، أول برنامج حاسوبي يهزم لاعبًا بشريًا محترفًا في لعبة Go دون أي عوائق على رقعة كاملة الحجم 19×19. وفي مشروع لاحق عام 2017، حسّن برنامج AlphaZero الأداء في لعبة Go ، كما أثبت قدرته على استخدام الخوارزمية نفسها لتعلم لعب الشطرنج والشوجي بمستوى يُنافس أو يتفوق على البرامج الحاسوبية الموجودة في هاتين اللعبتين، ثم تحسّن مرة أخرى عام 2019 مع برنامج MuZero . [ 17 ] وفي سياق منفصل، حقق باحثون من جامعة كارنيجي ميلون إنجازًا آخر عام 2019 بتطويرهم برنامج Pluribus ، وهو برنامج حاسوبي للعب البوكر، وكان أول برنامج يهزم محترفين في مباريات متعددة اللاعبين من لعبة تكساس هولدم بدون حد أقصى . وفي عام 2019 أيضًا، هزم برنامج OpenAI Five ، وهو برنامج للعب Dota 2 بخمسة لاعبين، أبطال العالم السابقين في مباراة استعراضية.

تم تطبيق التعلم العميق المعزز في العديد من المجالات خارج نطاق الألعاب. ففي مجال الروبوتات، استُخدم لتمكين الروبوتات من أداء مهام منزلية بسيطة [ 18 ] وحل مكعب روبيك باستخدام يد روبوتية. [ 19 ] [ 20 ] كما وُجدت تطبيقات للتعلم العميق المعزز في مجال الاستدامة، حيث استُخدم لتقليل استهلاك الطاقة في مراكز البيانات. [ 21 ] ويُعدّ التعلم العميق المعزز للقيادة الذاتية مجالًا بحثيًا نشطًا في الأوساط الأكاديمية والصناعية. [ 22 ] وقد استكشفت شركة لون التعلم العميق المعزز لتوجيه بالوناتها على ارتفاعات عالية ذاتيًا. [ 23 ]

الخوارزميات

توجد تقنيات متنوعة لتدريب السياسات على حل المهام باستخدام خوارزميات التعلم العميق المعزز، ولكل منها مزاياها الخاصة. على أعلى مستوى، ثمة فرق بين التعلم المعزز القائم على النموذج والتعلم المعزز غير القائم على النموذج، ويشير هذا الفرق إلى ما إذا كانت الخوارزمية تحاول تعلم نموذج أمامي لديناميكيات البيئة.

في خوارزميات التعلم العميق المعزز القائمة على النماذج ، يُقدَّر نموذج أمامي لديناميكيات البيئة، عادةً من خلال التعلم الخاضع للإشراف باستخدام شبكة عصبية. بعد ذلك، تُحدَّد الإجراءات باستخدام التحكم التنبؤي بالنموذج المُدرَك. ولأن ديناميكيات البيئة الحقيقية عادةً ما تختلف عن الديناميكيات المُدرَكة، يُعيد العامل تخطيط مساره بشكل متكرر عند تنفيذ الإجراءات في البيئة. ويمكن تحسين الإجراءات المُختارة باستخدام طرق مونت كارلو، مثل طريقة الإنتروبيا المتقاطعة ، أو من خلال دمج التعلم القائم على النماذج مع الطرق غير القائمة على النماذج.

في خوارزميات التعلم العميق المعزز غير المعتمدة على النموذج ، سياسةπ(أ|s){\displaystyle \pi (a|s)}يتم تعلمها دون نمذجة ديناميكيات التقدم بشكل صريح. يمكن تحسين السياسة لتعظيم العوائد من خلال التقدير المباشر لتدرج السياسة [ 24 ] ، لكنها تعاني من تباين عالٍ، مما يجعلها غير عملية للاستخدام مع تقريب الدوال في التعلم المعزز العميق. وقد طُوّرت خوارزميات لاحقة لتعلم أكثر استقرارًا، وطُبّقت على نطاق واسع. [ 25 ] [ 26 ] يعتمد نوع آخر من خوارزميات التعلم المعزز العميق غير المعتمدة على النموذج على البرمجة الديناميكية ، المستوحاة من تعلم الفرق الزمني وتعلم Q. في فضاءات الفعل المنفصلة، ​​تتعلم هذه الخوارزميات عادةً دالة Q للشبكة العصبية.سؤال(s،أ){\displaystyle Q(s,a)}ذلك الذي يقدر العوائد المستقبلية لاتخاذ إجراءأ{\displaystyle a}من الولايةs{\displaystyle s}[ 14 ] في الفضاءات المتصلة، غالباً ما تتعلم هذه الخوارزميات كلاً من تقدير القيمة والسياسة. [ 27 ] [ 28 ] [ 29 ]

بحث

يُعد التعلم العميق المعزز مجالاً بحثياً نشطاً، وله عدة مسارات بحثية.

استكشاف

يجب على وكيل التعلم المعزز تحقيق التوازن بين الاستكشاف والاستغلال: أي اتخاذ القرار بشأن ما إذا كان سيتبع إجراءات معروفة مسبقًا بتحقيق مكافآت عالية، أو يستكشف إجراءات أخرى لاكتشاف مكافآت أعلى. عادةً ما يجمع وكلاء التعلم المعزز البيانات باستخدام نوع من السياسات العشوائية، مثل توزيع بولتزمان في فضاءات الإجراءات المنفصلة، ​​أو التوزيع الغاوسي في فضاءات الإجراءات المتصلة، مما يحفز سلوك الاستكشاف الأساسي. تكمن فكرة الاستكشاف القائم على الجدة، أو المدفوع بالفضول، في منح الوكيل دافعًا لاستكشاف نتائج غير معروفة بهدف إيجاد أفضل الحلول. ويتم ذلك من خلال "تعديل دالة الخسارة (أو حتى بنية الشبكة) بإضافة حدود لتحفيز الاستكشاف". [ 30 ] كما يمكن مساعدة الوكيل في الاستكشاف من خلال استخدام عروض توضيحية للمسارات الناجحة، أو تشكيل المكافآت، مما يمنح الوكيل مكافآت وسيطة مصممة خصيصًا لتناسب المهمة التي يحاول إنجازها. [ 31 ]

التعلم المعزز خارج السياسة

يُعدّ التمييز بين خوارزميات التعلم المعزز القائمة على السياسة، والتي تتطلب تقييم أو تحسين السياسة التي تجمع البيانات، وخوارزميات التعلم المعزز غير القائمة على السياسة، والتي تستطيع تعلم سياسة من بيانات مُولّدة بواسطة سياسة عشوائية، تمييزًا هامًا في مجال التعلم المعزز. عمومًا، تُعدّ الطرق القائمة على دالة القيمة، مثل خوارزمية Q-learning، أنسب للتعلم المعزز غير القائم على السياسة، وتتميز بكفاءة أعلى في استخدام العينات، حيث يقلّ حجم البيانات اللازمة لتعلم مهمة ما، نظرًا لإعادة استخدام البيانات في عملية التعلم. وفي أقصى الحالات، يُعنى التعلم المعزز غير المتصل بالإنترنت (أو "الدفعي") بتعلم سياسة من مجموعة بيانات ثابتة دون أي تفاعل إضافي مع البيئة.

التعلم المعزز العكسي

يشير التعلم المعزز العكسي إلى استنتاج دالة المكافأة لعامل ما بناءً على سلوكه. ويمكن استخدام التعلم المعزز العكسي للتعلم من العروض التوضيحية (أو التعلم بالتدريب العملي ) من خلال استنتاج مكافأة المُظهِر، ثم تحسين السياسة لتعظيم العوائد باستخدام التعلم المعزز. وقد استُخدمت أساليب التعلم العميق في أشكال مختلفة من التعلم بالتقليد والتعلم المعزز العكسي. [ 32 ]

التعلم المعزز المشروط بالهدف

يُعدّ مجال تعلم السياسات المشروطة بالأهداف، والتي تسمى أيضاً السياسات السياقية أو العالمية، مجالاً بحثياً نشطاً آخر.π(أ|s،ز){\displaystyle \pi (a|s,g)}والتي تتضمن هدفًا إضافيًاز{\displaystyle g}كمدخل لتوصيل الهدف المنشود إلى العامل. [ 33 ] إعادة تجربة الإدراك اللاحق هي طريقة للتعلم المعزز المشروط بالهدف، تتضمن تخزين المحاولات الفاشلة السابقة لإنجاز مهمة ما والتعلم منها. [ 34 ] على الرغم من أن المحاولة الفاشلة قد لا تحقق الهدف المنشود، إلا أنها يمكن أن تكون بمثابة درس لكيفية تحقيق النتيجة غير المقصودة من خلال إعادة تسمية الإدراك اللاحق.

التعلم المعزز متعدد العوامل

لا تقتصر العديد من تطبيقات التعلم المعزز على وكيل واحد فقط، بل تشمل مجموعة من الوكلاء الذين يتعلمون معًا ويتكيفون بشكل مشترك. قد يكون هؤلاء الوكلاء تنافسيين، كما هو الحال في العديد من الألعاب، أو متعاونين كما هو الحال في العديد من أنظمة الوكلاء المتعددة في العالم الحقيقي. يدرس التعلم المعزز متعدد الوكلاء المشكلات المطروحة في هذا السياق.

تعميم

يكمن وعد استخدام أدوات التعلم العميق في التعلم المعزز في التعميم: القدرة على العمل بشكل صحيح على مدخلات لم يسبق رؤيتها. على سبيل المثال، يمكن للشبكات العصبية المدربة على التعرف على الصور أن تتعرف على وجود طائر في صورة ما حتى لو لم يسبق لها رؤية تلك الصورة تحديدًا أو حتى ذلك الطائر تحديدًا. وبما أن التعلم المعزز العميق يسمح باستخدام البيانات الأولية (مثل البكسلات) كمدخلات، تقل الحاجة إلى تحديد البيئة مسبقًا، مما يسمح بتعميم النموذج على تطبيقات متعددة. بفضل طبقة التجريد هذه، يمكن تصميم خوارزميات التعلم المعزز العميق بطريقة تجعلها عامة، ويمكن استخدام النموذج نفسه لمهام مختلفة. [ 35 ] إحدى طرق زيادة قدرة السياسات المدربة باستخدام سياسات التعلم المعزز العميق على التعميم هي دمج تعلم التمثيل . [ 36 ]

التعلم المعزز العميق لاتخاذ القرارات المالية

تزايدت الأبحاث التي تتناول استخدام التعلم المعزز العميق في حل المشكلات المالية، ولا سيما تحسين المحافظ الاستثمارية . تعتمد الأساليب التقليدية، مثل نظرية المحفظة الحديثة، على تحسين متوسط ​​التباين لتحقيق التوازن بين المخاطر والعائد. إلا أنها غالباً ما تفتقر إلى المرونة اللازمة في الأسواق المتقلبة. في المقابل، يعيد التعلم المعزز العميق صياغة المشكلة كعملية ديناميكية لاتخاذ القرارات باستخدام أطر عمل مثل عمليات اتخاذ القرار ماركوفية أو عمليات اتخاذ القرار ماركوفية المرصودة جزئياً .

يُمكّن هذا النهج وكيل التعلم المعزز العميق من التفاعل المستمر مع السوق، واتخاذ قرارات تهدف إلى تعظيم العوائد طويلة الأجل بناءً على البيانات المتغيرة. وتلعب المكونات الأساسية لنماذج التعلم المعزز العميق، مثل فضاءات الحالة والفعل، ودوال المكافأة، وتقنيات تحسين السياسات، دورًا حاسمًا في هذه القدرة على التكيف. وتتميز نماذج مثل تدرج السياسة الحتمي العميق (DDPG) وتحسين السياسات التقريبي (PPO) بتطبيقها في فضاءات الفعل المستمرة وقدرتها على التعامل مع تعقيد الأسواق المالية. [ 37 ] [ 38 ] [ 39 ]

لا يزال تطبيق التعلم المعزز العميق في مجال المشاكل المالية مجالاً بحثياً متطوراً.

مراجع

  1. لي، نغان؛ راثور، فيديوار سينغ؛ يامازاكي، كاشو؛ لو، خوا؛ سافيدس، ماريوس (2022-04-01). "التعلم العميق المعزز في رؤية الحاسوب: دراسة شاملة". مراجعة الذكاء الاصطناعي . 55 (4): 2733-2819 . arXiv : 2108.11510 . doi : 10.1007 /s10462-021-10061-9 . ISSN 1573-7462 . 
  2. فرانسوا-لافيه، فنسنت؛ هندرسون، بيتر؛ إسلام، رياضات؛ بيلمار، مارك ج.؛ بينو، جويل (2018). "مقدمة في التعلم العميق المعزز". أسس واتجاهات في تعلم الآلة . 11 ( 3-4 ): 219-354 . arXiv : 1811.12560 . Bibcode : 2018arXiv181112560F . doi : 10.1561/2200000071 . ISSN 1935-8237 . S2CID 54434537 .  
  3. غرايسر، لورا. "أسس التعلم العميق المعزز: النظرية والتطبيق في بايثون" . مكتبة جامعة تلكوم المفتوحة . تاريخ الاسترجاع: 1 يوليو 2023 .
  4. ديميس، هاسابيس (11 مارس 2016). الذكاء الاصطناعي والمستقبل (خطاب).
  5. تيسورو، جيرالد (مارس 1995). "التعلم بالفرق الزمني وTD-Gammon" . اتصالات ACM . 38 (3): 58-68 . doi : 10.1145/203330.203343 . S2CID 8763243 . 
  6. ساتون، ريتشارد؛ بارتو، أندرو (سبتمبر 1996). التعلم المعزز: مقدمة . أثينا ساينتيفيك.
  7. بيرتسيكاس، جون؛ تسيتسيكليس، ديمتري (سبتمبر 1996). البرمجة العصبية الديناميكية . أثينا ساينتيفيك. ISBN 1-886529-10-8.
  8. ميلر، دبليو. توماس؛ ويربوس، بول؛ ساتون، ريتشارد (1990). الشبكات العصبية للتحكم .
  9. شيباتا، كاتسوناري؛ أوكابي، يويتشي (1997). التعلم المعزز عند إعطاء الإشارات الحسية البصرية مباشرةً كمدخلات (ملف PDF) . المؤتمر الدولي للشبكات العصبية (ICNN) 1997. مؤرشف من الأصل (ملف PDF) بتاريخ 9 ديسمبر 2020. تم الاطلاع عليه بتاريخ 1 ديسمبر 2020 .
  10. 1 2 شيباتا، كاتسوناري؛ إيدا، ماسارو (2003). اكتساب مهارة دفع الصندوق من خلال التعلم المعزز القائم على الرؤية المباشرة (ملف PDF) . المؤتمر السنوي لجمعية علوم الحاسوب والهندسة 2003. مؤرشف من الأصل (ملف PDF) بتاريخ 9 ديسمبر 2020. تم الاطلاع عليه بتاريخ 1 ديسمبر 2020 .
  11. شيباتا، كاتسوناري (7 مارس 2017). "الوظائف التي تنشأ من خلال التعلم المعزز الشامل". arXiv : 1703.02239 [ cs.AI ].
  12. أوتسونوميا، هيروكي؛ شيباتا، كاتسوناري (2008). السلوك السياقي والتمثيلات الداخلية المكتسبة من خلال التعلم المعزز باستخدام شبكة عصبية متكررة في مهمة فضاء الحالة والفعل المستمر (ملف PDF) . المؤتمر الدولي لمعالجة المعلومات العصبية (ICONIP) '08. مؤرشف من الأصل (ملف PDF) بتاريخ 10 أغسطس 2017. تم الاطلاع عليه بتاريخ 14 ديسمبر 2020 .
  13. شيباتا، كاتسوناري؛ كاوانو، توموهيكو (2008). تعلم توليد الحركة من صور الكاميرا الخام في بيئة تحاكي العالم الحقيقي من خلال دمج بسيط بين التعلم المعزز والشبكة العصبية (ملف PDF) . المؤتمر الدولي لمعالجة المعلومات العصبية (ICONIP) '08. مؤرشف من الأصل (ملف PDF) بتاريخ 11 ديسمبر 2020. تم الاطلاع عليه بتاريخ 1 ديسمبر 2020 .
  14. 1 2 منيه، فولوديمير؛ وآخرون . (ديسمبر 2013). لعب أتاري باستخدام التعلم العميق المعزز (ملف PDF) . ورشة عمل NIPS للتعلم العميق 2013. 
  15. 1 2 منيه، فولوديمير؛ وآخرون (2015). "التحكم بمستوى الإنسان من خلال التعلم العميق المعزز". مجلة نيتشر . 518 (7540): 529-533 . Bibcode : 2015Natur.518..529M . doi : 10.1038/nature14236 . PMID 25719670. S2CID 205242740 .   
  16. ^ فضة، ديفيد ؛ الأماكن القريبة : ماديسون، كريس J.؛ جويز، آرثر؛ سيفري، لوران؛ دريش، جورج فان دن؛ شريتويزر، جوليان؛ أنتونوغلو، يوانيس؛ بانيرشلفام، فيدا؛ لانكتوت، مارك؛ ديليمان، ساندر؛ غريوي، دومينيك. نهام، جون. كالشبرينر، نال؛ الأماكن القريبة : ليليكراب، تيموثي؛ ليتش، مادلين. كافوكوجلو، كوراي؛ جريبيل، ثور؛ حسابيص، ديميس (28 يناير 2016). “إتقان لعبة Go باستخدام الشبكات العصبية العميقة والبحث عن الأشجار”. طبيعة . 529 (7587): 484– 489. بيب كود : 2016Natur.529..484S . doi : 10.1038 / nature16961 . ISSN 0028-0836 . PMID 26819042. S2CID 515925 .   رمز الوصول المغلق
  17. ^ شريتويزر ، جوليان. أنتونوغلو، يوانيس؛ هيوبرت، توماس. سيمونيان، كارين؛ سيفري، لوران؛ شميت، سيمون. جويز، آرثر؛ لوكهارت، إدوارد. هاسابيس، ديميس؛ جريبيل، ثور؛ ليليكراب، تيموثي؛ سيلفر ، ديفيد (23 ديسمبر 2020). "إتقان لعبة Atari وGo والشطرنج والشوغي من خلال التخطيط باستخدام نموذج مكتسب" . طبيعة . 588 (7839): 604–609 . أرخايف : 1911.08265 . بيب كود : 2020Natur.588..604S . دوى : 10.1038/s41586-020-03051-4 . بميد 33361790 . S2CID 208158225 .  
  18. ليفين، سيرجي ؛ فين، تشيلسي ؛ داريل، تريفور؛ أبيل، بيتر (يناير 2016). "التدريب الشامل لسياسات الإدراك البصري الحركي العميق" (ملف PDF) . مجلة التعلم الآلي والتعلم الآلي . 17. arXiv : 1504.00702 .
  19. "OpenAI - حل مكعب روبيك بيد روبوتية" . OpenAI . 5 يناير 2021.
  20. OpenAI؛ وآخرون (2019). حل مكعب روبيك بيد روبوتية . arXiv : 1910.07113 . 
  21. "تقنية الذكاء الاصطناعي من ديب مايند تخفض فاتورة تبريد مركز بيانات جوجل بنسبة 40%" . ديب مايند . 14 مايو 2024.
  22. ورشة عمل "التعلم الآلي للقيادة الذاتية" في مؤتمر NeurIPS 2021. مؤتمر NeurIPS 2021. ديسمبر 2021.
  23. ^ بلمار، مارك؛ كانديدو، سلفاتوري؛ كاسترو، بابلو؛ جونج، يونيو؛ ماتشادو، مارلوس؛ مويترا، سوبهديب؛ بوندا، سميرة؛ وانغ ، زيو (2 ديسمبر 2020). "الملاحة المستقلة لبالونات الستراتوسفير باستخدام التعلم المعزز" . طبيعة . 588 (7836): 77– 82. بيب كود : 2020Natur.588...77B . دوى : 10.1038/s41586-020-2939-8 . بميد 33268863 . S2CID 227260253 .  
  24. ويليامز، رونالد ج. (1992). "خوارزميات بسيطة لتتبع التدرج الإحصائي للتعلم المعزز الترابطي" . تعلم الآلة . 8 ( 3-4 ): 229-256 . doi : 10.1007/BF00992696 . S2CID 2332513 . 
  25. شولمان، جون؛ ليفين، سيرجي؛ موريتز، فيليب؛ جوردان، مايكل؛ أبيل، بيتر (2015). تحسين سياسة منطقة الثقة . المؤتمر الدولي للتعلم الآلي (ICML). arXiv : 1502.05477 .
  26. شولمان، جون؛ وولسكي، فيليب؛ داريوال، برافولا؛ رادفورد، أليك؛ كليموف، أوليغ (2017). خوارزميات تحسين السياسة التقريبية . arXiv : 1707.06347 .
  27. ليليكرب، تيموثي؛ هانت، جوناثان؛ بريتزل، ألكسندر؛ هيس، نيكولاس؛ إيريز، توم؛ تاسا، يوفال؛ سيلفر، ديفيد؛ ويرسترا، دان (2016). التحكم المستمر باستخدام التعلم العميق المعزز . المؤتمر الدولي لتمثيلات التعلم (ICLR). arXiv : 1509.02971 .
  28. منيه، فولوديمير؛ بويغدومينش باديا، أدريا؛ ميرزي، مهدي؛ غريفز، أليكس؛ هارلي، تيم؛ ليليكرب، تيموثي؛ سيلفر، ديفيد؛ كافوكوغلو، كوراي (2016). أساليب غير متزامنة للتعلم العميق المعزز . المؤتمر الدولي للتعلم الآلي (ICML). arXiv : 1602.01783 .
  29. هارنوجا، توماس؛ تشو، أوريك؛ ليفين، سيرجي؛ أبيل، بيتر (2018). الممثل-الناقد المرن: التعلم العميق المعزز ذو الإنتروبيا القصوى خارج السياسة مع ممثل عشوائي . المؤتمر الدولي للتعلم الآلي (ICML). arXiv : 1801.01290 .
  30. ريزينجر، باتريك؛ سزيميني، مارتون (23 أكتوبر 2019). "الاستكشاف القائم على الانتباه والمدفوع بالفضول في التعلم العميق المعزز". المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات (ICASSP) لعام 2020، الصادر عن معهد مهندسي الكهرباء والإلكترونيات (IEEE) . الصفحات 3542-3546 . arXiv : 1910.10840 . doi : 10.1109/ICASSP40776.2020.9054546 . ISBN  978-1-5090-6631-5. S2CID 204852215 . 
  31. فيفيورا، إريك (2010)، "تشكيل المكافأة"، في ساموت، كلود؛ ويب، جيفري آي. (محرران)، موسوعة تعلم الآلة ، بوسطن، ماساتشوستس: سبرينغر الولايات المتحدة، ص 863-865 ، doi : 10.1007/978-0-387-30164-8_731 ، ISBN  978-0-387-30164-8
  32. وولفماير، ماركوس؛ أوندروسكا، بيتر؛ بوسنر، إنغمار (2015). "التعلم العميق العكسي المعزز ذو الإنتروبيا القصوى". arXiv : 1507.04888 [ cs.LG ].
  33. شاول، توم؛ هورغان، دانيال؛ غريغور، كارول؛ سيلفر، ديفيد (2015). مُقَرِّبات دالة القيمة الشاملة . المؤتمر الدولي للتعلم الآلي (ICML).
  34. أندريكوفيتش، مارسين؛ وولسكي، فيليب؛ راي، أليكس؛ شنايدر، جوناس؛ فونغ، راشيل؛ ويليندر، بيتر؛ ماكغرو، بوب؛ توبين، جوش؛ أبيل، بيتر؛ زاريمبا، فويتش (2018). إعادة تجربة الإدراك المتأخر . التطورات في أنظمة معالجة المعلومات العصبية (NeurIPS). arXiv : 1707.01495 .
  35. باكر، تشارلز؛ غاو، كاتلين؛ كوس، جيرني؛ كراهنبول، فيليب؛ كولتون، فلادلين؛ سونغ، داون (2019-03-15). "تقييم التعميم في التعلم العميق المعزز". arXiv : 1810.12282 [ cs.LG ].
  36. ^ فرانسوا لافيت، فنسنت. بنجيو، يوشوا؛ Precup، دوينا؛ بينو، جويل (2019). “التعلم المعزز المشترك عبر التمثيلات المجردة”. وقائع مؤتمر AAAI حول الذكاء الاصطناعي . المجلد. 33. ص 3582 – 3589.  
  37. ^ جيانغ، ييفو؛ أولمو، خوسيه. عطوي، ماجد (2024-09-01). "التعلم المعزز العميق لاختيار المحفظة" . مجلة التمويل العالمية . 62 101016. دوى : 10.1016/j.gfj.2024.101016 . ردمك 1044-0283 . 
  38. تشودري، هيمانشو؛ أورا، أريشي؛ ساهو، كارتيك؛ ثاكور، مانوج (26-05-2025). "التعلم العميق المعزز المعدل حسب المخاطر لتحسين المحفظة: نهج متعدد المكافآت" . المجلة الدولية لأنظمة الذكاء الحسابي . 18 (1): 126. doi : 10.1007/s44196-025-00875-8 . ISSN 1875-6883 . 
  39. أفراميلو، لوكيا؛ نوسي، باراسكيفي؛ باسليس، نيكولاوس؛ تيفاس، أناستاسيوس (15 مارس 2024). "التعلم العميق المعزز للتداول المالي باستخدام خصائص متعددة الوسائط" . أنظمة الخبراء وتطبيقاتها . 238 121849. doi : 10.1016/j.eswa.2023.121849 . ISSN 0957-4174 .