التعلم عن طريق الفروق الزمنية
يشير التعلم بالفرق الزمني ( TD ) إلى فئة من أساليب التعلم المعزز غير المعتمدة على النموذج، والتي تتعلم من خلال إعادة التوزيع العشوائي (bootstrapping) انطلاقًا من التقدير الحالي لدالة القيمة. تقوم هذه الأساليب بأخذ عينات من البيئة، مثل أساليب مونت كارلو ، وتُجري تحديثات بناءً على التقديرات الحالية، مثل أساليب البرمجة الديناميكية . [ 1 ]
بينما لا تُعدّل طرق مونت كارلو تقديراتها إلا بعد معرفة النتيجة، تُعدّل طرق TD التنبؤات لتتوافق مع تنبؤات لاحقة أكثر دقة حول المستقبل، حتى قبل معرفة النتيجة. [ 2 ] وهذا شكل من أشكال إعادة التوزيع العشوائي (bootstrapping )، كما هو موضح في المثال التالي:
لنفترض أنك ترغب في التنبؤ بحالة الطقس ليوم السبت، ولديك نموذج يتنبأ بحالة الطقس ليوم السبت، بناءً على حالة الطقس في كل يوم من أيام الأسبوع. في الحالة الاعتيادية، ستنتظر حتى يوم السبت ثم تُعدّل جميع نماذجك. ولكن، عندما يكون اليوم، على سبيل المثال، يوم الجمعة، يجب أن يكون لديك فكرة جيدة عن حالة الطقس يوم السبت، وبالتالي ستتمكن من تغيير نموذج يوم السبت، على سبيل المثال، قبل حلول يوم السبت. [ 2 ]
ترتبط طرق الفرق الزمني بنموذج الفرق الزمني لتعلم الحيوانات . [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ]
الصياغة الرياضية
تُعدّ طريقة TD(0) الجدولية إحدى أبسط طرق TD، وهي حالة خاصة من طرق التقريب العشوائي الأكثر عمومية. تُقدّر هذه الطريقة دالة قيمة الحالة لعملية اتخاذ القرار ماركوفية ذات الحالات المحدودة (MDP) في ظل سياسة معينة.. يتركلنرمز إلى دالة قيمة الحالة لعملية ماركوف للقرار ذات الحالاتمكافآتومعدل الخصم [ 8 ]بموجب السياسة[ 9 ]
نحذف الفعل من الترميز للتسهيل.يحقق معادلة بيلمان :
لذاهو تقدير غير متحيز لـهذه الملاحظة تحفز الخوارزمية التالية لتقدير.
تبدأ الخوارزمية بتهيئة جدولبشكل تعسفي، بقيمة واحدة لكل حالة من حالات عملية ماركوف للقرار. معدل تعلم إيجابييتم اختياره.
ثم نقوم بتقييم السياسة بشكل متكرراحصل على مكافأةوقم بتحديث دالة القيمة للحالة الحالية باستخدام القاعدة: [ 10 ]
أينوهما الحالتان الحالية والتالية على التوالي. القيمةيُعرف باسم هدف TD، ويُعرف باسم خطأ TD.
تي دي لامدا
خوارزمية TD-Lambda هي خوارزمية تعلم ابتكرها ريتشارد س. ساتون استنادًا إلى أعمال سابقة لآرثر صموئيل حول تعلم الفروق الزمنية . [ 11 ] وقد اشتهر جيرالد تيسورو بتطبيق هذه الخوارزمية لإنشاء برنامج TD-Gammon ، وهو برنامج تعلم لعب لعبة الطاولة بمستوى اللاعبين البشريين المحترفين. [ 12 ]
لامدا (يشير المعامل ) إلى معامل اضمحلال الأثر، معتؤدي الإعدادات الأعلى إلى آثار تدوم لفترة أطول؛ أي أنه يمكن منح نسبة أكبر من الفضل من المكافأة إلى حالات وأفعال أبعد عندماأعلى، معإنتاج التعلم المتوازي لخوارزميات التعلم المعزز مونت كارلو. [ 13 ]
في علم الأعصاب
حظيت خوارزمية TD باهتمام في مجال علم الأعصاب . فقد اكتشف الباحثون أن معدل إطلاق النبضات العصبية للدوبامين في منطقة السقيفية البطنية (VTA) والمادة السوداء (SNc) يُحاكي دالة الخطأ في الخوارزمية. [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ] تُشير دالة الخطأ إلى الفرق بين المكافأة المُقدَّرة في أي حالة أو خطوة زمنية مُحدَّدة والمكافأة الفعلية المُستلمة. كلما زادت دالة الخطأ، زاد الفرق بين المكافأة المُتوقَّعة والفعلية. وعندما يقترن هذا بمُحفِّز يُعكس بدقة مكافأة مُستقبلية، يُمكن استخدام الخطأ لربط المُحفِّز بالمكافأة المُستقبلية .
يبدو أن خلايا الدوبامين تتصرف بطريقة مماثلة. في إحدى التجارب، أُجريت قياسات على خلايا الدوبامين أثناء تدريب قرد على ربط مُحفز بمكافأة العصير. [ 14 ] في البداية، زادت معدلات إطلاق خلايا الدوبامين عندما تلقى القرد العصير، مما يشير إلى وجود فرق بين المكافآت المتوقعة والفعلية. بمرور الوقت، انتقلت هذه الزيادة في معدل الإطلاق إلى أول مُحفز موثوق للمكافأة. بمجرد أن اكتمل تدريب القرد، لم تكن هناك زيادة في معدل الإطلاق عند تقديم المكافأة المتوقعة. لاحقًا، انخفض معدل إطلاق خلايا الدوبامين إلى ما دون مستوى التنشيط الطبيعي عندما لم تُقدم المكافأة المتوقعة. يُحاكي هذا بشكل وثيق كيفية استخدام دالة الخطأ في نظرية التعلم المعزز .
أدت العلاقة بين النموذج والوظيفة العصبية المحتملة إلى ظهور أبحاث تسعى إلى استخدام نظرية التطور الزمني لتفسير العديد من جوانب البحث السلوكي. [ 15 ] [ 16 ] كما استُخدمت هذه النظرية لدراسة حالات مثل الفصام أو آثار التلاعب الدوباميني بالدوبامين على التعلم. [ 17 ]
انظر أيضاً
ملحوظات
- ↑ ساتون وبارتو (2018) ، ص 133.
- 1 2 ساتون، ريتشارد س. (1 أغسطس 1988). "التعلم للتنبؤ باستخدام أساليب الفروق الزمنية" . تعلم الآلة . 3 (1): 9-44 . doi : 10.1007/BF00115009 . ISSN 1573-0565 . S2CID 207771194 .
- 1 2 شولتز، دبليو، دايان، بي، ومونتاغيو، بي آر. (1997). "الركيزة العصبية للتنبؤ والمكافأة". مجلة ساينس . 275 (5306): 1593-1599 . CiteSeerX 10.1.1.133.6176 . doi : 10.1126/science.275.5306.1593 . PMID 9054347. S2CID 220093382 .
{{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط ) - مونتاغيو ، بي آر؛ دايان، بي؛ سيجنوفسكي، تي جيه (1996-03-01). " إطار عمل لأنظمة الدوبامين في الدماغ المتوسط قائم على التعلم الهيبي التنبؤي" ( ملف PDF) . مجلة علم الأعصاب . 16 (5): 1936-1947 . doi : 10.1523/JNEUROSCI.16-05-01936.1996 . ISSN 0270-6474 . PMC 6578666. PMID 8774460 .
- 1 2 مونتاج، بي آر؛ دايان، بي؛ نولان، إس جيه؛ بوجيه، إيه؛ سيجنوفسكي، تي جيه (1993). "استخدام التعزيز غير الدوري للتنظيم الذاتي الموجه" (ملف PDF) . التقدم في أنظمة معالجة المعلومات العصبية . 5 : 969-976 .
- مونتاغيو ، بي آر ؛ سيجنوفسكي، تي جيه (1994). "الدماغ التنبؤي: التزامن الزمني والترتيب الزمني في آليات التعلم المشبكي" . التعلم والذاكرة . 1 (1): 1-33 . doi : 10.1101/lm.1.1.1 . ISSN 1072-0502 . PMID 10467583. S2CID 44560099 .
- 1 2 سيجنوفسكي، تي جيه؛ دايان، بي؛ مونتاج، بي آر (1995). "التعلم الهيبي التنبؤي". وقائع المؤتمر السنوي الثامن حول نظرية التعلم الحسابي - كولت 95. ص 15-18 . doi : 10.1145/225298.225300 . ISBN 0897917235. S2CID 1709691 .
- ↑ يسمح مُعامل معدل الخصم بتفضيل الوقت نحو المكافآت الفورية، والابتعاد عن المكافآت المستقبلية البعيدة.
- ↑ ساتون وبارتو (2018) ، ص 134.
- ↑ ساتون وبارتو (2018) ، ص 135.
- ↑ ساتون وبارتو (2018) ، ص 130؟
- ↑ تيسورو (1995) .
- ↑ ساتون وبارتو (2018) ، ص 175.
- ↑ شولتز، و. (1998). " إشارة المكافأة التنبؤية لخلايا الدوبامين العصبية". مجلة علم وظائف الأعصاب . 80 (1): 1-27 . CiteSeerX 10.1.1.408.5994 . doi : 10.1152/jn.1998.80.1.1 . PMID 9658025. S2CID 52857162 .
- ↑ دايان، ب. (2001). "التعلم المعزز المدفوع" (ملف PDF) . التطورات في أنظمة معالجة المعلومات العصبية . 14. مطبعة معهد ماساتشوستس للتكنولوجيا: 11-18 . مؤرشف من الأصل (ملف PDF) بتاريخ 25-05-2012 . تم الاسترجاع بتاريخ 03-03-2009 .
- ↑ توبيا، إم جيه، وآخرون (2016). "تغير الاستجابة السلوكية والعصبية للمكاسب الافتراضية لدى كبار السن" . علم الأعصاب الإدراكي والعاطفي والسلوكي . 16 (3): 457-472 . doi : 10.3758/s13415-016-0406-7 . PMID 26864879. S2CID 11299945 .
{{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط ) - ↑ سميث، أ.، لي، م.، بيكر، س.، وكابور، س. (2006). "الدوبامين، خطأ التنبؤ، والتعلم الترابطي: تفسير قائم على النموذج". الشبكة : الحوسبة في الأنظمة العصبية . 17 (1): 61-84 . doi : 10.1080/09548980500361624 . PMID 16613795. S2CID 991839 .
{{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
المراجع
- ساتون، ريتشارد إس.؛ بارتو، أندرو جي. (2018). التعلم المعزز: مقدمة (الطبعة الثانية ). كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا.
- تيسورو، جيرالد (مارس 1995). "التعلم بالفرق الزمني وTD-Gammon" . مجلة اتصالات رابطة آلات الحوسبة . 38 (3): 58-68 . doi : 10.1145/203330.203343 . S2CID 6023746 .
للمزيد من القراءة
- ماين، إس بي (2007). تقنيات التحكم للشبكات المعقدة . مطبعة جامعة كامبريدج. رقم ISBN 978-0521884419.انظر الفصل الأخير والملحق.
- ساتون، آر إس؛ بارتو، إيه جي (1990). "نماذج المشتقات الزمنية للتعزيز البافلوفي" (ملف PDF) . التعلم وعلم الأعصاب الحاسوبي: أسس الشبكات التكيفية : 497-537 . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 30 مارس 2017. تم الاطلاع عليه بتاريخ 29 مارس 2017 .
روابط خارجية
- تطبيق Connect Four TDGravity مؤرشف بتاريخ 24-07-2012 على Wayback Machine (+ نسخة الهاتف المحمول) - تم تعلمه ذاتيًا باستخدام طريقة TD-Leaf (مزيج من TD-Lambda مع بحث الشجرة الضحلة)
- تطبيق ويب نموذجي للتعلم الذاتي للعبة تيك تاك تو، مؤرشف بتاريخ 19-03-2014 في Wayback Machine، يوضح كيفية استخدام التعلم بالفرق الزمني لتعلم ثوابت تقييم الحالة لذكاء اصطناعي minimax يلعب لعبة لوحية بسيطة.
- مشكلة التعلم المعزز ، وثيقة تشرح كيف يمكن استخدام التعلم بالفرق الزمني لتسريع عملية التعلم Q
- محاكي الفرق الزمني TD-Simulator للتكييف الكلاسيكي
- علم الأعصاب الحاسوبي
- التعلم المعزز
- الطرح
- 1988 في مجال الذكاء الاصطناعي
