أفضل رد

في نظرية الألعاب ، يُعدّ أفضل ردّ هو الاستراتيجية (أو الاستراتيجيات) التي تُحقق أفضل نتيجة ممكنة للاعب، مع الأخذ في الاعتبار استراتيجيات اللاعبين الآخرين. [ 1 ] ويُشكّل مفهوم أفضل ردّ محورًا أساسيًا في إسهام جون ناش الأشهر، وهو توازن ناش ، النقطة التي يختار عندها كل لاعب في اللعبة أفضل ردّ (أو أحد أفضل الردود) على استراتيجيات اللاعبين الآخرين. [ 2 ]

مراسلة

الشكل 1. تطابق ردود الفعل للاعب Y في لعبة صيد الغزلان.

تُستخدم مُطابقات رد الفعل ، والمعروفة أيضًا بمُطابقات أفضل استجابة، في إثبات وجود توازنات ناش للاستراتيجيات المختلطة . [ 3 ] [ 4 ] لا تُعدّ مُطابقات رد الفعل "دوال رد فعل" لأن الدوال يجب أن يكون لها قيمة واحدة فقط لكل مُدخل، وستكون العديد من مُطابقات رد الفعل غير مُعرّفة، أي خط عمودي، لبعض خيارات استراتيجية الخصم. يتم إنشاء مُطابقة b (·) لكل لاعب من مجموعة ملفات تعريف استراتيجية الخصم إلى مجموعة استراتيجيات اللاعب. لذا، لأي مجموعة مُعطاة من استراتيجيات الخصم σ −i ، تُمثل bᵢ ( σ −i ) أفضل استجابات اللاعب i لـ σ −i .

الشكل 2. تطابق ردود الفعل للاعب X في لعبة صيد الغزلان.

مراسلات الرد للجميع يمكن تمثيل ألعاب الشكل الطبيعي 2 × 2 بخط لكل لاعب في فضاء استراتيجية مربع الوحدة . توضح الأشكال من 1 إلى 3 أفضل استجابات لعبة صيد الغزلان . يُظهر الخط المنقط في الشكل 1 الاحتمال الأمثل لاختيار اللاعب Y لعبة "صيد الغزلان" (على المحور y )، كدالة لاحتمال اختيار اللاعب X لعبة "صيد الغزلان" (على المحور x ). في الشكل 2، يُظهر الخط المنقط الاحتمال الأمثل لاختيار اللاعب X لعبة "صيد الغزلان" (على المحور x )، كدالة لاحتمال اختيار اللاعب Y لعبة "صيد الغزلان" (على المحور y ). تجدر الإشارة إلى أن الشكل 2 يرسم المتغيرات المستقلة ومتغيرات الاستجابة على محاور معاكسة لتلك المستخدمة عادةً، بحيث يمكن وضعه فوق الرسم البياني السابق، لإظهار توازنات ناش عند النقاط التي تتفق فيها أفضل استجابات اللاعبين في الشكل 3.

توجد ثلاثة أشكال مميزة لتوافق التفاعل، شكل واحد لكل نوع من الأنواع الثلاثة المتناظرةألعاب 2 × 2 : ألعاب التنسيق، وألعاب عدم التنسيق، والألعاب ذات الاستراتيجيات المهيمنة (الحالة الرابعة البسيطة التي تكون فيها العوائد متساوية دائمًا لكلا الحركتين ليست في الواقع مشكلة نظرية ألعاب). أي عائد متناظرستتخذ لعبة 2 × 2 أحد هذه الأشكال الثلاثة.

ألعاب التنسيق

الشكل 3. تطابق ردود الفعل لكلا اللاعبين في لعبة صيد الغزلان. يوضح الشكل توازنات ناش بنقاط تتفق فيها ردود فعل اللاعبين، أي تتقاطع.

تُسمى الألعاب التي يحقق فيها اللاعبون أعلى النقاط عندما يختار كلاهما نفس الاستراتيجية، مثل صيد الغزلان ومعركة الجنسين ، بألعاب التنسيق . وتتشابه ردود أفعال هذه الألعاب مع الشكل الموضح في الشكل 3، حيث يوجد توازن ناش واحد في الزاوية السفلية اليسرى، وآخر في الزاوية العلوية اليمنى، وتوازن ناش مختلط في مكان ما على طول القطر بين التوازنين الآخرين.

ألعاب مضادة للتنسيق

الشكل 4. تطابق ردود الفعل لكلا اللاعبين في لعبة الصقر والحمامة. يوضح الشكل توازنات ناش بنقاط تتفق فيها ردود فعل اللاعبين، أي تتقاطع.

تُسمى الألعاب التي يحقق فيها اللاعبون أعلى النقاط عند اختيار استراتيجيات متقابلة (أي غير متناسقة)، مثل لعبة الدجاجة ولعبة الصقر والحمامة ، ألعابًا مضادة للتنسيق. ولها نقاط تقابل (الشكل 4) تتقاطع في الاتجاه المعاكس لألعاب التنسيق، مع ثلاثة توازنات ناش، واحد في كل من الزاوية العلوية اليسرى والزاوية السفلية اليمنى، حيث يختار أحد اللاعبين استراتيجية معينة، بينما يختار اللاعب الآخر الاستراتيجية المعاكسة. أما توازن ناش الثالث فهو استراتيجية مختلطة تقع على طول القطر من الزاوية السفلية اليسرى إلى الزاوية العلوية اليمنى. إذا لم يكن اللاعبان يعرفان أيهما يختار أي استراتيجية، فإن توازن ناش المختلط يُعد استراتيجية مستقرة تطوريًا (ESS) ، حيث يقتصر اللعب على الخط القطري من الزاوية السفلية اليسرى إلى الزاوية العلوية اليمنى. وإلا، يُقال إن هناك عدم تناسق غير مرتبط ، وتكون توازنات ناش في الزوايا استراتيجيات مستقرة تطوريًا .

ألعاب ذات استراتيجية مهيمنة

الشكل 5. تطابق ردود الفعل للعبة ذات استراتيجية مهيمنة.

تتميز الألعاب ذات الاستراتيجيات المهيمنة بردود فعل متطابقة تتقاطع عند نقطة واحدة فقط، والتي ستكون إما في الزاوية السفلية اليسرى أو الزاوية العلوية اليمنى في تناظر العوائد.في ألعاب 2 × 2 ، على سبيل المثال، في معضلة السجين الفردية ، لا يُعد خيار "التعاون" الأمثل لأي احتمال لتعاون الخصم. يوضح الشكل 5 منحنى الاستجابة لهذه اللعبة، حيث تمثل الأبعاد "احتمالية لعب التعاون"، ويقع توازن ناش في الزاوية السفلية اليسرى حيث لا يلعب أي من اللاعبين خيار "التعاون". أما إذا تم تعريف الأبعاد على أنها "احتمالية لعب الخيانة"، فإن منحنيات الاستجابة المثلى لكلا اللاعبين ستكون 1 لجميع احتمالات استراتيجية الخصم، وستتقاطع منحنيات الاستجابة (لتشكل توازن ناش) في الزاوية العلوية اليمنى.

ألعاب أخرى (غير متكافئة في العائد)

نطاق أوسع من أشكال تطابقات التفاعل ممكن فيألعاب 2 × 2 مع تباينات في العوائد. لكل لاعب خمسة أشكال استجابة مثالية محتملة، موضحة في الشكل 6. من اليسار إلى اليمين، هذه هي: الاستراتيجية المهيمنة (اللعب دائمًا 2)، الاستراتيجية المهيمنة (اللعب دائمًا 1)، التصاعدية (اللعب بالاستراتيجية 2 إذا كان احتمال أن يلعب اللاعب الآخر 2 أعلى من العتبة)، التنازلية (اللعب بالاستراتيجية 1 إذا كان احتمال أن يلعب اللاعب الآخر 2 أعلى من العتبة)، والمحايدة (كلتا الاستراتيجيتين تؤديان بشكل جيد بنفس القدر في جميع الظروف).

الشكل 6 - ردود الفعل الخمسة المحتملة للاعب فيلعبة 2 × 2. يُفترض أن المحاور تُظهر احتمالية لعب اللاعب للاستراتيجية 1. من اليسار إلى اليمين: أ) اللعب دائمًا بالاستراتيجية 2، الاستراتيجية 1 غير فعالة، ب) اللعب دائمًا بالاستراتيجية 1، الاستراتيجية 2 غير فعالة، ج) الاستراتيجية 1 هي الأفضل عندما يلعب الخصم استراتيجيته 1، والاستراتيجية 2 هي الأفضل عندما يلعب الخصم استراتيجيته 2، د) الاستراتيجية 1 هي الأفضل عندما يلعب الخصم استراتيجيته 2، والاستراتيجية 2 هي الأفضل عندما يلعب الخصم استراتيجيته 1، هـ) كلا الاستراتيجيتين فعالتان بنفس القدر بغض النظر عما يلعبه الخصم.

على الرغم من وجود أربعة أنواع محتملة فقط من العوائد المتناظرةفي ألعاب 2 × 2 (إحداها بسيطة)، تسمح منحنيات الاستجابة الخمسة الأفضل لكل لاعب بوجود عدد أكبر من أنواع الألعاب غير المتناظرة ذات العوائد المتساوية. العديد من هذه الأنواع لا يختلف جوهريًا عن بعضها البعض. يمكن إعادة تعريف الأبعاد (تبديل أسماء الاستراتيجيتين 1 و2) لإنتاج ألعاب متناظرة متطابقة منطقيًا.

بنسات متطابقة

إحدى الألعاب المعروفة ذات العوائد غير المتكافئة هي لعبة مطابقة البنسات . في هذه اللعبة، يفوز أحد اللاعبين، وهو اللاعب المُمثَّل بالصف (على المحور الرأسي)، إذا نسّق اللاعبان اختياراتهما (إما أن يختار كلاهما صورة أو كلاهما كتابة)، بينما يفوز اللاعب الآخر، وهو اللاعب المُمثَّل بالعمود (على المحور الأفقي )، إذا اختلف اللاعبان في اختياراتهما. يُصنَّف رد فعل اللاعب Y كلعبة تنسيق، بينما يُصنَّف رد فعل اللاعب X كلعبة اختلاف. التوازن الوحيد وفقًا لنظرية ناش هو مزيج من الاستراتيجيات المختلطة حيث يختار كلا اللاعبين بشكل مستقل صورة وكتابة باحتمالية 0.5 لكل منهما.

الشكل 7. علاقات التفاعل بين اللاعبين في لعبة مطابقة العملات المعدنية . يُمثل الرسم البياني الأيسر اللاعب المنسق، بينما يُمثل الرسم البياني الأوسط اللاعب غير المنسق. ويُظهر الرسم البياني الأيمن توازن ناش الوحيد.

الديناميكيات

في نظرية الألعاب التطورية ، تمثل ديناميكيات أفضل استجابة فئة من قواعد تحديث الاستراتيجية، حيث تُحدد استراتيجيات اللاعبين في الجولة التالية بناءً على أفضل استجاباتهم لمجموعة فرعية من اللاعبين. ومن الأمثلة على ذلك:

  • في نموذج السكان الكبير، يختار اللاعبون خطوتهم التالية بشكل احتمالي بناءً على الاستراتيجيات التي تمثل أفضل الاستجابات للسكان ككل.
  • في النموذج المكاني، يختار اللاعبون (في الجولة التالية) الإجراء الذي يمثل أفضل رد فعل لجميع جيرانهم. [ 5 ]

الأهم من ذلك، أن اللاعبين في هذه النماذج يختارون فقط أفضل رد فعل في الجولة التالية الذي يحقق لهم أعلى عائد . ولا يأخذ اللاعبون في الحسبان تأثير اختيار استراتيجية معينة في الجولة التالية على مجريات اللعب اللاحقة. هذا القيد يجعل القاعدة الديناميكية تُسمى غالبًا " أفضل رد فعل قصير النظر" .

في نظرية الألعاب المحتملة ، تشير ديناميكيات أفضل استجابة إلى طريقة لإيجاد توازن ناش عن طريق حساب أفضل استجابة لكل لاعب:

نظرية في أي لعبة ذات إمكانات محدودة، تتقارب ديناميكيات أفضل استجابة دائمًا إلى توازن ناش. [ 6 ]

تم تنعيمه

الشكل 8. تطابق BR (باللون الأسود) ووظائف BR المُنعّمة (بالألوان)

بدلاً من استخدام نماذج أفضل استجابة، تستخدم بعض النماذج دوال أفضل استجابة مُعدّلة . تشبه هذه الدوال نموذج أفضل استجابة، إلا أنها لا تنتقل فجأة من استراتيجية بحتة إلى أخرى. يوضح الشكل 8 الفرق، حيث يمثل اللون الأسود نموذج أفضل استجابة، بينما تمثل الألوان الأخرى دوال أفضل استجابة مُعدّلة مختلفة. في نماذج أفضل استجابة القياسية، حتى أدنى فائدة لأي إجراء ستؤدي إلى قيام الفرد بتنفيذه باحتمالية 1. أما في نماذج أفضل استجابة المُعدّلة، فمع تناقص الفرق بين إجراءين، تقترب احتمالية قيام الفرد بتنفيذهما من 50:50.

توجد العديد من الدوال التي تمثل أفضل استجابة مُنعّمة. الدوال الموضحة هنا هي عدة اختلافات للدالة التالية:

هـهـ(1)/γهـهـ(1)/γ+هـهـ(2)/γ{\displaystyle {\frac {e^{E(1)/\gamma }}{e^{E(1)/\gamma }+e^{E(2)/\gamma }}}}

حيث يمثل E ( x ) العائد المتوقع للفعل x ، و γ هو معلمة تحدد مدى انحراف الدالة عن أفضل استجابة حقيقية (قيمة γ الأكبر تعني أن اللاعب من المرجح أن يرتكب "أخطاء").

توجد عدة مزايا لاستخدام نموذج الاستجابة المثلى المُعدَّل، سواءً من الناحية النظرية أو التجريبية. أولًا، يتوافق هذا النموذج مع التجارب النفسية؛ فعندما يكون الأفراد غير مبالين تقريبًا بين فعلين، يبدو أنهم يختارون بشكل عشوائي إلى حد ما. ثانيًا، يتحدد أداء الأفراد بشكل فريد في جميع الحالات، لأنه عبارة عن علاقة تُعد أيضًا دالة . أخيرًا، يمكن أن يؤدي استخدام نموذج الاستجابة المثلى المُعدَّل مع بعض قواعد التعلم (كما في اللعب الوهمي ) إلى تعلم اللاعبين لعب توازنات ناش ذات الاستراتيجيات المختلطة . [ 7 ]

انظر أيضاً

مراجع

فهرس