ايكسي

AIXI ['ai̯k͡siː] هي صيغة رياضية نظرية للذكاء الاصطناعي العام . وهي تجمع بين استقراء سولومونوف ونظرية القرار المتسلسل . اقترح ماركوس هوتر AIXI لأول مرة في عام 2000 [1] وتم إثبات العديد من النتائج المتعلقة بـ AIXI في كتاب هوتر لعام 2005 بعنوان الذكاء الاصطناعي الشامل . [2]

AIXI هو وكيل تعزيز التعلم (RL). فهو يعمل على تعظيم إجمالي المكافآت المتوقعة التي يتم تلقيها من البيئة. وبشكل بديهي، فإنه يأخذ في الاعتبار في نفس الوقت كل فرضية (أو بيئة) قابلة للحساب. وفي كل خطوة زمنية، ينظر في كل برنامج ممكن ويقيم عدد المكافآت التي يولدها هذا البرنامج اعتمادًا على الإجراء التالي المتخذ. ثم يتم ترجيح المكافآت الموعودة بالاعتقاد الذاتي بأن هذا البرنامج يشكل البيئة الحقيقية. يتم حساب هذا الاعتقاد من طول البرنامج: تعتبر البرامج الأطول أقل احتمالية، بما يتماشى مع شفرة أوكام . ثم يختار AIXI الإجراء الذي يتمتع بأعلى مكافأة إجمالية متوقعة في المجموع المرجح لجميع هذه البرامج.

تعريف

وفقًا لهوتر، يمكن أن يكون لكلمة "AIXI" عدة تفسيرات. يمكن أن تعني AIXI الذكاء الاصطناعي استنادًا إلى توزيع سولومونوف، والذي يُشار إليه بـ (وهو الحرف اليوناني xi)، أو على سبيل المثال يمكن أن تعني الذكاء الاصطناعي "المتقاطع" (X) مع الاستقراء (I). هناك تفسيرات أخرى. [3]

AIXI هو وكيل تعزيز التعلم الذي يتفاعل مع بعض البيئات العشوائية وغير المعروفة ولكن القابلة للحساب . يستمر التفاعل في خطوات زمنية، من إلى ، حيث هو عمر وكيل AIXI. في خطوة الوقت t ، يختار الوكيل إجراءً (مثل حركة أحد الأطراف) وينفذه في البيئة، وتستجيب البيئة بـ "إدراك" ، والذي يتكون من "ملاحظة" (مثل صورة كاميرا) ومكافأة ، موزعة وفقًا للاحتمالية الشرطية ، حيث هو "تاريخ" الإجراءات والملاحظات والمكافآت. وبالتالي يتم تمثيل البيئة رياضيًا كتوزيع احتمالي على "الإدراكات" (الملاحظات والمكافآت) التي تعتمد على التاريخ الكامل ، لذلك لا يوجد افتراض ماركوف (على عكس خوارزميات التعلم المعزز الأخرى). لاحظ مرة أخرى أن توزيع الاحتمالات هذا غير معروف لوكيل AIXI. علاوة على ذلك، لاحظ مرة أخرى أن AIXI قابلة للحساب، أي أن الملاحظات والمكافآت التي يتلقاها العميل من البيئة يمكن حسابها بواسطة بعض البرامج (التي تعمل على آلة تورينج )، بالنظر إلى الإجراءات السابقة لوكيل AIXI. [4]

الهدف الوحيد لوكيل AIXI هو تحقيق أقصى قدر من المكافآت من الخطوة الزمنية 1 إلى م.

يرتبط وكيل AIXI بسياسة عشوائية ، وهي الوظيفة التي يستخدمها لاختيار الإجراءات في كل خطوة زمنية، حيث هي مساحة جميع الإجراءات الممكنة التي يمكن أن يتخذها AIXI و هي مساحة جميع "التصورات" الممكنة التي يمكن أن تنتجها البيئة. يمكن أيضًا اعتبار البيئة (أو توزيع الاحتمالات) بمثابة سياسة عشوائية (وهي دالة): ، حيث هي عملية نجم كلين .

بشكل عام، في خطوة زمنية (تتراوح من 1 إلى م)، يقوم AIXI، بعد تنفيذ الإجراءات مسبقًا (والتي غالبًا ما يتم اختصارها في الأدبيات باسم ) وبعد ملاحظة تاريخ الإدراكات (والتي يمكن اختصارها باسم )، باختيار وتنفيذ الإجراء في البيئة، ، كما هو محدد على النحو التالي: [3]

أو باستخدام الأقواس، لتوضيح الأولويات

حدسيًا، في التعريف أعلاه، تنظر AIXI إلى مجموع المكافأة الإجمالية على جميع "المستقبلات" المحتملة حتى خطوات زمنية للأمام (أي من إلى )، وتزن كل منها حسب تعقيد البرامج (أي بواسطة )، بما يتفق مع ماضي الوكيل (أي الإجراءات التي تم تنفيذها سابقًا، ، والإدراكات المستلمة، ) التي يمكن أن تولد هذا المستقبل، ثم تختار الإجراء الذي يزيد من المكافآت المستقبلية المتوقعة. [4]

دعونا نحلل هذا التعريف حتى نتمكن من فهمه بشكل كامل.

هو "الإدراك" (الذي يتكون من الملاحظة والمكافأة ) الذي يتلقاه وكيل AIXI في خطوة زمنية من البيئة (والتي هي غير معروفة وعشوائية). وبالمثل، هو الإدراك الذي يتلقاه AIXI في خطوة زمنية (آخر خطوة زمنية حيث يكون AIXI نشطًا).

هو مجموع المكافآت من خطوة زمنية إلى أخرى ، لذا تحتاج AIXI إلى النظر إلى المستقبل لاختيار عملها في خطوة زمنية .

يشير إلى آلة تورينج عالمية رتيبة ، ويتراوح على جميع البرامج (الحتمية) على الآلة العالمية ، والتي تتلقى كمدخلات البرنامج وتسلسل الإجراءات (أي جميع الإجراءات)، وتنتج تسلسل الإدراكات . وبالتالي، تُستخدم آلة تورينج العالمية "لمحاكاة" أو حساب استجابات البيئة أو الإدراكات، مع الأخذ في الاعتبار البرنامج (الذي "ينمذج" البيئة) وجميع إجراءات وكيل AIXI: بهذا المعنى، تكون البيئة "قابلة للحساب" (كما هو مذكور أعلاه). لاحظ أنه بشكل عام، فإن البرنامج الذي "ينمذج" البيئة الحالية والفعلية (حيث تحتاج AIXI إلى العمل) غير معروف لأن البيئة الحالية غير معروفة أيضًا.

هو طول البرنامج (الذي يتم ترميزه كسلسلة من البتات). لاحظ أن . وبالتالي، في التعريف أعلاه، يجب تفسيره على أنه مزيج (في هذه الحالة، مجموع) على جميع البيئات القابلة للحساب (والتي تتوافق مع ماضي العميل)، كل منها مرجح بتعقيده . لاحظ أنه يمكن أيضًا كتابته على أنه ، و هو تسلسل الإجراءات التي نفذها بالفعل وكيل AIXI في البيئة. وبالمثل، ، و هو تسلسل الإدراكات التي أنتجتها البيئة حتى الآن.

دعونا الآن نجمع كل هذه المكونات معًا لفهم هذه المعادلة أو التعريف.

في خطوة الوقت t، تختار AIXI الإجراء الذي تصل فيه الوظيفة إلى الحد الأقصى لها.

حدود

المعلمات الخاصة بـ AIXI هي آلة تورينج العالمية U ومدة حياة العميل m ، والتي يجب اختيارها. يمكن إزالة المعلمة الأخيرة باستخدام الخصم .

الأمثلية

يتم قياس أداء AIXI من خلال العدد الإجمالي المتوقع للمكافآت التي تتلقاها. وقد ثبت أن AIXI مثالية بالطرق التالية. [2]

  • الأمثلية الباريتوية : لا يوجد وكيل آخر يعمل على الأقل بنفس كفاءة AIXI في جميع البيئات بينما يعمل بشكل أفضل تمامًا في بيئة واحدة على الأقل. [ بحاجة لمصدر ]
  • الأمثلية الباريتوية المتوازنة: مثل الأمثلية الباريتوية، ولكن مع الأخذ في الاعتبار مجموعًا مرجحًا من البيئات.
  • تحسين ذاتي: تُسمى السياسة p بأنها مُحسَّنة ذاتيًا لبيئة ما إذا اقترب أداء p من الحد الأقصى النظري عندما يصل طول عمر العميل (وليس الوقت) إلى ما لا نهاية. بالنسبة لفئات البيئة التي توجد بها سياسات مُحسَّنة ذاتيًا، فإن AIXI تكون مُحسَّنة ذاتيًا.

وقد أظهر لاحقًا كل من هوتر وجان لايك أن المثالية الباريتوية المتوازنة هي ذاتية وأن أي سياسة يمكن اعتبارها مثالية باريتو، وهو ما وصفوه بأنه يقوض جميع ادعاءات المثالية السابقة لـ AIXI. [5]

ومع ذلك، فإن AIXI لديها بعض القيود. فهي مقيدة بتعظيم المكافآت بناءً على الإدراكات بدلاً من الحالات الخارجية. كما تفترض أنها تتفاعل مع البيئة فقط من خلال قنوات الفعل والإدراك، مما يمنعها من التفكير في إمكانية التلف أو التعديل. وهذا يعني بشكل عام أنها لا تعتبر نفسها محصورة بالبيئة التي تتفاعل معها. كما تفترض أن البيئة قابلة للحساب. [6]

الجوانب الحسابية

مثل استقراء سولومونوف ، فإن AIXI غير قابلة للحساب . ومع ذلك، هناك تقريبات قابلة للحساب لها. أحد هذه التقريبات هو AIXI tl ، والذي يعمل على الأقل بنفس كفاءة أفضل وكيل محدود زمنيًا ومكانيًا يمكن إثباته . [2] تقريبًا آخر لـ AIXI مع فئة بيئة مقيدة هو MC-AIXI (FAC-CTW) (الذي يرمز إلى Monte Carlo AIXI FAC- Context-Tree Weighting )، والذي حقق بعض النجاح في لعب ألعاب بسيطة مثل Pac-Man القابلة للملاحظة جزئيًا . [4] [7]

انظر أيضا

مراجع

  1. ^ ماركوس هوتر (2000). نظرية الذكاء الاصطناعي الشامل القائمة على التعقيد الخوارزمي. arXiv : cs.AI/0004001 . Bibcode :2000cs........4001H.
  2. ^ abc — (2005). الذكاء الاصطناعي الشامل: القرارات المتسلسلة المستندة إلى الاحتمالية الخوارزمية. نصوص في علوم الكمبيوتر النظرية، سلسلة EATCS. ​​سبرينغر. doi :10.1007/b138233. ISBN 978-3-540-22139-5. S2CID  33352850.
  3. ^ ab Hutter, Marcus. "الذكاء الاصطناعي الشامل". www.hutter1.net . تم الاسترجاع في 2024-09-21 .
  4. ^ abc فينيس، جويل؛ كي سيونج نج؛ هوتر، ماركوس؛ أوثر، ويليام؛ سيلفر، ديفيد (2009). "تقريب مونت كارلو AIXI". arXiv : 0909.0801 [cs.AI].
  5. ^ Leike, Jan; Hutter, Marcus (2015). Bad Universal Priors and Notions of Optimality (PDF) . وقائع المؤتمر الثامن والعشرين حول نظرية التعلم.
  6. ^ سواريس، نيت. "صياغة مشكلتين من نماذج العالم الواقعية" (PDF) . Intelligence.org . تم الاسترجاع في 2015-07-19 .
  7. ^ لعب Pacman باستخدام تقريب AIXI – YouTube
  • "الذكاء الخوارزمي الشامل: نهج رياضي من أعلى إلى أسفل"، ماركوس هوتر، arXiv :cs/0701125؛ كما هو الحال في الذكاء الاصطناعي العام ، المحررون: ب. جورتزل وسي. بيناتشين، سبرينغر، 2007، ISBN 9783540237334 ، ص 227-290، doi :10.1007/978-3-540-68677-4_8. 
Retrieved from "https://en.wikipedia.org/w/index.php?title=AIXI&oldid=1246914523"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate