نموذج الاستدلال
نموذج الاستدلال ، المعروف أيضًا بنموذج لغة الاستدلال ( RLM ) أو نموذج الاستدلال الكبير ( LRM )، هو نوع من نماذج اللغة الكبيرة (LLM) تم تدريبه خصيصًا لحل المهام المعقدة التي تتطلب خطوات متعددة من الاستدلال المنطقي . [ 1 ] تُظهر هذه النماذج أداءً متفوقًا في مهام المنطق والرياضيات والبرمجة مقارنةً بنماذج اللغة الكبيرة القياسية. فهي تمتلك القدرة على مراجعة خطوات الاستدلال السابقة وتعديلها، واستخدام حسابات إضافية أثناء الاستدلال كطريقة لتحسين الأداء ، مكملةً بذلك أساليب التحسين التقليدية القائمة على حجم بيانات التدريب ومعلمات النموذج وقدرات التدريب الحاسوبية. [ 2 ]
ملخص
على عكس نماذج اللغة التقليدية التي تُنتج استجابات فورية، تُخصص نماذج الاستدلال وقتًا إضافيًا للمعالجة، أو التفكير، قبل تقديم إجابة لحل المشكلات متعددة الخطوات. وقد قدمت OpenAI هذا المصطلح في سبتمبر 2024 عند إطلاقها سلسلة o1 ، واصفةً النماذج بأنها مصممة "لتقضي وقتًا أطول في التفكير" قبل الاستجابة. وصفت الشركة o1 بأنها إعادة صياغة لتسمية النماذج تستهدف المهام المعقدة في العلوم والبرمجة والرياضيات، وقارنت أداء o1 مع GPT-4o على معايير قياس الأداء مثل AIME و Codeforces . وقد لخصت تقارير مستقلة نُشرت في الأسبوع نفسه إطلاق o1، وسلطت الضوء على ادعاء OpenAI بأن o1 تُؤتمت الاستدلال التسلسلي لتحقيق مكاسب كبيرة في الامتحانات الصعبة. [ 3 ] [ 4 ] [ 5 ]
أثناء التشغيل، تُنشئ نماذج الاستدلال سلاسل داخلية من الخطوات الوسيطة، ثم تختار وتُحسّن الإجابة النهائية. أفادت OpenAI أن دقة نموذج o1 تتحسن مع زيادة التدريب المعزز أثناء التدريب، وزيادة موارد الحوسبة أثناء الاختبار في مرحلة الاستدلال. اختارت الشركة في البداية إخفاء السلاسل الخام، وعرض ملخص مكتوب بواسطة النموذج، موضحةً أنها "قررت عدم إظهار" الأفكار الكامنة حتى يتمكن الباحثون من مراقبتها دون الكشف عن محتوى غير متوافق للمستخدمين النهائيين. توثق عمليات النشر التجارية "رموز استدلال" منفصلة تقيس التفكير الخفي، وعنصر تحكم في "جهد الاستدلال" يضبط مقدار موارد الحوسبة التي يستخدمها النموذج. تجعل هذه الميزات النماذج أبطأ من أنظمة الدردشة العادية، مع تمكينها من أداء أقوى في حل المشكلات المعقدة. [ 4 ] [ 6 ]
تاريخ
لقد جمع مسار البحث نحو نماذج الاستدلال بين التطورات في الإشراف والتوجيه والاستدلال القائم على أسلوب البحث .
أظهرت الدراسات المبكرة حول مواءمة التعلم المعزز مع التغذية الراجعة البشرية إمكانية ضبط النماذج بدقة لاتباع التعليمات باستخدام "التغذية الراجعة البشرية" والمكافآت القائمة على التفضيلات. [ 7 ] [ 8 ] وفي عام 2022، أظهر عالما أبحاث جوجل ، جيسون وي وديني تشو، أن توجيه سلسلة الأفكار "يحسن بشكل ملحوظ قدرة" النماذج الكبيرة على أداء مهام الاستدلال المعقدة. [ 9 ]
أظهرت نتيجة مصاحبة أن التعليمات البسيطة "لنفكر خطوة بخطوة" قادرة على استنباط التفكير المنطقي دون الحاجة إلى تدريب مسبق. [ 10 ] وقدّمت دراسات لاحقة فك تشفير الاتساق الذاتي، الذي "يعزز أداء" تسلسل الأفكار من خلال معاينة مسارات حلول متنوعة واختيار الحل الأمثل، بالإضافة إلى أساليب مُعززة بالأدوات مثل ReAct ، وهي كلمة مركبة من Reason وAct، والتي تحث النماذج على "توليد كل من آثار التفكير" والإجراءات. [ 11 ] [ 12 ] ثم عمّمت الأبحاث تسلسل الأفكار ليشمل البحث في خطط مرشحة متعددة. ويقترح إطار عمل شجرة الأفكار، الذي وضعه عالم الحاسوب شونيو ياو من جامعة برينستون، أن النماذج "تتخذ قرارات مدروسة" من خلال استكشاف شجرة من الأفكار الوسيطة والتراجع عنها. [ 13 ]
ركز الإنجاز الذي أعلنته OpenAI على الإشراف على عمليات الاستدلال بدلاً من النتائج فقط، حيث أفاد لايتمان وآخرون في بحثهم "دعونا نتحقق خطوة بخطوة" أن مكافأة كل خطوة صحيحة "تتفوق بشكل ملحوظ على الإشراف على النتائج" في مسائل الرياضيات المعقدة، وتحسن قابلية التفسير من خلال مواءمة تسلسل التفكير مع الحكم البشري. [ 14 ] [ 15 ] ويربط إعلان OpenAI عن o1 هذه الجوانب معًا بخوارزمية تعلم معزز واسعة النطاق تُدرّب النموذج على تحسين تسلسل تفكيره، ويشير إلى أن الدقة ترتفع مع زيادة موارد التدريب الحاسوبية وزيادة الوقت المُستغرق في التفكير أثناء الاستدلال. [ 4 ]
تُشكّل هذه التطورات مجتمعةً جوهر نماذج الاستدلال. فهي تستخدم إشارات إشرافية لتقييم جودة الخطوات الوسيطة، وتستغلّ استكشاف وقت الاستدلال مثل الإجماع أو البحث الشجري ، وتُتيح التحكم في مقدار الحوسبة الداخلية المُخصصة للتفكير. وقد أتاحت عائلة o1 من OpenAI هذا النهج على نطاق واسع في سبتمبر 2024، وشاعت تسمية "نموذج الاستدلال" لنماذج التعلم الآلي التي تُفكّر بوعي قبل الإجابة. [ 3 ] [ 6 ]
يُجسّد تطوير نماذج الاستدلال "الدرس القاسي" لريتشارد س. ساتون ، والذي مفاده أن توسيع نطاق الحوسبة يتفوق عادةً على الأساليب القائمة على رؤى من تصميم البشر. [ 16 ] وقد برهن باحثون في مختبر أبحاث الذكاء الاصطناعي التوليدي (GAIR) على هذا المبدأ، حيث حاولوا في البداية محاكاة قدرات o1 باستخدام أساليب متطورة، بما في ذلك البحث الشجري والتعلم المعزز، في أواخر عام 2024. وكشفت نتائجهم، المنشورة في سلسلة "رحلة محاكاة o1"، أن تقطير المعرفة ، وهي تقنية بسيطة نسبيًا تُدرّب نموذجًا أصغر لمحاكاة مخرجات o1، حققت أداءً قويًا بشكل غير متوقع. وقد أوضحت هذه النتيجة كيف يمكن لأساليب التوسع المباشر، في بعض الأحيان، أن تتفوق على الحلول الهندسية الأكثر تعقيدًا. [ 17 ] [ 18 ]
العيوب
تتطلب نماذج الاستدلال موارد حاسوبية أكبر بكثير أثناء عملية الاستدلال مقارنةً بالنماذج الأخرى. وقد أظهرت الأبحاث التي أُجريت على معيار امتحان الرياضيات الأمريكي المدعو (AIME) أن نماذج الاستدلال كانت أكثر تكلفةً من 10 إلى 74 مرة من نظيراتها الأخرى. [ 19 ] يُعزى طول وقت الاستدلال إلى مخرجات الاستدلال التفصيلية والخطوة بخطوة التي تُنتجها هذه النماذج، والتي عادةً ما تكون أطول بكثير من استجابات نماذج اللغة الكبيرة القياسية التي تُقدم إجابات مباشرة دون توضيح عملية الاستدلال.
جادل أحد الباحثين في أوائل عام 2025 بأن هذه النماذج قد تواجه مخاوف إضافية محتملة تتعلق بحجب الخدمة مع "هجمات التفكير الزائد". [ 20 ]
الإصدارات
2024
في سبتمبر 2024، أصدرت OpenAI نموذج o1-preview ، وهو نموذج لغوي ضخم ذو قدرات استدلالية محسّنة. [ 21 ] أُصدرت النسخة الكاملة، o1 ، في ديسمبر 2024. شاركت OpenAI مبدئيًا نتائج أولية لنموذجها اللاحق، o3 ، في ديسمبر 2024، [ 22 ] [ 23 ] [ 24 ] على أن يصبح نموذج o3 الكامل متاحًا في عام 2025. [ 25 ]
أصدرت شركة علي بابا نسخًا تجريبية من نماذج اللغة الكبيرة Qwen في نوفمبر 2024. [ 26 ] وفي ديسمبر 2024، قدمت الشركة QvQ-72B-Preview، وهو نموذج تجريبي للاستدلال البصري. [ 27 ]
في ديسمبر 2024، قدمت جوجل ميزة البحث العميق في جهاز جيميني ، وهي ميزة مصممة لإجراء مهام بحث متعددة الخطوات. [ 28 ] [ 29 ]
في 16 ديسمبر 2024، أثبت باحثون أنه من خلال زيادة قدرة الحوسبة أثناء الاختبار، يمكن لنموذج Llama 3B صغير نسبيًا أن يتفوق على نموذج Llama 70B الأكبر حجمًا بكثير في مهام الاستدلال المعقدة. أشارت هذه التجربة إلى أن استراتيجيات الاستدلال المحسّنة يمكن أن تُطلق العنان لقدرات الاستدلال حتى في النماذج الأصغر حجمًا. [ 30 ] [ 31 ]
2025
في يناير 2025، أطلقت شركة DeepSeek نموذج R1 ، وهو نموذج استدلالي حقق أداءً مماثلاً لنموذج o1 من OpenAI بتكلفة حسابية أقل بكثير. وقد أظهر هذا الإصدار فعالية تقنية تحسين السياسة النسبية الجماعية (GRPO)، وهي تقنية تعلم معزز تُستخدم لتدريب النموذج. [ 32 ] [ 33 ]
في 25 يناير 2025، قامت شركة DeepSeek بتحسين R1 بإضافة إمكانيات البحث على الويب، مما يسمح للنموذج باسترجاع المعلومات من الإنترنت أثناء أداء مهام الاستدلال. [ 34 ]
أكدت الأبحاث التي أُجريت خلال هذه الفترة فعالية تقطير المعرفة في بناء نماذج الاستدلال. حقق نموذج s1-32B أداءً متميزًا من خلال أساليب فرض الميزانية والتوسع، مما يعزز النتائج التي تشير إلى أن أساليب التدريب الأبسط يمكن أن تكون فعالة للغاية في تعزيز قدرات الاستدلال. [ 35 ] [ 18 ]
في 2 فبراير 2025، أطلقت OpenAI ميزة البحث العميق ، وهي ميزة مدعومة بنموذج o3 الخاص بها ، تُمكّن المستخدمين من إجراء مهام بحثية شاملة. [ 36 ] يُنشئ النظام تقارير مفصلة من خلال جمع المعلومات وتوليفها تلقائيًا من مصادر ويب متعددة. [ 36 ]
أطلقت OpenAI على GPT-4.5 لقب "آخر نموذج غير قائم على سلسلة التفكير"، [ 37 ] وقامت بتطبيق نموذج توجيه مع GPT-5 يختار النموذج بناءً على صعوبة المهمة. [ 38 ]
2026
في يناير 2026، أطلقت شركة Moonshot AI نموذج Kimi K2.5، وهو نموذج مفتوح المصدر يعتمد على مبدأ MoE ويحتوي على تريليون مُعامل، منها 32 مليار مُعامل نشط. تبع ذلك إصدار Kimi K2.6 في أبريل 2026. يستخدم كلا النموذجين نظام " سرب الوكلاء " الذي يُقسّم المهام ديناميكيًا إلى وكلاء فرعيين للاستدلال والتنفيذ، مما يُتيح حل المشكلات متعددة الخطوات بشكل أكثر قابلية للتوسع من سلسلة الاستدلال التسلسلي الأحادي [ 39 ] . ومع ذلك، على الرغم من تطابق النموذجين في المُعاملات، إلا أنهما يختلفان في نظام سرب الوكلاء؛ حيث يستخدم K2.5 تنسيق 100 وكيل فرعي، بينما يستخدم K2.6 تنسيق 300 وكيل فرعي، مما عزز قدرة الأخير على تنسيق المهام [ 40 ] .
تمرين
تتبع نماذج الاستدلال عملية التدريب المسبق واسعة النطاق المألوفة المستخدمة في نماذج اللغة الرائدة، ثم تختلف في مرحلتي ما بعد التدريب والتحسين. تشير OpenAI إلى أن نموذج o1 مُدرَّب باستخدام خوارزمية تعلّم معزز واسعة النطاق تُعلِّم النموذج استخدام سلسلة من الأفكار وتحسينها قبل الإجابة. وتؤكد الشركة على عنصرين مترابطين: زيادة التعلّم المعزز أثناء التدريب، وزيادة وقت التفكير أثناء الاستدلال، وتوثّق تحسُّنًا تدريجيًا مع زيادة كلٍّ منهما. كما تُصرِّح OpenAI بأنها قررت عدم عرض سلاسل الأفكار الخام للمستخدمين النهائيين، وبدلًا من ذلك تُقدِّم ملخصًا مكتوبًا بواسطة النموذج، وهو خيار منتج مرتبط بمراقبة السلامة والمخاوف التنافسية. [ 4 ]
يُعدّ الإشراف على العمليات عنصرًا أساسيًا، إذ يُكافئ الخطوات الوسيطة بدلًا من الإجابة النهائية فقط. وقدّمت دراسة OpenAI نموذجًا لمكافأة العمليات مُدرّبًا على تصنيفات مستوى الخطوات، ووجدت أن الإشراف على العمليات يتفوّق بشكل ملحوظ على الإشراف على النتائج فقط في مسائل الرياضيات المعقدة. كما أصدر المشروع مجموعة بيانات PRM800K للتغذية الراجعة على مستوى الخطوات، وأوضح أن مكافآت مستوى العمليات تُحسّن قابلية التفسير لأن البشر يستطيعون التحقق من كل خطوة. وقد وفّرت هذه النتائج وصفة عملية للإشراف على سلاسل التفكير، والتي تمّ توسيع نطاقها لاحقًا لتشمل التدريب الإنتاجي. [ 15 ]
يختلف هذا التدريب اختلافًا جوهريًا عن نماذج الحدود التقليدية التي لا تستهدف الاستدلال. تُدرَّب الأنظمة القياسية مسبقًا على مجموعات بيانات ضخمة على الإنترنت بهدف التنبؤ بالرمز التالي، ثم تُحاذى من خلال ضبط التعليمات وتحسين التفضيلات. تستخدم وصفة InstructGPT النموذجية أولًا الضبط الدقيق الخاضع للإشراف على عروض توضيحية بشرية، ثم تُدرَّب نموذج مكافأة من التفضيلات الثنائية، وأخيرًا تُحسِّن السياسة باستخدام التعلم المعزز، وعادةً ما يكون PPO مع عقوبة KL . [ 8 ] [ 41 ] تزيل المتغيرات، مثل تحسين التفضيلات المباشر، خطوة التعلم المعزز الصريحة وتُحسِّن النموذج مباشرةً على بيانات التفضيلات، لكن هدف الإشراف يظل هو النتيجة النهائية التي يحكم عليها المُقيِّمون بدلًا من جودة الخطوات الداخلية. [ 42 ] تُلخِّص التقارير الفنية لـ GPT-4 هذه العملية التقليدية على أنها تدريب مسبق على الرمز التالي متبوعًا بتدريب لاحق على نمط RLHF لتشكيل السلوك. [ 43 ]
على النقيض من ذلك، تُحسَّن نماذج الاستدلال لإنتاج سلاسل متعددة الخطوات ونقدها ومراجعتها أثناء التدريب. تشير OpenAI إلى تطبيق التعلم المعزز على السلسلة نفسها، مما يُعلِّم النموذج كيفية التعرف على الأخطاء، وتقسيم المشكلات إلى خطوات أبسط، وتغيير الاستراتيجيات عند فشل النهج الحالي. كما توثق OpenAI أنها تُخفي السلاسل أثناء الاستدلال، وتُعيد إجابة تُوجز الأفكار المفيدة من التتبع الداخلي. تعكس خيارات التصميم هذه هدف تدريب النموذج ومراقبته المقصودة. [ 4 ]
قدّم زيليكمان وزملاؤه نموذج STaR (المُستدلّ المُعلّم ذاتيًا)، الذي استكشف بناء المبررات من خلال توليد سلاسل منطقية وتصفيتها بشكل متكرر، ثم ضبطها بدقة بناءً على تلك الآثار، وأفادوا بتحقيق مكاسب مقارنةً بالضبط الدقيق القائم على النتائج فقط. وقدّم أحد متغيرات هذه الطريقة آليات إضافية لإنتاج إشارات تدريبية تُشير إلى الاستدلال الوسيط، وليس فقط الإجابات النهائية. [ 44 ]
أفاد موقع DeepSeek أن أنظمة R1 وR1-Zero المدربة باستخدام التعلم المعزز الخالص قادرة على استنباط سلاسل طويلة، والتحقق الذاتي، والتأمل، مشيرًا إلى أن المكافآت الصريحة على مستوى السلسلة يمكن أن تحفز سلوكيات استدلال عامة. تشير هذه النتائج إلى أن التدريب اللاحق الذي يركز على جودة السلسلة أصبح نظامًا متميزًا منفصلًا عن التوافق القائم على النتائج فقط. [ 45 ]
الضبط الدقيق تحت الإشراف
يمكن ضبط نموذج لغوي كبير ( LLM) بدقة على مجموعات بيانات لمهام الاستدلال المقترنة بتتبعات الحلول خطوة بخطوة. ويتعلم النموذج المضبوط بدقة إنتاج سلاسل الاستدلال الخاصة به للمشكلات الجديدة. [ 46 ] [ 47 ]
نظراً لارتفاع تكلفة جمع البيانات المكتوبة يدوياً، يستخدم الباحثون تقنية الضبط الدقيق لأخذ العينات بالرفض (RFT) لبناء مجموعات البيانات تلقائياً. تُولّد هذه الطريقة مسارات استدلال متعددة لكل سؤال، ثم تُصفّي المسارات ذات الإجابات النهائية غير الصحيحة باستخدام أداة تحقق. [ 48 ]
التعلم المعزز
يمكن تدريب نموذج لغوي مُدرَّب مسبقًا بشكل إضافي باستخدام التعلم المعزز. في التعلم المعزز، يعمل نموذج اللغة التوليدي كسياسة، ويُشار إليه بـفي إطار هذا الشكل الرسمي، يُطلق على موجه المهمة اسم الحالة البيئيةويكون رد فعل النموذج إجراءًاحتمالية استجابة النموذجمنحتُكتب على النحو التالي:.
ولتطوير نموذج لغة استدلالية باستخدام التعلم المعزز، تتمثل الخطوة التالية في بناء نموذج مكافأة.لتوجيه العملية. وبشكل بديهي، تشير المكافأة إلى مدى جودة الاستجابة للمُحفِّز. في مهمة الاستدلال، تكون المكافأة عالية إذا حلت الاستجابة المهمة، ومنخفضة في غير ذلك.
وبناءً على ذلك، رديمكن تقسيمها إلى خطوات متعددة، يُشار إليها بـحيث كليمثل خطوة مميزة في عملية الاستجابة.
تستخدم معظم الأنظمة الحديثة أساليب تدرج السياسة مثل تحسين السياسة التقريبي (PPO) لهذا السبب، حيث أن PPO يقيد كل تحديث للسياسة بهدف مقصوص، مما يؤدي إلى استقرار التدريب للسياسات الكبيرة جدًا. [ 49 ]
نموذج مكافأة النتائج
يقدم نموذج مكافأة النتائج، أو نموذج مكافأة النتائج الخاضع للإشراف (ORM)، [ 46 ] مكافأة للخطوةبناءً على الإجابة النهائية:. غالباً ما تسمى هذه النماذج "المُدقِّقات".
بالنسبة للمهام التي يسهل التحقق من إجاباتها، مثل مسائل الرياضيات اللفظية ، يمكن أن تكون مكافأة النتيجة ثنائية: 1 إذا كانت الإجابة النهائية صحيحة، و0 خلاف ذلك. [ 46 ] إذا كان التحقق التلقائي صعبًا، يمكن للبشر تصنيف الإجابات على أنها صحيحة أو خاطئة، ويمكن استخدام هذه التصنيفات لضبط نموذج أساسي يتنبأ بالتصنيف البشري. [ 47 ] بالنسبة لمهام مثل الكتابة الإبداعية، حيث لا تكون الجودة صحيحة أو خاطئة ببساطة، يمكن تدريب نموذج مكافأة على بيانات تفضيل بشرية مرتبة ، كما هو الحال في التعلم المعزز من خلال التغذية الراجعة البشرية . [ 19 ] يمكن أيضًا ضبط نموذج أساسي للتنبؤ، انطلاقًا من أثر تفكير جزئي.، وما إذا كانت الإجابة النهائية ستكون صحيحة، ويمكن أن يكون هذا التوقع بمثابة مكافأة ثنائية. [ 46 ]
يتم تدريب نموذج ORM عادةً باستخدام الانحدار اللوجستي ، أي عن طريق تقليل خسارة الإنتروبيا المتقاطعة . [ 50 ]
بفرض وجود نموذج PRM، يمكن إنشاء نموذج ORM بضرب إجمالي مكافأة العملية أثناء مسار الاستدلال، [ 19 ] أو بأخذ القيمة الدنيا، [ 50 ] أو بطرق أخرى لتجميع مكافآت العمليات. استخدم DeepSeek نموذج ORM بسيطًا لتدريب نموذج R1 . [ 33 ]
نموذج مكافأة العملية
يقدم نموذج مكافأة العملية، أو نموذج مكافأة العملية الخاضع للإشراف (PRM)، [ 46 ] المكافأة للخطوةبناءً على الخطوات التي تم اتخاذها حتى الآن فقط:.
بالنظر إلى أثر التفكير الجزئييستطيع الإنسان الحكم على صحة الخطوات المتخذة حتى الآن دون النظر إلى الإجابة النهائية، مما ينتج عنه مكافأة ثنائية. ولأن تصنيفات الإنسان مكلفة، يمكن ضبط نموذج أساسي بدقة للتنبؤ بها. [ 46 ] عادةً ما يتم تدريب نموذج PRM باستخدام الانحدار اللوجستي على تصنيفات الإنسان، أي عن طريق تقليل خسارة الإنتروبيا المتقاطعة بين التصنيفات الحقيقية والمتوقعة. [ 50 ]
على سبيل المثال، جمعت ورقة بحثية نُشرت عام ٢٠٢٣ في مؤتمر OpenAI بيانات ٨٠٠ ألف تصنيف لعملية التفكير لـ ٧٥ ألف مسار تفكير. قام مُصنِّف بتحليل كل مسار، وصنّف كل خطوة فيه على أنها "إيجابية" إذا كانت تُسهم في الحل، و"محايدة" إذا لم تكن خاطئة ولكنها لم تُساعد، و"سلبية" إذا كانت خطأً. بعد أول تصنيف "سلبي"، توقف المُصنِّف عند ذلك المسار وانتقل إلى مسار آخر. جادل الباحثون بأن تصنيف البيانات حتى الخطأ الأول كان كافيًا لتدريب نموذج استجابة سلوكية فعال، على الرغم من أن تصنيف الخطوات اللاحقة قد يُعطي إشارات أكثر ثراءً. [ ١٩ ] [ ٥١ ]
لتجنب التصنيفات البشرية، اقترح الباحثون طرقًا لإنشاء نماذج العلاقات بين العمليات دون تصنيفات بشرية. تعتمد طريقة ماث-شيبيرد، المستوحاة من بحث شجرة مونت كارلو ، على أخذ عينات من عدة استمرارات حتى النهاية، بدءًا من كل خطوة استدلالية.وحدد المكافأة في تلك الخطوة إمافي حالة "التقدير التقريبي"، أو في حالة "التقدير الدقيق"، يُنتج هذا مكافآت عملية من نموذج ORM، والذي غالبًا ما يكون بناؤه أسهل أو أقل تكلفة. بعد ذلك، يمكن تدريب نموذج PRM على هذه التصنيفات. [ 50 ] وقد حاولت بعض الدراسات استخدام منهجية MCTS بشكل كامل. [ 52 ]
يمكن أيضًا استخدام ORM لإنشاء PRM ضمنيًا، على غرار تحسين التفضيل المباشر . [ 53 ]
أخذ العينات الموجه
يمكن استخدام نموذج ORM مُدرَّب لاختيار أفضل استجابة. تُولِّد السياسة عدة استجابات، ويختار نموذج ORM أفضلها. يُطبِّق هذا شكلاً بسيطاً من أشكال توسيع نطاق الحوسبة في وقت الاختبار ("أفضل من بين N"). [ 47 ] [ 54 ]
يمكن لنموذج إدارة العلاقات العامة المدرب توجيه عملية الاستدلال من خلال بحث شجري جشع : تقترح السياسة عدة خطوات تالية، ويختار النموذج إحداها، ثم تتكرر العملية. وهذا يُحاكي استخدام نموذج إدارة العلاقات العامة لاختيار استجابة كاملة. [ 55 ] ويُعدّ البحث الشعاعي أفضل أداءً من البحث الجشع.
يُعدّ البحث الاستباقي طريقة أخرى للبحث في الشجرة. تقترح هذه الطريقة عدة خطوات تالية، ثم تُجري عملية تنفيذ قصيرة لكل خطوة. إذا تم العثور على حل أثناء التنفيذ، يتوقف البحث مبكرًا. وإلا، تُقيّم خوارزمية إدارة السياسات (PRM) كل عملية تنفيذ، ويتم اختيار الخطوة ذات أعلى درجة. [ 31 ]
يمكن دمج الاتساق الذاتي مع نموذج ORM. يُولّد النموذج إجابات متعددة، وتُجمّع هذه الإجابات بحيث تحتوي كل مجموعة على نفس الإجابة النهائية. يُقيّم نموذج ORM كل إجابة، وتُجمع الدرجات في كل مجموعة، ثم تُعاد الإجابة من المجموعة ذات أعلى درجة. [ 50 ]
المعايير
تحقق نماذج الاستدلال عمومًا درجات أعلى من النماذج غير الاستدلالية في العديد من المعايير، لا سيما في المهام التي تتطلب استدلالًا متعدد الخطوات. [ 56 ] [ 57 ] [ 58 ] [ 59 ]
على سبيل المثال، في امتحان الرياضيات الأمريكي المدعو (AIME)، وهو مسابقة رياضية صعبة، لم تتمكن النماذج غير القائمة على الاستدلال عادةً من حل أكثر من 30% من المسائل. في المقابل، حققت العديد من النماذج القائمة على الاستدلال في بداياتها معدلات نجاح تتراوح بين 50% و80%. [ 2 ] [ 33 ] [ 35 ] أما نموذج o3-mini-high، الذي صدر في يناير 2025، فقد حقق دقة تزيد عن 80%. [ 60 ]
تستبعد بعض المعايير نماذج الاستدلال نظرًا لأوقات استجابتها الأطول وتكاليف الاستدلال الأعلى، بما في ذلك معايير الكشف عن الأحداث المعقدة عبر الإنترنت في الأنظمة السيبرانية الفيزيائية ، وتقييم وقت الاستدلال العام، ومهام هندسة Verilog، وتقييمات أمن الشبكات. [ 61 ] [ 62 ] [ 63 ] [ 64 ]
نماذج
| شركة | نموذج | تاريخ الافراج عنه |
|---|---|---|
| أوبن إيه آي ( ChatGPT ) | GPT-5 (o3.1) | أغسطس 2025 |
| GPT-OSS | أغسطس 2025 [ 65 ] | |
| o3 و o4-mini | أبريل 2025 | |
| o3-mini | يناير 2025 | |
| o1 | ديسمبر 2024 | |
| معاينة o1 | سبتمبر 2024 | |
| جوجل جيميني | 3 ومضات | ديسمبر 2025 |
| 3 برو | نوفمبر 2025 | |
| 2.5 استخدام الحاسوب | أكتوبر 2025 | |
| 2.5 فلاش | أبريل 2025 | |
| 2.5 برو | مارس 2025 | |
| 2.0 التفكير السريع | ديسمبر 2024 | |
| ديب سيك | الإصدار التجريبي V3.2 | سبتمبر 2025 |
| الإصدار 3.1 | أغسطس 2025 | |
| R1-0528 | مايو 2025 | |
| V3-0324 | مارس 2025 | |
| R1 و R1-Lite-Preview | يناير 2025 | |
| مجموعة علي بابا | QwQ-32B | مارس 2025 |
| معاينة QvQ-72B | ديسمبر 2024 | |
| معاينة QwQ-32B | نوفمبر 2024 | |
| الأنثروبيك | كلود أوبوس 4.5 | نوفمبر 2025 |
| كلود هايكو 4.5 | أكتوبر 2025 | |
| كلود سونيت (منذ 3.7) | فبراير 2025 | |
| ميسترال للذكاء الاصطناعي | متوسط / صغير | يونيو 2025 |
| xAI | جروك 4 | يوليو 2025 |
| جروك 3 | فبراير 2025 | |
| وجه معانقة | OlympicCoder-7B & 32B | فبراير 2025 |
| إنفيديا | لاما نيموترون | مارس 2025 |
| تينسنت | هونيوان T1 | مارس 2025 |
| مونشوت للذكاء الاصطناعي | كيمي كيه 2 يفكر | نوفمبر 2025 |
| كيمي كيه 2.5 | يناير 2026 | |
| كيمي كيه 2.6 | أبريل 2026 |
انظر أيضاً
مراجع
- ↑ بيستا، ماسيج؛ بارث، جوليا؛ شرايبر، إريك؛ كوبيتشيك، أليس؛ كاتارينو، أفونسو؛ جيرستنبرجر، روبرت؛ نيتشيك، بيوتر؛ إيف، باتريك؛ لي، يولينغ (23-01-2025). "نماذج لغة الاستدلال: مخطط". arXiv : 2501.11223 [ cs.CL ].
- 1 2 "التعلم على الاستدلال باستخدام نماذج التعلم الموجه" . OpenAI . 2024-09-12 . تم الاطلاع عليه بتاريخ 2025-07-26 .
- 1 2 تقديم OpenAI o1-preview ، OpenAI، 2024-09-12
- 1 2 3 4 5 تعلم الاستدلال باستخدام نماذج التعلم الموجه ، OpenAI، 12 سبتمبر 2024
- ↑ أطلقت OpenAI سلسلة جديدة من نماذج الذكاء الاصطناعي ذات القدرات الاستدلالية ، رويترز، 12 سبتمبر 2024
- 1 2 نماذج الاستدلال في Azure OpenAI ، مايكروسوفت ليرن، 11 أكتوبر 2025
- ↑ كريستيانو، بول؛ ليك، جان؛ براون، توم ب.؛ مارتيتش، ميلجان؛ ليج، شين؛ أمودي، داريو (2017). "التعلم العميق المعزز من التفضيلات البشرية". arXiv : 1706.03741 [ stat.ML ].
- 1 2 أويانغ، لونغ؛ وو، جيف؛ جيانغ، شو؛ دينان، إميلي؛ بانسال، برافولا؛ واينرايت، سام؛ شو، تشونغ؛ شولمان، جون (2022). "تدريب نماذج اللغة على اتباع التعليمات مع التغذية الراجعة البشرية". arXiv : 2203.02155 [ cs.CL ].
- ↑ وي، جيسون؛ وانغ، شوزي؛ شورمانز، ديل؛ ساكستون، ديفيد؛ برينجر، رايان؛ رين، شوهوي؛ ليو، يانغ؛ تشو، ديني (2022). "استثارة التفكير من خلال تسلسل الأفكار في نماذج اللغة الكبيرة". arXiv : 2201.11903 [ cs.CL ].
- ^ كوجيما، تاكيشي. قو، شيشيانغ؛ ريد، ماشيل. ماتسو، يوتاكا؛ إيواساوا، يوسوكي (2022). “نماذج اللغات الكبيرة هي مسببات صفرية”. أرخايف : 2205.11916 [ cs.CL ].
- ↑ وانغ، شوزي؛ وي، جيسون؛ شورمانز، ديل؛ لي، كوك؛ تشي، إد؛ تشو، ديني (2022). "الاتساق الذاتي يحسن استدلال سلسلة الأفكار في نماذج اللغة". arXiv : 2203.11171 [ cs.CL ].
- ^ ياو، شونيو؛ تشاو، جيفري. يو، ديان؛ دو، نان؛ شافران، إسحاق؛ ناراسيمهان، كارثيك؛ تساو، يوان (2022). “رد الفعل: التآزر بين الاستدلال والتصرف في نماذج اللغة”. أرخايف : 2210.03629 [ cs.CL ].
- ↑ ياو، شونيو؛ يو، ديان؛ تشاو، جيفري؛ شفران، إسحاق؛ غريفيث، توماس ل.؛ كاو، يوان؛ ناراسيمهان، كارتيك (2023). "شجرة الأفكار: حل المشكلات المتعمد باستخدام نماذج لغوية كبيرة". arXiv : 2305.10601 [ cs.CL ].
- ↑ لايتمان، هنتر؛ كوساراجو، فينيت؛ بوردا، يورا؛ إدواردز، هاري؛ بيكر، بوين؛ لي، تيدي؛ ليك، جان؛ شولمان، جون؛ سوتسكيفر، إيليا (2023). "لنتحقق خطوة بخطوة". arXiv : 2305.20050 [ cs.LG ].
- 1 2 تحسين الاستدلال الرياضي من خلال الإشراف على العمليات ، OpenAI، 31-05-2023
- ↑ ساتون، ريتشارد س. "الدرس المرير" . أفكار غير مكتملة . تم الاسترجاع في 27-02-2025 .
- ^ هوانغ ، تشن. زو، هاويانغ؛ لي، شيوفنغ؛ ليو، ييكسيو؛ تشنغ، يوشيانغ؛ تشيرن، إيثان؛ شيا، شيجي؛ تشين، ييوي؛ يوان ، ويزهي (2024/11/25). “رحلة النسخ المتماثل O1 – الجزء 2: تجاوز معاينة O1 من خلال التقطير البسيط أم التقدم الكبير أم الدرس المرير؟”. أرخايف : 2411.16489 [ cs.CL ].
- 1 2 زيف، ماكسويل (5 فبراير 2025). "باحثون يبتكرون منافسًا مفتوح المصدر لنموذج o1 الخاص بـ OpenAI 'للاستدلال' بأقل من 50 دولارًا" . TechCrunch . تم الاطلاع عليه بتاريخ 26 يوليو 2025 .
- 1 2 3 4 لايتمان، هنتر؛ كوساراجو، فينيت؛ بوردا، يورا؛ إدواردز، هاري؛ بيكر، بوين؛ لي، تيدي؛ ليك، جان؛ شولمان، جون؛ سوتسكيفر، إيليا (2024). "لنتحقق خطوة بخطوة" . المؤتمر الدولي لتمثيلات التعلم (ICLR 2024) . arXiv : 2305.20050 . تاريخ الاسترجاع : 26 يوليو 2025 .
- ↑ أبهيناف كومار (2025). "التفكير الزائد: هجمات الإبطاء على نماذج التعلم المنطقي". arXiv : 2502.02542 [ cs.LG ].
- ↑ إدواردز، بنج (12 سبتمبر 2024). "نماذج الذكاء الاصطناعي الجديدة "للاستدلال" من OpenAI متوفرة الآن: o1-preview و o1-mini" . آرس تكنيكا . تاريخ الاسترجاع: 6 فبراير 2025 .
- ↑ "بطاقة نظام OpenAI o1" (ملف PDF) . OpenAI . 2024-12-05 . تم الاطلاع عليه بتاريخ 2025-07-26 .
- ↑ روبيسون، كايلي (5 ديسمبر 2024). "أطلقت OpenAI خدمة ChatGPT Pro، وهي خطة بقيمة 200 دولار شهريًا مع وصول غير محدود إلى o1 وGPT-4o والمزيد" . ذا فيرج . تم الاطلاع عليه بتاريخ 26 يوليو 2025 .
- ↑ سينغ، جاسبريت (2024-12-20). "OpenAI تكشف النقاب عن نموذج 'o3'، مشيدةً بالتقدم المحرز في مجال الاستدلال" . رويترز . تم الاطلاع عليه بتاريخ 26-07-2025 .
- ↑ "تقديم OpenAI o3 و o4-mini" . OpenAI . 16-04-2025 . تم الاطلاع عليه بتاريخ 26-07-2025 .
- ↑ فريق كوين (28-11-2024). "معاينة QwQ-32B: تأمل عميق في حدود المجهول" . كوين (علي بابا كلاود) . تم الاطلاع عليه بتاريخ 26-07-2025 .
- ↑ فريق كوين (25-12-2024). "QVQ: لرؤية العالم بحكمة" . كوين . علي بابا كلاود . تم الاسترجاع في 26-07-2025 .
- ↑ "جرّب البحث العميق ونموذجنا التجريبي الجديد في جيميني، مساعدك الذكي" . جوجل . ١١ ديسمبر ٢٠٢٤. تم الاطلاع عليه بتاريخ ٥ فبراير ٢٠٢٥ .
- ↑ روث، إيما (11 ديسمبر 2024). "جوجل طورت أداة ذكاء اصطناعي يمكنها إجراء البحوث نيابةً عنك" . ذا فيرج . تاريخ الاسترجاع: 26 يوليو 2025 .
- ↑ "توسيع نطاق الحوسبة أثناء الاختبار" . Hugging Face . 2024-12-16 . تم الاسترجاع في 2025-07-26 .
- 1 2 سنيل، تشارلي؛ لي، جاي هون؛ شو، كيلفن؛ كومار، أفيرال (2025). "قد يكون توسيع نطاق حساب وقت اختبار نموذج التعلم الخطي الأمثل أكثر فعالية من توسيع نطاق معلمات النموذج" . المؤتمر الدولي لتمثيلات التعلم (ICLR 2025) . arXiv : 2408.03314 . تاريخ الاسترجاع : 26 يوليو 2025 .
- ↑ أورلاند، كايل (28 يناير 2025). "كيف يُقارن أداء DeepSeek R1 بأفضل نماذج الاستدلال من OpenAI؟" . آرس تكنيكا . تاريخ الاسترجاع: 6 فبراير 2025 .
- 1 2 3 ديب سيك-AI؛ قوه دايا. يانغ، ديجيان؛ تشانغ، هاوي؛ سونغ، جونشياو؛ تشانغ، رويو؛ شو، رونكسين؛ تشو، تشيهاو؛ ما ، شيرونج (22/01/2025). “DeepSeek-R1: تحفيز القدرة على التفكير في ماجستير إدارة الأعمال عبر التعلم المعزز”. أرخايف : 2501.12948 [ cs.CL ].
- ↑DeepSeek 支持"البحث عن المعلومات+البحث عن المعلومات"能力[ أضافت DeepSeek ميزة بحث تدعم التفكير العميق والبحث عبر الإنترنت في آن واحد ] . صحيفة الشعب اليومية الإلكترونية (باللغة الصينية). 29 يناير 2025. تاريخ الاطلاع: 26 يوليو 2025 .
- 1 2 مونيجوف، نيكلاس؛ يانغ، زيتونج؛ شي، ويجيا؛ لي، شيانغ ليزا؛ فاي فاي، لي؛ حاجشيرزي, حنانه ; زيتليموير، لوقا؛ ليانغ, بيرسي ; كانديس ، إيمانويل (2025/02/03). "s1: قياس بسيط لوقت الاختبار". أرخايف : 2501.19393 [ cs.CL ].
- 1 2 "مقدمة في البحث المعمق" . OpenAI . 2025-02-02 . تم الاطلاع عليه بتاريخ 2025-02-05 .
- ↑ فريد، إينا (28 فبراير 2025). "إصدار OpenAI لنموذج GPT-4.5 يُبرز التحدي التالي للذكاء الاصطناعي" . أكسيوس . تاريخ الاسترجاع: 20 يناير 2026 .
- ↑ غولدمان، شارون. "أثار نموذج التوجيه GPT-5 ردود فعل سلبية من المستخدمين ضد OpenAI، لكنه قد يكون مستقبل الذكاء الاصطناعي" . مجلة فورتشن . تاريخ الاسترجاع: 20 يناير 2026 .
- ↑ "مدونة كيمي كي 2.5 التقنية: الذكاء البصري الوكيل" . www.kimi.com . تاريخ الاسترجاع: 25-02-2026 .
- ↑ "Kimi K2.6: نموذج وكيل مفتوح الوزن" . Verdent AI . 2026-04-21 . تم الاسترجاع في 2026-06-27 .
- ↑ زيغلر، دانيال م.؛ ستينون، نيسان؛ وو، جيفري؛ براون، توم ب.؛ رادفورد، أليك؛ أمودي، داريو؛ كريستيانو، بول؛ إيرفينغ، جيفري (2019). "ضبط نماذج اللغة بدقة من خلال التفضيلات البشرية". arXiv : 1909.08593 [ cs.CL ].
- ↑ رافائيلوف، رافائيل؛ شارما، كوشال؛ ميتشل، إريك؛ مانينغ، كريستوفر د.؛ إرمون، ستيفانو؛ فين، تشيلسي (2023). "تحسين التفضيل المباشر: نموذج لغتك هو في السر نموذج مكافأة". arXiv : 2305.18290 [ cs.LG ].
- ↑ أتشيام، جوش؛ أدلر، ستيفن؛ أغاروال، سانديني (2023). "تقرير فني عن GPT-4". arXiv : 2303.08774 [ cs.CL ].
- ↑ زيليكمان، إريك؛ وو، يوهواي؛ مو، جيسي؛ غودمان، نوح د. (2022). "STAr: Bootstrapping Reasoning With Reasoning". arXiv : 2203.14465 [ cs.LG ].
- ↑ غو، دان (2025). "DeepSeek-R1: تحفيز القدرة على الاستدلال في نماذج التعلم المعزز من خلال التعلم المعزز". arXiv : 2501.12948 [ cs.CL ].
- 1 2 3 4 5 6 أوساتو، جوناثان؛ كوشمان، نيت؛ كومار، رامانا؛ سونغ، فرانسيس؛ سيجل، نوح؛ وانغ، ليزا؛ كريسويل، أنطونيا؛ إيرفينغ، جيفري؛ هيغينز، إيرينا (25-11-2022). "حل مسائل الرياضيات اللفظية باستخدام التغذية الراجعة القائمة على العملية والنتيجة". arXiv : 2211.14275 [ cs.LG ].
- 1 2 3 كوبي، كارل؛ كوساراجو، فينيت؛ بافاريان، محمد؛ تشين، مارك؛ جون، هيوو؛ كايزر، لوكاس؛ بلابيرت، ماتياس؛ توورك، جيري؛ هيلتون، جاكوب (2021-11-18). "تدريب أدوات التحقق لحل مسائل الرياضيات اللفظية". arXiv : 2110.14168 [ cs.LG ].
- ^ يوان، تشنغ؛ يوان، هونغ يى؛ لي، تشينجبينج؛ دونغ، غوانتينغ؛ لو، كيمينغ؛ تان، تشوانكي؛ تشو، تشانغ؛ تشو ، جينجرين (2023/09/13). “توسيع نطاق العلاقة في تعلم التفكير الرياضي باستخدام نماذج اللغة الكبيرة”. أرخايف : 2308.01825 [ cs.CL ].
- ↑ "مواءمة نماذج اللغة لاتباع التعليمات" . مدونة OpenAI . 27 يناير 2022. تاريخ الاسترجاع: 4 مايو 2025 .
- 1 2 3 4 5 وانغ، بيي؛ لي، لي؛ شاو، تشيهونغ؛ شو، رونشين؛ داي، داماي؛ لي، ييفي؛ تشين، ديلي؛ وو، يو؛ سوي، تشيفانغ (أغسطس 2024). كو، لون-وي؛ مارتينز، أندريه؛ سريكومار، فيفيك (محررون). "Math-Shepherd: التحقق من نماذج اللغة الطويلة وتعزيزها خطوة بخطوة دون تعليقات بشرية". وقائع الاجتماع السنوي الثاني والستين لجمعية اللغويات الحاسوبية (المجلد 1: الأوراق الطويلة) . بانكوك، تايلاند: جمعية اللغويات الحاسوبية: 9426-9439 . arXiv : 2312.08935 . doi : 10.18653/v1/2024.acl-long.510 .
- ↑ "prm800k" . GitHub . OpenAI. 2025-01-27 . تم الاسترجاع في 2025-01-27 .
- ↑ تشين، غوكسين؛ لياو، مينبنغ؛ لي، تشنغشي؛ فان، كاي (2024-09-27). "ألفا ماث شبه الصفر: الإشراف على العمليات بدون عمليات". arXiv : 2405.03553 [ cs.LG ].
- ^ يوان، ليفان؛ لي، ويندي؛ تشن، هوايو؛ كوي، جانكو؛ دينغ، نينغ؛ تشانغ، كيان؛ تشو، بوين؛ Liu, تشييوان ; بنغ ، هاو (2024/12/02). "مكافآت العملية المجانية بدون تسميات العملية". أرخايف : 2412.01981 [ cs.CL ].
- ^ تشانغ، دي؛ وو، جيانبو؛ لي، جينجدي؛ تشي، تونغ؛ لي، جياتونغ؛ شيه، تونغ؛ هوانغ، شياوشوي؛ تشانغ، شوفي. بافوني ، ماركو (2024/11/21). “LLaMA-Berry: التحسين الزوجي للاستدلال الرياضي على مستوى الأولمبياد الذي يشبه O1”. أرخايف : 2410.02884 [ cs.CL ].
- ↑ ما، تشيانلي؛ تشو، هاوتيان؛ ليو، تينغكاي؛ يوان، جيانبو؛ ليو، بنغفي؛ أنت يانغ؛ يانغ ، هونغشيا (2023/10/16). "دعونا نكافئ خطوة بخطوة: نموذج المكافأة على مستوى الخطوة كملاحين للاستدلال". أرخايف : 2310.10080 [ cs.CL ].
- ↑ كوي، دونغ شو؛ لونغ، شي يو؛ تانغ، يي شوان؛ تشاو، يو؛ لي، تشياو (25 أغسطس 2025). "هل يمكن لقوة الاستدلال أن تُحسّن بشكلٍ ملحوظ معرفة نماذج اللغة الكبيرة في الكيمياء؟ - بناءً على المحادثات مع نماذج اللغة الكبيرة" . مجلة المعلومات الكيميائية والنمذجة . 65 (18) acs.jcim.5c01265. doi : 10.1021/acs.jcim.5c01265 . ISSN 1549-9596 . PMID 40854079 .
- ↑ كوين؛ يانغ، آن؛ يانغ، باوسونغ؛ تشانغ، بيتشن؛ هوي، بينيوان؛ تشنغ، بو؛ يو، بوين؛ لي، تشنغيوان؛ ليو ، دايهينج (2024). “التقرير الفني Qwen2.5”. أرخايف : 2412.15115 [ cs.CL ].
- ↑ كومانيتشي، جورج؛ بيبر، إريك؛ شايكرمان، مايك؛ باسوبات، آيس؛ ساشديفا، نوفين؛ ديلون، إندرجيت؛ بليستين، مارسيل؛ رام، أوري؛ تشانغ، دان (22-07-2025). "جيميني 2.5: دفع الحدود بالاستدلال المتقدم، والتعددية الوسائطية، والسياق الطويل، وقدرات الجيل التالي من الوكلاء". arXiv : 2507.06261 [ cs.CL ].
- ^ ميرزا، ادريان. الامبارا، نواف؛ كونشابو، سريكانث؛ ريوس غارسيا، مارتينيو؛ إمويكابو، بنديكت؛ كريشنان، أسوانث؛ غوبتا، تانيا؛ شيلينغ فيلهلمي، مارا؛ أوكيريكي، ماكجوناثان؛ أنيش، أناغا؛ أصغري، مهرداد؛ ابرهارت، جوليان. إلهي، أمير محمد؛ البحيري، هاني م.؛ جيل ماريا فيكتوريا (يوليو 2025). "إطار لتقييم المعرفة الكيميائية والقدرات المنطقية لنماذج اللغة الكبيرة مقابل خبرة الكيميائيين" . كيمياء الطبيعة . 17 (7): 1027–1034 . بيب كود : 2025NatCh..17.1027M . doi : 10.1038/s41557-025-01815- x . ISSN 1755-4349 . PMC 12226332. PMID 40394186 .
- ^ "OpenAI o3-mini" . أوبن آي . 2025-01-31 . تم الاسترجاع بتاريخ 2025-02-09 .
- ↑ هوانغ، يوتينغ؛ زويس، كريستوس؛ وانغ، يو؛ تشانغ، يو؛ مافروماتيس، كريستوس؛ زينغ، جياشن؛ ين، شيهو؛ فولكيديس، أنطونيوس؛ شيبارد، دانيال (2025). "نحو نماذج أساسية للكشف عن الأحداث المعقدة عبر الإنترنت في أنظمة التحكم الفيزيائية السيبرانية وإنترنت الأشياء: دراسة حالة". وقائع ورشة العمل الدولية الثانية حول النماذج الأساسية لأنظمة التحكم الفيزيائية السيبرانية وإنترنت الأشياء . ACM. الصفحات 1-6 . arXiv : 2503.12282 . doi : 10.1145/3722565.3727198 . ISBN 979-8-4007-1608-9على
الرغم من أننا لم نقم بتقييم نماذج o1 و o3 ... فإن تكلفتها العالية ووقت الاستدلال يجعلانها غير عملية لـ CED عبر الإنترنت، والذي يتطلب طلبات API متكررة ومنخفضة زمن الوصول.
- ^ هو، زيهاو؛ وانغ، يو تشينغ. صن، روي؛ لو، حوران؛ قونغ، تشيان. وانغ، جينشواي؛ قونغ، يون لونغ؛ هوانغ، ييمينغ؛ هو ، بنغ (2025/02/13). “حساب وقت الاستدلال: أكثر إخلاصًا؟ مذكرة بحثية”. أرخايف : 2502.09673 [ cs.CL ].
لم نتمكن من تقييم O1 و R1 …
- ^ تشن ، جوليانج. تشو، تشياو؛ منغ، تشينشيانغ؛ ليانغ، ويلين؛ جي، زيجي. ليو، جيانغنينغ؛ تسنغ ، جي (2025/03/07). “RealBench: تقييم LLMs كمهندسين في Verilog”. أرخايف : 2503.04914 [ cs.AI ].
بالنسبة لمعاينة O1، فإننا نقوم بإجراء عينة مرة واحدة فقط بسبب التكلفة العالية.
- ↑ غوبتا، أربيت؛ شابيرا، مايكل؛ جيل، فيليبا؛ سيثارامان، سرينيفاسان (30 يناير 2025). "حول جدوى استخدام نماذج التعلم المحدود لتنفيذ هجمات شبكية متعددة المراحل". arXiv : 2501.16466 [ cs.CR ].
لم نتمكن من تقييم o1... واجهة برمجة التطبيقات العامة مزودة بآلية حماية تمنع o1 من تنفيذ الهجمات.
- ↑ هيث، أليكس (5 أغسطس 2025). "أوبن إيه آي تُصدر نموذج GPT مجانيًا يمكن تشغيله على حاسوبك المحمول" . ذا فيرج . تم الاطلاع عليه بتاريخ 7 مارس 2026 .
روابط خارجية
- فورتيس، أرماندو (27 يناير 2025). "atfortes/Awesome-LLM-Reasoning" . جيت هاب . تم الاسترجاع في 27 يناير 2025 .
- هوانغ، جي؛ تشانغ، كيفن تشين-تشوان (2023-05-26). "نحو الاستدلال في نماذج اللغة الكبيرة: دراسة استقصائية". arXiv : 2212.10403 [ cs.CL ].
- بيستا، ماسيج؛ بارث، جوليا؛ شرايبر، إريك؛ كوبيتشيك، أليس؛ كاتارينو، أفونسو؛ جيرستنبرجر، روبرت؛ نيتشيك، بيوتر؛ إيف، باتريك؛ لي، يولينغ (23 يناير 2025). "نماذج لغة الاستدلال: مخطط أولي". arXiv : 2501.11223 [ cs.AI ].
- الذكاء الاصطناعي
- معالجة اللغة الطبيعية
- التعلم الآلي
- نماذج لغوية كبيرة
- الاستدلال الآلي
