نموذج الرؤية واللغة

يُعد نموذج الرؤية واللغة ( VLM ) نوعًا من أنظمة الذكاء الاصطناعي القادرة على تفسير المعلومات وتوليدها من الصور والنصوص معًا، مما يوسع قدرات نماذج اللغة الكبيرة (LLMs) التي تقتصر على النصوص. وهو مثال على التعلم متعدد الوسائط .

تعتمد العديد من التطبيقات التجارية واسعة الانتشار حاليًا على هذه الإمكانية. وقد أضافت OpenAI إمكانيات رؤية الحاسوب إلى نموذجها GPT-4V، وهو نسخة معدلة من نموذج GPT-4 ، مما مكّن المستخدمين من دمج الصور أو المخططات التي تم تحميلها في مناقشاتهم مع ChatGPT . ومنذ ذلك الحين، أصبح هذا جزءًا لا يتجزأ من العرض القياسي لـ ChatGPT. كما أُضيفت إمكانيات مماثلة إلى Gemini من Google، وClaude 3 Opus من Anthropic ، [ 1 ] و Copilot with Vision من Microsoft . [ 2 ] وإلى جانب هذه النماذج، أصدر مجتمع البحث العلمي العديد من نماذج الرؤية اللغوية مفتوحة المصدر ، مثل LLaVA، [ 3 ] و InstructBLIP، [ 4 ] وMiniGPT-4 [ 5 ] ، والتي تُقدم بدائل أصغر حجمًا للتجريب والدراسة الأكاديمية.

تاريخ

تطورت نماذج لغة الرؤية من أنظمة وصف الصور . صُممت هذه الأنظمة لالتقاط الصور وحدها (بدون تعليمات مصاحبة)، وإنتاج أوصاف لها.

استخدمت معظم أنظمة وصف الصور بنية مُشفِّر-مُفكِّك، حيث يقوم المُشفِّر بتلخيص الصور في متجهات مميزة ، تُغذَّى بدورها إلى المُفكِّك لإنشاء الوصف المُصاحب. جمعت الطرق المبكرة (أوائل العقد الثاني من القرن الحادي والعشرين) بين الميزات البصرية المُصممة يدويًا لترميز الصور، وقوالب النصوص القائمة على النماذج اللغوية أو القواعد لإنشاء الأوصاف. [ 6 ] [ 7 ]

مع صعود التعلم العميق ، هيمنت الشبكات العصبية على مجال وصف الصور. في عام ٢٠١٥، ظهرت أساليب تستخدم أنواعًا مختلفة من الشبكات العصبية الالتفافية (CNN) لترميز الصور، والشبكات العصبية المتكررة (RNN) لإنشاء التعليقات. [ ٨ ] [ ٩ ] وبحلول عام ٢٠١٨، حلت شبكات المحولات محل الشبكات العصبية المتكررة في دور فك تشفير اللغة. [ ١٠ ] والجدير بالذكر أن تدريب معلمات الشبكة كان يعتمد على مجموعات بيانات من أزواج الصور والنصوص، مثل MS COCO (الأشياء الشائعة في السياق). [ ١١ ] كما اتسع نطاق التطبيقات ليشمل الإجابة على الأسئلة المرئية (VQA)، [ ١٢ ] وتحديد العبارات [ ١٣ ] وغيرها.

في عام 2021، شكّل إطلاق OpenAI لنموذج CLIP ( التدريب المسبق للغة والصور المقارنة ) خطوةً هامةً نحو تطوير نماذج التعلم المرئي (VLMs). فبدلاً من التركيز على مهمة محددة كالتوصيف التصويري، يُعدّ CLIP نموذجًا أساسيًا متعدد الأغراض يُمكن توسيعه ليشمل نطاقًا واسعًا من المهام اللاحقة . والجدير بالذكر أن مكونات CLIP دُرّبت على مجموعة بيانات ضخمة تضم 400 مليون زوج من الصور والنصوص، مما أنتج نماذج قوية. كما أن بنية CLIP متعددة الأغراض تُتيح هذه القدرة الفائقة للأنظمة ذات الميزانيات الحسابية الأقل بكثير.

ابتداءً من عام 2022، تم اقتراح العديد من بنى نماذج اللغة الافتراضية (VLM)، استنادًا إلى فلسفات تصميم متشابهة (موضحة أدناه). شملت هذه النماذج Flamingo الخاص بشركة Google DeepMind [ 14 ] ونسخة مفتوحة المصدر منه [ 15 ] ، وLLaVA [ 3 وInstructBLIP من Salesforce [ 4 وKosmos من Microsoft [ 16 ] ، و MiniGPT-4 من جامعة الملك عبد الله للعلوم والتقنية [ 5 وغيرها. دمجت جميع هذه النماذج مُشفِّر صور مُدرَّبًا بشكل منفصل يشبه CLIP، ونموذج لغة كبير جاهز للاستخدام (LLM) لترميز النصوص، باستخدام مكونات متخصصة. تم تدريب النظام المشترك الناتج على مجموعات بيانات مُنتقاة بعناية.

شكّل إطلاق GPT-4V في عام 2023 بدايةً لتطبيقات تجارية بالغة التأثير. وسرعان ما تبع ذلك أنظمة أخرى ذُكرت سابقًا (بما في ذلك Gemini من جوجل، وClaude 3 Opus من أنثروبيك ، [ 1 ] و Copilot with Vision من مايكروسوفت [ 2 ] ). تتميز هذه التطبيقات بقدرة فائقة على أداء المهام العامة، إذ تحتوي عادةً على عدد أكبر بكثير من المعاملات، وتُدرَّب على مجموعات بيانات ضخمة، وتتطلب قدرة حاسوبية هائلة. ولم يُكشف عن بنيتها.

بنيان

تتكون مدخلات نماذج التعلم المرئي من عناصر بصرية (صور وفيديوهات) ونصوص. أما المخرجات فهي عادةً نصوص مطابقة. وتخرج النماذج التوليدية، التي تولد أيضاً عناصر بصرية (مثل DALL-E )، عن نطاق هذه المقالة.

فيما يلي وصف لبعض النماذج التمثيلية التي عُرفت بنيتها. من المرجح أن تكون وحدات معالجة الرسومات الافتراضية التجارية مثل GPT-4V، التي لم يُكشف عن تصميماتها علنًا، مبنية على مفاهيم مماثلة.

LLaVA 1.0

يُعدّ LLaVA (المساعد اللغوي والبصري واسع النطاق) [ 3 ] 1.0 نموذجًا بسيطًا يجسّد بعض المفاهيم الرئيسية لأنظمة التعلم البصري مفتوحة المصدر. ويتمثل مدخل النموذج في صورة وتعليمات لغوية نصية مصاحبة لها.

بنية LLaVA 1.0.

العمود الفقري لنموذج اللغة

من الناحية المفاهيمية، تم بناء التصميم حول أساس جاهز LLM (وهو نسخة معدلة من Llama [ 17 ] تسمى Vicuna)، مع مكونات تم تركيبها لدعم مدخلات الصور.

تستعير LLaVA وحدتي التجزئة والتحويل (بما في ذلك أوزانهما ) من Vicuna، وتستخدمهما لمعالجة النص المصاحب. تجدر الإشارة إلى أنه في تطبيق Vicuna القديم (غير VLM)، تقوم وحدة التجزئة بتحويل النص إلى سلسلة من الرموز، والتي تُنقل بدورها إلى وحدة التحويل، التي تُنتج سلسلة من رموز الاستجابة. ثم تُحوّل هذه الرموز مرة أخرى إلى نص باستخدام وحدة التجزئة.

ترميز الرؤية

إلى جانب ذلك، يضيف برنامج LLaVA مكونين لدعم مدخلات الصور:

  • مُشفِّر الرؤية: تم بناؤه باستخدام نموذج CLIP جاهز مُدرَّب بشكل منفصل (وتحديدًا، المتغير ViT-L/14) من OpenAI. يُحوِّل مُشفِّر الرؤية الصورة إلى مصفوفة من متجهات تضمين الميزات (المزيد حول هذا لاحقًا)، والتي تُشفِّر معلومات مفيدة عن الصورة. يُمكن استخدام هذه المعلومات مباشرةً بواسطة نموذج التعلم الموجه باللغات (LLM). وذلك لأن نموذج التعلم الموجه باللغات مُصمَّم لاستقبال الرموز، والتي لها أبعاد مختلفة. علاوة على ذلك، ولأن Vicuna نموذج جاهز، لم يتم تدريبه على التعرُّف على هذه المعلومات والاستجابة لها.
  • وحدة الإسقاط (المعروفة أيضًا باسم الجسر ) : تربط هذه الوحدة مُشفِّر الرؤية بنموذج التعلم الموجه (LLM). وهي عبارة عن مصفوفة بسيطة من المعاملات القابلة للتدريب، تُحوِّل أبعاد مُخرَجات مُشفِّر الرؤية، ويمكن تدريبها أيضًا (انظر أدناه) لتكون مفيدة لنموذج التعلم الموجه. تُسمى مُخرَجاتها رموز الصورة .

يتم إلحاق رموز الصور برموز النص ومعالجتها بواسطة LLM تمامًا مثل رموز النص العادية، مما ينتج عنه الاستجابة النهائية.

استُخدم تعديل بسيط على مُشفِّر الرؤية CLIP ViT-L/14 للحصول على متجهات مُشفَّرة أكثر فعالية. ولأن هذه الوحدة عبارة عن مُحوِّل رؤية ، فإن التطبيق المباشر كان سيستخدم رمز الفئة عند مخرج طبقة المُحوِّل الأخيرة (انظر فئة مُحوِّل الرؤية ) كمتجه واحد. مع ذلك، يستخدم LLaVA 1.0 رموز الشبكة (غير رموز الفئة) عند مخرج الطبقة السابقة (قبل الأخيرة) لإنتاج عدة متجهات. تتوافق رموز الشبكة مع الرقع المكانية في مُدخلات الصورة هذه، وبالتالي تلتقط معلومات ذات دقة أعلى.

تمرين

تطلّب الأمر تدريبًا لمواءمة الوحدات النمطية بحيث يمكن دمجها في نموذج واحد . في مصطلحات نماذج التعلم المرئي، تُعرف هذه الخطوة بضبط التعليمات. حقق نموذج LLaVA 1.0 ذلك على مرحلتين. ركّزت المرحلة الأولى على المواءمة الأولية لطبقة الإسقاط. تم تدريب أوزان هذه الوحدة النمطية فقط، بينما بقيت أوزان الوحدات النمطية الأخرى ثابتة. كانت مجموعة البيانات عبارة عن مجموعة فرعية من مجموعة بيانات CC3M [ 18 ] لأزواج الصور والتعليقات. كانت هذه المجموعة صغيرة (595,000 زوجًا)، ومحدودة النطاق، إذ احتوت فقط على أزواج صور وتعليقات بسيطة. ركّزت المرحلة الثانية على تدريب أكثر تفصيلًا لكل من طبقة الإسقاط ونموذج التعلم المرئي. بقي مُشفّر الرؤية ثابتًا. تم إنتاج مجموعة بيانات تدريبية غنية (LLaVA-Instruct-158K [ 19 ] ) من أزواج الصور والنصوص لهذه المرحلة، وذلك من خلال تسخير نموذج LLM النصي فقط ( GPT-4 ) لتحويل التعليقات البسيطة لأزواج الصور والتعليقات (من مجموعة بيانات COCO [ 11 ] ) إلى مطالبات مفصلة على غرار المحادثة.

أدخلت الإصدارات اللاحقة من برنامج LLaVA العديد من التحسينات مقارنةً بالإصدار 1.0. ومن أبرز هذه التحسينات استبدال وحدة الإسقاط البسيطة في الإصدار 1.5 [ 20 ] بوحدة MLP أكثر تطورًا . كما أضاف برنامج LLaVA-NeXT [ 21 ] دعمًا لنسب أبعاد متعددة للصور، تتجاوز نسبة 224×224 التي كان يدعمها الإصدار 1.0.

فلامنجو

يسبق برنامج Flamingo [ 14 ] ( DeepMind ، 2022) برنامج LLaVA 1.0 بعام، وهو في الواقع يتميز بتصميم أكثر تعقيدًا من LLaVA. ومن بين مزاياه دعمه لعرض صور متعددة في محادثة واحدة، ودعمه للفيديو.

هندسة فلامنجو VLM

من الناحية المعمارية، يتضمن التصميم تكاملاً أكثر ترابطاً بين وحدات اللغة والرؤية، ووحدة إعادة تشكيل الإدراك (الموصوفة أدناه).

ماجستير القانون والرؤية الأساسية

على غرار LLaVA، يبدأ Flamingo بنموذج خطي متعلم (LLM) ومُشفِّر رؤية مصممين بشكل مستقل، لتحليل النصوص وتضمين الصور على التوالي. يتم تدريب كليهما مسبقًا لأغراضهما المحددة، بغض النظر عن فائدتهما النهائية كمكونات في Flamingo. علاوة على ذلك، وبصفتهما مكونين، تظل أوزانهما ثابتة أثناء التدريب المشترك (انظر أدناه).

تستخدم فلامينغو نموذج شينشيلا الجاهز من ديب مايند كبنية أساسية لنموذج التعلم المحدود. أما بالنسبة لمشفّر الرؤية، فقد اختاروا تصميمًا لا يعتمد على المحوّلات ( شبكة NFNet-F6 القائمة على ResNet [ 22 ] ). وتم تدريب هذا النموذج باستخدام دالة خسارة تباينية على غرار CLIP على أزواج الصور والتعليقات من مجموعة بيانات ALIGN [ 23 ] ومجموعة بيانات مُختارة خصيصًا تُسمى LTIP (أزواج النصوص والصور الطويلة).

يأخذ مشفر الرؤية صورًا فردية كمدخلات (المزيد عن مقاطع الفيديو أدناه) وينتج شبكة ثنائية الأبعاد من متجهات الميزات.

المُدرِك-المُعيدَ التشكيل

يلعب مكون إعادة التشكيل [ 24 ] دورًا رئيسيًا في دعم الفيديو وعدد متغير من الصور عند مدخل Flamingo.

تُغذّى مُشفّرة الرؤية أولاً بصور متتالية متعددة (صورة واحدة أو أكثر)، واحدة تلو الأخرى، مما يُنتج شبكة ثلاثية الأبعاد من متجهات الميزات. تُحوّل مقاطع الفيديو إلى سلسلة من الصور عن طريق أخذ عينات بمعدل إطار واحد في الثانية . تُسطّح الشبكة الناتجة إلى مصفوفة طويلة متغيرة الحجم من متجهات الميزات.

يقوم مُستقبِل إعادة التشكيل بتحويل هذا إلى مصفوفة قصيرة ذات طول ثابت من الرموز. ويستخدم تصميمًا يعتمد على الانتباه المتبادل بين عدد ثابت من متجهات الاستعلام الاصطناعية والمحددة مسبقًا (والتي يتم تحديد قيمها من خلال التدريب)، وأزواج (مفتاح، قيمة) المستمدة من مصفوفة متجهات الميزات.

تجدر الإشارة إلى أنه في هذا السياق، يُفترض أن الصور المتتالية متصلة ببعضها دون وجود نص بينها. وسيتم مناقشة الحالة العامة لاحقاً.

الانتباه المتقاطع المُتحكم به / الكتل الكثيفة

هذه عبارة عن عدة وحدات (انظر الشكل أعلاه)، تؤدي دورًا موازيًا لوحدة الإسقاط في LLaVA، حيث تعمل كواجهة بين وحدتي معالجة الرؤية ومعالجة النصوص. ومع ذلك، فإن تصميمها أكثر ارتباطًا بنموذج اللغة.

الانتباه المتبادل المُبَوَّب والكتلة الكثيفة

على وجه التحديد، يُدرج فلامينغو بين كتل المحولات المختارة في نموذج اللغة هذه الكتل الكثيفة ذات الانتباه المتقاطع. تُشبه هذه الكتل كتل فك التشفير في بنى المحولات المشفرة-المفككة. أي أن استعلاماتها تُستمد من كتلة المحولات السابقة ذات الانتباه الذاتي في نموذج اللغة الأساسي. وتُستمد مفاتيحها وقيمها من متجهات ميزات الرؤية. تُرسل مخرجاتها إلى كتلة نموذج اللغة الأساسي التالية. كما تتضمن هذه الكتل وصلات تخطي.

يُعدّ تضمين بوابة tanh أحد التعديلات المهمة على الوحدات المضافة، مقارنةً بوحدات محوّلات التشفير-فك التشفير . تُضِف هذه الوحدات الصغيرة مدخلاتها، ويتم التحكم بها بواسطة وزن قياسي قابل للتدريب ضمن النطاق (-1، 1)، خاص بكل وحدة. تُعدّل هذه الأوزان تأثير وحدة الانتباه المتقاطع الكثيفة على عملية توليد النص. تُهيأ هذه الأوزان إلى الصفر في بداية التدريب، عندما تكون أوزان الوحدات الأخرى في الوحدة غير مُدرّبة وعشوائية. ومع تقدّم التدريب، تزداد قيمها تدريجيًا. تلعب هذه البوابات دورًا حاسمًا في ضمان استقرار التدريب.

تقسيم البيانات إلى أجزاء

لدعم دمج الصور وتسلسلات النصوص، قدمت فلامينغو تعديلاً بسيطاً يُحسّن الأداء بشكل ملحوظ في التعلم السياقي (باستخدام عدد قليل من الأمثلة). يقوم هذا التعديل بتقسيم تدفق المدخلات إلى أجزاء، يحتوي كل منها على مدخل مرئي واحد (صورة، أو سلسلة متصلة من الصور، أو فيديو). عند تطبيق آلية الانتباه المتبادل بين النص والميزات المرئية، يُسمح لرموز النص بالتركيز فقط على المدخل المرئي ضمن جزئها، بينما يتم حجب المدخلات المرئية الأخرى.

لاحظ أن رموز النص لا تزال تتأثر بشكل غير مباشر بجميع مدخلات الفيديو، من خلال الانتباه الذاتي داخل النص.

تمرين

أثناء التدريب، يتم تجميد بنية اللغة والنص الأساسية (كما هو مذكور أعلاه). استخدم التدريب ثلاث مجموعات بيانات: مجموعة بيانات LTIP المذكورة أعلاه، ومجموعة بيانات منسقة من أزواج الفيديو والنص (تسمى VTP)، ومجموعة بيانات ضخمة من تسلسلات النص والصور المتداخلة، المستمدة من مستندات HTML (MultiModal MassiveWeb - M3W).

Qwen2-VL

يتميز Qwen2-VL [ 25 ] من Alibaba (2024) ببنية بسيطة من الناحية المفاهيمية توفر أيضًا وظائف ومرونة تتجاوز Flamingo.

مثل LLaVA 1.0 و Flamingo، يبدأ بنموذج لغة أساسي ( Qwen2 ) ومشفر رؤية (DFN [ 26 ] محول الرؤية ).

على غرار LLaVA، وبخلاف Flamingo، يستخدم Qwen2-VL معالجة موحدة لبيانات الرؤية والنص، حيث يُدخل جميع الرموز إلى نموذج اللغة بدلاً من حقنها في كتل داخلية. ثم يُعامل نموذج اللغة الرموز بالتساوي، باستخدام آلية الانتباه الذاتي بدلاً من آلية الانتباه المتبادل . ولدعم تداخل بيانات النص والرؤية، وفصل تدفقات الرموز عن الأخيرة، تُستخدم رموز خاصة (vision_start و vision_end).

دقة ديناميكية بسيطة

يتمثل أحد الاختلافات الرئيسية بين LLaVA 1.0 و Flamingo في أن مُشفِّر الرؤية يدعم دقة صور عشوائية ، دون الحاجة إلى إعادة تشكيل الصورة مسبقًا إلى شكل ثابت. ويختلف عدد الرموز المُشفَّرة تبعًا لشكل الصورة.

تُؤخذ عينات من مقاطع الفيديو بمعدل إطارين في الثانية لإنتاج سلسلة من الصور، والتي يتم ترميز كل منها على حدة. وهذا أيضاً يُسهم في اختلاف طول مصفوفة الرموز.

تعمل الشبكة العصبية متعددة الطبقات (MLP) على مواءمة بُعد تضمين نموذج الفيديو (ViT) مع بُعد نموذج اللغة. كما أنها تُسهم في تقليل أبعاد ترميز الصورة من خلال دمج تضمينات المتجهات في رقع متجاورة بحجم 2×2 (انظر ViT ). ويستفيد ترميز الفيديو أيضًا من عملية التفاف ثلاثية الأبعاد تعمل على البُعد الزمني.

التشفير الموضعي الدوراني متعدد الوسائط (M-RoPE)

لا يُعدّ الترميز الموضعي القياسي مناسبًا لبيانات الرؤية، خاصةً عند ترميز البيانات في تضمينات رمزية متغيرة الطول. فعلى وجه التحديد، يفقد تمثيله أحادي البعد التخطيط المكاني للصور والاستمرارية الزمنية للفيديو.

يستخدم Qwen2-VL صيغة متعددة الأبعاد لبيانات الرؤية، تُسمى التشفير الموضعي الدوراني متعدد الوسائط (M-RoPE). في هذه الصيغة، يُخصص لكل رمز ثلاثي من المؤشرات ( i ، x ، y )، مُعرّفة كما يلي: بالنسبة للصور، يُمثل x و y الإحداثيات المكانية للرمز في الصورة. أما i فهو ثابت لجميع رموز الصورة، ويساوي رقم تسلسل الصورة ضمن دفق الإدخال الموحد للنموذج. ثم يُنشأ التشفير الموضعي M-RoPE عن طريق دمج تشفيرات RoPE أحادية البعد منفصلة للمؤشرات الثلاثة. [ 27 ]

يستخدم ترميز الموقع في الفيديو ثلاثيات مماثلة، باستثناء أن i ليس ثابتًا ويتطور مع كل صورة في دفق الفيديو. وبالتالي، فهو يرمز إلى الموقع الزمني.

تمرين

يتم تدريب Qwen2-VL عبر عملية ثلاثية المراحل تدمج تدريجيًا الفهم البصري واللغوي. في المرحلة الأولى، يتم تدريب مُشفِّر الرؤية مع تثبيت باقي الوحدات. في المرحلة الثانية، يتم تفعيل البنية بالكامل، وفي المرحلة الثالثة، يتم تثبيت مُشفِّر الرؤية مع ضبط نموذج اللغة بدقة. تتضمن مجموعة بيانات التدريب نطاقًا واسعًا من الوسائط، ليصل إجماليها إلى 1.4 تريليون رمز (بما في ذلك رموز الرؤية المُشفَّرة). يتم حساب خسارة التدريب على رموز النص عند مخرج نموذج اللغة.

التأريض البصري

تتمثل إحدى الوظائف الرئيسية التي يتيحها الترميز الموضعي متعدد الوسائط في التأسيس البصري؛ أي القدرة على الاستدلال حول كائنات محددة داخل الصورة. ويُعد الحفاظ على الموقع المكاني لرموز الصورة في M-RoPE أمرًا أساسيًا لتحقيق ذلك.

لدعم عملية التأريض، تتضمن معظم بيانات التدريب معلومات عن الكائنات في الصور، بما في ذلك التعليقات التوضيحية وإحداثيات المربع المحيط . يتضمن إعداد مجموعة بيانات التدريب تنسيق هذه البيانات في بنية قياسية، والتي تشمل رموزًا خاصة مثل object_ref_startو object_ref_endو box_startو و box_end.

انظر أيضاً

مراجع

  1. 1 2 "الرؤية" . وثائق كلود . تم الاسترجاع في 15-10-2025 .
  2. 1 2 "استخدام Copilot Vision مع Microsoft Copilot - دعم Microsoft" . support.microsoft.com . تم الاطلاع عليه بتاريخ 15-10-2025 .
  3. 1 2 3 ليو، هاوتيان؛ لي، تشونيوان؛ وو، تشينغيانغ؛ لي ، يونغ جاي (2023/12/11). “ضبط التعليمات المرئية”. أرخايف : 2304.08485 [ cs.CV ].
  4. 1 2 داي، وينليانغ؛ لي، جونان؛ لي، دونجكسو؛ تيونج، أنتوني منغ هوات؛ تشاو، جونكي؛ وانغ، ويشينغ. لي، بويانغ؛ فونج، باسكال؛ هوي ، ستيفن (2023/06/15). “InstructBLIP: نحو نماذج الرؤية واللغة للأغراض العامة مع ضبط التعليمات”. أرخايف : 2305.06500 [ cs.CV ].
  5. 1 2 تشو، دياو؛ تشن، يونيو؛ شين، شياو تشيان. لي شيانغ. الحسيني، محمد (2023-10-02). “MiniGPT-4: تعزيز فهم الرؤية واللغة باستخدام نماذج اللغة الكبيرة المتقدمة”. أرخايف : 2304.10592 [ cs.CV ].
  6. كولكارني، جيريش؛ بريمراج، فيسروث؛ دار، ساغنيك؛ لي، سيمينغ؛ تشوي، ييجين؛ بيرغ، ألكسندر سي؛ بيرغ، تمارا إل (25 يونيو 2011). "حديث الأطفال: فهم وتوليد أوصاف صور بسيطة". مؤتمر رؤية الحاسوب وأنماط التعرف 2011. الصفحات 1601-1608 . doi : 10.1109/CVPR.2011.5995466 . ISBN  978-1-4577-0394-2.
  7. باراجيوس، نيكوس؛ دانييليديس، كوستاس؛ ماراغوس، بيتروس (2010). رؤية الحاسوب - المؤتمر الأوروبي الحادي عشر لرؤية الحاسوب ECCV 2010، هيراكليون، كريت، اليونان، 5-11 سبتمبر 2010، وقائع المؤتمر، الجزء الرابع . سلسلة محاضرات في علوم الحاسوب. برلين، هايدلبرغ: سبرينغر برلين هايدلبرغ، كتب سبرينغر الإلكترونية. ISBN 978-3-642-15561-1.
  8. فينيالز، أوريول؛ توشيف، ألكسندر؛ بينجيو، سامي؛ إرهان، دوميترو (2015). "العرض والشرح: مولد تعليقات الصور العصبية" . مؤتمر رؤية الحاسوب وأنماط التعرف 2015 : 3156-3164 .
  9. شو، كيلفن؛ با، جيمي لي؛ كيروس، رايان؛ تشو، كيونغ هيون؛ كورفيل، آرون؛ سالاخوتدينوف، روسلان؛ زيميل، ريتشارد س.؛ بينجيو، يوشوا (2015-07-06). "العرض، والاهتمام، والشرح: توليد تعليقات الصور العصبية باستخدام الانتباه البصري" . وقائع المؤتمر الدولي الثاني والثلاثين للتعلم الآلي . ICML'15. ليل، فرنسا: JMLR.org: 2048-2057 .
  10. لو، جياسن؛ باترا، دروف؛ باريك، ديفي؛ لي، ستيفان (2019-08-06). "فيلبرت: تدريب مسبق على تمثيلات بصرية لغوية مستقلة عن المهمة لمهام الرؤية واللغة". arXiv : 1908.02265 [ cs.CV ].
  11. 1 2 "COCO - الكائنات الشائعة في السياق" . cocodataset.org . تم الاسترجاع في 2025-10-20 .
  12. "نماذج اللغة المرئية (VLM) مقابل الإجابة على الأسئلة المرئية (VQA) في عام 2025؟" . www.gravio.com . تاريخ الاسترجاع: 20 أكتوبر 2025 .
  13. "ما هو تأريض العبارة؟" . مدونة روبوفلو . 13 نوفمبر 2024. تم الاطلاع عليه بتاريخ 21 أكتوبر 2025 .
  14. 1 2 ألايراك، جان بابتيست؛ دوناهو، جيف؛ لوك، بولين؛ ميش، أنطوان؛ بار، إيان؛ حسون، يانا؛ لينس، كاريل؛ مينش، آرثر؛ ميليكان، كاتي (2022-11-15). "فلامينغو: نموذج لغوي مرئي للتعلم باستخدام عدد قليل من الأمثلة". arXiv : 2204.14198 [ cs.CV ].
  15. عوض الله، أنس؛ غاو، إيرينا؛ غاردنر، جوش؛ هيسل، جاك؛ حنفي، يوسف؛ تشو، وانرونغ؛ ماراثي، كالياني؛ بيتون، يوناتان؛ غادري، سمير (2023-08-07). "OpenFlamingo: إطار عمل مفتوح المصدر لتدريب نماذج الرؤية واللغة الانحدارية الذاتية الكبيرة". arXiv : 2308.01390 [ cs.CV ].
  16. هوانغ، شاوهان؛ دونغ، لي؛ وانغ، وينهوي؛ هاو، يارو؛ سينغال، ساكشام؛ ما، شومينغ؛ لو، تينغتشاو؛ تسوي، لي؛ محمد، أويس خان (2023-03-01). "اللغة ليست كل ما تحتاجه: مواءمة الإدراك مع نماذج اللغة". arXiv : 2302.14045 [ cs.CL ].
  17. "فيكونيا: روبوت محادثة مفتوح المصدر يُبهر GPT-4 بجودة ChatGPT بنسبة 90%* | LMSYS Org" . lmsys.org . تاريخ الاسترجاع: 25-10-2025 .
  18. شارما، بيوش؛ دينغ، نان؛ غودمان، سيباستيان؛ سوريكوت، رادو (2018). غوريفيتش، إيرينا؛ مياو، يوسوكي (محررون). "التعليقات المفاهيمية: مجموعة بيانات نص بديل للصور مُنقّحة ومُصنّفة تصنيفًا عامًا للتعليق التلقائي على الصور" . وقائع الاجتماع السنوي السادس والخمسين لجمعية اللغويات الحاسوبية (المجلد 1: الأوراق البحثية الطويلة) . ملبورن، أستراليا: جمعية اللغويات الحاسوبية: 2556-2565 . doi : 10.18653/v1/P18-1238 .
  19. "liuhaotian/LLaVA-Instruct-150K · Datasets at Hugging Face" . huggingface.co . 2025-06-06 . تم الاطلاع عليه بتاريخ 2025-10-25 .
  20. ^ ليو، هاوتيان؛ لي، تشونيوان؛ لي، يوهينغ؛ لي ، يونغ جاي (15/05/2024). “تحسين خطوط الأساس مع ضبط التعليمات المرئية”. أرخايف : 2310.03744 [ cs.CV ].
  21. ^ لي فنغ. تشانغ، رينروي. تشانغ، هاو؛ تشانغ، يوانهان؛ لي، بو؛ لي، وي؛ ما، زيجون؛ لي ، تشونيوان (2024/07/28). “LLaVA-NeXT-Interleave: معالجة الصور المتعددة والفيديو وثلاثية الأبعاد في النماذج الكبيرة متعددة الوسائط”. أرخايف : 2407.07895 [ cs.CV ].
  22. بروك، أندرو؛ دي، سوهام؛ سميث، صموئيل ل.؛ سيمونيان، كارين (2021-02-11). "التعرف على الصور واسعة النطاق عالية الأداء بدون تطبيع". arXiv : 2102.06171 [ cs.CV ].
  23. جيا، تشاو؛ يانغ، ينفي؛ شيا، يي؛ تشين، يي-تينغ؛ باريك، زارانا؛ فام، هيو؛ لي، كوك ف.؛ سونغ، يونهسوان؛ لي، تشن (2021-06-11). "توسيع نطاق تعلم تمثيل اللغة المرئية والبصرية باستخدام الإشراف على النصوص المشوشة". arXiv : 2102.05918 [ cs.CV ].
  24. جايجل، أندرو؛ جيمينو، فيليكس؛ بروك، أندرو؛ زيسرمان، أندرو؛ فينيالز، أوريول؛ كاريرا، جواو (2021-06-23). ​​"المُدرِك: الإدراك العام مع الانتباه التكراري". arXiv : 2103.03206 [ cs.CV ].
  25. ^ وانغ ، بنغ. باي، شواي؛ تان، سنان؛ وانغ، شيجي. فان، تشيهاو؛ باي، جينزي؛ تشن كيكين. ليو، شيويجينغ؛ وانغ ، جيالين (2024/10/03). “Qwen2-VL: تعزيز تصور نموذج الرؤية واللغة للعالم بأي قرار”. أرخايف : 2409.12191 [ cs.CV ].
  26. فانغ، أليكس؛ خوسيه، ألبين مادابالي؛ جاين، أميت؛ شميدت، لودفيغ؛ توشيف، ألكسندر؛ شانكار، فايشال (2023-11-06). "شبكات تصفية البيانات". arXiv : 2309.17425 [ cs.AI ].
  27. تانغباسكي (2025-09-08). "نسخة Qwen2-VL من RoPE - M-RoPE" . الذكاء الاصطناعي اليومي . تم الاسترجاع في 2025-10-30 .