التدريب المسبق للغة والصور المتناقضة
التدريب المسبق للغة والصور باستخدام التباين ( CLIP ) هو أسلوب لتدريب نموذجين من الشبكات العصبية ، أحدهما لفهم الصور والآخر لفهم النصوص، باستخدام هدف تبايني . [ 1 ] وقد أتاح هذا الأسلوب تطبيقات واسعة النطاق في مجالات متعددة، بما في ذلك الاسترجاع متعدد الوسائط، [ 2 ] وتوليد الصور من النصوص، [ 3 ] والتصنيف الجمالي. [ 4 ]
الخوارزمية

تُدرّب طريقة CLIP نموذجين بطريقة مقارنة. [ 1 ] يستقبل أحد النموذجين نصًا كمدخل ويُخرج متجهًا واحدًا يُمثل محتواه الدلالي. ويستقبل النموذج الآخر صورة ويُخرج متجهًا واحدًا يُمثل محتواها المرئي. يتم تدريب النموذجين بحيث تكون المتجهات المُقابلة لأزواج النص والصورة المتشابهة دلاليًا متقاربة في فضاء المتجهات المشترك، بينما تكون المتجهات المُقابلة للأزواج غير المتشابهة متباعدة. [ 1 ]
لتدريب نموذجين من نماذج CLIP، يبدأ المرء بإعداد مجموعة بيانات كبيرة من أزواج الصور والتعليقات. أثناء التدريب، يتم عرض دفعات منأزواج الصورة والتعليق. لنفترض أن مخرجات نموذجي النص والصورة هي على التوالييُعتبر متجهان "متشابهين" إذا كان حاصل ضربهما النقطي كبيرًا.
لكل صورة، يتم حساب درجات التشابه معيتم تحويل النصوص بواسطة دالة softmax إلى توزيع احتمالي يحدد النص المطابق. ثم يتم حساب الإنتروبيا المتقاطعة مقابل الهدف ذي الترميز الأحادي الذي يُسند الاحتمال 1 للنص الصحيح؛ ويتم إجراء الحساب نفسه أيضًا في اتجاه تحويل النص إلى صورة.
الخسارة المتكبدة في هذه الدفعة هي خسارة N-pair متعددة الفئات، [ 5 ] وهي خسارة إنتروبيا متقاطعة متناظرة على درجات التشابه:باختصار، تشجع دالة الخسارة هذه على حساب حاصل الضرب النقطي بين متجهات الصورة والنص المتطابقة () أن تكون عالية، مع تثبيط حاصل الضرب النقطي العالي بين الأزواج غير المتطابقة. المعاملهي درجة الحرارة ، والتي يتم تحديدها كمعامل في نموذج CLIP الأصلي على النحو التالي:أينهو مُعامل مُتعلم.
توجد دوال خسارة أخرى ممكنة. على سبيل المثال، يقترح نموذج Sigmoid CLIP (SigLIP) [ 6 ] دالة الخسارة التالية:أينيمثل دالة الخسارة اللوغاريتمية السالبة ، ورمز دالة ديراك دلتايساوي 1 إذاوإلا 0.
نماذج CLIP
على الرغم من أن النموذج الأصلي تم تطويره بواسطة OpenAI ، إلا أن النماذج اللاحقة تم تدريبها بواسطة منظمات أخرى أيضًا.
نموذج الصورة

تعتمد نماذج ترميز الصور المستخدمة في CLIP عادةً على محولات الرؤية (ViT). ويعكس اصطلاح تسمية هذه النماذج غالبًا بنية محول الرؤية المستخدمة. على سبيل المثال، يشير "ViT-L/14" إلى "محول رؤية كبير" (مقارنةً بالنماذج الأخرى في السلسلة نفسها) بحجم رقعة يبلغ 14 بكسل، أي أن الصورة تُقسّم إلى رقع بحجم 14×14 بكسل قبل معالجتها بواسطة المحول. ويتراوح مؤشر الحجم من B إلى L، ثم H، ثم G (أساسي، كبير، ضخم، عملاق)، بهذا الترتيب.
بخلاف ViT، فإن نموذج الصورة عادة ما يكون شبكة عصبية التفافية ، مثل ResNet (في السلسلة الأصلية من OpenAI)، أو ConvNeXt [ 7 ] (في سلسلة نماذج OpenCLIP من LAION [ 8 ] ).
بما أن متجهات الإخراج لنموذج الصورة ونموذج النص يجب أن تكون لها نفس الطول تمامًا، فإن كلا النموذجين لهما متجهات إخراج ذات طول ثابت، وهو ما يُسمى في التقرير الأصلي "بعد التضمين". [ ملاحظة 1 ]
على سبيل المثال، في نموذج OpenAI الأصلي، تتراوح أبعاد تضمين نماذج ResNet من 512 إلى 1024، [ 9 ] : الجدول 19، وبالنسبة لنماذج ViTs، من 512 إلى 768. [ 9 ] : الجدول 20
| اسم الطراز | دقة | المعايير (الإجمالي، بالملايين) | المعايير (الرؤية) | المعلمات (نص) | بُعد التضمين | الحجم (ميغابايت) | تاريخ الافراج عنه |
|---|---|---|---|---|---|---|---|
| RN50 | 224 | 102 | 38.3 | 63.1 | 1024 | 244 | 2021-01 |
| RN101 | 224 | 120 | 56.3 | 63.1 | 512 | 278 | 2021-03 |
| RN50x4 | 288 | 178 | 87.1 | 90.7 | 640 | 402 | 2021-03 |
| RN50x16 | 384 | 291 | 167.3 | 123.0 | 768 | 630 | 2021-07 |
| RN50x64 | 448 | 623 | 420.4 | 201.8 | 1024 | 1260 | 2022-01 |
| ViT-B/32 | 224 | 151 | 87.8 | 63.1 | 512 | 338 | 2021-01 |
| فيتامين ب/16 | 224 | 150 | 86.2 | 63.1 | 512 | 335 | 2021-07 |
| ViT-L/14 | 224 | 428 | 304.0 | 123.0 | 768 | 890 | 2022-01 |
| ViT-L/14@336px | 336 | 428 | 304.3 | 123.0 | 768 | 891 | 2022-04 |
كان تطبيقها لـ ViT هو نفسه التطبيق الأصلي، [ 11 ] مع تعديل واحد: بعد إضافة تضمينات الموضع إلى تضمينات الرقعة الأولية، يوجد LayerNorm .
كان تطبيقها لشبكة ResNet هو نفسه التطبيق الأصلي، [ 12 ] مع 3 تعديلات:
- في بداية الشبكة العصبية التلافيفية (الجذع)، استخدموا ثلاث عمليات التفاف متراصة بحجم 3x3 بدلاً من عملية التفاف واحدة بحجم 7x7، كما هو مقترح من قبل [ 13 ] .
- يُطبَّق تجميع متوسط بمتوسط خطوة 2 في بداية كل طبقة التفافية لتقليل حجم الصورة (يُطلق عليه اسم تجميع التمويه المستطيل-2 وفقًا لمصطلحات [ 14 ] ). ويؤدي هذا إلى تمويه الصور قبل تقليل حجمها، وذلك لتنعيم الحواف. [ 15 ]
- تلي الطبقة الالتفافية النهائية عملية تجميع الانتباه متعددة الرؤوس .
ALIGN نموذج ذو قدرات مماثلة، تم تدريبه بواسطة باحثين من جوجل [ 16 ] باستخدام EfficientNet ، [ 17 ] وهو نوع من الشبكات العصبية الالتفافية .
نموذج نصي

نماذج ترميز النصوص المستخدمة في CLIP هي عادةً نماذج محولات .
في تقرير OpenAI الأصلي، أفادوا باستخدام نموذج Transformer (بـ 63 مليون مُعامل، و12 طبقة، وعرض 512، و8 رؤوس انتباه) مع ترميز أزواج البايتات بأحرف صغيرة (BPE) وحجم مفردات يبلغ 49152. وتم تحديد طول السياق بـ 76 لتحقيق الكفاءة. ومثل GPT ، كان النموذج مُفكِّكًا فقط، مع استخدام الانتباه الذاتي المُقنَّح سببيًا فقط. [ 1 ] : 5 وتتشابه بنيته مع بنية GPT-2 . [ 18 ]
كما هو الحال في BERT ، يُحاط تسلسل النص برمزين خاصين [SOS]( [EOS]"بداية التسلسل" و"نهاية التسلسل"). تُؤخذ تنشيطات الطبقة العليا من المحول [EOS]، ويُطبق عليها LayerNorm ، ثم خريطة خطية نهائية. هذا هو ترميز النص لتسلسل الإدخال. يبلغ بُعد الإخراج للخريطة الخطية النهائية بُعد تضمين مُشفِّر الصورة المُقترن بها. جميع هذه النماذج لها طول سياق 77 وحجم مفردات 49408.
استخدم ALIGN [ 16 ] BERT بأحجام مختلفة.
مجموعة البيانات
نص الصورة على الويب
تم تدريب نماذج CLIP التي أصدرتها OpenAI على مجموعة بيانات تُسمى "WebImageText" (WIT) تحتوي على 400 مليون زوج من الصور والتعليقات المصاحبة لها، والتي جُمعت من الإنترنت. ويُشابه العدد الإجمالي للكلمات في هذه المجموعة حجم مجموعة بيانات WebText المستخدمة لتدريب GPT-2 ، والتي تحتوي على حوالي 40 جيجابايت من البيانات النصية. [ 1 ]
تحتوي مجموعة البيانات على 500,000 استعلام نصي، مع ما يصل إلى 20,000 زوج (صورة، نص) لكل استعلام. تم توليد الاستعلامات النصية بالبدء بجميع الكلمات التي تظهر 100 مرة على الأقل في ويكيبيديا الإنجليزية ، ثم تم توسيعها باستخدام ثنائيات الكلمات ذات المعلومات المتبادلة العالية ، وأسماء جميع مقالات ويكيبيديا التي تتجاوز حجم بحث معين، ومجموعات المرادفات من WordNet .
مجموعة البيانات خاصة ولم يتم نشرها للعامة، ولا توجد معلومات إضافية عنها. [ ملاحظة 3 ]
معالجة البيانات المسبقة
بالنسبة لنماذج صور CLIP، تتم معالجة الصور المدخلة مسبقًا عن طريق قسمة كل من قيم R و G و B للصورة على القيمة القصوى الممكنة، بحيث تقع هذه القيم بين 0 و 1، ثم طرحها من [0.48145466, 0.4578275, 0.40821073]، والقسمة على [0.26862954, 0.26130258, 0.27577711].
كان الأساس المنطقي هو أن هذه القيم تمثل المتوسط والانحراف المعياري للصور في مجموعة بيانات WebImageText، لذا فإن خطوة المعالجة المسبقة هذه تُبيض موتر الصورة تقريبًا. تختلف هذه الأرقام قليلاً عن المعالجة المسبقة القياسية لـ ImageNet ، والتي تستخدم [0.485, 0.456, 0.406]قيمًا أخرى [0.229, 0.224, 0.225]. [ 20 ]
إذا لم تكن دقة الصورة المدخلة هي نفس دقة الدقة الأصلية (224×224 لجميع الصور باستثناء ViT-L/14@336px، التي تبلغ دقتها 336×336)، فسيتم أولاً تغيير حجم الصورة المدخلة عن طريق الاستيفاء ثنائي التكعيب ، بحيث يكون ضلعها الأقصر هو نفسه الدقة الأصلية، ثم يتم اقتطاع المربع المركزي من الصورة .
آحرون
استخدمت مجموعة بيانات ALIGN [ 16 ] أكثر من مليار زوج من الصور والنصوص، تم الحصول عليها من خلال استخراج الصور ونصوصها البديلة من عمليات الزحف عبر الإنترنت. وُصفت هذه الطريقة بأنها مشابهة لكيفية إنشاء مجموعة بيانات Conceptual Captions [ 21 ] ، ولكن بدلاً من استخدام الترشيح المعقد، تم تطبيق ترشيح قائم على التردد فقط.
نُشرت مجموعات بيانات لنماذج لاحقة دُرِّبت بواسطة منظمات أخرى. على سبيل المثال، درّبت LAION برنامج OpenCLIP باستخدام مجموعات البيانات المنشورة LAION-400M وLAION-2B وDataComp-1B. [ 22 ] [ 8 ]
تمرين
في تقرير OpenAI CLIP الأصلي، أفادوا بتدريب 5 نماذج ResNet و3 نماذج ViT (ViT-B/32، ViT-B/16، ViT-L/14). تم تدريب كل نموذج لمدة 32 دورة تدريبية. استغرق تدريب أكبر نموذج ResNet 18 يومًا على 592 وحدة معالجة رسومية V100 ، بينما استغرق تدريب أكبر نموذج ViT 12 يومًا على 256 وحدة معالجة رسومية V100.
تم تدريب جميع نماذج ViT على دقة صور 224×224. ثم تم رفع دقة ViT-L/14 إلى 336×336 باستخدام FixRes، [ 23 ] مما أدى إلى نموذج. [ ملاحظة 4 ] وجدوا أن هذا النموذج هو الأفضل أداءً. [ 1 ] : الملحق F. المعلمات الفائقة للنموذج
في سلسلة OpenCLIP، تم تدريب نموذج ViT-L/14 على 384 وحدة معالجة رسومية A100 على مجموعة بيانات LAION-2B، لمدة 160 دورة تدريبية بإجمالي 32 مليار عينة تمت رؤيتها. [ 24 ]
التطبيقات
الاسترجاع متعدد الوسائط
تُمكّن خاصية الاسترجاع متعدد الوسائط في CLIP من مواءمة البيانات المرئية والنصية في فضاء كامن مشترك ، مما يسمح للمستخدمين باسترجاع الصور بناءً على الأوصاف النصية والعكس، دون الحاجة إلى تعليقات توضيحية صريحة على الصور. [ 25 ] في استرجاع الصور من النص ، يُدخل المستخدمون نصًا وصفيًا، ويسترجع CLIP الصور ذات التضمينات المطابقة. أما في استرجاع النصوص من الصور ، فتُستخدم الصور للعثور على محتوى نصي ذي صلة.
لقد وجدت قدرة CLIP على ربط البيانات المرئية والنصية تطبيقات في البحث عن الوسائط المتعددة ، واكتشاف المحتوى، وأنظمة التوصية. [ 26 ] [ 27 ]
تصنيف الصور
يستطيع برنامج CLIP تنفيذ مهام تصنيف الصور بدون استخدام بيانات تدريبية. ويتحقق ذلك من خلال تزويد مُشفِّر النصوص بأسماء الفئات، ثم اختيار الفئة التي يكون تمثيلها النصي أقرب ما يكون إلى تمثيل الصورة. على سبيل المثال، لتصنيف صورة ما، تتم مقارنة تمثيل الصورة النصي مع تمثيل النص "صورة من {الفئة}"، ويتم إخراج {الفئة} التي تُحقق أعلى قيمة للضرب النقطي.
برنامج CLIP للتعلم متعدد الوسائط
استُخدمت تقنية CLIP كعنصر في التعلم متعدد الوسائط . على سبيل المثال، خلال تدريب نموذج Flamingo التابع لشركة Google DeepMind (2022) [ 28 ]، قام الباحثون بتدريب زوج من نماذج CLIP، باستخدام BERT كمُشفِّر نصي وResNet F6 [ 29 ] كمُشفِّر صور. تم استخدام مُشفِّر الصور في زوج CLIP مع تثبيت معلماتهما، بينما تم استبعاد مُشفِّر النص. بعد ذلك، تم دمج مُشفِّر الصور المُثبَّت مع نموذج لغة Chinchilla مُثبَّت ، وذلك من خلال ضبط دقيق لبعض المعلمات الإضافية التي تربط بين النموذجين المُثبَّتين.
تطبيقات في مجالات أخرى
- مُشفّر الصور الخاص بـ CLIP هو مُشفّر صور مُدرّب مُسبقًا . ويمكن بعد ذلك إدخاله في نماذج الذكاء الاصطناعي الأخرى. [ 1 ]
- تستخدم نماذج مثل Stable Diffusion مُشفِّر النصوص الخاص بـ CLIP لتحويل النصوص إلى تمثيلات مضمنة لتوليد الصور. [ 3 ] كما يمكن استخدام CLIP كإشارة تدرج لتوجيه الانتشار مباشرةً ("توجيه CLIP") [ 30 ] [ 31 ] أو غيره من الفنون التوليدية. [ 32 ]
- يمكن استخدام نماذج CLIP المُحسّنة لترتيب الصور حسب جودتها الجمالية، وهو ما قد يكون مفيدًا كخطوة في تصفية مجموعة بيانات كبيرة إلى مجموعة أصغر ذات جودة أعلى. [ 33 ]
- يمكن استخدام CLIP لإنشاء تعليقات توضيحية للصور عن طريق مطابقة المدخلات النصية مع تضمينات الصور. [ 34 ]
ملحوظات
- ↑ على غرار "بعد التضمين" لتضمين النصوص في نماذج Transformer
- ↑
! pip install git + https://github.com/openai/CLIP.git ! wget https://github.com/openai/CLIP/raw/main/CLIP.png -O CLIP.pngاستيراد torch، استيراد clip، من PIL استيراد Image، استيراد numpy كـ npالجهاز = " cuda" إذا كان torch.cuda.is_available ( ) وإلا " cpu " لكل m في clip.available_models ( ) : النموذج ، المعالجة المسبقة = clip.load ( m , device = device )دقة_الإدخال = دقة_الإدخال_للنموذج.المرئي.طول_السياق = طول_السياق_للنموذج حجم_المفردات = حجم_المفردات_للنموذجprint ( " معلمات النموذج:" , f " { np.sum ( [ int(np.prod(p.shape ) ) for p in model.parameters ( ) ] ) : " , } " ) print ( " دقة الإدخال : " , input_resolution ) print ( "طول السياق:" , context_length ) print ( "حجم المفردات: " , vocab_size )n_params_vision = sum ( p.numel ( ) for p in model.visual.parameters ( ) ) n_params_text = sum ( p.numel ( ) for p in model.transformer.parameters () ) image = preprocess ( Image.open ( " CLIP.png " ) ) . unsqueeze ( 0 ) .to ( device ) image_features = model.encode_image ( image ) print ( f " Model : { m } , #vision parameters : { n_params_vision : , } , #text parameters : { n_params_text : , } , embedding dimension : { image_features.shape [ 1 ] } " ) del model , preprocess , image , image_features
- ↑ لا يُعدّ هذا هو نفسه مجموعة بيانات نص الصورة المستندة إلى ويكيبيديا، والتي تُسمى أيضًا "WIT". [ 19 ]
- ↑ لقد أشاروا إلى هذا على أنه كلاهما
ViT-L/14-336pxوViT-L/14@336px، بشكل غير متسق في جميع أنحاء التقرير.
مراجع
- 1 2 3 4 5 6 7 رادفورد، أليك؛ كيم، جونغ ووك؛ هالاسي، كريس؛ راميش، أديتيا؛ جوه، غابرييل؛ أغاروال، سانديني؛ ساستري، جيريش؛ أسكيل، أماندا؛ ميشكين، باميلا؛ كلارك، جاك؛ كروجر، غريتشن؛ سوتسكيفر، إيليا (2021-07-01). تعلم نماذج بصرية قابلة للنقل من خلال الإشراف على اللغة الطبيعية . وقائع المؤتمر الدولي الثامن والثلاثين للتعلم الآلي. PMLR. ص 8748-8763 .
- ^ هندريكسن، ماريا. بليكر، موريتس؛ فاكولينكو، سفيتلانا؛ فان نورد، نان؛ كويبر، ارنست. دي ريكي، مارتن (2022). "توسيع CLIP لاسترجاع الفئة إلى الصورة في التجارة الإلكترونية" . وفي هاجن ماتياس؛ فيربيرن، سوزان؛ ماكدونالد، كريج. سيفرت، كريستين. بالوغ، كريستيان؛ نورفاج، كيتيل؛ سيتي ، فيناي (محرران). التقدم في استرجاع المعلومات . ملاحظات محاضرة في علوم الكمبيوتر. المجلد. 13185. شام: سبرينغر الدولية للنشر. ص 289 – 303. دوى : 10.1007 / 978-3-030-99736-6_20 . رقم ISBN 978-3-030-99736-6.
- 1 2 "مستودع نشر مستقر على GitHub" . CompVis - مجموعة أبحاث رؤية الآلة والتعلم، جامعة لودفيغ ماكسيميليان في ميونخ. 17 سبتمبر 2022. مؤرشف من الأصل في 18 يناير 2023. تم الاطلاع عليه في 17 سبتمبر 2022 .
- ↑ LAION-AI/aesthetic-predictor ، LAION AI، 2024-09-06 ، تم الاطلاع عليه بتاريخ 2024-09-08
- ↑ سون، كيهيوك (2016). "تحسين التعلم العميق للمقاييس باستخدام هدف خسارة متعدد الفئات من نوع N-pair" . التطورات في أنظمة معالجة المعلومات العصبية . 29. كوران أسوشيتس، إنك.
- ↑ تشاي، شياوهوا؛ مصطفى، باسل؛ كوليسنيكوف، ألكسندر؛ باير، لوكاس (2023). دالة الخسارة سيجمويد للتدريب المسبق على صور اللغة . المؤتمر الدولي IEEE/CVF حول رؤية الحاسوب (ICCV). الصفحات 11975-11986 .
- ↑ ليو، تشوانغ؛ ماو، هانزي؛ وو، تشاو يوان؛ فايشتنهوفر، كريستوف؛ داريل، تريفور؛ شي، ساينينغ (2022). شبكة عصبية التفافية لعقد 2020. مؤتمر IEEE/CVF حول رؤية الحاسوب والتعرف على الأنماط (CVPR). الصفحات 11976-11986 .
- 1 2 إلهاركو، غابرييل؛ وورتسمان، ميتشل؛ ويتمان، روس. جوردون، كيد. كارليني, نيكولاس ; تاوري، روهان؛ ديف، أشال؛ شانكار، فيشال؛ Namkoong، Hongseok (يوليو 2021)، "OpenCLIP" ، Zenodo ، بيب كود : 2021zndo...5143773I ، doi : 10.5281/zenodo.5143773 ، استرجاعها 2024-09-06
- 1 2 رادفورد، أليك؛ كيم، جونغ ووك؛ هالاسي، كريس؛ راميش، أديتيا؛ جوه، غابرييل؛ أغاروال، سانديني؛ ساستري، جيريش؛ أسكيل، أماندا؛ ميشكين، باميلا؛ كلارك، جاك؛ كروجر، غريتشن؛ سوتسكيفر، إيليا (2021). "تعلم النماذج البصرية القابلة للنقل من خلال الإشراف على اللغة الطبيعية". arXiv : 2103.00020 [ cs.CV ].
- ^ openai/CLIP ، OpenAI، 06-09-2024 ، استرجاعها 2024-09-06
- ^ دوسوفيتسكي ، أليكسي. باير، لوكاس. كوليسنيكوف، الكسندر؛ ويسينبورن، ديرك. تشاي، شياو هوا؛ أونترثينر، توماس؛ دهقاني، مصطفى؛ مينديرر، ماتياس؛ هيجولد، جورج. جيلي، سيلفان. أوزكوريت ، جاكوب (2021-06-03). “الصورة تستحق 16 × 16 كلمة: محولات للتعرف على الصور على نطاق واسع”. أرخايف : 2010.11929 [ cs.CV ].
- ^ هو كايمينغ. تشانغ، شيانغيو. رن، شاوتشينج؛ صن جيان (10 ديسمبر 2015). التعلم المتبقي العميق للتعرف على الصور . أرخايف : 1512.03385 .
- ↑ هي، تونغ؛ تشانغ، تشي؛ تشانغ، هانغ؛ تشانغ، تشونغيو؛ شي، جونيوان؛ لي، مو (2018-12-05). "مجموعة من الحيل لتصنيف الصور باستخدام الشبكات العصبية الالتفافية". arXiv : 1812.01187 [ cs.CV ].
- ↑ تشانغ، ريتشارد (27-09-2018). "جعل الشبكات الالتفافية غير متغيرة مع الإزاحة مرة أخرى" . وقائع المؤتمر الدولي السادس والثلاثين للتعلم الآلي .
- ↑ تشانغ، ريتشارد (2019-06-08). "جعل الشبكات الالتفافية غير متغيرة مع الإزاحة مرة أخرى". arXiv : 1904.11486 [ cs.CV ].
- 1 2 3 جيا، تشاو؛ يانغ، ينفي؛ شيا، يي؛ تشين، يي-تينغ؛ باريك، زارانا؛ فام، هيو؛ لي، كوك؛ سونغ، يون-هسوان؛ لي، تشن؛ دويريغ، توم (2021-07-01). "توسيع نطاق تعلم تمثيل اللغة المرئية والبصرية باستخدام الإشراف على النصوص المشوشة" . وقائع المؤتمر الدولي الثامن والثلاثين للتعلم الآلي . PMLR: 4904–4916 .
- ↑ تان، مينغشينغ؛ لي، كوك ف. (2020-09-11). "EfficientNet: إعادة التفكير في توسيع نطاق النموذج للشبكات العصبية الالتفافية". arXiv : 1905.11946 [ cs.LG ].
- ↑ رادفورد، أليك؛ وو، جيف؛ تشايلد، ر.؛ لوان، د.؛ أمودي، داريو؛ سوتسكيفر، إ. (2019). "نماذج اللغة هي متعلمون متعددون المهام غير خاضعين للإشراف". OpenAI . S2CID 160025533 .
- ↑ سرينيفاسان، كريشنا؛ رامان، كارتيك؛ تشين، جيكاو؛ بيندرسكي، مايكل؛ ناجورك، مارك (11 يوليو 2021). "WIT: مجموعة بيانات نصية صورية قائمة على ويكيبيديا للتعلم الآلي متعدد الوسائط ومتعدد اللغات". وقائع المؤتمر الدولي الرابع والأربعين لجمعية ACM SIGIR حول البحث والتطوير في استرجاع المعلومات . الصفحات 2443-2449 . arXiv : 2103.01913 . doi : 10.1145/3404835.3463257 . ISBN 978-1-4503-8037-9.
- ↑ "الانحراف المعياري والمتوسط لتطبيع الصور يختلفان عن ImageNet · المشكلة رقم 20 · openai/CLIP" . GitHub . تم الاطلاع عليه بتاريخ 19-09-2024 .
- ↑ شارما، بيوش؛ دينغ، نان؛ غودمان، سيباستيان؛ سوريكوت، رادو (يوليو 2018). غوريفيتش، إيرينا؛ مياو، يوسوكي (محررون). "التعليقات المفاهيمية: مجموعة بيانات نص بديل للصور مُنقّحة ومُصنّفة تصنيفًا عامًا للتعليق التلقائي على الصور" . وقائع الاجتماع السنوي السادس والخمسين لجمعية اللغويات الحاسوبية (المجلد 1: الأوراق البحثية الطويلة) . ملبورن، أستراليا: جمعية اللغويات الحاسوبية: 2556-2565 . doi : 10.18653/v1/P18-1238 .
- ↑ تشيرتي، مهدي؛ بومونت، رومان؛ وايتمان، روس؛ وورتسمان، ميتشل؛ إلهاركو، غابرييل؛ غوردون، كيد؛ شومان، كريستوف؛ شميدت، لودفيغ؛ جيتسيف، جينيا (يونيو 2023). "قوانين قياس قابلة للتكرار لتعلم اللغة-الصورة التبايني". مؤتمر IEEE/CVF لعام 2023 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 2818-2829 . arXiv : 2212.07143 . doi : 10.1109/CVPR52729.2023.00276 . ISBN 979-8-3503-0129-8.
- ↑ توفرون، هوغو؛ فيدالدي، أندريا؛ دوز، ماتيس؛ جيغو، هيرفي (2019). "معالجة التباين في دقة التدريب والاختبار" . التطورات في أنظمة معالجة المعلومات العصبية . 32. كوران أسوشيتس، إنك.
- ↑ "laion/CLIP-ViT-L-14-laion2B-s32B-b82K · Hugging Face" . huggingface.co . 2023-09-10 . تم الاطلاع عليه بتاريخ 2024-09-06 .
- ^ هندريكسن، ماريا. بليكر، موريتس؛ فاكولينكو، سفيتلانا؛ فان نورد، نان؛ كويبر، ارنست. دي ريكي، مارتن (2021). “توسيع CLIP لاسترجاع الفئة إلى الصورة في التجارة الإلكترونية”. أرخايف : 2112.11294 [ cs.CV ].
- ↑ بومونت، رومان (2024-09-07)، rom1504/clip-retrieval ، تم الاسترجاع في 2024-09-08
- ↑ هالتاكوف، فلاديمير (2024-09-03)، haltakov/natural-language-image-search ، تم الاطلاع عليه بتاريخ 2024-09-06
- ↑ ألايراك، جان بابتيست؛ دوناهو، جيف؛ لوك، بولين؛ ميش، أنطوان؛ بار، إيان؛ حسون، يانا؛ لينس، كاريل؛ مينش، آرثر؛ ميليكان، كاثرين؛ رينولدز، مالكولم؛ رينغ، رومان؛ رذرفورد، إليزا؛ كابي، سيركان؛ هان، تينغدا؛ غونغ، زيتاو (2022-12-06). "فلامينغو: نموذج لغوي مرئي للتعلم باستخدام عدد قليل من الأمثلة" . التقدم في أنظمة معالجة المعلومات العصبية . 35 : 23716-23736 .
- ↑ بروك، آندي؛ دي، سوهام؛ سميث، صموئيل ل.؛ سيمونيان، كارين (2021-07-01). "التعرف على الصور عالية الأداء واسعة النطاق بدون تطبيع" . وقائع المؤتمر الدولي الثامن والثلاثين للتعلم الآلي . PMLR: 1059–1071 .
- ↑ راميش، أديتيا؛ داريوال، برافولا؛ نيكول، أليكس؛ تشو، كيسي؛ تشين، مارك (2022-04-12). "توليد الصور الهرمي المشروط بالنص باستخدام CLIP Latents". arXiv : 2204.06125 [ cs.CV ].
- ^ هندريكسن، ماريا. بليكر، موريتس؛ فاكولينكو، سفيتلانا؛ فان نورد، نان؛ كويبر، ارنست. دي ريكي، مارتن (2022). "توسيع CLIP لاسترجاع الفئة إلى الصورة في التجارة الإلكترونية" . وفي هاجن ماتياس؛ فيربيرن، سوزان؛ ماكدونالد، كريج. سيفرت، كريستين. بالوغ، كريستيان؛ نورفاج، كيتيل؛ سيتي ، فيناي (محرران). التقدم في استرجاع المعلومات . ملاحظات محاضرة في علوم الكمبيوتر. المجلد. 13185. شام: سبرينغر الدولية للنشر. ص 289 – 303. دوى : 10.1007 / 978-3-030-99736-6_20 . رقم ISBN 978-3-030-99736-6.
- ↑ ويتاكر، جوناثان (22-05-2022). "متعة مع الأوتوماتا الخلوية العصبية" . دبليو آند بي . تم الاسترجاع في 08-09-2024 .
- ↑ LAION-AI/aesthetic-predictor ، LAION AI، 2024-09-06 ، تم الاطلاع عليه بتاريخ 2024-09-08
- ↑ موكادي، رون؛ هيرتز، أمير؛ بيرمانو، أميت هـ. (2021). "ClipCap: بادئة CLIP لشرح الصور". arXiv : 2111.09734 [ cs.CV ].
روابط خارجية
- صفحة CLIP الخاصة بـ OpenAI
- OpenCLIP: تطبيق مفتوح المصدر لـ CLIP
- أرورا، أمان (11 مارس 2023). "التعليق التوضيحي على مقطع الفيديو (الجزء الثاني)" . amaarora.github.io . تاريخ الاسترجاع: 11 سبتمبر 2024 .
- التعلم الآلي
- الشبكات العصبية الاصطناعية
- رؤية الحاسوب
- معالجة اللغة الطبيعية
