شبكة إيماج نت
مشروع ImageNet عبارة عن قاعدة بيانات بصرية كبيرة مصممة للاستخدام في أبحاث برامج التعرف البصري على الأشياء . تم شرح أكثر من 14 مليون [1] [2] صورة يدويًا بواسطة المشروع للإشارة إلى الأشياء المصورة وفي مليون صورة على الأقل، يتم توفير مربعات محيطة أيضًا. [3] يحتوي ImageNet على أكثر من 20000 فئة، [2] مع فئة نموذجية، مثل "البالون" أو "الفراولة"، تتكون من عدة مئات من الصور. [4] قاعدة بيانات التعليقات التوضيحية لعناوين URL للصور التابعة لجهات خارجية متاحة مجانًا مباشرة من ImageNet، على الرغم من أن الصور الفعلية لا تملكها ImageNet. [5] منذ عام 2010، يدير مشروع ImageNet مسابقة برمجيات سنوية، تحدي التعرف البصري على نطاق واسع ImageNet (ILSVRC)، حيث تتنافس برامج الكمبيوتر على تصنيف واكتشاف الأشياء والمشاهد بشكل صحيح. يستخدم التحدي قائمة "مقتطعة" من ألف فئة غير متداخلة. [6]
تاريخ
بدأت الباحثة في مجال الذكاء الاصطناعي فاي فاي لي العمل على فكرة ImageNet في عام 2006. وفي الوقت الذي ركزت فيه معظم أبحاث الذكاء الاصطناعي على النماذج والخوارزميات، أرادت لي توسيع وتحسين البيانات المتاحة لتدريب خوارزميات الذكاء الاصطناعي. [7] في عام 2007، التقت لي مع أستاذة جامعة برينستون كريستيان فيلباوم ، أحد مؤسسي WordNet ، لمناقشة المشروع. ونتيجة لهذا الاجتماع، واصلت لي بناء ImageNet بدءًا من حوالي 22000 اسم من WordNet واستخدام العديد من ميزاته. [8] كما استلهمت من تقدير عام 1987 [9] بأن الشخص العادي يتعرف على حوالي 30000 نوع مختلف من الأشياء. [10]
بصفته أستاذًا مساعدًا في جامعة برينستون ، جمع لي فريقًا من الباحثين للعمل على مشروع ImageNet. استخدموا Amazon Mechanical Turk للمساعدة في تصنيف الصور. بدأت عملية التصنيف في يوليو 2008 وانتهت في أبريل 2010. استغرق الأمر 2.5 عامًا لإكمال عملية التصنيف. [8] كان لديهم ميزانية كافية لتصنيف كل صورة من الصور البالغ عددها 14 مليون صورة ثلاث مرات. [10]
كانت الخطة الأصلية تتطلب 10000 صورة لكل فئة، ثم 40000 فئة بواقع 400 مليون صورة، يتم التحقق من كل منها ثلاث مرات. ووجد الباحثون أن البشر يستطيعون تصنيف صورتين على الأكثر في الثانية. وبهذا المعدل، كان من المقدر أن يستغرق الأمر 19 عامًا من العمل البشري (بدون راحة). [11]
لقد قدموا قاعدة البيانات الخاصة بهم لأول مرة كملصق في مؤتمر 2009 حول الرؤية الحاسوبية والتعرف على الأنماط (CVPR) في فلوريدا، بعنوان "ImageNet: معاينة لمجموعة بيانات هرمية واسعة النطاق". [12] [8] [13] [14] وأعيد استخدام الملصق في Vision Sciences Society 2009. [15]
في عام 2009، اقترح أليكس بيرج إضافة تحديد موقع الكائن كمهمة. وفي عام 2009، اتصل لي بمسابقة PASCAL Visual Object Classes للتعاون. وقد أسفر ذلك عن مسابقة ImageNet Large Scale Visual Recognition Challenge اللاحقة التي بدأت في عام 2010، والتي تضم 1000 فئة وتحديد موقع الكائن، مقارنة بمسابقة PASCAL VOC التي تضم 20 فئة فقط و19737 صورة (في عام 2010). [6] [8]
أهمية التعلم العميق
في 30 سبتمبر 2012، حققت شبكة عصبية ملتوية (CNN) تسمى AlexNet [16] خطأً من أعلى 5 بنسبة 15.3٪ في تحدي ImageNet 2012، وهو أقل من صاحب المركز الثاني بأكثر من 10.8 نقطة مئوية. كان استخدام الشبكات العصبية الملتوية ممكنًا بسبب استخدام وحدات معالجة الرسومات (GPUs) أثناء التدريب، [16] وهو عنصر أساسي في ثورة التعلم العميق . وفقًا لمجلة The Economist ، "فجأة بدأ الناس ينتبهون، ليس فقط داخل مجتمع الذكاء الاصطناعي ولكن عبر صناعة التكنولوجيا ككل." [4] [17] [18]
في عام 2015، تفوقت شبكة CNN العميقة للغاية من Microsoft والتي تحتوي على أكثر من 100 طبقة على شبكة AlexNet، والتي فازت بمسابقة ImageNet 2015. [19]
مجموعة البيانات
تعتمد ImageNet على عملية التعليق التوضيحي التي تقوم بها. تشير التعليقات التوضيحية على مستوى الصورة إلى وجود أو عدم وجود فئة كائن في الصورة، مثل "هناك نمور في هذه الصورة" أو "لا توجد نمور في هذه الصورة". توفر التعليقات التوضيحية على مستوى الكائن مربعًا محددًا حول الجزء المرئي من الكائن المشار إليه. تستخدم ImageNet أحد أشكال مخطط WordNet الواسع لتصنيف الكائنات، مع إضافة 120 فئة من سلالات الكلاب لعرض التصنيف الدقيق. [6]
في عام 2012، كانت ImageNet أكبر مستخدم أكاديمي لبرنامج Mechanical Turk في العالم . حيث تمكن العامل العادي من التعرف على 50 صورة في الدقيقة. [2]
كانت الخطة الأصلية لشبكة ImageNet الكاملة تتضمن ما يقرب من 50 مليون صورة نظيفة ومتنوعة وكاملة الدقة موزعة على ما يقرب من 50 ألف مجموعة متزامنة. [13] لم يتم تحقيق ذلك.
الإحصائيات الموجزة المقدمة في 30 أبريل 2010: [20]
- العدد الإجمالي للمجموعات غير الفارغة: 21841
- العدد الإجمالي للصور: 14,197,122
- عدد الصور التي تحتوي على تعليقات توضيحية لمربعات التحديد: 1,034,908
- عدد مجموعات المزامنات التي تحتوي على ميزات SIFT: 1000
- عدد الصور التي تحتوي على ميزات SIFT: 1.2 مليون
فئات
تمت تصفية فئات ImageNet من مفاهيم WordNet. نظرًا لأن كل مفهوم يمكن أن يحتوي على مرادفات متعددة (على سبيل المثال، "kitty" و"young cat")، فإن كل مفهوم يُسمى "مجموعة مرادفات" أو " synset ". كان هناك أكثر من 100000 مجموعة مرادفات في WordNet 3.0، معظمها أسماء (80000+). قامت مجموعة بيانات ImageNet بتصفية هذه إلى 21841 مجموعة مرادفات هي أسماء قابلة للعد ويمكن توضيحها بصريًا.
تحتوي كل مجموعة مرادفات في WordNet 3.0 على "معرف WordNet" (wnid)، وهو عبارة عن سلسلة من جزء من الكلام و"إزاحة" ( رقم تعريف فريد ). يبدأ كل معرف wnid بالحرف "n" لأن ImageNet لا يتضمن سوى الأسماء . على سبيل المثال، معرف wnid لمجموعة المرادفات " كلب، كلب محلي، Canis familiaris " هو "n02084071". [21]
تنقسم الفئات في ImageNet إلى 9 مستويات، من المستوى 1 (مثل "الثدييات") إلى المستوى 9 (مثل "الراعي الألماني"). [11]
تنسيق الصورة
تم جمع الصور من البحث عن الصور عبر الإنترنت ( Google ، Picsearch ، MSN ، Yahoo ، Flickr ، إلخ) باستخدام مرادفات بلغات متعددة. على سبيل المثال: الراعي الألماني، كلب الشرطة الألماني، كلب الراعي الألماني، الألزاسي، ovejero alemán، pastore tedesco، 德国牧羊犬. [22]
يتكون ImageNet من صور بتنسيق RGB بدقة متفاوتة. على سبيل المثال، في ImageNet 2012، فئة "الأسماك"، تتراوح الدقة من 4288 × 2848 إلى 75 × 56. في التعلم الآلي، تتم معالجة هذه الصور مسبقًا عادةً إلى دقة ثابتة قياسية، وتبييضها، قبل معالجتها بشكل أكبر بواسطة الشبكات العصبية.
على سبيل المثال، في PyTorch، يتم تطبيع صور ImageNet افتراضيًا عن طريق قسمة قيم البكسل بحيث تقع بين 0 و1، ثم الطرح على [0.485، 0.456، 0.406]، ثم القسمة على [0.229، 0.224، 0.225]. هذه هي المتوسطات والانحرافات المعيارية، بالنسبة إلى ImageNet، لذا فهي تبيض بيانات الإدخال. [23]
العلامات والتعليقات التوضيحية
يتم تمييز كل صورة بمعرف واحد فقط.
كانت ميزات SIFT الكثيفة (موصفات SIFT الخام، وكلمات الكود الكمية، وإحداثيات كل واصف/كلمة كود) لـ ImageNet-1K متاحة للتنزيل، وهي مصممة لحقيبة من الكلمات المرئية . [24]
كانت المربعات المحيطة بالأشياء متاحة لحوالي 3000 مجموعة شائعة [25] بمتوسط 150 صورة في كل مجموعة. [26]
علاوة على ذلك، تحتوي بعض الصور على سمات. لقد أصدروا 25 سمة لنحو 400 مجموعة شائعة من الصور المتزامنة: [27] [28]
- اللون : أسود، أزرق، بني، رمادي، أخضر، برتقالي، وردي، أحمر، بنفسجي، أبيض، أصفر
- النمط : منقط، مخطط
- الشكل : طويل، دائري، مستطيل، مربع
- الملمس : فروي، أملس، خشن، لامع، معدني، نباتي، خشبي، رطب
إيماج نت-21ك
يشار إلى مجموعة البيانات الأصلية الكاملة باسم ImageNet-21K. تحتوي ImageNet-21k على 14,197,122 صورة مقسمة إلى 21,841 فئة. تلخص بعض الأوراق البحثية هذا وتسميه ImageNet-22k. [29]
تم إصدار ImageNet-21k بالكامل في خريف عام 2011، كما هو الحال في fall11_whole.tar. لا يوجد تقسيم رسمي للتدريب والتحقق والاختبار لـ ImageNet-21k. تحتوي بعض الفئات على 1-10 عينات فقط، بينما تحتوي فئات أخرى على آلاف العينات. [29]
إيماج نت-1ك
توجد مجموعات فرعية مختلفة من مجموعة بيانات ImageNet تُستخدم في سياقات مختلفة، ويشار إليها أحيانًا باسم "الإصدارات". [16]
أحد أكثر المجموعات الفرعية استخدامًا في ImageNet هي "مجموعة بيانات تصنيف الصور وتحديد موقعها لتحدي التعرف البصري على نطاق واسع (ILSVRC) 2012-2017 من ImageNet". يُشار إليها أيضًا في الأدبيات البحثية باسم ImageNet-1K أو ILSVRC2017، مما يعكس تحدي ILSVRC الأصلي الذي شمل 1000 فئة. يحتوي ImageNet-1K على 1281167 صورة تدريب و50000 صورة تحقق و100000 صورة اختبار. [30]
كل فئة في ImageNet-1K هي فئة فرعية، مما يعني أنه لا توجد عقد فرعية أسفلها، على عكس ImageNet-21K. على سبيل المثال، في ImageNet-21K، توجد بعض الصور المصنفة على أنها "ثدييات" ببساطة، بينما في ImageNet-1K، توجد فقط صور مصنفة على أنها أشياء مثل "الراعي الألماني"، نظرًا لعدم وجود كلمات فرعية أسفل "الراعي الألماني". [22]
التطورات اللاحقة
في شتاء عام 2021، تم تحديث ImageNet-21k. تمت تصفية 2702 فئة في الشجرة الفرعية "الشخص" لمنع "السلوكيات الإشكالية" في النموذج المدرب. في عام 2021، تم تحديث ImageNet-1k من خلال التعليق على الوجوه التي تظهر في 997 فئة غير شخصية. وجدوا أن نماذج التدريب على مجموعة البيانات مع عدم وضوح هذه الوجوه تسببت في خسارة ضئيلة في الأداء. [31]
كانت ImageNetV2 عبارة عن مجموعة بيانات جديدة تحتوي على ثلاث مجموعات اختبار تحتوي كل منها على 10000، تم إنشاؤها بنفس المنهجية المستخدمة في ImageNet الأصلية. [32]
كانت ImageNet-21K-P عبارة عن مجموعة فرعية مفلترة ونظيفة من ImageNet-21K، تحتوي على 12,358,688 صورة من 11,221 فئة. [29]
| اسم | نُشرت | الفصول الدراسية | تمرين | تصديق | امتحان | مقاس |
|---|---|---|---|---|---|---|
| باسكال فوك | 2005 | 20 | ||||
| إيماج نت-1ك | 2009 | 1000 | 1,281,167 | 50,000 | 100000 | 130 جيجابايت |
| إيماج نت-21ك | 2011 | 21,841 | 14,197,122 | 1.31 تيرابايت | ||
| برنامج ImageNetV2 | 2019 | 30,000 | ||||
| إيماج نت-21ك-بي | 2021 | 11,221 | 11,797,632 | 561,052 |
تاريخ تحدي ImageNet
.svg/440px-ImageNet_error_rate_history_(just_systems).svg.png)
تهدف ILSVRC إلى "السير على خطى" تحدي PASCAL VOC الأصغر حجمًا، والذي تم إنشاؤه في عام 2005، والذي احتوى فقط على حوالي 20000 صورة وعشرين فئة من الكائنات. [6] لـ "إضفاء الطابع الديمقراطي" على ImageNet، اقترحت Fei-Fei Li على فريق PASCAL VOC تعاونًا، بدءًا من عام 2010، حيث تقوم فرق البحث بتقييم خوارزمياتها على مجموعة البيانات المقدمة، والتنافس لتحقيق دقة أعلى في العديد من مهام التعرف البصري. [8]
تُعرف المسابقة السنوية الناتجة الآن باسم تحدي التعرف البصري واسع النطاق على ImageNet (ILSVRC). يستخدم ILSVRC قائمة "مقتضبة" تضم 1000 فئة أو "فئات" للصور فقط، بما في ذلك 90 من أصل 120 سلالة كلاب مصنفة حسب مخطط ImageNet الكامل. [6]
وشهد العقد الأول من القرن الحادي والعشرين تقدماً هائلاً في معالجة الصور.
كانت المسابقة الأولى في عام 2010 تضم 11 فريقًا مشاركًا. وكان الفريق الفائز عبارة عن آلة دعم متجه خطي (SVM). والميزات عبارة عن شبكة كثيفة من HoG و LBP ، متناثرة من خلال ترميز الإحداثيات المحلية والتجميع. [33] وقد حققت 52.9٪ في دقة التصنيف و71.8٪ في أعلى 5 دقة. تم تدريبها لمدة 4 أيام على ثلاث آلات ذات 8 نواة (وحدة معالجة مركزية Intel Xeon ثنائية النواة بسرعة 2 جيجاهرتز ). [34]
كانت المسابقة الثانية في عام 2011 تضم عددًا أقل من الفرق، حيث فاز SVM آخر بمعدل خطأ بين أفضل 5 بنسبة 25%. [10] وكان الفريق الفائز هو XRCE بواسطة فلورنت بيرونين وخورخي سانشيز. كان النظام عبارة عن SVM خطي آخر، يعمل على متجهات فيشر الكمية [35] . [36] [37] وقد حقق 74.2% في أعلى 5 دقة.
في عام 2012، حققت شبكة عصبية ملتوية عميقة تسمى AlexNet نسبة 84.7% في الدقة ضمن أفضل 5، وهي قفزة كبيرة إلى الأمام. [38] وفي العامين التاليين، نمت دقة أفضل 5 إلى أكثر من 90%. وفي حين أن الاختراق الذي حدث في عام 2012 "جمع بين القطع التي كانت موجودة من قبل"، فإن التحسن الكمي المذهل كان بمثابة بداية طفرة الذكاء الاصطناعي على مستوى الصناعة. [4]
بحلول عام 2014، شاركت أكثر من خمسين مؤسسة في ILSVRC. [6] في عام 2017، كان لدى 29 من 38 فريقًا متنافسًا دقة تزيد عن 95٪. [39] في عام 2017، ذكرت ImageNet أنها ستطرح تحديًا جديدًا أكثر صعوبة في عام 2018 يتضمن تصنيف الكائنات ثلاثية الأبعاد باستخدام لغة طبيعية. نظرًا لأن إنشاء بيانات ثلاثية الأبعاد أكثر تكلفة من التعليق على صورة ثنائية الأبعاد موجودة مسبقًا، فمن المتوقع أن تكون مجموعة البيانات أصغر. ستتراوح تطبيقات التقدم في هذا المجال من الملاحة الآلية إلى الواقع المعزز . [1]
بحلول عام 2015، أفاد الباحثون في مايكروسوفت أن شبكات CNN الخاصة بهم تجاوزت القدرة البشرية في مهام ILSVRC الضيقة. [19] [40] ومع ذلك، كما أشارت إحدى منظمي التحدي، أولغا روساكوفسكي ، في عام 2015، فإن المسابقة تجاوزت 1000 فئة فقط؛ يمكن للبشر التعرف على عدد أكبر من الفئات، ويمكنهم أيضًا (على عكس البرامج) الحكم على سياق الصورة. [41]
التحيز في ImageNet
يُقدَّر أن أكثر من 6% من العلامات في مجموعة التحقق من صحة ImageNet-1k خاطئة. [42] كما وجد أن حوالي 10% من ImageNet-1k تحتوي على علامات غامضة أو خاطئة، وأنه عند تقديم تنبؤ النموذج وعلامة ImageNet الأصلية، يفضل المعلقون البشريون تنبؤ نموذج متطور في عام 2020 مدرب على ImageNet الأصلية، مما يشير إلى أن ImageNet-1k قد أصبح مشبعًا. [43]
وصفت دراسة لتاريخ الطبقات المتعددة ( التصنيف وفئات الكائنات والترميز) لـ ImageNet وWordNet في عام 2019 كيف أن التحيز [ يحتاج إلى توضيح ] متأصل بعمق في معظم مناهج التصنيف لجميع أنواع الصور. [44] [45] [46] [47] تعمل ImageNet على معالجة مصادر التحيز المختلفة. [48]
أحد الجوانب السلبية لاستخدام WordNet هو أن الفئات قد تكون "أكثر ارتفاعًا" مما قد يكون مثاليًا لـ ImageNet: "معظم الناس مهتمون بـ Lady Gaga أو iPod Mini أكثر من هذا النوع النادر من diplodocus ." [ بحاجة لتوضيح ]
انظر أيضا
مراجع
- ^ "تحدي جديد في مجال الرؤية الحاسوبية يهدف إلى تعليم الروبوتات الرؤية ثلاثية الأبعاد". مجلة نيو ساينتست . 7 أبريل 2017. تم الاسترجاع في 3 فبراير 2018 .
- ^ abc Markoff, John (19 November 2012). "For Web Images, Creating New Technology to Seek and Find". The New York Times . تم الاسترجاع في 3 فبراير 2018 .
- ^ "ImageNet". 7 سبتمبر 2020. مؤرشف من الأصل في 7 سبتمبر 2020. اطلع عليه بتاريخ 11 أكتوبر 2022 .
- ^ abc "من عدم العمل إلى الشبكات العصبية". مجلة الإيكونوميست . 25 يونيو 2016. تم الاسترجاع في 3 فبراير 2018 .
- ^ "نظرة عامة على ImageNet". ImageNet . تم الاسترجاع في 15 أكتوبر 2022 .
- ^ abcdef أولغا روساكوفسكي*، جيا دينغ*، هاو سو، جوناثان كراوس، سانجيف ساتيش، شون ما، زيهينغ هوانغ، أندريه كارباثي ، أديتيا خوسلا، مايكل بيرنشتاين، ألكسندر سي بيرج، ولي فاي فاي. (* = مساهمة متساوية) تحدي التعرف البصري على نطاق واسع من ImageNet. آي جي سي في، 2015.
- ^ Hempel, Jesse (13 November 2018). "Fei-Fei Li's Quest to Make AI Better for Humanity". Wired . تم الاسترجاع في 5 مايو 2019 .
عندما تحدثت لي، التي عادت إلى برينستون لتولي وظيفة أستاذة مساعدة في عام 2007، عن فكرتها الخاصة بشبكة ImageNet، واجهت صعوبة في إقناع أعضاء هيئة التدريس بالمساعدة. أخيرًا، وافق أستاذ متخصص في هندسة الكمبيوتر على الانضمام إليها كمتعاون.
- ^ abcde Gershgorn, Dave (26 July 2017). "The data that transformed AI research—and perhaps the world". Quartz . Atlantic Media Co . Retrieved 26 July 2017 .
بعد أن قرأ عن نهج WordNet، التقى لي بالبروفيسور كريستيان فيلباوم، الباحث المؤثر في العمل المستمر على WordNet، خلال زيارة إلى برينستون عام 2006.
- ^ بيدرمان، إيرفينج (1987). "التعرف حسب المكونات: نظرية لفهم الصورة البشرية". المراجعة النفسية . 94 (2): 115-117 . doi :10.1037/0033-295x.94.2.115. ISSN 0033-295X. PMID 3575582.
- ^ abc Lee, Timothy B. (11 نوفمبر 2024). "كيف أطلق عالم كمبيوتر عنيد عن طريق الخطأ طفرة التعلم العميق". Ars Technica . تم الاسترجاع في 12 نوفمبر 2024 .
- ^ ab Li, FF. ImageNet. "Crowdsourcing, benchmarking & other cool things." CMU VASC Semin 16 (2010): 18-25.
- ^ "CVPR 2009: مؤتمر جمعية IEEE للكمبيوتر حول الرؤية الحاسوبية والتعرف على الأنماط". tab.computer.org . تم الاسترجاع في 13 نوفمبر 2024 .
- ^ ab Deng, Jia; Dong, Wei; Socher, Richard; Li, Li-Jia; Li, Kai; Fei-Fei, Li (2009), "ImageNet: A Large-Scale Hierarchical Image Database" (PDF) , 2009 conference on Computer Vision and Pattern Recognition , محفوظ من الأصل (PDF) في 15 يناير 2021 , تم استرجاعه في 26 يوليو 2017
- ^ لي، فاي فاي (23 مارس 2015)، كيف نعلم أجهزة الكمبيوتر فهم الصور ، تم الاسترجاع في 16 ديسمبر 2018
- ^ دينج، جيا، وآخرون. "إنشاء وتحليل علم الوجود للصور على نطاق واسع". مجلة جمعية علوم الرؤية 186.2 (2009).
- ^ abc Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (يونيو 2017). "تصنيف ImageNet باستخدام الشبكات العصبية التلافيفية العميقة" (PDF) . Communications of the ACM . 60 (6): 84– 90. doi : 10.1145/3065386 . ISSN 0001-0782. S2CID 195908774. تم الاسترجاع في 24 مايو 2017 .
- ^ "الآلات تتفوق على البشر في عدد متزايد من المهام". فاينانشال تايمز . 30 نوفمبر 2017. تم استرجاعه في 3 فبراير 2018 .
- ^ جيرشجورن، ديف (18 يونيو 2018). "القصة الداخلية لكيفية حصول الذكاء الاصطناعي على ما يكفي من الجودة للهيمنة على وادي السيليكون". كوارتز . تم الاسترجاع في 10 ديسمبر 2018 .
- ^ ab He, Kaiming; Zhang , Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "التعلم المتبقي العميق للتعرف على الصور". مؤتمر معهد مهندسي الكهرباء والإلكترونيات لعام 2016 حول الرؤية الحاسوبية والتعرف على الأنماط (CVPR) . ص 770-778 . arXiv : 1512.03385 . doi :10.1109/CVPR.2016.90. ISBN 978-1-4673-8851-1. S2CID 206594692.
- ^ "ملخص وإحصائيات ImageNet (تم التحديث في 30 أبريل 2010)". 15 يناير 2013. مؤرشف من الأصل في 15 يناير 2013. تم الاسترجاع 13 نوفمبر 2024 .
- ^ "ImageNet API documentation". 22 يناير 2013. مؤرشف من الأصل في 22 يناير 2013. تم الاسترجاع 13 نوفمبر 2024 .
- ^ ab Berg, Alex, Jia Deng, and L. Fei-Fei. "تحدي التعرف البصري واسع النطاق 2010." نوفمبر 2010.
- ^ "std and mean for image normalization different from ImageNet · Issue #20 · openai/CLIP". GitHub . تم الاسترجاع في 19 سبتمبر 2024 .
- ^ "ImageNet". 5 أبريل 2013. مؤرشف من الأصل في 5 أبريل 2013. اطلع عليه بتاريخ 13 نوفمبر 2024 .
- ^ https://web.archive.org/web/20181030191122/http://www.image-net.org/api/text/imagenet.sbow.obtain_synset_list
- ^ "ImageNet". مؤرشف من الأصل في 5 أبريل 2013.
- ^ "ImageNet". مؤرشف من الأصل في 22 ديسمبر 2019.
- ^ Russakovsky, Olga; Fei-Fei, Li (2012). "Attribute Learning in Large-Scale Datasets". في Kutulakos, Kiriakos N. (محرر). Trends and Topics in Computer Vision . Lecture Notes in Computer Science. المجلد 6553. برلين، هايدلبرغ: سبرينغر. ص. 1-14 . doi :10.1007/978-3-642-35749-7_1. ISBN 978-3-642-35749-7.
- ^ abc Ridnik, Tal; Ben-Baruch, Emanuel; Noy, Asaf; Zelnik-Manor, Lihi (5 أغسطس 2021). "تدريب ImageNet-21K المسبق للجماهير". arXiv : 2104.10972 [cs.CV].
- ^ "ImageNet". www.image-net.org . تم الاسترجاع في 19 أكتوبر 2022 .
- ^ "تحديث لموقع ImageNet ومجموعة البيانات الخاصة به". www.image-net.org . تم الاسترجاع في 13 نوفمبر 2024 .
- ^ Recht, Benjamin; Roelofs, Rebecca; Schmidt, Ludwig; Shankar, Vaishaal (24 مايو 2019). "هل يمكن لتصنيفات ImageNet أن تنطبق على ImageNet؟". وقائع المؤتمر الدولي السادس والثلاثين حول التعلم الآلي . PMLR: 5389– 5400.
- ^ تصنيف ImageNet: ترميز الوصف السريع وتدريب SVM على نطاق واسع
- ^ لين ، يوانكينج ؛ المستوى، فنغجون؛ تشو، شينغهو؛ يانغ، مينغ. كور تيموثي. يو، كاي؛ تساو، ليانغ ليانغ؛ هوانغ ، توماس (يونيو 2011). “تصنيف الصور على نطاق واسع: استخراج سريع للميزات وتدريب SVM”. سي في بي آر 2011 . IEEE. ص 1689 – 1696. دوى :10.1109/cvpr.2011.5995477. رقم ISBN 978-1-4577-0394-2.
- ^ سانشيز، خورخي؛ بيرونين، فلورنت (يونيو 2011). "ضغط التوقيع عالي الأبعاد لتصنيف الصور واسعة النطاق". CVPR 2011. IEEE. ص 1665– 1672. doi :10.1109/cvpr.2011.5995504. ISBN 978-1-4577-0394-2.
- ^ بيرونين، فلوران؛ سانشيز، خورخي. مينسينك، توماس (2010). “تحسين نواة فيشر لتصنيف الصور على نطاق واسع”. في دانيليديس، كوستاس؛ ماراجوس، بيتروس؛ باراجيوس، نيكوس (محرران). رؤية الكمبيوتر – ECCV 2010 . ملاحظات محاضرة في علوم الكمبيوتر. المجلد. 6314. برلين، هايدلبرغ: سبرينغر. ص 143 – 156. دوى :10.1007 / 978-3-642-15561-1_11. رقم ISBN 978-3-642-15561-1.
- ^ "XRCE@ILSVRC2011: متجهات فيشر المضغوطة لـ LSVR"، فلورنت بيرونين وخورخي سانشيز، مركز أبحاث زيروكس أوروبا (XRCE)
- ^ https://www.image-net.org/challenges/LSVRC/2012/results
- ^ جيرشجورن، ديف (10 سبتمبر 2017). "دليل كوارتز للذكاء الاصطناعي: ما هو، ولماذا هو مهم، وهل يجب أن نخاف منه؟". كوارتز . تم الاسترجاع في 3 فبراير 2018 .
- ^ ماركوف، جون (10 ديسمبر 2015). "تقدم تعليمي في الذكاء الاصطناعي ينافس القدرات البشرية". نيويورك تايمز . تم الاسترجاع في 22 يونيو 2016 .
- ^ آرون، جاكوب (21 سبتمبر 2015). "انسَ اختبار تورينج – هناك طرق أفضل للحكم على الذكاء الاصطناعي". مجلة نيو ساينتست . تم الاسترجاع في 22 يونيو 2016 .
- ^ Northcutt, Curtis G.; Athalye, Anish; Mueller, Jonas (7 نوفمبر 2021)، أخطاء التسمية الشاملة في مجموعات الاختبار تزعزع استقرار معايير التعلم الآلي ، arXiv : 2103.14749
- ^ باير ، لوكاس. هيناف، أوليفييه J.؛ كوليسنيكوف، الكسندر؛ تشاي، شياو هوا؛ أورد، آرون فان دن (12 يونيو 2020)، هل انتهينا من ImageNet؟ ، أرخايف : 2006.07159
- ^ "التطبيق الفيروسي الذي يصنفك ليس بالضبط ما تعتقد". Wired . ISSN 1059-1028 . تم الاسترجاع في 22 سبتمبر 2019 .
- ^ وونغ، جوليا كاري (18 سبتمبر 2019). "بدا تطبيق الصور الشخصية الفيروسي ImageNet Roulette ممتعًا - حتى وصفني بإهانة عنصرية". The Guardian . ISSN 0261-3077 . تم الاسترجاع في 22 سبتمبر 2019 .
- ^ كروفورد، كيت؛ باجلين، تريفور (19 سبتمبر 2019). "استكشاف الذكاء الاصطناعي: سياسات مجموعات التدريب للتعلم الآلي". - . تم الاسترجاع في 22 سبتمبر 2019 .
- ^ ليونز، مايكل (24 ديسمبر 2020). "التنقيب "التنقيب بالذكاء الاصطناعي": الفيل في المعرض". arXiv : 2009.01215 . doi :10.5281/zenodo.4037538.
{{cite journal}}: تتطلب المجلة الاستشهاد بها|journal=( مساعدة ) - ^ "نحو مجموعات بيانات أكثر عدالة: تصفية وموازنة توزيع شجرة الأشخاص الفرعية في التسلسل الهرمي لشبكة ImageNet". image-net.org . 17 سبتمبر 2019 . تم الاسترجاع في 22 سبتمبر 2019 .
روابط خارجية
- الموقع الرسمي
