قاعدة بيانات MNIST

صور نموذجية من MNIST
صور نموذجية من مجموعة بيانات اختبار MNIST

قاعدة بيانات MNIST ( قاعدة بيانات المعهد الوطني للمعايير والتكنولوجيا المعدلة [ 1 ] ) هي قاعدة بيانات ضخمة للأرقام المكتوبة بخط اليد، وتُستخدم عادةً لتدريب أنظمة معالجة الصور المختلفة . [ 2 ] [ 3 ] كما تُستخدم قاعدة البيانات على نطاق واسع للتدريب والاختبار في مجال التعلم الآلي . [ 4 ] [ 5 ] وقد أُنشئت عن طريق "إعادة مزج" العينات من مجموعات بيانات NIST الأصلية. [ 6 ] ورأى مُنشئوها أن مجموعة بيانات التدريب الخاصة بـ NIST، والمأخوذة من موظفي مكتب الإحصاء الأمريكي ، بينما مجموعة بيانات الاختبار المأخوذة من طلاب المدارس الثانوية الأمريكية ، لم تكن مناسبة تمامًا لتجارب التعلم الآلي. [ 1 ] علاوة على ذلك، تم توحيد الصور بالأبيض والأسود من NIST لتناسب مربعًا محيطًا بحجم 28×28 بكسل، وتم تنعيم حوافها ، مما أدى إلى ظهور تدرجات رمادية. [ 1 ]

تحتوي قاعدة بيانات MNIST على 60,000 صورة تدريبية و10,000 صورة اختبارية. [ 7 ] تم أخذ نصف مجموعة التدريب ونصف مجموعة الاختبار من مجموعة بيانات التدريب التابعة للمعهد الوطني للمعايير والتكنولوجيا (NIST)، بينما تم أخذ النصف الآخر من مجموعة التدريب والنصف الآخر من مجموعة الاختبار من مجموعة بيانات الاختبار التابعة للمعهد الوطني للمعايير والتكنولوجيا (NIST). [ 8 ] يحتفظ منشئو قاعدة البيانات الأصليون بقائمة ببعض الطرق التي تم اختبارها عليها. [ 1 ] في ورقتهم البحثية الأصلية، استخدموا آلة المتجهات الداعمة (SVM) للحصول على معدل خطأ قدره 0.8%. [ 9 ]

تحتوي مجموعة بيانات MNIST الأصلية على 4 تصنيفات خاطئة على الأقل. [ 10 ]

تاريخ

قاعدة بيانات خدمة البريد الأمريكية

في عام ١٩٨٨، تم إنشاء مجموعة بيانات لأرقام من خدمة البريد الأمريكية . احتوت على صور رمادية بحجم ١٦×١٦ بكسل، مُرقمنة من رموز بريدية مكتوبة بخط اليد ، ظهرت على رسائل البريد الأمريكية التي تمر عبر مكتب بريد بوفالو، نيويورك . ضمت مجموعة التدريب ٧٢٩١ صورة، بينما ضمت مجموعة الاختبار ٢٠٠٧ صور، ليصبح المجموع ٩٢٩٨ صورة. احتوت كلتا المجموعتين على بيانات غامضة، وغير قابلة للتصنيف، ومصنفة بشكل خاطئ. استُخدمت مجموعة البيانات هذه لتدريب وقياس أداء نموذج LeNet لعام ١٩٨٩. [ ١١ ] [ ١٢ ]

المهمة صعبة نوعاً ما. في مجموعة الاختبار، ارتكب شخصان أخطاء بمعدل متوسط ​​قدره 2.5%. [ 13 ]

قاعدة بيانات خاصة

مثال على ملف HSF. هذا الملف مأخوذ من قاعدة بيانات NIST الخاصة رقم 19، واسم الملف هو f1002_33.png.

في أواخر ثمانينيات القرن العشرين، أبدى مكتب الإحصاء اهتمامًا بالرقمنة الآلية لاستمارات التعداد السكاني المكتوبة بخط اليد، فاستعان بمجموعة التعرف على الصور (IRG) في المعهد الوطني للمعايير والتكنولوجيا (NIST) لتقييم أنظمة التعرف الضوئي على الحروف (OCR ). [ 14 ] أسفرت سنوات من العمل عن إنشاء العديد من "قواعد البيانات الخاصة" ومعايير الأداء. ومن أهمها بالنسبة لمجموعة بيانات التعداد السكاني المتعددة (MNIST) قاعدة البيانات الخاصة 1 (SD-1)، التي صدرت في مايو 1990، [ 15 ] وقاعدة البيانات الخاصة 3 (SD-3)، التي صدرت في فبراير 1992، [ 16 ] وقاعدة البيانات الخاصة 7 (SD-7)، أو بيانات اختبار المعهد الوطني للمعايير والتكنولوجيا 1 (TD-1)، التي صدرت في أبريل 1992. [ 17 ] وقد صدرت هذه القواعد على أقراص مدمجة (CD-ROM) بمعيار ISO-9660 . [ 6 ] وتم الحصول عليها من خلال مطالبة الأفراد بالكتابة على "نماذج عينات الكتابة اليدوية" (HSFs)، ثم رقمنة هذه النماذج، ثم فصل الأحرف والأرقام. وقد كتب كل مشارك نموذجًا واحدًا فقط من نماذج عينات الكتابة اليدوية.

تحتوي كل استمارة HSF على حقول إدخال متعددة، طُلب من المشاركين الكتابة فيها. يوجد 34 حقلاً: حقول الاسم والتاريخ، وحقل المدينة/الولاية، و28 حقلاً للأرقام، وحقل واحد للأحرف الكبيرة، وحقل واحد للأحرف الصغيرة، وفقرة نصية غير مقيدة من الدستور . تم مسح كل استمارة HSF ضوئياً بدقة 300 نقطة في البوصة (11.8 نقطة في المليمتر).

تم إنشاء ملفي البيانات SD-1 وSD-3 من نفس مجموعة حقول إدخال البيانات (HSFs) بواسطة 2100 من أصل 3400 عامل ميداني دائم في تعداد الولايات المتحدة لعام 1990. [ 14 ] : احتوى ملف SD-1 على حقول إدخال البيانات المجزأة، ولكن ليس على الأحرف والأرقام المجزأة. أما ملف SD-3 فاحتوى على صور ثنائية بحجم 128×128 بكسل، تم رقمنتها من أحرف وأرقام مجزأة، تضم 223125 رقمًا، و44951 حرفًا كبيرًا، و45313 حرفًا صغيرًا.

كانت مجموعة الاختبار SD-7 أو TD-1 تحتوي على 58,646 صورة ثنائية بحجم 128×128 بكسل، كتبها 500 طالب في المرحلة الثانوية في بيثيسدا، ميريلاند . وُصفت هذه الصور بأنها "تمارين قصيرة لطلاب الرياضيات والعلوم في مدرسة ثانوية خلال الحصة الدراسية". [ 14 ] : 10 تُرفق كل صورة برقم تعريف فريد يُشير إلى هوية كاتبها. صدرت مجموعة SD-7 بدون ملصقات على أقراص CD-ROM، ثم أُضيفت الملصقات لاحقًا على أقراص مرنة. لم تحتوي المجموعة على ملفات HSF. كانت SD-7 صعبة للغاية لدرجة أن نسبة الخطأ البشري فيها بلغت 1.5%. [ 18 ]

كانت صور SD-3 أنقى وأسهل تمييزًا من صور SD-7. [ 1 ] كما أن الرقم 7 المتقاطع مع الحرف الأوروبي أكثر وفرة في SD-7 منه في SD-3. [ 19 ] وقد ساد الاعتقاد بأن SD-3 أُنتجت من قِبل أشخاص أكثر حماسًا من أولئك الذين أنتجوا SD-7. كذلك، كان مُجزئ الأحرف في SD-3 أقدم تصميمًا من مُجزئ الأحرف في SD-7، وكان أكثر عرضةً للفشل. ورجّح الاعتقاد بأن الحالات الأكثر صعوبةً قد تم استبعادها من عملية بناء SD-3، نظرًا لفشلها حتى في اجتياز مُجزئ الأحرف. [ 14 ] : 10 وقد وُجد أن أنظمة التعلّم الآلي التي تم تدريبها والتحقق من صحتها على SD-3 عانت من انخفاضات كبيرة في الأداء على SD-7، من معدل خطأ أقل من 1% إلى حوالي 10%. [ 20 ] [ 14 ] : 9

في عام ١٩٩٢، رعى المعهد الوطني للمعايير والتكنولوجيا (NIST) ومكتب الإحصاء الأمريكي مسابقة ومؤتمرًا لتحديد أحدث التقنيات في هذا المجال. في المسابقة، مُنحت الفرق مجموعة بيانات التدريب SD-3 قبل ٢٣ مارس، ومجموعة بيانات الاختبار SD-7 قبل ١٣ أبريل، وكان عليها تقديم نظام واحد أو أكثر لتصنيف SD-7 قبل ٢٧ أبريل. [ ١٤ ] : الملحق ج . قُدِّم ما مجموعه ٤٥ خوارزمية من ٢٦ شركة من ٧ دول مختلفة. [ ١٣ ] في ٢٧ و٢٨ مايو، اجتمعت جميع الجهات التي قدمت نتائجها في غايثرسبيرغ، ميريلاند، في المؤتمر الأول لأنظمة التعرف الضوئي على الأحرف (OCR) التابع لمكتب الإحصاء الأمريكي. وحضر المؤتمر مراقبون من مكتب التحقيقات الفيدرالي (FBI) ومصلحة الضرائب الأمريكية ( IRS) وهيئة البريد الأمريكية (USPS) . [ ١٤ ] : ١ لم يستخدم النظام الفائز مجموعة بيانات التدريب SD-3، بل استخدم مجموعة بيانات تدريب خاصة أكبر بكثير، وبالتالي لم يتأثر بتغيير التوزيع. من بين 25 مشاركة استخدمت SD-3 للتدريب، كانت المشاركة الفائزة عبارة عن مصنف أقرب جار باستخدام مقياس مصمم يدويًا وهو ثابت بالنسبة للتحويلات الإقليدية . [ 13 ]

نُشرت قاعدة بيانات SD-19 في عام 1995، وهي عبارة عن تجميع لبيانات SD-1 وSD-3 وSD-7 وبعض البيانات الإضافية. احتوت على 814,255 صورة ثنائية لأحرف وأرقام وصور ثنائية لـ 4169 صورة فائقة الدقة، بما في ذلك 500 صورة فائقة الدقة استُخدمت لإنشاء SD-7. تم تحديثها في عام 2016. [ 6 ]

وزارة العلوم والتكنولوجيا

تم إنشاء مجموعة بيانات MNIST قبل صيف عام 1994. [ 21 ] وقد تم إنشاؤها بدمج صور ثنائية بحجم 128×128 من مجموعتي SD-3 وSD-7. تحديدًا، تم أولًا أخذ جميع الصور من مجموعة SD-7 وتقسيمها إلى مجموعتين: مجموعة تدريب ومجموعة اختبار، كل مجموعة تضم 250 كاتبًا. نتج عن ذلك ما يقارب 30000 صورة في كل مجموعة. ثم أُضيفت المزيد من الصور من مجموعة SD-3 حتى احتوت كل مجموعة على 60000 صورة بالضبط. [ 20 ]

تمت معايرة حجم كل صورة لتناسب مربعًا بحجم 20×20 بكسل مع الحفاظ على نسبة العرض إلى الارتفاع، ثم تم تحويلها إلى تدرج رمادي مع تنعيم الحواف. بعد ذلك، تم تحويلها إلى صورة بحجم 28×28 بكسل عن طريق تحريكها حتى أصبح مركز كتلة البكسلات في مركز الصورة. تم إعادة بناء تفاصيل عملية تقليل حجم الصورة. [ 21 ]

كانت مجموعتا التدريب والاختبار تحتويان في الأصل على 60 ألف عينة، ولكن تم استبعاد 50 ألف عينة من مجموعة الاختبار، واستُخدمت فقط العينات المفهرسة من 24476 إلى 34475، مما أعطى 10 آلاف عينة فقط في مجموعة الاختبار. [ 22 ]

إصدارات أخرى

في عام 2019، تم استعادة مجموعة الاختبار الكاملة المكونة من 60 ألف صورة من MNIST لإنشاء QMNIST، والتي تحتوي على 60 ألف صورة في مجموعة التدريب و60 ألف صورة في مجموعة الاختبار. [ 23 ] [ 21 ]

مجموعة بيانات Extended MNIST (EMNIST) هي مجموعة بيانات أحدث طورتها وأصدرتها NIST لتكون النسخة النهائية من MNIST، التي صدرت عام 2017. [ 24 ] [ 25 ] تضمنت MNIST صورًا للأرقام المكتوبة بخط اليد فقط. أما EMNIST فقد تم إنشاؤها من جميع الصور من SD-19، [ 26 ] [ 27 ] وتم تحويلها إلى نفس تنسيق 28×28 بكسل، بنفس العملية المستخدمة في صور MNIST. وبناءً على ذلك، من المرجح أن تعمل الأدوات التي تعمل مع MNIST دون تعديل مع EMNIST.

تم إنشاء مجموعة بيانات Fashion MNIST في عام 2017 كبديل أكثر تحديًا لمجموعة بيانات MNIST. تتكون مجموعة البيانات من 70,000 صورة رمادية بحجم 28×28 بكسل لمنتجات أزياء من 10 فئات. [ 28 ]

أداء

حقق بعض الباحثين أداءً يُقارب الأداء البشري على قاعدة بيانات MNIST، باستخدام مجموعة من الشبكات العصبية ؛ وفي الورقة البحثية نفسها، حقق المؤلفون أداءً يُعادل ضعف أداء البشر في مهام التعرف الأخرى. [ 29 ] أعلى معدل خطأ مُدرج [ 1 ] على الموقع الإلكتروني الأصلي لقاعدة البيانات هو 12%، وقد تحقق باستخدام مُصنِّف خطي بسيط دون أي معالجة مُسبقة. [ 9 ]

في عام 2004، حقق الباحثون معدل خطأ مثاليًا بلغ 0.42 بالمائة على قاعدة البيانات باستخدام مصنف جديد يسمى LIRA، وهو مصنف عصبي بثلاث طبقات عصبية يعتمد على مبادئ بيرسيبترون لروزنبلات . [ 30 ]

استخدمت بعض الدراسات تقنية تضخيم البيانات لزيادة حجم مجموعة بيانات التدريب، وبالتالي تحسين الأداء. عادةً ما تكون الأنظمة المستخدمة في هذه الحالات شبكات عصبية، وتميل التشوهات المستخدمة إلى أن تكون إما تشوهات خطية أو تشوهات مرنة . [ 1 ] في بعض الأحيان، قد تحقق هذه الأنظمة نجاحًا كبيرًا؛ فقد حقق أحد هذه الأنظمة معدل خطأ على قاعدة البيانات بلغ 0.39%. [ 31 ]

في عام 2011، أبلغ باحثون، باستخدام نظام مماثل من الشبكات العصبية، عن معدل خطأ بلغ 0.27%، محققين بذلك تحسناً ملحوظاً عن أفضل نتيجة سابقة. [ 32 ] وفي عام 2013، زُعم أن نهجاً قائماً على تنظيم الشبكات العصبية باستخدام DropConnect قد حقق معدل خطأ بلغ 0.21%. [ 33 ] وفي عام 2016، بلغ أفضل أداء لشبكة عصبية التفافية واحدة معدل خطأ 0.25%. [ 34 ] وحتى أغسطس 2018، بلغ أفضل أداء لشبكة عصبية التفافية واحدة مُدرَّبة على بيانات تدريب MNIST دون أي زيادة في البيانات معدل خطأ 0.25%. [ 34 ] [ 35 ] كما حصل مركز الحوسبة المتوازية (خميلنيتسكي، أوكرانيا) على مجموعة من 5 شبكات عصبية التفافية فقط، حققت أداءً جيداً على MNIST بمعدل خطأ 0.21%. [ 36 ] [ 37 ]

المصنفات

هذا جدول يوضح بعض أساليب التعلم الآلي المستخدمة على مجموعة البيانات ومعدلات الخطأ الخاصة بها، حسب نوع المصنف :

يكتبالمصنفزيادة البياناتالمعالجة المسبقةمعدل الخطأ (%)
المصنف الخطيالمصنف الخطي الثنائيالتحويل الأفينيانحراف7.6 [ 9 ]
أقرب الجيرانخوارزمية أقرب جار مع التحويلات الصلبة؟لا أحد0.96 [ 38 ]
خوارزمية أقرب جار مع التشوه غير الخطي (P2DHMDM)؟حواف قابلة للتحريك0.52 [ 39 ]
جذوع معززةمنتج من جذوع الأشجار في هار؟ميزات هار0.87 [ 40 ]
المصنف غير الخطي40 PCA + مصنف تربيعيالتحويل الأفينيلا أحد3.3 [ 9 ]
الغابة العشوائيةالغابات العشوائية الموحدة السريعة للبقاء والانحدار والتصنيف (RF-SRC) [ 41 ]؟أهمية البكسل الإحصائية البسيطة2.8 [ 42 ]
آلة المتجهات الداعمة (SVM)آلة المتجهات الداعمة الافتراضية ، مضلع من الدرجة 9، مع تشويش بمقدار 2 بكسل؟انحراف0.56 [ 43 ]
الشبكة العصبية متعددة الطبقات (MLP)2-طبقة 784-800-10لا أحدلا أحد1.6 [ 44 ]
2-طبقة 784-800-10التحويل الأفينيلا أحد1.1 [ 44 ]
2-طبقة 784-800-10التشوه المرنلا أحد0.7 [ 44 ]
3 طبقات 784-1000-500-10التشوه المرن والتحويل الأفينيلا أحد0.49 [ 45 ]
6 طبقات 784-2500-2000-1500-1000-500-10التشوه المرن والتحويل الأفينيلا أحد0.35 [ 45 ]
محول الرؤية (ViT)16 طبقة، 4 رؤوس، 4 رقعاتالتحويل الأفينيلا أحد1.06 [ 46 ]
9 طبقات 28 رأس 7 رقعةالتحويل الأفينيلا أحد0.35 [ 47 ]
الشبكة العصبية الالتفافية (CNN)6 طبقات 784-40-80-500-1000-2000-10نعملا أحد0.31 [ 48 ]
6 طبقات 784-50-100-500-1000-10-10نعملا أحد0.27 [ 49 ]
13 طبقة 64-128 (5x)-256 (3x)-512-2048-256-256-10لا أحدلا أحد0.25 [ 34 ]
لجنة 35 قناة سي إن إن، 1-20-P-40-P-150-10التشوه المرنعمليات تطبيع العرض0.23 [ 29 ]
لجنة مكونة من 5 شبكات CNN، 6 طبقات 784-50-100-500-1000-10-10نعملا أحد0.21 [ 36 ] [ 37 ]
لجنة من 20 شبكة عصبية تلافيفية مع شبكات الضغط والإثارة [ 50 ]نعملا أحد0.17 [ 51 ]
مجموعة من 3 شبكات عصبية تلافيفية بأحجام نواة متفاوتةالدوران والانتقاللا أحد0.09 [ 52 ]

انظر أيضاً

مراجع

  1. ١ ٢ ٣ ٤ ٥ ٦ ٧ ليكان، يان؛ كورتيز، كورينا؛ بورجيس، كريستوفر سي جيه. "قاعدة بيانات الأرقام المكتوبة بخط اليد MNIST" . موقع يان ليكان الإلكتروني yann.lecun.com . مؤرشف من الأصل بتاريخ ٣٠ أبريل ٢٠٢٠.
  2. "آلات المتجهات الداعمة تُسرّع عملية التعرف على الأنماط - تصميم أنظمة الرؤية" . تصميم أنظمة الرؤية . سبتمبر 2004. تم الاطلاع عليه بتاريخ 17 أغسطس 2013 .
  3. جانجابوترا، ساشين. "قاعدة بيانات الأرقام المكتوبة بخط اليد" . تم الاسترجاع 17 أغسطس 2013 .
  4. تشياو، يو (2007). "قاعدة بيانات MNIST للأرقام المكتوبة بخط اليد" . تم الاطلاع عليه بتاريخ 18 أغسطس 2013 .
  5. بلات، جون سي. (1999). "استخدام البرمجة التربيعية التحليلية والتباعد لتسريع تدريب آلات المتجهات الداعمة" (ملف PDF) . التطورات في أنظمة معالجة المعلومات العصبية : 557-563 . مؤرشف من الأصل (ملف PDF) في 4 مارس 2016. تم الاطلاع عليه في 18 أغسطس 2013 .
  6. 1 2 3 غروثر، باتريك ج. "قاعدة بيانات NIST الخاصة 19 - قاعدة بيانات الأشكال والأحرف المكتوبة بخط اليد" (ملف PDF) . المعهد الوطني للمعايير والتكنولوجيا .
  7. كوسول، إرنست؛ بايديك، تاتيانا (2004). "طريقة محسّنة للتعرف على الأرقام المكتوبة بخط اليد تم اختبارها على قاعدة بيانات MNIST". معالجة الصور والرؤية الحاسوبية . 22 (12): 971-981 . doi : 10.1016/j.imavis.2004.03.008 .
  8. تشانغ، بين؛ سري هاري، سارجور ن. (2004). "تصنيف سريع لأقرب k جار باستخدام الأشجار القائمة على التجميع" ( ملف PDF) . معاملات IEEE في تحليل الأنماط والذكاء الآلي . 26 (4): 525-528 . Bibcode : 2004ITPAM..26..525Z . doi : 10.1109/TPAMI.2004.1265868 . PMID 15382657. S2CID 6883417. تاريخ الاسترجاع: 20 أبريل 2020 .  
  9. 1 2 3 4 لوكون، يان؛ ليون بوتو؛ يوشوا بنجيو؛ باتريك هافنر (1998). "التعلم القائم على التدرج المطبق على التعرف على المستندات" (ملف PDF) . وقائع معهد مهندسي الكهرباء والإلكترونيات . 86 (11): 2278-2324 . رمز Bibcode : 1998IEEEP..86.2278L . doi : 10.1109/5.726791 . S2CID 14542261. مؤرشف من الأصل (ملف PDF) في 30 نوفمبر 2016. تم الاسترجاع في 18 أغسطس 2013 . 
  10. مولر، نيكولاس م.؛ ماركرت، كارلا (يوليو 2019). تحديد الحالات المصنفة بشكل خاطئ في مجموعات بيانات التصنيف . المؤتمر الدولي المشترك للشبكات العصبية 2019 (IJCNN). معهد مهندسي الكهرباء والإلكترونيات. الصفحات 1-8 . arXiv : 1912.05283 . doi : 10.1109/IJCNN.2019.8851920 . ISBN  978-1-7281-1985-4.
  11. دينكر، جون؛ غاردنر، دبليو؛ غراف، هانز؛ هندرسون، دوني؛ هوارد، آر؛ هوبارد، دبليو؛ جاكيل، إل دي؛ بيرد، هنري؛ غايون، إيزابيل (1988). "مُعرِّف الشبكة العصبية لأرقام الرموز البريدية المكتوبة بخط اليد" . التطورات في أنظمة معالجة المعلومات العصبية . 1. مورغان كوفمان.
  12. لوكون، ي.؛ بوسر، ب.؛ دينكر، ج. س.؛ هندرسون، د.؛ هوارد، ر. إ.؛ هوبارد، و.؛ جاكيل، ل. د. (ديسمبر 1989). "تطبيق خوارزمية الانتشار العكسي على التعرف على الرموز البريدية المكتوبة بخط اليد". الحوسبة العصبية . 1 (4): 541-551 . doi : 10.1162/neco.1989.1.4.541 . ISSN 0899-7667 . S2CID 41312633 .  
  13. 1 2 3 سيمارد، باتريس؛ ليكان، يان؛ دينكر، جون (1992). "التعرف الفعال على الأنماط باستخدام مسافة تحويل جديدة" . التقدم في أنظمة معالجة المعلومات العصبية . 5. مورغان كوفمان.
  14. 1 2 3 4 5 6 7 ويلكنسون، آر. ألين؛ جيست، جون؛ جانيت، ستانلي؛ جروثر، باتريك جيه؛ بورجيس، كريستوفر جيه سي؛ كريسي، روبرت؛ هاموند، بوب؛ هول، جوناثان جيه؛ لارسن، نورمان إل (1992). المؤتمر الأول لنظام التعرف الضوئي على الأحرف في التعداد السكاني. تقرير داخلي/مشترك بين الوكالات للمعهد الوطني للمعايير والتكنولوجيا (NISTIR) - 4912 (PDF) (تقرير). غايثرسبيرغ، ماريلاند: المعهد الوطني للمعايير والتكنولوجيا. doi : 10.6028/nist.ir.4912 .
  15. سي إل ويلسون وإم دي جاريس. قاعدة بيانات الأحرف المطبوعة يدويًا. التقرير الفني الخاص بقاعدة البيانات 1، HWDB، المعهد الوطني للمعايير والتكنولوجيا، أبريل 1990.
  16. إم دي جاريس و آر إيه ويلكنسون. قاعدة بيانات الأحرف المجزأة المكتوبة بخط اليد. التقرير الفني الخاص بقاعدة البيانات 3، HWSC، المعهد الوطني للمعايير والتكنولوجيا، فبراير 1992.
  17. آر إيه ويلكنسون. قاعدة بيانات الأحرف المجزأة المكتوبة بخط اليد. التقرير الفني لقاعدة بيانات الاختبار 1، TST1، المعهد الوطني للمعايير والتكنولوجيا، أبريل 1992.
  18. سميث، إس جيه؛ بورغوين، إم أو؛ سيمز، كيه؛ فوريس، إتش إل (سبتمبر 1994). "تصنيف الأحرف المكتوبة بخط اليد باستخدام أقرب جار في قواعد البيانات الكبيرة". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 16 (9): 915-919 . Bibcode : 1994ITPAM..16..915S . doi : 10.1109/34.310689 .
  19. غروثر، باتريك ج. (1993-01-01). "مقارنة التحقق المتبادل لقواعد بيانات التعرف الضوئي على الأحرف التابعة للمعهد الوطني للمعايير والتكنولوجيا" . المعهد الوطني للمعايير والتكنولوجيا . 1906 : 296. Bibcode : 1993SPIE.1906..296G . doi : 10.1117/12.143632 .
  20. 1 2 بوتو، ليون؛ كورتيس، كورينا؛ دينكر، جون س.؛ دروكر، هاريس؛ غويون، إيزابيل؛ جاكيل، إل دي؛ ليكان، واي.؛ مولر، يو إيه؛ ساكينجر، إي.؛ سيمارد، بي.؛ فابنيك، في. (1994). "مقارنة أساليب التصنيف: دراسة حالة في التعرف على الأرقام المكتوبة بخط اليد". وقائع المؤتمر الدولي الثاني عشر للجمعية الدولية للتعرف على الأنماط (رقم التصنيف 94CH3440-5) . المجلد 2. القدس، إسرائيل. الصفحات 77-82 . doi : 10.1109/ICPR.1994.576879 . ISBN   0-8186-6270-0.{{cite book}}: CS1 maint: موقع الناشر مفقود ( رابط )
  21. 1 2 3 ياداف، تشافي؛ بوتو، ليون (2019). "قضية لم تُحل: أرقام MNIST المفقودة" . التقدم في أنظمة معالجة المعلومات العصبية . 32. arXiv : 1905.10498 . تتضمن المقالة تاريخًا مفصلاً وإعادة بناء لمجموعة الاختبار المستبعدة.
  22. ديكوست، دينيس؛ شولكوف، برنارد (2002). "تدريب آلات المتجهات الداعمة الثابتة" . تعلم الآلة . 46 (1/3): 161-190 . doi : 10.1023/A:1012454411458 .
  23. facebookresearch/qmnist ، ميتا ريسيرش، 23 سبتمبر 2024 ، تاريخ الاطلاع 25 أكتوبر 2024
  24. كوهين، ج.؛ أفشار، س.؛ تابسون، ج.؛ فان شايك، أ. (2017). "EMNIST: امتداد لـ MNIST للأحرف المكتوبة بخط اليد". arXiv : 1702.05373 [ cs.CV ].
  25. المعهد الوطني للمعايير والتكنولوجيا (4 أبريل 2017). "مجموعة بيانات EMNIST" . المعهد الوطني للمعايير والتكنولوجيا . تم الاطلاع عليه بتاريخ 11 أبريل 2022 .
  26. المعهد الوطني للمعايير والتكنولوجيا (27 أغسطس 2010). "قاعدة بيانات المعهد الوطني للمعايير والتكنولوجيا الخاصة 19" . المعهد الوطني للمعايير والتكنولوجيا . تم الاطلاع عليه بتاريخ 11 أبريل 2022 .
  27. غروثر، باتريك جيه، وكيه كيه هانوكا. " قاعدة بيانات خاصة من المعهد الوطني للمعايير والتكنولوجيا 19 ". قاعدة بيانات الأشكال والأحرف المكتوبة بخط اليد، المعهد الوطني للمعايير والتكنولوجيا 10 (1995): 69.
  28. شياو، هان؛ رسول، كاشف؛ فولغراف، رولاند (2017-09-15). "Fashion-MNIST: مجموعة بيانات صور جديدة لتقييم خوارزميات التعلم الآلي". arXiv : 1708.07747 [ cs.LG ].
  29. 1 2 سيريسان، دان؛ أولي ماير؛ يورغن شميدهوبر (2012). "شبكات عصبية عميقة متعددة الأعمدة لتصنيف الصور" (ملف PDF) . مؤتمر IEEE لعام 2012 حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 3642-3649 . arXiv : 1202.2745 . CiteSeerX 10.1.1.300.3283 . doi : 10.1109/CVPR.2012.6248110 . ISBN   978-1-4673-1228-8. S2CID 2161592 . 
  30. كوسول، إرنست؛ تاتيانا بايديك (2004). "طريقة محسّنة للتعرف على الأرقام المكتوبة بخط اليد، تم اختبارها على قاعدة بيانات MNIST" (ملف PDF) . معالجة الصور والرؤية الحاسوبية . 22 (12): 971-981 . doi : 10.1016/j.imavis.2004.03.008 . مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 21 سبتمبر 2013. تم الاطلاع عليه بتاريخ 20 سبتمبر 2013 .
  31. رانزاتو، مارك أوريليو؛ كريستوفر بولتني؛ سوميت تشوبرا؛ يان ليكان (2006). "التعلم الفعال للتمثيلات المتفرقة باستخدام نموذج قائم على الطاقة" (ملف PDF) . التطورات في أنظمة معالجة المعلومات العصبية . 19 : 1137-1144 . مؤرشف من الأصل (ملف PDF) في 22 مارس 2016. تم الاسترجاع في 20 سبتمبر 2013 .
  32. سيريسان، دان كلاوديو؛ أولي ماير؛ لوكا ماريا غامبارديلا؛ يورغن شميدهوبر (2011). "لجان الشبكات العصبية الالتفافية لتصنيف الأحرف المكتوبة بخط اليد" (ملف PDF) . المؤتمر الدولي لتحليل المستندات والتعرف عليها (ICDAR) لعام 2011. الصفحات 1135-1139 . CiteSeerX 10.1.1.465.2138 . doi : 10.1109/ICDAR.2011.229 . ISBN   978-1-4577-1350-7S2CID 10122297. مؤرشف من الأصل (PDF) بتاريخ 22 فبراير 2016. تم الاطلاع عليه بتاريخ 20 سبتمبر 2013 . 
  33. وان، لي؛ ماثيو زيلر؛ سيكسين تشانغ؛ يان ليكان؛ روب فيرغوس (2013). تنظيم الشبكة العصبية باستخدام DropConnect . المؤتمر الدولي للتعلم الآلي (ICML).
  34. 1 2 3 SimpleNet (2016). "لنُبقِ الأمور بسيطة: استخدام بنى بسيطة للتفوق على البنى الأكثر تعقيدًا وعمقًا" . arXiv : 1608.06037 . تاريخ الاسترجاع: 3 ديسمبر 2020 .
  35. سيمب نت (2018). "نحو تصميم مبدئي للشبكات العصبية التلافيفية العميقة: تقديم سيمب نت" . جيت هاب . arXiv : 1802.06205 . تم الاطلاع عليه في 3 ديسمبر 2020 .
  36. 1 2 رومانوك، فاديم. "يمثل مركز الحوسبة المتوازية (خميلنيتسكي، أوكرانيا) مجموعة من 5 شبكات عصبية التفافية تعمل على مجموعة بيانات MNIST بمعدل خطأ 0.21%" . تم الاطلاع عليه بتاريخ 24 نوفمبر 2016 .
  37. 1 2 رومانوك، فاديم (2016). "توسيع بيانات التدريب وتعزيز الشبكات العصبية الالتفافية لتقليل معدل الخطأ في مجموعة بيانات MNIST" . نشرة بحثية لمعهد كييف للفنون التطبيقية التابع لجامعة كييف التقنية الوطنية . 6 (6): 29-34 . doi : 10.20535/1810-0546.2016.6.84115 .
  38. ليندبلاد، يواكيم؛ ناتاشا سلادوي (يناير 2014). "المسافات الزمنية الخطية بين المجموعات الضبابية مع تطبيقات في مطابقة الأنماط والتصنيف". معاملات IEEE في معالجة الصور . 23 (1): 126-136 . Bibcode : 2014ITIP...23..126L . doi : 10.1109/TIP.2013.2286904 . PMID 24158476. S2CID 1908950 .  
  39. كيزرز، دانيال؛ توماس ديسيليرز؛ كريستيان غولان؛ هيرمان ناي (أغسطس 2007). "نماذج التشوه للتعرف على الصور". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 29 (8): 1422-1435 . Bibcode : 2007ITPAM..29.1422K . CiteSeerX 10.1.1.106.3963 . doi : 10.1109/TPAMI.2007.1153 . PMID 17568145. S2CID 2528485 .   
  40. كيغل، بالاز؛ روبرت بوسا-فيكيتي (2009). "تعزيز نواتج المصنفات الأساسية" (ملف PDF) . وقائع المؤتمر الدولي السنوي السادس والعشرين للتعلم الآلي . الصفحات 497-504 . doi : 10.1145/1553374.1553439 . ISBN  9781605585161. S2CID 8460779 . تم الاسترجاع في 27 أغسطس 2013 . 
  41. "RandomForestSRC: غابات عشوائية موحدة سريعة للبقاء والانحدار والتصنيف (RF-SRC)" . 21 يناير 2020.
  42. "مهراد محموديان / MNIST مع RandomForest" .
  43. ديكوست، دينيس؛ شولكوف، برنارد (2002). "تدريب آلات المتجهات الداعمة الثابتة" . تعلم الآلة . 46 ( 1-3 ): 161-190 . doi : 10.1023/A:1012454411458 . ISSN 0885-6125 . OCLC 703649027 .  
  44. 1 2 3 باتريس واي. سيمارد؛ ديف شتاينكراوس؛ جون سي. بلات (2003). "أفضل الممارسات للشبكات العصبية الالتفافية المطبقة على تحليل المستندات المرئية" . وقائع المؤتمر الدولي السابع لتحليل المستندات والتعرف عليها . المجلد 1. معهد مهندسي الكهرباء والإلكترونيات . ص 958. doi : 10.1109/ICDAR.2003.1227801 . ISBN   978-0-7695-1960-9. S2CID 4659176 . 
  45. 1 2 سيريسان، كلاوديو دان؛ أولي ماير؛ لوكا ماريا غامبارديلا؛ يورغن شميدهوبر (ديسمبر 2010). "شبكات عصبية عميقة كبيرة وبسيطة تتفوق في التعرف على الأرقام المكتوبة بخط اليد". الحوسبة العصبية . 22 (12): 3207-20 . arXiv : 1003.0358 . doi : 10.1162/NECO_a_00052 . PMID 20858131. S2CID 1918673 .  
  46. "المحول المرئي ومجموعة بيانات MNIST" . itp.uni-frankfurt.de . تم الاطلاع عليه بتاريخ 17 يوليو 2026 .
  47. "GitHub - asnelt/mnistvit: تطبيق PyTorch لمحول الرؤية للتدريب على مجموعة بيانات MNIST" . جيت هاب . تم الاطلاع عليه بتاريخ 17 يوليو 2026 .
  48. رومانوك، فاديم. "أفضل أداء لشبكة عصبية التفافية واحدة في 18 دورة تدريبية على بيانات التدريب الموسعة في مركز الحوسبة المتوازية، خميلنيتسكي، أوكرانيا" . تم الاطلاع عليه بتاريخ 16 نوفمبر 2016 .
  49. رومانوك، فاديم. "مركز الحوسبة المتوازية (خميلنيتسكي، أوكرانيا) يقدم شبكة عصبية التفافية واحدة تعمل على مجموعة بيانات MNIST بمعدل خطأ 0.27%" . تم الاطلاع عليه بتاريخ 24 نوفمبر 2016 .
  50. هو، جي؛ شين، لي؛ ألباني، صموئيل؛ صن، غانغ؛ وو، إنهوا (2019). " شبكات الضغط والإثارة". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 42 (8): 2011-2023 . arXiv : 1709.01507 . doi : 10.1109/TPAMI.2019.2913372 . PMID 31034408. S2CID 140309863 .  
  51. "GitHub - Matuzas77/MNIST-0.17: مصنف MNIST بمتوسط ​​خطأ 0.17%" . GitHub . 25 فبراير 2020.
  52. آن، سانغ هيون؛ لي، مين جون؛ بارك، سانغلي؛ يانغ، هيرين؛ سو، جونغ مين (2020-10-04). "مجموعة من نماذج الشبكات العصبية الالتفافية البسيطة للتعرف على الأرقام في مجموعة بيانات MNIST". arXiv : 2008.10400 [ cs.CV ].

للمزيد من القراءة