VGGNet

تُعد شبكات VGGNets سلسلة من الشبكات العصبية الالتفافية (CNNs) التي طورتها مجموعة الهندسة البصرية (VGG) في جامعة أكسفورد .
تتضمن عائلة VGG تكوينات متنوعة بأعماق مختلفة، ويُرمز إليها بالحرف "VGG" متبوعًا بعدد طبقات الوزن. وأكثرها شيوعًا VGG-16 (13 طبقة التفافية + 3 طبقات متصلة بالكامل، 138 مليون مُعامل ) وVGG-19 (16 + 3، 144 مليون مُعامل). [ 1 ]
استُخدمت عائلة VGG على نطاق واسع في مجالات رؤية الحاسوب المختلفة. [ 2 ] حقق نموذج مُجمّع من شبكات VGG نتائج متقدمة في تحدي ImageNet للتعرف البصري واسع النطاق (ILSVRC) عام 2014. [ 1 ] [ 3 ] استُخدم هذا النموذج كمعيار للمقارنة في ورقة ResNet لتصنيف الصور ، [ 4 ] وكشبكة في شبكة CNN السريعة القائمة على المناطق للكشف عن الكائنات ، وكشبكة أساسية في نقل الأنماط العصبية . [ 5 ]
كانت هذه السلسلة ذات أهمية تاريخية باعتبارها نموذجًا مبكرًا مؤثرًا صُمم من خلال تجميع وحدات نمطية عامة، بينما صُممت شبكة AlexNet (2012) من الصفر. كما كان لها دورٌ أساسي في تغيير حجم نواة الالتفاف القياسية في الشبكات العصبية الالتفافية من حجم كبير (يصل إلى 11×11 في AlexNet) إلى 3×3 فقط، وهو قرار لم يُراجع إلا في ConvNext (2022). [ 6 ] [ 7 ]
أصبحت شبكات VGGNets قديمة الطراز بعد ظهور شبكات Inception و ResNet و DenseNet . وتُعدّ RepVGG (2021) نسخة محدّثة من هذه البنية. [ 8 ]
بنيان

المبدأ المعماري الأساسي لنماذج VGG هو الاستخدام المتسق للعناصر الصغيرةتستخدم الشبكة مرشحات التفافية في جميع أنحائها. وهذا يتناقض مع بنى الشبكات العصبية الالتفافية السابقة التي كانت تستخدم مرشحات أكبر، مثلفي شبكة أليكس نت. [ 7 ]
على سبيل المثال، اثنانتتمتع الالتفافات المكدسة معًا بنفس وحدات البكسل في مجال الاستقبال التي تتمتع بها وحدة واحدةالالتفاف، لكن الأخير يستخدمبينما يستخدم الأول المعلماتالمعلمات (حيث(عدد القنوات). أظهرت الدراسة الأصلية أن الشبكات العصبية التلافيفية العميقة والضيقة تتفوق بشكل ملحوظ على نظيراتها الضحلة والواسعة. [ 7 ]
تُعد سلسلة نماذج VGG شبكات عصبية عميقة تتكون من وحدات نمطية عامة:
- الوحدات الالتفافية :طبقات التفافية بخطوة 1، متبوعة بتنشيطات ReLU.
- طبقات التجميع الأقصى : بعد بعض وحدات الالتفاف، تأتي طبقات التجميع الأقصى معيتم تطبيق مرشح وخطوة مقدارها 2 لتقليل دقة خرائط الميزات. يؤدي ذلك إلى تقليل كل من العرض والارتفاع إلى النصف، مع الحفاظ على عدد القنوات.
- الطبقات المتصلة بالكامل : ثلاث طبقات متصلة بالكامل في نهاية الشبكة، بأحجام 4096-4096-1000. تحتوي الطبقة الأخيرة على 1000 قناة تتوافق مع 1000 فئة في ImageNet.
- طبقة سوفتماكس : تقوم طبقة سوفتماكس بإخراج توزيع الاحتمالات على الفئات.
تتضمن عائلة VGG تكوينات متنوعة بأعماق مختلفة، يُرمز إليها بالحرف "VGG" متبوعًا بعدد طبقات الوزن. وأكثرها شيوعًا هما VGG-16 (13 طبقة التفافية + 3 طبقات متصلة بالكامل) وVGG-19 (16 + 3)، ويُشار إليهما بالتكوينين D و E في الورقة الأصلية. [ 10 ]
على سبيل المثال، تتكون طبقات الالتفاف الـ 16 في VGG-19 من العناصر التالية:حيث السهميعني ذلك عملية التفاف 3×3 معقنوات الإدخال وقنوات الإخراج والخطوة 1، متبوعة بتنشيط ReLU.يعني ذلك طبقة تقليل حجم العينة عن طريق التجميع الأقصى 2x2 مع خطوة 2.
| اسم | عدد الطبقات الالتفافية | عدد الطبقات المتصلة بالكامل | عدد المعلمات |
|---|---|---|---|
| VGG-16 | 13 | 3 | 138 مليون |
| VGG-19 | 16 | 3 | 144 مليون |
تمرين
تم تنفيذ نماذج VGG الأصلية باستخدام نسخة من C++ Caffe ، مُعدّلة للتدريب والتقييم على وحدات معالجة رسومية متعددة مع توازي البيانات . على نظام مُجهز بأربع وحدات معالجة رسومية NVIDIA Titan Black ، استغرق تدريب شبكة واحدة من أسبوعين إلى ثلاثة أسابيع، وذلك حسب بنية النظام. [ 1 ]
مراجع
- 1 2 3 سيمونيان، كارين؛ زيسرمان، أندرو (2015-04-10)، شبكات الالتفاف العميقة جدًا للتعرف على الصور واسعة النطاق ، arXiv : 1409.1556
- ↑ ديلون، أناميكا؛ فيرما، جيانيندرا ك. (2020-06-01). "الشبكة العصبية الالتفافية: مراجعة للنماذج والمنهجيات والتطبيقات في الكشف عن الأجسام" . التقدم في الذكاء الاصطناعي . 9 (2): 85-112 . doi : 10.1007/s13748-019-00203-0 . ISSN 2192-6360 .
- ↑ "نتائج مؤتمر ILSVRC2014" . image-net.org . تم الاطلاع عليه بتاريخ 2024-09-06 .
- ↑ هي، كايمينغ؛ تشانغ، شيانغيو؛ رين، شاوكينغ؛ صن، جيان (2016). "التعلم العميق المتبقي للتعرف على الصور" . مؤتمر IEEE لعام 2016 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 770-778 . arXiv : 1512.03385 . Bibcode : 2016cvpr.confE...1H . doi : 10.1109/CVPR.2016.90 . ISBN 978-1-4673-8851-1.
- ↑ جاتيس، ليون أ.؛ إيكر، ألكسندر س.؛ بيثج، ماتياس (2016). نقل أنماط الصور باستخدام الشبكات العصبية الالتفافية . مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط (CVPR). الصفحات 2414-2423 .
- ↑ ليو، تشوانغ؛ ماو، هانزي؛ وو، تشاو يوان؛ فايشتنهوفر، كريستوف؛ داريل، تريفور؛ شي، ساينينغ (2022). "شبكة عصبية التفافية لعقد 2020" . مؤتمر IEEE/CVF لعام 2022 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 11976-11986 . arXiv : 2201.03545 . doi : 10.1109/CVPR52688.2022.01167 . ISBN 978-1-6654-6946-3.
- 1 2 3 تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "8.2. الشبكات باستخدام الكتل (VGG)" . تعمق في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
- ↑ دينغ، شياوهان؛ تشانغ، شيانغيو؛ ما، نينغنينغ؛ هان، جونغونغ؛ دينغ، غويغوانغ؛ صن، جيان (2021). "RepVGG: إعادة إحياء شبكات VGG-style ConvNets" . مؤتمر IEEE/CVF لعام 2021 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 13733-13742 . arXiv : 2101.03697 . doi : 10.1109/CVPR46437.2021.01352 . ISBN 978-1-6654-4509-2.
- ^ لين، مين؛ تشن، تشيانغ. يان، شويتشنغ (2013). "الشبكة في الشبكة". أرخايف : 1312.4400 [ cs.NE ].
- ↑ "شبكات الالتفاف العميق جدًا للتعرف البصري واسع النطاق" . مجموعة رؤية الحاسوب بجامعة أكسفورد . تم الاطلاع عليه بتاريخ 6 سبتمبر 2024 .
- برامج التعلم العميق
- التعرف على الأشياء وتصنيفها
- بنى الشبكات العصبية
