VGGNet

مقارنة بنية وحدة VGG ببنية AlexNet

تُعد شبكات VGGNets سلسلة من الشبكات العصبية الالتفافية (CNNs) التي طورتها مجموعة الهندسة البصرية (VGG) في جامعة أكسفورد .

تتضمن عائلة VGG تكوينات متنوعة بأعماق مختلفة، ويُرمز إليها بالحرف "VGG" متبوعًا بعدد طبقات الوزن. وأكثرها شيوعًا VGG-16 (13 طبقة التفافية + 3 طبقات متصلة بالكامل، 138 مليون مُعامل ) وVGG-19 (16 + 3، 144 مليون مُعامل). [ 1 ]

استُخدمت عائلة VGG على نطاق واسع في مجالات رؤية الحاسوب المختلفة. [ 2 ] حقق نموذج مُجمّع من شبكات VGG نتائج متقدمة في تحدي ImageNet للتعرف البصري واسع النطاق (ILSVRC) عام 2014. [ 1 ] [ 3 ] استُخدم هذا النموذج كمعيار للمقارنة في ورقة ResNet لتصنيف الصور ، [ 4 ] وكشبكة في شبكة CNN السريعة القائمة على المناطق للكشف عن الكائنات ، وكشبكة أساسية في نقل الأنماط العصبية . [ 5 ]

كانت هذه السلسلة ذات أهمية تاريخية باعتبارها نموذجًا مبكرًا مؤثرًا صُمم من خلال تجميع وحدات نمطية عامة، بينما صُممت شبكة AlexNet (2012) من الصفر. كما كان لها دورٌ أساسي في تغيير حجم نواة الالتفاف القياسية في الشبكات العصبية الالتفافية من حجم كبير (يصل إلى 11×11 في AlexNet) إلى 3×3 فقط، وهو قرار لم يُراجع إلا في ConvNext (2022). [ 6 ] [ 7 ]

أصبحت شبكات VGGNets قديمة الطراز بعد ظهور شبكات Inception و ResNet و DenseNet . وتُعدّ RepVGG (2021) نسخة محدّثة من هذه البنية. [ 8 ]

بنيان

مقارنة بين بنية الشبكة داخل الشبكة وبنية VGG. كانت بنية الشبكة داخل الشبكة (2013) [ 9 ] نموذجًا سابقًا لشبكات CNN. وقد عدّلت بنية AlexNet بإضافة طبقات التفاف 1x1، واستخدام تجميع متوسط ​​عالمي بعد طبقة الالتفاف الأخيرة.

المبدأ المعماري الأساسي لنماذج VGG هو الاستخدام المتسق للعناصر الصغيرة3×3{\displaystyle 3\times 3}تستخدم الشبكة مرشحات التفافية في جميع أنحائها. وهذا يتناقض مع بنى الشبكات العصبية الالتفافية السابقة التي كانت تستخدم مرشحات أكبر، مثل11×11{\displaystyle 11\times 11}في شبكة أليكس نت. [ 7 ]

على سبيل المثال، اثنان3×3{\textstyle 3\times 3}تتمتع الالتفافات المكدسة معًا بنفس وحدات البكسل في مجال الاستقبال التي تتمتع بها وحدة واحدة5×5{\textstyle 5\times 5}الالتفاف، لكن الأخير يستخدم(25ج2){\textstyle \left(25\cdot c^{2}\right)}بينما يستخدم الأول المعلمات(18ج2){\textstyle \left(18\cdot c^{2}\right)}المعلمات (حيثج{\displaystyle c}(عدد القنوات). أظهرت الدراسة الأصلية أن الشبكات العصبية التلافيفية العميقة والضيقة تتفوق بشكل ملحوظ على نظيراتها الضحلة والواسعة. [ 7 ]

تُعد سلسلة نماذج VGG شبكات عصبية عميقة تتكون من وحدات نمطية عامة:

  1. الوحدات الالتفافية :3×3{\displaystyle 3\times 3}طبقات التفافية بخطوة 1، متبوعة بتنشيطات ReLU.
  2. طبقات التجميع الأقصى : بعد بعض وحدات الالتفاف، تأتي طبقات التجميع الأقصى مع2×2{\displaystyle 2\times 2}يتم تطبيق مرشح وخطوة مقدارها 2 لتقليل دقة خرائط الميزات. يؤدي ذلك إلى تقليل كل من العرض والارتفاع إلى النصف، مع الحفاظ على عدد القنوات.
  3. الطبقات المتصلة بالكامل : ثلاث طبقات متصلة بالكامل في نهاية الشبكة، بأحجام 4096-4096-1000. تحتوي الطبقة الأخيرة على 1000 قناة تتوافق مع 1000 فئة في ImageNet.
  4. طبقة سوفتماكس : تقوم طبقة سوفتماكس بإخراج توزيع الاحتمالات على الفئات.

تتضمن عائلة VGG تكوينات متنوعة بأعماق مختلفة، يُرمز إليها بالحرف "VGG" متبوعًا بعدد طبقات الوزن. وأكثرها شيوعًا هما VGG-16 (13 طبقة التفافية + 3 طبقات متصلة بالكامل) وVGG-19 (16 + 3)، ويُشار إليهما بالتكوينين D و E في الورقة الأصلية. [ 10 ]

على سبيل المثال، تتكون طبقات الالتفاف الـ 16 في VGG-19 من العناصر التالية:36464تقليل معدل العينة64128128تقليل معدل العينة128256256256256تقليل معدل العينة256512512512512تقليل معدل العينة512512512512512تقليل معدل العينة{\displaystyle {\begin{aligned}&3\to 64\to 64&\xrightarrow {\text{downsample}} \\&64\to 128\to 128&\xrightarrow {\text{downsample}} \\&128\to 256\to 256\to 256\to 256&\xrightarrow {\text{downsample}} \\&256\to 512\to 512\to 512\to 512&\xrightarrow {\text{downsample}} \\&512\to 512\to 512\to 512\to 512&\xrightarrow {\text{downsample}} \end{aligned}}}حيث السهمج1ج2{\displaystyle c_{1}\to c_{2}}يعني ذلك عملية التفاف 3×3 معج1{\displaystyle c_{1}}قنوات الإدخال وج2{\displaystyle c_{2}}قنوات الإخراج والخطوة 1، متبوعة بتنشيط ReLU.تقليل معدل العينة{\displaystyle \xrightarrow {\text{downsample}} }يعني ذلك طبقة تقليل حجم العينة عن طريق التجميع الأقصى 2x2 مع خطوة 2.

جدول نماذج VGG
اسمعدد الطبقات الالتفافيةعدد الطبقات المتصلة بالكاملعدد المعلمات
VGG-16133138 مليون
VGG-19163144 مليون

تمرين

تم تنفيذ نماذج VGG الأصلية باستخدام نسخة من C++ Caffe ، مُعدّلة للتدريب والتقييم على وحدات معالجة رسومية متعددة مع توازي البيانات . على نظام مُجهز بأربع وحدات معالجة رسومية NVIDIA Titan Black ، استغرق تدريب شبكة واحدة من أسبوعين إلى ثلاثة أسابيع، وذلك حسب بنية النظام. [ 1 ]

مراجع

  1. 1 2 3 سيمونيان، كارين؛ زيسرمان، أندرو (2015-04-10)، شبكات الالتفاف العميقة جدًا للتعرف على الصور واسعة النطاق ، arXiv : 1409.1556
  2. ديلون، أناميكا؛ فيرما، جيانيندرا ك. (2020-06-01). "الشبكة العصبية الالتفافية: مراجعة للنماذج والمنهجيات والتطبيقات في الكشف عن الأجسام" . التقدم في الذكاء الاصطناعي . 9 (2): 85-112 . doi : 10.1007/s13748-019-00203-0 . ISSN 2192-6360 . 
  3. "نتائج مؤتمر ILSVRC2014" . image-net.org . تم الاطلاع عليه بتاريخ 2024-09-06 .
  4. هي، كايمينغ؛ تشانغ، شيانغيو؛ رين، شاوكينغ؛ صن، جيان (2016). "التعلم العميق المتبقي للتعرف على الصور" . مؤتمر IEEE لعام 2016 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 770-778 . arXiv : 1512.03385 . Bibcode : 2016cvpr.confE...1H . doi : 10.1109/CVPR.2016.90 . ISBN  978-1-4673-8851-1.
  5. جاتيس، ليون أ.؛ إيكر، ألكسندر س.؛ بيثج، ماتياس (2016). نقل أنماط الصور باستخدام الشبكات العصبية الالتفافية . مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط (CVPR). الصفحات 2414-2423 . 
  6. ليو، تشوانغ؛ ماو، هانزي؛ وو، تشاو يوان؛ فايشتنهوفر، كريستوف؛ داريل، تريفور؛ شي، ساينينغ (2022). "شبكة عصبية التفافية لعقد 2020" . مؤتمر IEEE/CVF لعام 2022 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 11976-11986 . arXiv : 2201.03545 . doi : 10.1109/CVPR52688.2022.01167 . ISBN  978-1-6654-6946-3.
  7. 1 2 3 تشانغ، أستون؛ ليبتون، زاكاري؛ لي، مو؛ سمولا، ألكسندر ج. (2024). "8.2. الشبكات باستخدام الكتل (VGG)" . تعمق في التعلم العميق . كامبريدج، نيويورك، بورت ملبورن، نيودلهي، سنغافورة: مطبعة جامعة كامبريدج. ISBN 978-1-009-38943-3.
  8. دينغ، شياوهان؛ تشانغ، شيانغيو؛ ما، نينغنينغ؛ هان، جونغونغ؛ دينغ، غويغوانغ؛ صن، جيان (2021). "RepVGG: إعادة إحياء شبكات VGG-style ConvNets" . مؤتمر IEEE/CVF لعام 2021 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . الصفحات 13733-13742 . arXiv : 2101.03697 . doi : 10.1109/CVPR46437.2021.01352 . ISBN  978-1-6654-4509-2.
  9. ^ لين، مين؛ تشن، تشيانغ. يان، شويتشنغ (2013). "الشبكة في الشبكة". أرخايف : 1312.4400 [ cs.NE ].
  10. "شبكات الالتفاف العميق جدًا للتعرف البصري واسع النطاق" . مجموعة رؤية الحاسوب بجامعة أكسفورد . تم الاطلاع عليه بتاريخ 6 سبتمبر 2024 .