اكتشاف الأجسام

تم اكتشاف الكائنات باستخدام وحدة الشبكة العصبية العميقة (dnn) في مكتبة OpenCV، وذلك باستخدام نموذج YOLOv3 المدرب على مجموعة بيانات COCO، والقادر على اكتشاف كائنات من 80 فئة شائعة.

يُعدّ اكتشاف الأجسام تقنية حاسوبية مرتبطة برؤية الحاسوب ومعالجة الصور ، وتختصّ باكتشاف الأجسام الدلالية من فئة معينة (مثل البشر، والمباني، والسيارات) في الصور والفيديوهات الرقمية. [ 1 ] تشمل المجالات البحثية الواسعة لاكتشاف الأجسام اكتشاف الوجوه واكتشاف المشاة . ولاكتشاف الأجسام تطبيقات في العديد من مجالات رؤية الحاسوب، بما في ذلك استرجاع الصور والمراقبة بالفيديو .

الاستخدامات

يُستخدم على نطاق واسع في مهام رؤية الحاسوب ، مثل تصنيف الصور ، [ 2 ] وعدّ المركبات، [ 3 ] والتعرف على الأنشطة ، [ 4 ] واكتشاف الوجوه ، والتعرف على الوجوه ، وتقسيم الفيديو إلى أجزاء . كما يُستخدم في تتبع الأجسام ، على سبيل المثال تتبع الكرة أثناء مباراة كرة القدم، أو تتبع حركة مضرب الكريكيت، أو تتبع شخص في مقطع فيديو.

غالبًا ما تُؤخذ صور الاختبار من توزيع بيانات مختلف، مما يجعل مهمة اكتشاف الأجسام أكثر صعوبة. [ 5 ] ولمعالجة التحديات الناجمة عن فجوة المجال بين بيانات التدريب والاختبار، اقتُرحت العديد من مناهج التكيف غير الخاضعة للإشراف. [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] ويُعدّ تطبيق منهج ترجمة الصور، مثل Cycle-GAN، حلاً بسيطًا ومباشرًا لتقليل فجوة المجال. [ 10 ] ومن بين استخدامات أخرى، يُستخدم اكتشاف الأجسام عبر المجالات في القيادة الذاتية، حيث يمكن تدريب النماذج على عدد هائل من مشاهد ألعاب الفيديو، نظرًا لإمكانية توليد التصنيفات تلقائيًا.

مفهوم

لكل فئة من فئات الكائنات خصائصها المميزة التي تساعد في تصنيفها، فمثلاً، جميع الدوائر مستديرة. ويعتمد اكتشاف فئات الكائنات على هذه الخصائص. فعلى سبيل المثال، عند البحث عن دوائر، يتم البحث عن كائنات تقع على مسافة محددة من نقطة معينة (أي المركز). وبالمثل، عند البحث عن مربعات، نحتاج إلى كائنات متعامدة عند الزوايا ومتساوية الأضلاع. ويُستخدم نهج مماثل للتعرف على الوجوه ، حيث يمكن تحديد العينين والأنف والشفتين، بالإضافة إلى خصائص أخرى مثل لون البشرة والمسافة بين العينين.

المعايير

التقاطع على الاتحاد كمقياس للتشابه في اكتشاف الكائنات في الصور - مهمة مهمة في مجال رؤية الحاسوب 

في تحديد موقع الأجسام، يُقاس الاكتشاف الصحيح عادةً بنسبة التقاطع إلى الاتحاد (IoU ) بعد تطبيق عتبة معينة . على سبيل المثال، إذا كانت هناك إشارة مرور في الصورة، مع مربع محيط مرسوم يدويًا ("التصنيف الصحيح")، فإن الشبكة العصبية تكون قد اكتشفت إشارة المرور ( اكتشاف صحيح ) عند عتبة 0.5 إذا كان المربع المحيط الذي رسمته أعلى من 0.5 في نسبة التقاطع إلى الاتحاد (IoU) بينه وبين التصنيف الصحيح. وإلا، فإن المربع المحيط يُعتبر اكتشافًا خاطئًا .

إذا كان هناك مربع إحاطة واحد فقط للحقيقة الأرضية، ولكن مع وجود تنبؤات متعددة، فسيتم حساب معامل تقاطع الاتحاد (IoU) لكل تنبؤ. يُعتبر التنبؤ ذو أعلى قيمة IoU إيجابيًا صحيحًا إذا كان أعلى من العتبة، وإلا فهو إيجابي خاطئ. جميع مربعات الإحاطة المتوقعة الأخرى هي إيجابيات خاطئة. إذا لم يكن هناك أي تنبؤ بقيمة IoU أعلى من العتبة، فإن تصنيف الحقيقة الأرضية يكون سلبيًا خاطئًا .

بالنسبة لتحديد موقع الكائن وتصنيفه في وقت واحد، فإن النتيجة الإيجابية الحقيقية هي تلك التي يكون فيها تصنيف الفئة صحيحًا، ويكون للمربع المحيط به قيمة IoU تتجاوز العتبة.

يُقاس أداء تحديد موقع وتصنيف الأجسام في آنٍ واحد بمتوسط ​​الدقة (mAP). يُعرَّف متوسط ​​الدقة (AP) للشبكة لفئة معينة من الأجسام بأنه المساحة تحت منحنى الدقة والاستدعاء مع تغيير عتبة الثقة. أما mAP فهو متوسط ​​AP لجميع الفئات.

طُرق

مثال مبسط لتدريب شبكة عصبية في مجال اكتشاف الأجسام: يتم تدريب الشبكة باستخدام صور متعددة معروفة بتصويرها لنجم البحر وقنافذ البحر ، والتي ترتبط بـ"عُقد" تمثل السمات المرئية . يتطابق نجم البحر مع نسيج حلقي وشكل نجمي، بينما تتطابق معظم قنافذ البحر مع نسيج مخطط وشكل بيضاوي. ومع ذلك، فإن وجود قنفذ بحر ذي نسيج حلقي يُنشئ ارتباطًا ضعيفًا بينهما.
تشغيل الشبكة لاحقًا على صورة مُدخلة (يسار): [ 11 ] تكتشف الشبكة نجم البحر بشكل صحيح. مع ذلك، فإن الارتباط الضعيف بين النسيج الحلقي وقنفذ البحر يُعطي إشارة ضعيفة للأخير من إحدى العقدتين الوسيطتين. إضافةً إلى ذلك، تُعطي صدفة لم تُدرج في التدريب إشارة ضعيفة للشكل البيضاوي، مما ينتج عنه أيضًا إشارة ضعيفة لقنفذ البحر. قد تُؤدي هذه الإشارات الضعيفة إلى نتيجة إيجابية خاطئة لقنفذ البحر. في الواقع، لا تُمثل الأنسجة والخطوط الخارجية بعقدة واحدة، بل بأنماط أوزان مُرتبطة من عدة عقد.

تنقسم طرق الكشف عن الأجسام عمومًا إلى نوعين: الطرق القائمة على الشبكات العصبية والطرق غير العصبية. في الطرق غير العصبية، يصبح من الضروري أولًا تحديد الخصائص باستخدام إحدى الطرق المذكورة أدناه، ثم استخدام تقنية مثل آلة المتجهات الداعمة (SVM) لإجراء التصنيف. أما في الطرق العصبية، فتستطيع الكشف عن الأجسام بشكل كامل دون الحاجة إلى تحديد الخصائص مسبقًا، وتعتمد عادةً على الشبكات العصبية الالتفافية (CNN).

انظر أيضاً

مراجع

  1. داسيوبولو، ستاماتيا، وآخرون. " الكشف الدلالي عن كائنات الفيديو بمساعدة المعرفة ." معاملات IEEE للدوائر والأنظمة لتكنولوجيا الفيديو 15.10 (2005): 1210-1224.
  2. ^ لينغ جوان؛ يفينغ هو؛ صن يوان كونغ (1 مارس 2012). الوسائط المتعددة معالجة الصور والفيديو . الصحافة اتفاقية حقوق الطفل. ص  331–. رقم ISBN 978-1-4398-3087-1.
  3. السناباني، علاء؛ أحمد، محمد؛ السمادي، أحمد (2020). "عدّ المركبات باستخدام تركيبات الكشف والتتبع: تحليل مقارن". المؤتمر الدولي الرابع لمعالجة الفيديو والصور ، 2020. ص 48-54 . doi : 10.1145/3447450.3447458 . ISBN  9781450389075. S2CID 233194604 . 
  4. وو، جيانشين؛ أوسونتوجون، أديبولا؛ تشودري، تنزيم؛ فيليبوز، ماثاي؛ ريج، جيمس م. (2007). "نهج قابل للتطوير للتعرف على الأنشطة بناءً على استخدام الأشياء". المؤتمر الدولي الحادي عشر لـ IEEE حول رؤية الحاسوب، 2007. الصفحات 1-8 . doi : 10.1109/ICCV.2007.4408865 . ISBN  978-1-4244-1630-1.
  5. 1 2 أوزا، بوجان؛ سينداجي، فيشواناث أ.؛ في إس، فيباشان؛ باتيل، فيشال م. (2021-07-04). "تكييف المجال غير الخاضع للإشراف لكاشفات الأجسام: دراسة استقصائية". arXiv : 2105.13502 [ cs.CV ].
  6. خودابنده، مهران؛ وحدت، أراش؛ رانجبار، ماني؛ ماكريدي، ويليام ج. (2019-11-18). "نهج تعلم قوي للكشف عن الكائنات التكيفي مع المجال". arXiv : 1904.02361 [ cs.LG ].
  7. سوفياني، بيترو؛ إيونيسكو، رادو تيودور؛ روتا، باولو؛ سيبي، نيكو (2021-03-01). "التعلم الذاتي المنهجي للكشف عن الأجسام عبر المجالات" . رؤية الحاسوب وفهم الصور . 204 103166. arXiv : 1911.06849 . doi : 10.1016/j.cviu.2021.103166 . ISSN 1077-3142 . S2CID 208138033 .  
  8. مينكه، ماكسيميليان؛ وينزل، توماس؛ شوينغ، أندرياس (أكتوبر 2022). "تحسين التكيف مع المجال القائم على الشبكات التوليدية الخصومية (GAN) للكشف عن الأجسام". المؤتمر الدولي الخامس والعشرون لأنظمة النقل الذكية (ITSC) لعام 2022، IEEE . الصفحات 3880-3885 . doi : 10.1109/ITSC55140.2022.9922138 . ISBN  978-1-6654-6880-0. S2CID 253251380 . 
  9. مينكه، ماكسيميليان؛ وينزل، توماس؛ شوينغ، أندرياس (2022-08-31). "أوادا: التكيف العدائي للمجال الموزون بالانتباه للكشف عن الكائنات". arXiv : 2208.14662 [ cs.CV ].
  10. تشو، جون يان؛ بارك، تايسونغ؛ إيزولا، فيليب؛ إفروس، أليكسي أ. (24-08-2020). "ترجمة الصور غير المزدوجة باستخدام الشبكات التنافسية المتسقة دوريًا". arXiv : 1703.10593 [ cs.CV ].
  11. فيري، سي.، وكايزر، إس. (2019). الشبكات العصبية للأطفال . دار سورس بوكس ​​للنشر. رقم ISBN 978-1492671206.{{cite book}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  12. دلال، نافنيت (2005). "مخططات التدرجات الموجهة للكشف عن الإنسان" (ملف PDF) . رؤية الحاسوب والتعرف على الأنماط . 1 .
  13. سيرمانيه، بيير؛ إيجن، ديفيد؛ تشانغ، شيانغ؛ ماثيو، مايكل؛ فيرغوس، روب؛ ليكان، يان (23-02-2014). "أوفر فيت: التعرف المتكامل، وتحديد الموقع، والكشف باستخدام الشبكات الالتفافية". arXiv : 1312.6229 [ cs.CV ].
  14. روس، غيرشيك (2014). "تسلسلات هرمية غنية بالميزات للكشف الدقيق عن الكائنات والتجزئة الدلالية" (ملف PDF) . وقائع مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط . IEEE. الصفحات 580-587 . arXiv : 1311.2524 . doi : 10.1109/CVPR.2014.81 . ISBN  978-1-4799-5118-5. S2CID 215827080 . 
  15. جيرشيك، روس (2015). "Fast R-CNN" (ملف PDF) . وقائع المؤتمر الدولي لهندسة الكهرباء والإلكترونيات حول رؤية الحاسوب . الصفحات 1440-1448 . arXiv : 1504.08083 . 
  16. شاوكينغ، رين (2015). "Faster R-CNN". Advances in Neural Information Processing Systems . arXiv : 1506.01497 .
  17. 1 2 بانغ، جيانغمياو؛ تشين، كاي؛ شي، جيان بينغ؛ فنغ، هواجون؛ أويانغ، وانلي؛ لين ، داهوا (2019-04-04). “Libra R-CNN: نحو التعلم المتوازن لاكتشاف الكائنات”. أرخايف : 1904.02701v1 [ cs.CV ].
  18. ريدمون، جوزيف؛ ديفالا، سانتوش؛ جيرشيك، روس؛ فرهادي، علي (2016-05-09). "أنت تنظر مرة واحدة فقط: الكشف الموحد عن الأجسام في الوقت الحقيقي". arXiv : 1506.02640 [ cs.CV ].
  19. ليو، وي (أكتوبر 2016). "SSD: كاشف الصناديق المتعددة بلقطة واحدة". رؤية الحاسوب - ECCV 2016. سلسلة محاضرات في علوم الحاسوب. المجلد 9905. الصفحات 21-37 . arXiv : 1512.02325 . doi : 10.1007/978-3-319-46448-0_2 . ISBN   978-3-319-46447-3. S2CID 2141740 . 
  20. تشانغ، شيفنغ (2018). "شبكة عصبية مُحسَّنة بلقطة واحدة للكشف عن الأجسام". وقائع مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 4203-4212 . arXiv : 1711.06897 . 
  21. لين، تسونغ-يي (2020). "فقدان التركيز للكشف عن الأجسام الكثيفة". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 42 (2): 318-327 . arXiv : 1708.02002 . Bibcode : 2020ITPAM..42..318L . doi : 10.1109/TPAMI.2018.2858826 . PMID: 30040631. S2CID : 47252984 .  
  22. تشو، شيتشو (2018). "الشبكات العصبية الالتفافية القابلة للتشكيل الإصدار الثاني: أكثر قابلية للتشكيل، نتائج أفضل". arXiv : 1811.11168 [ cs.CV ].
  23. داي، جيفنغ (2017). "الشبكات الالتفافية القابلة للتشوه". arXiv : 1703.06211 [ cs.CV ].

للمزيد من القراءة

  • زو، تشنغشيا؛ تشن، كيان؛ شي، زينوي؛ قوه، يوهونغ؛ نعم جيبينج (مارس 2023). “اكتشاف الأشياء خلال 20 عامًا: مسح”. وقائع IEEE . 111 (3): 257-276 . دوى : 10.1109/JPROC.2023.3238524 . ISSN 0018-9219 .