اكتشاف الأجسام

يُعدّ اكتشاف الأجسام تقنية حاسوبية مرتبطة برؤية الحاسوب ومعالجة الصور ، وتختصّ باكتشاف الأجسام الدلالية من فئة معينة (مثل البشر، والمباني، والسيارات) في الصور والفيديوهات الرقمية. [ 1 ] تشمل المجالات البحثية الواسعة لاكتشاف الأجسام اكتشاف الوجوه واكتشاف المشاة . ولاكتشاف الأجسام تطبيقات في العديد من مجالات رؤية الحاسوب، بما في ذلك استرجاع الصور والمراقبة بالفيديو .
الاستخدامات
يُستخدم على نطاق واسع في مهام رؤية الحاسوب ، مثل تصنيف الصور ، [ 2 ] وعدّ المركبات، [ 3 ] والتعرف على الأنشطة ، [ 4 ] واكتشاف الوجوه ، والتعرف على الوجوه ، وتقسيم الفيديو إلى أجزاء . كما يُستخدم في تتبع الأجسام ، على سبيل المثال تتبع الكرة أثناء مباراة كرة القدم، أو تتبع حركة مضرب الكريكيت، أو تتبع شخص في مقطع فيديو.
غالبًا ما تُؤخذ صور الاختبار من توزيع بيانات مختلف، مما يجعل مهمة اكتشاف الأجسام أكثر صعوبة. [ 5 ] ولمعالجة التحديات الناجمة عن فجوة المجال بين بيانات التدريب والاختبار، اقتُرحت العديد من مناهج التكيف غير الخاضعة للإشراف. [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] ويُعدّ تطبيق منهج ترجمة الصور، مثل Cycle-GAN، حلاً بسيطًا ومباشرًا لتقليل فجوة المجال. [ 10 ] ومن بين استخدامات أخرى، يُستخدم اكتشاف الأجسام عبر المجالات في القيادة الذاتية، حيث يمكن تدريب النماذج على عدد هائل من مشاهد ألعاب الفيديو، نظرًا لإمكانية توليد التصنيفات تلقائيًا.
مفهوم
لكل فئة من فئات الكائنات خصائصها المميزة التي تساعد في تصنيفها، فمثلاً، جميع الدوائر مستديرة. ويعتمد اكتشاف فئات الكائنات على هذه الخصائص. فعلى سبيل المثال، عند البحث عن دوائر، يتم البحث عن كائنات تقع على مسافة محددة من نقطة معينة (أي المركز). وبالمثل، عند البحث عن مربعات، نحتاج إلى كائنات متعامدة عند الزوايا ومتساوية الأضلاع. ويُستخدم نهج مماثل للتعرف على الوجوه ، حيث يمكن تحديد العينين والأنف والشفتين، بالإضافة إلى خصائص أخرى مثل لون البشرة والمسافة بين العينين.
المعايير
في تحديد موقع الأجسام، يُقاس الاكتشاف الصحيح عادةً بنسبة التقاطع إلى الاتحاد (IoU ) بعد تطبيق عتبة معينة . على سبيل المثال، إذا كانت هناك إشارة مرور في الصورة، مع مربع محيط مرسوم يدويًا ("التصنيف الصحيح")، فإن الشبكة العصبية تكون قد اكتشفت إشارة المرور ( اكتشاف صحيح ) عند عتبة 0.5 إذا كان المربع المحيط الذي رسمته أعلى من 0.5 في نسبة التقاطع إلى الاتحاد (IoU) بينه وبين التصنيف الصحيح. وإلا، فإن المربع المحيط يُعتبر اكتشافًا خاطئًا .
إذا كان هناك مربع إحاطة واحد فقط للحقيقة الأرضية، ولكن مع وجود تنبؤات متعددة، فسيتم حساب معامل تقاطع الاتحاد (IoU) لكل تنبؤ. يُعتبر التنبؤ ذو أعلى قيمة IoU إيجابيًا صحيحًا إذا كان أعلى من العتبة، وإلا فهو إيجابي خاطئ. جميع مربعات الإحاطة المتوقعة الأخرى هي إيجابيات خاطئة. إذا لم يكن هناك أي تنبؤ بقيمة IoU أعلى من العتبة، فإن تصنيف الحقيقة الأرضية يكون سلبيًا خاطئًا .
بالنسبة لتحديد موقع الكائن وتصنيفه في وقت واحد، فإن النتيجة الإيجابية الحقيقية هي تلك التي يكون فيها تصنيف الفئة صحيحًا، ويكون للمربع المحيط به قيمة IoU تتجاوز العتبة.
يُقاس أداء تحديد موقع وتصنيف الأجسام في آنٍ واحد بمتوسط الدقة (mAP). يُعرَّف متوسط الدقة (AP) للشبكة لفئة معينة من الأجسام بأنه المساحة تحت منحنى الدقة والاستدعاء مع تغيير عتبة الثقة. أما mAP فهو متوسط AP لجميع الفئات.
طُرق
تنقسم طرق الكشف عن الأجسام عمومًا إلى نوعين: الطرق القائمة على الشبكات العصبية والطرق غير العصبية. في الطرق غير العصبية، يصبح من الضروري أولًا تحديد الخصائص باستخدام إحدى الطرق المذكورة أدناه، ثم استخدام تقنية مثل آلة المتجهات الداعمة (SVM) لإجراء التصنيف. أما في الطرق العصبية، فتستطيع الكشف عن الأجسام بشكل كامل دون الحاجة إلى تحديد الخصائص مسبقًا، وتعتمد عادةً على الشبكات العصبية الالتفافية (CNN).
- الأساليب غير العصبية:
- أساليب الشبكات العصبية:
- OverFeat. [ 13 ]
- مقترحات المناطق (R-CNN، [ 14 ] Fast R-CNN، [ 15 ] Faster R-CNN، [ 16 ] cascade R-CNN. [ 17 ] )
- أنت تنظر مرة واحدة فقط (YOLO). [ 18 ]
- كاشف متعدد الصناديق بلقطة واحدة (SSD) [ 19 ]
- شبكة عصبية للتحسين أحادي اللقطة للكشف عن الكائنات (RefineDet) [ 20 ]
- شبكة ريتينا [ 21 ] [ 17 ]
- الشبكات الالتفافية القابلة للتشوه [ 22 ] [ 23 ]
- محول الكشف (DETR) ، الذي يستخدم محولات الرؤية .
انظر أيضاً
مراجع
- ↑ داسيوبولو، ستاماتيا، وآخرون. " الكشف الدلالي عن كائنات الفيديو بمساعدة المعرفة ." معاملات IEEE للدوائر والأنظمة لتكنولوجيا الفيديو 15.10 (2005): 1210-1224.
- ^ لينغ جوان؛ يفينغ هو؛ صن يوان كونغ (1 مارس 2012). الوسائط المتعددة معالجة الصور والفيديو . الصحافة اتفاقية حقوق الطفل. ص 331–. رقم ISBN 978-1-4398-3087-1.
- ↑ السناباني، علاء؛ أحمد، محمد؛ السمادي، أحمد (2020). "عدّ المركبات باستخدام تركيبات الكشف والتتبع: تحليل مقارن". المؤتمر الدولي الرابع لمعالجة الفيديو والصور ، 2020. ص 48-54 . doi : 10.1145/3447450.3447458 . ISBN 9781450389075. S2CID 233194604 .
- ↑ وو، جيانشين؛ أوسونتوجون، أديبولا؛ تشودري، تنزيم؛ فيليبوز، ماثاي؛ ريج، جيمس م. (2007). "نهج قابل للتطوير للتعرف على الأنشطة بناءً على استخدام الأشياء". المؤتمر الدولي الحادي عشر لـ IEEE حول رؤية الحاسوب، 2007. الصفحات 1-8 . doi : 10.1109/ICCV.2007.4408865 . ISBN 978-1-4244-1630-1.
- 1 2 أوزا، بوجان؛ سينداجي، فيشواناث أ.؛ في إس، فيباشان؛ باتيل، فيشال م. (2021-07-04). "تكييف المجال غير الخاضع للإشراف لكاشفات الأجسام: دراسة استقصائية". arXiv : 2105.13502 [ cs.CV ].
- ↑ خودابنده، مهران؛ وحدت، أراش؛ رانجبار، ماني؛ ماكريدي، ويليام ج. (2019-11-18). "نهج تعلم قوي للكشف عن الكائنات التكيفي مع المجال". arXiv : 1904.02361 [ cs.LG ].
- ↑ سوفياني، بيترو؛ إيونيسكو، رادو تيودور؛ روتا، باولو؛ سيبي، نيكو (2021-03-01). "التعلم الذاتي المنهجي للكشف عن الأجسام عبر المجالات" . رؤية الحاسوب وفهم الصور . 204 103166. arXiv : 1911.06849 . doi : 10.1016/j.cviu.2021.103166 . ISSN 1077-3142 . S2CID 208138033 .
- ↑ مينكه، ماكسيميليان؛ وينزل، توماس؛ شوينغ، أندرياس (أكتوبر 2022). "تحسين التكيف مع المجال القائم على الشبكات التوليدية الخصومية (GAN) للكشف عن الأجسام". المؤتمر الدولي الخامس والعشرون لأنظمة النقل الذكية (ITSC) لعام 2022، IEEE . الصفحات 3880-3885 . doi : 10.1109/ITSC55140.2022.9922138 . ISBN 978-1-6654-6880-0. S2CID 253251380 .
- ↑ مينكه، ماكسيميليان؛ وينزل، توماس؛ شوينغ، أندرياس (2022-08-31). "أوادا: التكيف العدائي للمجال الموزون بالانتباه للكشف عن الكائنات". arXiv : 2208.14662 [ cs.CV ].
- ↑ تشو، جون يان؛ بارك، تايسونغ؛ إيزولا، فيليب؛ إفروس، أليكسي أ. (24-08-2020). "ترجمة الصور غير المزدوجة باستخدام الشبكات التنافسية المتسقة دوريًا". arXiv : 1703.10593 [ cs.CV ].
- ↑ فيري، سي.، وكايزر، إس. (2019). الشبكات العصبية للأطفال . دار سورس بوكس للنشر. رقم ISBN 978-1492671206.
{{cite book}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط ) - ↑ دلال، نافنيت (2005). "مخططات التدرجات الموجهة للكشف عن الإنسان" (ملف PDF) . رؤية الحاسوب والتعرف على الأنماط . 1 .
- ↑ سيرمانيه، بيير؛ إيجن، ديفيد؛ تشانغ، شيانغ؛ ماثيو، مايكل؛ فيرغوس، روب؛ ليكان، يان (23-02-2014). "أوفر فيت: التعرف المتكامل، وتحديد الموقع، والكشف باستخدام الشبكات الالتفافية". arXiv : 1312.6229 [ cs.CV ].
- ↑ روس، غيرشيك (2014). "تسلسلات هرمية غنية بالميزات للكشف الدقيق عن الكائنات والتجزئة الدلالية" (ملف PDF) . وقائع مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط . IEEE. الصفحات 580-587 . arXiv : 1311.2524 . doi : 10.1109/CVPR.2014.81 . ISBN 978-1-4799-5118-5. S2CID 215827080 .
- ↑ جيرشيك، روس (2015). "Fast R-CNN" (ملف PDF) . وقائع المؤتمر الدولي لهندسة الكهرباء والإلكترونيات حول رؤية الحاسوب . الصفحات 1440-1448 . arXiv : 1504.08083 .
- ↑ شاوكينغ، رين (2015). "Faster R-CNN". Advances in Neural Information Processing Systems . arXiv : 1506.01497 .
- 1 2 بانغ، جيانغمياو؛ تشين، كاي؛ شي، جيان بينغ؛ فنغ، هواجون؛ أويانغ، وانلي؛ لين ، داهوا (2019-04-04). “Libra R-CNN: نحو التعلم المتوازن لاكتشاف الكائنات”. أرخايف : 1904.02701v1 [ cs.CV ].
- ↑ ريدمون، جوزيف؛ ديفالا، سانتوش؛ جيرشيك، روس؛ فرهادي، علي (2016-05-09). "أنت تنظر مرة واحدة فقط: الكشف الموحد عن الأجسام في الوقت الحقيقي". arXiv : 1506.02640 [ cs.CV ].
- ↑ ليو، وي (أكتوبر 2016). "SSD: كاشف الصناديق المتعددة بلقطة واحدة". رؤية الحاسوب - ECCV 2016. سلسلة محاضرات في علوم الحاسوب. المجلد 9905. الصفحات 21-37 . arXiv : 1512.02325 . doi : 10.1007/978-3-319-46448-0_2 . ISBN 978-3-319-46447-3. S2CID 2141740 .
- ↑ تشانغ، شيفنغ (2018). "شبكة عصبية مُحسَّنة بلقطة واحدة للكشف عن الأجسام". وقائع مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 4203-4212 . arXiv : 1711.06897 .
- ↑ لين، تسونغ-يي (2020). "فقدان التركيز للكشف عن الأجسام الكثيفة". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 42 (2): 318-327 . arXiv : 1708.02002 . Bibcode : 2020ITPAM..42..318L . doi : 10.1109/TPAMI.2018.2858826 . PMID: 30040631. S2CID : 47252984 .
- ↑ تشو، شيتشو (2018). "الشبكات العصبية الالتفافية القابلة للتشكيل الإصدار الثاني: أكثر قابلية للتشكيل، نتائج أفضل". arXiv : 1811.11168 [ cs.CV ].
- ↑ داي، جيفنغ (2017). "الشبكات الالتفافية القابلة للتشوه". arXiv : 1703.06211 [ cs.CV ].
للمزيد من القراءة
- زو، تشنغشيا؛ تشن، كيان؛ شي، زينوي؛ قوه، يوهونغ؛ نعم جيبينج (مارس 2023). “اكتشاف الأشياء خلال 20 عامًا: مسح”. وقائع IEEE . 111 (3): 257-276 . دوى : 10.1109/JPROC.2023.3238524 . ISSN 0018-9219 .
روابط خارجية
- جوشي، سنيال (24-10-2023). "أفضل نماذج الكشف عن الأجسام" . hitechbpo.com .
- وينغ، ليليان (29 أكتوبر 2017). "الكشف عن الأجسام للمبتدئين - الجزء الأول: متجه التدرج، وHOG، وSS" . lilianweng.github.io . تاريخ الاسترجاع: 11 سبتمبر 2024 .
- وينغ، ليليان (15 ديسمبر 2017). "الكشف عن الأجسام للمبتدئين - الجزء الثاني: الشبكات العصبية الالتفافية، وDPM، وOverfeat" . lilianweng.github.io . تاريخ الاسترجاع: 11 سبتمبر 2024 .
- وينغ، ليليان (31 ديسمبر 2017). "الكشف عن الأجسام للمبتدئين - الجزء 3: عائلة R-CNN" . lilianweng.github.io . تاريخ الاسترجاع: 11 سبتمبر 2024 .
- وينغ، ليليان (27-12-2018). "الكشف عن الأجسام - الجزء 4: نماذج الكشف السريع" . lilianweng.github.io . تاريخ الاسترجاع: 11-09-2024 .
- الكشف عن فئات متعددة من الكائنات
- تحديد موقع الفعل المكاني والزماني
- عرض توضيحي لاكتشاف الأجسام عبر الإنترنت
- الكشف عن الأجسام في الفيديو والتجزئة المشتركة
- التعرف على الأشياء وتصنيفها
- مراقبة
- تطبيقات رؤية الحاسوب
- التعرف على الإيماءات
