فيس نت
FaceNet هو نظام للتعرف على الوجوه طوّره فلوريان شروف، وديمتري كالينيتشينكو، وجيمس فيلبين، وهم مجموعة من الباحثين المنتسبين إلى جوجل . عُرض النظام لأول مرة في مؤتمر IEEE لعام 2015 حول رؤية الحاسوب والتعرف على الأنماط. [ 1 ] يستخدم النظام شبكة عصبية تلافيفية عميقة لتعلم تمثيل (يُسمى أيضًا تضمينًا ) من مجموعة صور وجوه إلى فضاء إقليدي ذي 128 بُعدًا ، ويُقيّم التشابه بين الوجوه بناءً على مربع المسافة الإقليدية بين المتجهات المُعَيَّرة المُقابلة للصور في هذا الفضاء. يستخدم النظام دالة خسارة الثلاثيات كدالة تكلفة، وقدّم طريقة جديدة لاستخراج الثلاثيات عبر الإنترنت. حقق النظام دقة بلغت 99.63%، وهي أعلى نسبة مُسجلة حتى الآن على مجموعة بيانات Labeled Faces in the Wild باستخدام بروتوكول البيانات الخارجية غير المُقيد والمُصنَّف . [ 2 ]
بناء
الهيكل الأساسي
يتم تمثيل بنية FaceNet بشكل تخطيطي في الشكل 1.

لأغراض التدريب، استخدم الباحثون مجموعات إدخال تضم حوالي 1800 صورة. لكل هوية ممثلة في مجموعات الإدخال، كانت هناك 40 صورة مشابهة لتلك الهوية، بالإضافة إلى عدة صور مختارة عشوائيًا لهويات أخرى. تم تغذية هذه المجموعات إلى شبكة عصبية تلافيفية عميقة، تم تدريبها باستخدام خوارزمية التدرج العشوائي مع الانتشار العكسي القياسي وخوارزمية مُحسِّن التدرج التكيفي (AdaGrad). تم ضبط معدل التعلم مبدئيًا على 0.05، ثم تم تخفيضه لاحقًا أثناء وضع اللمسات الأخيرة على النموذج.
بنية الشبكة العصبية التلافيفية
استخدم الباحثون نوعين من البنى، أطلقوا عليهما NN1 وNN2، واستكشفوا مزايا وعيوب كل منهما. تكمن الاختلافات العملية بين النموذجين في اختلاف المعاملات وعدد عمليات الفاصلة العائمة في الثانية (FLOPS). ترد تفاصيل نموذج NN1 في الجدول أدناه.
| طبقة | الحجم (الصفوف × الأعمدة × عدد الفلاتر) | تحديد الحجم (الصفوف × الأعمدة × عدد الفلاتر) | Kernel (rows × cols, stride) | حدود | الفشل |
|---|---|---|---|---|---|
| conv1 | 220×220×3 | 110×110×64 | 7×7×3، 2 | 9 آلاف | 115 مليون |
| المسبح 1 | 110×110×64 | 55×55×64 | 3×3×64، 2 | 0 | — |
| rnorm1 | 55×55×64 | 55×55×64 | 0 | ||
| conv2a | 55×55×64 | 55×55×64 | 1×1×64، 1 | 4K | 13 مليون |
| conv2 | 55×55×64 | 55×55×192 | 3×3×64، 1 | 111 ألف | 335 مليون |
| rnorm2 | 55×55×192 | 55×55×192 | 0 | ||
| المسبح 2 | 55×55×192 | 28×28×192 | 3×3×192، 2 | 0 | |
| conv3a | 28×28×192 | 28×28×192 | 1×1×192، 1 | 37 ألف | 29 مليون |
| conv3 | 28×28×192 | 28×28×384 | 3×3×192، 1 | 664 ألف | 521 مليون |
| pool3 | 28×28×384 | 14×14×384 | 3×3×384، 2 | 0 | |
| conv4a | 14×14×384 | 14×14×384 | 1×1×384، 1 | 148 ألف | 29 مليون |
| conv4 | 14×14×384 | 14×14×256 | 3×3×384، 1 | 885 ألف | 173 مليون |
| conv5a | 14×14×256 | 14×14×256 | 1×1×256، 1 | 66 ألف | 13 مليون |
| conv5 | 14×14×256 | 14×14×256 | 3×3×256، 1 | 590 ألف | 116 مليون |
| conv6a | 14×14×256 | 14×14×256 | 1×1×256، 1 | 66 ألف | 13 مليون |
| conv6 | 14×14×256 | 14×14×256 | 3×3×256، 1 | 590 ألف | 116 مليون |
| pool4 | 14×14×256 | 3×3×256، 2 | 7×7×256 | 0 | |
| concat | 7×7×256 | 7×7×256 | 0 | ||
| fc1 | 7×7×256 | 1×32×128 | أقصى قيمة لـ p = 2 | 103 مليون | 103 مليون |
| fc2 | 1×32×128 | 1×32×128 | أقصى قيمة لـ p = 2 | 34 مليون | 34 مليون |
| fc7128 | 1×32×128 | 1×1×128 | 524 ألف | 0.5 مليون | |
| المستوى الثاني | 1×1×128 | 1×1×128 | 0 | ||
| المجموع | 140 مليون | 1.6 مليار |
فقدان ثلاثة توائم
كان من أبرز ابتكارات النظام دالة خسارة الثلاثية وطريقة استخراج البيانات المرتبطة بها. وقد أصبحت هذه الدالة منذ ذلك الحين عنصراً أساسياً في العديد من مسائل التعلم أحادي اللقطة الأخرى.
أداء
في مجموعة بيانات Labeled Faces in the Wild (LFW) واسعة الانتشار، حقق نظام FaceNet دقة بلغت 99.63%، وهي أعلى نسبة دقة مُسجلة في LFW ضمن بروتوكول البيانات الخارجية غير المُقيد والمُصنفة. [ 2 ] أما في قاعدة بيانات YouTube Faces DB، فقد حقق النظام دقة بلغت 95.12%. [ 1 ]
انظر أيضاً
للمزيد من القراءة
- راجيش جوباكومار؛ كاروناجار أ؛ كوتيغار، م؛ فيشال أناند (سبتمبر 2023). "دراسة كمية لنظام FaceNet": في وقائع مؤتمر ICACCP 2023. سنغافورة: سبرينغر نيتشر. الصفحات 211-222 . ISBN 9789819942848.
- إيفان ويليام؛ دي روزال إغناتيوس موسى سيتيادي؛ إيكو هاري راشموانتو؛ هيرو أغوس سانتوسو؛ كريستي أتيكا ساري (2019). "التعرف على الوجوه باستخدام FaceNet (دراسة استقصائية، واختبار أداء، ومقارنة)" في وقائع المؤتمر الدولي الرابع للمعلوماتية والحوسبة . IEEE Xplore. doi : 10.1109/ICIC47613.2019.8985786 . تاريخ الاسترجاع: 6 أكتوبر 2023 .
- لمناقشة نقاط ضعف خوارزميات التعرف على الوجوه القائمة على شبكة Facenet في تطبيقاتها على فيديوهات التزييف العميق : بافيل كورشونوف؛ سيباستيان مارسيل (2022). "تهديد التزييف العميق للرؤية الحاسوبية والبشرية" في: دليل التلاعب الرقمي بالوجوه وكشفها من التزييف العميق إلى هجمات التشكيل (ملف PDF) . سبرينغر. الصفحات 97-114 . ISBN 978-3-030-87664-7تم الاطلاع عليه بتاريخ 5 أكتوبر 2023 .
- لمناقشة تطبيق FaceNet للتحقق من الوجوه في نظام Android: فاسكو كوريا فيلوسو (يناير 2022). الذكاء الاصطناعي العملي لنظام Android . منشورات BPB. ISBN 9789355510242.أمازون
مراجع
- 1 2 فلوريان شروف؛ ديمتري كالينيتشينكو؛ جيمس فيلبين. "FaceNet: تضمين موحد للتعرف على الوجوه وتجميعها" (ملف PDF) . مؤسسة رؤية الحاسوب . تم الاطلاع عليه بتاريخ 4 أكتوبر 2023 .
- 1 2 إريك ليرند-ميلر؛ غاري هوانغ؛ أروني روي تشودري؛ هاوكسيانغ لي؛ غانغ هوا (أبريل 2016). "الوجوه المصنفة في بيئات طبيعية: دراسة استقصائية". التطورات في اكتشاف الوجوه وتحليل صور الوجه (ملف PDF) . سبرينغر. الصفحات 189-248 . تاريخ الاسترجاع: 5 أكتوبر 2023 .
- برنامج التعرف على الوجه
- البحث عن الصور
- تطبيقات برمجيات التعلم العميق
- الشبكات العصبية الاصطناعية
