فيس نت

FaceNet هو نظام للتعرف على الوجوه طوّره فلوريان شروف، وديمتري كالينيتشينكو، وجيمس فيلبين، وهم مجموعة من الباحثين المنتسبين إلى جوجل . عُرض النظام لأول مرة في مؤتمر IEEE لعام 2015 حول رؤية الحاسوب والتعرف على الأنماط. [ 1 ] يستخدم النظام شبكة عصبية تلافيفية عميقة لتعلم تمثيل (يُسمى أيضًا تضمينًا ) من مجموعة صور وجوه إلى فضاء إقليدي ذي 128 بُعدًا ، ويُقيّم التشابه بين الوجوه بناءً على مربع المسافة الإقليدية بين المتجهات المُعَيَّرة المُقابلة للصور في هذا الفضاء. يستخدم النظام دالة خسارة الثلاثيات كدالة تكلفة، وقدّم طريقة جديدة لاستخراج الثلاثيات عبر الإنترنت. حقق النظام دقة بلغت 99.63%، وهي أعلى نسبة مُسجلة حتى الآن على مجموعة بيانات Labeled Faces in the Wild باستخدام بروتوكول البيانات الخارجية غير المُقيد والمُصنَّف . [ 2 ]

بناء

الهيكل الأساسي

يتم تمثيل بنية FaceNet بشكل تخطيطي في الشكل 1.

الشكل 1: البنية العامة لنظام التعرف على الوجوه FaceNet

لأغراض التدريب، استخدم الباحثون مجموعات إدخال تضم حوالي 1800 صورة. لكل هوية ممثلة في مجموعات الإدخال، كانت هناك 40 صورة مشابهة لتلك الهوية، بالإضافة إلى عدة صور مختارة عشوائيًا لهويات أخرى. تم تغذية هذه المجموعات إلى شبكة عصبية تلافيفية عميقة، تم تدريبها باستخدام خوارزمية التدرج العشوائي مع الانتشار العكسي القياسي وخوارزمية مُحسِّن التدرج التكيفي (AdaGrad). تم ضبط معدل التعلم مبدئيًا على 0.05، ثم تم تخفيضه لاحقًا أثناء وضع اللمسات الأخيرة على النموذج.

بنية الشبكة العصبية التلافيفية

استخدم الباحثون نوعين من البنى، أطلقوا عليهما NN1 وNN2، واستكشفوا مزايا وعيوب كل منهما. تكمن الاختلافات العملية بين النموذجين في اختلاف المعاملات وعدد عمليات الفاصلة العائمة في الثانية (FLOPS). ترد تفاصيل نموذج NN1 في الجدول أدناه.

بنية الشبكة العصبية التلافيفية المستخدمة في النموذج NN1 في نظام التعرف على الوجوه FaceNet
طبقةالحجم (الصفوف × الأعمدة × عدد الفلاتر)تحديد الحجم (الصفوف × الأعمدة × عدد الفلاتر)Kernel (rows × cols, stride)حدودالفشل
conv1220×220×3110×110×647×7×3، 29 آلاف115 مليون
المسبح 1110×110×6455×55×643×3×64، 20
rnorm155×55×6455×55×640
conv2a55×55×6455×55×641×1×64، 14K13 مليون
conv255×55×6455×55×1923×3×64، 1111 ألف335 مليون
rnorm255×55×19255×55×1920
المسبح 255×55×19228×28×1923×3×192، 20
conv3a28×28×19228×28×1921×1×192، 137 ألف29 مليون
conv328×28×19228×28×3843×3×192، 1664 ألف521 مليون
pool328×28×38414×14×3843×3×384، 20
conv4a14×14×38414×14×3841×1×384، 1148 ألف29 مليون
conv414×14×38414×14×2563×3×384، 1885 ألف173 مليون
conv5a14×14×25614×14×2561×1×256، 166 ألف13 مليون
conv514×14×25614×14×2563×3×256، 1590 ألف116 مليون
conv6a14×14×25614×14×2561×1×256، 166 ألف13 مليون
conv614×14×25614×14×2563×3×256، 1590 ألف116 مليون
pool414×14×2563×3×256، 27×7×2560
concat7×7×2567×7×2560
fc17×7×2561×32×128أقصى قيمة لـ p = 2103 مليون103 مليون
fc21×32×1281×32×128أقصى قيمة لـ p = 234 مليون34 مليون
fc71281×32×1281×1×128524 ألف0.5 مليون
المستوى الثاني1×1×1281×1×1280
المجموع140 مليون1.6 مليار

فقدان ثلاثة توائم

كان من أبرز ابتكارات النظام دالة خسارة الثلاثية وطريقة استخراج البيانات المرتبطة بها. وقد أصبحت هذه الدالة منذ ذلك الحين عنصراً أساسياً في العديد من مسائل التعلم أحادي اللقطة الأخرى.

أداء

في مجموعة بيانات Labeled Faces in the Wild (LFW) واسعة الانتشار، حقق نظام FaceNet دقة بلغت 99.63%، وهي أعلى نسبة دقة مُسجلة في LFW ضمن بروتوكول البيانات الخارجية غير المُقيد والمُصنفة. [ 2 ] أما في قاعدة بيانات YouTube Faces DB، فقد حقق النظام دقة بلغت 95.12%. [ 1 ]

انظر أيضاً

للمزيد من القراءة

مراجع

  1. 1 2 فلوريان شروف؛ ديمتري كالينيتشينكو؛ جيمس فيلبين. "FaceNet: تضمين موحد للتعرف على الوجوه وتجميعها" (ملف PDF) . مؤسسة رؤية الحاسوب . تم الاطلاع عليه بتاريخ 4 أكتوبر 2023 .
  2. 1 2 إريك ليرند-ميلر؛ غاري هوانغ؛ أروني روي تشودري؛ هاوكسيانغ لي؛ غانغ هوا (أبريل 2016). "الوجوه المصنفة في بيئات طبيعية: دراسة استقصائية". التطورات في اكتشاف الوجوه وتحليل صور الوجه (ملف PDF) . سبرينغر. الصفحات 189-248 . تاريخ الاسترجاع: 5 أكتوبر 2023 .