درجة التأسيس

تُعدّ درجة Inception (IS) خوارزمية تُستخدم لتقييم جودة الصور المُنشأة بواسطة نموذج توليدي للصور، مثل الشبكة التوليدية التنافسية (GAN). [ 1 ] تُحسب الدرجة بناءً على مُخرجات نموذج تصنيف الصور Inception v3 المُدرّب مُسبقًا، والذي يُطبّق على عينة من الصور (عادةً حوالي 30,000 صورة) مُولّدة بواسطة النموذج التوليدي. تصل درجة Inception إلى أقصى قيمة لها عندما تتحقق الشروط التالية:

  1. يتم تقليل إنتروبيا توزيع التصنيفات التي يتنبأ بها نموذج Inceptionv3 للصور المُولَّدة. بعبارة أخرى، يتنبأ نموذج التصنيف بثقة بتصنيف واحد لكل صورة. وهذا يتوافق بديهيًا مع الهدف المنشود من الصور المُولَّدة، وهو أن تكون "واضحة" أو "مميزة".
  2. تتوزع تنبؤات نموذج التصنيف بالتساوي على جميع التصنيفات الممكنة. وهذا يتوافق مع المطلب بأن يكون ناتج النموذج التوليدي "متنوعًا". [ 2 ]

لقد تم استبدالها إلى حد ما بمسافة فريشيه التأسيسية ذات الصلة . [ 3 ] في حين أن درجة التأسيس تقيّم فقط توزيع الصور المولدة، فإن مسافة فريشيه التأسيسية تقارن توزيع الصور المولدة بتوزيع مجموعة من الصور الحقيقية ("الحقيقة الأساسية").

تعريف

لنفترض وجود فضاءين، فضاء الصورΩX{\displaystyle \Omega _{X}}ومساحة التسمياتΩY{\displaystyle \Omega _{Y}}. مساحة التصنيفات محدودة.

يتركصزهـن{\displaystyle p_{gen}}ليكن توزيع احتمالي علىΩX{\displaystyle \Omega _{X}}التي نرغب في الحكم عليها.

ليكن المميز دالة من النوعصدأناs:ΩXم(ΩY){\displaystyle p_{dis}:\Omega _{X}\to M(\Omega _{Y})}أينم(ΩY){\displaystyle M(\Omega _{Y})}هي مجموعة جميع التوزيعات الاحتمالية علىΩY{\displaystyle \Omega _{Y}}لأي صورةx{\displaystyle x}وأي ملصقy{\displaystyle y}، يتركصدأناs(y|x){\displaystyle p_{dis}(y|x)}ليكن احتمال أن تكون الصورةx{\displaystyle x}يحتوي على ملصقy{\displaystyle y}، وفقًا للمميز. وعادةً ما يتم تنفيذه كشبكة Inception-v3 مدربة على ImageNet.

درجة البداية لـصزهـن{\displaystyle p_{gen}}بالنسبة إلىصدأناs{\displaystyle p_{dis}}يكونأناS(صزهـن،صدأناs):=خبرة(هـxصزهـن[دكل(صدأناs(|x)صدأناs(|x)صزهـن(x)دx)]){\displaystyle IS(p_{gen},p_{dis}):=\exp \left(\mathbb {E} _{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot |x)\|\int p_{dis}(\cdot |x)p_{gen}(x)dx\right)\right]\right)}تتضمن عمليات إعادة الصياغة المكافئة ما يلي:lnأناS(صزهـن،صدأناs):=هـxصزهـن[دكل(صدأناs(|x)هـxصزهـن[صدأناs(|x)])]{\displaystyle \ln IS(p_{gen},p_{dis}):=\mathbb {E} _{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot |x)\|\mathbb {E} _{x\sim p_{gen}}[p_{dis}(\cdot |x)]\right)\right]}lnأناS(صزهـن،صدأناs):=ح[هـxصزهـن[صدأناs(|x)]]-هـxصزهـن[ح[صدأناs(|x)]]{\displaystyle \ln IS(p_{gen},p_{dis}):=H[\mathbb {E} _{x\sim p_{gen}}[p_{dis}(\cdot |x)]]-\mathbb {E} _{x\sim p_{gen}}[H[p_{dis}(\cdot |x)]]}lnأناS{\displaystyle \ln IS}غير سالبة حسب متباينة جنسن .

الشفرة الزائفة:

مُعَرِّف الإدخالصدأناs{\displaystyle p_{dis}}.

مولد المدخلاتز{\displaystyle g}.

صور نموذجيةxأنا{\displaystyle x_{i}}من المولد.

الحوسبةصدأناs(|xأنا){\displaystyle p_{dis}(\cdot |x_{i})}، توزيع الاحتمالات على التصنيفات المشروطة بالصورةxأنا{\displaystyle x_{i}}.

اجمع النتائج للحصول علىص^{\displaystyle {\hat {p}}}، تقدير تجريبي لـصدأناs(|x)صزهـن(x)دx{\displaystyle \int p_{dis}(\cdot |x)p_{gen}(x)dx}.

شاهد المزيد من الصورxأنا{\displaystyle x_{i}}من المولد، ولكل منها، احسبدكل(صدأناs(|xأنا)ص^){\displaystyle D_{KL}\left(p_{dis}(\cdot |x_{i})\|{\hat {p}}\right)}.

قم بحساب متوسط ​​النتائج، ثم خذ القيمة الأسية لها.

أعد النتيجة.

تفسير

يُفسر ارتفاع درجة التقييم الأولي على أنه "أفضل"، لأنه يعني أنصزهـن{\displaystyle p_{gen}}هي مجموعة صور "واضحة ومميزة".

lnأناS(صزهـن،صدأناs)[0،lnشمال]{\displaystyle \ln IS(p_{gen},p_{dis})\in [0,\ln N]}، أينشمال{\displaystyle N}يمثل العدد الإجمالي للتسميات الممكنة.

lnأناS(صزهـن،صدأناs)=0{\displaystyle \ln IS(p_{gen},p_{dis})=0}iff بالنسبة للجميع تقريبًاxصزهـن{\displaystyle x\sim p_{gen}}صدأناs(|x)=صدأناs(|x)صزهـن(x)دx{\displaystyle p_{dis}(\cdot |x)=\int p_{dis}(\cdot |x)p_{gen}(x)dx}هذا يعنيصزهـن{\displaystyle p_{gen}}غير واضح تمامًا. أي بالنسبة لأي صورةx{\displaystyle x}عينة مأخوذة منصزهـن{\displaystyle p_{gen}}، يُعيد المُميّز نفس تنبؤات التصنيف تمامًاصدأناs(|x){\displaystyle p_{dis}(\cdot |x)}.

أعلى درجة بدايةشمال{\displaystyle N}يتحقق ذلك إذا وفقط إذا تحقق الشرطان معًا:

  • بالنسبة للجميع تقريباًxصزهـن{\displaystyle x\sim p_{gen}}، التوزيعصدأناs(y|x){\displaystyle p_{dis}(y|x)}يركز على علامة تجارية واحدة. أي،حy[صدأناs(y|x)]=0{\displaystyle H_{y}[p_{dis}(y|x)]=0}أي أن كل صورة مأخوذة منصزهـن{\displaystyle p_{gen}}يتم تصنيفها بدقة بواسطة أداة التمييز.
  • لكل علامة تجاريةy{\displaystyle y}، نسبة الصور المُولَّدة المصنفة على أنهاy{\displaystyle y}هو بالضبطهـxصزهـن[صدأناs(y|x)]=1شمال{\displaystyle \mathbb {E} _{x\sim p_{gen}}[p_{dis}(y|x)]={\frac {1}{N}}}أي أن الصور التي تم إنشاؤها موزعة بالتساوي على جميع التصنيفات.

مراجع

  1. ساليمانس، تيم؛ غودفيلو، إيان؛ زاريمبا، فويتشيك؛ تشيونغ، فيكي؛ رادفورد، أليك؛ تشين، شي؛ تشين، شي (2016). "تقنيات محسّنة لتدريب الشبكات التوليدية الخصومية" . التطورات في أنظمة معالجة المعلومات العصبية . 29. كوران أسوشيتس، إنك. arXiv : 1606.03498 .
  2. فرولوف، ستانيسلاف؛ هينز، توبياس؛ راو، فيديريكو؛ هيس، يورن؛ دينجل، أندرياس (ديسمبر 2021). " توليف الصور من النصوص باستخدام أساليب الخصومة: مراجعة" . الشبكات العصبية . 144 : 187-209 . arXiv : 2101.09983 . doi : 10.1016/j.neunet.2021.07.019 . PMID 34500257. S2CID 231698782 .  
  3. بورجي، علي (2022). "مزايا وعيوب مقاييس تقييم الشبكات التوليدية الخصومية: تطورات جديدة" . رؤية الحاسوب وفهم الصور . 215 103329. arXiv : 2103.09396 . doi : 10.1016/j.cviu.2021.103329 . S2CID 232257836 .