ستايلجان

شبكة الخصومة التوليدية للأنماط ، أو StyleGAN اختصارًا، هي امتداد لبنية GAN التي قدمها باحثو Nvidia في ديسمبر 2018، [ 1 ] وتم إتاحة المصدر في فبراير 2019. [ 2 ] [ 3 ]
يعتمد StyleGAN على برنامج CUDA من Nvidia ، ووحدات معالجة الرسومات (GPUs)، و TensorFlow من Google ، [ 4 ] أو PyTorch من Meta AI ، الذي يحل محل TensorFlow كمكتبة التنفيذ الرسمية في الإصدارات اللاحقة من StyleGAN. [ 5 ] نُشر الإصدار الثاني من StyleGAN، المسمى StyleGAN2، في 5 فبراير 2020. وقد أزال بعض التشوهات المميزة وحسّن جودة الصورة. [ 6 ] [ 7 ] أطلقت Nvidia الإصدار StyleGAN3، الذي وُصف بأنه إصدار "خالٍ من التعرجات"، في 23 يونيو 2021، وأتاحت شفرة المصدر في 12 أكتوبر 2021. [ 8 ]
تاريخ
يُعد Progressive GAN سلفًا مباشرًا لسلسلة StyleGAN، وقد نُشر في عام 2017. [ 9 ]
في ديسمبر 2018، نشر باحثو شركة إنفيديا ورقة بحثية أولية مصحوبة ببرنامج يُعرّف بـ StyleGAN، وهي شبكة GAN لإنتاج عدد غير محدود من الصور (التي غالبًا ما تكون مقنعة) لوجوه بشرية مزيفة . وقد تمكنت StyleGAN من العمل على معالجات الرسومات (GPU) التجارية من إنفيديا.
في فبراير 2019، استخدم فيليب وانغ، مهندس شركة أوبر ، البرنامج لإنشاء موقع " هذا الشخص غير موجود" ، الذي كان يعرض وجهًا جديدًا مع كل إعادة تحميل للصفحة. [ 10 ] [ 11 ] وقد أعرب وانغ نفسه عن دهشته، نظرًا لأن البشر مُهيّؤون لفهم وجوه البشر تحديدًا، من قدرة StyleGAN على "تحليل جميع السمات ذات الصلة (بالوجوه البشرية) وإعادة تركيبها بطريقة متماسكة". [ 12 ]
في سبتمبر 2019، نشر موقع إلكتروني يُدعى "Generated Photos" مئة ألف صورة كمجموعة من الصور المخزنة . [ 13 ] وقد جُمعت هذه المجموعة باستخدام مجموعة بيانات خاصة تم التقاطها في بيئة مضبوطة بإضاءة وزوايا متشابهة. [ 14 ]
وبالمثل، استخدم اثنان من أعضاء هيئة التدريس في كلية المعلومات بجامعة واشنطن برنامج StyleGAN لإنشاء مشروع " أي وجه حقيقي؟" ، الذي تحدى الزوار للتمييز بين وجه مزيف وآخر حقيقي جنبًا إلى جنب. [ 11 ] وذكر عضوا هيئة التدريس أن الهدف كان "توعية الجمهور" بوجود هذه التقنية حتى يكونوا حذرين منها، "تمامًا كما أدرك معظم الناس في النهاية أنه يمكن التلاعب بالصور باستخدام برنامج فوتوشوب". [ 15 ]
تم نشر الإصدار الثاني من StyleGAN، المسمى StyleGAN2، في 5 فبراير 2020. وهو يزيل بعض التشوهات المميزة ويحسن جودة الصورة. [ 6 ] [ 7 ]
في عام 2021، تم إصدار نسخة ثالثة، حسّنت التناسق بين التفاصيل الدقيقة والخشنة في المولد. وقد تم تنفيذ هذه النسخة، التي أُطلق عليها اسم "خالية من التشويش"، باستخدام PyTorch . [ 16 ]
الاستخدام غير المشروع
في ديسمبر 2019، أزالت فيسبوك شبكة من الحسابات ذات الهويات المزيفة، وذكرت أن بعضها استخدم صورًا شخصية تم إنشاؤها باستخدام تقنيات التعلم الآلي. [ 17 ]
بنيان
شبكة توليدية تقدمية
تُعدّ شبكة GAN التدريجية [ 9 ] طريقةً لتدريب شبكات GAN لتوليد الصور على نطاق واسع بثبات، وذلك من خلال تنمية مولد GAN من نطاق صغير إلى نطاق كبير بطريقة هرمية. ومثل شبكة SinGAN، تُقسّم هذه الطريقة المولد إلى أجزاء أصغر.والمميز كـ.
أثناء التدريب، في البداية فقطتُستخدم في لعبة GAN لإنشاء صور بحجم 4x4. ثمتتم إضافتها للوصول إلى المرحلة الثانية من لعبة GAN، لتوليد صور بحجم 8x8، وهكذا، حتى نصل إلى لعبة GAN لتوليد صور بحجم 1024x1024.
لتجنب عدم الاستمرارية بين مراحل لعبة الشبكة التوليدية الخصومية (GAN)، يتم دمج كل طبقة جديدة (الشكل 2 من الورقة البحثية [ 9 ] ). على سبيل المثال، هكذا تبدأ المرحلة الثانية من لعبة الشبكة التوليدية الخصومية:
- قبل ذلك مباشرة، تتكون لعبة GAN من الزوجتوليد وتمييز الصور بحجم 4x4.
- بعد ذلك مباشرة، تتكون لعبة GAN من الزوجتوليد وتمييز الصور بحجم 8x8. هنا، الوظائفهي وظائف تكبير وتصغير الصور، وهو عامل مزج (يشبه إلى حد كبير ألفا في تكوين الصور) ينتقل بسلاسة من 0 إلى 1.
ستايلجان

تم تصميم StyleGAN كمزيج من GAN التدريجي مع نقل الأنماط العصبية . [ 18 ]
يتمثل الخيار المعماري الرئيسي لـ StyleGAN-1 في آلية نمو تدريجي، على غرار Progressive GAN. تبدأ كل صورة مُولَّدة كقيمة ثابتة [ ملاحظة 1 ]يتم تمرير المصفوفة بشكل متكرر عبر كتل الأنماط. تُطبق كل كتلة نمط "متجه نمط كامن" عبر تحويل أفيني ("تطبيع الحالة التكيفي")، على غرار كيفية استخدام نقل الأنماط العصبية لمصفوفة غراميان . ثم تُضاف الضوضاء، ويتم التطبيع (طرح المتوسط، ثم القسمة على التباين).
في وقت التدريب، عادة ما يتم استخدام متجه نمط كامن واحد فقط لكل صورة يتم إنشاؤها، ولكن في بعض الأحيان يتم استخدام اثنين ("التنظيم المختلط") من أجل تشجيع كل كتلة نمط على أداء نمطها بشكل مستقل دون توقع مساعدة من كتل الأنماط الأخرى (لأنها قد تتلقى متجه نمط كامن مختلف تمامًا).
بعد التدريب، يمكن إدخال متجهات كامنة متعددة للأنماط في كل كتلة نمط. تتحكم المتجهات التي تُدخل إلى الطبقات السفلية في الأنماط واسعة النطاق، بينما تتحكم المتجهات التي تُدخل إلى الطبقات العليا في أنماط التفاصيل الدقيقة.
مزج الأنماط بين صورتينيمكن تنفيذ ذلك أيضًا. أولًا، قم بتشغيل خوارزمية التدرج الهبوطي للعثور علىبحيثيُطلق على هذا اسم "إسقاط الصورة مرة أخرى إلى فضاء النمط الكامن ". ثم،يمكن إدخالها إلى كتل الأنماط السفلية، وإلى كتل الأنماط الأعلى، لإنشاء صورة مركبة ذات نمط واسع النطاق منوأسلوب التفاصيل الدقيقة لـويمكن أيضاً تجميع صور متعددة بهذه الطريقة.
ستايلجان2
يتفوق StyleGAN2 على StyleGAN بطريقتين.
أولًا، يطبق هذا الأسلوب متجه النمط الكامن لتحويل أوزان طبقة الالتفاف، وبالتالي يحل مشكلة "البقعة". [ 19 ] وتكمن مشكلة "البقعة" باختصار في أن استخدام متجه النمط الكامن لتطبيع الصورة المُولَّدة يُفقدها معلومات مفيدة. ونتيجةً لذلك، تعلَّم المُولِّد إنشاء "تشتيت" بواسطة بقعة كبيرة، تمتص معظم تأثير التطبيع (يشبه إلى حد ما استخدام الشعلات لتشتيت صاروخ موجه حراريًا ).
ثانيًا، يستخدم هذا الأسلوب وصلات متبقية، مما يساعده على تجنب ظاهرة تعطل بعض الميزات عند فواصل بكسلات. على سبيل المثال، قد يتعطل الخط الفاصل بين سنين عند بكسلات تقبل القسمة على 32، لأن المولد تعلم توليد الأسنان خلال المرحلة N-5، وبالتالي لم يتمكن من توليد سوى أسنان أولية في تلك المرحلة، قبل تكبيرها 5 مرات (وبالتالي فواصل 32).
تم تحديث هذا بواسطة StyleGAN2-ADA ("ADA" اختصار لـ "التكيفي")، [ 20 ] الذي يستخدم تقنية زيادة البيانات القابلة للعكس . كما أنه يضبط مقدار زيادة البيانات المطبقة بالبدء من الصفر، وزيادته تدريجيًا حتى تصل " الخوارزمية الاستدلالية للتجاوز " إلى مستوى مستهدف، ومن هنا جاءت تسمية "التكيفي".
ستايلجان3
يُحسّن نموذج StyleGAN3 [ 21 ] من نموذج StyleGAN2 بحلّ مشكلة "التصاق النسيج"، والتي يمكن ملاحظتها في الفيديوهات الرسمية. [ 22 ] وقد حلّلوا المشكلة باستخدام نظرية نايكويست-شانون لأخذ العينات ، وجادلوا بأن الطبقات في المُولّد تعلّمت استغلال الإشارة عالية التردد في البكسلات التي تعمل عليها.
لحل هذه المشكلة، اقترحوا فرض مرشحات تمرير منخفضة صارمة بين طبقات كل مولد، بحيث يُجبر المولد على التعامل مع البكسلات بطريقة تتوافق مع الإشارات المتصلة التي تمثلها، بدلاً من التعامل معها كإشارات منفصلة فقط. كما فرضوا ثباتًا دورانيًا وانتقاليًا باستخدام المزيد من مرشحات الإشارة . وبذلك، أصبح بإمكان StyleGAN-3 الناتج توليد صور تدور وتنتقل بسلاسة، دون أي تشويش في النسيج.
انظر أيضاً
ملحوظات
- ↑ يتم تعلمها أثناء التدريب، ولكن بعد ذلك يتم تثبيتها، تمامًا مثل متجه الانحياز.
مراجع
- ↑ "GAN 2.0: مولد الوجوه الواقعية للغاية من NVIDIA" . SyncedReview.com . 14 ديسمبر 2018. تم الاطلاع عليه في 3 أكتوبر 2019 .
- ↑ "إنفيديا تُطلق برنامج StyleGAN مفتوح المصدر لتوليد الوجوه فائقة الواقعية" . Medium.com . 9 فبراير 2019. تاريخ الاطلاع: 3 أكتوبر 2019 .
- ↑ بيشيزا، روب (15 فبراير 2019). "هذا الشخص غير موجود" . بوينغ بوينغ . تم الاسترجاع في 16 فبراير 2019 .
- ↑ لارابيل، مايكل (10 فبراير 2019). "إنفيديا تفتح شفرة StyleGAN - أنشئ صورًا عائلية خاصة بك باستخدام الذكاء الاصطناعي" . Phoronix.com . تم الاطلاع عليه في 3 أكتوبر 2019 .
- ↑ "هل تبحث عن إصدار PyTorch؟ - Stylegan2" . github.com . 28 أكتوبر 2021. تم الاطلاع عليه في 5 أغسطس 2022 .
- 1 2 "توليف صور عالية الدقة باستخدام StyleGAN2 - مركز أخبار مطوري NVIDIA" . news.developer.nvidia.com . 17 يونيو 2020. تم الاطلاع عليه بتاريخ 11 أغسطس 2020 .
- 1 2 NVlabs/stylegan2 ، مشاريع بحثية لشركة NVIDIA، 11 أغسطس 2020 ، تم الاطلاع عليه في 11 أغسطس 2020
- ↑ كاكار، شوبها (13 أكتوبر 2021). "إنفيديا للذكاء الاصطناعي تُطلق StyleGAN3: شبكات توليدية معادية خالية من التشويه" . مارك تك بوست . تم الاطلاع عليه في 14 أكتوبر 2021 .
- 1 2 3 كاراس، تيرو؛ آيلا، تيمو؛ لاين، سامولي؛ ليتينين، جاكو (2018). "النمو التدريجي لشبكات GAN لتحسين الجودة والاستقرار والتنوع" . المؤتمر الدولي حول تمثيلات التعلم . arXiv : 1710.10196 .
- ↑ msmash، غير متوفر (14 فبراير 2019). "موقع "هذا الشخص غير موجود" يستخدم الذكاء الاصطناعي لإنشاء وجوه واقعية لكنها مرعبة . سلاش دوت . تاريخ الاطلاع: ١٦ فبراير ٢٠١٩ .
- 1 2 فليشمان، جلين (30 أبريل 2019). "كيفية اكتشاف الأشخاص المزيفين الواقعيين الذين يتسللون إلى صفحاتك على مواقع التواصل الاجتماعي" . فاست كومباني . تم الاطلاع عليه في 7 يونيو 2020 .
- ↑ بيشوب، كاتي (7 فبراير 2020). "الذكاء الاصطناعي في صناعة الأفلام الإباحية: قد يضمّ هذا النوع من الأفلام قريباً أشخاصاً غير موجودين" . صحيفة الغارديان . تاريخ الاطلاع: 8 يونيو 2020 .
- ↑ بورتر، جون (20 سبتمبر 2019). "100,000 صورة شخصية مجانية مُولّدة بالذكاء الاصطناعي تُنذر شركات الصور الفوتوغرافية" . ذا فيرج . تم الاطلاع عليه في 4 أغسطس 2020 .
- ↑ تيمينز، جين ويكفيلد وبيث (29 فبراير 2020). "هل يمكن استخدام تقنية التزييف العميق لتدريب موظفي المكاتب؟" . بي بي سي نيوز . تم الاطلاع عليه في 4 أغسطس 2020 .
- ↑ فينسنت، جيمس (3 مارس 2019). "هل يمكنك التمييز بين وجه حقيقي ووجه مزيف تم إنشاؤه بواسطة الذكاء الاصطناعي؟" . ذا فيرج . تم الاطلاع عليه في 8 يونيو 2020 .
- ↑ NVlabs/stylegan3 ، مشاريع أبحاث NVIDIA، 11 أكتوبر 2021
- ↑ "أحدث إجراءات فيسبوك لمكافحة المحتوى تتضمن تطوراً جديداً - صور الملف الشخصي المُولّدة بالذكاء الاصطناعي" . ABC News . تم الاطلاع عليه بتاريخ 4 أغسطس 2020 .
- ↑ كاراس، تيرو؛ لاين، سامولي؛ آيلا، تيمو (2019). "بنية مولد قائمة على الأسلوب لشبكات الخصومة التوليدية" (ملف PDF) . مؤتمر IEEE/CVF لعام 2019 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 4396-4405 . arXiv : 1812.04948 . doi : 10.1109/CVPR.2019.00453 . ISBN 978-1-7281-3293-8. S2CID 54482423 .
- ^ كراس، تيرو؛ لين، سامولي؛ أيتالا، ميكا؛ هيلستن، جان. ليهتينن، جاكو؛ ايلا ، تيمو (2020). "تحليل وتحسين جودة صورة StyleGAN" (PDF) . مؤتمر IEEE/CVF لعام 2020 حول الرؤية الحاسوبية والتعرف على الأنماط (CVPR) . IEEE. ص 8107 – 8116. أرخايف : 1912.04958 . دوى : 10.1109/CVPR42600.2020.00813 . رقم ISBN 978-1-7281-7168-5. S2CID 209202273 .
- ^ تيرو ، كراس. ميكا، أيتالا؛ جان، هيلستن؛ سامولي، لين؛ جاكو، ليهتينن؛ تيمو، أيلا (2020). "تدريب شبكات الخصومة التوليدية ببيانات محدودة" . التقدم في أنظمة معالجة المعلومات العصبية . 33 .
- ^ كراس، تيرو. أيتالا، ميكا؛ لين، سامولي؛ هاركونن، إريك؛ هيلستن، جان. ليهتينن، جاكو؛ ايلا ، تيمو (2021). شبكات الخصومة التوليدية الخالية من الأسماء المستعارة (PDF) . التقدم في أنظمة معالجة المعلومات العصبية .
- ^ كراس، تيرو. أيتالا، ميكا؛ لين، سامولي؛ هاركونن، إريك؛ هيلستن، جان. ليهتينن، جاكو؛ ايلا، تيمو. "شبكات الخصومة التوليدية الخالية من الاسم المستعار (StyleGAN3)" . nvlabs.github.io . تم الاسترجاع في 16 يوليو 2022 .
روابط خارجية
- مؤسسات عام 2018
- تطبيقات برمجيات التعلم العميق
- رسومات الحاسوب
- الواقع الافتراضي
- تطبيقات رؤية الحاسوب
