نموذج الصورة العميقة

تُعدّ تقنية "الاستباق العميق للصورة" نوعًا من الشبكات العصبية الالتفافية، تُستخدم لتحسين صورة معينة دون الحاجة إلى بيانات تدريب مسبقة سوى الصورة نفسها. تُهيأ الشبكة العصبية عشوائيًا وتُستخدم كبيانات مسبقة لحلّ مسائل عكسية مثل تقليل التشويش ، وتحسين الدقة الفائقة ، وترميم الصور . تُستخلص إحصائيات الصورة من خلال بنية مولد الصور الالتفافي، وليس من خلال أي قدرات مُكتسبة مسبقًا.

طريقة

خلفية

يمكن صياغة المسائل العكسية مثل تقليل الضوضاء ، وتحسين الدقة الفائقة ، وإعادة بناء الصور كمهمة تحسين.x*=مأنانxهـ(x؛x0)+R(x){\displaystyle x^{*}=min_{x}E(x;x_{0})+R(x)}، أينx{\displaystyle x}هي صورة،x0{\displaystyle x_{0}}تمثيل مشوه لتلك الصورة،هـ(x؛x0){\displaystyle E(x;x_{0})}هو مصطلح بيانات يعتمد على المهمة، و R(x) هو المنظم .

تتعلم الشبكات العصبية العميقة مولد/مفكك شفرةx=وθ(z){\displaystyle x=f_{\theta }(z)}والذي يرسم متجه رمز عشوائيz{\displaystyle z}إلى صورةx{\displaystyle x}.

طريقة تشويه الصورة المستخدمة في الإنشاءx0{\displaystyle x_{0}}يتم اختيارها للتطبيق المحدد.

تفاصيل

في هذا النهج،R(x){\displaystyle R(x)}يتم استبدال الاحتمال المسبق بالاحتمال المسبق الضمني الذي تم التقاطه بواسطة الشبكة العصبية (حيثR(x)=0{\displaystyle R(x)=0}بالنسبة للصور التي يمكن إنتاجها بواسطة الشبكات العصبية العميقة وR(x)=+{\displaystyle R(x)=+\infty }وإلا). وهذا يُعطي معادلة المُصغِّرθ*=أرزمأنانθهـ(وθ(z)؛x0){\displaystyle \theta ^{*}=argmin_{\theta }E(f_{\theta }(z);x_{0})}ونتيجة عملية التحسينx*=وθ*(z){\displaystyle x^{*}=f_{\theta ^{*}}(z)}.

أداة التصغيرθ*{\displaystyle \theta ^{*}}(عادةً ما تكون خوارزمية انحدار التدرج ) تبدأ من معلمات مُهيأة عشوائيًا وتنحدر إلى أفضل نتيجة محلية لتحقيقx*{\displaystyle x^{*}}وظيفة الاستعادة.

الإفراط في التخصيص

يمكن استخدام المعامل θ لاستعادة أي صورة، بما في ذلك التشويش. مع ذلك، تميل الشبكة إلى تجنب التقاط التشويش لاحتوائه على مقاومة عالية، بينما تتميز الإشارة المفيدة بمقاومة منخفضة. ينتج عن ذلك اقتراب قيمة المعامل θ من قيمة مثلى محلية جيدة المظهر ، طالما بقي عدد التكرارات في عملية التحسين منخفضًا بما يكفي لتجنب فرط التخصيص للبيانات.

نموذج الشبكة العصبية العميقة

عادةً، يستخدم نموذج الشبكة العصبية العميقة لتحليل الصور نموذجًا مشابهًا لشبكة U-Net، ولكن بدون وصلات الربط التي تربط وحدات التشفير بوحدات فك التشفير. ويذكر الباحثون في ورقتهم البحثية أن "نتائجنا هنا (وفي مقارنات أخرى مماثلة) تشير إلى أن امتلاك بنية أعمق أمر مفيد، وأن وجود وصلات الربط التي تعمل بكفاءة عالية في مهام التعرف (مثل التجزئة الدلالية) أمر ضار للغاية." [ 1 ]

التطبيقات

إزالة الضوضاء

مبدأ إزالة التشويش هو استعادة الصورةx{\displaystyle x}من خلال ملاحظة صاخبةx0{\displaystyle x_{0}}، أينx0=x+ϵ{\displaystyle x_{0}=x+\epsilon }التوزيعϵ{\displaystyle \epsilon }يُعرف أحيانًا (على سبيل المثال: ضوضاء مستشعر التنميط والفوتون [ 2 ] ) ويمكن دمجه اختياريًا في النموذج، على الرغم من أن هذه العملية تعمل بشكل جيد في إزالة الضوضاء العمياء.

دالة الطاقة التربيعيةهـ(x،x0)=||x-x0||2{\displaystyle E(x,x_{0})=||x-x_{0}||^{2}}يُستخدم كمعامل بيانات، ويتم إدخاله في معادلة لـθ*{\displaystyle \theta ^{*}}ينتج عن ذلك مشكلة التحسينمأنانθ||وθ(z)-x0||2{\displaystyle min_{\theta }||f_{\theta }(z)-x_{0}||^{2}}.

دقة فائقة

تُستخدم تقنية الدقة الفائقة لإنشاء نسخة ذات دقة أعلى من الصورة س. يتم ضبط مصطلح البيانات علىهـ(x؛x0)=||د(x)-x0||2{\displaystyle E(x;x_{0})=||d(x)-x_{0}||^{2}}حيث أن d(·) هو عامل تقليل حجم العينة مثل Lanczos الذي يقلل حجم الصورة بمعامل t.

إعادة التلوين

تُستخدم تقنية ترميم الصور لإعادة بناء منطقة مفقودة في الصورة.x0{\displaystyle x_{0}}تُعرَّف هذه البكسلات المفقودة بأنها القناع الثنائيم{0،1}ح×V{\displaystyle m\in \{0,1\}^{H\times V}}يُعرَّف مصطلح البيانات على النحو التالي:هـ(x؛x0)=||(x-x0)م||2{\displaystyle E(x;x_{0})=||(x-x_{0})\odot m||^{2}}(أين{\displaystyle \odot }(هو منتج هادامارد ).

يكمن المنطق وراء ذلك في أن الخسارة تُحسب فقط على وحدات البكسل المعروفة في الصورة، وستتعلم الشبكة ما يكفي عن الصورة لملء الأجزاء غير المعروفة منها حتى وإن لم تشمل الخسارة المحسوبة تلك الوحدات. تُستخدم هذه الاستراتيجية لإزالة العلامات المائية من الصور بمعاملة العلامة المائية على أنها وحدات بكسل مفقودة.

إعادة بناء الصورة باستخدام الفلاش وبدون فلاش

يمكن تطبيق هذا النهج على صور متعددة. ومن الأمثلة البسيطة التي ذكرها المؤلف إعادة بناء صورة للحصول على إضاءة طبيعية ووضوح من صورة ملتقطة بفلاش وأخرى بدونه. إعادة بناء الفيديو ممكنة، لكنها تتطلب تحسينات لمراعاة الاختلافات المكانية.

التطبيقات

مثال

انظر صورة علم الفلك لليوم (APOD) بتاريخ 2024-02-18 [ 4 ]

مراجع

  1. أوليانوف، ديمتري؛ فيدالدي، أندريا؛ ليمبيتسكي، فيكتور (يوليو 2020). "المعلومات المسبقة العميقة للصور" (ملف PDF) . المجلة الدولية لرؤية الحاسوب . 128 (7): 1867-1888 . arXiv : 1711.10925 . doi : 10.1007/s11263-020-01303-4 . ISSN 0920-5691 . 
  2. jo (2012-12-11). "تحليل ضوضاء المستشعر والفوتون .. وكيفية التخلص منها" . darktable.
  3. "DmitryUlyanov/Deep-image-prior" . GitHub . 3 يونيو 2021.
  4. "صورة اليوم الفلكية" .
  • أوليانوف، ديمتري؛ فيدالدي، أندريا؛ ليمبيتسكي، فيكتور (30 نوفمبر 2017). "المعلومات المسبقة للصورة العميقة". arXiv : 1711.10925v2 [ cs.CV ].