التسوية الدفعية

في الشبكات العصبية الاصطناعية ، يُعدّ تطبيع الدُفعات (المعروف أيضًا باسم معيار الدُفعات ) تقنية تطبيع تُستخدم لتسريع عملية التدريب وزيادة استقرارها من خلال تعديل مدخلات كل طبقة، وذلك بإعادة توسيطها حول الصفر وإعادة تحجيمها إلى حجم قياسي. وقد طُوّرت هذه التقنية من قِبل سيرجي يوف وكريستيان سيجيدي في عام 2015. [ 1 ]

لا يزال الخبراء يناقشون أسباب فعالية تقنية التطبيع الدفعي. كان يُعتقد في البداية أنها تعالج مشكلة انزياح المتغيرات الداخلية ، وهي مشكلة تؤثر فيها تهيئة المعلمات والتغيرات في توزيع مدخلات كل طبقة على معدل تعلم الشبكة. [ 1 ] ومع ذلك، تشير الأبحاث الحديثة إلى أنها لا تُصلح هذا الانزياح، بل تُحسّن دالة الهدف - وهي دليل رياضي تتبعه الشبكة لتحسين أدائها - مما يُعزز الأداء. [ 2 ] في الشبكات العميقة جدًا، قد يتسبب التطبيع الدفعي في البداية في تضخم حاد في التدرج - حيث تنمو تحديثات الشبكة بشكل غير قابل للتحكم - ولكن يتم التعامل مع هذا باستخدام اختصارات تُسمى وصلات التخطي في الشبكات المتبقية. [ 3 ] هناك نظرية أخرى تقول إن التطبيع الدفعي يُعدّل البيانات من خلال التعامل مع حجمها ومسارها بشكل منفصل، مما يُسرّع عملية التدريب. [ 4 ]

التحول الداخلي للمتغيرات المصاحبة

لكل طبقة في الشبكة العصبية مدخلات تتبع توزيعًا محددًا، يتغير أثناء التدريب نتيجة عاملين رئيسيين: القيم الأولية العشوائية لإعدادات الشبكة ( تهيئة المعلمات ) والتغير الطبيعي في بيانات الإدخال. يُطلق على نمط التغير هذا، الذي يؤثر على مدخلات الطبقات الداخلية للشبكة، اسم " انزياح المتغيرات الداخلية ". ورغم عدم وجود تعريف دقيق متفق عليه تمامًا، تُظهر التجارب أنه ينطوي على تغييرات في متوسطات وتباينات هذه المدخلات أثناء التدريب.

طُوِّرت تقنية التطبيع الدفعي في البداية لمعالجة مشكلة انزياح المتغيرات الداخلية. [ 1 ] أثناء التدريب، ومع تعديل معلمات الطبقات السابقة، يتغير توزيع المدخلات إلى الطبقة الحالية تبعًا لذلك، مما يستدعي إعادة ضبط الطبقة الحالية باستمرار لتتوافق مع التوزيعات الجديدة. وتبرز هذه المشكلة بشكل خاص في الشبكات العميقة، لأن التغيرات الطفيفة في الطبقات المخفية الأقل عمقًا تتضخم مع انتشارها داخل الشبكة، مما يؤدي إلى انزياح كبير في الطبقات المخفية الأعمق. وقد اقتُرحت تقنية التطبيع الدفعي للحد من هذه الانزياحات غير المرغوب فيها، بهدف تسريع التدريب وإنتاج نماذج أكثر موثوقية.

إلى جانب إمكانية معالجة انزياح المتغيرات الداخلية، يوفر التطبيع الدفعي العديد من المزايا الإضافية. فهو يسمح للشبكة باستخدام معدل تعلم أعلى - وهو إعداد يتحكم في سرعة تعلم الشبكة - دون التسبب في مشاكل مثل تلاشي أو انفجار التدرجات، حيث تصبح التحديثات صغيرة جدًا أو كبيرة جدًا. ويبدو أيضًا أن له تأثيرًا تنظيميًا، مما يحسن قدرة الشبكة على التعميم على بيانات جديدة، ويقلل الحاجة إلى التسرب ، وهي تقنية تُستخدم لمنع التجاوز (عندما يتعلم النموذج بيانات التدريب جيدًا جدًا ويفشل في التعامل مع البيانات الجديدة). بالإضافة إلى ذلك، فإن الشبكات التي تستخدم التطبيع الدفعي أقل حساسية لاختيار الإعدادات الأولية أو معدلات التعلم، مما يجعلها أكثر قوة وقابلية للتكيف.

إجراءات

تحويل

في الشبكات العصبية، يتم تحقيق توحيد الدُفعات من خلال خطوة توحيد تُثبّت متوسطات وتباينات مُدخلات كل طبقة. من الناحية المثالية، يُجرى التوحيد على مجموعة التدريب بأكملها، ولكن لاستخدام هذه الخطوة بالتزامن مع أساليب التحسين العشوائي ، يصبح من غير العملي استخدام المعلومات الشاملة. لذا، يقتصر التوحيد على كل دفعة صغيرة في عملية التدريب.

لنستخدم B للدلالة على دفعة صغيرة بحجم m من مجموعة التدريب بأكملها. وبالتالي ، يمكن التعبير عن المتوسط ​​والتباين التجريبيين لـ B على النحو التالي:

μب=1مأنا=1مxأنا{\displaystyle \mu _{B}={\frac {1}{m}}\sum _{i=1}^{m}x_{i}}وσب2=1مأنا=1م(xأنا-μب)2{\displaystyle \sigma _{B}^{2}={\frac {1}{m}}\sum _{i=1}^{m}(x_{i}-\mu _{B})^{2}}.

بالنسبة لطبقة من الشبكة ذات مدخلات ذات أبعاد d ،x=(x(1)،...،x(د)){\displaystyle x=(x^{(1)},...,x^{(d)})}ثم يتم تطبيع كل بُعد من أبعاد المدخلات (أي إعادة توسيطه وإعادة تحجيمه) بشكل منفصل،

x^أنا(ك)=xأنا(ك)-μب(ك)(σب(ك))2+ϵ{\displaystyle {\hat {x}}_{i}^{(k)}={\frac {x_{i}^{(k)}-\mu _{B}^{(k)}}{\sqrt {\left(\sigma _{B}^{(k)}\right)^{2}+\epsilon }}}}، أينك[1،د]{\displaystyle k\in [1,d]}و أنا[1،م]{\displaystyle i\in [1,m]}؛μب(ك){\displaystyle \mu _{B}^{(ك)}}وσب(ك){\displaystyle \sigma _{B}^{(k)}}يمثلان المتوسط ​​والانحراف المعياري لكل بُعد، على التوالي.

ϵ{\displaystyle \epsilon }تُضاف هذه القيمة إلى المقام لتحقيق الاستقرار العددي، وهي قيمة ثابتة موجبة صغيرة جدًا. والنتيجة هي التنشيط المعياريx^(ك){\displaystyle {\hat {x}}^{(ك)}}إذا كان متوسطها يساوي صفرًا وتباينها يساوي واحدًاϵ{\displaystyle \epsilon }لا يؤخذ ذلك في الاعتبار. لاستعادة قدرة تمثيل الشبكة، تتبع ذلك خطوة تحويل كما يلي:

yأنا(ك)=γ(ك)x^أنا(ك)+β(ك){\displaystyle y_{i}^{(k)}=\gamma ^{(k)}{\hat {x}}_{i}^{(k)}+\beta ^{(k)}}،

حيث المعلماتγ(ك){\displaystyle \gamma ^{(k)}}وβ(ك){\displaystyle \beta ^{(k)}}يتم تعلمها لاحقًا في عملية التحسين.

بصورة رسمية، فإن العملية التي تُنفذ عملية التطبيع الدفعي هي عملية تحويلبشمالγ(ك)،β(ك):x1...م(ك)y1...م(ك){\displaystyle BN_{\gamma ^{(k)},\beta ^{(k)}}:x_{1...m}^{(k)}\rightarrow y_{1...m}^{(k)}}يُطلق عليه اسم تحويل التطبيع الدفعي. ناتج تحويل التطبيع الدفعيy(ك)=بشمالγ(ك)،β(ك)(x(ك)){\displaystyle y^{(k)}=BN_{\gamma ^{(k)},\beta ^{(k)}}(x^{(k)})}ثم يتم تمريرها إلى طبقات الشبكة الأخرى، بينما يتم تطبيع الناتج x^أنا(ك){\displaystyle {\hat {x}}_{i}^{(k)}}يبقى داخل الطبقة الحالية.

الانتشار العكسي

إن تحويل BN الموصوف هو عملية قابلة للتفاضل ، وتدرج الخسارةل{\displaystyle l} يمكن حساب المعاملات المختلفة مباشرة باستخدام قاعدة السلسلة .

خاصة،لyأنا(ك){\displaystyle {\frac {\partial l}{\partial y_{i}^{(k)}}}}يعتمد ذلك على اختيار دالة التنشيط ، ويمكن التعبير عن التدرج مقابل المعلمات الأخرى كدالة لـلyأنا(ك){\displaystyle {\frac {\partial l}{\partial y_{i}^{(k)}}}}:

لx^أنا(ك)=لyأنا(ك)γ(ك){\displaystyle {\frac {\partial l}{\partial {\hat {x}}_{i}^{(k)}}}={\frac {\partial l}{\partial y_{i}^{(k)}}}\gamma ^{(k)}}،

لγ(ك)=أنا=1ملyأنا(ك)x^أنا(ك){\displaystyle {\frac {\partial l}{\partial \gamma ^{(k)}}}=\sum _{i=1}^{m}{\frac {\partial l}{\partial y_{i}^{(k)}}}{\hat {x}}_{i}^{(k)}}،لβ(ك)=أنا=1ملyأنا(ك){\displaystyle {\frac {\partial l}{\partial \beta ^{(k)}}}=\sum _{i=1}^{m}{\frac {\partial l}{\partial y_{i}^{(k)}}}}،لσب(ك)2=أنا=1ملyأنا(ك)(xأنا(ك)-μب(ك))(-γ(ك)2(σب(ك)2+ϵ)-3/2){\displaystyle {\frac {\partial l}{\partial \sigma _{B}^{(k)^{2}}}}=\sum _{i=1}^{m}{\frac {\partial l}{\partial y_{i}^{(k)}}}(x_{i}^{(k)}-\mu _{B}^{(k)})\left(-{\frac {\gamma ^{(k)}}{2}}(\sigma _{B}^{(k)^{2}}+\epsilon )^{-3/2}\right)}،لμب(ك)=أنا=1ملyأنا(ك)-γ(ك)σب(ك)2+ϵ+لσب(ك)21مأنا=1م(-2)(xأنا(ك)-μب(ك)){\displaystyle {\frac {\partial l}{\partial \mu _{B}^{(k)}}}=\sum _{i=1}^{m}{\frac {\partial l}{\partial y_{i}^{(k)}}}{\frac {-\gamma ^{(k)}}{\sqrt {\sigma _{B}^{(k)^{2}}+\epsilon }}}+{\frac {\partial l}{\partial \sigma _{B}^{(k)^{2}}}}{\frac {1}{m}}\sum _{i=1}^{m}(-2)\cdot (x_{i}^{(k)}-\mu _{B}^{(k)})}،

ولxأنا(ك)=لx^أنا(ك)1σب(ك)2+ϵ+لσب(ك)22(xأنا(ك)-μب(ك))م+لμب(ك)1م{\displaystyle {\frac {\partial l}{\partial x_{i}^{(k)}}}={\frac {\partial l}{\partial {\hat {x}}_{i}^{(k)}}}{\frac {1}{\sqrt {\sigma _{B}^{(k)^{2}}+\epsilon }}}+{\frac {\partial l}{\partial \sigma _{B}^{(k)^{2}}}}{\frac {2(x_{i}^{(k)}-\mu _{B}^{(k)})}{m}}+{\frac {\partial l}{\partial \mu _{B}^{(k)}}}{\frac {1}{m}}}.

الاستدلال

خلال مرحلة التدريب، تعتمد خطوات التطبيع على الدفعات الصغيرة لضمان تدريب فعال وموثوق. مع ذلك، في مرحلة الاستدلال، لا يكون لهذا الاعتماد فائدة. بدلاً من ذلك، تُحسب خطوة التطبيع في هذه المرحلة باستخدام إحصائيات المجتمع بحيث يمكن أن يعتمد الناتج على المدخلات بطريقة حتمية. متوسط ​​المجتمع،هـ[x(ك)]{\displaystyle E[x^{(k)}]}والتباين،متغير[x(ك)]{\displaystyle \operatorname {Var} [x^{(k)}]}، ويتم حسابها على النحو التالي:

هـ[x(ك)]=هـب[μب(ك)]{\displaystyle E[x^{(k)}]=E_{B}[\mu _{B}^{(k)}]}، ومتغير[x(ك)]=مم-1هـب[(σب(ك))2]{\displaystyle \operatorname {Var} [x^{(k)}]={\frac {m}{m-1}}E_{B}[\left(\sigma _{B}^{(k)}\right)^{2}]}.

وبالتالي فإن إحصاءات السكان تمثل تمثيلاً كاملاً للمجموعات الصغيرة.

وبالتالي يصبح تحويل BN في خطوة الاستدلال

y(ك)=بشمالγ(ك)،β(ك)معلومات(x(ك))=γ(ك)x(ك)-هـ[x(ك)]متغير[x(ك)]+ϵ+β(ك)// }}}+\بيتا ^{(ك)}}،

أينy(ك){\displaystyle y^{(k)}}يتم تمريرها إلى الطبقات التالية بدلاً منx(ك){\displaystyle x^{(k)}}بما أن المعلمات ثابتة في هذا التحويل، فإن إجراء التطبيع الدفعي يقوم أساسًا بتطبيق تحويل خطي على دالة التنشيط.

نظرية

على الرغم من شيوع استخدام تقنية التطبيع الدفعي نظرًا لأدائها التجريبي المتميز، إلا أن آلية عملها لا تزال غير مفهومة تمامًا. وقد أوضحت الورقة البحثية الأصلية [ 1 ] أن التطبيع الدفعي يعمل عن طريق تقليل انزياح المتغيرات الداخلية، إلا أن هذا التفسير قد تم دحضه في دراسات حديثة. في إحدى التجارب [ 5 تم تدريب شبكة VGG-16 [ 6 ] في ظل ثلاثة أنظمة تدريب مختلفة: النظام القياسي (بدون تطبيع دفعي)، والتطبيع الدفعي، والتطبيع الدفعي مع إضافة ضوضاء إلى كل طبقة أثناء التدريب. في النموذج الثالث، تتميز الضوضاء بمتوسط ​​غير صفري وتباين غير موحد، أي أنها تُدخل انزياحًا في المتغيرات بشكل صريح. ومع ذلك، فقد أظهر هذا النموذج دقة مماثلة للنموذج الثاني، بل وتفوق كلاهما على النموذج الأول، مما يشير إلى أن انزياح المتغيرات ليس هو السبب وراء تحسين التطبيع الدفعي للأداء.

يؤدي استخدام التسوية الدفعية إلى عدم كون العناصر في الدفعة مستقلة ومتطابقة التوزيع ، مما قد يؤدي إلى صعوبات في التدريب بسبب انخفاض جودة تقدير التدرج. [ 7 ]

نعومة

أحد التفسيرات البديلة [ 5 ] هو أن التحسن مع التسوية الدفعية يرجع بدلاً من ذلك إلى إنتاج مساحة معلمات أكثر سلاسة وتدرجات أكثر سلاسة، كما هو موضح رسميًا بواسطة ثابت ليبشيتز أصغر .

لنفترض وجود شبكتين متطابقتين، إحداهما تحتوي على طبقات تطبيع الدُفعات والأخرى لا تحتوي عليها، ثم تتم مقارنة سلوك هاتين الشبكتين. لنرمز إلى دوال الخسارة بـل^{\displaystyle {\hat {L}}}ول{\displaystyle L}على التوالي. لنفترض أن مدخلات الشبكتين هيx{\displaystyle x}ويكون الناتجy{\displaystyle y}، والتي من أجلهاy=دبليوx{\displaystyle y=Wx}، أيندبليو{\displaystyle W}تمثل هذه الأوزان الطبقة. أما بالنسبة للشبكة الثانية،y{\displaystyle y}بالإضافة إلى ذلك، يمر عبر طبقة تطبيع الدُفعات. يُرمز إلى التنشيط المُطَبَّع بـy^{\displaystyle {\hat {y}}}، والتي لها متوسط ​​صفر وتباين يساوي واحدًا. لنفترض أن التنشيط المحوّل هوz=γy^+β{\displaystyle z=\gamma {\hat {y}}+\beta }ولنفترضγ{\displaystyle \gamma }وβ{\displaystyle \beta }هي ثوابت. وأخيرًا، نرمز إلى الانحراف المعياري على دفعة صغيرةyج^Rم{\displaystyle {\hat {y_{j}}}\in \mathbb {R} ^{m}}مثلσج{\displaystyle \sigma _{j}}.

أولاً، يمكن إثبات أن مقدار التدرج لشبكة مُعَيَّرة على دفعات،||yأنال^||{\displaystyle ||\triangledown _{y_{i}}{\hat {L}}||}، محدودة، ويتم التعبير عن الحد على النحو التالي

||yأنال^||2γ2σج2(||yأنال||2-1م1،yأنال2-1مyأنال،y^ج2){\displaystyle ||\triangledown _{y_{i}}{\hat {L}}||^{2}\leq {\frac {\gamma ^{2}}{\sigma _{j}^{2}}}{\Bigg (}||\triangledown _{y_{i}}L||^{2}-{\frac {1}{m}}\langle 1,\triangledown _{y_{i}}L\rangle ^{2}-{\frac {1}{m}}\langle \triangledown _{y_{i}}L,{\hat {y}}_{j}\rangle ^{2}{\bigg )}}.

بما أن مقدار التدرج يمثل ثبات ليبشيتز للخسارة، فإن هذه العلاقة تشير إلى أن الشبكة المُعَيَّرة بالدُفعات يُمكن أن تُحقق ثبات ليبشيتز أكبر نسبيًا. لاحظ أن الحد يصبح أضيق عندما يكون التدرجyأنال^{\displaystyle \triangledown _{y_{i}}{\hat {L}}}يرتبط بالتنشيطyأنا^{\displaystyle {\hat {y_{i}}}}وهي ظاهرة شائعة. قياسγ2σج2{\displaystyle {\frac {\gamma ^{2}}{\sigma _{j}^{2}}}}كما أن ذلك مهم، لأن التباين غالباً ما يكون كبيراً.

ثانيًا، يمكن تحديد الشكل التربيعي لمصفوفة هيسيان الخسارة بالنسبة للتنشيط في اتجاه التدرج على النحو التالي:

(yجل^)تيل^yجyج(yجل^)γ2σ2(ل^yج)تي(لyجyج)(ل^yج)-γمσ2yجل،yج^||ل^yج||2{\displaystyle (\triangledown _{y_{j}}{\hat {L}})^{T}{\frac {\partial {\hat {L}}}{\partial y_{j}\partial y_{j}}}(\triangledown _{y_{j}}{\hat {L}})\leq {\frac {\gamma ^{2}}{\sigma ^{2}}}{\bigg (}{\frac {\partial {\hat {L}}}{\partial y_{j}}}{\bigg )}^{T}{\bigg (}{\frac {\partial L}{\partial y_{j}\partial y_{j}}}{\bigg )}{\bigg (}{\frac {\partial {\hat {L}}}{\partial y_{j}}}{\bigg )}-{\frac {\gamma }{m\sigma ^{2}}}\langle \triangledown _{y_{j}}L,{\hat {y_{j}}}\rangle {\bigg |}{\bigg |}{\frac {\partial {\hat {L}}}{\partial y_{j}}}{\bigg |}{\bigg |}^{2}}.

توسيع نطاقγ2σج2{\displaystyle {\frac {\gamma ^{2}}{\sigma _{j}^{2}}}}يشير هذا إلى أن مصفوفة هيسيان للخسارة مقاومة لتباين الدفعة المصغرة، بينما يشير الحد الثاني على الجانب الأيمن إلى أنها تصبح أكثر سلاسة عندما تكون مصفوفة هيسيان والضرب الداخلي غير سالبين. إذا كانت الخسارة محدبة محليًا ، فإن مصفوفة هيسيان تكون شبه موجبة ، بينما يكون الضرب الداخلي موجبًا إذازج^{\displaystyle {\hat {g_{j}}}}يتجه هذا الاتجاه نحو الحد الأدنى للخسارة. ومن ثم، يمكن استنتاج أن التدرج يصبح أكثر قدرة على التنبؤ بشكل عام مع طبقة التطبيع الدفعي.

ثم يتبع ذلك ترجمة الحدود المتعلقة بالخسارة فيما يتعلق بالتنشيط المعياري إلى حد للخسارة فيما يتعلق بأوزان الشبكة:

زج^γ2σج2(زج2-مμزج2-λ2yجل،y^ج2){\displaystyle {\hat {g_{j}}}\leq {\frac {\gamma ^{2}}{\sigma _{j}^{2}}}(g_{j}^{2}-m\mu _{g_{j}}^{2}-\lambda ^{2}\langle \triangledown _{y_{j}}L,{\hat {y}}_{j}\rangle ^{2})}، أينزج=مأx||X||λ||دبليول||2{\displaystyle g_{j}=max_{||X||\leq \lambda }||\triangledown _{W}L||^{2}}وز^ج=مأx||X||λ||دبليول^||2{\displaystyle {\hat {g}}_{j}=max_{||X||\leq \lambda }||\triangledown _{W}{\hat {L}}||^{2}}.

بالإضافة إلى تحسين سلاسة المشهد، فقد تبين أيضاً أن توحيد الدُفعات يمكن أن يؤدي إلى تهيئة أفضل مع المتباينة التالية:

||دبليو0-دبليو^*||2||دبليو0-دبليو*||2-1||دبليو*||2(||دبليو*||2-دبليو*،دبليو0)2{\displaystyle ||W_{0}-{\hat {W}}^{*}||^{2}\leq ||W_{0}-W^{*}||^{2}-{\frac {1}{||W^{*}||^{2}}}(||W^{*}||^{2}-\langle W^{*},W_{0}\rangle )^{2}}، أيندبليو*{\displaystyle W^{*}}ودبليو^*{\displaystyle {\hat {W}}^{*}}تمثل هذه القيم الأوزان المثلى المحلية للشبكتين، على التوالي.

يرى بعض الباحثين أن التحليل المذكور أعلاه لا يُغطي أداء عملية التطبيع الدفعي بشكل كامل، لأن البرهان يقتصر على أكبر قيمة ذاتية، أو ما يُعادلها، اتجاه واحد في المجال عند جميع النقاط. ويُقترح أخذ الطيف الذاتي الكامل في الاعتبار للوصول إلى تحليل قاطع. [ 8 ] [ 5 ]

يقيس

بما أنه يُفترض أن طبقات التطبيع الدفعي قد تُقلل من انزياح المتغيرات الداخلية، فقد أُجريت تجربة لقياس مقدار هذا الانخفاض كميًا. أولًا، يجب تعريف مفهوم انزياح المتغيرات الداخلية رياضيًا. تحديدًا، لتحديد مقدار التعديل الذي تُجريه معلمات الطبقة استجابةً للتحديثات في الطبقات السابقة، يُقاس الارتباط بين تدرجات دالة الخسارة قبل وبعد تحديث جميع الطبقات السابقة، إذ يُمكن للتدرجات أن تُجسد الانزياحات الناتجة عن طريقة التدريب من الدرجة الأولى. إذا كان الانزياح الناتج عن التغييرات في الطبقات السابقة صغيرًا، فسيكون الارتباط بين التدرجات قريبًا من 1.

تم حساب معامل الارتباط بين التدرجات لأربعة نماذج: شبكة VGG قياسية ، [ 6 ] وشبكة VGG مزودة بطبقات تسوية الدُفعات، وشبكة خطية عميقة (DLN) مكونة من 25 طبقة مُدرَّبة باستخدام خوارزمية التدرج الكامل، وشبكة DLN مزودة بطبقات تسوية الدُفعات. ومن المثير للاهتمام، أن النموذجين VGG القياسي وDLN يتميزان بمعاملات ارتباط أعلى بين التدرجات مقارنةً بنظيريهما، مما يشير إلى أن طبقات تسوية الدُفعات الإضافية لا تُقلل من انزياح المتغيرات الداخلية.

تدرجات متلاشية/متفجرة

على الرغم من أن تقنية التطبيع الدفعي قد طُرحت في الأصل للتخفيف من مشاكل تلاشي أو انفجار التدرج ، إلا أن شبكة التطبيع الدفعي العميق تعاني في الواقع من انفجار التدرج عند التهيئة، بغض النظر عن طريقة معالجة اللاخطية المستخدمة. وبالتالي، فإن مجال التحسين بعيد كل البعد عن السلاسة بالنسبة لشبكة التطبيع الدفعي العميق المُهيأة عشوائيًا. وبشكل أدق، إذا كانت الشبكةل{\displaystyle L}إذا كانت الطبقات، فإن تدرج أوزان الطبقة الأولى يكون له معيار>جλل{\displaystyle >c\lambda ^{L}}بالنسبة للبعضλ>1،ج>0{\displaystyle \lambda >1,c>0}يعتمد ذلك فقط على اللاخطية. لأي قيمة ثابتة للاخطية،λ{\displaystyle \lambda }يقلّ مع ازدياد حجم الدفعة. على سبيل المثال، بالنسبة لدالة ReLU،λ{\displaystyle \lambda }انخفاضات إلىπ/(π-1)1.467{\displaystyle \pi /(\pi -1)\approx 1.467}مع ازدياد حجم الدفعة إلى ما لا نهاية، يصبح من الصعب عمليًا تدريب شبكات التطبيع الدفعي العميق. ولا يُتغلب على هذه المشكلة إلا باستخدام وصلات التخطي على غرار الشبكات المتبقية . [ 9 ]

يتناقض هذا التزايد المفاجئ في التدرج على السطح مع خاصية النعومة الموضحة في القسم السابق، ولكنهما في الواقع متسقان. درس القسم السابق تأثير إدخال معيار دفعة واحد في الشبكة، بينما يعتمد التزايد المفاجئ في التدرج على تكديس معايير الدفعات، وهو أمر شائع في الشبكات العصبية العميقة الحديثة.

فك الارتباط

سبب آخر محتمل لنجاح عملية التطبيع الدفعي هو أنها تفصل بين طول واتجاه متجهات الوزن، وبالتالي تسهل التدريب بشكل أفضل.

من خلال تفسير معيار الدفعة على أنه إعادة تحديد معلمات فضاء الأوزان، يمكن إثبات أن طول الأوزان واتجاهها منفصلان، وبالتالي يمكن تدريبهما بشكل منفصل. بالنسبة لوحدة شبكة عصبية معينة ذات مدخلاتx{\displaystyle x}ومتجه الوزنw{\displaystyle w}، نرمز إلى مخرجاته بـو(w)=هـx[ϕ(xتيw)]{\displaystyle f(w)=E_{x}[\phi (x^{T}w)]}، أينϕ{\displaystyle \phi }هي دالة التنشيط، وS=هـ[xxتي]{\displaystyle S=E[xx^{T}]}افترض أنهـ[x]=0{\displaystyle E[x]=0}وأن طيف المصفوفةS{\displaystyle S}محدد بـ0<μ=λمأنان(S){\displaystyle 0<\mu =\lambda _{min}(S)}،ل=λمأx(S)<{\displaystyle L=\lambda _{max}(S)<\infty }بحيثS{\displaystyle S}هي متماثلة وموجبة تمامًا. وبالتالي، فإن إضافة تسوية الدُفعات إلى هذه الوحدة ينتج عنه

وبشمال(w،γ،β)=هـx[ϕ(بشمال(xتيw))]=هـx[ϕ(γ(xتيw-هـx[xتيw]vأرx[xتيw]1/2)+β)]{\displaystyle f_{BN}(w,\gamma ,\beta )=E_{x}[\phi (BN(x^{T}w))]=E_{x}{\bigg [}\phi {\bigg (}\gamma ({\frac {x^{T}w-E_{x}[x^{T}w]}{var_{x}[x^{T}w]^{1/2}}})+\beta {\bigg )}{\bigg ]}}، بحسب التعريف.

يمكن تبسيط حد التباين بحيثvأرx[xتيw]=wتيSw{\displaystyle var_{x}[x^{T}w]=w^{T}Sw}افترض أنx{\displaystyle x}متوسطه يساوي صفرًا وβ{\displaystyle \beta }إذا أمكن حذفها، فإن ذلك يترتب عليه أن

وبشمال(w،γ)=هـx[ϕ(γxتيw(wتيSw)1/2)]{\displaystyle f_{BN}(w,\gamma )=E_{x}{\bigg [}\phi {\bigg (}\gamma {\frac {x^{T}w}{(w^{T}Sw)^{1/2}}}{\bigg )}{\bigg ]}}، أين(wتيSw)12{\displaystyle (w^{T}Sw)^{\frac {1}{2}}}هو المعيار المستحث لـS{\displaystyle S}،||w||s{\displaystyle ||w||_{s}}.

وبالتالي، يمكن استنتاج أنوبشمال(w،γ)=هـx[ϕ(xتيw~)]{\displaystyle f_{BN}(w,\gamma )=E_{x}[\phi (x^{T}{\tilde {w}})]}، أينw~=γw||w||s{\displaystyle {\tilde {w}}=\gamma {\frac {w}{||w||_{s}}}}، وγ{\displaystyle \gamma }وw{\displaystyle w}يُراعى طولها واتجاهها بشكل منفصل. ويمكن استخدام هذه الخاصية لإثبات سرعة تقارب المسائل باستخدام التسوية الدفعية.

التقارب الخطي

مسألة المربعات الصغرى

باستخدام تفسير إعادة المعلمات، يمكن إثبات أن تطبيق التطبيع الدفعي على مشكلة المربعات الصغرى العادية يحقق معدل تقارب خطي في هبوط التدرج، وهو أسرع من هبوط التدرج العادي مع تقارب دون الخطي فقط.

لنرمز إلى هدف تقليل مشكلة المربعات الصغرى العادية بـ

مينw~RدويالS(w~)=مينw~Rد(هـx،y[(y-xتيw~)2])=مينw~Rد(2uتيw~+w~تيSw~){\displaystyle \min _{{\tilde {w}}\in R^{d}}f_{OLS}({\tilde {w}})=\min _{{\tilde {w}}\in R^{d}}(E_{x,y}[(y-x^{T}{\tilde {w}})^{2}])=\min _{{\tilde {w}}\in R^{d}}(2u^{T}{\tilde {w}}+{\tilde {w}}^{T}S{\tilde {w}})}، أينu=هـ[-yx]{\displaystyle u=E[-yx]}وS=هـ[xxتي]{\displaystyle S=E[xx^{T}]}.

منذw~=γw||w||s{\displaystyle {\tilde {w}}=\gamma {\frac {w}{||w||_{s}}}}وبذلك يصبح الهدف

مينwRد{0}،γRويالS(w،γ)=مينwRد{0}،γR(2γuتيw||w||S+γ2){\displaystyle \min _{w\in R^{d}\backslash \{0\},\gamma \in R}f_{OLS}(w,\gamma )=\min _{w\in R^{d}\backslash \{0\},\gamma \in R}{\bigg (}2\gamma {\frac {u^{T}w}{||w||_{S}+\gamma ^{2}}}{\bigg )}}، حيث يتم استبعاد الصفر لتجنب وجود الصفر في المقام.

بما أن الدالة الهدف محدبة بالنسبة إلىγ{\displaystyle \gamma }ويمكن حساب قيمتها المثلى عن طريق وضع المشتق الجزئي للدالة الهدف مقابلγ{\displaystyle \gamma }إلى صفر. ويمكن تبسيط الهدف أكثر ليصبح

مينwRد{0}ρ(w)=مينwRد{0}(-wتيuuتيwwتيSw){\displaystyle \min _{w\in R^{d}\backslash \{0\}}\rho (w)=\min _{w\in R^{d}\backslash \{0\}}{\bigg (}-{\frac {w^{T}uu^{T}w}{w^{T}Sw}}{\bigg )}}.

لاحظ أن هذا الهدف هو شكل من أشكال حاصل قسمة رايلي المعمم

ρ~(w)=wتيبwwتيأw{\displaystyle {\tilde {\rho }}(w)={\frac {w^{T}Bw}{w^{T}Aw}}}، أينبRد×د{\displaystyle B\in R^{d\times d}}هي مصفوفة متناظرة وأRد×د{\displaystyle A\in R^{d\times d}}هي مصفوفة متناظرة موجبة التحديد .

ثبت أن معدل تقارب انحدار التدرج لنسبة رايلي المعممة هو

λ1-ρ(wت+1)ρ(wت+1-λ2)(1-λ1-λ2λ1-λمأنان)2تλ1-ρ(wت)ρ(wت)-λ2{\displaystyle {\frac {\lambda _{1}-\rho (w_{t+1})}{\rho (w_{t+1}-\lambda _{2})}}\leq {\bigg (}1-{\frac {\lambda _{1}-\lambda _{2}}{\lambda _{1}-\lambda _{min}}}{\bigg )}^{2t}{\frac {\lambda _{1}-\rho (w_{t})}{\rho (w_{t})-\lambda _{2}}}}، أينλ1{\displaystyle \lambda _{1}}هي أكبر قيمة ذاتية لـب{\displaystyle B}،λ2{\displaystyle \lambda _{2}}هي ثاني أكبر قيمة ذاتية لـب{\displaystyle B}، وλمأنان{\displaystyle \lambda _{min}}هي أصغر قيمة ذاتية لـب{\displaystyle B}[ 10 ]

في حالتنا،ب=uuتي{\displaystyle B=uu^{T}}هي مصفوفة من الرتبة الأولى، ويمكن تبسيط نتيجة التقارب وفقًا لذلك. على وجه التحديد، ضع في اعتبارك خطوات انحدار التدرج من الشكل التالي:wت+1=wت-ηتρ(wت){\displaystyle w_{t+1}=w_{t}-\eta _{t}\triangledown \rho (w_{t})}مع حجم الخطوةηت=wتتيSwت2ل|ρ(wت)|{\displaystyle \eta _{t}={\frac {w_{t}^{T}Sw_{t}}{2L|\rho (w_{t})|}}}، وبدءاً منρ(w0)0{\displaystyle \rho (w_{0})\neq 0}، ثم

ρ(wت)-ρ(w*)(1-μل)2ت(ρ(w0)-ρ(w*)){\displaystyle \rho (w_{t})-\rho (w^{*})\leq {\bigg (}1-{\frac {\mu }{L}}{\bigg )}^{2t}(\rho (w_{0})-\rho (w^{*}))}.

مسائل تعلم نصف الفضاء

تُشير مشكلة تعلم أنصاف الفضاءات إلى تدريب البيرسيبترون ، وهو أبسط أشكال الشبكات العصبية. وتتمثل مشكلة التحسين في هذه الحالة في:

مينw~Rدولح(w~)=هـy،x[ϕ(zتيw~)]{\displaystyle \min _{{\tilde {w}}\in R^{d}}f_{LH}({\tilde {w}})=E_{y,x}[\phi (z^{T}{\tilde {w}})]}، أينz=-yx{\displaystyle z=-yx}وϕ{\displaystyle \phi }هي دالة خسارة اختيارية.

لنفترض أنϕ{\displaystyle \phi }دالة قابلة للتفاضل بلا حدود ولها مشتقة محدودة. افترض أن دالة الهدفولح{\displaystyle f_{LH}}يكونζ{\displaystyle \zeta }- سلس ، وهذا حلα*=أرزمأنانα||و(αw)||2{\displaystyle \alpha ^{*}=argmin_{\alpha }||\triangledown f(\alpha w)||^{2}}موجود ومحدود بحيث-<α*<{\displaystyle -\infty <\alpha ^{*}<\infty }افترض أيضًاz{\displaystyle z}هو متغير عشوائي طبيعي متعدد المتغيرات . بافتراض التوزيع الغاوسي، يمكن إثبات أن جميع النقاط الحرجة تقع على نفس الخط، لأي اختيار لدالة الخسارة.ϕ{\displaystyle \phi }. على وجه التحديد، تدرجولح{\displaystyle f_{LH}}يمكن تمثيلها على النحو التالي

w~ولح(w~)=ج1(w~)u+ج2(w~)Sw~{\displaystyle \triangledown _{\tilde {w}}f_{LH}({\tilde {w}})=c_{1}({\tilde {w}})u+c_{2}({\tilde {w}})S{\tilde {w}}}، أين ج1(w~)=هـz[ϕ(1)(zتيw~)]-هـz[ϕ(2)(zتيw~)](uتيw~){\displaystyle c_{1}({\tilde {w}})=E_{z}[\phi ^{(1)}(z^{T}{\tilde {w}})]-E_{z}[\phi ^{(2)}(z^{T}{\tilde {w}})](u^{T}{\tilde {w}})}،ج2(w~)=هـz[ϕ(2)(zتيw~)]{\displaystyle c_{2}({\tilde {w}})=E_{z}[\phi ^{(2)}(z^{T}{\tilde {w}})]}، وϕ(أنا){\displaystyle \phi ^{(i)}}هوأنا{\displaystyle i}المشتقة النونية لـϕ{\displaystyle \phi }.

وبجعل التدرج يساوي صفرًا، يترتب على ذلك أن النقاط الحرجة المحدودةw~*{\displaystyle {\tilde {w}}_{*}}يمكن التعبير عنها على النحو التاليw~*=ز*S-1u{\displaystyle {\tilde {w}}_{*}=g_{*}S^{-1}u}، أينز*{\displaystyle g_{*}}يعتمد علىw~*{\displaystyle {\tilde {w}}_{*}}وϕ{\displaystyle \phi }. وبدمج هذه الخاصية العالمية مع فصل اتجاه الطول، يمكن إثبات أن مشكلة التحسين هذه تتقارب خطيًا.

أولاً، تم تصميم نوع مختلف من خوارزمية التدرج الهبوطي مع تطبيع الدُفعات، وهو التدرج الهبوطي في المعلمات المُطَبَّعة (GDNP)، لدالة الهدف.مينwRد{0}،γRولح(w،γ){\displaystyle \min _{w\in R^{d}\backslash \{0\},\gamma \in R}f_{LH}(w,\gamma )}بحيث يتم تحديث اتجاه وطول الأوزان بشكل منفصل. لنرمز إلى معيار إيقاف GDNP بـ

ح(wت،γت)=هـz[ϕ(zتيw~ت)](uتيwت)-هـz[ϕ"(zتيw~ت)](uتيwت)2{\displaystyle h(w_{t},\gamma _{t})=E_{z}[\phi '(z^{T}{\tilde {w}}_{t})](u^{T}w_{t})-E_{z}[\phi ''(z^{T}{\tilde {w}}_{t})](u^{T}w_{t})^{2}}.

لنفترض أن حجم الخطوة هو

sت=s(wت،γت)=-||wت||S3لزتح(wت،γت){\displaystyle s_{t}=s(w_{t},\gamma _{t})=-{\frac {||w_{t}||_{S}^{3}}{Lg_{t}h(w_{t},\gamma _{t})}}}.

لكل خطوة، إذاح(wت،γت)0{\displaystyle h(w_{t},\gamma _{t})\neq 0}ثم قم بتحديث الاتجاه كما يلي

wت+1=wت-sتwو(wت،γت){\displaystyle w_{t+1}=w_{t}-s_{t}\triangledown _{w}f(w_{t},\gamma _{t})}.

ثم قم بتحديث الطول وفقًا لـ

γت=التنصيف(تيs،و،wت){\displaystyle \gamma _{t}={\text{Bisection}}(T_{s},f,w_{t})}، أينالتنصيف(){\displaystyle {\text{Bisection()}}}هي خوارزمية التنصيف الكلاسيكية ، وتيs{\displaystyle T_{s}}يمثل إجمالي عدد التكرارات التي تم تشغيلها في خطوة التنصيف.

لنرمز إلى العدد الإجمالي للتكرارات بـتيد{\displaystyle T_{d}}إذن، الناتج النهائي لـ GDNP هو

w~تيد=γتيدwتيد||wتيد||S{\displaystyle {\tilde {w}}_{T_{d}}=\gamma _{T_{d}}{\frac {w_{T_{d}}}{||w_{T_{d}}||_{S}}}}.

وبالتالي، فإن خوارزمية GDNP تقوم بتعديل خطوة تطبيع الدفعات بشكل طفيف لتسهيل التحليل الرياضي.

يمكن إثبات أنه في GDNP، المشتق الجزئي لـولح{\displaystyle f_{LH}}يتقارب عنصر الطول إلى الصفر بمعدل خطي، بحيث

(γولح(wت،أت(تيs))22-تيsζ|بت(0)-أت(0)|μ2{\displaystyle (\partial _{\gamma }f_{LH}(w_{t},a_{t}^{(T_{s})})^{2}\leq {\frac {2^{-T_{s}}\zeta |b_{t}^{(0)}-a_{t}^{(0)}|}{\mu ^{2}}}}، أينأت(0){\displaystyle a_{t}^{(0)}}وبت0{\displaystyle b_{t}^{0}}هما نقطتا البداية لخوارزمية التنصيف على اليسار وعلى اليمين، على التوالي.

علاوة على ذلك، لكل تكرار، معيار تدرجولح{\displaystyle f_{LH}}بالنسبة إلىw{\displaystyle w}يتقارب خطيًا، بحيث

||wت||S2||ولح(wت،زت)||S-12(1-μل)2تΦ2γت2(ρ(w0)-ρ*){\displaystyle ||w_{t}||_{S}^{2}||\triangledown f_{LH}(w_{t},g_{t})||_{S^{-1}}^{2}\leq {\bigg (}1-{\frac {\mu }{L}}{\bigg )}^{2t}\Phi ^{2}\gamma _{t}^{2}(\rho (w_{0})-\rho ^{*})}.

وبدمج هاتين المتباينتين، يمكن بالتالي الحصول على حد للتدرج بالنسبة إلىw~تيد{\displaystyle {\tilde {w}}_{T_{d}}}:

||w~و(w~تيد)||2(1-μل)2تيدΦ2(ρ(w0)-ρ*)+2-تيsζ|بت(0)-أت(0)|μ2{\displaystyle ||\triangledown _{\tilde {w}}f({\tilde {w}}_{T_{d}})||^{2}\leq {\bigg (}1-{\frac {\mu }{L}}{\bigg )}^{2T_{d}}\Phi ^{2}(\rho (w_{0})-\rho ^{*})+{\frac {2^{-T_{s}}\zeta |b_{t}^{(0)}-a_{t}^{(0)}|}{\mu ^{2}}}}، بحيث يكون من المضمون أن تتقارب الخوارزمية خطيًا.

على الرغم من أن البرهان يعتمد على افتراض المدخلات الغاوسية، إلا أنه تم إثبات ذلك أيضًا في التجارب التي أظهرت أن GDNP يمكن أن يسرع عملية التحسين بدون هذا القيد.

الشبكات العصبية

لنفترض وجود شبكة عصبية متعددة الطبقات (MLP) ذات طبقة مخفية واحدة وم{\displaystyle m}وحدات مخفية مع تعيين من المدخلاتxRد{\displaystyle x\in R^{d}}إلى ناتج قياسي موصوف على النحو التالي

Fx(دبليو~،Θ)=أنا=1مθأناϕ(xتيw~(أنا)){\displaystyle F_{x}({\tilde {W}},\Theta )=\sum _{i=1}^{m}\theta _{i}\phi (x^{T}{\tilde {w}}^{(i)})}، أينw~(أنا){\displaystyle {\tilde {w}}^{(i)}}وθأنا{\displaystyle \theta _{i}}تمثل أوزان المدخلات والمخرجات للوحدةأنا{\displaystyle i}وبالمثل، وϕ{\displaystyle \phi }هي دالة التنشيط ويُفترض أنها دالة tanh .

ويمكن بعد ذلك تحسين أوزان الإدخال والإخراج باستخدام

ميندبليو~،Θ(وشمالشمال(دبليو~،Θ)=هـy،x[ل(-yFx(دبليو~،Θ))]){\displaystyle \min _{{\tilde {W}},\Theta }(f_{NN}({\tilde {W}},\Theta )=E_{y,x}[l(-yF_{x}({\tilde {W}},\Theta ))])}، أينل{\displaystyle l}هي دالة خسارة،دبليو~={w~(1)،...،w~(م)}{\displaystyle {\tilde {W}}=\{{\tilde {w}}^{(1)},...,{\tilde {w}}^{(m)}\}}، وΘ={θ(1)،...،θ(م)}{\displaystyle \Theta =\{\theta ^{(1)},...,\theta ^{(m)}\}}.

ضع في اعتبارك الثابتΘ{\displaystyle \Theta }والتحسين فقطدبليو~{\displaystyle {\tilde {W}}}، يمكن إثبات أن النقاط الحرجة لـوشمالشمال(دبليو~){\displaystyle f_{NN}({\tilde {W}})}وحدة مخفية معينةأنا{\displaystyle i}،w^(أنا){\displaystyle {\hat {w}}^{(i)}}تصطف جميعها على خط واحد اعتمادًا على المعلومات الواردة إلى الطبقة المخفية، بحيث

w^(أنا)=ج^(أنا)S-1u{\displaystyle {\hat {w}}^{(i)}={\hat {c}}^{(i)}S^{-1}u}، أينج^(أنا)R{\displaystyle {\hat {c}}^{(i)}\in R}هو كمية قياسية،أنا=1،...،م{\displaystyle i=1,...,m}.

يمكن إثبات هذه النتيجة عن طريق تحديد تدرجوشمالشمال{\displaystyle f_{NN}}إلى الصفر وحل نظام المعادلات.

طبّق خوارزمية GDNP على مسألة التحسين هذه عن طريق التناوب بين عمليات التحسين على الوحدات المخفية المختلفة. تحديدًا، لكل وحدة مخفية، شغّل خوارزمية GDNP لإيجاد الحل الأمثل.دبليو{\displaystyle W}وγ{\displaystyle \gamma }باختيار نفس معيار التوقف وحجم الخطوة، يترتب على ذلك ما يلي:

||w~(أنا)و(w~ت(أنا))||S-12(1-μل)2تج(ρ(w0)-ρ*)+2-تيs(أنا)ζ|بت(0)-أت(0)|μ2{\displaystyle ||\triangledown _{{\tilde {w}}^{(i)}}f({\tilde {w}}_{t}^{(i)})||_{S^{-1}}^{2}\leq {\bigg (}1-{\frac {\mu }{L}}{\bigg )}^{2t}C(\rho (w_{0})-\rho ^{*})+{\frac {2^{-T_{s}^{(i)}}\zeta |b_{t}^{(0)}-a_{t}^{(0)}|}{\mu ^{2}}}}.

بما أن معلمات كل وحدة مخفية تتقارب خطيًا، فإن مسألة التحسين بأكملها لها معدل تقارب خطي. [ 8 ]

مراجع

  1. 1 2 3 4 إيوف، سيرجي؛ سيجيدي، كريستيان (2015). "التطبيع الدفعي: تسريع تدريب الشبكات العميقة عن طريق تقليل تحول المتغيرات الداخلية". arXiv : 1502.03167 [ cs.LG ].
  2. سانتوركار، شيباني؛ تسيبراس، ديميتريس؛ إلياس، أندرو؛ مادري، ألكسندر (29 مايو 2018). "كيف يُسهم توحيد الدُفعات في التحسين؟". arXiv : 1805.11604 [ stat.ML ].
  3. يانغ، غريغ؛ بينينغتون، جيفري؛ راو، فيناي؛ سول-ديكستين، ياشا؛ شونهولز، صموئيل س. (2019). "نظرية المجال المتوسط ​​للتطبيع الدفعي". arXiv : 1902.08129 [ cs.NE ].
  4. كولر، جوناس؛ دانشمند، هادي؛ لوتشي، أوريليان؛ تشو، مينغ؛ نيمير، كلاوس؛ هوفمان، توماس (27 مايو 2018). "معدلات التقارب الأسي لتطبيع الدفعات: قوة فصل الطول عن الاتجاه في التحسين غير المحدب". arXiv : 1805.10694 [ stat.ML ].
  5. 1 2 3 سانتوركار، شيباني؛ تسيبراس، ديميتريس؛ إلياس، أندرو؛ مادري، ألكسندر (29 مايو 2018). "كيف يُسهم توحيد الدُفعات في تحسين الأداء؟". arXiv : 1805.11604 [ stat.ML ].
  6. 1 2 سيمونيان، كارين؛ أندرو، زيسرمان (2014). "شبكات الالتفاف العميق للغاية للتعرف على الصور واسعة النطاق". arXiv : 1409.1556 [ cs.CV ].
  7. با، ج.، كيروس، جيه آر، وهينتون، جي إي (2016). توحيد الطبقات. ArXiv، abs/1607.06450.
  8. 1 2 كولر، جوناس؛ دانشمند، هادي؛ لوتشي، أوريليان؛ تشو، مينغ؛ نيمير، كلاوس؛ هوفمان، توماس (27 مايو 2018). "معدلات التقارب الأسي للتطبيع الدفعي: قوة فصل الطول عن الاتجاه في التحسين غير المحدب". arXiv : 1805.10694 [ stat.ML ].
  9. يانغ، غريغ؛ بينينغتون، جيفري؛ راو، فيناي؛ سول-ديكستين، ياشا؛ شونهولز، صموئيل س. (2019). "نظرية المجال المتوسط ​​للتطبيع الدفعي". arXiv : 1902.08129 [ cs.NE ].
  10. كنيازيف، نيمير (2003). "نظرية هندسية للتكرار العكسي المُهيأ مسبقًا III: تقدير تقارب قصير ودقيق لمسائل القيم الذاتية المعممة" . الجبر الخطي وتطبيقاته . 358 ( 1-3 ): 95-114 . doi : 10.1016/S0024-3795(01)00461-X .

للمزيد من القراءة

  • إيوف، سيرجي؛ سيجيدي، كريستيان (2015). "التطبيع الدفعي: تسريع تدريب الشبكات العميقة عن طريق تقليل تحول المتغيرات الداخلية"، ICML'15: وقائع المؤتمر الدولي الثاني والثلاثين للتعلم الآلي - المجلد 37، يوليو 2015، الصفحات 448-456
  • سيمونيان، كارين؛ زيسرمان، أندرو (2014). "شبكات الالتفاف العميقة جدًا للتعرف على الصور واسعة النطاق". arXiv : 1409.1556 [ cs.CV ].