دوال الخسارة للتصنيف

دوال الخسارة المتسقة مع بايز: خسارة الصفر والواحد (رمادي)، خسارة سافاج (أخضر)، خسارة لوجستية (برتقالي)، خسارة أسية (بنفسجي)، خسارة مماسية (بني)، خسارة مربعة (أزرق)

في مجال التعلم الآلي والتحسين الرياضي ، تُعدّ دوال الخسارة للتصنيف دوال خسارة قابلة للتطبيق حسابيًا، تمثل الثمن المدفوع مقابل عدم دقة التنبؤات في مسائل التصنيف (مسائل تحديد الفئة التي تنتمي إليها ملاحظة معينة). [ 1 ] بالنظر إلىX{\displaystyle {\mathcal {X}}}باعتبارها مساحة جميع المدخلات الممكنة (عادةًXRد{\displaystyle {\mathcal {X}}\subset \mathbb {R} ^{d}})، وY={-1،1}{\displaystyle {\mathcal {Y}}=\{-1,1\}}باعتبارها مجموعة من التصنيفات (المخرجات المحتملة)، يتمثل الهدف النموذجي لخوارزميات التصنيف في إيجاد دالةو:XY{\displaystyle f:{\mathcal {X}}\to {\mathcal {Y}}}أيهما يتنبأ بشكل أفضل بالتصنيف؟y{\displaystyle y}بالنسبة لمدخل معينx{\displaystyle {\vec {x}}}[ 2 ] ومع ذلك ، ونظرًا لنقص المعلومات، أو التشويش في القياس، أو المكونات الاحتمالية في العملية الأساسية، فمن الممكن أن يحدث الشيء نفسه.x{\displaystyle {\vec {x}}}لتوليد مختلفy{\displaystyle y}[ 3 ] ونتيجة لذلك ، فإن هدف مشكلة التعلم هو تقليل الخسارة المتوقعة (المعروفة أيضًا باسم المخاطرة)، والتي تُعرَّف على النحو التالي:

أنا[و]=X×YV(و(x)،y)ص(x،y)دxدy{\displaystyle I[f]=\displaystyle \int _{{\mathcal {X}}\times {\mathcal {Y}}}V(f({\vec {x}}),y)\,p({\vec {x}},y)\,d{\vec {x}}\,dy}

أينV(و(x)،y){\displaystyle V(f({\vec {x}}),y)}دالة الخسارة المعطاة، و ص(x،y){\displaystyle p({\vec {x}},y)}هي دالة كثافة الاحتمال للعملية التي ولّدت البيانات، والتي يمكن كتابتها بشكل مكافئ على النحو التالي:

ص(x،y)=ص(y|x)ص(x).{\displaystyle p({\vec {x}},y)=p(y\mid {\vec {x}})p({\vec {x}}).}

في مجال التصنيف، تُكتب العديد من دوال الخسارة الشائعة الاستخدام فقط بدلالة حاصل ضرب التصنيف الحقيقيy{\displaystyle y}والتصنيف المتوقعو(x){\displaystyle f({\vec {x}})}لذلك، يمكن تعريفها على أنها دوال لمتغير واحد فقط.υ=yو(x){\displaystyle \upsilon =yf({\vec {x}})}، لهذا السببV(و(x)،y)=ϕ(yو(x))=ϕ(υ){\displaystyle V(f({\vec {x}}),y)=\phi (yf({\vec {x}}))=\phi (\upsilon )}بوظيفة مختارة بشكل مناسبϕ:RR{\displaystyle \phi :\mathbb {R} \to \mathbb {R} } . تُسمى هذه دوال الخسارة القائمة على الهامش . اختيار دالة خسارة قائمة على الهامش يعني اختيارϕ{\displaystyle \phi }يؤثر اختيار دالة الخسارة ضمن هذا الإطار على الحل الأمثلوϕ*{\displaystyle f_{\phi }^{*}}مما يقلل من المخاطر المتوقعة، انظر إلى تقليل المخاطر التجريبية .

في حالة التصنيف الثنائي، من الممكن تبسيط حساب المخاطر المتوقعة من التكامل المحدد أعلاه. على وجه التحديد،

أنا[و]=X×YV(و(x)،y)ص(x،y)دxدy=XYϕ(yو(x))ص(y|x)ص(x)دyدx=X[ϕ(و(x))ص(1|x)+ϕ(-و(x))ص(-1|x)]ص(x)دx=X[ϕ(و(x))ص(1|x)+ϕ(-و(x))(1-ص(1|x))]ص(x)دx$$ {Y}}\phi (yf({\vec {x}}))\,p(y\mid {\vec {x}})\,p({\vec {x}})\,dy\,d{\vec {x}}\\[6pt]&=\int _{\mathcal {X}}[\phi (f({\vec {x}}))\,p(1\mid {\vec {x}})+\phi (-f({\vec {x}}))\,p(-1\mid {\vec {x})]\,p({\vec {x}})\,d{\vec {x}}\\[6pt]&=\int _{\mathcal {X}}[\phi (f({\vec {x}}))\,p(1\mid {\vec {x}})+\phi (-f({\vec) {x}}))\,(1-p(1\mid {\vec {x}))]\,p({\vec {x}})\,d{\vec {x}}\end{محاذاة}}}

تنتج المساواة الثانية من الخصائص المذكورة أعلاه. أما المساواة الثالثة فتنتج من حقيقة أن 1 و -1 هما القيمتان الوحيدتان الممكنتان لـy{\displaystyle y}والرابع لأنص(-1|x)=1-ص(1|x){\displaystyle p(-1\mid x)=1-p(1\mid x)}المصطلح الموجود بين قوسين[ϕ(و(x))ص(1|x)+ϕ(-و(x))(1-ص(1|x))]{\displaystyle [\phi (f({\vec {x}}))p(1\mid {\vec {x}})+\phi (-f({\vec {x}}))(1-p(1\mid {\vec {x}}))]}يُعرف باسم المخاطر المشروطة.

يمكن إيجاد القيمة الصغرى لـأنا[و]{\displaystyle I[f]}بأخذ المشتقة الوظيفية للمساواة الأخيرة بالنسبة إلىو{\displaystyle f}وبجعل المشتقة تساوي صفرًا، سينتج عن ذلك المعادلة التالية

ϕ(و)وη+ϕ(-و)و(1-η)=0،(1){\displaystyle {\frac {\partial \phi (f)}{\partial f}}\eta +{\frac {\partial \phi (-f)}{\partial f}}(1-\eta )=0,\;\;\;\;\;(1)}

أينη=ص(y=1|x){\displaystyle \eta =p(y=1|{\vec {x}})}وهذا يعادل أيضاً جعل مشتق المخاطرة الشرطية يساوي صفرًا.

بالنظر إلى الطبيعة الثنائية للتصنيف، فإنّ الاختيار الطبيعي لدالة الخسارة (بافتراض تساوي تكلفة النتائج الإيجابية الخاطئة والنتائج السلبية الخاطئة ) سيكون دالة الخسارة 0-1 ( دالة المؤشر 0-1 )، والتي تأخذ القيمة 0 إذا كان التصنيف المتوقع مساويًا للفئة الحقيقية، أو القيمة 1 إذا كان التصنيف المتوقع لا يتطابق مع الفئة الحقيقية. ويتم نمذجة هذا الاختيار بواسطة

V(و(x)،y)=ح(-yو(x)){\displaystyle V(f({\vec {x}}),y)=H(-yf({\vec {x}}))}

أينح{\displaystyle H}يشير هذا إلى دالة هيفسايد المتدرجة . مع ذلك، فإن دالة الخسارة هذه غير محدبة وغير ملساء، وإيجاد الحل الأمثل لها يُعدّ مسألة تحسين توافقي صعبة الحل (NP-hard) . [ 4 ] ونتيجةً لذلك، يُفضّل استبدالها بدوال بديلة للخسارة، والتي يسهل التعامل معها في خوارزميات التعلّم الشائعة، لما تتمتع به من خصائص ملائمة كالتحدب والسلاسة. إضافةً إلى سهولة حسابها، يُمكن إثبات أن حلول مسألة التعلّم باستخدام هذه الدوال البديلة للخسارة تسمح باستعادة الحل الأصلي لمسألة التصنيف. [ 5 ] بعض هذه الدوال البديلة موصوفة أدناه.

عملياً، التوزيع الاحتماليص(x،y){\displaystyle p({\vec {x}},y)}غير معروف. وبالتالي، باستخدام مجموعة تدريب منن{\displaystyle n}نقاط عينة موزعة بشكل مستقل ومتطابق

S={(x1،y1)،...،(xن،yن)}{\displaystyle S=\{({\vec {x}}_{1},y_{1}),\dots ,({\vec {x}}_{n},y_{n})\}}

يسعى المرء، من خلال اختيار البيانات من فضاء العينة ، إلى تقليل المخاطر التجريبية.

أناS[و]=1نأنا=1نV(و(xأنا)،yأنا){\displaystyle I_{S}[f]={\frac {1}{n}}\sum _{i=1}^{n}V(f({\vec {x}}_{i}),y_{i})}

كبديل للمخاطر المتوقعة. [ 3 ] (انظر نظرية التعلم الإحصائي للحصول على وصف أكثر تفصيلاً.)

اتساق بايز

باستخدام نظرية بايز ، يمكن إثبات أن الأمثلو0/1*{\displaystyle f_{0/1}^{*}}أي، تلك التي تقلل من المخاطر المتوقعة المرتبطة بخسارة الصفر أو الواحد، وتطبق قاعدة القرار الأمثل لبايز لمشكلة التصنيف الثنائي، وتكون على شكل

و0/1*(x)={1لو ص(1|x)>ص(-1|x)0لو ص(1|x)=ص(-1|x)-1لو ص(1|x)<ص(-1|x){\displaystyle f_{0/1}^{*}({\vec {x}})\;=\;{\begin{cases}\;\;\;1&{\text{if }}p(1\mid {\vec {x}})>p(-1\mid {\vec {x}})\\\;\;\;0&{\text{if }}p(1\mid {\vec {x}})=p(-1\mid {\vec {x}})\\-1&{\text{if }}p(1\mid {\vec {x}})<p(-1\mid {\vec {x}})\end{cases}}}.

يُقال إن دالة الخسارة مُعايرة للتصنيف أو متسقة مع بايز إذا كانت مثاليةوϕ*{\displaystyle f_{\phi }^{*}}بحيثو0/1*(x)=علامة(وϕ*(x)){\displaystyle f_{0/1}^{*}({\vec {x}})=\operatorname {sgn} (f_{\phi }^{*}({\vec {x}}))}وبالتالي فهي الأمثل وفقًا لقاعدة قرار بايز. تسمح لنا دالة الخسارة المتسقة مع بايز بإيجاد دالة القرار الأمثل وفقًا لبايز.وϕ*{\displaystyle f_{\phi }^{*}}من خلال تقليل المخاطر المتوقعة بشكل مباشر ودون الحاجة إلى نمذجة دوال كثافة الاحتمال بشكل صريح.

بالنسبة لخسارة الهامش المحدبϕ(υ){\displaystyle \phi (\upsilon )}، ويمكن إثبات ذلكϕ(υ){\displaystyle \phi (\upsilon )}تكون نظرية بايز متسقة إذا وفقط إذا كانت قابلة للتفاضل عند الصفر وϕ(0)<0{\displaystyle \phi '(0)<0}[ 6 ] [ 1 ] ومع ذلك، لا تستبعد هذه النتيجة وجود دوال خسارة متسقة مع بايز غير محدبة. وتنص نتيجة أكثر عمومية على أنه يمكن توليد دوال خسارة متسقة مع بايز باستخدام الصيغة التالية [ 7 ]

ϕ(v)=ج[و-1(v)]+(1-و-1(v))ج[و-1(v)](2){\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]\;\;\;\;\;(2)}،

أينو(η)،(0η1){\displaystyle f(\eta ),(0\leq \eta \leq 1)}هي أي دالة قابلة للعكس بحيثو-1(-v)=1-و-1(v){\displaystyle f^{-1}(-v)=1-f^{-1}(v)}وج(η){\displaystyle C(\eta )}هي أي دالة قابلة للتفاضل مقعرة تمامًا بحيثج(η)=ج(1-η){\displaystyle C(\eta )=C(1-\eta )}يُظهر الجدول الأول دوال الخسارة المتسقة مع بايز التي تم إنشاؤها لبعض الخيارات النموذجية لـج(η){\displaystyle C(\eta )}وو-1(v){\displaystyle f^{-1}(v)}لاحظ أن دالتي خسارة سافاج وتانجنت ليستا محدبتين. وقد ثبت أن دوال الخسارة غير المحدبة هذه مفيدة في التعامل مع القيم الشاذة في التصنيف. [ 7 ] [ 8 ] بالنسبة لجميع دوال الخسارة المولدة من (2)، فإن الاحتمال اللاحقص(y=1|x){\displaystyle p(y=1|{\vec {x}})}يمكن إيجادها باستخدام دالة الربط العكسي كما يلي ص(y=1|x)=η=و-1(v){\displaystyle p(y=1|{\vec {x}})=\eta =f^{-1}(v)}تُسمى دوال الخسارة هذه، التي يمكن استعادة الاحتمالية اللاحقة فيها باستخدام الرابط القابل للعكس، دوال الخسارة المناسبة .

الجدول الأول
اسم الخسارةϕ(v){\displaystyle \phi (v)}ج(η){\displaystyle C(\eta )}و-1(v){\displaystyle f^{-1}(v)}و(η){\displaystyle f(\eta )}
النمو الأسيهـ-v{\displaystyle e^{-v}}2η(1-η){\displaystyle 2{\sqrt {\eta (1-\eta )}}}هـ2v1+هـ2v{\displaystyle {\frac {e^{2v}}{1+e^{2v}}}}12سجل(η1-η){\displaystyle {\frac {1}{2}}\log({\frac {\eta }{1-\eta }})}
الخدمات اللوجستية1سجل(2)سجل(1+هـ-v){\displaystyle {\frac {1}{\log(2)}}\log(1+e^{-v})}1سجل(2)[-ηسجل(η)-(1-η)سجل(1-η)]{\displaystyle {\frac {1}{\log(2)}}[-\eta \log(\eta )-(1-\eta )\log(1-\eta )]}هـv1+هـv{\displaystyle {\frac {e^{v}}{1+e^{v}}}}سجل(η1-η){\displaystyle \log({\frac {\eta }{1-\eta }})}
مربع(1-v)2{\displaystyle (1-v)^{2}}4η(1-η){\displaystyle 4\eta (1-\eta )}12(v+1){\displaystyle {\frac {1}{2}}(v+1)}2η-1{\displaystyle 2\eta -1}
متوحش1(1+هـv)2{\displaystyle {\frac {1}{(1+e^{v})^{2}}}}η(1-η){\displaystyle \eta (1-\eta )}هـv1+هـv{\displaystyle {\frac {e^{v}}{1+e^{v}}}}سجل(η1-η){\displaystyle \log({\frac {\eta }{1-\eta }})}
مماس(2دالة الظل العكسي(v)-1)2{\displaystyle (2\arctan(v)-1)^{2}}4η(1-η){\displaystyle 4\eta (1-\eta )}دالة الظل العكسي(v)+12{\displaystyle \arctan(v)+{\frac {1}{2}}}لون برونزي(η-12){\displaystyle \tan(\eta -{\frac {1}{2}})}

الجهة الوحيدة التي تقلل من المخاطر المتوقعة،وϕ*{\displaystyle f_{\phi }^{*}}يمكن إيجاد القيم المرتبطة بدوال الخسارة المولدة أعلاه مباشرةً من المعادلة (1)، وإثبات أنها تساوي القيم المقابلة لها.و(η){\displaystyle f(\eta )}ينطبق هذا حتى على دوال الخسارة غير المحدبة، مما يعني أنه يمكن استخدام الخوارزميات القائمة على انحدار التدرج مثل تعزيز التدرج لإنشاء المصغر.

وظائف الخسارة المناسبة، وهامش الخسارة، والتنظيم

(أحمر) الخسارة اللوجستية القياسية (γ=1،μ=2{\displaystyle \gamma =1,\mu =2}) و(الأزرق) زيادة هامش الخسارة اللوجستية (γ=0.2{\displaystyle \gamma =0.2})

بالنسبة لدوال الخسارة المناسبة، يمكن تعريف هامش الخسارة على النحو التالي:μϕ=-ϕ(0)ϕ"(0){\displaystyle \mu _{\phi }=-{\frac {\phi '(0)}{\phi ''(0)}}}وقد ثبت ارتباطها المباشر بخصائص التنظيم للمصنف. [ 9 ] على وجه التحديد، فإن دالة الخسارة ذات الهامش الأكبر تزيد من التنظيم وتنتج تقديرات أفضل للاحتمالية اللاحقة. على سبيل المثال، يمكن زيادة هامش الخسارة للخسارة اللوجستية عن طريق إدخالγ{\displaystyle \gamma }المعلمة وكتابة الخسارة اللوجستية على النحو التالي1γسجل(1+هـ-γv){\displaystyle {\frac {1}{\gamma }}\log(1+e^{-\gamma v})}حيث أصغر0<γ<1{\displaystyle 0<\gamma <1}يزيد من هامش الخسارة. وقد تبين أن هذا يعادل مباشرةً تقليل معدل التعلم في تعزيز التدرج.Fم(x)=Fم-1(x)+γحم(x)،{\displaystyle F_{m}(x)=F_{m-1}(x)+\gamma h_{m}(x),}حيث يتناقصγ{\displaystyle \gamma }يُحسّن هذا من تنظيم المصنف المُعزز. وتوضح النظرية أنه عندما يكون معدل التعلمγ{\displaystyle \gamma }عند استخدام الصيغة الصحيحة لاسترجاع الاحتمالية اللاحقة، تصبح الصيغة الصحيحة هيη=و-1(γF(x)){\displaystyle \eta =f^{-1}(\gamma F(x))}.

وختاماً، باختيار دالة خسارة ذات هامش أكبر (أصغر)γ{\displaystyle \gamma }) نقوم بزيادة التنظيم وتحسين تقديراتنا للاحتمالية اللاحقة مما يؤدي بدوره إلى تحسين منحنى ROC للمصنف النهائي.

خسارة مربعة

على الرغم من شيوع استخدامها في الانحدار، إلا أنه يمكن إعادة كتابة دالة الخسارة التربيعية كدالةϕ(yو(x)){\displaystyle \phi (yf({\vec {x}}))}ويمكن استخدامها للتصنيف. ويمكن توليدها باستخدام (2) والجدول الأول كما يلي

ϕ(v)=ج[و-1(v)]+(1-و-1(v))ج[و-1(v)]=4(12(v+1))(1-12(v+1))+(1-12(v+1))(4-8(12(v+1)))=(1-v)2.{\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]=4({\frac {1}{2}}(v+1))(1-{\frac {1}{2}}(v+1))+(1-{\frac {1}{2}}(v+1))(4-8({\frac {1}{2}}(v+1)))=(1-v)^{2}.}

دالة الخسارة التربيعية محدبة وسلسة. مع ذلك، تميل هذه الدالة إلى معاقبة القيم الشاذة بشكل مفرط، مما يؤدي إلى معدلات تقارب أبطأ (فيما يتعلق بتعقيد العينة) مقارنةً بدالتي الخسارة اللوجستية أو المفصلية. [ 1 ] إضافةً إلى ذلك، فإن الدوال التي تُنتج قيمًا عالية لـو(x){\displaystyle f({\vec {x}})}بالنسبة للبعضxX{\displaystyle x\in X}سيكون الأداء ضعيفًا مع دالة الخسارة التربيعية، نظرًا للقيم العالية لـyو(x){\displaystyle yf({\vec {x}})}سيُعاقب بشدة، بغض النظر عما إذا كانت علاماتy{\displaystyle y}وو(x){\displaystyle f({\vec {x}})}مباراة.

من مزايا دالة الخسارة التربيعية أن بنيتها تُسهّل التحقق المتبادل من معلمات التنظيم. وبالتحديد بالنسبة لتنظيم تيكهونوف ، يمكن حساب معلمة التنظيم باستخدام التحقق المتبادل بحذف عنصر واحد في نفس الوقت اللازم لحل مسألة واحدة. [ 10 ]

المُصغِّر لـأنا[و]{\displaystyle I[f]}يمكن إيجاد دالة الخسارة التربيعية مباشرة من المعادلة (1) كما يلي:

ومربع*=2η-1=2ص(1|x)-1.{\displaystyle f_{\text{Square}}^{*}=2\eta -1=2p(1\mid x)-1.}

الخسائر اللوجستية

يمكن توليد دالة الخسارة اللوجستية باستخدام (2) والجدول الأول كما يلي

ϕ(v)=ج[و-1(v)]+(1-و-1(v))ج[و-1(v)]=1سجل(2)[-هـv1+هـvسجلهـv1+هـv-(1-هـv1+هـv)سجل(1-هـv1+هـv)]+(1-هـv1+هـv)[-1سجل(2)سجل(هـv1+هـv1-هـv1+هـv)]=1سجل(2)سجل(1+هـ-v).{\displaystyle {\begin{aligned}\phi (v)&=C[f^{-1}(v)]+\left(1-f^{-1}(v)\right)\,C'\left[f^{-1}(v)\right]\\&={\frac {1}{\log(2)}}\left[{\frac {-e^{v}}{1+e^{v}}}\log {\frac {e^{v}}{1+e^{v}}}-\left(1-{\frac {e^{v}}{1+e^{v}}}\right)\log \left(1-{\frac {e^{v}}{1+e^{v}}}\right)\right]+\left(1-{\frac {e^{v}}{1+e^{v}}}\right)\left[{\frac {-1}{\log(2)}}\log \left({\frac {\frac {e^{v}}{1+e^{v}}}{1-{\frac {e^{v}}{1+e^{v}}}}}\right)\right]\\&={\frac {1}{\log(2)}}\log(1+e^{-v}).\end{aligned}}}

تُعدّ دالة الخسارة اللوجستية محدبة وتنمو خطيًا للقيم السالبة، مما يجعلها أقل حساسية للقيم الشاذة. وتُستخدم دالة الخسارة اللوجستية في خوارزمية LogitBoost .

المُصغِّر لـأنا[و]{\displaystyle I[f]}يمكن إيجاد دالة الخسارة اللوجستية مباشرة من المعادلة (1) كما يلي:

والخدمات اللوجستية*=سجل(η1-η)=سجل(ص(1|x)1-ص(1|x)).{\displaystyle f_{\text{Logistic}}^{*}=\log \left({\frac {\eta }{1-\eta }}\right)=\log \left({\frac {p(1\mid x)}{1-p(1\mid x)}}\right).}

تكون هذه الدالة غير معرّفة عندماص(1|x)=1{\displaystyle p(1\mid x)=1}أو ص(1|x)=0{\displaystyle p(1\mid x)=0}(تميل نحو ∞ و −∞ على التوالي)، لكنها تتنبأ بمنحنى سلس ينمو عندماص(1|x){\displaystyle p(1\mid x)}تزداد وتساوي صفرًا عندماص(1|x)=0.5{\displaystyle p(1\mid x)=0.5}[ 3 ]

من السهل التحقق من أن الخسارة اللوجستية وخسارة الإنتروبيا التقاطعية الثنائية (الخسارة اللوغاريتمية) متطابقتان في الواقع (حتى ثابت ضربي).1سجل(2){\displaystyle {\frac {1}{\log(2)}}}يرتبط فقدان الإنتروبيا المتقاطعة ارتباطًا وثيقًا بتباعد كولباك-لايبير بين التوزيع التجريبي والتوزيع المتوقع. ويُعدّ فقدان الإنتروبيا المتقاطعة شائعًا في الشبكات العصبية العميقة الحديثة .

خسارة أسية

يمكن توليد دالة الخسارة الأسية باستخدام (2) والجدول الأول كما يلي.

ϕ(v)=ج[و-1(v)]+(1-و-1(v))ج[و-1(v)]=2(هـ2v1+هـ2v)(1-هـ2v1+هـ2v)+(1-هـ2v1+هـ2v)(1-2هـ2v1+هـ2vهـ2v1+هـ2v(1-هـ2v1+هـ2v))=هـ-v{\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]=2{\sqrt {\left({\frac {e^{2v}}{1+e^{2v}}}\right)\left(1-{\frac {e^{2v}}{1+e^{2v}}}\right)}}+\left(1-{\frac {e^{2v}}{1+e^{2v}}}\right)\left({\frac {1-{\frac {2e^{2v}}{1+e^{2v}}}}{\sqrt {{\frac {e^{2v}}{1+e^{2v}}}(1-{\frac {e^{2v}}{1+e^{2v}}})}}}\right)=e^{-v}}

إن دالة الخسارة الأسية محدبة وتنمو بشكل أسي للقيم السالبة، مما يجعلها أكثر حساسية للقيم الشاذة. تُستخدم دالة الخسارة 0-1 الموزونة أسيًا في خوارزمية AdaBoost، مما يؤدي ضمنيًا إلى ظهور دالة الخسارة الأسية.

المُصغِّر لـأنا[و]{\displaystyle I[f]}يمكن إيجاد دالة الخسارة الأسية مباشرة من المعادلة (1) كما يلي:

وخبرة*=12سجل(η1-η)=12سجل(ص(1|x)1-ص(1|x)).{\displaystyle f_{\text{Exp}}^{*}={\frac {1}{2}}\log \left({\frac {\eta }{1-\eta }}\right)={\frac {1}{2}}\log \left({\frac {p(1\mid x)}{1-p(1\mid x)}}\right).}

خسارة فادحة

يمكن حساب خسارة سافاج [ 7 ] باستخدام (2) والجدول الأول كما يلي

ϕ(v)=ج[و-1(v)]+(1-و-1(v))ج[و-1(v)]=(هـv1+هـv)(1-هـv1+هـv)+(1-هـv1+هـv)(1-2هـv1+هـv)=1(1+هـv)2.{\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]=\left({\frac {e^{v}}{1+e^{v}}}\right)\left(1-{\frac {e^{v}}{1+e^{v}}}\right)+\left(1-{\frac {e^{v}}{1+e^{v}}}\right)\left(1-{\frac {2e^{v}}{1+e^{v}}}\right)={\frac {1}{(1+e^{v})^{2}}}.}

تُعتبر دالة خسارة سافاج شبه محدبة ومحدودة للقيم السالبة الكبيرة، مما يجعلها أقل حساسية للقيم الشاذة. وقد استُخدمت دالة خسارة سافاج في تعزيز التدرج وخوارزمية سافاج بوست.

المُصغِّر لـأنا[و]{\displaystyle I[f]}يمكن إيجاد دالة خسارة سافاج مباشرة من المعادلة (1) كما يلي:

ومتوحش*=سجل(η1-η)=سجل(ص(1|x)1-ص(1|x)).{\displaystyle f_{\text{Savage}}^{*}=\log \left({\frac {\eta }{1-\eta }}\right)=\log \left({\frac {p(1\mid x)}{1-p(1\mid x)}}\right).}

خسارة مماسية

يمكن توليد دالة الخسارة المماسية [ 11 ] باستخدام (2) والجدول الأول كما يلي

ϕ(v)=ج[و-1(v)]+(1-و-1(v))ج[و-1(v)]=4(دالة الظل العكسي(v)+12)(1-(دالة الظل العكسي(v)+12))+(1-(دالة الظل العكسي(v)+12))(4-8(دالة الظل العكسي(v)+12))=(2دالة الظل العكسي(v)-1)2.{\displaystyle {\begin{aligned}\phi (v)&=C[f^{-1}(v)]+\left(1-f^{-1}(v)\right)C'[f^{-1}(v)]\\&=4\left(\arctan(v)+{\frac {1}{2}}\right)\left(1-\left(\arctan(v)+{\frac {1}{2}}\right)\right)+\left(1-\left(\arctan(v)+{\frac {1}{2}}\right)\right)\left(4-8\left(\arctan(v)+{\frac {1}{2}}\right)\right)\\&=\left(2\arctan(v)-1\right)^{2}.\end{aligned}}}

تُعتبر دالة خسارة المماس شبه محدبة، وهي محدودة للقيم السالبة الكبيرة، مما يجعلها أقل حساسية للقيم الشاذة. ومن المثير للاهتمام أن دالة خسارة المماس تُخصص أيضًا عقوبة محدودة لنقاط البيانات التي تم تصنيفها "بشكل صحيح للغاية". وهذا يُساعد على منع الإفراط في التدريب على مجموعة البيانات. وقد استُخدمت دالة خسارة المماس في تعزيز التدرج ، وخوارزمية TangentBoost، وغابات القرار المتناوبة. [ 12 ]

المُصغِّر لـأنا[و]{\displaystyle I[f]}يمكن إيجاد دالة خسارة الظل مباشرةً من المعادلة (1) كما يلي:

ومماس*=لون برونزي(η-12)=لون برونزي(ص(1|x)-12).{\displaystyle f_{\text{Tangent}}^{*}=\tan \left(\eta -{\frac {1}{2}}\right)=\tan \left(p\left(1\mid x\right)-{\frac {1}{2}}\right).}

فقدان المفصلة

تُعرَّف دالة خسارة المفصلة بـϕ(υ)=الأعلى(0،1-υ)=[1-υ]+{\displaystyle \phi (\upsilon )=\max(0,1-\upsilon )=[1-\upsilon ]_{+}}، أين[أ]+=الأعلى(0،أ){\displaystyle [a]_{+}=\max(0,a)}هي دالة الجزء الموجب .

V(و(x)،y)=الأعلى(0،1-yو(x))=[1-yو(x)]+.{\displaystyle V(f({\vec {x}}),y)=\max(0,1-yf({\vec {x}}))=[1-yf({\vec {x}})]_{+}.}

توفر خسارة المفصلة حدًا علويًا محدبًا ودقيقًا نسبيًا لدالة المؤشر 0-1 . وبالتحديد، تتساوى خسارة المفصلة مع دالة المؤشر 0-1 عندماعلامة(و(x))=y{\displaystyle \operatorname {sgn} (f({\vec {x}}))=y}و|yو(x)|1{\displaystyle |yf({\vec {x}})|\geq 1}بالإضافة إلى ذلك، فإن تقليل المخاطر التجريبية لهذه الخسارة يُعادل الصيغة الكلاسيكية لآلات المتجهات الداعمة (SVMs). لا تُعاقب النقاط المصنفة بشكل صحيح والواقعة خارج حدود هامش المتجهات الداعمة، بينما تُعاقب النقاط الواقعة داخل حدود الهامش أو على الجانب الخطأ من المستوى الفائق بشكل خطي مقارنةً بمسافتها من الحد الصحيح. [ 4 ]

على الرغم من أن دالة خسارة المفصل محدبة ومتصلة، إلا أنها ليست سلسة (غير قابلة للتفاضل) عندyو(x)=1{\displaystyle yf({\vec {x}})=1}وبالتالي، لا يمكن استخدام دالة خسارة المفصلة مع طرق التدرج الهبوطي أو طرق التدرج الهبوطي العشوائي التي تعتمد على قابلية التفاضل على كامل المجال. ومع ذلك، فإن لخسارة المفصلة تدرجًا فرعيًا عندyو(x)=1{\displaystyle yf({\vec {x}})=1}مما يسمح باستخدام طرق الانحدار الفرعي . [ 4 ] يمكن أيضًا حل آلات المتجهات الداعمة التي تستخدم دالة خسارة المفصلة باستخدام البرمجة التربيعية .

المُصغِّر لـأنا[و]{\displaystyle I[f]}بالنسبة لدالة خسارة المفصلة،

ومفصلة*(x)={1لو ص(1|x)>ص(-1|x)-1لو ص(1|x)<ص(-1|x){\displaystyle f_{\text{Hinge}}^{*}({\vec {x}})\;=\;{\begin{cases}1&{\text{if }}p(1\mid {\vec {x}})>p(-1\mid {\vec {x}})\\-1&{\text{if }}p(1\mid {\vec {x}})<p(-1\mid {\vec {x}})\end{cases}}}

متىص(1|x)0.5{\displaystyle p(1\mid x)\neq 0.5}وهو ما يتطابق مع دالة المؤشر 0-1. هذه النتيجة تجعل خسارة المفصل جذابة للغاية، حيث يمكن وضع حدود على الفرق بين المخاطر المتوقعة وإشارة دالة خسارة المفصل. [ 1 ] لا يمكن اشتقاق خسارة المفصل من (2) لأنومفصلة*{\displaystyle f_{\text{Hinge}}^{*}} غير قابل للعكس.

فقدان المفصلة الملساء المعمم

دالة الخسارة المفصلية الملساء المعممة ذات المعاملα{\displaystyle \alpha }يُعرَّف بأنه

وα*(z)={αα+1-zلو z01α+1zα+1-z+αα+1لو 0<z<10لو z1،{\displaystyle f_{\alpha }^{*}(z)\;=\;{\begin{cases}{\frac {\alpha }{\alpha +1}}-z&{\text{if }}z\leq 0\\{\frac {1}{\alpha +1}}z^{\alpha +1}-z+{\frac {\alpha }{\alpha +1}}&{\text{if }}0<z<1\\0&{\text{if }}z\geq 1\end{cases}},}

أين

z=yو(x).{\displaystyle z=yf({\vec {x}}).}

وهي تتناقص بشكل رتيب وتصل إلى الصفر عندماz=1{\displaystyle z=1}.

انظر أيضاً

مراجع

  1. 1 2 3 4 روسكو، ل.؛ دي فيتو، إد؛ كابونيتو، أ.؛ بيانا، م.؛ فيري، أ. (2004). "هل وظائف الخسارة كلها متشابهة؟" (بي دي إف) . الحساب العصبي . 16 (5): 1063-1076 . سايتسيركس 10.1.1.109.6786 . دوى : 10.1162/089976604773135104 . بميد 15070510 . S2CID 11845688 .   
  2. شين، يي (2005)، دوال الخسارة للتصنيف الثنائي وتقدير احتمالية الفئة (ملف PDF) ، جامعة بنسلفانيا ، تم الاطلاع عليه في 6 ديسمبر 2014
  3. 1 2 3 روساسكو، لورينزو؛ بوجيو، توماسو (2014)، جولة في تنظيم التعلم الآلي ، محاضرات MIT-9.520، المجلد. مخطوطة 
  4. 1 2 3 بيوش، راي (13 سبتمبر 2011)، آلات المتجهات الداعمة (تابع)، دوال خسارة التصنيف والمنظمات (ملف PDF) ، جامعة يوتا CS5350/6350: تعلم الآلة ، تم الاطلاع عليه في 4 مايو 2021
  5. رامانان، ديفا (27 فبراير 2008)، المحاضرة 14 (ملف PDF) ، UCI ICS273A: تعلم الآلة ، تم الاطلاع عليه في 6 ديسمبر 2014{{citation}}: CS1 maint: publisher location ( link )
  6. بارتليت، بيتر ل.؛ جوردان، مايكل آي.؛ مكوليف، جون د. (2006). "التحدب، والتصنيف، وحدود المخاطر". مجلة الجمعية الإحصائية الأمريكية . 101 (473): 138-156 . doi : 10.1198/016214505000000907 . ISSN 0162-1459 . JSTOR 30047445. S2CID 2833811 .   
  7. 1 2 3 مسنادي شيرازي، حامد؛ فاسكونسيلوس، نونو (2008). "حول تصميم دوال الخسارة للتصنيف: النظرية، والمتانة في مواجهة القيم الشاذة، وخوارزمية SavageBoost" (ملف PDF) . وقائع المؤتمر الدولي الحادي والعشرين لأنظمة معالجة المعلومات العصبية . NIPS'08. الولايات المتحدة الأمريكية: Curran Associates Inc.: 1049-1056 . ISBN 9781605609492.
  8. ليستر، سي.؛ صفاري، أ.؛ روث، ب.م.؛ بيشوف، هـ. (سبتمبر 2009). "حول متانة التعزيز عبر الإنترنت - دراسة تنافسية". ورش عمل المؤتمر الدولي الثاني عشر لـ IEEE حول رؤية الحاسوب، ورش عمل ICCV، 2009. الصفحات 1362-1369 . doi : 10.1109/ICCVW.2009.5457451 . ISBN  978-1-4244-4442-7. S2CID 6032045 . 
  9. فاسكونسيلوس، نونو؛ مسنادي شيرازي، حامد (2015). "نظرة على خسائر الهامش كعوامل تنظيم لتقديرات الاحتمالية" . مجلة أبحاث تعلم الآلة . 16 (85): 2751-2795 . ISSN 1533-7928 . 
  10. ريفكين، رايان م.؛ ليبرت، روس أ. (1 مايو 2007)، ملاحظات حول المربعات الصغرى المنتظمة (ملف PDF) ، مختبر علوم الحاسوب والذكاء الاصطناعي بمعهد ماساتشوستس للتكنولوجيا
  11. مسنادي شيرازي، ح.؛ ماهاديفان، ف.؛ فاسكونسيلوس، ن. (يونيو 2010). "حول تصميم المصنفات القوية لرؤية الحاسوب". مؤتمر جمعية مهندسي الكهرباء والإلكترونيات (IEEE) لعام 2010 حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 779-786 . CiteSeerX 10.1.1.172.6416 . doi : 10.1109/CVPR.2010.5540136 . ISBN   978-1-4244-6984-0. S2CID 632758 . 
  12. شولتر، س.؛ وولهارت، ب.؛ ليستر، س.؛ صفاري، أ.؛ روث، ب.م.؛ بيشوف، هـ. (يونيو 2013). "غابات القرار المتناوبة". مؤتمر IEEE لعام 2013 حول رؤية الحاسوب والتعرف على الأنماط . الصفحات 508-515 . CiteSeerX 10.1.1.301.1305 . doi : 10.1109/CVPR.2013.72 . ISBN   978-0-7695-4989-7. S2CID 6557162 .