خطأ التعميم

في تطبيقات التعلم الخاضع للإشراف في مجال تعلم الآلة ونظرية التعلم الإحصائي ، يُعد خطأ التعميم [ 1 ] (المعروف أيضًا بخطأ العينة الخارجية [ 2 ] أو المخاطرة ) مقياسًا لمدى دقة الخوارزمية في التنبؤ بالنتائج لبيانات لم يسبق رؤيتها. ونظرًا لتقييم خوارزميات التعلم على عينات محدودة، فقد يتأثر تقييمها بخطأ أخذ العينات . ونتيجةً لذلك، قد لا توفر قياسات خطأ التنبؤ على البيانات الحالية معلومات كافية حول قدرة الخوارزمية على التنبؤ ببيانات جديدة لم يسبق رؤيتها. ويمكن تقليل خطأ التعميم بتجنب فرط التخصيص في خوارزمية التعلم. ويتم عادةً تصوير أداء خوارزميات تعلم الآلة من خلال رسوم بيانية لمنحنى التعلم تُظهر تقديرات خطأ التعميم خلال عملية التعلم.

تعريف

في مسألة التعلم، يكون الهدف هو تطوير دالةون(x){\displaystyle f_{n}({\vec {x}})}التي تتنبأ بقيم المخرجاتy{\displaystyle y}لكل بيانات الإدخالx{\displaystyle {\vec {x}}}الرمز السفلين{\displaystyle n}يشير ذلك إلى أن الوظيفةون{\displaystyle f_{n}}تم تطويره بناءً على مجموعة بيانات منن{\displaystyle n}نقاط البيانات. خطأ التعميم أو الخسارة المتوقعة أو المخاطرةأنا[و]{\displaystyle I[f]}لوظيفة معينةو{\displaystyle f}على جميع القيم الممكنة لـx{\displaystyle {\vec {x}}}وy{\displaystyle y}القيمة المتوقعة لدالة الخسارةV(و){\displaystyle V(f)}: [ 1 ]

أنا[و]=X×YV(و(x)،y)ρ(x،y)دxدy،{\displaystyle I[f]=\int _{X\times Y}V(f({\vec {x}}),y)\rho ({\vec {x}},y)d{\vec {x}}dy,}

أينρ(x،y){\displaystyle \rho ({\vec {x}},y)}هو التوزيع الاحتمالي المشترك غير المعروف لـx{\displaystyle {\vec {x}}}وy{\displaystyle y}.

دون معرفة التوزيع الاحتمالي المشتركρ{\displaystyle \rho }، من المستحيل حسابأنا[و]{\displaystyle I[f]}بدلاً من ذلك، يمكننا حساب الخطأ على بيانات العينة، والذي يُسمى الخطأ التجريبي (أو المخاطرة التجريبية ).ن{\displaystyle n}نقاط البيانات، الخطأ التجريبي لدالة مرشحةو{\displaystyle f}يكون:

أنان[و]=1نأنا=1نV(و(xأنا)،yأنا){\displaystyle I_{n}[f]={\frac {1}{n}}\sum _{i=1}^{n}V(f({\vec {x}}_{i}),y_{i})}

يُقال إن الخوارزمية تعمم إذا:

ليمنأنا[و]-أنان[و]=0{\displaystyle \lim _{n\rightarrow \infty }I[f]-I_{n}[f]=0}

يُعد خطأ التعميم ذا أهمية خاصةأنا[ون]{\displaystyle I[f_{n}]}من الدالة المعتمدة على البياناتون{\displaystyle f_{n}}يتم إيجاد ذلك بواسطة خوارزمية تعلم تعتمد على العينة. مرة أخرى، بالنسبة لتوزيع احتمالي غير معروف،أنا[ون]{\displaystyle I[f_{n}]}لا يمكن حسابها. بدلاً من ذلك، يهدف العديد من المشاكل في نظرية التعلم الإحصائي إلى تحديد أو توصيف الفرق بين خطأ التعميم والخطأ التجريبي في الاحتمالية:

Pجي=P(أنا[ون]-أنان[ون]ϵ)1-دلتان{\displaystyle P_{G}=P(I[f_{n}]-I_{n[f_{n}]\leq \epsilon )\geq 1-\delta _{n}}

أي أن الهدف هو تحديد الاحتمالية1-دلتان{\displaystyle 1-\delta _{n}}أن خطأ التعميم أقل من الخطأ التجريبي بالإضافة إلى حد معين للخطأϵ{\displaystyle \epsilon }(يعتمد بشكل عام علىدلتا{\displaystyle \delta }ون{\displaystyle n}بالنسبة للعديد من أنواع الخوارزميات، فقد ثبت أن للخوارزمية حدود تعميم إذا استوفت معايير استقرار معينة . تحديدًا، إذا كانت الخوارزمية متناظرة (أي أن ترتيب المدخلات لا يؤثر على النتيجة)، ولها خسارة محدودة، وتستوفي شرطين من شروط الاستقرار، فإنها ستعمم. ينص شرط الاستقرار الأول، وهو استقرار التحقق المتقاطع بحذف عنصر واحد ، على أنه لكي تكون الخوارزمية مستقرة، يجب أن يتقارب خطأ التنبؤ لكل نقطة بيانات عند استخدام التحقق المتقاطع بحذف عنصر واحد إلى الصفر.ن{\displaystyle n\rightarrow \infty }الشرط الثاني، وهو استقرار الخطأ المتوقع عند حذف عنصر واحد (المعروف أيضًا باسم استقرار الفرضية إذا كان يعمل فيل1{\displaystyle L_{1}}يتحقق الشرط (المعيار ) إذا لم يتغير التنبؤ على نقطة بيانات مستبعدة عند إزالة نقطة بيانات واحدة من مجموعة بيانات التدريب. [ 3 ]

يمكن صياغة هذه الشروط بشكل رسمي على النحو التالي:

استقرار التحقق المتقاطع بحذف عنصر واحد

خوارزميةل{\displaystyle L}لديهجVلoo{\displaystyle CVloo}الاستقرار إذا كان لكلن{\displaystyle n}يوجدβجV(ن){\displaystyle \beta _{CV}^{(n)}}ودلتاجV(ن){\displaystyle \delta _{CV}^{(n)}}بحيث:

أنا{1،...،ن}،PS{|V(وSأنا،zأنا)-V(وS،zأنا)|βجV(ن)}1-دلتاجV(ن){\displaystyle \forall i\in \{1,...,n\},\mathbb {P} _{S}\{|V(f_{S^{i}},z_{i})-V(f_{S},z_{i})|\leq \beta _{CV}^{(n)}\}\geq 1-\delta _{CV}^{(n)}}

وβجV(ن){\displaystyle \beta _{CV}^{(n)}}ودلتاجV(ن){\displaystyle \delta _{CV}^{(n)}}انتقل إلى الصفر كـن{\displaystyle n}[ 3 ] يؤول إلى ما لا نهاية.

استقرار الخطأ المتوقع عند حذف عنصر واحد

خوارزميةل{\displaystyle L}لديههـلooهـرر{\displaystyle Eloo_{err}}الاستقرار إذا كان لكلن{\displaystyle n}يوجدβهـلم{\displaystyle \beta _{EL}^{m}}و أدلتاهـلم{\displaystyle \delta _{EL}^{m}}بحيث:

أنا{1،...،ن}،PS{|أنا[وS]-1نأنا=1شمالV(وSأنا،zأنا)|βهـل(ن)}1-دلتاهـل(ن){\displaystyle \forall i\in \{1,...,n\},\mathbb {P} _{S}\left\{\left|I[f_{S}]-{\frac {1}{n}}\sum _{i=1}^{N}V\left(f_{S^{i}},z_{i}\right)\right|\leq \beta _{EL}^{(n)}\right\}\geq 1-\delta _{EL}^{(n)}}

معβهـل(ن){\displaystyle \beta _{EL}^{(n)}}ودلتاهـل(ن){\displaystyle \delta _{EL}^{(n)}}الوصول إلى الصفر لـن{\displaystyle n\rightarrow \infty }.

لتحقيق الاستقرار في نظام "حذف عنصر واحد"ل1{\displaystyle L_{1}}المعيار، وهذا هو نفسه استقرار الفرضية:

هـS،z[|V(وS،z)-V(وSأنا،z)|]βح(ن){\displaystyle \mathbb {E} _{S,z}[|V(f_{S},z)-V(f_{S^{i}},z)|]\leq \beta _{H}^{(n)}}

معβح(ن){\displaystyle \beta _{H}^{(n)}}يتجه إلى الصفر عندمان{\displaystyle n}[ 3 ] يؤول إلى ما لا نهاية.

خوارزميات ذات استقرار مثبت

ثبت استقرار عدد من الخوارزميات، وبالتالي فإن لها حدودًا لخطأ التعميم. تتوفر قائمة بهذه الخوارزميات والأبحاث التي أثبتت استقرارها هنا .

العلاقة بالتجاوز في التخصيص

يوضح هذا الشكل العلاقة بين فرط التخصيص وخطأ التعميم I [ fn ] - IS [ fn ]. تم توليد نقاط البيانات من العلاقة y = x مع إضافة ضوضاء بيضاء إلى قيم y . في العمود الأيسر، تظهر مجموعة من نقاط التدريب باللون الأزرق. تم تطبيق دالة متعددة الحدود من الدرجة السابعة على بيانات التدريب. في العمود الأيمن، تم اختبار الدالة على بيانات مأخوذة من التوزيع الاحتمالي المشترك الأساسي لـ x و y . في الصف العلوي، تم تطبيق الدالة على مجموعة بيانات عينة مكونة من 10 نقاط بيانات. في الصف السفلي، تم تطبيق الدالة على مجموعة بيانات عينة مكونة من 100 نقطة بيانات. كما نلاحظ، بالنسبة لأحجام العينات الصغيرة والدوال المعقدة، يكون الخطأ على مجموعة التدريب صغيرًا، لكن الخطأ على التوزيع الأساسي للبيانات يكون كبيرًا، مما يؤدي إلى فرط التخصيص. ونتيجة لذلك، يكون خطأ التعميم كبيرًا. مع ازدياد عدد نقاط العينة، يتقارب خطأ التنبؤ على بيانات التدريب والاختبار، ويؤول خطأ التعميم إلى الصفر.

يرتبط مفهوما خطأ التعميم والتجاوز في التخصيص ارتباطًا وثيقًا. يحدث التجاوز في التخصيص عندما تكون الدالة المُتعلمةوS{\displaystyle f_{S}}تصبح حساسة للضوضاء في العينة. ونتيجة لذلك، ستؤدي الدالة أداءً جيدًا على مجموعة التدريب، لكنها لن تؤدي أداءً جيدًا على البيانات الأخرى من التوزيع الاحتمالي المشترك لـx{\displaystyle x}وy{\displaystyle y}وبالتالي، كلما زاد حدوث التجاوز في التخصيص، زاد خطأ التعميم.

يمكن اختبار مدى فرط التخصيص باستخدام أساليب التحقق المتبادل ، التي تقسم العينة إلى عينات تدريب واختبار محاكاة. ثم يتم تدريب النموذج على عينة التدريب وتقييمه على عينة الاختبار. عينة الاختبار غير مرئية مسبقًا للخوارزمية، وبالتالي فهي تمثل عينة عشوائية من التوزيع الاحتمالي المشترك لـx{\displaystyle x}وy{\displaystyle y}. تسمح لنا عينة الاختبار هذه بتقريب الخطأ المتوقع، وبالتالي تقريب شكل معين من خطأ التعميم.

توجد العديد من الخوارزميات لمنع التجاوز في التخصيص. يمكن لخوارزمية التصغير معاقبة الدوال الأكثر تعقيدًا (المعروفة باسم تنظيم تيكهونوف )، أو يمكن تقييد فضاء الفرضيات، إما بشكل صريح في شكل الدوال أو عن طريق إضافة قيود إلى دالة التصغير (تنظيم إيفانوف).

إنّ منهجية إيجاد دالة لا تُفرط في التخصيص تتعارض مع هدف إيجاد دالة معقدة بما يكفي لاستيعاب الخصائص المحددة للبيانات. يُعرف هذا بمفاضلة التحيز والتباين . قد يؤدي تبسيط الدالة لتجنب الإفراط في التخصيص إلى تحيز في التنبؤات الناتجة، بينما يؤدي جعلها أكثر تعقيدًا إلى الإفراط في التخصيص وزيادة التباين في التنبؤات. من المستحيل تقليل كليهما في آنٍ واحد.

مراجع

  1. 1 2 موهري، م.، رستمي زاده، أ.، تالواكار، أ.، (2018) أسس التعلم الآلي ، الطبعة الثانية، بوسطن: مطبعة معهد ماساتشوستس للتكنولوجيا
  2. ي. س. أبو مصطفى، م. مجدون إسماعيل، و هـ. ت. لين (2012) التعلم من البيانات، دار نشر AMLBook. ISBN 978-1600490064
  3. 1 2 3 موخرجي، س.؛ نيوجي، ب.؛ بوجيو، ت.؛ ريفكين، ر.م. (2006). "نظرية التعلم: الاستقرار كافٍ للتعميم وضروري وكافٍ لاتساق تقليل المخاطر التجريبية" (ملف PDF) . مجلة الرياضيات الحاسوبية المتقدمة ، 25 ( 1-3 ): 161-193 . doi : 10.1007/s10444-004-7634-z . S2CID 2240256 . 

للمزيد من القراءة