النموذج التمييزي

النماذج التمييزية ، والتي تُعرف أيضًا بالنماذج الشرطية ، هي فئة من النماذج تُستخدم بكثرة في التصنيف . في مجال التعلّم الآلي ، تُنمذج هذه النماذج عادةً التوزيع الشرطي P(Y|X)، أو تتعلم قاعدة قرار مباشرة تربط المدخلات X بالمخرجات Y. تُستخدم النماذج التمييزية بشكل شائع في التصنيف والانحدار ، حيث يكون الهدف الرئيسي هو التنبؤ الدقيق بالبيانات الجديدة. تُستخدم عادةً لحل مشاكل التصنيف الثنائي ، أي إسناد تصنيفات، مثل ناجح/راسب، فائز/خاسر، حي/ميت، أو سليم/مريض، لنقاط البيانات الموجودة. تُدرَّب النماذج التمييزية عادةً لفصل الفئات أو لتقليل خطأ التنبؤ في ظل دالة خسارة مُختارة . غالبًا ما تُقارن هذه النماذج بالنماذج التوليدية ، التي تهدف إلى نمذجة كيفية توليد البيانات ويمكن استخدامها لأخذ عينات من بيانات جديدة.

تشمل أنواع النماذج التمييزية الانحدار اللوجستي (LR) والحقول العشوائية الشرطية (CRFs) وأشجار القرار من بين العديد من النماذج الأخرى.

تعريف

بخلاف النمذجة التوليدية، التي تدرس الاحتمالية المشتركةP(x،y){\displaystyle P(x,y)}، دراسات النمذجة التمييزيةP(y|x){\displaystyle P(y|x)}أو يرسم خريطة للمتغير غير المرصود المحدد (الهدف)x{\displaystyle x}إلى تسمية فئةy{\displaystyle y}يعتمد ذلك على المتغيرات المرصودة (عينات التدريب). على سبيل المثال، في مجال التعرف على الأشياء ،x{\displaystyle x}من المرجح أن يكون متجهًا من وحدات البكسل الخام (أو الميزات المستخرجة من وحدات البكسل الخام للصورة). ضمن إطار احتمالي، يتم ذلك عن طريق نمذجة توزيع الاحتمال الشرطي.P(y|x){\displaystyle P(y|x)}والتي يمكن استخدامها للتنبؤy{\displaystyle y}منx{\displaystyle x}لاحظ أنه لا يزال هناك فرق بين النموذج الشرطي والنموذج التمييزي، على الرغم من أنه في أغلب الأحيان يتم تصنيفهما ببساطة على أنهما نموذج تمييزي.

النموذج التمييزي البحت مقابل النموذج الشرطي

يُمثل النموذج الشرطي توزيع الاحتمالية الشرطية ، بينما يهدف النموذج التمييزي التقليدي إلى تحسين عملية ربط المدخلات بالعينات المدربة الأكثر تشابهاً. [ 1 ]

قارن بالنموذج التوليدي

في التصنيف الإحصائي ، يُطلق على منهجين رئيسيين اسم المنهج التوليدي والمنهج التمييزي . يحسب هذان المنهجان المصنفات باستخدام أساليب مختلفة، تتباين في درجة النمذجة الإحصائية . المصطلحات غير متسقة، [ أ ] ولكن يمكن تمييز ثلاثة أنواع رئيسية:

  1. النموذج التوليدي هو نموذج إحصائي لتوزيع الاحتمال المشتركP(X،Y){\displaystyle P(X,Y)}على متغير قابل للملاحظة X ومتغير هدف Y ؛ يمكن استخدام نموذج توليدي "لتوليد" حالات عشوائية ( نتائج ) للملاحظة x .
  2. النموذج التمييزي هو نموذج للاحتمال الشرطيP(Y|X=x){\displaystyle P(Y\mid X=x)}بالنسبة للهدف Y ، بالنظر إلى الملاحظة x . يمكن استخدامه لـ "تمييز" قيمة المتغير المستهدف Y ، بالنظر إلى الملاحظة x .
  3. تُعرف المصنفات التي يتم حسابها دون استخدام نموذج احتمالي أيضًا بشكل فضفاض باسم "التمييزية".

لا يتم التمييز بين هاتين الفئتين الأخيرتين بشكل متسق.

يُعرّف تقسيم بديل هذه العناصر بشكل متناظر على النحو التالي:

  • النموذج التوليدي هو نموذج للاحتمالية الشرطية للمتغير القابل للملاحظة X ، بالنظر إلى متغير مستهدف y ، بشكل رمزي،P(X|Y=y){\displaystyle P(X\mid Y=y)}
  • النموذج التمييزي هو نموذج للاحتمالية الشرطية للهدف Y ، بالنظر إلى الملاحظة x ، ويرمز له بـP(Y|X=x){\displaystyle P(Y\mid X=x)}

بغض النظر عن التعريف الدقيق، فإن هذا المصطلح دستوري لأن النموذج التوليدي يمكن استخدامه "لتوليد" حالات عشوائية ( نتائج )، سواء كانت لملاحظة أو هدف.(x،y){\displaystyle (x,y)}، أو للملاحظة x بالنظر إلى قيمة الهدف y ، في حين يمكن استخدام نموذج تمييزي أو مصنف تمييزي (بدون نموذج) "لتمييز" قيمة المتغير المستهدف Y ، بالنظر إلى الملاحظة x .

تباين في المناهج

لنفترض أننا حصلنا علىم{\displaystyle m}تصنيفات الفئات (التصنيف) ون{\displaystyle n}المتغيرات المميزة،Y:{y1،y2،...،yم}،X:{x1،x2،...،xن}{\displaystyle Y:\{y_{1},y_{2},\ldots ,y_{m}\},X:\{x_{1},x_{2},\ldots ,x_{n}\}}، كعينات تدريبية.

يأخذ النموذج التوليدي الاحتمال المشتركP(x،y){\displaystyle P(x,y)}، أينx{\displaystyle x}المدخل وy{\displaystyle y}هو التصنيف، ويتنبأ بالتصنيف الأكثر احتمالاً المعروفy~Y{\displaystyle {\widetilde {y}}\in Y}بالنسبة للمتغير المجهولx~{\displaystyle {\widetilde {x}}}باستخدام نظرية بايز .

لا تسمح النماذج التمييزية، على عكس النماذج التوليدية ، بتوليد عينات من التوزيع المشترك للمتغيرات المرصودة والمستهدفة. مع ذلك، في مهام مثل التصنيف والانحدار التي لا تتطلب التوزيع المشترك، قد تُحقق النماذج التمييزية أداءً أفضل (ويرجع ذلك جزئيًا إلى قلة عدد المتغيرات التي تحتاج إلى حساب). من جهة أخرى، تتميز النماذج التوليدية بمرونة أكبر من النماذج التمييزية في التعبير عن التبعيات في مهام التعلم المعقدة. إضافةً إلى ذلك، فإن معظم النماذج التمييزية خاضعة للإشراف بطبيعتها ، ولا تدعم التعلم غير الخاضع للإشراف بسهولة . في النهاية، تُحدد تفاصيل التطبيق مدى ملاءمة اختيار النموذج التمييزي أو التوليدي.

تختلف النماذج التمييزية والنماذج التوليدية أيضًا في إدخال الاحتمال اللاحق . وللحفاظ على أقل خسارة متوقعة، ينبغي تقليل احتمالية تصنيف النتائج بشكل خاطئ. في النموذج التمييزي، تكون الاحتمالات اللاحقة...P(y|x){\displaystyle P(y|x)}يُستنتج هذا من نموذج بارامتري، حيث تُستمد البارامترات من بيانات التدريب. تُحدد نقاط تقدير البارامترات من خلال تعظيم الاحتمالية أو حساب التوزيع على البارامترات. من ناحية أخرى، ونظرًا لأن النماذج التوليدية تركز على الاحتمال المشترك، فإن الاحتمال اللاحق للفئةP(ك){\displaystyle P(k)}يُؤخذ هذا في الاعتبار في نظرية بايز ، وهي

P(y|x)=ص(x|y)ص(y)أناص(x|أنا)ص(أنا)=ص(x|y)ص(y)ص(x){\displaystyle P(y|x)={\frac {p(x|y)p(y)}{\textstyle \sum _{i}p(x|i)p(i)\displaystyle }}={\frac {p(x|y)p(y)}{p(x)}}}.

مزايا وعيوب التطبيق

في التجارب المتكررة، طُبقت نماذج الانحدار اللوجستي وخوارزمية بايز البسيطة على نماذج مختلفة في مهمة التصنيف الثنائي. أظهرت النتائج أن التعلم التمييزي يُسفر عن أخطاء تقاربية أقل، بينما يُسفر التعلم التوليدي عن أخطاء تقاربية أعلى وأسرع. مع ذلك، في بحث أولوسوي وبيشوب المشترك، " مقارنة التقنيات التوليدية والتمييزية للكشف عن الكائنات وتصنيفها" ، ذكرا أن العبارة السابقة صحيحة فقط عندما يكون النموذج مناسبًا للبيانات (أي عندما يُمثل النموذج التوليدي توزيع البيانات بشكل صحيح).

المزايا

تتمثل المزايا الهامة لاستخدام النمذجة التمييزية فيما يلي:

  • دقة أعلى، مما يؤدي في الغالب إلى نتائج تعلم أفضل.
  • يُتيح تبسيط عملية الإدخال ويوفر نهجًا مباشرًا لـP(y|x){\displaystyle P(y|x)}
  • يوفر موارد الحساب
  • يُنتج أخطاء تقاربية أقل

مقارنة بمزايا استخدام النمذجة التوليدية:

  • يأخذ جميع البيانات في الاعتبار، مما قد يؤدي إلى بطء المعالجة كعيب.
  • يتطلب عينات تدريب أقل
  • إطار عمل مرن يمكنه التعاون بسهولة مع الاحتياجات الأخرى للتطبيق
العيوب
  • تتطلب طريقة التدريب عادةً تقنيات متعددة للتحسين العددي
  • وبالمثل، بحسب التعريف، سيحتاج النموذج التمييزي إلى الجمع بين مهام فرعية متعددة لحل مشكلة معقدة في العالم الحقيقي

أساليب النمذجة التمييزية النموذجية

يعتمد النهج التالي على افتراض أنه يتم إعطاء مجموعة بيانات التدريبد={(xأنا؛yأنا)|أناشمالZ}{\displaystyle D=\{(x_{i};y_{i})|i\leq N\in \mathbb {Z} \}}، أينyأنا{\displaystyle y_{i}}يمثل الناتج المقابل للمدخلxأنا{\displaystyle x_{i}}[ 2 ]

المصنف الخطي

نعتزم استخدام هذه الوظيفةو(x){\displaystyle f(x)}لمحاكاة السلوك الذي لاحظناه من مجموعة بيانات التدريب باستخدام طريقة المصنف الخطي . باستخدام متجه الميزات المشتركةϕ(x،y){\displaystyle \phi (x,y)}، يتم تعريف دالة القرار على النحو التالي:

و(x؛w)=argالأعلىywتيϕ(x،y){\displaystyle f(x;w)=\arg \max _{y}w^{T}\phi (x,y)}

وفقًا لتفسير ميميسيفيتش، [ 2 ]wتيϕ(x،y){\displaystyle w^{T}\phi (x,y)}وهو أيضاًج(x،y؛w){\displaystyle c(x,y;w)}، يحسب درجة تقيس مدى توافق المدخلاتx{\displaystyle x}مع الناتج المحتملy{\displaystyle y}ثمargالأعلى{\displaystyle \arg \max }يحدد الفصل الحاصل على أعلى درجة.

الانحدار اللوجستي (LR)

بما أن دالة الخسارة 0-1 شائعة الاستخدام في نظرية القرار، فإن توزيع الاحتمال الشرطيP(y|x؛w){\displaystyle P(y|x;w)}، أينw{\displaystyle w}يمثل متجه المعلمات لتحسين بيانات التدريب، ويمكن إعادة النظر فيه على النحو التالي لنموذج الانحدار اللوجستي:

P(y|x؛w)=1Z(x؛w)خبرة(wتيϕ(x،y)){\displaystyle P(y|x;w)={\frac {1}{Z(x;w)}}\exp(w^{T}\phi (x,y))}، مع
Z(x؛w)=yخبرة(wتيϕ(x،y)){\displaystyle Z(x;w)=\textstyle \sum _{y}\displaystyle \exp(w^{T}\phi (x,y))}

تمثل المعادلة أعلاه الانحدار اللوجستي . لاحظ أن أحد الفروق الرئيسية بين النماذج هو طريقة إدخال الاحتمال اللاحق. يُستنتج الاحتمال اللاحق من النموذج البارامتري. بعد ذلك، يمكننا تعظيم المعلمة باتباع المعادلة التالية:

ل(w)=أناسجلص(yأنا|xأنا؛w){\displaystyle L(w)=\textstyle \sum _{i}\displaystyle \log p(y^{i}|x^{i};w)}

ويمكن استبدالها أيضاً بمعادلة الخسارة اللوغاريتمية التالية:

لسجل(xأنا،yأنا،ج(xأنا؛w))=-سجلص(yأنا|xأنا؛w)=سجلZ(xأنا؛w)-wتيϕ(xأنا،yأنا){\displaystyle l^{\log }(x^{i},y^{i},c(x^{i};w))=-\log p(y^{i}|x^{i};w)=\log Z(x^{i};w)-w^{T}\phi (x^{i},y^{i})}

بما أن دالة الخسارة اللوغاريتمية قابلة للتفاضل، يمكن استخدام طريقة تعتمد على التدرج لتحسين النموذج. ويُضمن الوصول إلى الحل الأمثل الشامل لأن دالة الهدف محدبة. ويُعبَّر عن تدرج دالة الاحتمال اللوغاريتمي كما يلي:

ل(w)w=أناϕ(xأنا،yأنا)-هـص(y|xأنا؛w)ϕ(xأنا،y){\displaystyle {\frac {\partial L(w)}{\partial w}}=\textstyle \sum _{i}\displaystyle \phi (x^{i},y^{i})-E_{p(y|x^{i};w)}\phi (x^{i},y)}

أينهـص(y|xأنا؛w){\displaystyle E_{p(y|x^{i};w)}}هو توقعص(y|xأنا؛w){\displaystyle p(y|x^{i};w)}.

ستوفر الطريقة المذكورة أعلاه حسابًا فعالًا لعدد التصنيفات الصغير نسبيًا.

أهداف التدريب والتحسينات في التطبيقات

نظراً لوجود مزايا وعيوب لكلتا طريقتي النمذجة، فإن الجمع بينهما يُعدّ نمذجةً جيدةً عملياً. على سبيل المثال، في مقالة ماراس بعنوان " نموذج توليدي تمييزي مشترك لبناء وتصنيف النماذج القابلة للتشوه" [ 3 قام هو وزملاؤه بتطبيق دمج النموذجين على تصنيف وجوه النماذج ، وحققوا دقةً أعلى من الطريقة التقليدية.

وبالمثل، اقترح كيلم [ 4 ] أيضًا الجمع بين نموذجين لتصنيف البكسل في مقالته " الجمع بين الأساليب التوليدية والتمييزية لتصنيف البكسل باستخدام التعلم متعدد الشروط" .

During the process of extracting the discriminative features prior to the clustering, Principal component analysis (PCA), though commonly used, is not a necessarily discriminative approach. In contrast, LDA is a discriminative one.[5]Linear discriminant analysis (LDA), provides an efficient way of eliminating the disadvantage we list above. As we know, the discriminative model needs a combination of multiple subtasks before classification, and LDA provides appropriate solution towards this problem by reducing dimension.

  • Empirical risk minimization
  • Common loss functions (log loss, hinge loss, squared loss)
  • Regularization (L1/L2)
  • Optimization methods (gradient descent family)

Families and types

Examples of discriminative models include:

See also

Notes

  1. Three leading sources, Ng & Jordan 2002, Jebara 2004, and Mitchell 2015, give different divisions and definitions.

References

  1. Ballesteros, Miguel. "Discriminative Models"(PDF). Retrieved October 28, 2018.
  2. 12Memisevic, Roland (December 21, 2006). "An introduction to structured discriminative learning". Retrieved October 29, 2018.
  3. Marras, Ioannis (2017). "A Joint Discriminative Generative Model for Deformable Model Construction and Classification"(PDF). Retrieved 5 November 2018.
  4. Kelm, B. Michael. "Combining Generative and Discriminative Methods for Pixel Classification with Multi-Conditional Learning"(PDF). Archived from the original(PDF) on 17 July 2019. Retrieved 5 November 2018.
  5. Wang, Zhangyang (2015). "A Joint Optimization Framework of Sparse Coding and Discriminative Clustering"(PDF). Retrieved 5 November 2018.

Sources