الحد الأقصى للتقدير اللاحق

في الإحصاء البايزي ، يُعرف تقدير الاحتمال اللاحق الأقصى ( MAP ) لكمية مجهولة بأنه نمط دالة الكثافة الاحتمالية اللاحقة . يُمكن استخدام تقدير الاحتمال اللاحق الأقصى للحصول على تقدير نقطي لكمية غير مُلاحظة بناءً على البيانات التجريبية. وهو يرتبط ارتباطًا وثيقًا بطريقة تقدير الاحتمال الأقصى (ML)، ولكنه يستخدم هدفًا مُحسَّنًا للتحسين يتضمن دالة كثافة احتمالية مسبقة للكمية المراد تقديرها. وبالتالي، يُعد تقدير الاحتمال اللاحق الأقصى بمثابة تنظيم لتقدير الاحتمال الأقصى.

وصف

لنفترض أننا نريد تقدير معلمة سكانية غير مرصودةθ{\displaystyle \theta }بناءً على الملاحظاتx{\displaystyle x}. يتركو{\displaystyle f}ليكن التوزيع الاحتمالي لـx{\displaystyle x}، لهذا السببو(x|θ){\displaystyle f(x\mid \theta )}هو احتمالx{\displaystyle x}عندما تكون معلمة السكان الأساسيةθ{\displaystyle \theta }ثم الدالة:

θو(x|θ){\displaystyle \theta \mapsto f(x\mid \theta )\!}

تُعرف باسم دالة الاحتمال والتقدير:

θ^ملهـ(x)=أرزمأxθ و(x|θ){\displaystyle {\hat {\theta}}_{\mathrm {MLE} }(x)={\underset {\theta }{\operatorname {arg\,max} }}\ f(x\mid \theta )\!}

هو تقدير الاحتمال الأقصى لـθ{\displaystyle \theta }.

لنفترض الآن أن التوزيع المسبقز{\displaystyle g}زيادةθ{\displaystyle \theta }هذا موجود. وهذا يسمح لنا بالتعامل معθ{\displaystyle \theta }كمتغير عشوائي كما هو الحال في الإحصاء البايزي . يمكننا حساب الكثافة الاحتمالية اللاحقة لـθ{\displaystyle \theta }باستخدام نظرية بايز :

θو(θ|x)=و(x|θ)ز(θ)Θو(x|ϑ)ز(ϑ)دϑ{\displaystyle \theta \mapsto f(\theta \mid x)={\frac {f(x\mid \theta )\,g(\theta )}{\displaystyle \int _{\Theta }f(x\mid \vartheta )\,g(\vartheta )\,d\vartheta }}\!}

أينز{\displaystyle g}دالة الكثافة لـθ{\displaystyle \theta }،Θ{\displaystyle \Theta }هو مجالز{\displaystyle g}.

ثم تقوم طريقة التقدير اللاحق الأقصى بتقديرθ{\displaystyle \theta }باعتباره نمط الكثافة الاحتمالية اللاحقة لهذا المتغير العشوائي:

θ^مأP(x)=أرزمأxθ و(θ|x)=أرزمأxθ و(x|θ)ز(θ)Θو(x|ϑ)ز(ϑ)دϑ=أرزمأxθ و(x|θ)ز(θ).{\displaystyle {\begin{aligned}{\hat {\theta }}_{\mathrm {MAP} }(x)&={\underset {\theta }{\operatorname {arg\,max} }}\ f(\theta \mid x)\\&={\underset {\theta }{\operatorname {arg\,max} }}\ {\frac {f(x\mid \theta) )\,g(\theta )}{\displaystyle \int _{\Theta }f(x\mid \vartheta )\,g(\vartheta )\,d\vartheta }}\\&={\underset {\theta }{\operatorname {arg\,max} }}\ f(x\mid \theta )\,g(\theta ).\end{محاذاة}}\!}

يكون مقام دالة الكثافة الاحتمالية الخلفية ( الاحتمالية الحدية للنموذج) موجبًا دائمًا ولا يعتمد علىθ{\displaystyle \theta }وبالتالي، لا يلعب أي دور في عملية التحسين. لاحظ أن تقدير MAP لـθ{\displaystyle \theta }يتطابق مع تقدير الاحتمال الأقصى عندما تكون القيمة المسبقةز{\displaystyle g}موحد (أي،ز{\displaystyle g}هي دالة ثابتة )، والتي تحدث كلما تم اعتبار التوزيع المسبق كمقياس مرجعي، كما هو معتاد في تطبيقات فضاء الدوال.

في سياق مقدرات بايز ، يمكن استعادة متوسط ​​الاحتمال اللاحق (MAP) باعتباره القيمة التي تقلل من مخاطر بايز باستخدام دالة المخاطرة.

ل(θ،أ)={0،لو |أ-θ|<ج،1،خلاف ذلك،{\displaystyle L(\theta ,a)={\begin{cases}0,&{\text{if }}|a-\theta |<c,\\1,&{\text{otherwise}},\\\end{cases}}}

في الحد كماج{\displaystyle c}يؤول إلى الصفر، بشرط أن يكون توزيعθ{\displaystyle \theta }تكون شبه مقعرة. [ 1 ] عمومًا، مع ذلك، فإن مُقدِّر MAP ليس مُقدِّر بايز إلا إذاθ{\displaystyle \theta }منفصل .

حساب

يمكن حساب تقديرات متوسط ​​هطول الأمطار بعدة طرق:

  1. تحليليًا، عندما يمكن التعبير عن نمط (أنماط) الكثافة الاحتمالية اللاحقة بصيغة مغلقة . هذا هو الحال عند استخدام التوزيعات الاحتمالية المسبقة المترافقة .
  2. عن طريق التحسين العددي مثل طريقة التدرج المترافق أو طريقة نيوتن . يتطلب هذا عادةً مشتقات أولى أو ثانية ، والتي يجب تقييمها تحليليًا أو عدديًا.
  3. عن طريق تعديل خوارزمية التوقع والتعظيم . وهذا لا يتطلب مشتقات الكثافة الاحتمالية اللاحقة.
  4. باستخدام طريقة مونت كارلو وتقنية التلدين المحاكي

القيود

على الرغم من أن تقدير MAP لا يتطلب سوى شروط بسيطة ليكون حالةً حديةً لتقدير بايز (في ظل دالة الخسارة 0-1)، [ 1 ] إلا أنه لا يُمثل الطرق البايزية عمومًا. يعود ذلك إلى أن تقديرات MAP هي تقديرات نقطية، وتعتمد على اختيار عشوائي للمقياس المرجعي، بينما تتميز الطرق البايزية باستخدام التوزيعات لتلخيص البيانات واستخلاص النتائج؛ لذا، تميل الطرق البايزية إلى الإبلاغ عن المتوسط ​​أو الوسيط اللاحق ، بالإضافة إلى فترات الثقة . ويرجع ذلك إلى أن هذه المُقدِّرات تكون مثالية في ظل خسارة الخطأ التربيعي والخطأ الخطي على التوالي - وهما أكثر تمثيلًا لدوال الخسارة النموذجية - ولأنه بالنسبة للتوزيع اللاحق المستمر، لا توجد دالة خسارة تُشير إلى أن MAP هو المُقدِّر النقطي الأمثل.

مثال على كثافة توزيع ثنائي النمط حيث يكون النمط الأعلى غير مميز لغالبية التوزيع

في العديد من أنواع النماذج، مثل نماذج الخليط ، قد يكون التوزيع الاحتمالي اللاحق متعدد الأنماط . في هذه الحالة، يُنصح عادةً باختيار النمط الأعلى: إلا أن هذا ليس ممكنًا دائمًا ( فالتحسين الشامل مشكلة معقدة)، بل قد يكون مستحيلاً في بعض الحالات (كما هو الحال عند ظهور مشكلات في قابلية التحديد ). علاوة على ذلك، قد لا يُمثل النمط الأعلى غالبية التوزيع الاحتمالي اللاحق، خاصةً في الأبعاد المتعددة.

أخيرًا، على عكس مُقدِّرات الاحتمال الأقصى، فإن تقدير الاحتمال الأقصى اللاحق ليس ثابتًا عند إعادة تحديد المعلمات. فالانتقال من معلمة إلى أخرى يستلزم إدخال مصفوفة جاكوبية تؤثر على موقع القيمة القصوى. [ 2 ] في المقابل، فإن التوقعات الخلفية البايزية ثابتة عند إعادة تحديد المعلمات.

كمثال على الفرق بين مقدرات بايز المذكورة أعلاه (مقدرات المتوسط ​​والوسيط) واستخدام تقدير MAP، لنفترض الحالة التي تتطلب تصنيف المدخلاتx{\displaystyle x}إما إيجابي أو سلبي (على سبيل المثال، القروض باعتبارها محفوفة بالمخاطر أو آمنة). لنفترض أن هناك ثلاث فرضيات محتملة فقط حول الطريقة الصحيحة للتصنيفح1{\displaystyle h_{1}}،ح2{\displaystyle h_{2}}وح3{\displaystyle h_{3}}بقيم احتمالية لاحقة تبلغ 0.4 و0.3 و0.3 على التوالي. لنفترض، عند إعطاء حالة جديدة،x{\displaystyle x}،ح1{\displaystyle h_{1}}يصنفها على أنها إيجابية، بينما يصنفها الاثنان الآخران على أنها سلبية. باستخدام تقدير MAP للمصنف الصحيحح1{\displaystyle h_{1}}،x{\displaystyle x}يُصنف على أنه إيجابي، بينما تقوم تقديرات بايز بحساب المتوسط ​​لجميع الفرضيات وتصنيفها.x{\displaystyle x}سلبي.

مثال

لنفترض أن لدينا متتالية(x1،...،xن){\displaystyle (x_{1},\dots ,x_{n})}من IIDشمال(μ،σv2){\displaystyle N(\mu ,\sigma _{v}^{2})}المتغيرات العشوائية والتوزيع المسبق لـμ{\displaystyle \mu }يُعطى بواسطة شمال(μ0،σم2){\displaystyle N(\mu _{0},\sigma _{m}^{2})}نرغب في إيجاد تقدير MAP لـμ{\displaystyle \mu }لاحظ أن التوزيع الطبيعي هو التوزيع المسبق المترافق الخاص به ، لذلك سنكون قادرين على إيجاد حل مغلق الشكل تحليليًا.

ثم يتم إعطاء الدالة المراد تعظيمها بواسطة [ 3 ]

ز(μ)و(x|μ)=π(μ)ل(μ)=12πσمخبرة(-12(μ-μ0σم)2)ج=1ن12πσvخبرة(-12(xج-μσv)2)،{\displaystyle g(\mu )f(x\mid \mu )=\pi (\mu )L(\mu )={\frac {1}{{\sqrt {2\pi }}\sigma _{m}}}\exp \left(-{\frac {1}{2}}\left({\frac {\mu -\mu _{0}}{\sigma _{m}}}\right)^{2}\right)\prod _{j=1}^{n}{\frac {1}{{\sqrt {2\pi }}\sigma _{v}}}\exp \left(-{\frac {1}{2}}\left({\frac {x_{j}-\mu }{\sigma _{v}}}\right)^{2}\right),}

وهو ما يعادل تقليل الدالة التالية لـμ{\displaystyle \mu }:

ج=1ن(xج-μσv)2+(μ-μ0σم)2.{\displaystyle \sum _{j=1}^{n}\left({\frac {x_{j}-\mu }{\sigma _{v}}}\right)^{2}+\left({\frac {\mu -\mu _{0}}{\sigma _{m}}}\right)^{2}.}

وهكذا، نرى أن مقدر MAP لـ μ يتم إعطاؤه بواسطة [ 3 ]

μ^مأP=σم2نσم2ن+σv2(1نج=1نxج)+σv2σم2ن+σv2μ0=σم2(ج=1نxج)+σv2μ0σم2ن+σv2.{\displaystyle {\hat {\mu }}_{\mathrm {MAP} }={\frac {\sigma _{m}^{2}\,n}{\sigma _{m}^{2}\,n+\sigma _{v}^{2}}}\left({\frac {1}{n}}\sum _{j=1}^{n}x_{j}\right)+{\frac {\sigma _{v}^{2}}{\sigma _{m}^{2}\,n+\sigma _{v}^{2}}}\,\mu _{0}={\frac {\sigma _{m}^{2}\left(\sum _{j=1}^{n}x_{j}\right)+\sigma _{v}^{2}\,\mu _{0}}{\sigma _{m}^{2}\,n+\sigma _{v}^{2}}}.}

والذي تبين أنه استيفاء خطي بين المتوسط ​​المسبق ومتوسط ​​العينة المرجح بمعاملات التباين الخاصة بهما.

قضيةσم{\displaystyle \sigma _{m}\to \infty }يُطلق عليه اسم التوزيع الاحتمالي المسبق غير المُعلِم، ويؤدي إلى توزيع احتمالي غير صحيح ؛ في هذه الحالةμ^مأPμ^ملهـ.{\displaystyle {\hat {\mu }} _ {\mathrm {MAP} }\to {\hat {\mu }}_{\mathrm {MLE} }.}

مراجع

  1. 1 2 باسيت، روبرت؛ ديريد، خوليو (30 يناير 2018). "مُقدِّرات الاحتمال اللاحق الأقصى كحدٍّ لمُقدِّرات بايز". البرمجة الرياضية . 174 ( 1-2 ): 129-144 . arXiv : 1611.05917 . doi : 10.1007/s10107-018-1241-0 . ISSN 0025-5610 . 
  2. مورفي، كيفن ب. (2012). التعلم الآلي : منظور احتمالي . كامبريدج، ماساتشوستس: مطبعة معهد ماساتشوستس للتكنولوجيا. ص 151-152 . ISBN   978-0-262-01802-9.
  3. 1 2 يونغ، جي إيه؛ سميث، آر إل (2005). أساسيات الاستدلال الإحصائي . سلسلة كامبريدج في الرياضيات الإحصائية والاحتمالية. كامبريدج: مطبعة جامعة كامبريدج. ISBN 978-0-521-83971-6.
  • ديغروت، م. (1970). القرارات الإحصائية المثلى . ماكجرو هيل. ISBN 0-07-016242-5.
  • سورنسون، هارولد و. (1980). تقدير المعلمات: المبادئ والمسائل . مارسيل ديكر. ISBN 0-8247-6987-2.
  • هالد، أندرس (2007). "اشتقاق جاوس للتوزيع الطبيعي وطريقة المربعات الصغرى، 1809". تاريخ الاستدلال الإحصائي البارامتري من برنولي إلى فيشر، 1713-1935 . نيويورك: سبرينغر. ص 55-61 . ISBN  978-0-387-46409-1.