مقدر بايز

في نظرية التقدير ونظرية القرار ، يُعرف مُقدِّر بايز أو إجراء بايز بأنه مُقدِّر أو قاعدة قرار تُقلِّل القيمة المتوقعة اللاحقة لدالة الخسارة (أي الخسارة المتوقعة اللاحقة ). وبصورة مكافئة، يُعظِّم القيمة المتوقعة اللاحقة لدالة المنفعة . وهناك طريقة بديلة لصياغة المُقدِّر ضمن الإحصاءات البايزية، وهي تقدير القيمة اللاحقة القصوى .

تعريف

لنفترض وجود معلمة غير معروفةθ{\displaystyle \theta }من المعروف أن لها توزيعًا مسبقًاπ{\displaystyle \pi }. يتركθ^=θ^(x){\displaystyle {\widehat {\theta }}={\widehat {\theta }}(x)}كن مُقدِّراً لـθ{\displaystyle \theta } (بناءً على بعض القياسات x )، ولتكنل(θ،θ^){\displaystyle L(\theta ,{\widehat {\theta }})}قد تكون دالة خسارة ، مثل الخطأ التربيعي. مخاطرة بايز لـθ^{\displaystyle {\widehat {\theta }}}يُعرَّف بأنههـπ(ل(θ،θ^)){\displaystyle E_{\pi }(L(\theta ,{\widehat {\theta }}))}، حيث يتم حساب التوقع على أساس التوزيع الاحتمالي لـθ{\displaystyle \theta }وهذا يُعرّف دالة المخاطرة كدالة لـθ^{\displaystyle {\widehat {\theta }}}. مُقدِّرθ^{\displaystyle {\widehat {\theta }}}يُقال إن المقدر هو مقدر بايزي إذا قلل من مخاطرة بايز بين جميع المقدرات. أو بعبارة أخرى، هو المقدر الذي يقلل من الخسارة المتوقعة اللاحقة.هـ(ل(θ،θ^)|x){\displaystyle E(L(\theta ,{\widehat {\theta }})|x)}لكلx{\displaystyle x}كما أنه يقلل من مخاطر بايز، وبالتالي فهو مقدر بايز. [ 1 ]

إذا كانت التوزيعة الاحتمالية المسبقة غير مناسبة، فإن المقدر الذي يقلل من الخسارة المتوقعة للتوزيعة الاحتمالية اللاحقة لكلx{\displaystyle x}يُطلق عليه اسم مُقدِّر بايز المعمم . [ 2 ]

أمثلة

تقدير الحد الأدنى لمتوسط ​​مربع الخطأ

تُعدّ دالة متوسط ​​مربع الخطأ (MSE)، والتي تُسمى أيضًا دالة مخاطرة الخطأ التربيعي ، أكثر دوال المخاطرة شيوعًا في التقدير البايزي . ويتم تعريف متوسط ​​مربع الخطأ (MSE) على النحو التالي:

مSهـ=هـ[(θ^(x)-θ)2]،{\displaystyle \mathrm {MSE} =E\left[({\widehat {\theta }}(x)-\theta )^{2}\right],}

حيث يتم حساب التوقع على التوزيع المشترك لـθ{\displaystyle \theta }وx{\displaystyle x}.

المتوسط ​​الخلفي

باستخدام متوسط ​​مربع الخطأ كمخاطرة، فإن تقدير بايز للمعلمة المجهولة هو ببساطة متوسط ​​التوزيع الخلفي ، [ 3 ]

θ^(x)=هـ[θ|x]=θص(θ|x)دθ.{\displaystyle {\widehat {\theta }}(x)=E[\theta |x]=\int \theta \,p(\theta |x)\,d\theta .}

يُعرف هذا باسم مقدر متوسط ​​مربع الخطأ الأدنى (MMSE).

مقدرات بايز للتوزيعات الاحتمالية المسبقة المترافقة

إذا لم يكن هناك سبب جوهري لتفضيل توزيع احتمالي مسبق على آخر، يُختار أحيانًا توزيع احتمالي مسبق مترافق لتبسيط العملية. يُعرَّف التوزيع الاحتمالي المسبق المترافق بأنه توزيع مسبق ينتمي إلى عائلة بارامترية معينة ، وينتمي التوزيع الاحتمالي اللاحق الناتج عنه أيضًا إلى نفس العائلة. هذه خاصية مهمة، إذ يمكن اشتقاق مُقدِّر بايز، بالإضافة إلى خصائصه الإحصائية (التباين، وفترة الثقة، وما إلى ذلك)، من التوزيع الاحتمالي اللاحق.

تُعدّ التوزيعات الاحتمالية المسبقة المترافقة مفيدةً للغاية في التقدير التسلسلي، حيث يُستخدم التوزيع الاحتمالي اللاحق للقياس الحالي كتوزيع احتمالي مسبق في القياس التالي. في التقدير التسلسلي، ما لم يُستخدم توزيع احتمالي مسبق مترافق، يصبح التوزيع الاحتمالي اللاحق أكثر تعقيدًا مع كل قياس إضافي، ولا يمكن عادةً حساب مُقدِّر بايز دون اللجوء إلى الطرق العددية.

فيما يلي بعض الأمثلة على التوزيعات الاحتمالية المسبقة المترافقة.

  • لوx|θ{\displaystyle x|\theta }طبيعي ،x|θشمال(θ،σ2){\displaystyle x|\theta \sim N(\theta ,\sigma ^{2})}، والوضع السابق طبيعي،θشمال(μ،τ2){\displaystyle \theta \sim N(\mu ,\tau ^{2})}إذا كان التوزيع الاحتمالي اللاحق طبيعيًا أيضًا، فإن مقدِّر بايز في ظل متوسط ​​مربعات الخطأ يُعطى بالصيغة التالية:
θ^(x)=σ2σ2+τ2μ+τ2σ2+τ2x.{\displaystyle {\widehat {\theta }}(x)={\frac {\sigma ^{2}}{\sigma ^{2}+\tau ^{2}}}\mu +{\frac {\tau ^{2}}{\sigma ^{2}+\tau ^{2}}}x.}
  • لوx1،...،xن{\displaystyle x_{1},...,x_{n}}هي متغيرات عشوائية مستقلة ومتطابقة التوزيع من نوع بواسونxأنا|θP(θ){\displaystyle x_{i}|\theta \sim P(\theta )}وإذا كان التوزيع الاحتمالي المسبق يتبع توزيع جاماθجي(أ،ب){\displaystyle \theta \sim G(a,b)}إذاً، فإن التوزيع الاحتمالي اللاحق يكون أيضاً توزيع غاما، ويُعطى مُقدِّر بايز في ظل متوسط ​​مربع الخطأ بواسطة
θ^(X)=نX¯+أن+ب.{\displaystyle {\widehat {\theta }}(X)={\frac {n{\overline {X}}+a}{n+b}}.}
  • لوx1،...،xن{\displaystyle x_{1},...,x_{n}}هي مستقلة وموزعة توزيعًا منتظمًاxأنا|θيو(0،θ){\displaystyle x_{i}|\theta \sim U(0,\theta )}وإذا كان التوزيع المسبق يتبع توزيع باريتوθPأ(θ0،أ){\displaystyle \theta \sim Pa(\theta _{0},a)}إذاً، فإن التوزيع الاحتمالي اللاحق يتبع توزيع باريتو أيضاً، ويُعطى مُقدِّر بايز في ظل متوسط ​​مربع الخطأ بواسطة
θ^(X)=(أ+ن)الأعلى(θ0،x1،...،xن)أ+ن-1.{\displaystyle {\widehat {\theta }}(X)={\frac {(a+n)\max {(\theta _{0},x_{1},...,x_{n})}}{a+n-1}}.}

وظائف المخاطر البديلة

يتم اختيار دوال المخاطرة بناءً على كيفية قياس المسافة بين التقدير والمعلمة المجهولة. تُعدّ دالة متوسط ​​مربعات الخطأ (MSE) أكثر دوال المخاطرة شيوعًا، ويعود ذلك أساسًا إلى بساطتها. مع ذلك، تُستخدم دوال مخاطرة بديلة أحيانًا. فيما يلي بعض الأمثلة على هذه البدائل. نرمز إلى دالة التوزيع المعمم اللاحق بـF{\displaystyle F}.

الوسيط الخلفي والكميات الأخرى

دالة خسارة "خطية"، معأ>0{\displaystyle a>0}، مما ينتج عنه الوسيط الخلفي كتقدير بايز:

ل(θ،θ^)=أ|θ-θ^|{\displaystyle L(\theta ,{\widehat {\theta }})=a|\theta -{\widehat {\theta }}|}
F(θ^(x)|X)=12.{\displaystyle F({\widehat {\theta }}(x)|X)={\tfrac {1}{2}}.}

دالة خسارة "خطية" أخرى، تُعيّن "أوزاناً" مختلفة.أ،ب>0{\displaystyle a,b>0}يؤدي ذلك إلى التقدير الزائد أو الناقص. وينتج عنه كمية من التوزيع الاحتمالي اللاحق، وهو تعميم لدالة الخسارة السابقة:

ل(θ،θ^)={أ|θ-θ^|،ل θ-θ^0ب|θ-θ^|،ل θ-θ^<0{\displaystyle L(\theta ,{\widehat {\theta }})={\begin{cases}a|\theta -{\widehat {\theta }}|,&{\mbox{for }}\theta -{\widehat {\theta }}\geq 0\\b|\theta -{\widehat {\theta }}|,&{\mbox{for }}\theta -{\widehat {\theta }}<0\end{cases}}}
F(θ^(x)|X)=أأ+ب.{\displaystyle F({\widehat {\theta }}(x)|X)={\frac {a}{a+b}}.}

الوضع الخلفي

تُعطي دالة الخسارة التالية النمط اللاحق في حالة الحدك>0{\displaystyle K>0}، في ظل ظروف معينة على الجزء الخلفي [ 4 ] :

ل(θ،θ^)={0،ل |θ-θ^|<كل،ل |θ-θ^|ك،{\displaystyle L(\theta ,{\widehat {\theta }})={\begin{cases}0,&{\mbox{for }}|\theta -{\widehat {\theta }}|<K\\L,&{\mbox{for }}|\theta -{\widehat {\theta }}|\geq K,\end{cases}}}

أينل>0{\displaystyle L>0}ثابت.

مقدرات Lp

يمكن للمرء أيضًا أن يفكرلP{\displaystyle L^{P}}المخاطرة التي يتم تحديد الخسارة من خلالها

ل(θ،θ^)=|θ-θ^|ص،ص>0.{\displaystyle L(\theta ,{\hat {\theta }})=|\theta -{\hat {\theta }}|^{p},\,p>0.}

أفضل لعبةلص{\displaystyle L^{p}}قد يكون من الصعب تحديد خصائص المقدرات بصيغة مغلقة، إلا أنها تشترك في العديد من الخصائص المشابهة لتلك الموجودة فيل2{\displaystyle L^{2}}[ 5 ]

يمكن تصور دوال خسارة أخرى، على الرغم من أن متوسط ​​مربع الخطأ هو الأكثر استخدامًا واعتمادًا. تُستخدم دوال خسارة أخرى في الإحصاء، وخاصة في الإحصاء القوي .

مقدرات بايز المعممة

التوزيع المسبقص{\displaystyle p}وقد افترض حتى الآن أن هذا التوزيع هو توزيع احتمالي حقيقي، بمعنى أن

ص(θ)دθ=1.{\displaystyle \int p(\theta )d\theta =1.}

مع ذلك، قد يكون هذا شرطًا مُقيِّدًا في بعض الأحيان. على سبيل المثال، لا يوجد توزيع (يشمل مجموعة الأعداد الحقيقية R ) يكون فيه احتمال كل عدد حقيقي متساويًا. ومع ذلك، يبدو هذا "التوزيع" من وجهة نظر معينة خيارًا طبيعيًا لتوزيع احتمالي أولي غير إعلامي ، أي توزيع احتمالي أولي لا يُشير إلى تفضيل أي قيمة مُحددة للمعلمة المجهولة. لا يزال بالإمكان تعريف دالة.ص(θ)=1{\displaystyle p(\theta )=1}لكن هذا لن يكون توزيعًا احتماليًا صحيحًا نظرًا لأن كتلته لا نهائية.

ص(θ)دθ=.{\displaystyle \int {p(\theta )d\theta }=\infty .}

مثل هذه التدابيرص(θ){\displaystyle p(\theta )}أما التوزيعات التي لا تمثل توزيعات احتمالية، فيشار إليها باسم التوزيعات الاحتمالية المسبقة غير المناسبة .

يؤدي استخدام توزيع احتمالي مسبق غير مناسب إلى عدم تعريف مخاطرة بايز (لأن التوزيع المسبق ليس توزيعًا احتماليًا، ولا يمكننا حساب القيمة المتوقعة في ظله). ونتيجةً لذلك، لم يعد من المجدي الحديث عن مُقدِّر بايز يُقلِّل مخاطرة بايز. مع ذلك، في كثير من الحالات، يمكن تعريف التوزيع الاحتمالي اللاحق.

ص(θ|x)=ص(x|θ)ص(θ)ص(x|θ)ص(θ)دθ.{\displaystyle p(\theta |x)={\frac {p(x|\theta )p(\theta )}{\int p(x|\theta )p(\theta )d\theta }}.}

هذا تعريف، وليس تطبيقًا لنظرية بايز ، إذ لا يمكن تطبيق نظرية بايز إلا عندما تكون جميع التوزيعات صحيحة. مع ذلك، ليس من النادر أن يكون التوزيع الاحتمالي اللاحق الناتج توزيعًا احتماليًا صحيحًا. في هذه الحالة، الخسارة المتوقعة اللاحقة

ل(θ،أ)ص(θ|x)دθ{\displaystyle \int {L(\theta ,a)p(\theta |x)d\theta }}

عادةً ما تكون محددة جيدًا ومحدودة. تذكر أنه في حالة التوزيع الاحتمالي المسبق المناسب، يُقلل مُقدِّر بايز من الخسارة المتوقعة اللاحقة. أما عندما يكون التوزيع الاحتمالي المسبق غير مناسب، فيُشار إلى المُقدِّر الذي يُقلل من الخسارة المتوقعة اللاحقة باسم مُقدِّر بايز المُعمَّم . [ 2 ]

مثال

ومن الأمثلة النموذجية على ذلك تقدير معلمة الموقع باستخدام دالة خسارة من النوعل(أ-θ){\displaystyle L(a-\theta )}. هناθ{\displaystyle \theta }هو مُعامل الموقع، أيص(x|θ)=و(x-θ){\displaystyle p(x|\theta )=f(x-\theta )}.

من الشائع استخدام الصيغة السابقة غير المناسبةص(θ)=1{\displaystyle p(\theta )=1}في هذه الحالة، وخاصة عندما لا تتوفر معلومات أخرى أكثر ذاتية. وهذا يؤدي إلى

ص(θ|x)=ص(x|θ)ص(θ)ص(x)=و(x-θ)ص(x){\displaystyle p(\theta |x)={\frac {p(x|\theta )p(\theta )}{p(x)}}={\frac {f(x-\theta )}{p(x)}}}

وبالتالي الخسارة المتوقعة اللاحقة

هـ[ل(أ-θ)|x]=ل(أ-θ)ص(θ|x)دθ=1ص(x)ل(أ-θ)و(x-θ)دθ.{\displaystyle E[L(a-\theta )|x]=\int {L(a-\theta )p(\theta |x)d\theta }={\frac {1}{p(x)}}\int L(a-\theta )f(x-\theta )d\theta .}

مقدر بايز المعمم هو القيمةأ(x){\displaystyle a(x)}الذي يقلل من هذا التعبير لقيمة معينةx{\displaystyle x}وهذا يعادل تقليل

ل(أ-θ)و(x-θ)دθ{\displaystyle \int L(a-\theta )f(x-\theta )d\theta }بالنسبة لـx.{\displaystyle x.}    (1)

في هذه الحالة، يمكن إثبات أن مقدر بايز المعمم له الشكل التالي:x+أ0{\displaystyle x+a_{0}}، لبعض الثوابتأ0{\displaystyle a_{0}}لرؤية ذلك، دعأ0{\displaystyle a_{0}}لتكن القيمة التي تقلل (1) عندماx=0{\displaystyle x=0}ثم، عند إعطاء قيمة مختلفةx1{\displaystyle x_{1}}يجب علينا تقليل

ل(أ-θ)و(x1-θ)دθ=ل(أ-x1-θ)و(-θ)دθ.{\displaystyle \int L(a-\theta )f(x_{1}-\theta )d\theta =\int L(a-x_{1}-\theta ')f(-\theta ')d\theta '.}    (2)

هذا مطابق لـ (1)، باستثناء أنأ{\displaystyle a}تم استبدالها بـأ-x1{\displaystyle a-x_{1}}وبالتالي، فإن التعبير الذي يُقلل من قيمة الدالة يُعطى بالصيغة التالية:أ-x1=أ0{\displaystyle a-x_{1}=a_{0}}بحيث يكون للمُقدِّر الأمثل الشكل التالي

أ(x)=أ0+x.{\displaystyle a(x)=a_{0}+x.\,\!}

مقدرات بايز التجريبية

يُطلق على مُقدِّر بايز المُشتق باستخدام طريقة بايز التجريبية اسم مُقدِّر بايز التجريبي . تُتيح طرق بايز التجريبية استخدام بيانات تجريبية مساعدة، مُستقاة من مُلاحظات معلمات مُرتبطة، في تطوير مُقدِّر بايز. ويتم ذلك بافتراض أن المعلمات المُقدَّرة مُستمدة من توزيع احتمالي مُسبق مُشترك. على سبيل المثال، إذا أُجريت مُلاحظات مُستقلة لمعلمات مُختلفة، فإنه يُمكن أحيانًا تحسين أداء تقدير مُعلمة مُعينة باستخدام بيانات من مُلاحظات أخرى.

توجد مناهج بارامترية وغير بارامترية لتقدير بايز التجريبي. [ 6 ]

مثال

فيما يلي مثال بسيط على تقدير بايز التجريبي البارامتري. بالنظر إلى الملاحظات السابقةx1،...،xن{\displaystyle x_{1},\ldots ,x_{n}}لها توزيع شرطيو(xأنا|θأنا){\displaystyle f(x_{i}|\theta _{i})}يهتم المرء بتقديرθن+1{\displaystyle \theta _{n+1}}مرتكز علىxن+1{\displaystyle x_{n+1}}افترض أنθأنا{\displaystyle \theta _{i}}لديهم سابقة مشتركةπ{\displaystyle \pi }والتي تعتمد على معلمات غير معروفة. على سبيل المثال، لنفترض أنπ{\displaystyle \pi }توزيع طبيعي بمتوسط ​​غير معروفμπ{\displaystyle \mu _{\pi }\,\!}والتباينσπ.{\displaystyle \sigma _{\pi }\,\!.}يمكننا بعد ذلك استخدام الملاحظات السابقة لتحديد المتوسط ​​والتباين لـπ{\displaystyle \pi }بالطريقة التالية.

أولاً، نقوم بتقدير المتوسطμم{\displaystyle \mu _{m}\,\!}والتباينσم{\displaystyle \sigma _{m}\,\!}التوزيع الهامشي لـx1،...،xن{\displaystyle x_{1},\ldots ,x_{n}}باستخدام أسلوب الاحتمال الأقصى :

μ^م=1نxأنا،{\displaystyle {\widehat {\mu }}_{m}={\frac {1}{n}}\sum {x_{i}},}
σ^م2=1ن(xأنا-μ^م)2.{\displaystyle {\widehat {\sigma }}_{m}^{2}={\frac {1}{n}}\sum {(x_{i}-{\widehat {\mu }}_{m})^{2}}.}

بعد ذلك، نستخدم قانون التوقع الكلي لحسابμم{\displaystyle \mu _{m}}وقانون التباين الكلي لحسابσم2{\displaystyle \sigma _{m}^{2}}بحيث

μم=هـπ[μو(θ)]،{\displaystyle \mu _{m}=E_{\pi }[\mu _{f}(\theta )]\,\!,}
σم2=هـπ[σو2(θ)]+هـπ[(μو(θ)-μم)2]،{\displaystyle \sigma _{m}^{2}=E_{\pi }[\sigma _{f}^{2}(\theta )]+E_{\pi }[(\mu _{f}(\theta )-\mu _{m})^{2}],}

أينμو(θ){\displaystyle \mu _{f}(\theta )}وσو(θ){\displaystyle \sigma _{f}(\theta )}هي لحظات التوزيع الشرطيو(xأنا|θأنا){\displaystyle f(x_{i}|\theta _{i})}، والتي يُفترض أنها معلومة. على وجه الخصوص، لنفترض أنμو(θ)=θ{\displaystyle \mu _{f}(\theta )=\theta }وذلكσو2(θ)=ك{\displaystyle \sigma _{f}^{2}(\theta )=K}ثم لدينا

μπ=μم،{\displaystyle \mu _{\pi }=\mu _{m}\,\!,}
σπ2=σم2-σو2=σم2-ك.{\displaystyle \sigma _{\pi }^{2}=\sigma _{m}^{2}-\sigma _{f}^{2}=\sigma _{m}^{2}-K.}

وأخيرًا، نحصل على اللحظات المقدرة للتوزيع الاحتمالي المسبق.

μ^π=μ^م،{\displaystyle {\widehat {\mu }}_{\pi }={\widehat {\mu }}_{m},}
σ^π2=σ^م2-ك.{\displaystyle {\widehat {\sigma }}_{\pi }^{2}={\widehat {\sigma }}_{m}^{2}-K.}

على سبيل المثال، إذاxأنا|θأناشمال(θأنا،1){\displaystyle x_{i}|\theta _{i}\sim N(\theta _{i},1)}وإذا افترضنا توزيعًا احتماليًا طبيعيًا مسبقًا (وهو توزيع احتمالي مترافق في هذه الحالة)، فإننا نستنتج أنθن+1شمال(μ^π،σ^π2){\displaystyle \theta _{n+1}\sim N({\widehat {\mu }}_{\pi },{\widehat {\sigma }}_{\pi }^{2})}، ومنها مقدر بايز لـθن+1{\displaystyle \theta _{n+1}}مرتكز علىxن+1{\displaystyle x_{n+1}}يمكن حسابها.

ملكيات

المقبولية

تُعتبر قواعد بايز ذات مخاطر بايز المحدودة مقبولة عادةً . وفيما يلي بعض الأمثلة المحددة لنظريات القبول.

  • إذا كانت قاعدة بايز فريدة، فهي مقبولة. [ 7 ] على سبيل المثال، كما ذُكر أعلاه، في ظل متوسط ​​مربع الخطأ (MSE)، تكون قاعدة بايز فريدة وبالتالي مقبولة.
  • إذا كانت θ تنتمي إلى مجموعة منفصلة ، ​​فإن جميع قواعد بايز مقبولة.
  • إذا كانت θ تنتمي إلى مجموعة متصلة (غير منفصلة)، وإذا كانت دالة المخاطرة R(θ,δ) متصلة في θ لكل δ، فإن جميع قواعد بايز مقبولة.

في المقابل، غالبًا ما تنطوي قواعد بايز المعممة على مخاطر بايز غير محددة في حالة التوزيعات الاحتمالية المسبقة غير المناسبة. غالبًا ما تكون هذه القواعد غير مقبولة، وقد يكون التحقق من مقبوليتها أمرًا صعبًا. على سبيل المثال، يُعد مُقدِّر بايز المعمم لمعامل الموقع θ، المُستند إلى عينات غاوسية (الموصوف في قسم "مُقدِّر بايز المعمم" أعلاه)، غير مقبول لـص>2{\displaystyle p>2}وهذا ما يُعرف بظاهرة شتاين .

الكفاءة التقاربية

ليكن θ متغيرًا عشوائيًا مجهولًا، ولنفترض أنx1،x2،...{\displaystyle x_{1},x_{2},\ldots }هل العينات مستقلة ومتطابقة التوزيع ذات كثافةو(xأنا|θ){\displaystyle f(x_{i}|\theta )}. يتركدلتان=دلتان(x1،...،xن){\displaystyle \delta _{n}=\delta _{n}(x_{1},\ldots ,x_{n})}لنفترض أن لدينا سلسلة من مُقدِّرات بايز لـ θ بناءً على عدد متزايد من القياسات. نهتم بتحليل الأداء التقاربي لهذه السلسلة من المُقدِّرات، أي أداءدلتان{\displaystyle \delta _{n}}بالنسبة لقيم n الكبيرة .

ولهذا الغرض، من المعتاد اعتبار θ معلمة حتمية تكون قيمتها الحقيقيةθ0{\displaystyle \theta _{0}}في ظل ظروف محددة، [ 8 ] بالنسبة للعينات الكبيرة (قيم n الكبيرة )، يكون التوزيع الاحتمالي اللاحق لـ θ طبيعيًا تقريبًا. بعبارة أخرى، بالنسبة لقيم n الكبيرة ، يكون تأثير الاحتمال المسبق على التوزيع اللاحق ضئيلاً. علاوة على ذلك، إذا كان δ هو مُقدِّر بايز في ظل مخاطر متوسط ​​مربع الخطأ، فإنه يكون غير متحيز تقاربيًا ويتقارب في التوزيع مع التوزيع الطبيعي .

ن(دلتان-θ0)شمال(0،1أنا(θ0))،{\displaystyle {\sqrt {n}}(\delta _{n}-\theta _{0})\to N\left(0,{\frac {1}{I(\theta _{0})}}\right),}

حيث I0 ) هي معلومات فيشر لـ θ 0. ويترتب على ذلك أن مقدر بايز δ n في ظل MSE يكون فعالاً تقاربياً .

يُعدّ مُقدِّر الاحتمال الأقصى (MLE) مُقدِّرًا آخر يتسم بالتوزيع الطبيعي التقاربي والكفاءة . ويمكن توضيح العلاقة بين مُقدِّر الاحتمال الأقصى ومُقدِّر بايز في المثال البسيط التالي.

مثال: تقدير قيمة p في التوزيع ذي الحدين

لنفترض مُقدِّر θ بناءً على عينة ذات الحدين x ~b(θ, n ) حيث θ تُمثِّل احتمال النجاح. بافتراض أن θ مُوزَّع وفقًا للتوزيع المسبق المترافق، وهو في هذه الحالة توزيع بيتا B( a , b )، فإن التوزيع اللاحق معروف بأنه B(a+x,b+nx). وبالتالي، فإن مُقدِّر بايز في ظل متوسط ​​مربع الخطأ هو

دلتان(x)=هـ[θ|x]=أ+xأ+ب+ن.{\displaystyle \delta _{n}(x)=E[\theta |x]={\frac {a+x}{a+b+n}}.}

إن تقدير الاحتمال الأقصى في هذه الحالة هو x/n، وبالتالي نحصل على:

دلتان(x)=أ+بأ+ب+نهـ[θ]+نأ+ب+ندلتاملهـ.{\displaystyle \delta _{n}(x)={\frac {a+b}{a+b+n}}E[\theta ]+{\frac {n}{a+b+n}}\delta _{MLE}.}

تشير المعادلة الأخيرة إلى أنه بالنسبة لـ n → ∞، فإن مقدر بايز (في المشكلة الموصوفة) قريب من تقدير الاحتمال الأقصى.

من جهة أخرى، عندما تكون قيمة n صغيرة، تظل المعلومات المسبقة ذات صلة بمسألة القرار وتؤثر على التقدير. لمعرفة الوزن النسبي للمعلومات المسبقة، افترض أن a = b ؛ في هذه الحالة، يُضيف كل قياس بتًا واحدًا جديدًا من المعلومات؛ تُظهر الصيغة أعلاه أن للمعلومات المسبقة نفس وزن a + b بت من المعلومات الجديدة. في التطبيقات، غالبًا ما تكون المعلومات المتوفرة عن تفاصيل التوزيع المسبق قليلة جدًا؛ على وجه الخصوص، لا يوجد سبب للافتراض بأنه يتطابق تمامًا مع B( a , b ). في مثل هذه الحالة، أحد التفسيرات الممكنة لهذه الحسابات هو: "يوجد توزيع مسبق غير شاذ بمتوسط ​​0.5 وانحراف معياري مما يُعطي وزنًا للمعلومات المسبقة يساوي 1/(4d² ) - 1 بت من المعلومات الجديدة."

مثال آخر على هذه الظاهرة هو حالة التوزيع الطبيعي للتقدير المسبق والقياس. إذا كان التقدير المسبق متمركزًا عند النقطة B بانحراف معياري Σ، وكان القياس متمركزًا عند النقطة b بانحراف معياري σ، فإن التقدير اللاحق يكون متمركزًا عند النقطة b.αα+βب+βα+βب{\displaystyle {\frac {\alpha }{\alpha +\beta }}B+{\frac {\beta }{\alpha +\beta }}b}حيث تكون الأوزان في هذا المتوسط ​​المرجح α=σ² و β=Σ². علاوة على ذلك، فإن مربع الانحراف اللاحق هو Σ²+σ². بعبارة أخرى، يتم دمج الاحتمال المسبق مع القياس بنفس الطريقة تمامًا كما لو كان قياسًا إضافيًا يجب أخذه في الاعتبار.

على سبيل المثال، إذا كان Σ=σ/2، فإن انحراف 4 قياسات مجتمعة يطابق انحراف التوزيع الاحتمالي المسبق (بافتراض استقلال أخطاء القياسات). وتتوافق الأوزان α وβ في صيغة التوزيع الاحتمالي اللاحق مع هذا: وزن التوزيع الاحتمالي المسبق يساوي 4 أضعاف وزن القياس. وبدمج هذا التوزيع الاحتمالي المسبق مع n قياسات بمتوسط ​​v ، نحصل على توزيع احتمالي لاحق متمركز عند44+نV+ن4+نv{\displaystyle {\frac {4}{4+n}}V+{\frac {n}{4+n}}v}وعلى وجه الخصوص، يؤدي الاحتمال المسبق نفس دور أربع قياسات أُجريت مسبقًا. وبشكل عام، يكون للاحتمال المسبق وزن يساوي (σ/Σ)² من القياسات.

بالمقارنة مع مثال التوزيع ذي الحدين: هناك، يكون للتوزيع المسبق وزن (σ/Σ)²−1 قياسًا. يمكن ملاحظة أن الوزن الدقيق يعتمد على تفاصيل التوزيع، ولكن عندما يكون σ≫Σ، يصبح الفرق ضئيلاً.

مثال عملي على مقدرات بايز

تستخدم قاعدة بيانات الأفلام على الإنترنت (IMDb) صيغةً لحساب ومقارنة تقييمات الأفلام من قِبل مستخدميها، بما في ذلك قائمة أفضل 250 فيلمًا ، والتي يُزعم أنها تُعطي "تقديرًا بايزيًا دقيقًا". [ 9 ] استُخدمت الصيغة البايزية التالية في البداية لحساب متوسط ​​مرجح لأفضل 250 فيلمًا، إلا أن الصيغة قد عُدّلت منذ ذلك الحين:

دبليو=Rv+جمv+م {\displaystyle W={Rv+Cm \over v+m}\ }

أين:

دبليو {\displaystyle W\ }= التقييم المرجح
R {\displaystyle R\ }= متوسط ​​تقييم الفيلم كرقم من 1 إلى 10 (المتوسط) = (التقييم)
v {\displaystyle v\ }عدد الأصوات/التقييمات للفيلم = (أصوات)
م {\displaystyle m\ }= الوزن المعطى للتقدير السابق (في هذه الحالة، عدد الأصوات التي اعتبرها موقع IMDB ضرورية لكي يقترب متوسط ​​التقييم من الصلاحية الإحصائية)
ج {\displaystyle C\ }= متوسط ​​التصويت عبر المجموعة بأكملها (حالياً 7.0)

لاحظ أن W هو ببساطة المتوسط ​​الحسابي المرجح لـ R و C باستخدام متجه الأوزان (v, m) . عندما يتجاوز عدد التقييمات m ، تتجاوز ثقة متوسط ​​التقييم ثقة متوسط ​​التصويت لجميع الأفلام (C)، ويقترب التقييم المرجح (W) من المتوسط ​​الحسابي (R). كلما اقترب v (عدد تقييمات الفيلم) من الصفر، اقترب W من C ، حيث W هو التقييم المرجح و C هو متوسط ​​تقييم جميع الأفلام. بعبارة أبسط، كلما قل عدد التقييمات/التصويتات لفيلم ما، كلما اقترب تقييمه المرجح من المتوسط ​​الحسابي لجميع الأفلام، بينما تقترب تقييمات الأفلام ذات التقييمات/التصويتات الكثيرة من متوسطها الحسابي.

يضمن نهج IMDb أن الفيلم الذي حصل على عدد قليل من التقييمات، وكلها عند 10، لن يحتل مرتبة أعلى من فيلم "العراب"، على سبيل المثال، الذي حصل على متوسط ​​9.2 من أكثر من 500000 تقييم.

انظر أيضاً

ملحوظات

  1. ليمان وكاسيلا، النظرية 4.1.1
  2. 1 2 ليمان وكاسيلا، التعريف 4.2.9
  3. ↑ جاينز ، إي تي (2007). نظرية الاحتمالات: منطق العلم (الطبعة الخامسة  المطبوعة). كامبريدج [ua]: مطبعة جامعة كامبريدج. ص 172. ISBN  978-0-521-59271-0.
  4. باسيت، روبرت؛ ديريد، خوليو (مارس 2019). "مُقدِّرات الاحتمال اللاحق الأقصى كحدٍّ لمُقدِّرات بايز". البرمجة الرياضية . 174 ( 1-2 ): 129-144 . arXiv : 1611.05917 . doi : 10.1007/s10107-018-1241-0 .
  5. ديتسو، أ.؛ بوستين، ر.؛ تونينيتي، د.؛ ديفروي، ن.؛ بور، هـ. ف.؛ شماي شيتز، س. (2018). "حول الحد الأدنى لمتوسط ​​الخطأ من الرتبة p في قنوات الضوضاء الغاوسية وتطبيقاته". معاملات IEEE في نظرية المعلومات . 64 (3). IEEE : 2012-2037 . arXiv : 1607.01461 . doi : 10.1109/TIT.2017.2782786 .
  6. بيرغر (1980)، القسم 4.5.
  7. ليمان وكاسيلا (1998)، النظرية 5.2.4.
  8. ليمان وكاسيلا (1998)، القسم 6.8
  9. "أفضل 250 فيلمًا على موقع IMDb" . مؤرشف من الأصل بتاريخ 2012-06-01.

مراجع

  • بيرغر، جيمس أو. (1985). نظرية القرار الإحصائي والتحليل البايزي (  الطبعة الثانية). نيويورك: سبرينغر-فيرلاغ. ISBN 0-387-96098-8MR 0804611 . 
  • ليمان، إي إل؛ كاسيلا، جي. (1998). نظرية التقدير النقطي (  الطبعة الثانية). سبرينغر. ISBN 0-387-98502-6.
  • بيلز، يورغن (1991). "التقدير البايزي". التقدير البايزي والتصميم التجريبي في نماذج الانحدار الخطي . تشيتشستر: جون وايلي وأولاده. ص 38-117 . ISBN  0-471-91732-X.