معيار المعلومات البايزي

في الإحصاء ، يُعد معيار معلومات بايز ( BIC ) أو معيار معلومات شوارتز (ويُعرف أيضًا باسم SIC و SBC و SBIC ) معيارًا لاختيار النموذج الأمثل من بين مجموعة محدودة من النماذج؛ حيث تُفضّل النماذج ذات قيمة BIC المنخفضة عمومًا. ويستند هذا المعيار جزئيًا إلى دالة الاحتمال ، ويرتبط ارتباطًا وثيقًا بمعيار معلومات أكايكي (AIC).

عند تركيب النماذج، من الممكن زيادة الاحتمالية القصوى بإضافة معلمات، ولكن قد يؤدي ذلك إلى فرط التخصيص . يحاول كل من معيار معلومات بايز (BIC) ومعيار معلومات أكايكي (AIC) حل هذه المشكلة عن طريق إدخال حد جزائي لعدد المعلمات في النموذج؛ ويكون هذا الحد الجزائي أكبر في معيار معلومات بايز منه في معيار معلومات أكايكي لأحجام العينات الأكبر من 7. [ 1 ]

تم تطوير BIC بواسطة جيديون إي. شوارتز ونُشر في ورقة بحثية عام 1978، [ 2 ] كتقريب لعينة كبيرة لعامل بايز .

تعريف

يتم تعريف BIC رسميًا على النحو التالي [ 3 ] [ أ ]

بأناج=كln(ن)-2ln(ل^). {\displaystyle \mathrm {BIC} =k\ln(n)-2\ln({\widehat {L}}).\ }

أين

  • ل^{\displaystyle {\hat {L}}}= القيمة القصوى لدالة الاحتمالية للنموذجم{\displaystyle M}، أيل^=ص(x|θ^،م){\displaystyle {\hat {L}}=p(x\mid {\widehat {\theta }},M)}، أين{θ^}{\displaystyle \{{\widehat {\theta }}\}}هي قيم المعلمات التي تزيد من دالة الاحتمالية وx{\displaystyle x}هي البيانات المرصودة؛
  • ن{\displaystyle n}= عدد نقاط البيانات فيx{\displaystyle x}، عدد الملاحظات ، أو ما يعادلها، حجم العينة؛
  • ك{\displaystyle k}= عدد المعاملات التي يُقدّرها النموذج. على سبيل المثال، في الانحدار الخطي المتعدد ، تكون المعاملات المُقدّرة هي الحد الثابت، وq{\displaystyle q}معلمات الميل، والتباين الثابت للأخطاء؛ وبالتالي،ك=q+2{\displaystyle k=q+2}.

الاشتقاق

يمكن اشتقاق معيار معلومات بايز (BIC) عن طريق دمج معلمات النموذج باستخدام طريقة لابلاس ، بدءًا من دليل النموذج التالي : [ 5 ] [ 6 ] : 217

ص(x|م)=ص(x|θ،م)π(θ|م)دθ{\displaystyle p(x\mid M)=\int p(x\mid \theta ,M)\pi (\theta \mid M)\,d\theta }

أينπ(θ|م){\displaystyle \pi (\theta \mid M)}هو السابق لـθ{\displaystyle \theta }نموذج قيد التطويرم{\displaystyle M}.

احتمالية اللوغاريتم،ln(ص(x|θ،م)){\displaystyle \ln(p(x\mid \theta ,M))}ثم يتم توسيعها إلى متسلسلة تايلور من الدرجة الثانية حول تقدير الاحتمال الأقصى ،θ^{\displaystyle {\widehat {\theta }}}بافتراض أنها قابلة للتفاضل مرتين كما يلي:

ln(ص(x|θ،م))=ln(ل^)-ن2(θ-θ^)تيأنا(θ^)(θ-θ^)+R(x،θ)،{\displaystyle \ln(p(x\mid \theta ,M))=\ln({\widehat {L}})-{\frac {n}{2}}(\theta -{\widehat {\theta }})^{\operatorname {T} }{\mathcal {I}}({\widehat {\theta }})(\theta -{\widehat {\theta }})+R(x,\theta ),}

أينأنا(θ){\displaystyle {\mathcal {I}}(\theta )}يمثل متوسط ​​المعلومات المرصودة لكل عملية رصد ، وR(x،θ){\displaystyle R(x,\theta )}يشير إلى الحد المتبقي. إلى الحد الذيR(x،θ){\displaystyle R(x,\theta )}ضئيل وπ(θ|م){\displaystyle \pi (\theta \mid M)}يكون خطيًا نسبيًا بالقرب منθ^{\displaystyle {\widehat {\theta }}}يمكننا دمجθ{\displaystyle \theta }للحصول على ما يلي:

ص(x|م)ل^(2πن)ك2|أنا(θ^)|-12π(θ^){\displaystyle p(x\mid M)\approx {\hat {L}}{\left({\frac {2\pi }{n}}\right)}^{\frac {k}{2}}|{\mathcal {I}}({\widehat {\theta }})|^{-{\frac {1}{2}}}\pi ({\widehat {\theta }})}

مثلن{\displaystyle n}يمكننا تجاهل الزيادات|أنا(θ^)|{\displaystyle |{\mathcal {I}}({\widehat {\theta }})|}وπ(θ^){\displaystyle \pi ({\widehat {\theta }})}كما هييا(1){\displaystyle O(1)}. هكذا،

ص(x|م)=خبرة(lnل^-ك2ln(ن)+يا(1))=خبرة(-بأناج2+يا(1))،{\displaystyle p(x\mid M)=\exp \left(\ln {\widehat {L}}-{\frac {k}{2}}\ln(n)+O(1)\right)=\exp \left(-{\frac {\mathrm {BIC} }{2}}+O(1)\right),}

حيث يتم تعريف BIC كما هو موضح أعلاه، ول^{\displaystyle {\widehat {L}}}إما (أ) هو النمط الخلفي البايزي أو (ب) يستخدم تقدير الاحتمال الأقصى والنمط المسبقπ(θ|م){\displaystyle \pi (\theta \mid M)}يكون للدالة ميل غير صفري عند تقدير الاحتمال الأقصى. عندئذٍ يكون التوزيع الاحتمالي اللاحق

ص(م|x)ص(x|م)ص(م)خبرة(-بأناج2)ص(م){\displaystyle p(M\mid x)\propto p(x\mid M)p(M)\approx \exp \left(-{\frac {\mathrm {BIC} }{2}}\right)p(M)}

إن الحجج المذكورة أعلاه هي حجج استدلالية، ولكن يمكن جعلها دقيقة رياضياً في ظل الافتراضات التقنية لاستمرارية ليبشيتز والتحدب القوي ، كما يلي.

ليما. (لما 2.82 [ 7 ] ) تعريفن(θ)=-ln(ص(x|θ،م)π(θ|م))/ن{\displaystyle \ell _{n}(\theta )=-\ln(p(x\mid \theta ,M)\pi (\theta \mid M))/n}إذا كان تسلسل التدرجات{ن(θ)}{\displaystyle \{\nabla \ell _{n}(\theta )\}}دالة ليبشيتز متصلة، بشكل منتظم فين{\displaystyle n}وكلن(θ){\displaystyle \ell _{n}(\theta )}محدبة بقوة ولها معامل مشتركم>0{\displaystyle m>0}(بشكل مستقل عنن{\displaystyle n}ثم كمان{\displaystyle n\rightarrow \infty }: lnص(x|م)=ln(ص(x|θ¯ن،م)π(θ¯ن|م))-ك2ln(ن)+يا(1)،{\displaystyle \ln p(x\mid M)=\ln(p(x\mid {\bar {\theta }}_{n},M)\pi ({\bar {\theta }}_{n}\mid M))-{\frac {k}{2}}\ln(n)+O(1),} أينθ¯ن=argمينθن(θ){\displaystyle {\bar {\theta }}_{n}=\arg \min _{\theta }\ell _{n}(\theta )}هو التقدير الأقصى اللاحق (MAP) لـθ{\displaystyle \theta }.

لاحظ أنه من الممكن دائمًا اختيار كثافة مسبقةπ(θ|م){\displaystyle \pi (\theta \mid M)}بحيث يكون كلن(θ){\displaystyle \ell _{n}(\theta )}محدبة بشدة (بنفس المعامل)م{\displaystyle m}يضمن هذا التوزيع المسبق أن تقدير MAPθ¯ن{\displaystyle {\bar {\theta }}_{n}}يوجد، حتى في الحالات التي يكون فيها تقدير MLEθ^{\displaystyle {\hat {\theta }}}هو نفسه غير موجود.

يستخدم

عند الاختيار من بين عدة نماذج، يُفضل عمومًا النماذج ذات قيم BIC المنخفضة. وتُعد قيمة BIC دالة متزايدة لتباين الخطأ.σهـ2{\displaystyle \sigma _{e}^{2}}وهي دالة متزايدة لـ k . أي أن التباين غير المُفسَّر في المتغير التابع وعدد المتغيرات التفسيرية يزيدان من قيمة BIC. مع ذلك، فإن انخفاض قيمة BIC لا يشير بالضرورة إلى أن نموذجًا ما أفضل من غيره. ولأنها تتضمن تقريبات، فإن BIC مجرد أداة استدلالية. وعلى وجه الخصوص، لا ينبغي أبدًا التعامل مع الاختلافات في BIC كما لو كانت عوامل بايز مُحوَّلة.

من المهم التذكير بأن معيار معلومات بايز (BIC) يُستخدم لمقارنة النماذج المُقدَّرة فقط عندما تكون القيم العددية للمتغير التابع [ b ] متطابقة في جميع النماذج المُقارنة. ولا يشترط أن تكون النماذج المُقارنة متداخلة ، على عكس ما يحدث عند مقارنة النماذج باستخدام اختبار F أو اختبار نسبة الاحتمال .

لمقارنة نموذجين مختلفين، ما عليك سوى حساب BIC لكل نموذج ومقارنته وفقًا للجدول أدناه:

ΔBICأدلة ضد ارتفاع مؤشر معلومات البناء (BIC)
من 0 إلى 2لا يستحق الذكر تقريبًا
من 2 إلى 6إيجابي
من 6 إلى 10قوي
>10قوي جداً

القيود

يعاني معيار معلومات بايز (BIC) من قيدين رئيسيين: [ 8 ]

  1. التقريب المذكور أعلاه صالح فقط لحجم العينةن{\displaystyle n}أكبر بكثير من العددك{\displaystyle k}من المعلمات في النموذج.
  2. لا يستطيع معيار BIC التعامل مع مجموعات النماذج المعقدة كما هو الحال في مشكلة اختيار المتغيرات (أو اختيار الميزات ) في الأبعاد العالية. [ 8 ]

حالة خاصة من غاوس

بافتراض أن أخطاء النموذج أو الاضطرابات مستقلة وموزعة بشكل متطابق وفقًا للتوزيع الطبيعي وشرط الحدود الذي يكون فيه مشتق اللوغاريتم الاحتمالي بالنسبة للتباين الحقيقي يساوي صفرًا، يصبح هذا ( حتى ثابت إضافي ، والذي يعتمد فقط على n وليس على النموذج): [ 9 ]

بأناج=نln(σهـ2^)+كln(ن) {\displaystyle \mathrm {BIC} =n\ln({\widehat {\sigma _{e}^{2}}})+k\ln(n)\ }

أينσهـ2^{\displaystyle {\widehat {\sigma _{e}^{2}}}}يمثل تباين الخطأ. ويُعرَّف تباين الخطأ في هذه الحالة على النحو التالي:

σهـ2^=1نأنا=1ن(xأنا-x^أنا)2.{\displaystyle {\widehat {\sigma _{e}^{2}}}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\widehat {x}}_{i})^{2}.}

وهو مقدر متحيز للتباين الحقيقي .

من حيث مجموع مربعات البواقي (RSS)، فإن معيار معلومات بايز ( BIC) هو

بأناج=نln(RSS/ن)+كln(ن) {\displaystyle \mathrm {BIC} =n\ln({\text{RSS}}/n)+k\ln(n)\ }

عند اختبار نماذج خطية متعددة مقابل نموذج مشبع، يمكن إعادة كتابة معيار معلومات بايز (BIC) بدلالة الانحراف.χ2{\displaystyle \chi ^{2}}كما يلي: [ 10 ]

بأناج=χ2+كln(ن){\displaystyle \mathrm {BIC} =\chi ^{2}+k\ln(n)}

أينك{\displaystyle k}يمثل عدد معلمات النموذج في الاختبار.

انظر أيضاً

ملحوظات

  1. إن AIC و AICc و BIC التي حددها Claeskens و Hjort [ 4 ] هي عكس تلك المحددة في هذه المقالة وفي معظم المراجع القياسية الأخرى.
  2. يُطلق على المتغير التابع أيضًا اسم متغير الاستجابة أو متغير النتيجة . انظر تحليل الانحدار .

مراجع

  1. انظر الورقة البحثية: ستويكا، ب.؛ سيلين، ي. (2004)، "اختيار ترتيب النموذج: مراجعة لقواعد معيار المعلومات"، مجلة معالجة الإشارات IEEE (يوليو): 36-47 ، doi : 10.1109/MSP.2004.1311138 ، S2CID 17338979 .
  2. شوارتز، جيديون إي. (1978)، "تقدير بُعد النموذج"، حوليات الإحصاء ، 6 (2): 461-464 ، doi : 10.1214/aos/1176344136 ، MR 0468014 .
  3. ^ فيت ، إرنست. إدوين فان دن هوفيل؛ جان ويليم رومين (2012). "«جميع النماذج خاطئة...»: مقدمة في عدم اليقين في النماذج (ملف PDF) . مجلة الإحصاء الهولندية . 66 (3): 217-236 . doi : 10.1111/j.1467-9574.2012.00530.x . S2CID 7793470. مؤرشف من النسخة الأصلية (ملف PDF) بتاريخ 26 يوليو 2020. تاريخ الاسترجاع: 11 ديسمبر 2019 . 
  4. كلايسكنز، جهيورت، ن. ل. (2008)، اختيار النموذج ومتوسط ​​النماذج ، مطبعة جامعة كامبريدج
  5. رافتري، أ. إي. (1995). "اختيار النموذج البايزي في البحث الاجتماعي". منهجية علم الاجتماع . 25 : 111-196 . doi : 10.2307/271063 . JSTOR 271063 . 
  6. ^ كونيشي، سادانوري. كيتاجاوا، جينشيرو (2008). معايير المعلومات والنمذجة الإحصائية . سبرينغر. رقم ISBN 978-0-387-71886-6.
  7. بوتيف، زدرافكو إي.؛ كروس، ديرك ب.؛ تايمر، توماس (2025). علم البيانات والتعلم الآلي: الأساليب الرياضية والإحصائية ( الطبعة الثانية). بوكا راتون ؛ لندن: مطبعة سي آر سي. الصفحات 56-57 . ISBN    978-1-032-48868-4.
  8. 1 2 جيرو، سي. (2015). مقدمة في الإحصاء عالي الأبعاد . تشابمان آند هول/سي آر سي. ISBN 9781482237948.
  9. بريستلي، إم بي (1981). التحليل الطيفي والسلاسل الزمنية . دار النشر الأكاديمية . رقم ISBN 978-0-12-564922-3.(ص 375).
  10. كاس، روبرت إي.؛ رافتري، أدريان إي. (1995)، "عوامل بايز"، مجلة الجمعية الإحصائية الأمريكية ، 90 (430): 773-795 ، doi : 10.2307/2291091 ، ISSN 0162-1459 ، JSTOR 2291091  .

للمزيد من القراءة