المتوسط ​​الحسابي المرجح

يُشبه المتوسط ​​الحسابي المرجّح المتوسط ​​الحسابي العادي ( وهو النوع الأكثر شيوعًا من المتوسطات )، إلا أنه بدلًا من أن تُساهم جميع نقاط البيانات بالتساوي في المتوسط ​​النهائي، تُساهم بعض نقاط البيانات أكثر من غيرها. يلعب مفهوم المتوسط ​​المرجّح دورًا في الإحصاء الوصفي ، كما يظهر بصورة أعمّ في العديد من مجالات الرياضيات الأخرى .

إذا كانت جميع الأوزان متساوية، فإن المتوسط ​​المرجح يساوي المتوسط ​​الحسابي . وبينما تتصرف المتوسطات المرجحة عمومًا بطريقة مشابهة للمتوسطات الحسابية، إلا أنها تنطوي على بعض الخصائص غير البديهية، كما يتضح مثلاً في مفارقة سيمبسون .

أمثلة

مثال أساسي

بافتراض وجود فصلين دراسيين - أحدهما يضم 20 طالبًا والآخر يضم 30 طالبًا - ودرجات الاختبار في كل فصل على النحو التالي:

الحصة الصباحية = {62، 67، 71، 74، 76، 77، 78، 79، 79، 80، 80، 81، 81، 82، 83، 84، 86، 89، 93، 98}

فئة ما بعد الظهر = {81، 82، 83، 84، 85، 86، 87، 87، 88، 88، 89، 89، 89، 90، 90، 90، 90، 91، 91، 91، 92، 92، 93، 93، 94، 95، 96، 97، 98، 99}

متوسط ​​درجات الفصل الصباحي 80، ومتوسط ​​درجات الفصل المسائي 90. المتوسط ​​الحسابي غير المرجح للمتوسطين هو 85. مع ذلك، لا يأخذ هذا المتوسط ​​في الحسبان اختلاف عدد الطلاب في كل فصل (20 مقابل 30)؛ لذا فإن قيمة 85 لا تعكس متوسط ​​درجات الطلاب (بصرف النظر عن الفصل). يمكن حساب متوسط ​​درجات الطلاب بجمع جميع الدرجات، دون النظر إلى الفصول (جمع جميع الدرجات وقسمتها على العدد الإجمالي للطلاب). x¯=430050=86.{\displaystyle {\bar {x}}={\frac {4300}{50}}=86.}

أو يمكن تحقيق ذلك عن طريق ترجيح متوسطات الفصول الدراسية بعدد الطلاب في كل فصل. ويُعطى الفصل الأكبر وزناً أكبر.

x¯=(20×80)+(30×90)20+30=86.{\displaystyle {\bar {x}}={\frac {(20\times 80)+(30\times 90)}{20+30}}=86.}

وبالتالي، يُتيح المتوسط ​​المرجح إمكانية إيجاد متوسط ​​درجات الطلاب دون معرفة درجات كل طالب على حدة. يكفي فقط معرفة متوسط ​​درجات الصفوف وعدد الطلاب في كل صف.

مثال على التركيب المحدب

بما أن الأوزان النسبية فقط هي المهمة، يمكن التعبير عن أي متوسط ​​مرجح باستخدام معاملات مجموعها يساوي واحدًا. يُطلق على هذا التركيب الخطي اسم التركيب المحدب .

باستخدام المثال السابق، سنحصل على الأوزان التالية:

2020+30=0.4{\displaystyle {\frac {20}{20+30}}=0.4}
3020+30=0.6{\displaystyle {\frac {30}{20+30}}=0.6}

ثم قم بتطبيق الأوزان على النحو التالي:

x¯=(0.4×80)+(0.6×90)=86.{\displaystyle {\bar {x}}=(0.4\times 80)+(0.6\times 90)=86.}

التعريف الرياضي

بصورة رسمية، المتوسط ​​المرجح لمجموعة بيانات منتهية غير فارغة(x1،x2،...،xن){\displaystyle \left(x_{1},x_{2},\dots ,x_{n}\right)}، مع أوزان غير سالبة مقابلة(w1،w2،...،wن){\displaystyle \left(w_{1},w_{2},\dots ,w_{n}\right)}يكون

x¯=أنا=1نwأناxأناأنا=1نwأنا،{\displaystyle {\bar {x}}={\frac {\sum \limits _{i=1}^{n}w_{i}x_{i}}{\sum \limits _{i=1}^{n}w_{i}}},}

والتي تتوسع إلى:

x¯=w1x1+w2x2++wنxنw1+w2++wن.{\displaystyle {\bar {x}}={\frac {w_{1}x_{1}+w_{2}x_{2}+\cdots +w_{n}x_{n}}{w_{1}+w_{2}+\cdots +w_{n}}}.}

لذا، تُساهم عناصر البيانات ذات الوزن العالي في المتوسط ​​المرجح أكثر من العناصر ذات الوزن المنخفض. ولا يجوز أن تكون الأوزان سالبة حتى تعمل المعادلة. [ أ ] قد يكون بعضها صفرًا، ولكن ليس كلها (لأن القسمة على صفر غير مسموحة).

تُبسط الصيغ عندما يتم توحيد الأوزان بحيث يكون مجموعها 1، أيأنا=1نwأنا=1{\textstyle \sum \limits _{i=1}^{n}{w_{i}'}=1}بالنسبة لهذه الأوزان المعيارية، يكون المتوسط ​​المرجح مكافئًا لما يلي:

x¯=أنا=1نwأناxأنا{\displaystyle {\bar {x}}=\sum \limits _{i=1}^{n}{w_{i}'x_{i}}}.

يمكن دائمًا تطبيع الأوزان عن طريق إجراء التحويل التالي على الأوزان الأصلية:

wأنا=wأناج=1نwج{\displaystyle w_{i}'={\frac {w_{i}}{\sum \limits _{j=1}^{n}{w_{j}}}}}.

المتوسط ​​العادي1نأنا=1نxأنا{\textstyle {\frac {1}{n}}\sum \limits _{i=1}^{n}{x_{i}}}هي حالة خاصة من المتوسط ​​المرجح حيث تكون لجميع البيانات أوزان متساوية.

إذا كانت عناصر البيانات عبارة عن متغيرات عشوائية مستقلة وموزعة توزيعًا متطابقًا بتباينσ2{\displaystyle \sigma ^{2}}، الخطأ المعياري للمتوسط ​​المرجح ،σx¯{\displaystyle \sigma _{\bar {x}}}ويمكن إثبات ذلك من خلال انتشار عدم اليقين على النحو التالي:

σx¯=σأنا=1نwأنا2{\textstyle \sigma _{\bar {x}}=\sigma {\sqrt {\sum \limits _{i=1}^{n}w_{i}'^{2}}}}

الأوزان المحددة بالتباين

بالنسبة للمتوسط ​​المرجح لقائمة البيانات التي يكون فيها كل عنصرxأنا{\displaystyle x_{i}}قد يأتي ذلك من توزيع احتمالي مختلف ذي تباين معروفσأنا2{\displaystyle \sigma _{i}^{2}}بما أن جميعها لها نفس المتوسط، فإن أحد الخيارات الممكنة للأوزان يُعطى بواسطة مقلوب التباين:

wأنا=1σأنا2.{\displaystyle w_{i}={\frac {1}{\sigma _{i}^{2}}}.}

المتوسط ​​المرجح في هذه الحالة هو:

x¯=أنا=1ن(xأناσأنا2)أنا=1ن1σأنا2=أنا=1ن(xأناwأنا)أنا=1نwأنا،{\displaystyle {\bar {x}}={\frac {\sum _{i=1}^{n}\left({\dfrac {x_{i}}{\sigma _{i}^{2}}}\right)}{\sum _{i=1}^{n}{\dfrac {1}{\sigma _{i}^{2}}}}}={\frac {\sum _{i=1}^{n}\left(x_{i}\cdot w_{i}\right)}{\sum _{i=1}^{n}w_{i}}},}

والخطأ المعياري للمتوسط ​​المرجح (مع أوزان التباين العكسي) هو:

σx¯=1أنا=1نσأنا-2=1أنا=1نwأنا،{\displaystyle \sigma _{\bar {x}}={\sqrt {\frac {1}{\sum _{i=1}^{n}\sigma _{i}^{-2}}}}={\sqrt {\frac {1}{\sum _{i=1}^{n}w_{i}}}},}

لاحظ أن هذا يختزل إلىσx¯2=σ02/ن{\displaystyle \sigma _{\bar {x}}^{2}=\sigma _{0}^{2}/n}عندما كلσأنا=σ0{\displaystyle \sigma _{i}=\sigma _{0}}إنها حالة خاصة من الصيغة العامة الواردة في القسم السابق.

σx¯2=أنا=1نwأنا2σأنا2=أنا=1نσأنا-4σأنا2(أنا=1نσأنا-2)2.{\displaystyle \sigma _{\bar {x}}^{2}=\sum _{i=1}^{n}{w_{i}'^{2}\sigma _{i}^{2}}={\frac {\sum _{i=1}^{n}{\sigma _{i}^{-4}\sigma _{i}^{2}}}{\left(\sum _{i=1}^{n}\sigma _{i}^{-2}\right)^{2}}}.}

يمكن دمج المعادلات أعلاه للحصول على:

x¯=σx¯2أنا=1نxأناσأنا2.{\displaystyle {\bar {x}}=\sigma _{\bar {x}}^{2}\sum _{i=1}^{n}{\frac {x_{i}}{\sigma _{i}^{2}}}.}

تكمن أهمية هذا الاختيار في أن هذا المتوسط ​​المرجح هو مقدر الاحتمال الأقصى لمتوسط ​​التوزيعات الاحتمالية بافتراض أنها مستقلة وموزعة توزيعًا طبيعيًا بنفس المتوسط.

الخصائص الإحصائية

التوقع

المتوسط ​​المرجح للعينة،x¯{\displaystyle {\bar {x}}}، هو نفسه متغير عشوائي. ترتبط قيمته المتوقعة وانحرافه المعياري بالقيم المتوقعة والانحرافات المعيارية للمشاهدات، كما يلي. ولتبسيط الأمر، نفترض أوزانًا معيارية (مجموع الأوزان يساوي واحدًا).

إذا كانت للملاحظات قيم متوقعة هـ(xأنا)=μأنا،{\displaystyle E(x_{i})={\mu _{i}},} ثم يكون للمتوسط ​​المرجح للعينة قيمة متوقعة. هـ(x¯)=أنا=1نwأناμأنا.{\displaystyle E({\bar {x}})=\sum _{i=1}^{n}{w_{i}'\mu _{i}}.} وعلى وجه الخصوص، إذا كانت الوسائل متساوية،μأنا=μ{\displaystyle \mu _{i}=\mu }إذاً، فإن القيمة المتوقعة لمتوسط ​​العينة المرجح ستكون تلك القيمة. هـ(x¯)=μ.{\displaystyle E({\bar {x}})=\mu .}

التباين

حالة مستقلة ومتطابقة التوزيع بسيطة

عند التعامل مع الأوزان كثوابت، ومع وجود عينة من n مشاهدة من متغيرات عشوائية غير مرتبطة ، جميعها بنفس التباين والتوقع (كما هو الحال بالنسبة للمتغيرات العشوائية المستقلة والمتطابقة التوزيع )، يمكن تقدير تباين المتوسط ​​المرجح كحاصل ضرب التباين غير المرجح في تأثير تصميم كيش (انظر البرهان ):

متغير(y¯w)=σ^y2w2¯w¯2{\displaystyle \operatorname {Var} ({\bar {y}}_{w})={\hat {\sigma }}_{y}^{2}{\frac {\overline {w^{2}}}{{\bar {w}}^{2}}}}

معσ^y2=أنا=1ن(yأنا-y¯)2ن-1{\displaystyle {\hat {\sigma }}_{y}^{2}={\frac {\sum _{i=1}^{n}(y_{i}-{\bar {y}})^{2}}{n-1}}}،w¯=أنا=1نwأنان{\displaystyle {\bar {w}}={\frac {\sum _{i=1}^{n}w_{i}}{n}}}، وw2¯=أنا=1نwأنا2ن{\displaystyle {\overline {w^{2}}}={\frac {\sum _{i=1}^{n}w_{i}^{2}}{n}}}

إلا أن هذا التقدير محدود نوعاً ما بسبب الافتراض القوي حول مشاهدات y . وقد أدى ذلك إلى تطوير مقدرات بديلة وأكثر عمومية.

منظور أخذ العينات في المسح

من منظور قائم على النموذج ، نهتم بتقدير تباين المتوسط ​​المرجح عندما تكون القيم المختلفةyأنا{\displaystyle y_{i}}ليست متغيرات عشوائية مستقلة ومتطابقة التوزيع . ثمة منظور بديل لهذه المشكلة يتمثل في تصميم عينة عشوائية للبيانات، حيث تُختار الوحدات باحتمالات غير متساوية (مع الإحلال). [ 1 ] : 306

في منهجية المسح ، يتم حساب متوسط ​​المجتمع، لكمية معينة ذات أهمية y ، عن طريق أخذ تقدير لمجموع y على جميع عناصر المجتمع ( Y أو أحيانًا T ) وقسمته على حجم المجتمع - سواء كان معروفًا (شمال{\displaystyle N}) أو تقديرية (شمال^{\displaystyle {\hat {N}}}في هذا السياق، تُعتبر كل قيمة من قيم y ثابتة، وينشأ التباين من عملية الاختيار. وهذا على عكس المناهج "القائمة على النموذج" التي غالبًا ما تُوصف فيها العشوائية بقيم y. تُنتج عملية أخذ العينات في المسح سلسلة من قيم مؤشر برنولي (أناأنا{\displaystyle I_{i}}تُعطى قيمة 1 إذا كانت إحدى المشاهدات (i) موجودة في العينة، وقيمة 0 إذا لم يتم اختيارها. يمكن أن يحدث هذا مع حجم عينة ثابت، أو مع أحجام عينات متغيرة (مثل: أخذ عينات بواسون ). يُرمز إلى احتمال اختيار عنصر ما، بالنظر إلى عينة معينة، بـP(أناأنا=1|عينة من الحجم ن)=πأنا{\displaystyle P(I_{i}=1\mid {\text{Some sample of size }}n)=\pi _{i}}واحتمالية الاختيار في سحبة واحدة هيP(أناأنا=1|سحب عينة واحدة)=صأناπأنان{\displaystyle P(I_{i}=1|{\text{one sample draw}})=p_{i}\approx {\frac {\pi _{i}}{n}}}(إذا كان N كبيرًا جدًا وكلصأنا{\displaystyle p_{i}}(صغير جدًا). ​​في الاشتقاق التالي، سنفترض أن احتمال اختيار كل عنصر ممثل بالكامل بهذه الاحتمالات. [ 2 ] : 42، 43، 51. أي: اختيار عنصر ما لن يؤثر على احتمال سحب عنصر آخر (لا ينطبق هذا على أمور مثل تصميم أخذ العينات العنقودية ).

بما أن كل عنصر (yأنا{\displaystyle y_{i}}) ثابت، والعشوائية تأتي من إدراجه في العينة أو عدم إدراجه فيها (أناأنا{\displaystyle I_{i}}عندما نتحدث عن حاصل ضرب العددين، وهو متغير عشوائي، فإننا غالبًا ما نشير إلى هذا المتغير. ولتجنب الالتباس في القسم التالي، سنستخدم المصطلح التالي:yأنا=yأناأناأنا{\displaystyle y'_{i}=y_{i}I_{i}}مع التوقع التالي:هـ[yأنا]=yأناهـ[أناأنا]=yأناπأنا{\displaystyle E[y'_{i}]=y_{i}E[I_{i}]=y_{i}\pi _{i}}والتباين:V[yأنا]=yأنا2V[أناأنا]=yأنا2πأنا(1-πأنا){\displaystyle V[y'_{i}]=y_{i}^{2}V[I_{i}]=y_{i}^{2}\pi _{i}(1-\pi _{i})}.

عندما يتم تضخيم كل عنصر من عناصر العينة بمعكوس احتمال اختياره، يُطلق عليه اسمπ{\displaystyle \pi }- قيم y الموسعة ، أي:yˇأنا=yأناπأنا{\displaystyle {\check {y}}_{i}={\frac {y_{i}}{\pi _{i}}}}الكمية المرتبطة هيص{\displaystyle p}- قيم y الموسعة :yأناصأنا=نyˇأنا{\displaystyle {\frac {y_{i}}{p_{i}}}=n{\check {y}}_{i}}[ 2 ] : 42، 43، 51، 52 كما سبق، يمكننا إضافة علامة صح عند الضرب بدالة المؤشر . أي:yˇأنا=أناأناyˇأنا=أناأناyأناπأنا{\displaystyle {\check {y}}'_{i}=I_{i}{\check {y}}_{i}={\frac {I_{i}y_{i}}{\pi _{i}}}}

في هذا المنظور القائم على التصميم ، تُستمد الأوزان المستخدمة في بسط المتوسط ​​المرجح من خلال أخذ مقلوب احتمالية الاختيار (أي: عامل التضخم).wأنا=1πأنا1ن×صأنا{\displaystyle w_{i}={\frac {1}{\pi _{i}}}\approx {\frac {1}{n\times p_{i}}}}.

تباين المجموع المرجح ( مُقدِّر القوة للمجاميع)

إذا كان حجم السكان N معروفًا، فيمكننا تقدير متوسط ​​السكان باستخدامY¯^معروف شمال=Y^صwرشمالأنا=1نwأناyأناشمال{\displaystyle {\hat {\bar {Y}}}_{{\text{known }}N}={\frac {{\hat {Y}}_{pwr}}{N}}\approx {\frac {\sum _{i=1}^{n}w_{i}y'_{i}}{N}}}.

إذا كان تصميم أخذ العينات ينتج عنه حجم عينة ثابت n (كما هو الحال في أخذ العينات pps )، فإن تباين هذا المقدر هو:

متغير(Y¯^معروف شمال)=1شمال2نن-1أنا=1ن(wأناyأنا-wy¯)2{\displaystyle \operatorname {Var} \left({\hat {\bar {Y}}}_{{\text{known }}N}\right)={\frac {1}{N^{2}}}{\frac {n}{n-1}}\sum _{i=1}^{n}\left(w_{i}y_{i}-{\overline {wy}}\right)^{2}}
دليل

يمكن صياغة الصيغة العامة على النحو التالي:

Y¯^معروف شمال=Y^صwرشمال=1نأنا=1نyأناصأناشمالأنا=1نyأناπأناشمال=أنا=1نwأناyأناشمال.{\displaystyle {\hat {\bar {Y}}}_{{\text{known }}N}={\frac {{\hat {Y}}_{pwr}}{N}}={\frac {{\frac {1}{n}}\sum _{i=1}^{n}{\frac {y'_{i}}{p_{i}}}}{N}}\approx {\frac {\sum _{i=1}^{n}{\frac {y'_{i}}{\pi _{i}}}}{N}}={\frac {\sum _{i=1}^{n}w_{i}y'_{i}}{N}}.}

يُشار إلى إجمالي عدد السكان بـY=أنا=1شمالyأنا{\displaystyle Y=\sum _{i=1}^{N}y_{i}}ويمكن تقديره بواسطة مقدر هورفيتز-تومسون (غير المتحيز) ، والذي يُسمى أيضًاπ{\displaystyle \pi }-المُقدِّر. يمكن تقدير هذا المُقدِّر نفسه باستخدام مُقدِّر القوة (أي:ص{\displaystyle p}(مُقدِّر مُوسَّع مع الإحلال، أو مُقدِّر "الاحتمالية مع الإحلال"). باستخدام الترميز أعلاه، يكون كالتالي:Y^صwر=1نأنا=1نyأناصأنا=أنا=1نyأنانصأناأنا=1نyأناπأنا=أنا=1نwأناyأنا{\displaystyle {\hat {Y}}_{pwr}={\frac {1}{n}}\sum _{i=1}^{n}{\frac {y'_{i}}{p_{i}}}=\sum _{i=1}^{n}{\frac {y'_{i}}{np_{i}}}\approx \sum _{i=1}^{n}{\frac {y'_{i}}{\pi _{i}}}=\sum _{i=1}^{n}w_{i}y'_{i}}[ 2 ] : 51

يُعطى التباين المُقدَّر لمُقدِّر القوة بالصيغة التالية: [ 2 ] : 52متغير(Y^صwر)=نن-1أنا=1ن(wأناyأنا-wy¯)2{\displaystyle \operatorname {Var} ({\hat {Y}}_{pwr})={\frac {n}{n-1}}\sum _{i=1}^{n}\left(w_{i}y_{i}-{\overline {wy}}\right)^{2}} أينwy¯=أنا=1نwأناyأنان{\displaystyle {\overline {wy}}=\sum _{i=1}^{n}{\frac {w_{i}y_{i}}{n}}}.

الصيغة المذكورة أعلاه مأخوذة من سارندال وآخرون (1992) (مُقدمة أيضًا في كوكران 1977)، ولكنها كُتبت بشكل مختلف. [ 2 ] : 52 [ 1 ] : 307 (11.35) يُمثل الجانب الأيسر كيفية كتابة التباين، بينما يُمثل الجانب الأيمن كيفية تطويرنا للنسخة المرجحة.

متغير(Y^الطاقة)=1ن1ن-1أنا=1ن(yأناصأنا-Y^صwر)2=1ن1ن-1أنا=1ن(ننyأناصأنا-ننأنا=1نwأناyأنا)2=1ن1ن-1أنا=1ن(نyأناπأنا-نأنا=1نwأناyأنان)2=ن2ن1ن-1أنا=1ن(wأناyأنا-wy¯)2=نن-1أنا=1ن(wأناyأنا-wy¯)2{\displaystyle {\begin{aligned}\operatorname {Var} ({\hat {Y}}_{\text{pwr}})&={\frac {1}{n}}{\frac {1}{n-1}}\sum _{i=1}^{n}\left({\frac {y_{i}}{p_{i}}}-{\hat {Y}}_{pwr}\right)^{2}\\&={\frac {1}{n}}{\frac {1}{n-1}}\sum _{i=1}^{n}\left({\frac {n}{n}}{\frac {y_{i}}{p_{i}}}-{\frac {n}{n}}\sum _{i=1}^{n}w_{i}y_{i}\right)^{2}={\frac {1}{n}}{\frac {1}{n-1}}\sum _{i=1}^{n}\left(n{\frac {y_{i}}{\pi _{i}}}-n{\frac {\sum _{i=1}^{n}w_{i}y_{i}}{n}}\right)^{2}\\&={\frac {n^{2}}{n}}{\frac {1}{n-1}}\sum _{i=1}^{n}\left(w_{i}y_{i}-{\overline {wy}}\right)^{2}\\&={\frac {n}{n-1}}\sum _{i=1}^{n}\left(w_{i}y_{i}-{\overline {wy}}\right)^{2}\end{aligned}}}

وهكذا توصلنا إلى الصيغة المذكورة أعلاه.

يُقدَّم مصطلح بديل، عندما يكون حجم العينة عشوائيًا (كما هو الحال في أخذ عينات بواسون )، في سارندال وآخرون (1992) على النحو التالي: [ 2 ] : 182

متغير(Y¯^الطاقة (معروفة) شمال))=1شمال2أنا=1نج=1ن(Δˇأناجyˇأناyˇج){\displaystyle \operatorname {Var} ({\hat {\bar {Y}}}_{{\text{pwr (known }}N{\text{)}}})={\frac {1}{N^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}\left({\check {\Delta }}_{ij}{\check {y}}_{i}{\check {y}}_{j}\right)}

معyˇأنا=yأناπأنا{\displaystyle {\check {y}}_{i}={\frac {y_{i}}{\pi _{i}}}}. أيضًا،ج(أناأنا،أناج)=πأناج-πأناπج=Δأناج{\displaystyle C(I_{i},I_{j})=\pi _{ij}-\pi _{i}\pi _{j}=\Delta _{ij}}أينπأناج{\displaystyle \pi _{ij}}هي احتمالية اختيار كل من i و j. [ 2 ] : 36 وΔˇأناج=1-πأناπجπأناج{\displaystyle {\check {\Delta }}_{ij}=1-{\frac {\pi _{i}\pi _{j}}{\pi _{ij}}}}وبالنسبة لـ i=j:Δˇأناأنا=1-πأناπأناπأنا=1-πأنا{\displaystyle {\check {\Delta }}_{ii}=1-{\frac {\pi _{i}\pi _{i}}{\pi _{i}}}=1-\pi _{i}}[ 2 ] : 43

إذا كانت احتمالات الاختيار غير مترابطة (أي:أناج:ج(أناأنا،أناج)=0{\displaystyle \forall i\neq j:C(I_{i},I_{j})=0}وعند افتراض أن احتمال كل عنصر صغير جدًا، فإن:

متغير(Y¯^الطاقة (معروفة) شمال))=1شمال2أنا=1ن(wأناyأنا)2{\displaystyle \operatorname {Var} ({\hat {\bar {Y}}}_{{\text{pwr (known }}N{\text{)}}})={\frac {1}{N^{2}}}\sum _{i=1}^{n}\left(w_{i}y_{i}\right)^{2}}
دليل

نفترض أن(1-πأنا)1{\displaystyle (1-\pi _{i})\approx 1}وذلك متغير(Y^الطاقة (معروفة) شمال))=1شمال2أنا=1نج=1ن(Δˇأناجyˇأناyˇج)=1شمال2أنا=1ن(Δˇأناأناyˇأناyˇأنا)=1شمال2أنا=1ن((1-πأنا)yأناπأناyأناπأنا)=1شمال2أنا=1ن(wأناyأنا)2{\displaystyle {\begin{aligned}\operatorname {Var} ({\hat {Y}}_{{\text{pwr (known }}N{\text{)}}})&={\frac {1}{N^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}\left({\check {\Delta }}_{ij}{\check {y}}_{i}{\check {y}}_{j}\right)\\&={\frac {1}{N^{2}}}\sum _{i=1}^{n}\left({\check {\Delta }}_{ii}{\check {y}}_{i}{\check {y}}_{i}\right)\\&={\frac {1}{N^{2}}}\sum _{i=1}^{n}\left((1-\pi _{i}){\frac {y_{i}}{\pi _{i}}}{\frac {y_{i}}{\pi _{i}}}\right)\\&={\frac {1}{N^{2}}}\sum _{i=1}^{n}\left(w_{i}y_{i}\right)^{2}\end{aligned}}}

تباين المتوسط ​​المرجح ( مُقدِّر π للمتوسط ​​النسبي)

تناول القسم السابق تقدير متوسط ​​السكان كنسبة من إجمالي عدد السكان المقدر (Y^{\displaystyle {\hat {Y}}}) مع حجم سكاني معروف (شمال{\displaystyle N}وتم تقدير التباين في هذا السياق. ومن الحالات الشائعة الأخرى أن حجم السكان نفسه (شمال{\displaystyle N}) غير معروف ويتم تقديره باستخدام العينة (أي:شمال^{\displaystyle {\hat {N}}}تقديرشمال{\displaystyle N}يمكن وصفها بأنها مجموع الأوزان. لذلك عندماwأنا=1πأنا{\displaystyle w_{i}={\frac {1}{\pi _{i}}}}نحصلشمال^=أنا=1نwأناأناأنا=أنا=1نأناأناπأنا=أنا=1ن1ˇأنا{\displaystyle {\hat {N}}=\sum _{i=1}^{n}w_{i}I_{i}=\sum _{i=1}^{n}{\frac {I_{i}}{\pi _{i}}}=\sum _{i=1}^{n}{\check {1}}'_{i}}باستخدام الرموز المذكورة أعلاه، فإن المعامل الذي نهتم به هو نسبة مجموعيyأنا{\displaystyle y_{i}}s و 1s. أي:R=Y¯=أنا=1شمالyأناπأناأنا=1شمال1πأنا=أنا=1شمالyˇأناأنا=1شمال1ˇأنا=أنا=1شمالwأناyأناأنا=1شمالwأنا{\displaystyle R={\bar {Y}}={\frac {\sum _{i=1}^{N}{\frac {y_{i}}{\pi _{i}}}}{\sum _{i=1}^{N}{\frac {1}{\pi _{i}}}}}={\frac {\sum _{i=1}^{N}{\check {y}}_{i}}{\sum _{i=1}^{N}{\check {1}}_{i}}}={\frac {\sum _{i=1}^{N}w_{i}y_{i}}{\sum _{i=1}^{N}w_{i}}}}يمكننا تقدير ذلك باستخدام عيّنتنا مع:R^=Y¯^=أنا=1شمالأناأناyأناπأناأنا=1شمالأناأنا1πأنا=أنا=1شمالyˇأناأنا=1شمال1ˇأنا=أنا=1شمالwأناyأناأنا=1شمالwأنا1أنا=أنا=1نwأناyأناأنا=1نwأنا1أنا=y¯w{\displaystyle {\hat {R}}={\hat {\bar {Y}}}={\frac {\sum _{i=1}^{N}I_{i}{\frac {y_{i}}{\pi _{i}}}}{\sum _{i=1}^{N}I_{i}{\frac {1}{\pi _{i}}}}}={\frac {\sum _{i=1}^{N}{\check {y}}'_{i}}{\sum _{i=1}^{N}{\check {1}}'_{i}}}={\frac {\sum _{i=1}^{N}w_{i}y'_{i}}{\sum _{i=1}^{N}w_{i}1'_{i}}}={\frac {\sum _{i=1}^{n}w_{i}y'_{i}}{\sum _{i=1}^{n}w_{i}1'_{i}}}={\bar {y}}_{w}}عندما انتقلنا من استخدام N إلى استخدام n، نعلم في الواقع أن جميع متغيرات المؤشر تحصل على 1، لذلك يمكننا ببساطة كتابة:y¯w=أنا=1نwأناyأناأنا=1نwأنا{\displaystyle {\bar {y}}_{w}={\frac {\sum _{i=1}^{n}w_{i}y_{i}}{\sum _{i=1}^{n}w_{i}}}}سيكون هذا هو المقدر لقيم محددة من y و w، لكن الخصائص الإحصائية تظهر عند تضمين متغير المؤشر.y¯w=أنا=1نwأناyأناأنا=1نwأنا1أنا{\displaystyle {\bar {y}}_{w}={\frac {\sum _{i=1}^{n}w_{i}y'_{i}}{\sum _{i=1}^{n}w_{i}1'_{i}}}}[ 2 ] : 162، 163 ، 176

يُطلق على هذا اسم مُقدِّر النسبة ، وهو غير متحيز تقريبًا لـ R. [ 2 ] : 182

في هذه الحالة، يعتمد تباين النسبة على تباين المتغيرات العشوائية في كل من البسط والمقام، بالإضافة إلى ارتباطها. ولعدم وجود صيغة تحليلية مغلقة لحساب هذا التباين، تُستخدم طرق مختلفة للتقدير التقريبي، وأهمها: تقريب تايلور الخطي من الدرجة الأولى، والتقارب، وطريقة بوتستراب/جاكنايف. [ 2 ] : 172 قد تؤدي طريقة تقريب تايلور الخطي إلى التقليل من تقدير التباين لأحجام العينات الصغيرة عمومًا، ولكن ذلك يعتمد على مدى تعقيد الإحصائية. بالنسبة للمتوسط ​​المرجح، يُفترض أن يكون التباين التقريبي دقيقًا نسبيًا حتى لأحجام العينات المتوسطة. [ 2 ] : 176 أما عندما يكون حجم العينة عشوائيًا (كما في أخذ عينات بواسون )، فيكون كما يلي: [ 2 ] : 182

V(y¯w)^=1(أنا=1نwأنا)2أنا=1نwأنا2(yأنا-y¯w)2{\displaystyle {\widehat {V({\bar {y}}_{w})}}={\frac {1}{(\sum _{i=1}^{n}w_{i})^{2}}}\sum _{i=1}^{n}w_{i}^{2}(y_{i}-{\bar {y}}_{w})^{2}}.

لوπأناصأنان{\displaystyle \pi _{i}\approx p_{i}n}ثم إما باستخدامwأنا=1πأنا{\displaystyle w_{i}={\frac {1}{\pi _{i}}}}أوwأنا=1صأنا{\displaystyle w_{i}={\frac {1}{p_{i}}}}سيعطي نفس المُقدِّر، لأن الضربwأنا{\displaystyle w_{i}}سيؤدي تغيير عامل ما إلى نفس المُقدِّر. ويعني هذا أيضًا أنه إذا قمنا بتعديل مجموع الأوزان ليُساوي حجم مجتمع معروف مسبقًا N ، فإن حساب التباين سيبدو كما هو. عندما تتساوى جميع الأوزان، تُختزل هذه الصيغة إلى مُقدِّر التباين القياسي غير المتحيز.

دليل

تنص معادلة تايلور الخطية على أنه بالنسبة لمقدر النسبة العامة لمجموعين (R^=Y^Z^{\displaystyle {\hat {R}}={\frac {\hat {Y}}{\hat {Z}}}}ويمكن توسيعها حول القيمة الحقيقية R، وتعطي: [ 2 ] : 178

R^=Y^Z^=أنا=1نwأناyأناأنا=1نwأناzأناR+1Zأنا=1ن(yأناπأنا-Rzأناπأنا){\displaystyle {\hat {R}}={\frac {\hat {Y}}{\hat {Z}}}={\frac {\sum _{i=1}^{n}w_{i}y'_{i}}{\sum _{i=1}^{n}w_{i}z'_{i}}}\approx R+{\frac {1}{Z}}\sum _{i=1}^{n}\left({\frac {y'_{i}}{\pi _{i}}}-R{\frac {z'_{i}}{\pi _{i}}}\right)}

ويمكن تقريب التباين بواسطة: [ 2 ] : 178، 179

V(R^)^=1Z^2أنا=1نج=1ن(Δˇأناجyأنا-R^zأناπأناyج-R^zجπج)=1Z^2[V(Y^)^+R^V(Z^)^-2R^ج^(Y^،Z^)]{\displaystyle {\widehat {V({\hat {R}})}}={\frac {1}{{\hat {Z}}^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}\left({\check {\Delta }}_{ij}{\frac {y_{i}-{\hat {R}}z_{i}}{\pi _{i}}}{\frac {y_{j}-{\hat {R}}z_{j}}{\pi _{j}}}\right)={\frac {1}{{\hat {Z}}^{2}}}\left[{\widehat {V({\hat {Y}})}}+{\hat {R}}{\widehat {V({\hat {Z}})}}-2{\hat {R}}{\hat {C}}({\hat {Y}},{\hat {Z}})\right]}.

على المدىج^(Y^،Z^){\displaystyle {\hat {C}}({\hat {Y}},{\hat {Z}})}يمثل هذا التباين المشترك المقدر بين المجموع المقدر لـ Y والمجموع المقدر لـ Z. وبما أن هذا التباين هو تباين مشترك لمجموعين من المتغيرات العشوائية ، فإنه سيشمل العديد من تركيبات التباين المشترك التي ستعتمد على المتغيرات المؤشرة. إذا كانت احتمالات الاختيار غير مرتبطة (أي:أناج:Δأناج=ج(أناأنا،أناج)=0{\displaystyle \forall i\neq j:\Delta _{ij}=C(I_{i},I_{j})=0})، سيظل هذا المصطلح يتضمن مجموع n من التغايرات لكل عنصر i بينyأنا=أناأناyأنا{\displaystyle y'_{i}=I_{i}y_{i}}وzأنا=أناأناzأنا{\displaystyle z'_{i}=I_{i}z_{i}}وهذا يساعد في توضيح أن هذه الصيغة تتضمن تأثير الارتباط بين y و z على تباين مقدرات النسبة.

عند تعريفzأنا=1{\displaystyle z_{i}=1}يصبح ما سبق كما يلي: [ 2 ] : 182

V(R^)^=V(y¯w)^=1شمال^2أنا=1نج=1ن(Δˇأناجyأنا-y¯wπأناyج-y¯wπج).{\displaystyle {\widehat {V({\hat {R}})}}={\widehat {V({\bar {y}}_{w})}}={\frac {1}{{\hat {N}}^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}\left({\check {\Delta }}_{ij}{\frac {y_{i}-{\bar {y}}_{w}}{\pi _{i}}}{\frac {y_{j}-{\bar {y}}_{w}}{\pi _{j}}}\right).}

إذا كانت احتمالات الاختيار غير مترابطة (أي:أناج:Δأناج=ج(أناأنا،أناج)=0{\displaystyle \forall i\neq j:\Delta _{ij}=C(I_{i},I_{j})=0})، وعند افتراض أن احتمال كل عنصر صغير جدًا (أي:(1-πأنا)1{\displaystyle (1-\pi _{i})\approx 1}ثم اختُصر ما سبق إلى ما يلي: V(y¯w)^=1شمال^2أنا=1ن((1-πأنا)yأنا-y¯wπأنا)2=1(أنا=1نwأنا)2أنا=1نwأنا2(yأنا-y¯w)2.{\displaystyle {\widehat {V({\bar {y}}_{w})}}={\frac {1}{{\hat {N}}^{2}}}\sum _{i=1}^{n}\left((1-\pi _{i}){\frac {y_{i}-{\bar {y}}_{w}}{\pi _{i}}}\right)^{2}={\frac {1}{(\sum _{i=1}^{n}w_{i})^{2}}}\sum _{i=1}^{n}w_{i}^{2}(y_{i}-{\bar {y}}_{w})^{2}.}

وقدّم توماس لوملي في بحثه crossvalidated إعادة صياغة مماثلة للبرهان (مع بعض الأخطاء في النهاية). [ 3 ]

لدينا (على الأقل) نسختان من التباين للمتوسط ​​المرجح: إحداهما مع تقدير حجم المجتمع المعروف، والأخرى مع تقدير حجم المجتمع غير المعروف. لا توجد طريقة أفضل بشكل مطلق، لكن الأدبيات تقدم عدة حجج لتفضيل استخدام نسخة تقدير حجم المجتمع (حتى عندما يكون حجم المجتمع معروفًا). [ 2 ] : 188 على سبيل المثال: إذا كانت جميع قيم y ثابتة، فإن المُقدِّر مع حجم المجتمع غير المعروف سيعطي النتيجة الصحيحة، بينما سيُظهر المُقدِّر مع حجم المجتمع المعروف بعض التباين. كذلك، عندما يكون حجم العينة نفسه عشوائيًا (مثلًا: في أخذ عينات بواسون )، تُعتبر النسخة ذات متوسط ​​المجتمع غير المعروف أكثر استقرارًا. أخيرًا، إذا كانت نسبة أخذ العينات مرتبطة عكسيًا بالقيم (أي: فرصة أقل لأخذ عينة من قيمة كبيرة)، فإن نسخة حجم المجتمع غير المعروف تُعوض ذلك جزئيًا.

في الحالة البسيطة التي تكون فيها جميع الأوزان مساوية لـ 1، فإن الصيغة أعلاه تشبه الصيغة العادية لتباين المتوسط ​​(ولكن لاحظ أنها تستخدم مقدر الاحتمال الأقصى للتباين بدلاً من التباين غير المتحيز. أي: قسمته على n بدلاً من (n-1)).

التحقق من صحة التمهيد

لقد بيّن جاتز وآخرون (1995) أنه بالمقارنة مع طرق إعادة التوزيع العشوائي ، فإن ما يلي (تقدير تباين النسبة المتوسطة باستخدام خطية سلسلة تايلور ) يُعد تقديرًا معقولًا لمربع الخطأ المعياري للمتوسط ​​(عند استخدامه في سياق قياس المكونات الكيميائية): [ 4 ] : ​​1186

σx¯w2^=ن(ن-1)(نw¯)2[(wأناxأنا-w¯x¯w)2-2x¯w(wأنا-w¯)(wأناxأنا-w¯x¯w)+x¯w2(wأنا-w¯)2]{\displaystyle {\widehat {\sigma _{{\bar {x}}_{w}}^{2}}}={\frac {n}{(n-1)(n{\bar {w}})^{2}}}\left[\sum (w_{i}x_{i}-{\bar {w}}{\bar {x}}_{w})^{2}-2{\bar {x}}_{w}\sum (w_{i}-{\bar {w}})(w_{i}x_{i}-{\bar {w}}{\bar {x}}_{w})+{\bar {x}}_{w}^{2}\sum (w_{i}-{\bar {w}})^{2}\right]}

أينw¯=wأنان{\displaystyle {\bar {w}}={\frac {\sum w_{i}}{n}}}. ويؤدي المزيد من التبسيط إلى

σx¯2^=ن(ن-1)(نw¯)2wأنا2(xأنا-x¯w)2{\displaystyle {\widehat {\sigma _{\bar {x}}^{2}}}={\frac {n}{(n-1)(n{\bar {w}})^{2}}}\sum w_{i}^{2}(x_{i}-{\bar {x}}_{w})^{2}}

يذكر جاتز وآخرون أن الصيغة المذكورة أعلاه نُشرت بواسطة إندليش وآخرون (1988) عند اعتبار المتوسط ​​المرجح مزيجًا من مُقدِّر إجمالي مرجح مقسومًا على مُقدِّر لحجم المجتمع، [ 5 ] استنادًا إلى الصيغة التي نشرها كوكران (1977)، كتقريب لمتوسط ​​النسبة. مع ذلك، يبدو أن إندليش وآخرون لم ينشروا هذا الاشتقاق في بحثهم (على الرغم من ذكرهم استخدامهم له)، ويتضمن كتاب كوكران صيغة مختلفة قليلًا. [ 1 ] : 155 ومع ذلك، فهي تكاد تكون مطابقة للصيغ الموصوفة في الأقسام السابقة.

المقدرات القائمة على التكرار

لعدم وجود صيغة تحليلية مغلقة لتباين المتوسط ​​المرجح، فقد اقتُرح في الأدبيات الاعتماد على أساليب التكرار مثل طريقة جاكنايف وطريقة بوتسترابينغ . [ 1 ] : 321

ملاحظات أخرى

بالنسبة للملاحظات غير المترابطة ذات التبايناتσأنا2{\displaystyle \sigma _{i}^{2}}، تباين المتوسط ​​المرجح للعينة هو

σx¯2=أنا=1نwأنا2σأنا2{\displaystyle \sigma _{\bar {x}}^{2}=\sum _{i=1}^{n}{w_{i}'^{2}\sigma _{i}^{2}}}

جذره التربيعيσx¯{\displaystyle \sigma _{\bar {x}}}يمكن تسميته الخطأ المعياري للمتوسط ​​المرجح (الحالة العامة) .

وبالتالي، إذا كانت جميع المشاهدات لها تباين متساوٍ،σأنا2=σ02{\displaystyle \sigma _{i}^{2}=\sigma _{0}^{2}}، سيكون لمتوسط ​​العينة المرجح تباين

σx¯2=σ02أنا=1نwأنا2،{\displaystyle \sigma _{\bar {x}}^{2}=\sigma _{0}^{2}\sum _{i=1}^{n}{w_{i}'^{2}},}

أين1/نأنا=1نwأنا21{\textstyle 1/n\leq \sum _{i=1}^{n}{w_{i}'^{2}}\leq 1}يصل التباين إلى أقصى قيمة له.σ02{\displaystyle \sigma _{0}^{2}}عندما تكون جميع الأوزان صفرًا باستثناء وزن واحد. وتُوجد قيمته الدنيا عندما تكون جميع الأوزان متساوية (أي المتوسط ​​غير المرجح)، وفي هذه الحالة يكون لديناσx¯=σ0/ن{\textstyle \sigma _{\bar {x}}=\sigma _{0}/{\sqrt {n}}}، أي أنه يتحول إلى الخطأ المعياري للمتوسط ، مربع.

لأنه يمكن دائمًا تحويل الأوزان غير المعيارية إلى أوزان معيارية، يمكن تكييف جميع الصيغ في هذا القسم مع الأوزان غير المعيارية عن طريق استبدال جميعwأنا=wأناأنا=1نwأنا{\displaystyle w_{i}'={\frac {w_{i}}{\sum _{i=1}^{n}{w_{i}}}}}.

وسيط

عندما تكون الأوزانج{\displaystyle c}ود{\displaystyle d}، المتوسط ​​الحسابي المرجح لكسرينأ/ج{\displaystyle a/c}وب/د{\displaystyle b/d}يساوي وسيطهما .

تباين العينة المرجح

عادةً، عند حساب المتوسط، من المهم معرفة التباين والانحراف المعياري لهذا المتوسط. عند حساب المتوسط ​​المرجحμ*{\displaystyle \mu ^{*}}عند استخدام ، يكون تباين العينة المرجحة مختلفًا عن تباين العينة غير المرجحة.

تباين العينة المرجحة المتحيزةσ^w2{\displaystyle {\hat {\sigma }}_{\mathrm {w} }^{2}}يُعرَّف بشكل مشابه لتباين العينة المتحيزة الطبيعيةσ^2{\displaystyle {\hat {\sigma }}^{2}}:

σ^2 =أنا=1شمال(xأنا-μ)2شمالσ^w2=أنا=1شمالwأنا(xأنا-μ*)2أنا=1شمالwأنا{\displaystyle {\begin{aligned}{\hat {\sigma }}^{2}\ &={\frac {\sum \limits _{i=1}^{N}\left(x_{i}-\mu \right)^{2}}{N}}\\{\hat {\sigma }}_{\mathrm {w} }^{2}&={\frac {\sum \limits _{i=1}^{N}w_{i}\left(x_{i}-\mu ^{*}\right)^{2}}{\sum _{i=1}^{N}w_{i}}}\end{aligned}}}

أينأنا=1شمالwأنا=1{\displaystyle \sum _{i=1}^{N}w_{i}=1}بالنسبة للأوزان المعيارية. إذا كانت الأوزان عبارة عن أوزان ترددية (وبالتالي متغيرات عشوائية)، فيمكن إثبات أنσ^w2{\displaystyle {\hat {\sigma }}_{\mathrm {w} }^{2}}هو مقدر الاحتمال الأقصى لـσ2{\displaystyle \sigma ^{2}}بالنسبة للملاحظات المستقلة والمتطابقة التوزيع (iid) ذات التوزيع الغاوسي.

في العينات الصغيرة، يُعتاد استخدام مُقدِّر غير متحيز لتباين المجتمع. في العينات الطبيعية غير الموزونة، يُغيَّر N في المقام (المُقابل لحجم العينة) إلى N  1 (انظر تصحيح بيسل ). في حالة العينات الموزونة، يوجد في الواقع مُقدِّران غير متحيزين مختلفان، أحدهما لحالة أوزان التكرار والآخر لحالة أوزان الموثوقية .

أوزان التردد

إذا كانت الأوزان عبارة عن أوزان تكرارية (حيث يساوي الوزن عدد مرات الظهور)، فإن المقدر غير المتحيز هو:

s2 =أنا=1شمالwأنا(xأنا-μ*)2أنا=1شمالwأنا-1{\displaystyle s^{2}\ ={\frac {\sum \limits _{i=1}^{N}w_{i}\left(x_{i}-\mu ^{*}\right)^{2}}{\sum _{i=1}^{N}w_{i}-1}}}

يُطبّق هذا فعليًا تصحيح بيسل لأوزان التردد. على سبيل المثال، إذا كانت القيم{2،2،4،5،5،5}{\displaystyle \{2,2,4,5,5,5\}}إذا تم سحبها من نفس التوزيع، فيمكننا التعامل مع هذه المجموعة كعينة غير مرجحة، أو يمكننا التعامل معها كعينة مرجحة.{2،4،5}{\displaystyle \{2,4,5\}}مع الأوزان المقابلة{2،1،3}{\displaystyle \{2,1,3\}}ونحصل على نفس النتيجة في كلتا الحالتين.

إذا كانت أوزان التردد{wأنا}{\displaystyle \{w_{i}\}}إذا تم توحيد القيم إلى 1، فإن التعبير الصحيح بعد تصحيح بيسل يصبح

s2 =أنا=1شمالwأناأنا=1شمالwأنا-1أنا=1شمالwأنا(xأنا-μ*)2{\displaystyle s^{2}\ ={\frac {\sum _{i=1}^{N}w_{i}}{\sum _{i=1}^{N}w_{i}-1}}\sum _{i=1}^{N}w_{i}\left(x_{i}-\mu ^{*}\right)^{2}}

حيث يكون العدد الإجمالي للعيناتأنا=1شمالwأنا{\displaystyle \sum _{i=1}^{N}w_{i}}(لاشمال{\displaystyle N}على أي حال، فإن المعلومات المتعلقة بالعدد الإجمالي للعينات ضرورية للحصول على تصحيح غير متحيز، حتى لوwأنا{\displaystyle w_{i}}له معنى مختلف عن وزن التكرار.

لا يمكن أن يكون المقدر غير متحيز إلا إذا لم يتم توحيد الأوزان أو تطبيعها ، حيث تؤدي هذه العمليات إلى تغيير متوسط ​​البيانات وتباينها، وبالتالي تؤدي إلى فقدان المعدل الأساسي (عدد السكان، وهو شرط أساسي لتصحيح بيسل).

أوزان الموثوقية

إذا كانت الأوزان عبارة عن أوزان موثوقية (قيم غير عشوائية تعكس الموثوقية النسبية للعينة، وغالبًا ما تُستمد من تباين العينة)، فيمكننا تحديد عامل تصحيح للحصول على مُقدِّر غير متحيز. بافتراض أن كل متغير عشوائي يتم أخذ عينة منه من نفس التوزيع بمتوسطμ{\displaystyle \mu }والتباين الفعليσفِعلي2{\displaystyle \sigma _{\text{actual}}^{2}}مع الأخذ في الاعتبار توقعاتنا،

هـ[σ^2]=أنا=1شمالهـ[(xأنا-μ)2]شمال=هـ[(X-هـ[X])2]-1شمالهـ[(X-هـ[X])2]=(شمال-1شمال)σفِعلي2هـ[σ^w2]=أنا=1شمالwأناهـ[(xأنا-μ*)2]V1=هـ[(X-هـ[X])2]-V2V12هـ[(X-هـ[X])2]=(1-V2V12)σفِعلي2{\displaystyle {\begin{aligned}\operatorname {E} [{\hat {\sigma }}^{2}]&={\frac {\sum \limits _{i=1}^{N}\operatorname {E} [(x_{i}-\mu )^{2}]}{N}}\\&=\operatorname {E} [(X-\operatorname {E} [X])^{2}]-{\frac {1}{N}}\operatorname {E} [(X-\operatorname {E} [X])^{2}]\\&=\left({\frac {N-1}{N}}\right)\sigma _{\text{actual}}^{2}\\\operatorname {E} [{\hat {\sigma }}_{\mathrm {w} }^{2}]&={\frac {\sum \limits _{i=1}^{N}w_{i}\operatorname {E} [(x_{i}-\mu ^{*})^{2}]}{V_{1}}}\\&=\operatorname {E} [(X-\operatorname {E} [X])^{2}]-{\frac {V_{2}}{V_{1}^{2}}}\operatorname {E} [(X-\operatorname {E} [X])^{2}]\\&=\left(1-{\frac {V_{2}}{V_{1}^{2}}}\right)\sigma _{\text{actual}}^{2}\end{aligned}}}

أينV1=أنا=1شمالwأنا{\displaystyle V_{1}=\sum _{i=1}^{N}w_{i}}وV2=أنا=1شمالwأنا2{\displaystyle V_{2}=\sum _{i=1}^{N}w_{i}^{2}}لذلك، فإن التحيز في مقدرنا هو(1-V2V12){\displaystyle \left(1-{\frac {V_{2}}{V_{1}^{2}}}\right)}، على غرار(شمال-1شمال){\displaystyle \left({\frac {N-1}{N}}\right)}التحيز في المقدر غير المرجح (لاحظ أيضًا أن V12/V2=شمالهـوو{\displaystyle \ V_{1}^{2}/V_{2}=N_{eff}}يمثل حجم العينة الفعال . وهذا يعني أنه لتقليل تحيز المُقدِّر، نحتاج إلى القسمة المسبقة على1-(V2/V12){\displaystyle 1-\left(V_{2}/V_{1}^{2}\right)}مع ضمان أن القيمة المتوقعة للتباين المُقدَّر تساوي التباين الفعلي لتوزيع المعاينة . التقدير النهائي غير المتحيز لتباين العينة هو:

sw2 =σ^w21-(V2/V12)=أنا=1شمالwأنا(xأنا-μ*)2V1-(V2/V1)،{\displaystyle {\begin{aligned}s_{\mathrm {w} }^{2}\ &={\frac {{\hat {\sigma }}_{\mathrm {w} }^{2}}{1-(V_{2}/V_{1}^{2})}}\\[4pt]&={\frac {\sum \limits _{i=1}^{N}w_{i}(x_{i}-\mu ^{*})^{2}}{V_{1}-(V_{2}/V_{1})}},\end{aligned}}}[ 6 ]

أينهـ[sw2]=σفِعلي2{\displaystyle \operatorname {E} [s_{\mathrm {w} }^{2}]=\sigma _{\text{actual}}^{2}}. تتفاوت درجات حرية تباين العينة المرجح وغير المتحيز وفقًا لذلك من N  1 إلى  0. الانحراف المعياري هو ببساطة الجذر التربيعي للتباين أعلاه.

على هامش الموضوع، تم وصف طرق أخرى لحساب تباين العينة المرجح. [ 7 ]

التغاير المرجح للعينة

في العينة الموزونة، كل متجه صفxأنا{\displaystyle \mathbf {x} _{i}}(كل مجموعة من الملاحظات الفردية على كل متغير من المتغيرات العشوائية K ) يتم تعيين وزن لهاwأنا0{\displaystyle w_{i}\geq 0}.

ثم متجه المتوسط ​​المرجحμ*{\displaystyle \mathbf {\mu ^{*}} }يُعطى بواسطة

μ*=أنا=1شمالwأناxأناأنا=1شمالwأنا.{\displaystyle \mathbf {\mu ^{*}} ={\frac {\sum _{i=1}^{N}w_{i}\mathbf {x} _{i}}{\sum _{i=1}^{N}w_{i}}}.}

ويتم إعطاء مصفوفة التغاير الموزونة بواسطة: [ 8 ]

ج=أنا=1شمالwأنا(xأنا-μ*)تي(xأنا-μ*)V1.{\displaystyle \mathbf {C} ={\frac {\sum _{i=1}^{N}w_{i}\left(\mathbf {x} _{i}-\mu ^{*}\right)^{T}\left(\mathbf {x} _{i}-\mu ^{*}\right)}{V_{1}}}.}

على غرار تباين العينة المرجح، هناك نوعان مختلفان من المقدرات غير المتحيزة اعتمادًا على نوع الأوزان.

أوزان التردد

إذا كانت الأوزان عبارة عن أوزان ترددية ، فإن التقدير المرجح غير المتحيز لمصفوفة التغايرج{\displaystyle \textstyle \mathbf {C} }، مع تصحيح بيسل، يتم إعطاؤها بواسطة: [ 8 ]

ج=أنا=1شمالwأنا(xأنا-μ*)تي(xأنا-μ*)V1-1.{\displaystyle \mathbf {C} ={\frac {\sum _{i=1}^{N}w_{i}\left(\mathbf {x} _{i}-\mu ^{*}\right)^{T}\left(\mathbf {x} _{i}-\mu ^{*}\right)}{V_{1}-1}}.}

لا يمكن أن يكون هذا المقدر غير متحيز إلا إذا لم يتم توحيد الأوزان أو تطبيعها ، حيث تؤدي هذه العمليات إلى تغيير متوسط ​​البيانات وتباينها، وبالتالي تؤدي إلى فقدان المعدل الأساسي (عدد السكان، وهو شرط أساسي لتصحيح بيسل).

أوزان الموثوقية

في حالة أوزان الموثوقية ، يتم تطبيع الأوزان :

V1=أنا=1شمالwأنا=1.{\displaystyle V_{1}=\sum _{i=1}^{N}w_{i}=1.}

(إذا لم تكن كذلك، فاقسم الأوزان على مجموعها لتطبيعها قبل الحساب)V1{\displaystyle V_{1}}:

wأنا=wأناأنا=1شمالwأنا{\displaystyle w_{i}'={\frac {w_{i}}{\sum _{i=1}^{N}w_{i}}}}

ثم متجه المتوسط ​​المرجحμ*{\displaystyle \mathbf {\mu ^{*}} }يمكن تبسيطها إلى

μ*=أنا=1شمالwأناxأنا.{\displaystyle \mathbf {\mu ^{*}} =\sum _{i=1}^{N}w_{i}\mathbf {x} _{i}.}

والتقدير المرجح غير المتحيز لمصفوفة التغايرج{\displaystyle \mathbf {C} }هو: [ 9 ]

ج=أنا=1شمالwأنا(أنا=1شمالwأنا)2-أنا=1شمالwأنا2أنا=1شمالwأنا(xأنا-μ*)تي(xأنا-μ*)=أنا=1شمالwأنا(xأنا-μ*)تي(xأنا-μ*)V1-(V2/V1).{\displaystyle {\begin{aligned}\mathbf {C} &={\frac {\sum _{i=1}^{N}w_{i}}{\left(\sum _{i=1}^{N}w_{i}\right)^{2}-\sum _{i=1}^{N}w_{i}^{2}}}\sum _{i=1}^{N}w_{i}\left(\mathbf {x} _{i}-\mu ^{*}\right)^{T}\left(\mathbf {x} _{i}-\mu ^{*}\right)\\&={\frac {\sum _{i=1}^{N}w_{i}\left(\mathbf {x} _{i}-\mu ^{*}\right)^{T}\left(\mathbf {x} _{i}-\mu ^{*}\right)}{V_{1}-(V_{2}/V_{1})}}.\end{aligned}}}

والمنطق هنا هو نفسه كما في القسم السابق.

بما أننا نفترض أن الأوزان موحدة، فإنV1=1{\displaystyle V_{1}=1}وهذا يختزل إلى:

ج=أنا=1شمالwأنا(xأنا-μ*)تي(xأنا-μ*)1-V2.{\displaystyle \mathbf {C} ={\frac {\sum _{i=1}^{N}w_{i}\left(\mathbf {x} _{i}-\mu ^{*}\right)^{T}\left(\mathbf {x} _{i}-\mu ^{*}\right)}{1-V_{2}}}.}

إذا كانت جميع الأوزان متساوية، أيwأنا/V1=1/شمال{\displaystyle w_{i}/V_{1}=1/N}ثم يختزل المتوسط ​​المرجح والتباين إلى متوسط ​​العينة غير المرجح والتباين المذكور أعلاه.

تقديرات ذات قيم متجهة

يمكن تعميم ما سبق بسهولة على حالة حساب متوسط ​​التقديرات المتجهة. على سبيل المثال، قد تكون تقديرات الموقع على مستوى ما أقل دقة في اتجاه معين مقارنةً باتجاه آخر. وكما هو الحال في الحالة العددية، يمكن للمتوسط ​​المرجح لتقديرات متعددة أن يوفر تقديرًا لأقصى احتمال . ببساطة، نستبدل التباين.σ2{\displaystyle \sigma ^{2}}بواسطة مصفوفة التغايرج{\displaystyle \mathbf {C} }والمعكوس الحسابي بواسطة معكوس المصفوفة (كلاهما مشار إليه بنفس الطريقة، عبر الرموز العليا)؛ ثم تصبح مصفوفة الوزن كالتالي: [ 10 ]

دبليوأنا=جأنا-1.{\displaystyle \mathbf {W} _{i}=\mathbf {C} _{i}^{-1}.}

المتوسط ​​المرجح في هذه الحالة هو: x¯=جx¯(أنا=1ندبليوأناxأنا)،{\displaystyle {\bar {\mathbf {x} }}=\mathbf {C} _{\bar {\mathbf {x} }}\left(\sum _{i=1}^{n}\mathbf {W} _{i}\mathbf {x} _{i}\right),}(حيث لا يكون ترتيب ضرب المصفوفة في المتجه تبادليًا )، من حيث تباين المتوسط ​​المرجح: جx¯=(أنا=1ندبليوأنا)-1،{\displaystyle \mathbf {C} _{\bar {\mathbf {x} }}=\left(\sum _{i=1}^{n}\mathbf {W} _{i}\right)^{-1},}

على سبيل المثال، لنفترض المتوسط ​​المرجح للنقطة [1 0] ذات التباين العالي في المكون الثاني، والنقطة [0 1] ذات التباين العالي في المكون الأول.

x1:=[10]،ج1:=[100100]{\displaystyle \mathbf {x} _{1}:={\begin{bmatrix}1&0\end{bmatrix}}^{\top },\qquad \mathbf {C} _{1}:={\begin{bmatrix}1&0\\0&100\end{bmatrix}}}
x2:=[01]،ج2:=[100001]{\displaystyle \mathbf {x} _{2}:={\begin{bmatrix}0&1\end{bmatrix}}^{\top },\qquad \mathbf {C} _{2}:={\begin{bmatrix}100&0\\0&1\end{bmatrix}}}

إذن، المتوسط ​​المرجح هو:

x¯=(ج1-1+ج2-1)-1(ج1-1x1+ج2-1x2)=[0.9901000.9901][11]=[0.99010.9901]{\displaystyle {\begin{aligned}{\bar {\mathbf {x} }}&=\left(\mathbf {C} _{1}^{-1}+\mathbf {C} _{2}^{-1}\right)^{-1}\left(\mathbf {C} _{1}^{-1}\mathbf {x} _{1}+\mathbf {C} _{2}^{-1}\mathbf {x} _{2}\right)\\[5pt]&={\begin{bmatrix}0.9901&0\\0&0.9901\end{bmatrix}}{\begin{bmatrix}1\\1\end{bmatrix}}={\begin{bmatrix}0.9901\\0.9901\end{bmatrix}}\end{aligned}}}

وهذا منطقي: التقدير [1 0] "متوافق" في المكون الثاني والتقدير [0 1] متوافق في المكون الأول، لذا فإن المتوسط ​​المرجح قريب من [1 1].

مراعاة الارتباطات

في الحالة العامة، لنفترض أنX=[x1،...،xن]تي{\displaystyle \mathbf {X} =[x_{1},\dots ,x_{n}]^{T}}،ج{\displaystyle \mathbf {C} }هي مصفوفة التغاير التي تربط الكمياتxأنا{\displaystyle x_{i}}،x¯{\displaystyle {\bar {x}}}وهو المتوسط ​​المشترك المراد تقديره، وج{\displaystyle \mathbf {J} }هي مصفوفة تصميم تساوي متجهًا من الواحدات[1،...،1]تي{\displaystyle [1,\dots ,1]^{T}}(طول)ن{\displaystyle n}تنص نظرية جاوس -ماركوف على أن تقدير المتوسط ​​ذي التباين الأدنى يُعطى بالصيغة التالية:

σx¯2=(جتيدبليوج)-1،{\displaystyle \sigma _{\bar {x}}^{2}=(\mathbf {J} ^{T}\mathbf {W} \mathbf {J} )^{-1},}

و

x¯=σx¯2(جتيدبليوX)،{\displaystyle {\bar {x}}=\sigma _{\bar {x}}^{2}(\mathbf {J} ^{T}\mathbf {W} \mathbf {X} ),}

أين:

دبليو=ج-1.{\displaystyle \mathbf {W} =\mathbf {C} ^{-1}.}

انخفاض قوة التفاعلات

ضع في اعتبارك السلسلة الزمنية لمتغير مستقلx{\displaystyle x}ومتغير تابعy{\displaystyle y}، معن{\displaystyle n}الملاحظات التي تم أخذ عينات منها في أوقات منفصلةتأنا{\displaystyle t_{i}}في العديد من المواقف الشائعة، تكمن قيمةy{\displaystyle y}في ذلك الوقتتأنا{\displaystyle t_{i}}لا يعتمد الأمر فقط علىxأنا{\displaystyle x_{i}}ولكن أيضًا على قيمها السابقة. عادةً، تتضاءل قوة هذا الاعتماد مع ازدياد التباعد الزمني بين المشاهدات. لنمذجة هذه الحالة، يمكن استبدال المتغير المستقل بمتوسطه المتحرك.z{\displaystyle z}لحجم النافذةم{\displaystyle m}.

zك=أنا=1مwأناxك+1-أنا.{\displaystyle z_{k}=\sum _{i=1}^{m}w_{i}x_{k+1-i}.}

أوزان متناقصة بشكل كبير

في السيناريو الموصوف في القسم السابق، غالبًا ما يتبع انخفاض قوة التفاعل قانونًا أسيًا سالبًا. إذا تم أخذ عينات من الملاحظات في أوقات متساوية البعد، فإن الانخفاض الأسي يعادل انخفاضًا بنسبة ثابتة.0<Δ<1{\displaystyle 0<\Delta <1}في كل خطوة زمنية. الإعدادw=1-Δ{\displaystyle w=1-\Delta }يمكننا أن نحددم{\displaystyle m}الأوزان المعيارية بواسطة

wأنا=wأنا-1V1،{\displaystyle w_{i}={\frac {w^{i-1}}{V_{1}}},}

أينV1{\displaystyle V_{1}}هو مجموع الأوزان غير المعيارية. في هذه الحالةV1{\displaystyle V_{1}}هو ببساطة

V1=أنا=1مwأنا-1=1-wم1-w،{\displaystyle V_{1}=\sum _{i=1}^{m}{w^{i-1}}={\frac {1-w^{m}}{1-w}},}

الاقترابV1=1/(1-w){\displaystyle V_{1}=1/(1-w)}بالنسبة للقيم الكبيرة لـم{\displaystyle m}.

ثابت التخميدw{\displaystyle w}يجب أن يتوافق ذلك مع الانخفاض الفعلي في قوة التفاعل. إذا تعذر تحديد ذلك من خلال الاعتبارات النظرية، فإن الخصائص التالية للأوزان المتناقصة أُسّيًا تُفيد في اتخاذ خيار مناسب: عند الخطوة(1-w)-1{\displaystyle (1-w)^{-1}}، الوزن يساوي تقريبًاهـ-1(1-w)=0.39(1-w){\displaystyle {e^{-1}}(1-w)=0.39(1-w)}، مساحة الذيل القيمةهـ-1{\displaystyle e^{-1}}منطقة الرأس1-هـ-1=0.61{\displaystyle {1-e^{-1}}=0.61}منطقة الذيل عند الخطوةن{\displaystyle n}يكونهـ-ن(1-w){\displaystyle \leq {e^{-n(1-w)}}}حيث يكون الأقرب في المقام الأولن{\displaystyle n}إذا كانت الملاحظات مهمة، ويمكن تجاهل تأثير الملاحظات المتبقية بأمان، فاخترw{\displaystyle w}بحيث تكون مساحة الذيل صغيرة بما فيه الكفاية.

المتوسطات المرجحة للدوال

يمكن توسيع مفهوم المتوسط ​​المرجح ليشمل الدوال. [ 11 ] تلعب المتوسطات المرجحة للدوال دورًا هامًا في أنظمة حساب التفاضل والتكامل المرجح. [ 12 ]

تصحيح التشتت الزائد أو الناقص

تُستخدم المتوسطات المرجحة عادةً لإيجاد المتوسط ​​المرجح للبيانات التاريخية، بدلاً من البيانات المُولَّدة نظريًا. في هذه الحالة، سيكون هناك بعض الخطأ في تباين كل نقطة بيانات. عادةً ما يتم التقليل من شأن الأخطاء التجريبية لأن المجرب لا يأخذ في الاعتبار جميع مصادر الخطأ عند حساب تباين كل نقطة بيانات. في هذه الحالة، يجب تصحيح التباين في المتوسط ​​المرجح لمراعاة حقيقة أنχ2{\displaystyle \chi ^{2}}كبير جدًا. التصحيح المطلوب هو

σ^x¯2=σx¯2χν2{\displaystyle {\hat {\sigma }}_{\bar {x}}^{2}=\sigma _{\bar {x}}^{2}\chi _{\nu }^{2}}

أينχν2{\displaystyle \chi _{\nu }^{2}}هو مربع كاي المختزل :

χν2=1(ن-1)أنا=1ن(xأنا-x¯)2σأنا2؛{\displaystyle \chi _{\nu }^{2}={\frac {1}{(n-1)}}\sum _{i=1}^{n}{\frac {(x_{i}-{\bar {x}})^{2}}{\sigma _{i}^{2}}};}

الجذر التربيعيσ^x¯{\displaystyle {\hat {\sigma }}_{\bar {x}}}يمكن تسميته الخطأ المعياري للمتوسط ​​المرجح (أوزان التباين، مصحح المقياس) .

عندما تتساوى جميع تباينات البيانات،σأنا=σ0{\displaystyle \sigma _{i}=\sigma _{0}}، فتُلغى هذه العوامل في تباين المتوسط ​​المرجح،σx¯2{\displaystyle \sigma _{\bar {x}}^{2}}، وهو ما يختزل بدوره إلى الخطأ المعياري للمتوسط ​​(المربع).σx¯2=σ2/ن{\displaystyle \sigma _{\bar {x}}^{2}=\sigma ^{2}/n}، مصاغة بدلالة الانحراف المعياري للعينة (مربع)،

σ2=أنا=1ن(xأنا-x¯)2ن-1.{\displaystyle \sigma ^{2}={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}{n-1}}.}

انظر أيضاً

ملحوظات

  1. من الناحية الفنية، يمكن استخدام القيم السالبة إذا كانت جميع القيم إما صفرًا أو سالبة. ومع ذلك، لا يؤدي هذا أي وظيفة لأن الأوزان تعمل كقيم مطلقة .

مراجع

  1. 1 2 3 4 كوكران، دبليو جي (1977). تقنيات أخذ العينات (الطبعة الثالثة). ناشفيل، تينيسي: جون وايلي وأولاده. ISBN 978-0-471-16240-7
  2. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 كارل إريك سارندال؛ بينجت سوينسون؛ جان ريتمان (1992). نموذج أخذ عينات المسح بمساعدة . سبرينغر. رقم ISBN 978-0-387-97528-3.
  3. توماس لوملي ( https://stats.stackexchange.com/users/249135/thomas-lumley )، كيفية تقدير التباين (التقريبي) للمتوسط ​​المرجح؟، الرابط (الإصدار: 2021-06-08): https://stats.stackexchange.com/q/525770
  4. جاتز، دونالد ف.؛ سميث، لوثر (يونيو 1995). "الخطأ المعياري لمتوسط ​​التركيز المرجح - الجزء الأول: إعادة التوزيع العشوائي مقابل الطرق الأخرى". بيئة الغلاف الجوي . 29 (11): 1185-1193 . Bibcode : 1995AtmEn..29.1185G . doi : 10.1016/1352-2310(94)00210-C .- رابط ملف PDF
  5. إندليش، آر إم؛ إيمون، بي بي؛ فيريك، آر جيه؛ فالديس، إيه دي؛ ماكسويل، سي. (1988-12-01). "التحليل الإحصائي لقياسات كيمياء الهطول فوق شرق الولايات المتحدة. الجزء الأول: الأنماط والارتباطات الموسمية والإقليمية" . مجلة الأرصاد الجوية التطبيقية وعلم المناخ . 27 (12): 1322-1333 . Bibcode : 1988JApMe..27.1322E . doi : 10.1175/1520-0450(1988)027 < 1322:SAOPCM > 2.0.CO ; 2 .
  6. "مكتبة جنو العلمية - دليل مرجعي: العينات الموزونة" . Gnu.org . تم الاطلاع عليه بتاريخ 22 ديسمبر 2017 .
  7. "الخطأ المعياري المرجح وتأثيره على اختبار الدلالة الإحصائية (WinCross مقابل Quantum وSPSS)، د. ألبرت مادانسكي" (ملف PDF) . Analyticalgroup.com . تاريخ الاطلاع: 22 ديسمبر 2017 .
  8. 1 2 برايس، جورج ر. (أبريل 1972). " توسيع رياضيات اختيار التغاير" (ملف PDF) . حوليات علم الوراثة البشرية . 35 (4): 485-490 . doi : 10.1111/j.1469-1809.1957.tb01874.x . PMID 5073694. S2CID 37828617 .  
  9. مارك جالاسي، جيم ديفيز، جيمس ثيلر، برايان جوف، جيرارد يونغمان، مايكل بوث، وفابريس روسي. مكتبة جنو العلمية - دليل مرجعي، الإصدار 1.15 ، 2011. القسم 21.7 العينات الموزونة
  10. جيمس، فريدريك (2006). الأساليب الإحصائية في الفيزياء التجريبية ( الطبعة الثانية). سنغافورة: وورلد ساينتيفيك. ص 324. ISBN   981-270-527-9.
  11. جي إتش هاردي ، جي إي ليتلوود ، وجي بوليا . عدم المساواة (الطبعة الثانية)، مطبعة جامعة كامبريدج، رقم ISBN 978-0-521-35880-41988.
  12. جين غروسمان، مايكل غروسمان، روبرت كاتز. الأنظمة الأولى لحساب التفاضل والتكامل الموزون ، ISBN 0-9771170-1-4، 1980.

للمزيد من القراءة

  • بيفينجتون، فيليب ر. (1969). اختزال البيانات وتحليل الأخطاء في العلوم الفيزيائية . نيويورك، نيويورك: ماكجرو هيل. OCLC 300283069 . 
  • ستروتز، ت. (2010). ملاءمة البيانات وعدم اليقين (مقدمة عملية للمربعات الصغرى الموزونة وما بعدها) . فيوج + توبنر. ISBN 978-3-8348-1022-9.