الانحراف المعياري

رسم بياني للتوزيع الطبيعي (أو منحنى على شكل جرس) حيث يكون لكل نطاق عرض انحراف معياري واحد - انظر أيضًا: قاعدة 68-95-99.7 .
دالة التوزيع التراكمي للتوزيع الطبيعي بقيمة متوقعة 0 وانحراف معياري 1

في الإحصاء ، يُعدّ الانحراف المعياري مقياسًا لمدى تباين قيم متغير ما حول متوسطه الحسابي . [ 1 ] يشير الانحراف المعياري المنخفض إلى أن قيم مجموعة ما تميل إلى أن تكون قريبة من متوسطها، بينما يشير الانحراف المعياري المرتفع إلى أن القيم موزعة على نطاق أوسع. يُختصر الانحراف المعياري بـ SD أو std dev ، ويُرمز إليه عادةً في النصوص والمعادلات الرياضية بالحرف اليوناني الصغير σ (سيجما).

في حالة التوزيع الطبيعي (كما هو موضح في المنحنى المتماثل على شكل جرس)، تقع حوالي 68% من جميع القيم ضمن انحراف معياري واحد عن المتوسط، و95% ضمن انحرافين معياريين، و99.7% ضمن ثلاثة انحرافات معيارية.

الانحراف المعياري لمتغير عشوائي ، أو عينة ، أو مجتمع إحصائي ، أو مجموعة بيانات ، أو توزيع احتمالي، هو الجذر التربيعي لتباينه ( التباين هو متوسط ​​مربعات الانحرافات عن المتوسط ). ومن خصائص الانحراف المعياري المفيدة أنه، على عكس التباين، يُقاس بنفس وحدة البيانات. كما يُمكن استخدام الانحراف المعياري لحساب الخطأ المعياري لعينة محدودة، ولتحديد الدلالة الإحصائية .

عندما لا تتوفر سوى عينة من البيانات من مجتمع ما، فإن مصطلح الانحراف المعياري للعينة أو الانحراف المعياري للعينة يمكن أن يشير إما إلى الكمية المذكورة أعلاه كما تم تطبيقها على تلك البيانات، أو إلى كمية معدلة تمثل تقديرًا غير متحيز للانحراف المعياري للمجتمع (الانحراف المعياري للمجتمع بأكمله).

العلاقة مع الخطأ المعياري والدلالة الإحصائية

يختلف الانحراف المعياري للمجتمع أو العينة عن الخطأ المعياري للإحصائية (مثل متوسط ​​العينة)، ولكنهما مرتبطان. الخطأ المعياري لمتوسط ​​العينة هو الانحراف المعياري لمجموعة المتوسطات التي يمكن الحصول عليها بسحب عدد لا نهائي من العينات المتكررة من المجتمع وحساب متوسط ​​لكل عينة. ويُحسب الخطأ المعياري للمتوسط ​​بقسمة الانحراف المعياري للمجتمع على الجذر التربيعي لحجم العينة، ويُقدّر باستخدام الانحراف المعياري للعينة مقسومًا على الجذر التربيعي لحجم العينة. على سبيل المثال، الخطأ المعياري لاستطلاع رأي (ما يُعرف بهامش خطأ الاستطلاع) هو الانحراف المعياري المتوقع للمتوسط ​​المُقدّر إذا أُجري الاستطلاع نفسه عدة مرات. وبالتالي، يُقدّر الخطأ المعياري الانحراف المعياري للتقدير، والذي بدوره يقيس مدى اعتماد التقدير على العينة المحددة التي تم سحبها من المجتمع.

في العلوم ، من الشائع الإبلاغ عن كل من الانحراف المعياري للبيانات (كإحصائية موجزة) والخطأ المعياري للتقدير (كمقياس للخطأ المحتمل في النتائج). وبحسب العرف، تُعتبر التأثيرات التي تبعد أكثر من خطأين معياريين عن القيمة المتوقعة الصفرية " ذات دلالة إحصائية "، وذلك كإجراء وقائي ضد الاستنتاجات الخاطئة التي تعود في الواقع إلى خطأ المعاينة العشوائية.

أمثلة أساسية

الانحراف المعياري لدرجات ثمانية طلاب

لنفترض أن جميع الطلاب محل الاهتمام هم ثمانية طلاب في فصل دراسي معين. علاماتهم هي القيم الثمانية التالية: 2، 4، 4، 4، 5، 5، 7، 9.{\displaystyle 2,\4,\4,\4,\5,\5,\7,\9.}

بالنسبة لمجموعة محدودة من الأرقام، يتم إيجاد الانحراف المعياري للمجتمع عن طريق أخذ الجذر التربيعي لمتوسط ​​مربعات انحرافات القيم مطروحًا من متوسط ​​قيمتها، أي: σ=أvهـرأزهـ((v-μ)2 ل vvألuهـs) أين μ=أvهـرأزهـ(vألuهـs).{\displaystyle \sigma ={\sqrt {\mathrm {average} \left((v-\mu )^{2}{\text{ for }}v\in \mathrm {values} \right)}}{\text{ Where }}\mu =\mathrm {average} (\mathrm {values} ).}

يبلغ متوسط ​​هذه البيانات الثمانية 5:μ=2+4+4+4+5+5+7+98=408=5.{\displaystyle \mu ={\frac {2+4+4+4+5+5+7+9}{8}}={\frac {40}{8}}=5.}

بعد ذلك، احسب انحرافات كل نقطة بيانات عن المتوسط. ثم قم بتربيع نتيجة كل منها:(2-5)2=(-3)2=9(5-5)2=02=0(4-5)2=(-1)2=1(5-5)2=02=0(4-5)2=(-1)2=1(7-5)2=22=4(4-5)2=(-1)2=1(9-5)2=42=16.{\displaystyle {\begin{array}{lll}(2-5)^{2}=(-3)^{2}=9&&(5-5)^{2}=0^{2}=0\\(4-5)^{2}=(-1)^{2}=1&&(5-5)^{2}=0^{2}=0\\(4-5)^{2}=(-1)^{2}=1&&(7-5)^{2}=2^{2}=4\\(4-5)^{2}=(-1)^{2}=1&&(9-5)^{2}=4^{2}=16.\\\end{array}}}

بعد ذلك، يكون التباين هو متوسط ​​هذه القيم: σ2=9+1+1+1+0+0+4+168=328=4{\displaystyle \sigma ^{2}={\frac {9+1+1+1+0+0+4+16}{8}}={\frac {32}{8}}=4}

وأخيرًا، فإن الانحراف المعياري للمجتمع هو الجذر التربيعي للتباين:σ=4=2.{\displaystyle \sigma ={\sqrt {4}}=2.}

إذا لم تكن القيم الثمانية التي بدأنا بها تمثل كامل المجتمع محل الاهتمام، فإن هذا مجرد واحد من تقديرات عديدة محتملة للانحراف المعياري في المجتمع ككل. هذا التقدير تحديدًا متحيز ، أي أن قيمته المتوقعة في عمليات أخذ العينات المتكررة تنحرف عن القيمة الحقيقية، ولكنه يظل متسقًا . من ناحية أخرى، قد يكون متوسط ​​مربع الخطأ فيه أقل من متوسط ​​مربع الخطأ للمُقدِّر غير المتحيز .

الانحراف المعياري لمتوسط ​​طول الرجال البالغين

إذا كان توزيع المجتمع محل الدراسة طبيعيًا تقريبًا، فإن الانحراف المعياري يُقدّم معلومات حول نسبة المشاهدات التي تقع أعلى أو أسفل قيم معينة. على سبيل المثال، يبلغ متوسط ​​طول الرجال البالغين في الولايات المتحدة حوالي 175  سم [ 2 ] ، بانحراف معياري يبلغ حوالي 7.5 سم . هذا يعني أن معظم الرجال (حوالي 68%، بافتراض التوزيع الطبيعي ) يقع طولهم ضمن نطاق 7.5 سم من المتوسط ​​( 167-188 سم ) - أي انحراف معياري واحد - وأن جميع الرجال تقريبًا (حوالي 95%) يقع طولهم ضمن نطاق 15 سم من المتوسط ​​( 160-195 سم ) - أي انحرافين معياريين. لو كان الانحراف المعياري صفرًا، لكان طول جميع الرجال 175 سم. ثلاثة انحرافات معيارية تُفسّر 99.73% من عينة المجتمع قيد الدراسة، بافتراض أن التوزيع طبيعي أو على شكل جرس (انظر قاعدة 68-95-99.7 ، أو القاعدة التجريبية ، لمزيد من المعلومات).         

تعريف قيم السكان

ليكن μ القيمة المتوقعة (المتوسط) لمتغير عشوائي X ذي دالة كثافة احتمالية f : μهـ[X]=-+xو(x)دx.{\displaystyle \mu \equiv \operatorname {\mathbb {E} } [X]=\int _{-\infty }^{+\infty }x\,f(x)\,{\mathrm {d} }x.}يُعرَّف الانحراف المعياري σ لـ X على النحو التالي:σهـ[(X-μ)2]=-+(x-μ)2و(x) دx ،{\displaystyle \sigma \equiv {\sqrt {\operatorname {\mathbb {E} } \left[\left(X-\mu \right)^{2}\right]}}={\sqrt {\int _{-\infty }^{+\infty }\left(x-\mu \right)^{2}f(x)\ {\mathrm {d} }x\;}}\ ,} والتي يمكن إثبات أنها تساويهـ[X2]-(هـ[X])2.{\textstyle {\sqrt {\operatorname {\mathbb {E} } \left[X^{2}\right]-\left(\operatorname {\mathbb {E} } \left[X\right]\right)^{2}}}\,.}

بمعنى آخر ، الانحراف المعياري هو الجذر التربيعي لتباين X.

الانحراف المعياري لتوزيع احتمالي هو نفسه الانحراف المعياري لمتغير عشوائي له نفس التوزيع.

لا تمتلك جميع المتغيرات العشوائية انحرافًا معياريًا. فإذا كان للتوزيع ذيول سميكة تمتد إلى ما لا نهاية، فقد لا يكون للانحراف المعياري وجود، لأن التكامل قد لا يتقارب. أما التوزيع الطبيعي، فله ذيول تمتد إلى ما لا نهاية، لكن متوسطه وانحرافه المعياري موجودان، لأن الذيول تتلاشى بسرعة كافية. توزيع باريتو ذو المعلمةα(1،2]{\displaystyle \alpha \in (1,2]}يمتلك توزيع كوشي متوسطًا، لكن ليس له انحراف معياري (بمعنى أدق، الانحراف المعياري لانهائي). أما توزيع كوشي فلا يمتلك متوسطًا ولا انحرافًا معياريًا.

متغير عشوائي منفصل

في حالة أخذ المتغير العشوائي X قيمًا عشوائية من مجموعة بيانات محدودة x1 ، x2 ، ...، xN ، مع تساوي احتمالية كل قيمة، يكون الانحراف المعياري هو

σ=1شمال [(x1-μ)2+(x2-μ)2++(xشمال-μ)2] ،   أين   μ1شمال(x1++xشمال) ،{\displaystyle \sigma ={\sqrt {{\frac {1}{N}}\ \left[\left(x_{1}-\mu \right)^{2}+\left(x_{2}-\mu \right)^{2}+\cdots +\left(x_{N}-\mu \right)^{2}\right]\;}}\ ,~~{\text{ where }}~~\mu \equiv {\frac {1}{N}}\left(x_{1}+\cdots +x_{N}\right)\ ,} ملاحظة: يحتوي التعبير أعلاه على تحيز مُضمّن. انظر المناقشة حول تصحيح بيسل أدناه.

أو باستخدام رمز الجمع ،

σ=1شمالأنا=1شمال(xأنا-μ)2 ،   أين   μ1شمالأنا=1شمالxأنا .{\displaystyle \sigma ={\sqrt {{\frac {1}{N}}\sum _{i=1}^{N}\left(x_{i}-\mu \right)^{2}\;}}\ ,~~{\text{ where }}~~\mu \equiv {\frac {1}{N}}\sum _{i=1}^{N}x_{i}~.}

إذا كانت القيم ذات احتمالات مختلفة بدلاً من أن تكون متساوية، فلنفترض أن x1 لها احتمال p1 ، و x2 لها احتمال p2 ، ...، و xN لها احتمال pN . في هذه الحالة، سيكون الانحراف المعياري هوσ=أنا=1شمالصأنا(xأنا-μ)2 ،   أين   μأنا=1شمالصأناxأنا.{\displaystyle \sigma ={\sqrt {\sum _{i=1}^{N}p_{i}\left(x_{i}-\mu \right)^{2}\;}}\ ,~~{\text{ where }}~~\mu \equiv \sum _{i=1}^{N}p_{i}x_{i}\,.}

متغير عشوائي مستمر

الانحراف المعياري لمتغير عشوائي حقيقي مستمر X ذي دالة كثافة احتمالية p ( x ) هو σ=X(x-μ)2ص(x)دx،   أين   μXxص(x)دx،{\displaystyle \sigma ={\sqrt {\int _{\mathbf {X} }\left(x-\mu \right)^{2}\,p(x)\,{\mathrm {d} }x}}\,,~~{\text{ where }}~~\mu \equiv \int _{\mathbf {X} }x\,p(x)\,{\mathrm {d} }x\,,}

وحيث تكون التكاملات تكاملات محددة مأخوذة لـ x تتراوح على X ، والتي تمثل مجموعة القيم الممكنة للمتغير العشوائي X. 

في حالة عائلة التوزيعات البارامترية ، يمكن غالبًا التعبير عن الانحراف المعياري بدلالة معلمات التوزيع الأساسي. على سبيل المثال، في حالة التوزيع اللوغاريتمي الطبيعي ذي المعلمتين μ و σ² للتوزيع الطبيعي الأساسي، يُعطى الانحراف المعياري للمتغير اللوغاريتمي الطبيعي بالصيغة التالية :(هـσ2-1) هـ2μ+σ2.{\displaystyle {\sqrt {\left(e^{\sigma ^{2}}-1\right)\ e^{2\mu +\sigma ^{2}}}}\,.}

تقدير

يمكن إيجاد الانحراف المعياري لمجتمع إحصائي كامل في حالات (مثل الاختبارات المعيارية ) حيث يتم أخذ عينة من كل فرد من أفراد المجتمع. في الحالات التي يتعذر فيها ذلك، يُقدَّر الانحراف المعياري σ بفحص عينة عشوائية مأخوذة من المجتمع وحساب إحصائية خاصة بها، تُستخدم كتقدير للانحراف المعياري للمجتمع. تُسمى هذه الإحصائية بالمُقدِّر ، ويُسمى المُقدِّر (أو قيمة المُقدِّر، أي التقدير) بالانحراف المعياري للعينة ، ويُرمز له بالرمز s (مع إمكانية إضافة مُعدِّلات).

على عكس تقدير متوسط ​​المجتمع للتوزيع الطبيعي، حيث يُعد متوسط ​​العينة مُقدِّرًا بسيطًا يتمتع بالعديد من الخصائص المرغوبة ( غير متحيز ، فعال ، أقصى احتمال)، لا يوجد مُقدِّر واحد للانحراف المعياري يجمع كل هذه الخصائص، ويُعتبر التقدير غير المتحيز للانحراف المعياري مشكلة معقدة تقنيًا. في أغلب الأحيان، يُقدَّر الانحراف المعياري باستخدام الانحراف المعياري المصحح للعينة (باستخدام N − 1 )، المُعرَّف أدناه، ويُشار إليه غالبًا باسم "الانحراف المعياري للعينة" دون أي تحديدات. مع ذلك، توجد مُقدِّرات أخرى أفضل من نواحٍ أخرى: فالمُقدِّر غير المصحح (باستخدام N ) يُعطي متوسط ​​خطأ تربيعي أقل، بينما استخدام N − 1.5 (للتوزيع الطبيعي) يُزيل التحيز تقريبًا.

الانحراف المعياري للعينة غير المصحح

يمكن تطبيق صيغة الانحراف المعياري للمجتمع (لمجتمع محدود) على العينة، باستخدام حجم العينة كحجم للمجتمع (مع العلم أن حجم المجتمع الفعلي الذي سُحبت منه العينة قد يكون أكبر بكثير). يُعرف هذا المُقدِّر، الذي يُرمز له بـ s N ، بالانحراف المعياري للعينة غير المصحح ، أو أحيانًا الانحراف المعياري للعينة (باعتبارها المجتمع بأكمله)، ويُعرَّف كما يلي: [ 3 ]sشمال=1شمالأنا=1شمال(xأنا-x¯)2{\displaystyle s_{N}={\sqrt {{\frac {1}{N}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}}}} حيث { x 1 , x 2 , , x N } هي القيم المرصودة لعناصر العينة و x ̄ هو متوسط ​​هذه الملاحظات، بينما يمثل المقام N حجم العينة: هذا هو الجذر التربيعي لتباين العينة، وهو متوسط ​​مربعات الانحرافات حول متوسط ​​العينة.

هذا مُقدِّر متسق (يتقارب احتماليًا مع قيمة المجتمع الإحصائي عندما يؤول عدد العينات إلى اللانهاية)، وهو تقدير الاحتمال الأقصى عندما يكون توزيع المجتمع الإحصائي طبيعيًا. [ 4 ] مع ذلك، يُعد هذا مُقدِّرًا متحيزًا ، إذ تكون التقديرات منخفضة عمومًا. يقل التحيز مع ازدياد حجم العينة، ويتناقص بنسبة 1 / N ، وبالتالي يكون أكثر أهمية لأحجام العينات الصغيرة أو المتوسطة؛ أما بالنسبة لـ N > 75، فيكون التحيز أقل من 1%. لذا، بالنسبة لأحجام العينات الكبيرة جدًا، يكون الانحراف المعياري للعينة غير المصحح مقبولًا عمومًا. كما أن لهذا المُقدِّر متوسط ​​خطأ تربيعي أصغر بشكل منتظم من الانحراف المعياري للعينة المصحح.

الانحراف المعياري المصحح للعينة

إذا تم استخدام تباين العينة المتحيز ( العزم المركزي الثاني للعينة، وهو تقدير متحيز نحو الأسفل لتباين المجتمع) لحساب تقدير الانحراف المعياري للمجتمع، فإن النتيجة هي sشمال=1شمالأنا=1شمال(xأنا-x¯)2.{\displaystyle s_{N}={\sqrt {{\frac {1}{N}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}}}.}

هنا، يؤدي حساب الجذر التربيعي إلى تحيز تنازلي إضافي، وفقًا لمتباينة جنسن ، نظرًا لأن الجذر التربيعي دالة مقعرة . يسهل تصحيح التحيز في التباين، لكن تصحيح التحيز الناتج عن الجذر التربيعي أكثر صعوبة، ويعتمد على التوزيع المدروس.

يتم الحصول على مقدر غير متحيز للتباين عن طريق تطبيق تصحيح بيسل ، باستخدام N − 1 بدلاً من N للحصول على تباين العينة غير المتحيز، والذي يرمز له بـ s 2 : s2=1شمال-1أنا=1شمال(xأنا-x¯)2.{\displaystyle s^{2}={\frac {1}{N-1}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}.}

يكون هذا المُقدِّر غير متحيز إذا كان التباين موجودًا وتم سحب قيم العينة بشكل مستقل مع الإحلال. يُمثل N − 1 عدد درجات الحرية في متجه الانحرافات عن المتوسط.(x1-x¯،...،xن-x¯).{\displaystyle \textstyle (x_{1}-{\bar {x}},\;\dots ,\;x_{n}-{\bar {x}}).}

يؤدي حساب الجذر التربيعي إلى إعادة إدخال التحيز (لأن الجذر التربيعي دالة غير خطية لا تتبادل مع القيمة المتوقعة، أي غالبًا ما تكونهـ[X]هـ[X]{\textstyle E[{\sqrt {X}}]\neq {\sqrt {E[X]}}})، مما ينتج عنه الانحراف المعياري المصحح للعينة، والذي يرمز إليه بـ s : s=1شمال-1أنا=1شمال(xأنا-x¯)2.{\displaystyle s={\sqrt {{\frac {1}{N-1}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}}}.}

كما هو موضح أعلاه، على الرغم من أن يُعدّ مُقدِّرًا غير متحيز لتباين المجتمع، إلا أن s يظل مُقدِّرًا متحيزًا للانحراف المعياري للمجتمع، وإن كان أقل تحيزًا بشكل ملحوظ من الانحراف المعياري للعينة غير المصحح. يُستخدم هذا المُقدِّر بشكل شائع ويُعرف ببساطة باسم "الانحراف المعياري للعينة". قد يظل التحيز كبيرًا في العينات الصغيرة ( N أقل من 10). مع زيادة حجم العينة، يقل مقدار التحيز. نحصل على مزيد من المعلومات والفرق بين1شمال{\displaystyle {\frac {1}{N}}}و1شمال-1{\displaystyle {\frac {1}{N-1}}}يصبح أصغر.

الانحراف المعياري للعينة غير المتحيز

لتقدير الانحراف المعياري بشكل غير متحيز ، لا توجد صيغة واحدة صالحة لجميع التوزيعات، على عكس المتوسط ​​والتباين. بدلاً من ذلك، يُستخدم الانحراف المعياري (s) كأساس، ويُضرب بمعامل تصحيح للحصول على تقدير غير متحيز. بالنسبة للتوزيع الطبيعي، يُعطى التقدير غير المتحيز بالصيغة s / c 4 ، حيث يُعطى معامل التصحيح (الذي يعتمد على N ) بدلالة دالة غاما ، ويساوي: ج4(شمال)=2شمال-1Γ(شمال2)Γ(شمال-12).{\displaystyle c_{4}(N)\,=\,{\sqrt {\frac {2}{N-1}}}\,\,\,{\frac {\Gamma {\left({\frac {N}{2}}\right)}}{\Gamma {\left({\frac {N-1}{2}}\right)}}}.}

ينشأ هذا لأن توزيع أخذ العينات للانحراف المعياري للعينة يتبع توزيع كاي (المقاس) ، وعامل التصحيح هو متوسط ​​توزيع كاي.

يمكن الحصول على قيمة تقريبية عن طريق استبدال N − 1 بـ N − 1.5 ، مما ينتج عنه: σ^=1شمال-1.5أنا=1شمال(xأنا-x¯)2،{\displaystyle {\hat {\sigma }}={\sqrt {{\frac {1}{N-1.5}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}}},}

يتناقص الخطأ في هذا التقريب بشكل تربيعي (بمعدل 1 / N 2 ) ، وهو مناسب لجميع العينات باستثناء أصغرها أو أعلى دقة: بالنسبة لـ N = 3 يكون الانحياز مساويًا لـ 13٪، وبالنسبة لـ N = 9 يكون الانحياز 3٪.

والتقريب الأكثر دقة هو استبدال N − 1.5 أعلاه بـ N − 1.5 + 1 / 8 ( N 1) . [ 5 ]

بالنسبة للتوزيعات الأخرى، تعتمد الصيغة الصحيحة على التوزيع، ولكن القاعدة العامة هي استخدام المزيد من التحسين للتقريب: σ^=1شمال-1.5-14γ2أنا=1شمال(xأنا-x¯)2،{\displaystyle {\hat {\sigma }}={\sqrt {{\frac {1}{N-1.5-{\frac {1}{4}}\gamma _{2}}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}}},}

حيث يرمز γ 2 إلى التفرطح الزائد للسكان . قد يكون التفرطح الزائد معروفًا مسبقًا لبعض التوزيعات، أو يتم تقديره من البيانات. [ 6 ]

فترة الثقة للانحراف المعياري المأخوذ من العينة

الانحراف المعياري الذي نحصل عليه من خلال أخذ عينة من التوزيع ليس دقيقًا تمامًا، وذلك لأسباب رياضية (موضحة هنا بفترة الثقة) ولأسباب عملية تتعلق بالقياس (خطأ القياس). ويمكن وصف التأثير الرياضي بفترة الثقة .

لتوضيح كيف يؤدي حجم العينة الأكبر إلى تضييق نطاق الثقة، انظر إلى الأمثلة التالية: مجتمع صغير مكون من فردين ( N = 2) لديه درجة حرية واحدة فقط لتقدير الانحراف المعياري. والنتيجة هي أن نطاق الثقة 95% للانحراف المعياري يمتد من 0.45 × الانحراف المعياري إلى 31.9 × الانحراف المعياري ؛ والعوامل هنا هي كما يلي :

برو(qα2<كs2σ2<q1-α2)=1-α،{\displaystyle \Pr \left(q_{\frac {\alpha }{2}}<k{\frac {s^{2}}{\sigma ^{2}}}<q_{1-{\frac {\alpha }{2}}}\right)=1-\alpha ,}

أينqص{\displaystyle q_{p}}يمثل المئين p لتوزيع كاي تربيع ذي k درجة حرية، و 1 − α هو مستوى الثقة. وهذا يكافئ ما يلي:

برو(كs2q1-α2<σ2<كs2qα2)=1-α.{\displaystyle \Pr \left(k{\frac {s^{2}}{q_{1-{\frac {\alpha }{2}}}}}<\sigma ^{2}<k{\frac {s^{2}}{q_{\frac {\alpha }{2}}}}\right)=1-\alpha .}

عندما k = 1 ، فإن q = 0.025 = 0.000982 و q = 0.975 = 5.024 . مقلوب الجذر التربيعي لهذين العددين يعطينا العاملين 0.45 و 31.9 المذكورين أعلاه.

يُتيح مجتمع إحصائي أكبر حجمه N = 10 تسع درجات حرية لتقدير الانحراف المعياري. وباستخدام نفس الحسابات المذكورة أعلاه، نحصل في هذه الحالة على فاصل ثقة بنسبة 95% يمتد من 0.69 × الانحراف المعياري إلى 1.83 × الانحراف المعياري . لذا، حتى مع عينة حجمها 10، قد يظل الانحراف المعياري الفعلي أعلى بمرتين تقريبًا من الانحراف المعياري المأخوذ من العينة. أما بالنسبة لعينة حجمها N = 100 ، فينخفض ​​هذا الفرق إلى ما بين 0.88 × الانحراف المعياري و 1.16 × الانحراف المعياري . وللتأكد من أن الانحراف المعياري المأخوذ من العينة قريب من الانحراف المعياري الفعلي، نحتاج إلى أخذ عينة من عدد كبير من النقاط.

يمكن استخدام هذه الصيغ نفسها للحصول على فترات ثقة حول تباين البواقي من ملاءمة المربعات الصغرى في ظل نظرية التوزيع الطبيعي القياسي، حيث k هو الآن عدد درجات الحرية للخطأ.

حدود الانحراف المعياري

بالنسبة لمجموعة بيانات N > 4 تغطي نطاقًا من القيم R ، يُعطى الحد الأعلى للانحراف المعياري s بالعلاقة s = 0.6 R. [ 7 ] ويُستنتج تقدير الانحراف المعياري لبيانات N > 100، التي تُعتبر ذات توزيع طبيعي تقريبًا، من القاعدة التقريبية التي تنص على أن 95% من المساحة تحت منحنى التوزيع الطبيعي تقع تقريبًا على بُعد انحرافين معياريين على جانبي المتوسط، بحيث يُمثل النطاق الكلي للقيم R ، باحتمالية 95%، أربعة انحرافات معيارية، وبالتالي sR / 4. تُعد قاعدة النطاق هذه مفيدة في تقدير حجم العينة ، حيث يسهل تقدير نطاق القيم الممكنة مقارنةً بتقدير الانحراف المعياري. وتتوفر قواسم أخرى K ( N ) للنطاق بحيث sR / K ( N ) لقيم أخرى لـ N وللتوزيعات غير الطبيعية. [ 8 ]

المتطابقات والخصائص الرياضية

يظل الانحراف المعياري ثابتًا عند تغير الموقع ، ويتناسب طرديًا مع حجم المتغير العشوائي. وبالتالي، بالنسبة لثابت c والمتغيرين العشوائيين X و Y : σ(ج)=0σ(X+ج)=σ(X)،σ(جX)=|ج|σ(X).{\displaystyle {\begin{aligned}\sigma (c)&=0\\\sigma (X+c)&=\sigma (X),\\\sigma (cX)&=|c|\sigma (X).\end{aligned}}}

يمكن ربط الانحراف المعياري لمجموع متغيرين عشوائيين بانحرافاتهما المعيارية الفردية وبالتغاير بينهما :

σ(X+Y)=متغير(X)+متغير(Y)+2كوف(X،Y).{\displaystyle \sigma (X+Y)={\sqrt {\operatorname {var} (X)+\operatorname {var} (Y)+2\,\operatorname {cov} (X,Y)}}.\,}

أينمتغير=σ2{\displaystyle \textstyle \operatorname {var} \,=\,\sigma ^{2}}وكوف{\displaystyle \textstyle \operatorname {cov} }يرمزان إلى التباين والتباين المشترك ، على التوالي.

يمكن ربط حساب مجموع مربعات الانحرافات بالعزوم المحسوبة مباشرة من البيانات. في الصيغة التالية، يُفسَّر الحرف E على أنه القيمة المتوقعة، أي المتوسط.

σ(X)=هـ[(X-هـ[X])2]=هـ[X2]-(هـ[X])2.{\displaystyle \sigma (X)={\sqrt {\operatorname {E} \left[\left(X-\operatorname {E} [X]\right)^{2}\right]}}={\sqrt {\operatorname {E} \left[X^{2}\right]-\left(\operatorname {E} [X]\right)^{2}}}.}

يمكن حساب الانحراف المعياري للعينة على النحو التالي: s(X)=شمالشمال-1هـ[(X-هـ[X])2].{\displaystyle s(X)={\sqrt {\frac {N}{N-1}}}{\sqrt {\operatorname {E} \left[\left(X-\operatorname {E} [X]\right)^{2}\right]}}.}

بالنسبة لمجموعة سكانية محدودة ذات احتمالات متساوية عند جميع النقاط، لدينا

1شمالأنا=1شمال(xأنا-x¯)2=1شمال(أنا=1شمالxأنا2)-x¯2=(1شمالأنا=1شمالxأنا2)-(1شمالأنا=1شمالxأنا)2،{\displaystyle {\begin{aligned}{\sqrt {{\frac {1}{N}}\sum _{i=1}^{N}\left(x_{i}-{\bar {x}}\right)^{2}}}&={\sqrt {{\frac {1}{N}}\left(\sum _{i=1}^{N}x_{i}^{2}\right)-{\bar {x}}^{2}}}\\[1ex]&={\sqrt {\left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}^{2}\right)-\left({\frac {1}{N}}\sum _{i=1}^{N}x_{i}\right)^{2}}},\end{aligned}}}

وهذا يعني أن الانحراف المعياري يساوي الجذر التربيعي للفرق بين متوسط ​​مربعات القيم ومربع القيمة المتوسطة.

انظر الصيغة الحسابية للتباين للإثبات، وللحصول على نتيجة مماثلة للانحراف المعياري للعينة.

التفسير والتطبيق

مثال على عينات من مجموعتين لهما نفس المتوسط ​​ولكن انحرافات معيارية مختلفة. المجموعة الحمراء متوسطها 100 وانحرافها المعياري 10؛ والمجموعة الزرقاء متوسطها 100 وانحرافها المعياري 50.

يشير الانحراف المعياري الكبير إلى أن نقاط البيانات يمكن أن تنتشر بعيدًا عن المتوسط، بينما يشير الانحراف المعياري الصغير إلى أنها تتجمع بشكل وثيق حول المتوسط.

على سبيل المثال، يبلغ متوسط ​​كل من المجموعات الثلاث {0، 0، 14، 14}، و{0، 6، 8، 14}، و{6، 6، 8، 8} 7. أما انحرافاتها المعيارية فهي 7، و5، و1 على التوالي. تتميز المجموعة الثالثة بانحراف معياري أصغر بكثير من المجموعتين الأخريين لأن قيمها جميعها قريبة من 7. وتُقاس هذه الانحرافات المعيارية بنفس وحدات نقاط البيانات نفسها. فإذا كانت مجموعة البيانات {0، 6، 8، 14}، على سبيل المثال، تُمثل أعمار أربعة أشقاء بالسنوات، فإن الانحراف المعياري هو 5 سنوات. كمثال آخر، قد تُمثل المجموعة {1000، 1006، 1008، 1014} المسافات التي قطعها أربعة رياضيين، مُقاسة بالأمتار. ويبلغ متوسطها 1007 أمتار، وانحرافها المعياري 5 أمتار.

قد يُستخدم الانحراف المعياري كمقياس للشك. ففي العلوم الفيزيائية، على سبيل المثال، يُشير الانحراف المعياري المُبلغ عنه لمجموعة من القياسات المتكررة إلى دقة تلك القياسات. وعند تحديد مدى توافق القياسات مع تنبؤ نظري، يُعدّ الانحراف المعياري لهذه القياسات بالغ الأهمية: فإذا كان متوسط ​​القياسات بعيدًا جدًا عن التنبؤ (حيث تُقاس المسافة بالانحرافات المعيارية)، فمن المرجح أن النظرية قيد الاختبار تحتاج إلى مراجعة. وهذا منطقي، إذ تقع هذه القياسات خارج نطاق القيم التي يُمكن توقعها بشكل معقول في حال صحة التنبؤ وتحديد الانحراف المعياري بدقة. انظر: فترة التنبؤ .

على الرغم من أن الانحراف المعياري يقيس مدى بُعد القيم النموذجية عن المتوسط، إلا أن هناك مقاييس أخرى متاحة. ومن الأمثلة على ذلك متوسط ​​الانحراف المطلق ، الذي يُمكن اعتباره مقياسًا أكثر مباشرة للمسافة المتوسطة، مقارنةً بجذر متوسط ​​مربع المسافة المتأصل في الانحراف المعياري.

أمثلة تطبيقية

تكمن القيمة العملية لفهم الانحراف المعياري لمجموعة من القيم في تقدير مقدار التباين الموجود عن المتوسط ​​(المتوسط ​​الحسابي).

التجارب والاختبارات الصناعية واختبارات الفرضيات

يُستخدم الانحراف المعياري غالبًا لمقارنة البيانات الواقعية بنموذج لاختبار هذا النموذج. على سبيل المثال، في التطبيقات الصناعية، قد يتطلب وزن المنتجات الخارجة من خط الإنتاج الالتزام بقيمة محددة قانونًا. من خلال وزن جزء من المنتجات، يمكن إيجاد متوسط ​​الوزن، والذي يختلف دائمًا اختلافًا طفيفًا عن المتوسط ​​طويل الأجل. باستخدام الانحرافات المعيارية، يمكن حساب الحد الأدنى والحد الأقصى للوزن المتوسط ​​الذي يقع ضمنه بنسبة عالية جدًا (99.9% أو أكثر). إذا خرج الوزن المتوسط ​​عن هذا النطاق، فقد يلزم تصحيح عملية الإنتاج أو لا. تكتسب الاختبارات الإحصائية من هذا النوع أهمية خاصة عندما يكون الاختبار مكلفًا نسبيًا، كما في حالة الحاجة إلى فتح المنتج وتفريغه ووزنه، أو إذا استُهلك المنتج بالكامل في الاختبار.

في العلوم التجريبية، يُستخدم نموذج نظري للواقع. ويستخدم علم فيزياء الجسيمات معيار " خمسة سيجما " لإعلان الاكتشاف. ويعني مستوى خمسة سيجما احتمالًا واحدًا من بين 3.5 مليون أن يؤدي تذبذب عشوائي إلى النتيجة. على سبيل المثال، كان هذا المستوى من اليقين مطلوبًا في تجربتين مستقلتين في فيزياء الجسيمات في مركز سيرن للإعلان عن اكتشاف بوزون هيغز ، [ 9 ] أو من قبل فريق ليغو العلمي لتأكيد وجود موجات الجاذبية بشكل قاطع . [ 10 ]

طقس

كمثال بسيط، لنفترض متوسط ​​درجات الحرارة العظمى اليومية لمدينتين، إحداهما داخلية والأخرى ساحلية. من المفيد أن نفهم أن نطاق درجات الحرارة العظمى اليومية في المدن الساحلية أصغر منه في المدن الداخلية. وبالتالي، فبينما قد تتساوى المدينتان في متوسط ​​درجة الحرارة العظمى، فإن الانحراف المعياري لدرجة الحرارة العظمى اليومية في المدينة الساحلية سيكون أقل من نظيره في المدينة الداخلية، لأنه في أي يوم محدد، من المرجح أن تكون درجة الحرارة العظمى الفعلية أبعد عن متوسط ​​درجة الحرارة العظمى في المدينة الداخلية مقارنةً بالمدينة الساحلية.

تمويل

في مجال التمويل، يُستخدم الانحراف المعياري غالبًا كمقياس للمخاطر المرتبطة بتقلبات أسعار أصل معين (الأسهم، السندات، العقارات، إلخ)، أو مخاطر محفظة أصول [ 11 ] (صناديق الاستثمار المشتركة المُدارة بنشاط، صناديق المؤشرات المشتركة، أو صناديق المؤشرات المتداولة). تُعدّ المخاطر عاملًا مهمًا في تحديد كيفية إدارة محفظة استثمارية بكفاءة، لأنها تُحدد التباين في عوائد الأصل أو المحفظة، وتُوفر للمستثمرين أساسًا رياضيًا لاتخاذ قراراتهم الاستثمارية (يُعرف بتحسين متوسط ​​التباين ). المفهوم الأساسي للمخاطر هو أنه كلما زادت، زاد العائد المتوقع على الاستثمار، وهي زيادة تُعرف بعلاوة المخاطرة. بعبارة أخرى، يتوقع المستثمرون عائدًا أعلى على الاستثمار عندما ينطوي هذا الاستثمار على مستوى أعلى من المخاطر أو عدم اليقين. عند تقييم الاستثمارات، ينبغي على المستثمرين تقدير كل من العائد المتوقع وعدم اليقين في العوائد المستقبلية. يوفر الانحراف المعياري تقديرًا كميًا لعدم اليقين في العوائد المستقبلية.

على سبيل المثال، لنفترض أن مستثمراً عليه الاختيار بين سهمين. حقق السهم (أ) خلال العشرين عاماً الماضية عائداً متوسطاً قدره 10%، بانحراف معياري قدره 20 نقطة مئوية . أما السهم (ب)، فحقق خلال الفترة نفسها عائداً متوسطاً قدره 12%، لكن بانحراف معياري أعلى قدره 30 نقطة مئوية. بناءً على موازنة المخاطر والعائد، قد يقرر المستثمر أن السهم (أ) هو الخيار الأكثر أماناً، لأن الزيادة الطفيفة في عائد السهم (ب) بنقطتين مئويتين لا تُبرر الانحراف المعياري الإضافي البالغ 10 نقاط مئوية (مخاطر أكبر أو عدم يقين بشأن العائد المتوقع). من المرجح أن يفشل السهم (ب) في تحقيق العائد المرجو (وأيضاً أن يتجاوزه) في كثير من الأحيان مقارنةً بالسهم (أ) في ظل الظروف نفسها، ويُقدر أن يحقق عائداً أعلى بنسبة 2% فقط في المتوسط. في هذا المثال، من المتوقع أن يحقق السهم (أ) عائداً بنسبة 10% تقريباً، بزيادة أو نقصان 20 نقطة مئوية (ضمن نطاق يتراوح بين 30% و-10%)، أي ما يقارب ثلثي عوائد السنوات القادمة. عند النظر في العوائد أو النتائج المحتملة الأكثر تطرفًا في المستقبل، يجب على المستثمر أن يتوقع نتائج تصل إلى 10 بالمائة زائد أو ناقص 60 نقطة مئوية، أو نطاق من 70 بالمائة إلى -50 بالمائة، وهو ما يشمل نتائج ثلاثة انحرافات معيارية عن متوسط ​​العائد (حوالي 99.7 بالمائة من العوائد المحتملة).

يُحسب متوسط ​​العائد (أو المتوسط ​​الحسابي) لعائد ورقة مالية خلال فترة زمنية محددة، مما يُنتج العائد المتوقع للأصل. في كل فترة، يُطرح العائد المتوقع من العائد الفعلي، فيكون الناتج هو الفرق عن المتوسط. بتربيع هذا الفرق في كل فترة، ثم حساب المتوسط، نحصل على التباين الكلي لعائد الأصل. كلما زاد التباين، زادت المخاطر التي تنطوي عليها الورقة المالية. يُحسب الانحراف المعياري للأداة الاستثمارية المعنية بإيجاد الجذر التربيعي لهذا التباين.

من المعروف أن السلاسل الزمنية المالية غير مستقرة، بينما تنطبق الحسابات الإحصائية المذكورة أعلاه، مثل الانحراف المعياري، على السلاسل المستقرة فقط. ولتطبيق هذه الأدوات الإحصائية على السلاسل غير المستقرة، يجب أولاً تحويل السلسلة إلى سلسلة مستقرة، مما يتيح استخدام الأدوات الإحصائية التي تستند إلى أساس متين.

التفسير الهندسي

للحصول على بعض الأفكار الهندسية والتوضيحات، سنبدأ بمجموعة من ثلاث قيم، x1 ، x2 ، x3 . تُعرّف هذه المجموعة نقطة P = ( x1 ، x2 ، x3 ) في الفضاء ثلاثي الأبعاد . لنعتبر الخط L = {( r1 ، r2  ، r3 ) : rR } . هذا هو "القطر الرئيسي" المار بنقطة الأصل. إذا كانت قيمنا الثلاث متساوية، فسيكون الانحراف المعياري صفرًا، وستقع النقطة P على الخط L. لذا ، من المنطقي افتراض أن الانحراف المعياري مرتبط بمسافة P عن L. وهذا هو الحال بالفعل. للانتقال عموديًا من L إلى النقطة P ، نبدأ من النقطة:

م=(x¯،x¯،x¯){\displaystyle M=\left({\bar {x}},{\bar {x}},{\bar {x}}\right)}

إحداثياتها هي متوسط ​​القيم التي بدأنا بها.

يُظهر القليل من الجبر أن المسافة بين P و M (وهي نفسها المسافة العمودية بين P والخط L )أنا(xأنا-x¯)2{\textstyle {\sqrt {\sum _{i}\left(x_{i}-{\bar {x}}\right)^{2}}}}يساوي الانحراف المعياري للمتجه ( x1 ، x2 ، x3 ) ، مضروبًا في الجذر التربيعي لعدد أبعاد المتجه (3 في هذه الحالة ) .

عدم المساواة عند تشيبيشيف

نادراً ما تتجاوز قيمة أي مشاهدة بضعة انحرافات معيارية عن المتوسط. تضمن متباينة تشيبيشيف أنه بالنسبة لجميع التوزيعات التي يُعرَّف لها الانحراف المعياري، فإن كمية البيانات ضمن عدد من الانحرافات المعيارية عن المتوسط ​​لا تقل عن الكمية الموضحة في الجدول التالي.

المسافة من المتوسطالحد الأدنى للسكان
2σ{\displaystyle {\sqrt {2}}\,\sigma }50%
2σ{\displaystyle 2\sigma }75%
3σ{\displaystyle 3\sigma }89%
4σ{\displaystyle 4\sigma }94%
5σ{\displaystyle 5\sigma }96%
6σ{\displaystyle 6\sigma }97%
كσ{\displaystyle k\sigma }1-1ك2{\displaystyle 1-{\frac {1}{k^{2}}}}[ 12 ]
11-σ{\displaystyle {\frac {1}{\sqrt {1-\ell }}}\,\sigma }{\displaystyle \ell }

قواعد البيانات الموزعة توزيعًا طبيعيًا

يمثل اللون الأزرق الداكن انحرافًا معياريًا واحدًا على جانبي المتوسط. في التوزيع الطبيعي، يمثل هذا 68.27% من المجموعة؛ بينما يمثل انحرافان معياريان عن المتوسط ​​(الأزرق المتوسط ​​والداكن) 95.45%؛ وثلاثة انحرافات معيارية (الأزرق الفاتح والمتوسط ​​والداكن) 99.73%؛ وأربعة انحرافات معيارية 99.994%. النقطتان على المنحنى اللتان تبعدان انحرافًا معياريًا واحدًا عن المتوسط ​​هما أيضًا نقطتا الانعطاف .

تنص نظرية النهاية المركزية على أن توزيع متوسط ​​العديد من المتغيرات العشوائية المستقلة والمتطابقة التوزيع يميل نحو التوزيع الطبيعي الشهير على شكل جرس، والذي تكون دالة كثافة احتماله

و(x،μ،σ2)=1σ2πهـ-12(x-μσ)2،{\displaystyle f\left(x,\mu ,\sigma ^{2}\right)={\frac {1}{\sigma {\sqrt {2\pi }}}}e^{-{\frac {1}{2}}\left({\frac {x-\mu }{\sigma }}\right)^{2}},}

حيث μ هي القيمة المتوقعة للمتغيرات العشوائية، و σ تساوي الانحراف المعياري لتوزيعها مقسومًا على n 1/2 ، و n هو عدد المتغيرات العشوائية. وبالتالي، فإن الانحراف المعياري هو ببساطة متغير قياس يُعدّل مدى اتساع المنحنى، على الرغم من أنه يظهر أيضًا في ثابت التوحيد .

إذا كان توزيع البيانات طبيعيًا تقريبًا، فإن نسبة قيم البيانات التي تقع ضمن z انحرافات معيارية عن المتوسط ​​تُحدد كما يلي:

حَجم=قطعة أرض(z2){\displaystyle {\text{Proportion}}=\operatorname {erf} \left({\frac {z}{\sqrt {2}}}\right)}

أينقطعة أرض{\displaystyle \textstyle \operatorname {erf} }هي دالة الخطأ . النسبة التي تقل عن أو تساوي عددًا ما، x ، تُعطى بواسطة دالة التوزيع التراكمي : [ 13 ]

حَجمx=12[1+قطعة أرض(x-μσ2)]=12[1+قطعة أرض(z2)].{\displaystyle {\text{Proportion}}\leq x={\frac {1}{2}}\left[1+\operatorname {erf} \left({\frac {x-\mu }{\sigma {\sqrt {2}}}}\right)\right]={\frac {1}{2}}\left[1+\operatorname {erf} \left({\frac {z}{\sqrt {2}}}\right)\right].}

إذا كان توزيع البيانات طبيعيًا تقريبًا، فإن حوالي 68% من قيم البيانات تقع ضمن انحراف معياري واحد عن المتوسط ​​(رياضيًا، μ ± σ ، حيث μ هو المتوسط ​​الحسابي)، وحوالي 95% تقع ضمن انحرافين معياريين ( μ ± 2 σ )، وحوالي 99.7% تقع ضمن ثلاثة انحرافات معيارية ( μ ± 3 σ ). يُعرف هذا بقاعدة 68-95-99.7 ، أو القاعدة التجريبية .

بالنسبة لقيم مختلفة لـ z ، فإن النسبة المئوية للقيم المتوقع أن تقع داخل وخارج الفترة المتناظرة، CI = (− z' σ , z' σ ) ، هي كما يلي:

النسبة المئوية ضمن ( z )
z (النسبة المئوية ضمن النطاق)

فاصل الثقةالنسبة داخلنسبة بدون
نسبة مئويةنسبة مئويةجزء
0.318 639 σ25%75%3 / 4
0.674 490 σ50 %50 %1  / 2
0.977 925 σ66.6667%33.3333%1  /  3
0.994 458 σ68%32%1  /  3.125
1 σ68.268 9492 %31.731 0508 %1  / 3.151 4872
1.281 552 σ80%20%1  /  5
1.644854 σ90%10%1  /  10
1.959964 σ95%5%1  /  20
95.449 9736 %4.550 0264 %1  / 21.977 895
2.575 829 σ99%1%1  /  100
3 سيجما99.730 0204 %0.269 9796 %1  /  370.398
3.290 527 σ99.9%0.1%1  / 1000
3.890 592 σ99.99%0.01%1  / 10000
4 سيجما99.993 666 %0.006 334 %1  / 15787
4.417 173 σ99.999%0.001%1  / 100000
4.5 σ99.999 320 465 3751%0.000 679 534 6249%1  / 147 159 .5358 6.8  / مليون
4.891 638 σ99.9999 %0.0001 %1  / مليون
5 سيجما99.999 942 6697 %0.000 057 3303 %1  / 1 744 278
5.326 724 σ99.999 99 %0.000 01 %1  / 10,000,000
5.730 729 σ99.999999 %0.000 001 %1  / 100,000,000
6 سيجما99.9999998027 %0.000 000 1973 %1  / 506 797 346
6.109 410 σ99.999 9999 %0.000 0001 %1  / 1,000,000,000
6.466 951 σ99.999 999 99 %0.000 000 01 %1  / 10,000,000,000
6.806 502 σ99.999 999 999 %0.000 000 001 %1  / 100,000,000,000
7 سيجما99.999 999 999 7440%0.000 000 000 256 %1  / 390 682 215 445

مصفوفة الانحراف المعياري

مصفوفة الانحراف المعياريS{\displaystyle \mathbf {S} }هو امتداد للانحراف المعياري إلى أبعاد متعددة. وهو الجذر التربيعي المتناظر لمصفوفة التغاير.Σ{\displaystyle \mathbf {\Sigma } }.

S{\displaystyle \mathbf {S} }يقوم بتوسيع نطاق متجه عشوائي خطيًا في أبعاد متعددة بنفس الطريقة التيσ{\displaystyle \sigma }يفعل ذلك في بُعد واحد. متغير عشوائي قياسيx{\displaystyle x}مع التباينσ2{\displaystyle \sigma ^{2}}يمكن كتابتها على النحو التاليx=σz{\displaystyle x=\sigma z}، أينz{\displaystyle z}له تباين يساوي واحدًا. وبالمثل، فإن المتجه العشوائيx{\displaystyle {\boldsymbol {x}}}في عدة أبعاد مع التغايرΣ{\displaystyle \mathbf {\Sigma } }يمكن كتابتها على النحو التاليx=Sz{\displaystyle {\boldsymbol {x}}=\mathbf {S} {\boldsymbol {z}}}، أينz{\displaystyle {\boldsymbol {z}}}متغير معياري ذو تباين متطابق1{\displaystyle \mathbf {1} }وهذا يتطلب أنSS=Σ{\displaystyle \mathbf {S} \mathbf {S'} =\mathbf {\Sigma } }ثم هناك عدد لا نهائي من الحلول لـS{\displaystyle \mathbf {S} }وبالتالي، توجد طرق متعددة لتبييض التوزيع. [ 14 ] الجذر التربيعي المتناظر لـΣ{\displaystyle \mathbf {\Sigma } }يُعد أحد الحلول.

على سبيل المثال، متجه طبيعي متعدد المتغيراتxشمال(μ،Σ){\displaystyle {\boldsymbol {x}}\sim N({\boldsymbol {\mu }},\mathbf {\Sigma } )}يمكن تعريفها على النحو التالي:x=Sz+μ{\displaystyle {\boldsymbol {x}}=\mathbf {S} {\boldsymbol {z}}+{\boldsymbol {\mu }}}، أينzشمال(0،1){\displaystyle {\boldsymbol {z}}\sim N({\boldsymbol {0}},\mathbf {1} )}هو التوزيع الطبيعي المعياري متعدد المتغيرات.

ملكيات

  • المتجهات الذاتية والقيم الذاتية لـS{\displaystyle \mathbf {S} }تتوافق هذه المحاور مع محاور القطع الناقص للخطأ ذي الانحراف المعياري الواحد للتوزيع الطبيعي متعدد المتغيرات. انظر: التوزيع الطبيعي متعدد المتغيرات: التفسير الهندسي .
    القطع الناقص للانحراف المعياري (باللون الأخضر) لتوزيع طبيعي ثنائي الأبعاد
  • الانحراف المعياري لإسقاط التوزيع متعدد المتغيرات (أي التوزيع الهامشي) على خط في اتجاه متجه الوحدةη^{\displaystyle {\hat {\boldsymbol {\eta }}}}يساويη^Ση^=Sη^{\displaystyle {\sqrt {{\hat {\boldsymbol {\eta }}}'\mathbf {\Sigma } {\hat {\boldsymbol {\eta }}}}}=\lVert \mathbf {S} {\hat {\boldsymbol {\eta }}}\rVert }.
  • الانحراف المعياري لشريحة من التوزيع متعدد المتغيرات (أي التوزيع الشرطي) على طول الخط في اتجاه متجه الوحدةη^{\displaystyle {\hat {\boldsymbol {\eta }}}}يساوي1S-1η^{\displaystyle {\frac {1}{\lVert \mathbf {S} ^{-1}{\hat {\boldsymbol {\eta }}}\rVert }}}.
  • مؤشر التمييز بين توزيعين متساويين في التباين هو مسافة ماهالانوبيس الخاصة بهما ، والتي يمكن التعبير عنها أيضًا بدلالة مصفوفة الانحراف المعياري:د=(μأ-μب)Σ-1(μأ-μب)=S-1د{\displaystyle d'={\sqrt {({\boldsymbol {\mu }}_{a}-{\boldsymbol {\mu }}_{b})'{\boldsymbol {\Sigma }}^{-1}({\boldsymbol {\mu }}_{a}-{\boldsymbol {\mu }}_{b})}}=\lVert \mathbf {S} ^{-1}{\boldsymbol {d}}\rVert }، أيند=μأ-μب{\displaystyle {\boldsymbol {d}}={\boldsymbol {\mu }}_{a}-{\boldsymbol {\mu }}_{b}}هو متجه متوسط ​​الفرق.
  • منذS{\displaystyle \mathbf {S} }عند تغيير مقياس المتغير المعياري، يمكن استخدامه لعكس التحويل، وجعله غير مرتبط وذو تباين موحد:z=S-1(x-μ){\displaystyle {\boldsymbol {z}}=\mathbf {S} ^{-1}({\boldsymbol {x}}-{\boldsymbol {\mu }})}له متوسط ​​صفري وتغاير متطابق. وهذا ما يسمى بتحويل ماهالانوبيس للتبييض .

العلاقة بين الانحراف المعياري والمتوسط

المتوسط ​​والانحراف المعياري لمجموعة بيانات هما من الإحصاءات الوصفية التي تُذكر عادةً معًا. بمعنى ما، يُعد الانحراف المعياري مقياسًا "طبيعيًا" للتشتت الإحصائي إذا تم قياس مركز البيانات حول المتوسط. وذلك لأن الانحراف المعياري عن المتوسط ​​أصغر من الانحراف المعياري عن أي نقطة أخرى. والصيغة الدقيقة هي كالتالي: لنفترض أن x₁ , ..., xₙ أعداد حقيقية ، ولنُعرّف الدالة:

σ(ر)=1شمال-1أنا=1شمال(xأنا-ر)2.{\displaystyle \sigma (r)={\sqrt {{\frac {1}{N-1}}\sum _{i=1}^{N}\left(x_{i}-r\right)^{2}}}.}

باستخدام حساب التفاضل والتكامل أو بإكمال المربع ، من الممكن إثبات أن σ ( r ) لها قيمة دنيا فريدة عند المتوسط:

ر=x¯.{\displaystyle r={\bar {x}}.\,}

يمكن قياس التباين أيضاً بمعامل التباين ، وهو نسبة الانحراف المعياري إلى المتوسط. وهو رقم بلا أبعاد .

الانحراف المعياري للمتوسط

في كثير من الأحيان، نرغب في الحصول على معلومات حول دقة المتوسط ​​الذي حصلنا عليه. ويمكننا الحصول على ذلك بتحديد الانحراف المعياري للمتوسط ​​المأخوذ من العينة. وبافتراض الاستقلال الإحصائي للقيم في العينة، فإن الانحراف المعياري للمتوسط ​​( SDOM ) يرتبط بالانحراف المعياري للتوزيع بالعلاقة التالية:

σيقصد=1شمالσ،{\displaystyle \sigma _{\text{mean}}={\frac {1}{\sqrt {N}}}\sigma ,}

حيث N هو عدد المشاهدات في العينة المستخدمة لتقدير المتوسط. ويمكن إثبات ذلك بسهولة باستخدام (انظر الخصائص الأساسية للتباين ): متغير(X)=σX2متغير(X1+X2)=متغير(X1)+متغير(X2){\displaystyle {\begin{aligned}\operatorname {var} (X)&=\sigma _{X}^{2}\\\operatorname {var} (X_{1}+X_{2})&=\operatorname {var} (X_{1})+\operatorname {var} (X_{2})\\\end{aligned}}} (يفترض الاستقلال الإحصائي.) متغير(جX1)ج2متغير(X1){\displaystyle \operatorname {var} (cX_{1})\equiv c^{2}\,\operatorname {var} (X_{1})}

لذلك متغير(يقصد)=متغير(1شمالأنا=1شمالXأنا)=1شمال2متغير(أنا=1شمالXأنا)=1شمال2أنا=1شمالمتغير(Xأنا)=شمالشمال2متغير(X)=1شمالمتغير(X).{\displaystyle {\begin{aligned}\operatorname {var} ({\text{mean}})&=\operatorname {var} \left({\frac {1}{N}}\sum _{i=1}^{N}X_{i}\right)={\frac {1}{N^{2}}}\operatorname {var} \left(\sum _{i=1}^{N}X_{i}\right)\\&={\frac {1}{N^{2}}}\sum _{i=1}^{N}\operatorname {var} (X_{i})={\frac {N}{N^{2}}}\operatorname {var} (X)={\frac {1}{N}}\operatorname {var} (X).\end{aligned}}}

مما أدى إلى: σيقصد=σشمال.{\displaystyle \sigma _{\text{mean}}={\frac {\sigma }{\sqrt {N}}}.}

لتقدير الانحراف المعياري للمتوسط ​​(σ mean)، من الضروري معرفة الانحراف المعياري للمجتمع الإحصائي بأكمله (σ) مسبقًا. مع ذلك، في معظم التطبيقات، يكون هذا المعيار غير معروف. على سبيل المثال، إذا أُجريت سلسلة من 10 قياسات لكمية غير معروفة مسبقًا في مختبر، فمن الممكن حساب متوسط ​​العينة وانحرافها المعياري، لكن من المستحيل حساب الانحراف المعياري للمتوسط. مع ذلك، يمكن تقدير الانحراف المعياري للمجتمع الإحصائي بأكمله من العينة، وبالتالي الحصول على تقدير للخطأ المعياري للمتوسط.

طرق الحساب السريع

يمكن للصيغتين التاليتين تمثيل الانحراف المعياري المتغير ( الذي يتم تحديثه بشكل متكرر). يتم حساب مجموعتين من القوى s1 و s2 على مجموعة من N قيمة لـ x ، ويرمز لها بـ x1 ، ... ، xN :

sج=ك=1شمالxكج.{\displaystyle s_{j}=\sum _{k=1}^{N}{x_{k}^{j}}.}

بالنظر إلى نتائج عمليات الجمع التراكمي هذه، يمكن استخدام القيم N و s1 و s2 في أي وقت لحساب القيمة الحالية للانحراف المعياري التراكمي:

σ=شمالs2-(s1)2شمال.{\displaystyle \sigma ={\frac {\sqrt {Ns_{2}-(s_{1})^{2}}}{N}}.}

حيث N ، كما ذكر أعلاه، هو حجم مجموعة القيم (أو يمكن اعتباره أيضًا s 0 ).

وبالمثل بالنسبة للانحراف المعياري للعينة،

s=شمالs2-(s1)2شمال(شمال-1).{\displaystyle s={\sqrt {\frac {Ns_{2}-(s_{1})^{2}}{N(N-1)}}}.}

في التطبيقات الحاسوبية، عندما يصبح مجموعا s و j كبيرين، يجب مراعاة أخطاء التقريب ، وتجاوزات ونقص البيانات الحسابية . تحسب الطريقة الموضحة أدناه طريقة المجاميع التراكمية مع تقليل أخطاء التقريب. [ 15 ] هذه خوارزمية "تمريرة واحدة" لحساب تباين n عينة دون الحاجة إلى تخزين البيانات السابقة أثناء الحساب. سيؤدي تطبيق هذه الطريقة على سلسلة زمنية إلى قيم متتالية للانحراف المعياري تتوافق مع n نقطة بيانات، حيث يزداد n مع كل عينة جديدة، بدلاً من حساب نافذة منزلقة ذات عرض ثابت.

لـ k = 1، ...، n :

أ0=0أك=أك-1+xك-أك-1ك{\displaystyle {\begin{aligned}A_{0}&=0\\A_{k}&=A_{k-1}+{\frac {x_{k}-A_{k-1}}{k}}\end{aligned}}}

حيث A هي القيمة المتوسطة. سؤال0=0سؤالك=سؤالك-1+ك-1ك(xك-أك-1)2=سؤالك-1+(xك-أك-1)(xك-أك){\displaystyle {\begin{aligned}Q_{0}&=0\\Q_{k}&=Q_{k-1}+{\frac {k-1}{k}}\left(x_{k}-A_{k-1}\right)^{2}\\&=Q_{k-1}+\left(x_{k}-A_{k-1}\right)\left(x_{k}-A_{k}\right)\end{aligned}}}

ملاحظة: Q 1 = 0 لأن k 1 = 0 أو x 1 = A 1 .

تباين العينة: sن2=سؤالنن-1{\displaystyle s_{n}^{2}={\frac {Q_{n}}{n-1}}}

تباين السكان: σن2=سؤالنن{\displaystyle \sigma _{n}^{2}={\frac {Q_{n}}{n}}}

الحساب المرجح

عندما تكون القيمxك{\displaystyle x_{k}}يتم ترجيحها بأوزان غير متساويةwك{\displaystyle w_{k}}يتم حساب مجموع القوى s 0 و s 1 و s 2 على النحو التالي:

sج=ك=1شمالwكxكج.{\displaystyle s_{j}=\sum _{k=1}^{N}w_{k}x_{k}^{j}.\,}

وتبقى معادلات الانحراف المعياري دون تغيير. s 0 الآن هو مجموع الأوزان وليس عدد العينات N.

يمكن أيضًا تطبيق الطريقة التزايدية مع تقليل أخطاء التقريب، مع بعض التعقيد الإضافي.

يجب حساب مجموع الأوزان لكل قيمة k من 1 إلى n : دبليو0=0دبليوك=دبليوك-1+wك{\displaystyle {\begin{aligned}W_{0}&=0\\W_{k}&=W_{k-1}+w_{k}\end{aligned}}}

ويجب استبدال المواضع التي تم فيها استخدام 1/ k أعلاه بـwك/دبليوك{\displaystyle w_{k}/W_{k}}: أ0=0أك=أك-1+wكدبليوك(xك-أك-1)سؤال0=0سؤالك=سؤالك-1+wكدبليوك-1دبليوك(xك-أك-1)2=سؤالك-1+wك(xك-أك-1)(xك-أك){\displaystyle {\begin{aligned}A_{0}&=0\\A_{k}&=A_{k-1}+{\frac {w_{k}}{W_{k}}}\left(x_{k}-A_{k-1}\right)\\Q_{0}&=0\\Q_{k}&=Q_{k-1}+{\frac {w_{k}W_{k-1}}{W_{k}}}\left(x_{k}-A_{k-1}\right)^{2}\\&=Q_{k-1}+w_{k}\left(x_{k}-A_{k-1}\right)\left(x_{k}-A_{k}\right)\end{aligned}}}

في القسم الأخير، σن2=سؤالندبليون{\displaystyle \sigma _{n}^{2}={\frac {Q_{n}}{W_{n}}}\,}

و sن2=سؤالندبليون-1،{\displaystyle s_{n}^{2}={\frac {Q_{n}}{W_{n}-1}},}

أو sن2=نن-1σن2،{\displaystyle s_{n}^{2}={\frac {n'}{n'-1}}\sigma _{n}^{2},}

حيث n هو العدد الإجمالي للعناصر، و n هو عدد العناصر ذات الأوزان غير الصفرية.

تصبح الصيغ المذكورة أعلاه مساوية للصيغ الأبسط المذكورة أعلاه إذا تم اعتبار الأوزان مساوية للواحد.

تاريخ

استُخدم مصطلح الانحراف المعياري لأول مرة في كتابات كارل بيرسون عام 1894، بعد استخدامه في محاضراته. [ 16 ] [ 17 ] وكان ذلك بديلاً عن الأسماء البديلة السابقة لنفس الفكرة: على سبيل المثال، استخدم غاوس مصطلح متوسط ​​الخطأ . [ 18 ]

مؤشر الانحراف المعياري

يُستخدم مؤشر الانحراف المعياري (SDI) في تقييمات الجودة الخارجية ، وخاصة للمختبرات الطبية . ويتم حسابه على النحو التالي: [ 19 ]مبادرة الدفاع المكاني=متوسط ​​المختبر-متوسط ​​مجموعة الإجماعالانحراف المعياري لمجموعة الإجماع.{\displaystyle {\text{SDI}}={\frac {{\text{Laboratory mean}}-{\text{Consensus group mean}}}{\text{Consensus group standard deviation}}}.}

البدائل

الانحراف المعياري أبسط جبرياً ، وإن كان أقل دقة عملياً ، من متوسط ​​الانحراف المطلق . [ 20 ] [ 21 ]

انظر أيضاً

مراجع

  1. بلاند، جيه إم؛ ألتمان، دي جي (1996). " ملاحظات إحصائية: خطأ القياس" . المجلة الطبية البريطانية . 312 (7047): 1654. doi : 10.1136/bmj.312.7047.1654 . PMC 2351401. PMID 8664723 .  
  2. بيانات مرجعية أنثروبومترية للأطفال والبالغين: الولايات المتحدة، 2015-2018 (ملف PDF) ، المركز الوطني للإحصاءات الصحية: الإحصاءات الحيوية والصحية، المجلد 3، مراكز السيطرة على الأمراض والوقاية منها، يناير 2021، صفحة 16، الجدول 12  
  3. وايسشتاين، إريك و. "الانحراف المعياري" . mathworld.wolfram.com . تم الاطلاع عليه بتاريخ 21 أغسطس 2020 .
  4. "المُقدِّر المتسق" . www.statlect.com . تم الاطلاع عليه بتاريخ 10 أكتوبر 2022 .
  5. غورلاند، جون؛ تريباثي، رام سي. (1971)، "تقريب بسيط لتقدير غير متحيز للانحراف المعياري"، الإحصائي الأمريكي ، 25 (4): 30-32 ، doi : 10.2307/2682923 ، JSTOR 2682923 
  6. "حاسبة الانحراف المعياري" . PureCalculators . 11 يوليو 2021. تم الاطلاع عليه بتاريخ 14 سبتمبر 2021 .
  7. شيفلر، رونالد إي.؛ هارشا، فيليب د. (1980). "الحدود العليا والدنيا للانحراف المعياري للعينة". تدريس الإحصاء . 2 (3): 84-86 . doi : 10.1111/j.1467-9639.1980.tb00398.x .
  8. براون، ريتشارد هـ. (2001). "استخدام نطاق العينة كأساس لحساب حجم العينة في حسابات القوة الإحصائية". الإحصائي الأمريكي . 55 (4): 293-298 . doi : 10.1198/000313001753272420 . JSTOR 2685690. S2CID 122328846 .  
  9. «تجارب سيرن ترصد جسيمًا يتوافق مع بوزون هيغز الذي طال انتظاره | المكتب الصحفي لسيرن» . Press.web.cern.ch. 4 يوليو 2012. مؤرشف من الأصل في 25 مارس 2016. تم الاطلاع عليه في 30 مايو 2015 .
  10. تعاون ليغو العلمي، تعاون فيرجو (2016)، "رصد موجات الجاذبية الناتجة عن اندماج ثقبين أسودين"، رسائل المراجعة الفيزيائية ، 116 (6) 061102، arXiv : 1602.03837 ، Bibcode : 2016PhRvL.116f1102A ، doi : 10.1103/PhysRevLett.116.061102 ، PMID 26918975 ، S2CID 124959784  
  11. "ما هو الانحراف المعياري؟" . بريستين . تم الاطلاع عليه بتاريخ 29 أكتوبر 2011 .
  12. غهراماني، سعيد (2000). أساسيات الاحتمالات ( الطبعة الثانية). نيوجيرسي: برنتيس هول. ص 438. ISBN   9780130113290.
  13. إريك و. وايسشتاين. "دالة التوزيع" . ماث وورلد . وولفرام . تم الاسترجاع في 30 سبتمبر 2014 .
  14. كيسي، أ.؛ ليوين، أ.؛ ستريمر، ك. (2018). "التبييض الأمثل وإزالة الارتباط". الإحصائي الأمريكي . 72 (4): 309-314 . arXiv : 1512.00809 . doi : 10.1080/00031305.2016.1277159 . S2CID 55075085 . 
  15. ويلفورد، بي بي (أغسطس 1962). "ملاحظة حول طريقة لحساب المجاميع المصححة للمربعات والمنتجات". تكنومتركس . 4 (3): 419-420 . CiteSeerX 10.1.1.302.7503 . doi : 10.1080/00401706.1962.10490022 . 
  16. دودج، يادولاه (2003). قاموس أكسفورد للمصطلحات الإحصائية . مطبعة جامعة أكسفورد. ISBN 978-0-19-920613-1.
  17. بيرسون، كارل (1894). "حول تحليل منحنيات التردد غير المتناظرة" . المعاملات الفلسفية للجمعية الملكية أ . 185 : 71-110 . Bibcode : 1894RSPTA.185...71P . doi : 10.1098/rsta.1894.0003 .
  18. ميلر، جيف. "أقدم الاستخدامات المعروفة لبعض كلمات الرياضيات" .
  19. هار، روبرت ر. (2012). مراجعة علوم المختبرات الطبية . فيلادلفيا: شركة إف إيه ديفيس. ص 236. ISBN  978-0-8036-3796-2. OCLC 818846942 . 
  20. ^ غاوس، كارل فريدريش (1816). "Bestimmung der Genauigkeit der Beobachtungen". Zeitschrift für Astronomie und Verwandte Wissenschaften . 1 : 187 - 197.
  21. ووكر، هيلين (1931). دراسات في تاريخ المنهج الإحصائي . بالتيمور، ماريلاند: شركة ويليامز وويلكنز. ص 24-25 .