الانحدار الخطي البسيط

يُعد قانون أوكون في الاقتصاد الكلي مثالاً على الانحدار الخطي البسيط. حيث يُفترض أن المتغير التابع (نمو الناتج المحلي الإجمالي) يرتبط خطياً بالتغيرات في معدل البطالة.

في الإحصاء ، يُعدّ الانحدار الخطي البسيط ( SLR ) نموذج انحدار خطي بمتغير تفسيري واحد . [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] أي أنه يتعامل مع نقاط عينة ثنائية الأبعاد بمتغير مستقل واحد ومتغير تابع واحد (عادةً ما يكونان إحداثيات س و ص في نظام إحداثيات ديكارتية )، ويجد دالة خطية ( خط مستقيم غير رأسي ) تتنبأ، بأكبر قدر ممكن من الدقة، بقيم المتغير التابع كدالة للمتغير المستقل. تشير صفة " بسيط" إلى أن المتغير التابع مرتبط بمتغير تنبؤي واحد.

من الشائع اشتراط استخدام طريقة المربعات الصغرى العادية (OLS): تُقاس دقة كل قيمة متوقعة بمربع الباقي (المسافة الرأسية بين نقطة البيانات والخط المُطابق)، والهدف هو تقليل مجموع مربعات هذه الانحرافات قدر الإمكان. في هذه الحالة، يساوي ميل الخط المُطابق معامل الارتباط بين y و x مُصححًا بنسبة الانحرافات المعيارية لهاتين المتغيرتين. أما نقطة تقاطع الخط المُطابق مع المحور الرأسي فهي التي تمر بمركز كتلة نقاط البيانات ( x , y ) .

الصياغة والحساب

ضع في اعتبارك دالة النموذجy=α+βx،{\displaystyle y=\alpha +\beta x,} يصف هذا خطًا مستقيمًا ميله β ومقطعه مع المحور الصادي α . عمومًا، قد لا تنطبق هذه العلاقة بدقة على مجموعة القيم غير المرصودة للمتغيرات المستقلة والتابعة؛ ونُطلق على الانحرافات غير المرصودة عن المعادلة أعلاه اسم الأخطاء . لنفترض أننا رصدنا n زوجًا من البيانات، ونُسميها {( xi , yi ) , i = 1, ..., n }. يمكننا وصف العلاقة الأساسية بين yi و xi ، والتي تتضمن حد الخطأ εi ، كما يلي :

yأنا=α+βxأنا+εأنا.{\displaystyle y_{i}=\alpha +\beta x_{i}+\varepsilon _{i}.}

تُسمى هذه العلاقة بين المعلمات الأساسية الحقيقية (ولكن غير المرصودة) α و β ونقاط البيانات بنموذج الانحدار الخطي.

الهدف هو إيجاد القيم المقدرةα^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}بالنسبة للمعاملين α و β اللذين يوفران أفضل تطابق ممكن لنقاط البيانات. وكما ذُكر في المقدمة، يُفهم مصطلح "أفضل تطابق" في هذه المقالة على أنه في طريقة المربعات الصغرى : خط يقلل مجموع مربعات البواقي (انظر أيضًا الأخطاء والبواقي ).ε^أنا{\displaystyle {\widehat {\varepsilon }}_{i}}(الفروق بين القيم الفعلية والمتوقعة للمتغير التابع y )، والتي يُعطى كل منها بواسطة، لأي قيم مرشحة للمعلماتα{\displaystyle \alpha }وβ{\displaystyle \beta }،

ε^أنا=yأنا-α-βxأنا.{\displaystyle {\widehat {\varepsilon }}_{i}=y_{i}-\alpha -\beta x_{i}.}

بعبارة أخرى،α^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}حل مسألة التصغير التالية :

(α^،β^)=أرجينين(سؤال(α،β))،{\displaystyle ({\hat {\alpha }},\,{\hat {\beta }})=\operatorname {argmin} \left(Q(\alpha ,\beta )\right),} حيث تكون دالة الهدف Q هي: سؤال(α،β)=أنا=1نε^أنا2=أنا=1ن(yأنا-α-βxأنا)2 .{\displaystyle Q(\alpha ,\beta )=\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}=\sum _{i=1}^{n}(y_{i}-\alpha -\beta x_{i})^{2}\ .}

عن طريق التوسع للحصول على تعبير تربيعي فيα{\displaystyle \alpha }وβ،{\displaystyle \beta ,}يمكننا استنتاج القيم الدنيا لوسائط الدالة، المشار إليها بـα^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}[ 6 ]

α^=y¯-β^x¯،β^=أنا=1ن(xأنا-x¯)(yأنا-y¯)أنا=1ن(xأنا-x¯)2=أنا=1نΔxأناΔyأناأنا=1نΔxأنا2{\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\bar {y}}-{\widehat {\beta }}\,{\bar {x}},\\[5pt]{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)\left(y_{i}-{\bar {y}}\right)}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}={\frac {\sum _{i=1}^{n}\Delta x_{i}\Delta y_{i}}{\sum _{i=1}^{n}\Delta x_{i}^{2}}}\end{aligned}}}

هنا قدمنا

  • x¯{\displaystyle {\bar {x}}}وy¯{\displaystyle {\bar {y}}}باعتباره متوسط ​​قيمتي xᵢ و yᵢ على التوالي
  • Δxأنا{\displaystyle \Delta x_{i}}وΔyأنا{\displaystyle \Delta y_{i}}باعتبارها الانحرافات في x i و y i بالنسبة إلى متوسطاتها الخاصة.

الصيغ الموسعة

تكون المعادلات المذكورة أعلاه فعالة للاستخدام إذا كان متوسط ​​المتغيرين x و y (x¯ و y¯{\displaystyle {\bar {x}}{\text{ and }}{\bar {y}}}إذا كانت الوسائل معروفة، فقد يكون من الأفضل استخدام النسخة الموسعة منα^ و β^{\displaystyle {\widehat {\alpha }}{\text{ and }}{\widehat {\beta }}}المعادلات. يمكن اشتقاق هذه المعادلات الموسعة من معادلات الانحدار متعددة الحدود الأكثر عمومية [ 7 ] [ 8 ] عن طريق تعريف متعددة حدود الانحدار بأنها من الدرجة 1، كما يلي.

[نأنا=1نxأناأنا=1نxأناأنا=1نxأنا2][α^β^]=[أنا=1نyأناأنا=1نyأناxأنا]{\displaystyle {\begin{bmatrix}n&\sum _{i=1}^{n}x_{i}\\[1ex]\sum _{i=1}^{n}x_{i}&\sum _{i=1}^{n}x_{i}^{2}\end{bmatrix}}{\begin{bmatrix}{\widehat {\alpha }}\\[1ex]{\widehat {\beta }}\end{bmatrix}}={\begin{bmatrix}\sum _{i=1}^{n}y_{i}\\[1ex]\sum _{i=1}^{n}y_{i}x_{i}\end{bmatrix}}}

يمكن حل نظام المعادلات الخطية المذكور أعلاه مباشرة، أو باستخدام معادلات مستقلة لـα^ و β^{\displaystyle {\widehat {\alpha }}{\text{ and }}{\widehat {\beta }}}يمكن اشتقاقها بتوسيع معادلات المصفوفة أعلاه. المعادلات الناتجة مكافئة جبريًا لتلك الموضحة في الفقرة السابقة، وهي معروضة أدناه دون برهان. [ 9 ] [ 7 ]

α^=أنا=1نyأناأنا=1نxأنا2-أنا=1نxأناأنا=1نxأناyأنانأنا=1نxأنا2-(أنا=1نxأنا)2β^=نأنا=1نxأناyأنا-أنا=1نxأناأنا=1نyأنانأنا=1نxأنا2-(أنا=1نxأنا)2{\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\frac {\sum \limits _{i=1}^{n}y_{i}\sum \limits _{i=1}^{n}x_{i}^{2}-\sum \limits _{i=1}^{n}x_{i}\sum \limits _{i=1}^{n}x_{i}y_{i}}{n\sum \limits _{i=1}^{n}x_{i}^{2}-\left(\sum \limits _{i=1}^{n}x_{i}\right)^{2}}}\\[2ex]{\widehat {\beta }}&={\frac {n\sum \limits _{i=1}^{n}x_{i}y_{i}-\sum \limits _{i=1}^{n}x_{i}\sum \limits _{i=1}^{n}y_{i}}{n\sum \limits _{i=1}^{n}x_{i}^{2}-\left(\sum \limits _{i=1}^{n}x_{i}\right)^{2}}}\end{aligned}}}

تفسير

العلاقة مع مصفوفة التغاير العيني

يمكن إعادة صياغة الحل باستخدام عناصر مصفوفة التغاير : β^=sx،ysx2=رxysysx{\displaystyle {\widehat {\beta }}={\frac {s_{x,y}}{s_{x}^{2}}}=r_{xy}{\frac {s_{y}}{s_{x}}}}

أين

باستبدال التعبيرات المذكورة أعلاه بـα^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}يؤدي إدخالها في الحل الأصلي إلى

y-y¯sy=رxyx-x¯sx.{\displaystyle {\frac {y-{\bar {y}}}{s_{y}}}=r_{xy}{\frac {x-{\bar {x}}}{s_{x}}}.}

هذا يُظهر أن r xy هو ميل خط الانحدار لنقاط البيانات المعيارية (وأن هذا الخط يمر بنقطة الأصل). بما أن-1رxy1{\displaystyle -1\leq r_{xy}\leq 1}إذن، نستنتج أنه إذا كان x قياسًا ما، وy قياسًا لاحقًا لنفس العنصر، فإننا نتوقع أن يكون y (في المتوسط) أقرب إلى متوسط ​​القياس مما كان عليه بالنسبة للقيمة الأصلية لـ x. تُعرف هذه الظاهرة باسم الانحدار نحو المتوسط .

تعميمx¯{\displaystyle {\bar {x}}}باستخدام الترميز، يمكننا كتابة خط أفقي فوق تعبير ما للإشارة إلى متوسط ​​قيمة ذلك التعبير على مجموعة العينات. على سبيل المثال:

xy¯=1نأنا=1نxأناyأنا.{\displaystyle {\overline {xy}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}y_{i}.}

تتيح لنا هذه الصيغة المختصرة كتابة معادلة لـ r xy :

رxy=xy¯-x¯y¯(x2¯-x¯2)(y2¯-y¯2).{\displaystyle r_{xy}={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}}{\sqrt {\left({\overline {x^{2}}}-{\bar {x}}^{2}\right)\left({\overline {y^{2}}}-{\bar {y}}^{2}\right)}}}.}

معامل التحديد ("R²") يساويرxy2{\displaystyle r_{xy}^{2}}عندما يكون النموذج خطيًا بمتغير مستقل واحد. انظر معامل الارتباط العيني لمزيد من التفاصيل.

تفسير حول المنحدر

بضرب جميع عناصر المجموع في البسط في  :xأنا-x¯xأنا-x¯=1{\displaystyle {\frac {x_{i}-{\bar {x}}}{x_{i}-{\bar {x}}}}=1}(وبذلك لا يتم تغييره):

β^=أنا=1ن(xأنا-x¯)(yأنا-y¯)أنا=1ن(xأنا-x¯)2=أنا=1ن(xأنا-x¯)2yأنا-y¯xأنا-x¯أنا=1ن(xأنا-x¯)2=أنا=1ن(xأنا-x¯)2ج=1ن(xج-x¯)2yأنا-y¯xأنا-x¯{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)\left(y_{i}-{\bar {y}}\right)}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}\\[1ex]&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}{\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}\\[1ex]&=\sum _{i=1}^{n}{\frac {\left(x_{i}-{\bar {x}}\right)^{2}}{\sum _{j=1}^{n}\left(x_{j}-{\bar {x}}\right)^{2}}}{\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}\\[6pt]\end{aligned}}}

يمكننا أن نرى أن ميل (ظل الزاوية) خط الانحدار هو المتوسط ​​المرجح لـyأنا-y¯xأنا-x¯{\displaystyle {\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}}أي ميل (ظل الزاوية) الخط الذي يربط النقطة رقم i بمتوسط ​​جميع النقاط، مرجحًا بـ(xأنا-x¯)2{\displaystyle (x_{i}-{\bar {x}})^{2}}لأن كلما كانت النقطة أبعد زادت "أهميتها"، حيث أن الأخطاء الصغيرة في موقعها ستؤثر بشكل أكبر على الميل الذي يربطها بالنقطة المركزية.

تفسير حول نقطة التقاطع

المعلمةα^{\displaystyle {\widehat {\alpha }}}هو نقطة تقاطع الدالة الخطيةy=α^ +β^x،{\displaystyle {\begin{aligned}{y}&={\widehat {\alpha }}\ +{\widehat {\beta }}\,{x},\\[5pt]\end{aligned}}}لذلك، فإنy{\displaystyle {y}}نقطة تقاطع الدالة التي تم الحصول عليها باستخدام الانحدار الخطي البسيط هي

yأنانتهـرجهـصت=α^=y¯-β^x¯{\displaystyle y_{\rm {intercept}}={\widehat {\alpha }}={\bar {y}}-{\widehat {\beta }}\,{\bar {x}}}.

لأنβ^{\displaystyle {\widehat {\beta }}}هو ميل الدالة الخطية،β^=لون برونزي(θ){\displaystyle {\widehat {\beta }}=\tan(\theta )}لذلك، الزاويةθ{\displaystyle \theta }الرسم البياني للدالة يصنع معx{\displaystyle {x}}المحور يساوي

θ=دالة الظل العكسي(β^){\displaystyle \theta =\arctan({\widehat {\beta }})}.

تفسير العلاقة

في الصيغة أعلاه، لاحظ أن كلxأنا{\displaystyle x_{i}}هي قيمة ثابتة ("معروفة مسبقاً")، بينماyأنا{\displaystyle y_{i}}هي متغيرات عشوائية تعتمد على الدالة الخطية لـxأنا{\displaystyle x_{i}}والحد العشوائيεأنا{\displaystyle \varepsilon _{i}}. يتم استخدام هذا الافتراض عند اشتقاق الخطأ المعياري للميل وإثبات أنه غير متحيز .

في هذا الإطار، عندماxأنا{\displaystyle x_{i}}إذا لم يكن متغيرًا عشوائيًا في الواقع ، فما نوع المعلمة التي يمثلها الارتباط التجريبي؟رxy{\displaystyle r_{xy}}التقدير؟ المشكلة هي أنه لكل قيمة i سيكون لدينا:هـ(xأنا)=xأنا{\displaystyle E(x_{i})=x_{i}}وVأر(xأنا)=0{\displaystyle Var(x_{i})=0}تفسير محتمل لـرxy{\displaystyle r_{xy}}هو أن نتخيل ذلكxأنا{\displaystyle x_{i}}يُعرّف متغيرًا عشوائيًا مُستمدًا من التوزيع التجريبي لقيم x في عيّنتنا. على سبيل المثال، إذا كانت x تحتوي على 10 قيم من الأعداد الطبيعية : [1، 2، 3، ...، 10]، فيمكننا حينها اعتبار x توزيعًا منتظمًا منفصلًا . وبناءً على هذا التفسير، فإن جميعxأنا{\displaystyle x_{i}}لدينا نفس التوقع وبعض التباين الإيجابي. بناءً على هذا التفسير، يمكننا التفكير فيرxy{\displaystyle r_{xy}}باعتباره مقدرًا لمعامل ارتباط بيرسون بين المتغير العشوائي y والمتغير العشوائي x (كما عرفناه للتو).

الخصائص العددية

  1. يمر خط الانحدار عبر نقطة مركز الكتلة ،(x¯،y¯){\displaystyle ({\bar {x}},\,{\bar {y}})}، إذا كان النموذج يتضمن حدًا ثابتًا (أي، لا يتم فرضه من خلال نقطة الأصل).
  2. يكون مجموع البواقي صفراً إذا كان النموذج يتضمن حداً ثابتاً: أنا=1نε^أنا=0.{\displaystyle \sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}=0.}
  3. لا توجد علاقة بين البواقي وقيم x (سواء كان هناك حد ثابت في النموذج أم لا)، وهذا يعني: أنا=1نxأناε^أنا=0{\displaystyle \sum _{i=1}^{n}x_{i}{\widehat {\varepsilon }}_{i}\;=\;0}
  4. العلاقة بينρxy{\displaystyle \rho _{xy}}( معامل الارتباط للسكان ) وتباينات السكانy{\displaystyle y}(σy2{\displaystyle \sigma _{y}^{2}}) وحد الخطأ لـε{\displaystyle \varepsilon }(σε2{\displaystyle \sigma _{\varepsilon }^{2}}) هو: [ 10 ] : 401σε2=(1-ρxy2)σy2{\displaystyle \sigma _{\varepsilon }^{2}=(1-\rho _{xy}^{2})\sigma _{y}^{2}} بالنسبة للقيم القصوى لـρxy{\displaystyle \rho _{xy}}هذا أمر بديهي. منذ متى؟ρxy=0{\displaystyle \rho _{xy}=0}ثمσε2=σy2{\displaystyle \sigma _{\varepsilon }^{2}=\sigma _{y}^{2}}وعندماρxy=1{\displaystyle \rho _{xy}=1}ثمσε2=0{\displaystyle \sigma _{\varepsilon }^{2}=0}.

الخصائص الإحصائية

يتطلب وصف الخصائص الإحصائية للمُقدِّرات المُستمدة من تقديرات الانحدار الخطي البسيط استخدام نموذج إحصائي . ويستند ما يلي إلى افتراض صحة نموذج تكون فيه التقديرات مثالية. ومن الممكن أيضًا تقييم الخصائص في ظل افتراضات أخرى، مثل عدم التجانس ، ولكن هذا الأمر يُناقش في موضع آخر.

الحياد

المقدرونα^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}غير متحيزين .

لإضفاء الطابع الرسمي على هذا الادعاء ، يجب علينا تحديد إطار عمل تكون فيه هذه المُقدِّرات متغيرات عشوائية. نعتبر البواقي εᵢ متغيرات عشوائية مُستقاة بشكل مستقل من توزيع ما بمتوسط ​​صفر. بعبارة أخرى، لكل قيمة من قيم x ، يتم توليد القيمة المقابلة لـ y كمتوسط ​​استجابة α + βx بالإضافة إلى متغير عشوائي إضافي ε يُسمى حد الخطأ ، ويساوي صفرًا في المتوسط. وفقًا لهذا التفسير، فإن مُقدِّرات المربعات الصغرىα^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}ستكون هذه المتغيرات نفسها متغيرات عشوائية، وستكون متوسطاتها مساوية للقيم الحقيقية α و β . هذا هو تعريف المقدر غير المتحيز.

تباين متوسط ​​الاستجابة

بما أن البيانات في هذا السياق تُعرَّف على أنها أزواج ( س ، ص ) لكل مشاهدة، فإن متوسط ​​الاستجابة عند قيمة معينة لـ س ، ولتكن س د ، هو تقدير لمتوسط ​​قيم ص في المجتمع عند قيمة س د ، أيهـ^(y|xد)y^د{\displaystyle {\hat {E}}(y\mid x_{d})\equiv {\hat {y}}_{d}\!}. يُعطى تباين متوسط ​​الاستجابة بالصيغة التالية: [ 11 ]

متغير(α^+β^xد)=متغير(α^)+(متغيرβ^)xد2+2xدكوف(α^،β^).{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\operatorname {Var} \left({\hat {\alpha }}\right)+\left(\operatorname {Var} {\hat {\beta }}\right)x_{d}^{2}+2x_{d}\operatorname {Cov} \left({\hat {\alpha }},{\hat {\beta }}\right).}

يمكن تبسيط هذا التعبير إلى

متغير(α^+β^xد)=σ2(1م+(xد-x¯)2(xأنا-x¯)2)،{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right),}

حيث يمثل m عدد نقاط البيانات.

ولتوضيح هذا التبسيط، يمكن للمرء استخدام المتطابقة

أنا(xأنا-x¯)2=أناxأنا2-1م(أناxأنا)2.{\displaystyle \sum _{i}(x_{i}-{\bar {x}})^{2}=\sum _{i}x_{i}^{2}-{\frac {1}{m}}\left(\sum _{i}x_{i}\right)^{2}.}

تباين الاستجابة المتوقعة

يُعرَّف توزيع الاستجابة المتوقع بأنه التوزيع المتوقع للبواقي عند النقطة المعطاة x d . وبالتالي، يُعطى التباين بالصيغة التالية:

متغير(yد-[α^+β^xد])=متغير(yد)+متغير(α^+β^xد)-2كوف(yد،[α^+β^xد])=متغير(yد)+متغير(α^+β^xد).{\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)-2\operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)\\&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right).\end{aligned}}}

وينتج السطر الثاني عن حقيقة أنكوف(yد،[α^+β^xد]){\displaystyle \operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)}يساوي صفرًا لأن نقطة التنبؤ الجديدة مستقلة عن البيانات المستخدمة لضبط النموذج. بالإضافة إلى ذلك، فإن المصطلحمتغير(α^+β^xد){\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)}تم حساب متوسط ​​الاستجابة مسبقًا.

منذمتغير(yد)=σ2{\displaystyle \operatorname {Var} (y_{d})=\sigma ^{2}}(معامل ثابت ولكنه غير معروف ويمكن تقديره)، يُعطى تباين الاستجابة المتوقعة بواسطة

متغير(yد-[α^+β^xد])=σ2+σ2(1م+(xد-x¯)2(xأنا-x¯)2)=σ2(1+1م+(xد-x¯)2(xأنا-x¯)2).{\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\sigma ^{2}+\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)\\[4pt]&=\sigma ^{2}\left(1+{\frac {1}{m}}+{\frac {(x_{d}-{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right).\end{aligned}}}

فترات الثقة

تسمح الصيغ الواردة في القسم السابق بحساب تقديرات نقطية لـ α و β ، أي معاملات خط الانحدار لمجموعة البيانات المعطاة. مع ذلك، لا توضح هذه الصيغ مدى دقة التقديرات، أي مدى دقة المُقدِّرات.α^{\displaystyle {\widehat {\alpha }}}وβ^{\displaystyle {\widehat {\beta }}}تختلف النتائج من عينة لأخرى بالنسبة لحجم العينة المحدد. وقد تم وضع فترات الثقة لإعطاء مجموعة معقولة من القيم للتقديرات التي قد يحصل عليها المرء إذا كرر التجربة عددًا كبيرًا جدًا من المرات.

تعتمد الطريقة القياسية لإنشاء فترات الثقة لمعاملات الانحدار الخطي على افتراض التوزيع الطبيعي، والذي يكون مبرراً إذا:

  1. تتوزع الأخطاء في الانحدار توزيعًا طبيعيًا (ما يسمى بافتراض الانحدار الكلاسيكي )، أو
  2. عدد المشاهدات n كبير بما فيه الكفاية، وفي هذه الحالة يكون المقدر موزعًا توزيعًا طبيعيًا تقريبًا.

يتم تبرير الحالة الأخيرة بنظرية النهاية المركزية .

افتراض التوزيع الطبيعي

بناءً على الافتراض الأول أعلاه، وهو افتراض التوزيع الطبيعي لحدود الخطأ، فإن مُقدِّر معامل الميل نفسه سيكون موزعًا توزيعًا طبيعيًا بمتوسط ​​β وتباينσ2/أنا(xأنا-x¯)2،{\textstyle \sigma ^{2}\left/\sum _{i}(x_{i}-{\bar {x}})^{2}\right.,}حيث σ² هو تباين حدود الخطأ (انظر البراهين المتعلقة بطريقة المربعات الصغرى العادية ). في الوقت نفسه ، يتوزع مجموع مربعات البواقي Q بشكل متناسب مع χ² بدرجات حرية n − 2 ، وبشكل مستقل عنβ^{\displaystyle {\widehat {\beta }}}وهذا يسمح لنا بإنشاء قيمة t

ت=β^-βsβ^  تن-2،{\displaystyle t={\frac {{\widehat {\beta }}-\beta }{s_{\widehat {\beta }}}}\ \sim \ t_{n-2},}

أين

sβ^=1ن-2أنا=1نε^أنا2أنا=1ن(xأنا-x¯)2{\displaystyle s_{\widehat {\beta }}={\sqrt {\frac {{\frac {1}{n-2}}\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}

هو تقدير الخطأ المعياري غير المتحيز للمُقدِّرβ^{\displaystyle {\widehat {\beta }}}.

تتبع قيمة t هذه توزيع t للطالب بدرجات حرية n − 2. وباستخدامها، يمكننا إنشاء فترة ثقة لـ β :

β[β^-sβ^تن-2*، β^+sβ^تن-2*]،{\displaystyle \beta \in \left[{\widehat {\beta }}-s_{\widehat {\beta }}t_{n-2}^{*},\ {\widehat {\beta }}+s_{\widehat {\beta }}t_{n-2}^{*}\right],}

عند مستوى ثقة (1 − γ ) ، حيثتن-2*{\displaystyle t_{n-2}^{*}}هو(1-γ2){\displaystyle \scriptstyle \left(1\;-\;{\frac {\gamma }{2}}\right){\text{-th}}}الكمية المئوية لتوزيع t n −2 . على سبيل المثال، إذا كانت γ = 0.05 فإن مستوى الثقة هو 95%.

وبالمثل، تُعطى فترة الثقة لمعامل التقاطع α بالصيغة التالية

α[α^-sα^تن-2*، α^+sα^تن-2*]،{\displaystyle \alpha \in \left[{\widehat {\alpha }}-s_{\widehat {\alpha }}t_{n-2}^{*},\ {\widehat {\alpha }}+s_{\widehat {\alpha }}t_{n-2}^{*}\right],}

عند مستوى ثقة (1 − γ )، حيث

sα^=sβ^1نأنا=1نxأنا2=1ن(ن-2)(أنا=1نε^أنا2)أنا=1نxأنا2أنا=1ن(xأنا-x¯)2{\displaystyle s_{\widehat {\alpha }}=s_{\widehat {\beta }}{\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}x_{i}^{2}}}={\sqrt {{\frac {1}{n(n-2)}}\left(\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}\right){\frac {\sum _{i=1}^{n}x_{i}^{2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}}

الانحدار الأمريكي "التغيرات في البطالة - نمو الناتج المحلي الإجمالي" مع نطاقات الثقة بنسبة 95٪.

تُعطينا فترات الثقة لـ α و β فكرة عامة عن المواضع التي يُرجّح أن تتواجد فيها معاملات الانحدار هذه. على سبيل المثال، في انحدار قانون أوكون الموضح هنا، تكون تقديرات النقاط هي

α^=0.859،β^=-1.817.{\displaystyle {\widehat {\alpha }}=0.859,\qquad {\widehat {\beta }}=-1.817.}

فترات الثقة بنسبة 95% لهذه التقديرات هي

α[0.76،0.96]،β[-2.06،-1.58].{\displaystyle \alpha \in \left[\,0.76,0.96\right],\qquad \beta \in \left[-2.06,-1.58\,\right].}

لتمثيل هذه المعلومات بيانيًا، في شكل نطاقات ثقة حول خط الانحدار، يجب توخي الحذر ومراعاة التوزيع المشترك للمُقدِّرات. يمكن إثبات [ 12 ] أنه عند مستوى ثقة (1  γ )، يكون لنطاق الثقة شكل زائدي مُعطى بالمعادلة 

(α+βξ)[α^+β^ξ±تن-2*(1ن-2ε^أنا2)(1ن+(ξ-x¯)2(xأنا-x¯)2)].{\displaystyle (\alpha +\beta \xi )\in \left[\,{\widehat {\alpha }}+{\widehat {\beta }}\xi \pm t_{n-2}^{*}{\sqrt {\left({\frac {1}{n-2}}\sum {\widehat {\varepsilon }}_{i}^{\,2}\right)\cdot \left({\frac {1}{n}}+{\frac {(\xi -{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)}}\,\right].}

عندما افترض النموذج أن نقطة التقاطع ثابتة وتساوي صفرًا (α=0{\displaystyle \alpha =0})، يتحول الخطأ المعياري للميل إلى:

sβ^=1ن-1أنا=1نε^أنا2أنا=1نxأنا2{\displaystyle s_{\widehat {\beta }}={\sqrt {{\frac {1}{n-1}}{\frac {\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}x_{i}^{2}}}}}}

مع:ε^أنا=yأنا-y^أنا{\displaystyle {\hat {\varepsilon }}_{i}=y_{i}-{\hat {y}}_{i}}

افتراض تقاربي

يفترض الافتراض الثاني البديل أنه عندما يكون عدد النقاط في مجموعة البيانات "كبيرًا بما يكفي"، يصبح قانون الأعداد الكبيرة ونظرية النهاية المركزية قابلين للتطبيق، وبالتالي يكون توزيع المُقدِّرات طبيعيًا تقريبًا. وبموجب هذا الافتراض ، تظل جميع الصيغ المُشتقة في القسم السابق صالحة، باستثناء استبدال الكمية t* ( n -2) لتوزيع t للطالب بالكمية q* للتوزيع الطبيعي القياسي . وفي بعض الأحيان ، يُستبدل الكسر 1 / n -2 بالكسر 1 / n . وعندما يكون n كبيرًا ، لا يُؤثر هذا التغيير على النتائج بشكل ملحوظ.

مثال عددي

تُقدّم هذه المجموعة من البيانات متوسط ​​كتلة النساء كدالة لطولهن في عينة من النساء الأمريكيات اللواتي تتراوح أعمارهن بين 30 و39 عامًا. على الرغم من أن مقالة OLS تُشير إلى أنه من الأنسب إجراء تحليل انحدار تربيعي لهذه البيانات، إلا أنه تم تطبيق نموذج الانحدار الخطي البسيط هنا بدلاً من ذلك.

الارتفاع (م)، س ع1.471.501.521.551.571.601.631.651.681.701.731.751.781.801.83
الكتلة (كجم)، ص ي52.2153.1254.4855.8457.2058.5759.9361.2963.1164.4766.2868.1069.9272.1974.46
أنا{\displaystyle i}xأنا{\displaystyle x_{i}}yأنا{\displaystyle y_{i}}xأنا2{\displaystyle x_{i}^{2}}xأناyأنا{\displaystyle x_{i}y_{i}}yأنا2{\displaystyle y_{i}^{2}}
11.4752.212.160976.74872725.8841
21.5053.122.250079.68002821.7344
31.5254.482.310482.80962968.0704
41.5555.842.402586.55203118.1056
51.5757.202.464989.80403271.8400
61.6058.572.560093.71203430.4449
71.6359.932.656997.68593591.6049
81.6561.292.7225101.12853756.4641
91.6863.112.8224106.02483982.8721
101.7064.472.8900109.59904156.3809
111.7366.282.9929114.66444393.0384
121.7568.103.0625119.17504637.6100
131.7869.923.1684124.45764888.8064
141.8072.193.2400129.94205211.3961
151.8374.463.3489136.26185544.2916
Σ{\displaystyle \Sigma }24.76931.1741.05321548.245358498.5439

تحتوي مجموعة البيانات هذه على 15 نقطة (n = 15). تبدأ الحسابات اليدوية بإيجاد المجاميع الخمسة التالية:

Sx=أناxأنا=24.76،Sy=أناyأنا=931.17،Sxx=أناxأنا2=41.0532،Syy=أناyأنا2=58498.5439،Sxy=أناxأناyأنا=1548.2453{\displaystyle {\begin{aligned}S_{x}&=\sum _{i}x_{i}\,=24.76,&\qquad S_{y}&=\sum _{i}y_{i}\,=931.17,\\[5pt]S_{xx}&=\sum _{i}x_{i}^{2}=41.0532,&\;\;\,S_{yy}&=\sum _{i}y_{i}^{2}=58498.5439,\\[5pt]S_{xy}&=\sum _{i}x_{i}y_{i}=1548.2453&\end{aligned}}}

سيتم استخدام هذه الكميات لحساب تقديرات معاملات الانحدار، وأخطائها المعيارية.

β^=نSxy-SxSyنSxx-Sx2=61.272α^=1نSy-β^1نSx=-39.062sε2=1ن(ن-2)[نSyy-Sy2-β^2(نSxx-Sx2)]=0.5762sβ^2=نsε2نSxx-Sx2=3.1539sα^2=sβ^21نSxx=8.63185{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {nS_{xy}-S_{x}S_{y}}{nS_{xx}-S_{x}^{2}}}=61.272\\[8pt]{\widehat {\alpha }}&={\frac {1}{n}}S_{y}-{\widehat {\beta }}{\frac {1}{n}}S_{x}=-39.062\\[8pt]s_{\varepsilon }^{2}&={\frac {1}{n(n-2)}}\left[nS_{yy}-S_{y}^{2}-{\widehat {\beta }}^{2}(nS_{xx}-S_{x}^{2})\right]=0.5762\\[8pt]s_{\widehat {\beta }}^{2}&={\frac {ns_{\varepsilon }^{2}}{nS_{xx}-S_{x}^{2}}}=3.1539\\[8pt]s_{\widehat {\alpha }}^{2}&=s_{\widehat {\beta }}^{2}{\frac {1}{n}}S_{xx}=8.63185\end{aligned}}}

رسم بياني للنقاط وخطوط المربعات الصغرى الخطية في مثال عددي للانحدار الخطي البسيط

النسبة المئوية 0.975 لتوزيع t للطالب بدرجة حرية 13 هي t * 13 = 2.1604 ، وبالتالي فإن فترات الثقة 95% لـ α و β هي

α[α^ت13*sα^]=[-45.4، -32.7]β[β^ت13*sβ^]=[57.4، 65.1]{\displaystyle {\begin{aligned}&\alpha \in [\,{\widehat {\alpha }}\mp t_{13}^{*}s_{\widehat {\alpha }}\,]=[\,{-45.4},\ {-32.7}\,]\\[5pt]&\beta \in [\,{\widehat {\beta }}\mp t_{13}^{*}s_{\widehat {\beta }}\,]=[\,57.4,\ 65.1\,]\end{aligned}}}

يمكن أيضًا حساب معامل ارتباط بيرسون :

ر^=نSxy-SxSy(نSxx-Sx2)(نSyy-Sy2)=0.9946{\displaystyle {\widehat {r}}={\frac {nS_{xy}-S_{x}S_{y}}{\sqrt {(nS_{xx}-S_{x}^{2})(nS_{yy}-S_{y}^{2})}}}=0.9946}

البدائل

حساب معلمات النموذج الخطي عن طريق تقليل الخطأ التربيعي.

في الانحدار الخطي البسيط، هناك افتراض ضمني بأن المتغير التابع فقط هو الذي يحتوي على خطأ في القياس؛ إذا تم قياس المتغير التفسيري أيضًا بخطأ، فإن الانحدار البسيط ليس مناسبًا لتقدير العلاقة الأساسية لأنه سيكون متحيزًا بسبب تخفيف الانحدار .

تشمل طرق التقدير الأخرى التي يمكن استخدامها بدلاً من طريقة المربعات الصغرى العادية الانحرافات المطلقة الدنيا (تقليل مجموع القيم المطلقة للبواقي) ومقدر ثيل-سين (الذي يختار خطًا يكون ميله هو متوسط ​​الميول المحددة بواسطة أزواج من نقاط العينة).

يُحدد انحدار ديمينغ (المربعات الصغرى الكلية) خطًا يُناسب مجموعة من نقاط العينة ثنائية الأبعاد، ولكنه (على عكس المربعات الصغرى العادية، والانحرافات المطلقة الصغرى، وانحدار الميل الوسيط) ليس مثالًا حقيقيًا للانحدار الخطي البسيط، لأنه لا يفصل الإحداثيات إلى متغير تابع ومتغير مستقل، وقد يُنتج خطًا رأسيًا كقيمة مُلائمة. وهذا قد يؤدي إلى نموذج يُحاول مُلاءمة القيم الشاذة أكثر من البيانات.

تركيب الخطوط

تُعرف عملية ملاءمة الخط بأنها عملية إنشاء خط مستقيم يمثل أفضل تطابق مع سلسلة من نقاط البيانات.

توجد عدة طرق، مع الأخذ في الاعتبار ما يلي:

الانحدار الخطي البسيط بدون حد التقاطع (متغير مستقل واحد)

أحيانًا يكون من المناسب إجبار خط الانحدار على المرور بنقطة الأصل، لأن x و y يُفترض أنهما متناسبان. بالنسبة للنموذج بدون الحد الثابت، y = βx ، فإن مُقدِّر المربعات الصغرى العادية لـ β يتبسط إلى

β^=أنا=1نxأناyأناأنا=1نxأنا2=xy¯x2¯{\displaystyle {\widehat {\beta }}={\frac {\sum _{i=1}^{n}x_{i}y_{i}}{\sum _{i=1}^{n}x_{i}^{2}}}={\frac {\overline {xy}}{\overline {x^{2}}}}}

باستبدال ( xh , yk ) بدلاً من ( x , y ) نحصل على الانحدار من خلال ( h , k ) :

β^=أنا=1ن(xأنا-ح)(yأنا-ك)أنا=1ن(xأنا-ح)2=(x-ح)(y-ك)¯(x-ح)2¯=xy¯-كx¯-حy¯+حكx2¯-2حx¯+ح2=xy¯-x¯y¯+(x¯-ح)(y¯-ك)x2¯-x¯2+(x¯-ح)2=كوف(x،y)+(x¯-ح)(y¯-ك)متغير(x)+(x¯-ح)2،{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-h)(y_{i}-k)}{\sum _{i=1}^{n}(x_{i}-h)^{2}}}={\frac {\overline {(x-h)(y-k)}}{\overline {(x-h)^{2}}}}\\[6pt]&={\frac {{\overline {xy}}-k{\bar {x}}-h{\bar {y}}+hk}{{\overline {x^{2}}}-2h{\bar {x}}+h^{2}}}\\[6pt]&={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}+({\bar {x}}-h)({\bar {y}}-k)}{{\overline {x^{2}}}-{\bar {x}}^{2}+({\bar {x}}-h)^{2}}}\\[6pt]&={\frac {\operatorname {Cov} (x,y)+({\bar {x}}-h)({\bar {y}}-k)}{\operatorname {Var} (x)+({\bar {x}}-h)^{2}}},\end{aligned}}}

حيث يشير Cov و Var إلى التباين والتباين المشترك لبيانات العينة (دون تصحيح الانحياز). يوضح الشكل الأخير أعلاه كيف يؤثر تحريك الخط بعيدًا عن مركز كتلة نقاط البيانات على الميل.

انظر أيضاً

مراجع

  1. سيلتمان، هوارد ج. (2008-09-08). تصميم التجارب وتحليلها (ملف PDF) . ص  227.
  2. "المعاينة الإحصائية والانحدار: الانحدار الخطي البسيط" . جامعة كولومبيا . تاريخ الاسترجاع: 17 أكتوبر 2016. عندما يُستخدم متغير مستقل واحد في الانحدار، يُطلق عليه انحدار بسيط؛(...)
  3. لين، ديفيد م. مقدمة في الإحصاء (ملف PDF) . ص 462. 
  4. زو كيه إتش؛ تونكالي كيه؛ سيلفرمان إس جي (2003). " الارتباط والانحدار الخطي البسيط" . علم الأشعة . 227 (3): 617-22 . doi : 10.1148/radiol.2273011499 . ISSN 0033-8419 . OCLC 110941167. PMID 12773666 .   
  5. ألتمان، نعومي؛ كرزيونسكي، مارتن (2015). " الانحدار الخطي البسيط" . مجلة نيتشر ميثودز . 12 (11): 999-1000 . doi : 10.1038/nmeth.3627 . ISSN 1548-7091 . OCLC 5912005539. PMID 26824102. S2CID 261269711 .    
  6. كيني، جيه إف وكيبينغ، إي إس (1962) "الانحدار الخطي والارتباط". الفصل 15 في رياضيات الإحصاء ، الجزء 1، الطبعة الثالثة. برينستون، نيوجيرسي: فان نوستراند، الصفحات 252-285
  7. 1 2 موثوكريشنان، غوري (17 يونيو 2018). "الرياضيات الكامنة وراء الانحدار متعدد الحدود، موثوكريشنان" . الرياضيات الكامنة وراء الانحدار متعدد الحدود . تم الاسترجاع في 30 يناير 2024 .
  8. "رياضيات الانحدار متعدد الحدود" . الانحدار متعدد الحدود، فئة انحدار PHP .
  9. "المهارات الحسابية والرياضية والإحصائية - مجموعة المهارات الأكاديمية، جامعة نيوكاسل" . الانحدار الخطي البسيط . تم الاطلاع عليه بتاريخ 30 يناير 2024 .
  10. فاليانت، ريتشارد، وجيل أ. ديفر، وفراوك كروتر. أدوات عملية لتصميم وترجيح عينات المسح. نيويورك: سبرينغر، 2013.
  11. درابر، إن آر؛ سميث، إتش. (1998). تحليل الانحدار التطبيقي ( الطبعة الثالثة). جون وايلي. ISBN  0-471-17082-8.
  12. كاسيلا، جي. وبيرغر، آر إل (2002)، "الاستدلال الإحصائي" (الطبعة الثانية)، سينغيج، رقم ISBN 978-0-534-24312-8، الصفحات 558-559.