إجمالي المربعات الصغرى

في الإحصاء التطبيقي ، تُعدّ طريقة المربعات الصغرى الكلية نوعًا من أنواع انحدار الأخطاء في المتغيرات ، وهي تقنية لنمذجة البيانات باستخدام طريقة المربعات الصغرى ، حيث تُؤخذ أخطاء الرصد في كلٍّ من المتغيرات التابعة والمستقلة في الحسبان. وهي تعميم لانحدار ديمينغ ، وكذلك للانحدار المتعامد ، ويمكن تطبيقها على النماذج الخطية وغير الخطية.
إن تقريب المربعات الصغرى الكلية للبيانات يكافئ بشكل عام أفضل تقريب منخفض الرتبة لمصفوفة البيانات ، وفقًا لمعيار فروبينيوس . [ 1 ]
النموذج الخطي
خلفية
في طريقة المربعات الصغرى لنمذجة البيانات، تكون دالة الهدف المراد تقليلها، S ، على شكل تربيعي :
حيث يمثل r متجه البواقي و W مصفوفة الترجيح. في طريقة المربعات الصغرى الخطية، يحتوي النموذج على معادلات خطية في المعاملات الظاهرة في متجه المعاملات.إذن، تُعطى البواقي بواسطة
يوجد m مشاهدة في y و n معلمات في β حيث m > n . X هي مصفوفة m × n عناصرها إما ثوابت أو دوال للمتغيرات المستقلة x . مصفوفة الأوزان W هي، في الحالة المثالية، معكوس مصفوفة التباين والتباين المشترك.من المشاهدات y . يُفترض أن المتغيرات المستقلة خالية من الأخطاء. يتم إيجاد تقديرات المعلمات عن طريق جعل معادلات التدرج تساوي صفرًا، مما ينتج عنه المعادلات العادية [ أ ]
السماح بأخطاء الملاحظة في جميع المتغيرات
لنفترض الآن أن كلاً من x و y يتم رصدهما مع مراعاة احتمال الخطأ، مع مصفوفات التباين والتباين المشترك.وعلى التوالي. في هذه الحالة، يمكن كتابة دالة الهدف على النحو التالي:
أينوتمثل هذه القيم البواقي في x و y على التوالي. من الواضح أن هذه البواقي لا يمكن أن تكون مستقلة عن بعضها البعض، بل يجب أن تكون مقيدة بنوع من العلاقة. كتابة دالة النموذج على النحو التالي:يتم التعبير عن القيود بواسطة معادلات شرطية m . [ 2 ]
وبالتالي، تكمن المشكلة في تقليل دالة الهدف مع مراعاة القيود m . ويتم حلها باستخدام معاملات لاغرانج . وبعد بعض العمليات الجبرية، [ 3 ] نحصل على النتيجة.
أو بدلاً من ذلك حيث M هي مصفوفة التباين والتباين المشترك بالنسبة لكل من المتغيرات المستقلة والتابعة.
مثال
عندما تكون أخطاء البيانات غير مترابطة، تكون جميع المصفوفات M و W قطرية. لنأخذ مثالًا على ذلك: تركيب خط مستقيم.
في هذه الحالة
يوضح الشكل كيف يتحدد التباين عند النقطة i بتباينات كل من المتغيرات المستقلة والتابعة، وبالنموذج المستخدم لملاءمة البيانات. ويمكن تعميم هذه الصيغة بملاحظة أن المعلمةميل الخط.
يُستخدم تعبير من هذا النوع في ملاءمة بيانات معايرة الرقم الهيدروجيني حيث يترجم خطأ صغير في x إلى خطأ كبير في y عندما يكون الميل كبيرًا.
وجهة نظر جبرية
كما أوضح غولوب وفان لون في عام 1980، فإن مسألة المربعات الصغرى ذات الشقين لا تملك حلاً بشكل عام. [ 4 ] يتناول ما يلي الحالة البسيطة التي يوجد فيها حل وحيد دون وضع أي افتراضات محددة.
تم شرح حساب TLS باستخدام تحليل القيم المفردة (SVD) في المراجع القياسية. [ 5 ] يمكننا حل المعادلة
بالنسبة لـ B حيث X من الرتبة m × n و Y من الرتبة m × k . [ b ]
أي أننا نسعى لإيجاد B الذي يقلل من مصفوفات الخطأ E و F لـ X و Y على التوالي.
أينهي المصفوفة الموسعة التي تحتوي على E و F جنبًا إلى جنب والمعيار فروبينيوس هو الجذر التربيعي لمجموع مربعات جميع المدخلات في المصفوفة، وبالتالي فهو الجذر التربيعي لمجموع مربعات أطوال صفوف أو أعمدة المصفوفة.
يمكن إعادة كتابة هذا على النحو التالي
أينهومصفوفة الوحدة. والهدف هو إيجادها.مما يقلل من رتبةبواسطة ك . تعريفأن تكون تحليل القيم المفردة للمصفوفة الموسعة.
حيث يتم تقسيم V إلى كتل تتوافق مع شكل X و Y.
باستخدام نظرية إيكارت-يونغ ، يكون التقريب الذي يقلل معيار الخطأ بحيث تكون المصفوفاتولم تتغير، بينما الأصغريتم استبدال القيم المفردة بأصفار. أي أننا نريد
وبناءً على مبدأ الخطية،
يمكننا بعد ذلك إزالة الكتل من مصفوفات U و Σ، مما يؤدي إلى التبسيط إلى
وهذا يوفر E و F بحيث
الآن إذاغير منفردة، وهو ليس الحال دائمًا (لاحظ سلوك TLS عندما(المفرد غير مفهوم جيدًا بعد)، يمكننا بعد ذلك ضرب كلا الطرفين من اليمين فيلجعل الجزء السفلي من المصفوفة اليمنى هوية سالبة، مما يعطي [ 6 ]
وهكذا
تطبيق بسيط لهذا الأمر باستخدام GNU Octave / MATLAB هو:
دالة B = tls ( X, Y ) [ m n ] = size ( X ); % n هو عرض X (X هو m × n) Z = [ X Y ]; % Z هو X مضافًا إليه Y. [ U S V ] = svd ( Z , 0 ); % إيجاد تحليل القيم المفردة لـ Z. VXY = V ( 1 : n , 1 + n : end ); % أخذ كتلة V التي تتكون من أول n صفًا والعمود n+1 إلى الأخير VYY = V ( 1 + n : end , 1 + n : end ); % أخذ الكتلة السفلية اليمنى من V. B = - VXY / VYY ; endالطريقة الموضحة أعلاه لحل المشكلة، والتي تتطلب أن تكون المصفوفةغير منفردة، ويمكن توسيعها قليلاً بواسطة ما يسمى بخوارزمية TLS الكلاسيكية . [ 7 ]
حساب
يتوفر التطبيق القياسي لخوارزمية المربعات الصغرى التقليدية (TLS) التي كتبها فان هوفيل عبر مكتبة Netlib ، انظر أيضًا [ 8 ] [ 9 ] . جميع التطبيقات الحديثة، التي تعتمد على سبيل المثال على حل سلسلة من مسائل المربعات الصغرى العادية، تُقارب المصفوفة.(يشار إليه)في الأدبيات)، [ ب ] كما قدمه فان هوفيل وفانديفال. تجدر الإشارة إلى أن هذا الحل، مع ذلك، هو حل TLS فقط عندماووفي حالات أخرى، يمثل ذلك، حل لمسألة المربعات الصغرى الكلية المقتطعة (T-TLS). [ 10 ] [ 11 ] تتميز مسألة المربعات الصغرى الكلية المقتطعة بخاصية تنظيمية لا توجد في مسألة المربعات الصغرى الكلية الحقيقية. [ 11 ]
نموذج غير خطي
بالنسبة للأنظمة غير الخطية، يُظهر منطق مماثل أن المعادلات العادية لدورة تكرارية يمكن كتابتها على النحو التالي:
أينهي مصفوفة جاكوبيان .
التفسير الهندسي
عندما يكون المتغير المستقل خاليًا من الأخطاء، يُمثل الباقي المسافة "العمودية" بين نقطة البيانات المرصودة والمنحنى (أو السطح) المُطابق. في طريقة المربعات الصغرى الكلية، يُمثل الباقي المسافة بين نقطة البيانات والمنحنى المُطابق مُقاسةً على طول اتجاه معين. في الواقع، إذا تم قياس كلا المتغيرين بنفس الوحدات وكانت الأخطاء في كليهما متساوية، فإن الباقي يُمثل أقصر مسافة بين نقطة البيانات والمنحنى المُطابق ، أي أن متجه الباقي يكون عموديًا على مماس المنحنى. لهذا السبب، يُطلق على هذا النوع من الانحدار أحيانًا اسم الانحدار الإقليدي ثنائي الأبعاد (شتاين، 1983) [ 12 ] أو الانحدار المتعامد .
الأساليب الثابتة المقياس
تنشأ صعوبة بالغة إذا لم تُقاس المتغيرات بنفس الوحدات. لنفترض أولًا قياس المسافة بين نقطة بيانات والخط: ما هي وحدات قياس هذه المسافة؟ إذا اعتمدنا على نظرية فيثاغورس في قياس المسافة، فمن الواضح أننا سنجمع كميات مُقاسة بوحدات مختلفة، وهو أمر غير منطقي. ثانيًا، إذا أعدنا قياس أحد المتغيرات، مثلًا بالجرام بدلًا من الكيلوجرام، فسنحصل على نتائج مختلفة (خط مختلف). لتجنب هذه المشاكل، يُقترح أحيانًا تحويل المتغيرات إلى متغيرات لا بُعدية، وهو ما يُسمى بالتطبيع أو التقييس. مع ذلك، توجد طرق مختلفة للقيام بذلك، وتؤدي هذه الطرق إلى نماذج مُلائمة غير متكافئة. يتمثل أحد الأساليب في التطبيع باستخدام دقة قياس معروفة (أو مُقدَّرة)، مما يُقلل مسافة ماهالانوبيس من النقاط إلى الخط، ويُوفر حلًا بأقصى احتمال ؛ [ 13 ] ويمكن إيجاد الدقة غير المعروفة من خلال تحليل التباين .
باختصار، لا تتمتع طريقة المربعات الصغرى الكلية بخاصية ثبات الوحدات ، أي أنها ليست ثابتة المقياس . وللحصول على نموذج ذي معنى، نحتاج إلى توافر هذه الخاصية. يتمثل أحد الحلول في إدراك إمكانية دمج البواقي (المسافات) المقاسة بوحدات مختلفة باستخدام الضرب بدلًا من الجمع. لنفترض أننا نريد تركيب خط: لكل نقطة بيانات، يكون حاصل ضرب البواقي الرأسية والأفقية مساويًا لضعف مساحة المثلث المتكون من خطوط البواقي والخط المُركّب. نختار الخط الذي يُقلل مجموع هذه المساحات. أثبت الحائز على جائزة نوبل، بول سامويلسون، عام ١٩٤٢، أنه في بُعدين، الخط الوحيد الذي يُمكن التعبير عنه فقط بنسب الانحرافات المعيارية ومعامل الارتباط هو الذي (١) يُطابق المعادلة الصحيحة عندما تقع المشاهدات على خط مستقيم، (٢) يُظهر ثبات المقياس، و(٣) يُظهر ثباتًا عند تبديل المتغيرات. [ 13 ] أُعيد اكتشاف هذا الحل في مختلف التخصصات، ويُعرف بأسماء متعددة، منها المحور الرئيسي المعياري (ريكر 1975، وارتون وآخرون، 2006)، [ 14 ] [ 15 ] والمحور الرئيسي المُختزل ، والعلاقة الوظيفية للمتوسط الهندسي (دريبر وسميث، 1998)، [ 16 ] [ ج ] وانحدار أقل المنتجات ، والانحدار القطري ، وخط الارتباط العضوي ، وخط سترومبرغ المحايد ، وعلاقة القياس التناسبي، وانحدار المتوسط الهندسي ، [ 17 ] وخط أقل المساحات (توفاليس، 2002). [ 18 ] وقد أوصي باستخدام العلاقة الوظيفية للمتوسط الهندسي في علم الأحياء. [ 19 ]
قام توفاليس (2015، 2023) [ 20 ] [ 21 ] بتوسيع هذا النهج ليشمل التعامل مع متغيرات متعددة. تُعدّ الحسابات أبسط من حسابات المربعات الصغرى الكلية، إذ لا تتطلب سوى معرفة مصفوفة التغاير ، ويمكن إجراؤها باستخدام دوال جداول البيانات القياسية. يُعدّ المربعات الصغرى الكلية غير المتغيرة المقياس مثالًا على الانحدار المتناظر ، حيث تُعامل جميع المتغيرات على قدم المساواة. [ 21 ] وبشكل أكثر تحديدًا، عند إعطاء مصفوفة التغاير M ومعكوسها M⁻¹ ، يكون الانحداربالنسبة لعدد كبير من المتغيرات، يكون من الأكثر كفاءة حساب العناصر القطرية لـ M −1 مباشرة باستخدام التحديد الإيجابي لـ M. [ 21 ]
انظر أيضاً
- تخفيف الانحدار
- انحدار ديمينغ ، حالة خاصة مع متغيرين تنبؤيين وأخطاء مستقلة.
- نموذج الأخطاء في المتغيرات
- نموذج جاوس-هيلمرت
- الانحدار الخطي
- طريقة المربعات الصغرى
- تحليل المكونات الرئيسية
- انحدار المكونات الرئيسية
ملحوظات
- ↑ شكل بديل هو، أينيمثل هذا تغير المعلمة عن تقدير أولي لـويمثل الفرق بين y والقيمة المحسوبة باستخدام القيمة الابتدائية لـ
- ١ ٢ يُستخدم الرمز XB ≈ Y هنا ليعكس الرمز المستخدم في الجزء السابق من المقالة. في الأدبيات الحسابية، يُعرض هذا السؤال عادةً على أنه AX ≈ B ، أي باستخدام الحرف X للدلالة على مصفوفة n × k لمعاملات الانحدار المجهولة.
- ↑ سميت بهذا الاسم لأن ميل GMFR هو المتوسط الهندسي لميل OLS، مما يسهل أيضًا حسابه باستخدام الأدوات الحالية.
مراجع
- ↑ إ. ماركوفسكي وس . فان هوفيل ، نظرة عامة على طرق المربعات الصغرى الكلية. معالجة الإشارات، المجلد 87، الصفحات 2283-2302، 2007. نسخة أولية
- ↑ دبليو إي ديمينغ، التعديل الإحصائي للبيانات، وايلي، 1943
- ↑ غانز، بيتر (1992). ملاءمة البيانات في العلوم الكيميائية . وايلي. ISBN 9780471934127تم الاطلاع عليه بتاريخ 4 ديسمبر 2012 .
- ↑ GH Golub و CF Van Loan، تحليل لمسألة المربعات الصغرى الكلية. التحليل العددي، 17، 1980، ص 883-893.
- ↑ غولوب، جين هـ .؛ فان لون، تشارلز ف. (1996). حسابات المصفوفات ( الطبعة الثالثة). مطبعة جامعة جونز هوبكنز . ص 596.
- ↑ بيورك، آكي (1996) الطرق العددية لمسائل المربعات الصغرى ، جمعية الرياضيات الصناعية والتطبيقية. ISBN 978-0898713602
- ↑ S. Van Huffel and J. Vandewalle (1991) The Total Least Squares Problems: Computal Aspects and Analysis . SIAM Publications, Philadelphia PA.
- ↑ S. Van Huffel ، برامج Fortran 77 الموثقة لخوارزمية المربعات الصغرى الكلية الكلاسيكية الموسعة، وخوارزمية تحليل القيم المفردة الجزئية، وخوارزمية المربعات الصغرى الكلية الجزئية، تقرير داخلي ESAT-KUL 88/1، مختبر ESAT، قسم الهندسة الكهربائية، جامعة لوفين الكاثوليكية، 1988.
- ↑ S. Van Huffel , The extended classic total least squares algorithm, J. Comput. Appl. Math., 25, pp. 111–119, 1989.
- ↑ م. بليشنجر، مسألة المربعات الصغرى الكلية واختزال البيانات في AX ≈ B. أطروحة دكتوراه، جامعة ليبيريتس التقنية ومعهد علوم الحاسوب، أكاديمية العلوم التشيكية، براغ، 2008. أطروحة دكتوراه
- 1 2 هنيتينكوفا، إيفيتا؛ بليشنجر، مارتن؛ سيما، ديانا ماريا؛ ستراكوش، زدينيك؛ فان هوفيل، سابين (يوليو 2011). "مسألة المربعات الصغرى الكلية في AX≈B: تصنيف جديد وعلاقته بالأعمال الكلاسيكية" (ملف PDF) . مجلة SIAM لتحليل المصفوفات وتطبيقاتها . 32 (3): 748-770 . doi : 10.1137/100813348 .
- ↑ شتاين، يعقوب ج. "الانحدار الإقليدي ثنائي الأبعاد" (PDF) .
{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal= - 1 2 سامويلسون، بول أ. (1942). "ملاحظة حول الانحدارات البديلة". Econometrica . 10 (1): 80–83 . doi : 10.2307/1907024 . JSTOR 1907024 .
- ↑ ريكر، دبليو إي (1975). "ملاحظة بشأن تعليقات البروفيسور جوليكور". مجلة مجلس أبحاث مصايد الأسماك في كندا . 32 (8): 1494-1498 . رمز Bibcode : 1975JFRBC..32.1494R . doi : 10.1139/f75-172 .
- ↑ وارتون، ديفيد آي؛ رايت، إيان جيه؛ فالستر، دانيال إس؛ ويستوبي، مارك (2006). "طرق ملاءمة الخطوط ثنائية المتغيرات للقياسات النسبية". المراجعات البيولوجية . 81 (2): 259-291 . Bibcode : 2006BioRv..81..259W . CiteSeerX 10.1.1.461.9154 . doi : 10.1017/S1464793106007007 . PMID 16573844. S2CID 16462731 .
- ↑ درابر، إن آر وسميث، إتش. تحليل الانحدار التطبيقي ، الطبعة الثالثة، الصفحات 92-96. 1998
- ↑ سميث، ريتشارد ج. (نوفمبر 2009). "استخدام وإساءة استخدام المحور الرئيسي المُختزل في مُلاءمة الخطوط" . المجلة الأمريكية للأنثروبولوجيا الفيزيائية . 140 (3): 476-486 . doi : 10.1002/ajpa.21090 . ISSN 0002-9483 . PMID 19425097 .
- ↑ توفاليس، كريس (2002). "ملاءمة النموذج لمتغيرات متعددة عن طريق تقليل الانحراف الهندسي المتوسط". في: فان هوفيل، سابين ؛ ليمرلينغ، ب. (محرران). المربعات الصغرى الكلية ونمذجة الأخطاء في المتغيرات: التحليل والخوارزميات والتطبيقات . دوردريخت: كلوير للنشر الأكاديمي. doi : 10.1007/978-94-017-3552-0 . ISBN 978-1402004766. SSRN 1077322 .
- ↑ شو، شاو جي (2014-10-02). "خاصية من خصائص الانحدار الهندسي المتوسط" . الإحصائي الأمريكي . 68 (4): 277-281 . doi : 10.1080/00031305.2014.962763 . ISSN 0003-1305 .
- ↑ توفاليس، كريس (2015). "ملاءمة المعادلات للبيانات ذات علاقة الارتباط المثالية". SSRN 2707593 .
- 1 2 3 توفاليس، كريس (18 سبتمبر 2023). "ملاءمة معادلة للبيانات بشكل غير متحيز" . الرياضيات . 11 (18): 3957. arXiv : 2409.02573 . doi : 10.3390/math11183957 . SSRN 4556739 .
آحرون
- I. Hnětynková، M. Plešinger، DM Sima، Z. Strakoš، و S. Van Huffel ، مسألة المربعات الصغرى الكلية في AX ≈ B: تصنيف جديد وعلاقته بالأعمال الكلاسيكية. SIMAX، المجلد 32، العدد 3 (2011)، الصفحات 748-770. متوفر كنسخة أولية .
- م. بليشنجر، مسألة المربعات الصغرى الكلية واختزال البيانات في AX ≈ B. أطروحة دكتوراه، جامعة ليبيريتس التقنية ومعهد علوم الحاسوب، أكاديمية العلوم التشيكية، براغ، 2008 .
- سي سي بيج، زد. ستراكوش، المشكلات الأساسية في الأنظمة الجبرية الخطية. مجلة SIAM لتحليل المصفوفات وتطبيقاتها، 27، 2006، ص 861-875. doi : 10.1137/040616991
- S. Van Huffel and P. Lemmerling, Total Least Squares and Errors-in-Variables Modeling: Analysis, Algorithms and Applications . Dordrecht, The Netherlands: Kluwer Academic Publishers, 2002.
- S. Jo و SW Kim، ترشيح متوسط المربعات الصغرى المعياري المتسق مع مصفوفة بيانات مشوشة. IEEE Trans. Signal Process.، المجلد 53، العدد 6، الصفحات 2112-2123، يونيو 2005.
- RD DeGroat و EM Dowling، مشكلة المربعات الصغرى للبيانات ومعادلة القناة. IEEE Trans. Signal Process.، المجلد 41، العدد 1، الصفحات 407-411، يناير 1993.
- إس. فان هوفيل وج. فانديوال، مسائل المربعات الصغرى الكلية: الجوانب الحسابية والتحليل. منشورات SIAM، فيلادلفيا، بنسلفانيا، 1991. doi : 10.1137/1.9781611971002
- T. Abatzoglou و J. Mendel، Constrained total least squares ، في وقائع المؤتمر الدولي IEEE للصوتيات والكلام ومعالجة الإشارات (ICASSP'87)، أبريل 1987، المجلد 12، الصفحات 1485-1488.
- P. de Groen مقدمة لمجموع المربعات الصغرى ، في Nieuw Ar Chief voor Wiskunde، Vierde serie، deel 14، 1996، pp. 237–253 arxiv.org .
- جي إتش غولوب وسي إف فان لون، تحليل مسألة المربعات الصغرى الكلية. مجلة SIAM للتحليل العددي، 17، 1980، ص 883-893. doi : 10.1137/0717073
- الانحدار العمودي لخط مستقيم على موقع MathPages
- AR Amiri-Simkooei و S. Jazaeri ، المربعات الصغرى الكلية الموزونة المصاغة بواسطة نظرية المربعات الصغرى القياسية ، في مجلة العلوم الجيوديسية، 2 (2): 113-124، 2012.
- الرياضيات التطبيقية
- ملاءمة المنحنيات
- طريقة المربعات الصغرى
- نماذج الانحدار
