تحليل المكونات الرئيسية الوظيفية

يُعد تحليل المكونات الرئيسية الوظيفية ( FPCA ) أسلوبًا إحصائيًا لدراسة أنماط التباين السائدة في البيانات الوظيفية . باستخدام هذا الأسلوب، تُمثَّل الدالة العشوائية في أساس الدوال الذاتية، وهو أساس متعامد في فضاء هيلبرت يتكون من الدوال الذاتية لمؤثر التغاير الذاتي . يُمثِّل FPCA البيانات الوظيفية بأكثر الطرق اقتصادًا، بمعنى أنه عند استخدام عدد ثابت من دوال الأساس ، يُفسِّر أساس الدوال الذاتية تباينًا أكبر من أي توسيع أساس آخر. يُمكن تطبيق FPCA لتمثيل الدوال العشوائية، [ 1 ] أو في الانحدار الوظيفي [ 2 ] والتصنيف.

التركيبة

بالنسبة لعملية عشوائية قابلة للتكامل التربيعي X ( t )، حيث t ∈ 𝒯، ليكن

μ(ت)=هـ(X(ت)){\displaystyle \mu (t)={\text{E}}(X(t))}

و

جي(s،ت)=كوف(X(s)،X(ت))=ك=1λكφك(s)φك(ت)،{\displaystyle G(s,t)={\text{Cov}}(X(s),X(t))=\sum _{k=1}^{\infty }\lambda _{k}\varphi _{k}(s)\varphi _{k}(t),}

أينλ1λ2...0{\displaystyle \lambda _{1}\geq \lambda _{2}\geq ...\geq 0}هي القيم الذاتية وφ1{\displaystyle \varphi _{1}}،φ2{\displaystyle \varphi _{2}}... هي الدوال الذاتية المتعامدة لمؤثر هيلبرت-شميدت الخطي

جي:ل2(تي)ل2(تي)،جي(و)=تيجي(s،ت)و(s)دs.{\displaystyle G:L^{2}({\mathcal {T}})\rightarrow L^{2}({\mathcal {T}}),\,G(f)=\int _{\mathcal {T}}G(s,t)f(s)ds.}

بحسب نظرية كارونين-لوف ، يمكن التعبير عن العملية المركزية في أساس القيم الذاتية.

X(ت)-μ(ت)=ك=1ξكφك(ت)،{\displaystyle X(t)-\mu (t)=\sum _{k=1}^{\infty }\xi _{k}\varphi _{k}(t),}

أين

ξك=تي(X(ت)-μ(ت))φك(ت)دت{\displaystyle \xi _{k}=\int _{\mathcal {T}}(X(t)-\mu (t))\varphi _{k}(t)dt}

المكون الرئيسي المرتبط بالدالة الذاتية رقم kφك{\displaystyle \varphi _{k}}، مع الخصائص

هـ(ξك)=0،متغير(ξك)=λك و هـ(ξكξل)=0 ل كل.{\displaystyle {\text{E}}(\xi _{k})=0,{\text{Var}}(\xi _{k})=\lambda _{k}{\text{ و }}{\text{E}}(\xi _{k}\xi _{l})=0{\text{ لـ }}k\neq l.}

تكون العملية المركزية مكافئة لـ ξ 1 ، ξ 2 ، .... ومن الافتراضات الشائعة أن X يمكن تمثيلها فقط بالدوال الذاتية القليلة الأولى (بعد طرح دالة المتوسط)، أي

X(ت)Xم(ت)=μ(ت)+ك=1مξكφك(ت)،{\displaystyle X(t)\approx X_{m}(t)=\mu (t)+\sum _{k=1}^{m}\xi _{k}\varphi _{k}(t),}

أين

هـ(تي(X(ت)-Xم(ت))2دت)=ج>مλج0 مثل م.{\displaystyle \mathrm {E} \left(\int _{\mathcal {T}}\left(X(t)-X_{m}(t)\right)^{2}dt\right)=\sum _{j>m}\lambda _{j}\rightarrow 0{\text{ as }}m\rightarrow \infty .}

تفسير الوظائف الذاتية

الدالة الذاتية الأولىφ1{\displaystyle \varphi _{1}}يوضح النمط السائد لتغير X.

φ1=أرزمأxφ=1{متغير(تي(X(ت)-μ(ت))φ(ت)دت)}،{\displaystyle \varphi _{1}={\underset {\Vert \mathbf {\varphi } \Vert =1}{\operatorname {arg\,max} }}\left\{\operatorname {Var} \left(\int _{\mathcal {T}}(X(t)-\mu (t))\varphi (t)dt\right)\right\},}

أين

φ=(تيφ(ت)2دت)12.{\displaystyle \Vert \mathbf {\varphi} \Vert =\left(\int _{\mathcal {T}}\varphi (t)^{2}dt\right)^{\frac {1}{2}}.}

الدالة الذاتية رقم kφك{\displaystyle \varphi _{k}}النمط السائد للتغير المتعامد معφ1{\displaystyle \varphi _{1}}،φ2{\displaystyle \varphi _{2}}...φك-1{\displaystyle \varphi _{k-1}}،

φك=أرزمأxφ=1،φ،φج=0 ل ج=1،...،ك-1{متغير(تي(X(ت)-μ(ت))φ(ت)دت)}،{\displaystyle \varphi _{k}={\underset {\Vert \mathbf {\varphi } \Vert =1,\langle \varphi ,\varphi _{j}\rangle =0{\text{ for }}j=1,\dots ,k-1}{\operatorname {arg\,max} }}\left\{\operatorname {Var} \left(\int _{\mathcal {T}}(X(t)-\mu (t))\varphi (t)dt\right)\right\},}

أين

φ،φج=تيφ(ت)φج(ت)دت، ل ج=1،...،ك-1.{\displaystyle \langle \varphi ,\varphi _{j}\rangle =\int _{\mathcal {T}}\varphi (t)\varphi _{j}(t)dt,{\text{ for }}j=1,\dots ,k-1.}

تقدير

لنفترض أن Y <sub>ij</sub> = X<sub> i</sub> ( t<sub> ij</sub> ) + ε<sub> ij </sub> هي المشاهدات التي تم إجراؤها في المواقع (عادةً نقاط زمنية) t<sub> ij</sub> ، حيث X<sub> i </sub> هو التحقق رقم i من العملية العشوائية السلسة التي تولد البيانات، و ε <sub>ij</sub> هي متغيرات عشوائية طبيعية موزعة توزيعًا متطابقًا ومستقلًا بمتوسط ​​0 وتباين σ <sup>2 </sup> ، حيث j = 1, 2, ..., m<sub> i</sub> . للحصول على تقدير لدالة المتوسط ​​μ ( t<sub> ij</sub> )، إذا كانت هناك عينة كثيفة متاحة على شبكة منتظمة ، يمكن حساب المتوسط ​​عند كل موقع t<sub> ij</sub> .

μ^(تأناج)=1نأنا=1نYأناج.{\displaystyle {\hat {\mu}}(t_{ij})={\frac {1}{n}}\sum _{i=1}^{n}Y_{ij}.}

إذا كانت الملاحظات متفرقة، فمن الضروري تنعيم البيانات المجمعة من جميع الملاحظات للحصول على تقدير المتوسط، [ 3 ] باستخدام أساليب التنعيم مثل التنعيم الخطي المحلي أو تنعيم الشرائح .

ثم تقدير دالة التغايرجي^(s،ت){\displaystyle {\hat {G}}(s,t)}يتم الحصول عليها عن طريق حساب المتوسط ​​(في الحالة الكثيفة) أو التنعيم (في الحالة المتفرقة) للتباينات الخام.

جيأنا(تأناج،تأنال)=(Yأناج-μ^(تأناج))(Yأنال-μ^(تأنال))،جل،أنا=1،...،ن.{\displaystyle G_{i}(t_{ij},t_{il})=(Y_{ij}-{\hat {\mu }}(t_{ij}))(Y_{il}-{\hat {\mu }}(t_{il})),j\neq l,i=1,\dots ,n.}

لاحظ أنه يجب إزالة العناصر القطرية لـ G i لأنها تحتوي على خطأ في القياس. [ 4 ]

عملياً،جي^(s،ت){\displaystyle {\hat {G}}(s,t)}يتم تقسيم المصفوفة إلى شبكة كثيفة متساوية المسافات، ويتم تقدير القيم الذاتية λk والمتجهات الذاتية vk باستخدام الجبر الخطي العددي . [ 5 ] تقديرات الدوال الذاتيةφ^ك{\displaystyle {\hat {\varphi }}_{k}}ويمكن الحصول عليها بعد ذلك عن طريق استيفاء المتجهات الذاتيةvك^.{\displaystyle {\hat {v_{k}}}.}

ينبغي أن يكون التغاير المُقاس موجبًا تمامًا ومتماثلًا ، ويتم الحصول عليه على النحو التالي:

جي~(s،ت)=λك>0λ^كφ^ك(s)φ^ك(ت).{\displaystyle {\tilde {G}}(s,t)=\sum _{\lambda _{k}>0}{\hat {\lambda }}_{k}{\hat {\varphi }}_{k}(s){\hat {\varphi }}_{k}(t).}

يتركV^(ت){\displaystyle {\hat {V}}(t)}لتكن نسخة مُنعّمة من العناصر القطرية G i ( t ij , t ij ) لمصفوفات التغاير الخام. عندئذٍV^(ت){\displaystyle {\hat {V}}(t)}يمثل تقديرًا لـ ( G ( t , t ) + σ² ) . ويتم الحصول على تقدير σ² من خلال

σ^2=2|تي|تي(V^(ت)-جي~(ت،ت))دت،{\displaystyle {\hat {\sigma }}^{2}={\frac {2}{|{\mathcal {T}}|}}\int _{\mathcal {T}}({\hat {V}}(t)-{\tilde {G}}(t,t))dt,}لوσ^2>0؛{\displaystyle {\hat {\sigma }}^{2}>0;}خلاف ذلكσ^2=0.{\displaystyle {\hat {\sigma }}^{2}=0.}

إذا كانت المشاهدات X <sub>ij</sub> ، حيث j = 1، 2، ...، m <sub> i </sub>، كثيفة في 𝒯، فإنه يمكن تقدير FPC رقم k ، ξ<sub> k </sub>، عن طريق التكامل العددي ، بتطبيق

ξ^ك=X-μ^،φ^ك.{\displaystyle {\hat {\xi }}_{k}=\langle X-{\hat {\mu }},{\hat {\varphi}}_{k}\rangle .}

لكن إذا كانت الملاحظات قليلة، فلن تنجح هذه الطريقة. بدلاً من ذلك، يمكن استخدام أفضل المتنبئات الخطية غير المتحيزة ، [ 3 ] مما ينتج عنه

ξ^ك=λ^كφ^كتيΣ^Yأنا-1(Yأنا-μ^)،{\displaystyle {\hat {\xi }}_{k}={\hat {\lambda }}_{k}{\hat {\varphi }}_{k}^{T}{\hat {\Sigma }}_{Y_{i}}^{-1}(Y_{i}-{\hat {\mu }}),}

أين

Σ^Yأنا=جي~+σ^2أنامأنا{\displaystyle {\hat {\Sigma }}_{Y_{i}}={\tilde {G}}+{\hat {\sigma }}^{2}\mathbf {I} _{m_{i}}}،

وجي~{\displaystyle {\tilde {G}}}يتم تقييمها عند نقاط الشبكة التي تم إنشاؤها بواسطة t ij ، حيث j = 1، 2، ...، m i . تتوفر حزمة Matlab للخوارزمية، PACE، [ 6 ] وحزمة R [ 7 ].

تم التحقق من خصائص التقارب التقاربي لهذه التقديرات. [ 3 ] [ 8 ] [ 9 ]

التطبيقات

يمكن تطبيق تحليل المكونات الرئيسية الوظيفية (FPCA) لعرض أنماط التباين الوظيفي ، [ 1 ] [ 10 ] في مخططات التشتت للمكونات الرئيسية الوظيفية مقابل بعضها البعض أو للاستجابات مقابل المكونات الرئيسية الوظيفية، لنمذجة البيانات الطولية المتفرقة ، [ 3 ] أو للانحدار الوظيفي والتصنيف (مثل الانحدار الخطي الوظيفي ). [ 2 ] يمكن استخدام مخططات التباين وغيرها من الطرق لتحديد عدد المكونات المضمنة. لتحليل المكونات الرئيسية الوظيفية تطبيقات متنوعة في تحليل السلاسل الزمنية . حاليًا، يجري تكييف هذه الطريقة من التقنيات متعددة المتغيرات التقليدية لتحليل مجموعات البيانات المالية مثل مؤشرات سوق الأسهم وإنشاء رسوم بيانية للتقلب الضمني. [ 11 ] من الأمثلة الجيدة على مزايا المنهج الوظيفي تحليل المكونات الرئيسية الوظيفية المُنعّم (SPCA)، الذي طوره سيلفرمان [1996] ودرسه بيزولي وسيلفرمان [1993]، والذي يُتيح الدمج المباشر بين تحليل المكونات الرئيسية الوظيفية ومنهجية تنعيم عامة تُسهّل استخدام المعلومات المُخزّنة في بعض المؤثرات التفاضلية الخطية. ومن التطبيقات المهمة لتحليل المكونات الرئيسية الوظيفية، والمعروفة في تحليل المكونات الرئيسية متعدد المتغيرات، تحليل كارونين-لوف لدالة عشوائية إلى مجموعة من المعاملات الوظيفية - دوال العوامل ومعاملات التحميل المقابلة (المتغيرات العشوائية العددية). يُعد هذا التطبيق أكثر أهمية من تحليل المكونات الرئيسية متعدد المتغيرات القياسي، لأن توزيع الدالة العشوائية يكون معقدًا للغاية بحيث لا يُمكن تحليله مباشرةً، ويُختزل تحليل كارونين-لوف التحليل إلى تفسير دوال العوامل وتوزيع المتغيرات العشوائية العددية. وبفضل تقليل الأبعاد ودقته في تمثيل البيانات، هناك مجال واسع لمزيد من تطوير تقنيات المكونات الرئيسية الوظيفية في المجال المالي.

العلاقة بتحليل المكونات الرئيسية

يُبيّن الجدول التالي مقارنة بين عناصر مختلفة من تحليل المكونات الرئيسية (PCA) وتحليل المكونات الرئيسية الوظيفية (FPCA). تُستخدم كلتا الطريقتين لتقليل الأبعاد . في التطبيقات العملية، يستخدم تحليل المكونات الرئيسية الوظيفية خطوة تحليل المكونات الرئيسية.

مع ذلك، يختلف تحليل المكونات الرئيسية (PCA) وتحليل المكونات الوظيفية (FPCA) في بعض الجوانب الجوهرية. أولًا، يمكن تبديل ترتيب البيانات متعددة المتغيرات في PCA ، وهو ما لا يؤثر على التحليل، بينما يحمل ترتيب البيانات الوظيفية معلومات زمنية أو مكانية ولا يمكن إعادة ترتيبه. ثانيًا، يُعد تباعد المشاهدات مهمًا في FPCA، بينما لا توجد مشكلة تباعد في PCA. ثالثًا، لا يُجدي PCA العادي نفعًا مع البيانات عالية الأبعاد دون تنظيم ، بينما يتميز FPCA بتنظيم مُدمج نظرًا لسلاسة البيانات الوظيفية وتقليص عدد المكونات المُضمنة إلى عدد محدود.

عنصرفي تحليل المكونات الرئيسيةفي قانون حماية المستهلك المالي
بياناتXRص{\displaystyle X\in \mathbb {R} ^{p}}Xل2(تي){\displaystyle X\in L^{2}({\mathcal {T}})}
الأبعادص<{\displaystyle p<\infty }{\displaystyle \infty }
يقصدμ=هـ(X){\displaystyle \mu ={\text{E}}(X)}μ(ت)=هـ(X(ت)){\displaystyle \mu (t)={\text{E}}(X(t))}
التغايركوف(X)=Σص×ص{\displaystyle {\text{Cov}}(X)=\Sigma _{p\times p}}كوف(X(s)،X(ت))=جي(s،ت){\displaystyle {\text{Cov}}(X(s),X(t))=G(s,t)}
القيم الذاتيةλ1،λ2،...،λص{\displaystyle \lambda _{1},\lambda _{2},\dots ,\lambda _{p}}λ1،λ2،...{\displaystyle \lambda _{1},\lambda _{2},\dots }
المتجهات الذاتية/الدوال الذاتيةv1،v2،...،vص{\displaystyle \mathbf {v} _{1},\mathbf {v} _{2},\dots ,\mathbf {v} _{p}}φ1(ت)،φ2(ت)،...{\displaystyle \varphi _{1}(t),\varphi _{2}(t),\dots }
المنتج الداخليX،Y=ك=1صXكYك{\displaystyle \langle \mathbf {X} ,\mathbf {Y} \rangle =\sum _{k=1}^{p}X_{k}Y_{k}}X،Y=تيX(ت)Y(ت)دت{\displaystyle \langle X,Y\rangle =\int _{\mathcal {T}}X(t)Y(t)dt}
المكونات الرئيسيةzك=X-μ،vك،ك=1،2،...،ص{\displaystyle z_{k}=\langle X-\mu ,\mathbf {v_{k}} \rangle ,k=1,2,\dots ,p}ξك=X-μ،φك،ك=1،2،...{\displaystyle \xi _{k}=\langle X-\mu ,\varphi _{k}\rangle ,k=1,2,\dots }

انظر أيضاً

ملحوظات

  1. 1 2 جونز، إم سي؛ رايس، جيه إيه (1992). "عرض السمات المهمة لمجموعات كبيرة من المنحنيات المتشابهة". الإحصائي الأمريكي . 46 (2): 140. doi : 10.1080/00031305.1992.10475870 .
  2. 1 2 ياو، ف.؛ مولر، هـ. ج.؛ وانغ، ج. ل. (2005). "تحليل الانحدار الخطي الوظيفي للبيانات الطولية". حوليات الإحصاء . 33 (6): 2873. arXiv : math/0603132 . doi : 10.1214/009053605000000660 .
  3. 1 2 3 4 ياو، ف.؛ مولر، هـ. ج.؛ وانغ، ج. ل. (2005). "تحليل البيانات الوظيفية للبيانات الطولية المتفرقة". مجلة الجمعية الإحصائية الأمريكية . 100 (470): 577. doi : 10.1198/016214504000001745 .
  4. ستانيسواليس، جي جي ؛ لي، جي جي (1998). "تحليل الانحدار غير البارامتري للبيانات الطولية". مجلة الجمعية الإحصائية الأمريكية . 93 (444): 1403. doi : 10.1080/01621459.1998.10473801 .
  5. رايس، جون؛ سيلفرمان، ب. (1991). "تقدير المتوسط ​​وبنية التباين بطريقة غير معلمية عندما تكون البيانات عبارة عن منحنيات". مجلة الجمعية الإحصائية الملكية. السلسلة ب (المنهجية) . 53 (1): 233-243 . doi : 10.1111/j.2517-6161.1991.tb01821.x .
  6. "PACE: التحليل الرئيسي عن طريق التوقع الشرطي" .
  7. "fdapace: تحليل البيانات الوظيفية والديناميكيات التجريبية" . 2018-02-25.
  8. هول، ب.؛ مولر، هـ. ج.؛ وانغ، ج. ل. (2006). "خصائص طرق المكونات الرئيسية لتحليل البيانات الوظيفية والطولية". حوليات الإحصاء . 34 (3): 1493. arXiv : math/0608022 . doi : 10.1214/009053606000000272 .
  9. لي، ي.؛ هسينغ، ت. (2010). "معدلات التقارب المنتظم للانحدار غير البارامتري وتحليل المكونات الرئيسية في البيانات الوظيفية/الطولية". حوليات الإحصاء . 38 (6): 3321. arXiv : 1211.2137 . doi : 10.1214/10-AOS813 .
  10. مادريغال، بيدرو؛ كراجيفسكي، باويل (2015). " الكشف عن التباين المترابط في مجموعات بيانات علم التخلق باستخدام تحويل كارونين-لوف" . BioData Mining . 8 : 20. doi : 10.1186/s13040-015-0051-7 . PMC 4488123. PMID 26140054 .  
  11. تحليل البيانات الوظيفية مع تطبيقات في مجال التمويل، بقلم ميخال بينكو

مراجع