أسلوب عنق الزجاجة المعلوماتي

تُعدّ طريقة عنق الزجاجة المعلوماتية تقنيةً في نظرية المعلومات، قدّمها نفتالي تيشبي ، وفرناندو سي. بيريرا، وويليام بياليك . [ 1 ] وهي مصممة لإيجاد أفضل توازن بين الدقة والتعقيد ( الضغط ) عند تلخيص (مثل التجميع ) متغير عشوائي X ، بالنظر إلى توزيع احتمالي مشترك p(X,Y) بين X ومتغير ذي صلة مُلاحَظ Y. وتُعرّف هذه الطريقة نفسها بأنها توفر "إطارًا غنيًا بشكلٍ مُدهش لمناقشة مجموعة متنوعة من المشكلات في معالجة الإشارات والتعلم" . [ 1 ]

تشمل التطبيقات التجميع التوزيعي وتقليل الأبعاد ، وقد اقتُرح مؤخرًا كأساس نظري للتعلم العميق . وقد عمّم هذا المفهوم الكلاسيكي للإحصاءات الكافية الدنيا من الإحصاءات البارامترية إلى التوزيعات العشوائية، ليس بالضرورة ذات الشكل الأسي. ويتم ذلك عن طريق تخفيف شرط الكفاية لالتقاط جزء من المعلومات المتبادلة مع المتغير ذي الصلة Y.

يمكن النظر إلى عنق الزجاجة المعلوماتي أيضًا على أنه مشكلة تشويه معدل ، حيث تقيس دالة التشويه مدى دقة التنبؤ بـ Y من تمثيل مضغوط T مقارنةً بالتنبؤ المباشر به من X. يوفر هذا التفسير خوارزمية تكرارية عامة لحل مفاضلة عنق الزجاجة المعلوماتي وحساب منحنى المعلومات من التوزيع p(X,Y) .

لنفترض أن التمثيل المضغوط معطى بواسطة متغير عشوائيتي{\displaystyle T}تعمل الخوارزمية على تقليل الدالة التالية بالنسبة للتوزيع الشرطيص(ت|x){\displaystyle p(t|x)}:

معلوماتص(ت|x)(أنا(X؛تي)-βأنا(تي؛Y))،{\displaystyle \inf _{p(t|x)}\,\,{\Big (}I(X;T)-\beta I(T;Y){\Big )},}

أينأنا(X؛تي){\displaystyle I(X;T)}وأنا(تي؛Y){\displaystyle I(T;Y)}المعلومات المتبادلة لـX{\displaystyle X}وتي{\displaystyle T}و منتي{\displaystyle T}وY{\displaystyle Y}، على التوالي، وβ{\displaystyle \beta }هو مُضاعِف لاغرانج .

نظرية التعلم للتعلم العميق

لقد ثبت رياضياً أن التحكم في اختناق المعلومات هو إحدى طرق التحكم في خطأ التعميم في التعلم العميق. [ 2 ] أي أن خطأ التعميم يتناسب طردياً معيا~(أنا(X،تي)+1ن){\displaystyle {\tilde {O}}\left({\sqrt {\frac {I(X,T)+1}{n}}}\right)}أينن{\displaystyle n}يمثل عدد عينات التدريب،X{\displaystyle X}وهو المدخل لشبكة عصبية عميقة، وتي{\displaystyle T}يمثل هذا الناتج طبقة مخفية. ويتناسب حد التعميم هذا مع درجة اختناق المعلومات، على عكس حدود التعميم الأخرى التي تتناسب مع عدد المعلمات، أو بُعد VC ، أو تعقيد رادماخر ، أو الاستقرار، أو المتانة.

التحولات الطورية

نظرية المعلومات في التعلم العميق

تُستخدم نظرية اختناق المعلومات مؤخرًا لدراسة الشبكات العصبية العميقة (DNN). [ 3 ] لنأخذ مثالًاX{\displaystyle X}وY{\displaystyle Y}على التوالي كطبقات الإدخال والإخراج لشبكة عصبية عميقة، وتي{\displaystyle T}يمكن أن تكون أي طبقة مخفية من الشبكة. اقترح شوارتز-زيف وتيشبي مفهوم عنق الزجاجة المعلوماتي الذي يعبر عن المفاضلة بين مقاييس المعلومات المتبادلةأنا(X،تي){\displaystyle I(X,T)}وأنا(تي،Y){\displaystyle I(T,Y)}في هذه الحالة،أنا(X،تي){\displaystyle I(X,T)}وأنا(تي،Y){\displaystyle I(T,Y)}يُحدد كل منهما كمية المعلومات التي تحتويها الطبقة المخفية حول المدخلات والمخرجات. وقد افترضوا أن عملية تدريب الشبكة العصبية العميقة تتكون من مرحلتين منفصلتين؛ 1) مرحلة ملاءمة أولية يتم فيهاأنا(تي،Y){\displaystyle I(T,Y)}2) زيادة، و2) مرحلة ضغط لاحقة يكون فيهاأنا(X،تي){\displaystyle I(X,T)}يتناقص. وقد عارض ساكس وآخرون في [ 4 ] ادعاء شوارتز-زيف وتيشبي [ 3 ] ، مصرحين بأن ظاهرة الانضغاط هذه في الشبكات العصبية العميقة ليست شاملة، وتعتمد على دالة التنشيط المستخدمة . وعلى وجه الخصوص، زعموا أن الانضغاط لا يحدث مع دوال تنشيط ReLU. وقد عارض شوارتز-زيف وتيشبي هذه الادعاءات، بحجة أن ساكس وآخرون لم يلاحظوا الانضغاط بسبب ضعف تقديرات المعلومات المتبادلة. من ناحية أخرى، جادل غولدفليد وآخرون مؤخرًا بأن الانضغاط الملحوظ هو نتيجة لظواهر هندسية، وليس لظواهر نظرية المعلومات [ 5 ] ، وهو رأي تم تبنيه أيضًا في [ 6 ] .

عنق الزجاجة التبايني

عنق الزجاجة الغاوسي

تؤدي عنق الزجاجة الغاوسي، [ 7 ] أي تطبيق منهج عنق الزجاجة المعلوماتي على المتغيرات الغاوسية، إلى حلول تتعلق بتحليل الارتباط الكنسي . افترضX،Y{\displaystyle X,Y\,}هي متجهات طبيعية متعددة المتغيرات ذات متوسط ​​صفري ومتغايرات مشتركة.ΣXX،ΣYY{\displaystyle \Sigma _{XX},\,\,\Sigma _{YY}}وتي{\displaystyle T\,}هي نسخة مضغوطة منX{\displaystyle X\,}يجب أن يحافظ ذلك على قيمة معينة من المعلومات المتبادلة معY{\displaystyle Y\,}يمكن إثبات أن الأمثلتي{\displaystyle T\,}هو متجه عمودي يتكون من تراكيب خطية لعناصرX،تي=أX{\displaystyle X,\,\,T=AX\,}حيث المصفوفةأ{\displaystyle A\,}يحتوي على صفوف متعامدة.

مصفوفة الإسقاطأ{\displaystyle A\,}في الواقع يحتويم{\displaystyle M\,}الصفوف المختارة من المتجهات الذاتية اليسرى الموزونة لتحليل القيم المفردة للمصفوفة (غير متماثلة بشكل عام)

Ω=ΣX|YΣXX-1=أنا-ΣXYΣYY-1ΣXYتيΣXX-1.\displaystyle \Omega =\Sigma _{X|Y}\Sigma _{XX}^{-1}=I-\Sigma _{XY}\Sigma _{YY}^{-1}\Sigma _{XY}^{T}\Sigma _{XX}^{-1}.\,}

عرّف تحليل القيم المفردة

Ω=يوΛVتي مع Λ=التشخيص(λ1λ2λشمال){\displaystyle \Omega =U\Lambda V^{T}{\text{ with }}\Lambda =\operatorname {Diag} {\big (}\lambda _{1}\leq \lambda _{2}\cdots \lambda _{N}{\big )}\,}

والقيم الحرجة

βأناج=λأنا<1(1-λأنا)-1.{\displaystyle \beta _{i}^{C}{\underset {\lambda _{i}<1}{=}}(1-\lambda _{i})^{-1}.\,}

ثم الرقمم{\displaystyle M\,}عدد المتجهات الذاتية الفعالة في الإسقاط، أو رتبة التقريب، يُعطى بواسطة

βم-1ج<ββمج{\displaystyle \beta _{M-1}^{C}<\beta \leq \beta _{M}^{C}}

وأخيراً نحصل على

أ=[w1يو1،...،wميوم]تي{\displaystyle A=[w_{1}U_{1},\dots ,w_{M}U_{M}]^{T}}

حيث تُعطى الأوزان بواسطة

wأنا=(β(1-λأنا)-1)/λأنارأنا{\displaystyle w_{i}={\sqrt {\left(\beta (1-\lambda _{i})-1\right)/\lambda _{i}r_{i}}}}

أينرأنا=يوأناتيΣXXيوأنا.{\displaystyle r_{i}=U_{i}^{T}\Sigma _{XX}U_{i}.\,}

يؤدي تطبيق نموذج عنق الزجاجة المعلوماتي الغاوسي على السلاسل الزمنية (العمليات) إلى حلول تتعلق بالترميز التنبؤي الأمثل . هذا الإجراء مكافئ شكليًا لتحليل الميزات البطيئة الخطية . [ 8 ]

يمكن الكشف عن البنى الزمنية المثلى في الأنظمة الديناميكية الخطية من خلال ما يُعرف بـ"عنق الزجاجة المعلوماتي بين الماضي والمستقبل"، وهو تطبيق لمنهجية عنق الزجاجة على البيانات المأخوذة عينات منها غير غاوسية. [ 9 ] لا يخلو هذا المفهوم، كما تناوله كرويتزيج وتيشبي وآخرون، من التعقيد، إذ يتألف من مرحلتين مستقلتين: أولاً، تقدير كثافات الاحتمال الأصلية المجهولة التي تُسحب منها عينات البيانات، وثانياً، استخدام هذه الكثافات ضمن الإطار النظري للمعلومات الخاص بعنق الزجاجة.

تقدير الكثافة

بما أن طريقة عنق الزجاجة تُصاغ بعبارات احتمالية وليست إحصائية، فإن كثافة الاحتمال الأساسية عند نقاط العينةX=xأنا{\displaystyle X={x_{i}}\,}يجب تقديرها. هذه مشكلة معروفة ولها حلول متعددة وصفها سيلفرمان . [ 10 ] في الطريقة الحالية، يتم إيجاد احتمالات العينة المشتركة باستخدام طريقة مصفوفة انتقال ماركوف ، وهذا له بعض التآزر الرياضي مع طريقة عنق الزجاجة نفسها.

مقياس المسافة المتزايد بشكل تعسفيو{\displaystyle f\,}بين جميع أزواج العينات ومصفوفة المسافة هيدأنا،ج=و(|xأنا-xج|){\displaystyle d_{i,j}=f{\Big (}{\Big |}x_{i}-x_{j}{\Big |}{\Big )}}ثم احتمالات الانتقال بين أزواج العيناتPأنا،ج=خبرة(-λدأنا،ج){\displaystyle P_{i,j}=\exp(-\lambda d_{i,j})\,}بالنسبة للبعضλ>0{\displaystyle \lambda >0\,}يجب حسابها. يتم التعامل مع العينات كحالات، ونسخة مُعَيَّرة منP{\displaystyle P\,}باعتبارها مصفوفة احتمالية انتقال حالة ماركوف، فإن متجه احتمالات "الحالات" بعدت{\displaystyle t\,}خطوات، مشروطة بالحالة الأوليةص(0){\displaystyle p(0)\,}، يكونص(ت)=Pتص(0){\displaystyle p(t)=P^{t}p(0)\,}متجه احتمالية التوازنص(){\displaystyle p(\infty )\,}معطاة بالطريقة المعتادة بواسطة المتجه الذاتي المهيمن للمصفوفةP{\displaystyle P\,}وهو أمر مستقل عن متجه التهيئةص(0){\displaystyle p(0)\,}. تحدد طريقة انتقال ماركوف هذه احتمالًا عند نقاط العينة يُزعم أنه يتناسب مع كثافات الاحتمالات هناك.

تفسيرات أخرى لاستخدام القيم الذاتية لمصفوفة المسافةد{\displaystyle d\,}تمت مناقشتها في كتاب سيلفرمان " تقدير الكثافة للإحصاء وتحليل البيانات" . [ 10 ]

مجموعة

في مثال التجميع المرن التالي، متجه المرجعY{\displaystyle Y\,}يحتوي على فئات العينة والاحتمال المشتركص(X،Y){\displaystyle p(X,Y)\,}يُفترض أن يكون معروفًا. مجموعة ناعمةجك{\displaystyle c_{k}\,}يتم تعريفها من خلال توزيعها الاحتمالي على عينات البياناتxأنا:ص(جك|xأنا){\displaystyle x_{i}:\,\,\,p(c_{k}|x_{i})}قدّم تيشبي وآخرون [ 1 ] مجموعة المعادلات التكرارية التالية لتحديد المجموعات، والتي تُعدّ في نهاية المطاف تعميمًا لخوارزمية بلاهوت-أريموتو ، المُطوّرة في نظرية معدل التشوه . ويبدو أن تطبيق هذا النوع من الخوارزميات في الشبكات العصبية ينبع من حجج الإنتروبيا التي تظهر عند تطبيق توزيعات جيبس ​​في التلدين الحتمي. [ 11 ] [ 12 ]

{ص(ج|x)=كص(ج)خبرة(-βدكل[ص(y|x)||ص(y|ج)])ص(y|ج)=xص(y|x)ص(ج|x)ص(x)/ص(ج)ص(ج)=xص(ج|x)ص(x){\displaystyle {\begin{cases}p(c|x)=Kp(c)\exp {\Big (}-\beta \,D^{KL}{\Big [}p(y|x)\,||\,p(y|c){\Big ]}{\Big )}\\p(y|c)=\textstyle \sum _{x}p(y|x)p(c|x)p(x){\big /}p(c)\\p(c)=\textstyle \sum _{x}p(c|x)p(x)\\\end{cases}}}

تتوسع وظيفة كل سطر من التكرار على النحو التالي

السطر 1: هذه مجموعة احتمالات شرطية ذات قيم مصفوفية

أأنا،ج=ص(جأنا|xج)=كص(جأنا)خبرة(-βدكل[ص(y|xج)||ص(y|جأنا)]){\displaystyle A_{i,j}=p(c_{i}|x_{j})=Kp(c_{i})\exp {\Big (}-\beta \,D^{KL}{\Big [}p(y|x_{j})\,||\,p(y|c_{i}){\Big ]}{\Big )}}

تباعد كولباك -لايبيردكل{\displaystyle D^{KL}\,}بينY{\displaystyle Y\,}المتجهات الناتجة عن بيانات العينةx{\displaystyle x\,}وتلك التي تم إنشاؤها بواسطة وكيل المعلومات المختزل الخاص بهاج{\displaystyle c\,}يتم تطبيقها لتقييم مدى دقة المتجه المضغوط بالنسبة للبيانات المرجعية (أو الفئوية)Y{\displaystyle Y\,}وفقًا لمعادلة عنق الزجاجة الأساسية.دكل(أ||ب){\displaystyle D^{KL}(a||b)\,}هو تباعد كولباك-لايبير بين التوزيعاتأ،ب{\displaystyle a,b\,}

دكل(أ||ب)=أناص(أأنا)سجل(ص(أأنا)ص(بأنا)){\displaystyle D^{KL}(a||b)=\sum _{i}p(a_{i})\log {\Big (}{\frac {p(a_{i})}{p(b_{i})}}{\Big )}}

وك{\displaystyle K\,}هو توحيد قياسي. يعني الترجيح بالأس السالب للمسافة أن احتمالات التجميع المسبقة يتم تقليلها في السطر 1 عندما يكون تباعد كولباك-لايبير كبيرًا، وبالتالي تزداد احتمالية المجموعات الناجحة بينما تتلاشى احتمالية المجموعات غير الناجحة.

السطر 2: مجموعة ثانية من الاحتمالات الشرطية ذات القيم المصفوفية. بحسب التعريف

ص(yأنا|جك)=جص(yأنا|xج)ص(xج|جك)=جص(yأنا|xج)ص(xج،جك)/ص(جك)=جص(yأنا|xج)ص(جك|xج)ص(xج)/ص(جك){\displaystyle {\begin{aligned}p(y_{i}|c_{k})&=\sum _{j}p(y_{i}|x_{j})p(x_{j}|c_{k})\\&=\sum _{j}p(y_{i}|x_{j})p(x_{j},c_{k}){\big /}p(c_{k})\\&=\sum _{j}p(y_{i}|x_{j})p(c_{k}|x_{j})p(x_{j}){\big /}p(c_{k})\\\end{aligned}}}

حيث متطابقات بايزص(أ،ب)=ص(أ|ب)ص(ب)=ص(ب|أ)ص(أ){\displaystyle p(a,b)=p(a|b)p(b)=p(b|a)p(a)\,}تُستخدم.

السطر 3: يحدد هذا السطر التوزيع الهامشي للمجموعاتج{\displaystyle c\,}

ص(جأنا)=جص(جأنا،xج)=جص(جأنا|xج)ص(xج){\displaystyle {\begin{aligned}p(c_{i})&=\sum _{j}p(c_{i},x_{j})&=\sum _{j}p(c_{i}|x_{j})p(x_{j})\end{aligned}}}

هذه نتيجة قياسية.

وتشمل المدخلات الأخرى للخوارزمية توزيع العينة الهامشيةص(x){\displaystyle p(x)\,}والتي تم تحديدها بالفعل بواسطة المتجه الذاتي المهيمن لـP{\displaystyle P\,}ودالة تباعد كولباك-لايبير ذات القيم المصفوفية

دأنا،جكل=دكل[ص(y|xج)||ص(y|جأنا)]){\displaystyle D_{i,j}^{KL}=D^{KL}{\Big [}p(y|x_{j})\,||\,p(y|c_{i}){\Big ]}{\Big )}}

مستمدة من تباعد العينات واحتمالات الانتقال.

المصفوفةص(yأنا|جج){\displaystyle p(y_{i}|c_{j})\,}يمكن تهيئتها عشوائيًا أو بتخمين معقول، بينما المصفوفةص(جأنا|xج){\displaystyle p(c_{i}|x_{j})\,}لا يحتاج إلى قيم مسبقة. على الرغم من أن الخوارزمية تتقارب، فقد توجد عدة نقاط دنيا يجب حلها. [ 13 ]

تحديد ملامح القرار

لتصنيف عينة جديدةx{\displaystyle x'\,}خارج مجموعة التدريبX{\displaystyle X\,}يحدد مقياس المسافة السابق احتمالات الانتقال بينx{\displaystyle x'\,}وجميع العينات فيX:{\displaystyle X:\,\,}،ص~(xأنا)=ص(xأنا|x)=كخبرة(-λو(|xأنا-x|)){\displaystyle {\tilde {p}}(x_{i})=p(x_{i}|x')=\mathrm {K} \exp {\Big (}-\lambda f{\big (}{\Big |}x_{i}-x'{\Big |}{\big )}{\Big )}}معك{\displaystyle \mathrm {K} \,}أولاً، قم بتطبيق عملية التطبيع. ثانياً، قم بتطبيق السطرين الأخيرين من الخوارزمية المكونة من 3 أسطر للحصول على احتمالات التجميع والفئات الشرطية.

ص~(جأنا)=ص(جأنا|x)=جص(جأنا|xج)ص(xج|x)=جص(جأنا|xج)ص~(xج)ص(yأنا|جج)=كص(yأنا|xك)ص(جج|xك)ص(xك|x)/ص(جج|x)=كص(yأنا|xك)ص(جج|xك)ص~(xك)/ص~(جج){\displaystyle {\begin{aligned}&{\tilde {p}}(c_{i})=p(c_{i}|x')=\sum _{j}p(c_{i}|x_{j})p(x_{j}|x')=\sum _{j}p(c_{i}|x_{j}){\tilde {p}}(x_{j})\\&p(y_{i}|c_{j})=\sum _{k}p(y_{i}|x_{k})p(c_{j}|x_{k})p(x_{k}|x')/p(c_{j}|x')=\sum _{k}p(y_{i}|x_{k})p(c_{j}|x_{k}){\tilde {p}}(x_{k})/{\tilde {p}}(c_{j})\\\end{aligned}}}

أخيراً

ص(yأنا|x)=جص(yأنا|جج)ص(جج|x))=جص(yأنا|جج)ص~(جج){\displaystyle p(y_{i}|x')=\sum _{j}p(y_{i}|c_{j})p(c_{j}|x'))=\sum _{j}p(y_{i}|c_{j}){\tilde {p}}(c_{j})\,}

المعلمةβ{\displaystyle \beta \,}يجب إبقاؤها تحت إشراف دقيق لأنه مع زيادتها من الصفر، تزداد أعداد الميزات في فضاء احتمالية الفئة ، وتبرز عند عتبات حرجة معينة.

مثال

تتناول الحالة التالية عملية التجميع في مضاعف رباعي الأرباع مع مدخلات عشوائية.u،v{\displaystyle u,v\,}وفئتان من المخرجات،±1{\displaystyle \pm 1\,}، تم إنشاؤه بواسطةy=لافتة(uv){\displaystyle y=\operatorname {sign} (uv)\,}تحتوي هذه الوظيفة على مجموعتين منفصلتين مكانيًا لكل فئة، وبالتالي توضح أن الطريقة يمكنها التعامل مع مثل هذه التوزيعات.

تم أخذ 20 عينة، موزعة بشكل متساوٍ على المربع[-1،1]2{\displaystyle [-1,1]^{2}\,}إن عدد المجموعات المستخدمة، بالإضافة إلى عدد الفئات (اثنتان في هذه الحالة)، لا يؤثر بشكل كبير على الأداء، وقد تم عرض النتائج لمجموعتين باستخدام المعلمات.λ=3،β=2.5{\displaystyle \lambda =3,\,\beta =2.5}.

دالة المسافة هيدأنا،ج=|xأنا-xج|2{\displaystyle d_{i,j}={\Big |}x_{i}-x_{j}{\Big |}^{2}}أينxأنا=(uأنا،vأنا)تي{\displaystyle x_{i}=(u_{i},v_{i})^{T}\,}بينما التوزيع الشرطيص(y|x){\displaystyle p(y|x)\,}هي مصفوفة 2  ×  20

Pر(yأنا=1)=1 لو لافتة(uأناvأنا)=1Pر(yأنا=-1)=1 لو لافتة(uأناvأنا)=-1{\displaystyle {\begin{aligned}&Pr(y_{i}=1)=1{\text{ if }}\operatorname {sign} (u_{i}v_{i})=1\,\\&Pr(y_{i}=-1)=1{\text{ if }}\operatorname {sign} (u_{i}v_{i})=-1\,\end{aligned}}}

ولا شيء في أي مكان آخر.

يتضمن المجموع في السطر 2 قيمتين فقط تمثلان قيم التدريب +1 أو -1 ، ولكنه مع ذلك يعمل بشكل جيد. يوضح الشكل مواقع العينات العشرين، حيث يمثل '0' قيمة Y = 1، ويمثل 'x' قيمة Y = -1 . ويظهر منحنى التوزيع عند مستوى نسبة الاحتمالية الموحدة.

ل=برو(1)برو(-1)=1{\displaystyle L={\frac {\Pr(1)}{\Pr(-1)}}=1}

كعينة جديدةx{\displaystyle x'\,}يتم مسح المربع ضوئيًا. من الناحية النظرية، يجب أن يتوافق المحيط معu=0{\displaystyle u=0\,}وv=0{\displaystyle v=0\,}الإحداثيات، ولكن بالنسبة لأعداد العينات الصغيرة هذه، فقد اتبعوا بدلاً من ذلك التجمعات الزائفة لنقاط العينة.

ملامح القرار

تشبيهات الشبكة العصبية/المنطق الضبابي

تُشبه هذه الخوارزمية إلى حد ما الشبكة العصبية ذات الطبقة المخفية الواحدة. ويتم تمثيل العقد الداخلية بواسطة المجموعات.جج{\displaystyle c_{j}\,}والطبقتان الأولى والثانية من أوزان الشبكة هما الاحتمالات الشرطيةص(جج|xأنا){\displaystyle p(c_{j}|x_{i})\,}وص(yك|جج){\displaystyle p(y_{k}|c_{j})\,}على التوالي. ومع ذلك، وخلافًا للشبكة العصبية التقليدية، تعتمد الخوارزمية كليًا على الاحتمالات كمدخلات بدلًا من قيم العينة نفسها، بينما تمثل القيم الداخلية وقيم المخرجات جميعها توزيعات كثافة احتمالية شرطية . وتُغلف الدوال غير الخطية بمقياس المسافة.و(.){\displaystyle f(.)\,}(أو دوال التأثير/دوال الأساس الشعاعي ) واحتمالات الانتقال بدلاً من الدوال السينية .

تتقارب خوارزمية بلاهوت-أريموتو ثلاثية الخطوط بسرعة، غالبًا في عشرات التكرارات، وذلك عن طريق التغييرβ{\displaystyle \beta \,}،λ{\displaystyle \lambda \,}وو{\displaystyle f\,}ويمكن تحقيق مستويات مختلفة من التركيز على السمات، وذلك بحسب عدد المجموعات.

تعريف التجميع الإحصائي المرنص(جأنا|xج){\displaystyle p(c_{i}|x_{j})\,}يوجد بعض التداخل مع مفهوم العضوية الضبابية اللفظية في المنطق الضبابي .

الإضافات

يُعدّ اختناق المعلومات مع المعلومات الجانبية امتدادًا مثيرًا للاهتمام. [ 14 ] في هذه الحالة، يتم تعظيم المعلومات حول متغير مستهدف واحد وتقليلها حول متغير آخر، مما يؤدي إلى تعلم تمثيل يُقدّم معلومات حول جوانب مُختارة من البيانات. رسميًا

مينص(ت|x)أنا(X؛تي)-β+أنا(تي؛Y+)+β-أنا(تي؛Y-){\displaystyle \min _{p(t|x)}\,\,I(X;T)-\beta ^{+}I(T;Y^{+})+\beta ^{-}I(T;Y^{-})}

فهرس

مراجع

  1. 1 2 3 تيشبي، نفتالي ؛ بيريرا، فرناندو سي؛ بياليك، ويليام (سبتمبر 1999). طريقة عنق الزجاجة المعلوماتية (ملف PDF) . المؤتمر السنوي السابع والثلاثون لأليرتون حول الاتصالات والتحكم والحوسبة. الصفحات 368-377 . 
  2. كينجي كاواغوتشي، تشون دينغ، شو جي، جياويانغ هوانغ. "كيف تساعد اختناقات المعلومات في التعلم العميق؟" وقائع المؤتمر الدولي الأربعين للتعلم الآلي، PMLR 202:16049-16096، 2023.
  3. 1 2 شوارتز-زيف، رافيد؛ تيشبي، نفتالي (2017). "فتح الصندوق الأسود للشبكات العصبية العميقة عبر المعلومات". arXiv : 1703.00810 [ cs.LG ].
  4. أندرو م. ساكس وآخرون (2018). "حول نظرية عنق الزجاجة المعلوماتي للتعلم العميق" . مؤتمر ICLR 2018، بحث مقدم بشكل سري . 2019 (12): 124020. رمز Bibcode : 2019JSMTE..12.4020S . doi : 10.1088/1742-5468/ab3985 . S2CID 49584497 .  
  5. غولدفليد، زيف؛ وآخرون (2019). "تقدير تدفق المعلومات في الشبكات العصبية العميقة" . المؤتمر الدولي للتعلم الآلي 2019 : 2299-2308 . arXiv : 1810.05728 . 
  6. جيجر، برنارد سي. (2022). "حول تحليلات مستوى المعلومات لمصنفات الشبكات العصبية - مراجعة". معاملات IEEE في الشبكات العصبية وأنظمة التعلم . 33 (12): 7039-7051 . arXiv : 2003.09671 . Bibcode : 2022ITNNL..33.7039G . doi : 10.1109/TNNLS.2021.3089037 . PMID : 34191733. S2CID : 214611728 .  
  7. تشيك، غال؛ غلوبيرسون، أمير؛ تيشبي، نفتالي؛ فايس، يائير (1 يناير 2005). دايان، بيتر (محرر). "اختناق المعلومات للمتغيرات الغاوسية" (ملف PDF) . مجلة أبحاث تعلم الآلة (6) (نُشر في 1 مايو 2005): 165-188 .
  8. كرويتزيغ، فيليكس ؛ سبريكيلر، هينينغ (17-12-2007). "الترميز التنبؤي ومبدأ البطء: منهج قائم على نظرية المعلومات". الحوسبة العصبية . 20 (4): 1026-1041 . CiteSeerX 10.1.1.169.6917 . doi : 10.1162/neco.2008.01-07-455 . ISSN 0899-7667 . PMID 18085988. S2CID 2138951 .    
  9. كروتزيغ، فيليكس؛ غلوبيرسون، أمير؛ تيشبي، نفتالي (27 أبريل 2009). "اختناق المعلومات بين الماضي والمستقبل في الأنظمة الديناميكية". مجلة Physical Review E. 79 ( 4) 041925. Bibcode : 2009PhRvE..79d1925C . doi : 10.1103/PhysRevE.79.041925 . PMID 19518274 . 
  10. 1 2 سيلفرمان، بيرني (1986). تقدير الكثافة للإحصاء وتحليل البيانات . دراسات في الإحصاء والاحتمالات التطبيقية. تشابمان وهول. Bibcode : 1986desd.book.....S . ISBN 978-0-412-24620-3.
  11. سلونيم، نوام؛ تيشبي، نفتالي (1 يناير 2000). "تجميع المستندات باستخدام مجموعات الكلمات عبر طريقة عنق الزجاجة المعلوماتي". وقائع المؤتمر الدولي السنوي الثالث والعشرين لجمعية ACM SIGIR حول البحث والتطوير في استرجاع المعلومات . SIGIR '00. نيويورك، نيويورك، الولايات المتحدة الأمريكية: ACM. الصفحات 208-215 . CiteSeerX 10.1.1.21.3062 . doi : 10.1145/345508.345578 . ISBN   978-1-58113-226-7. S2CID 1373541 . 
  12. دي جيه ميلر، إيه في راو، ك. روز، إيه غيرشو: "خوارزمية تعلم قائمة على نظرية المعلومات لتصنيف الشبكات العصبية". NIPS 1995: ص 591-597
  13. تيشبي، نفتالي ؛ سلونيم، ن. تجميع البيانات بواسطة الاسترخاء الماركوفي وطريقة عنق الزجاجة المعلوماتية (PDF) . أنظمة معالجة المعلومات العصبية (NIPS) 2000. ص 640-646 . 
  14. تشيك، غال؛ تيشبي، نفتالي (2002). "استخراج البنى ذات الصلة بمعلومات جانبية" (ملف PDF) . التطورات في أنظمة معالجة المعلومات العصبية : 857-864 .