نموذج قائم على الطاقة

يُعدّ النموذج القائم على الطاقة ( EBM )، والذي يُطلق عليه أيضًا اسم التعلّم الجماعي الكنسي ( CEL ) أو التعلّم عبر المجموعة الكنسية ( LCE )، تطبيقًا لصياغة المجموعة الكنسية من الفيزياء الإحصائية للتعلّم من البيانات . ويظهر هذا النهج بشكل بارز في الذكاء الاصطناعي التوليدي .

توفر نماذج EBM إطارًا موحدًا للعديد من الأساليب الاحتمالية وغير الاحتمالية لمثل هذا التعلم، وخاصة لتدريب النماذج الرسومية وغيرها من النماذج المنظمة.

تتعلم خوارزمية EBM خصائص مجموعة البيانات المستهدفة وتُنشئ مجموعة بيانات مماثلة ولكن أكبر حجماً. كما تكشف هذه الخوارزميات عن المتغيرات الكامنة في مجموعة البيانات وتُنشئ مجموعات بيانات جديدة ذات توزيع مشابه.

الشبكات العصبية التوليدية القائمة على الطاقة [ 1 ] [ 2 ] هي فئة من النماذج التوليدية التي تهدف إلى تعلم التوزيعات الاحتمالية الصريحة للبيانات في شكل نماذج قائمة على الطاقة، والتي يتم تحديد وظائف الطاقة الخاصة بها بواسطة الشبكات العصبية العميقة الحديثة .

آلات بولتزمان هي شكل خاص من النماذج القائمة على الطاقة مع تحديد معلمات محددة للطاقة. [ 3 ]

وصف

بالنسبة لمدخل معينx{\displaystyle x}يصف النموذج طاقةهـθ(x){\displaystyle E_{\theta }(x)}بحيث يكون توزيع بولتزمانPθ(x)=هـ-βهـθ(x)Z(θ){\displaystyle P_{\theta }(x)={e^{-\beta E_{\theta }(x)} \over Z(\theta )}}هي احتمال (كثافة)، وعادةًβ=1{\displaystyle \beta =1}.

بما أن ثابت التطبيع:

Z(θ):=xXهـ-βهـθ(x)دx{\displaystyle Z(\theta ):=\int _{x\in X}e^{-\beta E_{\theta }(x)}dx}

(المعروفة أيضًا باسم دالة التقسيم ) تعتمد على جميع عوامل بولتزمان لجميع المدخلات الممكنةx{\displaystyle x}، لا يمكن حسابها بسهولة أو تقديرها بشكل موثوق أثناء التدريب باستخدام تقدير الاحتمالية القصوى القياسي .

مع ذلك، ولتحقيق أقصى قدر من الاحتمالية أثناء التدريب، فإن تدرج لوغاريتم الاحتمالية لمثال تدريبي واحدx{\displaystyle x}يتم الحصول عليها باستخدام قاعدة السلسلة :

θسجل(Pθ(x))=هـxPθ[θهـθ(x)]-θهـθ(x)(*){\displaystyle \partial _{\theta }\log \left(P_{\theta }(x)\right)=\mathbb {E} _{x'\sim P_{\theta }}[\partial _{\theta }E_{\theta }(x')]-\partial _{\theta }E_{\theta }(x)\,(*)}

يمكن تقدير القيمة المتوقعة في الصيغة أعلاه للتدرج تقريبًا عن طريق سحب عيناتx{\displaystyle x'}من التوزيعPθ{\displaystyle P_{\theta }}باستخدام سلسلة ماركوف مونت كارلو (MCMC). [ 4 ]

قدّرت النماذج المبكرة القائمة على الطاقة، مثل آلة بولتزمان لهينتون عام 2003 ، هذا التوقع عبر أخذ عينات جيبس ​​المحظورة . أما الأساليب الأحدث فتستخدم ديناميكيات لانجفين للتدرج العشوائي الأكثر كفاءة، حيث تسحب العينات باستخدام: [ 5 ]

x0P0،xأنا+1=xأنا-α2هـθ(xأنا)xأنا+ϵ{\displaystyle x_{0}'\sim P_{0},x_{i+1}'=x_{i}'-{\frac {\alpha }{2}}{\frac {\partial E_{\theta }(x_{i}')}{\partial x_{i}'}}+\epsilon }،

أينϵشمال(0،α){\displaystyle \epsilon \sim {\mathcal {N}}(0,\alpha )}مخزن مؤقت لإعادة تشغيل القيم السابقةxأنا{\displaystyle x_{i}'}يتم استخدامه مع LD لتهيئة وحدة التحسين.

المعاييرθ{\displaystyle \theta }لذلك، يتم تدريب مكونات الشبكة العصبية بطريقة توليدية عبر تقدير الاحتمالية القصوى القائم على سلسلة ماركوف مونت كارلو (MCMC): [ 6 ] تتبع عملية التعلم مخطط "التحليل بالتركيب"، حيث تقوم الخوارزمية، ضمن كل تكرار للتعلم، بأخذ عينات من الأمثلة المركبة من النموذج الحالي باستخدام طريقة MCMC القائمة على التدرج (مثل ديناميكيات لانجفين أو مونت كارلو الهجين )، ثم تقوم بتحديث المعلماتθ{\displaystyle \theta }بناءً على الفرق بين أمثلة التدريب والأمثلة المُصنّعة - انظر المعادلة(*){\displaystyle (*)}يمكن تفسير هذه العملية على أنها عملية متناوبة للبحث عن نمط معين وتغييره ، ولها أيضاً تفسير عدائي. [ 7 ] [ 8 ]

باختصار، يتعلم النموذج وظيفةهـθ{\displaystyle E_{\theta }}التي تربط الطاقات المنخفضة بالقيم الصحيحة، والطاقات الأعلى بالقيم غير الصحيحة.

بعد التدريب، يتم إعطاء نموذج طاقة متقاربهـθ{\displaystyle E_{\theta }}يمكن استخدام خوارزمية متروبوليس -هاستينغز لسحب عينات جديدة. ويُعطى احتمال القبول بالصيغة التالية:

Pأجج(xأناx*)=مين(1،Pθ(x*)Pθ(xأنا)).{\displaystyle P_{acc}(x_{i}\to x^{*})=\min \left(1,{\frac {P_{\theta }(x^{*})}{P_{\theta }(x_{i})}}\right).}

تاريخ

صِيغ مصطلح "النماذج القائمة على الطاقة" لأول مرة في ورقة بحثية نُشرت عام 2003 في مجلة JMLR [ 9 ] ، حيث عرّف المؤلفون تعميمًا لتحليل المكونات المستقلة ليشمل حالة البيانات غير المكتملة باستخدام نماذج الطاقة. واقترحت دراسات مبكرة أخرى حول نماذج الطاقة نماذج تمثل الطاقة كتركيبة من متغيرات كامنة ومتغيرات قابلة للملاحظة.

صفات

تُظهر نماذج EBM خصائص مفيدة: [ 4 ]

  • البساطة والاستقرار. نموذج التوازن القائم على الأدلة هو العنصر الوحيد الذي يحتاج إلى تصميم وتدريب. لا حاجة لتدريب شبكات منفصلة لضمان التوازن.
  • زمن حساب تكيفي. يمكن لنموذج EBM توليد عينات دقيقة ومتنوعة، أو (بسرعة أكبر) عينات خشنة وأقل تنوعًا. مع وقت غير محدود، ينتج عن هذه العملية عينات حقيقية.
  • المرونة. في المشفرات التلقائية المتغيرة (VAE) والنماذج القائمة على التدفق ، يتعلم المولد خريطة من فضاء متصل إلى فضاء (قد يكون) غير متصل يحتوي على أنماط بيانات مختلفة. يمكن لنماذج EBM أن تتعلم تعيين طاقات منخفضة لمناطق منفصلة (أنماط متعددة).
  • التوليد التكيفي. تُعرَّف مولدات EBM ضمنيًا بواسطة التوزيع الاحتمالي، وتتكيف تلقائيًا مع تغير التوزيع (دون تدريب)، مما يسمح لـ EBM بمعالجة المجالات التي يكون فيها تدريب المولد غير عملي، بالإضافة إلى تقليل انهيار النمط وتجنب الأنماط الزائفة من العينات الخارجة عن التوزيع. [ 4 ]
  • التركيبية. النماذج الفردية عبارة عن توزيعات احتمالية غير معيارية، مما يسمح بدمج النماذج من خلال نتاج الخبراء أو التقنيات الهرمية الأخرى.

النتائج التجريبية

في مجموعات بيانات الصور مثل CIFAR-10 و ImageNet 32x32، أنتج نموذج EBM صورًا عالية الجودة بسرعة نسبية. وقد دعم دمج الميزات المستخلصة من نوع معين من الصور لإنتاج أنواع أخرى. كما تمكن من التعميم باستخدام مجموعات بيانات خارج التوزيع، متفوقًا على النماذج القائمة على التدفق والنماذج الانحدارية الذاتية . وأظهر نموذج EBM مقاومة نسبية للتشويشات المعادية، متفوقًا في أدائه على النماذج المدربة خصيصًا لمواجهتها أثناء التدريب على التصنيف. [ 4 ]

التطبيقات

تشمل التطبيقات المستهدفة معالجة اللغة الطبيعية والروبوتات ورؤية الكمبيوتر .

أول شبكة عصبية توليدية قائمة على الطاقة هي شبكة ConvNet التوليدية، التي طُرحت عام 2016 لأنماط الصور، حيث تُعدّ الشبكة العصبية شبكة عصبية التفافية . [ 10 ] [ 11 ] وقد عُمِّم هذا النموذج ليشمل مجالات متنوعة لتعلم توزيعات مقاطع الفيديو، [ 7 ] [ 2 ] ووحدات البكسل ثلاثية الأبعاد. [12] كما تم تحسين فعاليته في بعض المتغيرات. [13] [14] [15] [16] [17] [18 ] وقد أثبتت هذه الشبكات فائدتها في توليد البيانات ( مثل توليف الصور ، وتوليف الفيديو ، [ 7 ] وتوليف الأشكال ثلاثية الأبعاد ، [ 4 ] وغيرها )، واستعادة البيانات (مثل استعادة مقاطع الفيديو التي تحتوي على وحدات بكسل أو إطارات صور مفقودة، [ 7 ] وتحسين دقة الصور ثلاثية الأبعاد، [ 4 ] وغيرها)، وإعادة بناء البيانات (مثل إعادة بناء الصور والاستيفاء الخطي [ 14 ] ).

البدائل

تتنافس نماذج EBM مع تقنيات مثل المشفرات التلقائية المتغيرة (VAEs) أو الشبكات التوليدية التنافسية (GANs) أو التدفقات المعيارية .

الإضافات

نماذج مشتركة قائمة على الطاقة

يمكن إعادة تفسير المصنف على أنه نموذج مشترك قائم على الطاقة

تسمح النماذج المشتركة القائمة على الطاقة (JEM)، التي اقترحها غراثوول وآخرون في عام 2020، بتفسير أي مصنف ذي مخرجات دالة softmax كنموذج قائم على الطاقة. وتتمثل الملاحظة الأساسية في أن هذا المصنف يُدرَّب على التنبؤ بالاحتمالية الشرطية.صθ(y|x)=هـوθ(x)[y]ج=1كهـوθ(x)[ج]   ل y=1،...،ك و وθ=(و1،...،وك)Rك،{\displaystyle p_{\theta }(y|x)={\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{\sum _{j=1}^{K}e^{{\vec {f}}_{\theta }(x)[j]}}}\ \ {\text{ لـ }}y=1,\dotsc ,K{\text{ و }}{\vec {f}}_{\theta }=(f_{1},\dotsc ,f_{K})\in \mathbb {R} ^{K},} أينوθ(x)[y]{\displaystyle {\vec {f}}_{\theta }(x)[y]}هو الدليل y للوغيتاتو{\displaystyle {\vec {f}}}بما يتوافق مع الفئة y. ودون أي تغيير في اللوجيت، تم اقتراح إعادة تفسير اللوجيت لوصف كثافة احتمالية مشتركة:

صθ(y،x)=هـوθ(x)[y]Z(θ)،{\displaystyle p_{\theta }(y,x)={\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{Z(\theta )}},}

مع دالة تقسيم غير معروفةZ(θ){\displaystyle Z(\theta )}والطاقةهـθ(x،y)=-وθ(x)[y]{\displaystyle E_{\theta }(x,y)=-f_{\theta }(x)[y]}. من خلال التهميش، نحصل على الكثافة غير المعيارية

صθ(x)=yصθ(y،x)=yهـوθ(x)[y]Z(θ)=:هـ-هـθ(x)،{\displaystyle p_{\theta }(x)=\sum _{y}p_{\theta }(y,x)=\sum _{y}{\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{Z(\theta )}}=:e^{-E_{\theta }(x)},}

لذلك،

هـθ(x)=-سجل(yهـوθ(x)[y]Z(θ))،{\displaystyle E_{\theta }(x)=-\log \left(\sum _{y}{\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{Z(\theta )}}\right),}

بحيث يمكن استخدام أي مصنف لتحديد دالة الطاقةهـθ(x){\displaystyle E_{\theta }(x)}.

انظر أيضاً

الأدب

  • التوليد الضمني والتعميم في النماذج القائمة على الطاقة، ييلون دو، إيغور مورداتش https://arxiv.org/abs/1903.08689
  • المصنف الخاص بك هو في الواقع نموذج قائم على الطاقة، ويجب عليك التعامل معه على هذا الأساس. ويل غراثوول، كوان-تشيه وانغ، يورن-هنريك جاكوبسن، ديفيد دوفينو ، محمد نوروزي، كيفن سويرسكي https://arxiv.org/abs/1912.03263
  • المحولات المعتمدة على الطاقة هي متعلمون ومفكرون قابلون للتطوير، أليكسي جلادستون، غانيش ناندورو، إم دي موفيجول إسلام، بيكسوان هان، هيونجيونغ ها، أمان تشادا، ييلون دو، هنغ جي، جوندونج لي، طارق https://arxiv.org/abs/2507.02092

مراجع

  1. ^ شيه، جيان ون؛ لو، يانغ؛ تشو، سونغ تشون؛ وو، يينغ نيان (2016). “نظرية ConvNet التوليدية”. آي سي إم إل . أرخايف : 1602.03264 . بيب كود : 2016arXiv160203264X .
  2. 1 2 شي، جيان وين؛ تشو، سونغ تشون؛ وو، يينغ نيان (2019). "تعلم الشبكات العصبية التوليدية المكانية الزمنية القائمة على الطاقة للأنماط الديناميكية". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 43 (2): 516-531 . arXiv : 1909.11975 . Bibcode : 2019arXiv190911975X . doi : 10.1109/tpami.2019.2934852 . ISSN 0162-8828 . PMID 31425020. S2CID 201098397 .   
  3. تعلم البنى العميقة للذكاء الاصطناعي، يوشوا بنجيو، الصفحة 54، https://books.google.com/books?id=cq5ewg7FniMC&pg=PA54
  4. 1 2 3 4 5 6 دو، ييلون؛ مورداتش، إيغور (2019-03-20). "التوليد الضمني والتعميم في النماذج القائمة على الطاقة". arXiv : 1903.08689 [ cs.LG ].
  5. Grathwohl, Will, et al. "مصنفك هو في السر نموذج قائم على الطاقة ويجب عليك التعامل معه على هذا النحو." arXiv preprint arXiv:1912.03263 (2019).
  6. باربو، أدريان؛ تشو، سونغ-تشون (2020). طرق مونت كارلو . سبرينغر.
  7. 1 2 3 4 شي، جيان وين؛ تشو، سونغ تشون؛ وو، يينغ نيان (يوليو 2017). "توليف الأنماط الديناميكية باستخدام شبكة عصبية توليدية مكانية-زمانية". مؤتمر IEEE لعام 2017 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 1061-1069 . arXiv : 1606.00972 . doi : 10.1109/cvpr.2017.119 . ISBN  978-1-5386-0457-1. S2CID 763074 . 
  8. وو، يينغ نيان؛ شي، جيان وين؛ لو، يانغ؛ تشو، سونغ تشون (2018). "تعميمات متفرقة وعميقة لنموذج FRAME". حوليات العلوم الرياضية والتطبيقات . 3 (1): 211-254 . doi : 10.4310/amsa.2018.v3.n1.a7 . ISSN 2380-288X . 
  9. تيه، يي واي؛ ويلينغ، ماكس؛ أوسينديرو، سيمون؛ هينتون، جيفري إي. (ديسمبر 2003). "نماذج قائمة على الطاقة للتمثيلات المتفرقة الزائدة" . مجلة أبحاث التعلم الآلي . 4 (ديسمبر): 1235-1260 .
  10. ليكان، ي.؛ بوتو، ل.؛ بينجيو، ي.؛ هافنر، ب. (1998). "التعلم القائم على التدرج المطبق على التعرف على المستندات". وقائع معهد مهندسي الكهرباء والإلكترونيات . 86 (11): 2278-2324 . doi : 10.1109/5.726791 . ISSN 0018-9219 . S2CID 14542261 .  
  11. كريزيفسكي، أليكس؛ سوتسكيفر، إيليا؛ هينتون، جيفري (2012). "تصنيف ImageNet باستخدام الشبكات العصبية الالتفافية العميقة" (ملف PDF) . NIPS .
  12. شي، جيان وين؛ تشنغ، زيلونغ؛ غاو، روي تشي؛ وانغ، ونغوان؛ تشو، سونغ تشون؛ وو، يينغ نيان (يونيو 2018). "تعلم شبكات الواصفات لتوليف وتحليل الأشكال ثلاثية الأبعاد". مؤتمر IEEE/CVF لعام 2018 حول رؤية الحاسوب والتعرف على الأنماط . IEEE. الصفحات 8629-8638 . arXiv : 1804.00586 . Bibcode : 2018arXiv180400586X . doi : 10.1109/cvpr.2018.00900 . ISBN  978-1-5386-6420-9. S2CID 4564025 . 
  13. غاو، رويكي؛ لو، يانغ؛ تشو، جونبي؛ تشو، سونغ-تشون؛ وو، يينغ نيان (يونيو 2018). "تعلم الشبكات العصبية التوليدية عبر نمذجة الشبكة المتعددة وأخذ العينات". مؤتمر IEEE/CVF لعام 2018 حول رؤية الحاسوب والتعرف على الأنماط . IEEE. الصفحات 9155-9164 . arXiv : 1709.08868 . doi : 10.1109/cvpr.2018.00954 . ISBN  978-1-5386-6420-9. S2CID 4566195 . 
  14. 1 2 نيجكامب، تشو، سونغ تشون وو، ينغ نيان، إريك؛ هيل، ميتش؛ تشو، سونغ تشون؛ وو، يينغ نيان (2019). حول تعلم نموذج MCMC غير المتقارب وغير المستمر قصير المدى نحو نموذج قائم على الطاقة . نوريبس. او سي ال سي 1106340764 . {{cite book}}: صيانة CS1: موقع الناشر مفقود ( رابط ) صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  15. كاي، شو؛ وو، يانغ؛ لي، غوانبين؛ تشين، زيليانغ؛ لين، ليانغ (17 يوليو 2019). "إعادة النظر في FRAME: منظور تفسيري قائم على تطور الجسيمات" . وقائع مؤتمر AAAI حول الذكاء الاصطناعي . 33 : 3256-3263 . arXiv : 1812.01186 . doi : 10.1609/aaai.v33i01.33013256 . ISSN 2374-3468 . 
  16. شي، جيان وين؛ لو، يانغ؛ غاو، روي تشي؛ تشو، سونغ تشون؛ وو، يينغ نيان (2020-01-01). "التدريب التعاوني لشبكات الواصفات والمولدات". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 42 (1): 27-45 . arXiv : 1609.09408 . Bibcode : 2020ITPAM..42...27X . doi : 10.1109 / tpami.2018.2879081 . ISSN 0162-8828 . PMID 30387724. S2CID 7759006 .   
  17. شي، جيان وين؛ لو، يانغ؛ غاو، روي تشي؛ غاو، سونغ تشون (2018). "التعلم التعاوني لنموذج الطاقة ونموذج المتغيرات الكامنة عبر تعليم MCMC" . المؤتمر الثاني والثلاثون لجمعية النهوض بالذكاء الاصطناعي . 32. doi : 10.1609/aaai.v32i1.11834 . S2CID 9212174 . 
  18. هان، تيان؛ نايكمب، إريك؛ فانغ، شياولين؛ هيل، ميتش؛ تشو، سونغ-تشون؛ وو، يينغ نيان (يونيو 2019). "مثلث التباعد للتدريب المشترك لنموذج المولد، والنموذج القائم على الطاقة، والنموذج الاستدلالي". مؤتمر IEEE/CVF لعام 2019 حول رؤية الحاسوب والتعرف على الأنماط (CVPR) . IEEE. الصفحات 8662-8671 . doi : 10.1109/cvpr.2019.00887 . ISBN  978-1-7281-3293-8. S2CID 57189202 .