تقطير المعرفة
في مجال تعلم الآلة ، يُعرف تقطير المعرفة أو تقطير النموذج بأنه عملية نقل المعرفة من نموذج كبير إلى نموذج أصغر. ورغم أن النماذج الكبيرة (مثل الشبكات العصبية العميقة جدًا أو مجموعات النماذج المتعددة [ 1 ] ) تمتلك سعة معرفية أكبر من النماذج الصغيرة، إلا أن هذه السعة قد لا تُستغل بالكامل. وقد يكون تقييم النموذج مكلفًا حسابيًا بنفس القدر حتى لو لم يستغل سوى جزء ضئيل من سعته المعرفية. ينقل تقطير المعرفة المعرفة من نموذج كبير إلى نموذج أصغر دون فقدان صحتها . وبما أن النماذج الأصغر أقل تكلفة في التقييم، يمكن نشرها على أجهزة ذات قدرات أقل (مثل الأجهزة المحمولة ). [ 2 ]
وهناك أيضاً تقنية أقل شيوعاً تسمى التقطير العكسي للمعرفة ، حيث يتم نقل المعرفة من نموذج أصغر إلى نموذج أكبر. [ 3 ]
لا ينبغي الخلط بين تقطير النموذج وضغط النموذج ، الذي يصف طرقًا لتقليل حجم النموذج الكبير نفسه، دون تدريب نموذج جديد. يحافظ ضغط النموذج عمومًا على بنية النموذج وعدد معلماته الاسمية، مع تقليل عدد البتات لكل معلمة.
استُخدمت تقنية تقطير المعرفة بنجاح في العديد من تطبيقات التعلّم الآلي ، مثل اكتشاف الأجسام [ 4 ] ، والنماذج الصوتية [ 5 ] ، ومعالجة اللغة الطبيعية [ 6 ] . ومؤخرًا، تمّ إدخالها أيضًا إلى الشبكات العصبية البيانية القابلة للتطبيق على البيانات غير الشبكية [ 7 ] .
طُرق
يتطلب نقل المعرفة من نموذج كبير إلى نموذج صغير تدريب النموذج الصغير دون المساس بصحة النموذج. إذا تم تدريب كلا النموذجين على نفس البيانات، فقد لا يمتلك النموذج الصغير القدرة الكافية على تعلم تمثيل معرفي موجز مقارنةً بالنموذج الكبير. مع ذلك، تتضمن قيم الاحتمالية الزائفة المخصصة لمخرجات النموذج الكبير بعض المعلومات حول التمثيل المعرفي الموجز: فعندما يتنبأ النموذج بفئة معينة بشكل صحيح، فإنه يُخصص قيمة كبيرة لمتغير المخرجات الخاص بتلك الفئة، وقيمًا أصغر لمتغيرات المخرجات الأخرى. يوفر توزيع القيم بين مخرجات سجل معين معلومات حول كيفية تمثيل النموذج الكبير للمعرفة. لذلك، يمكن تحقيق هدف النشر الاقتصادي لنموذج صالح من خلال تدريب النموذج الكبير فقط على البيانات، مستفيدًا من قدرته الأفضل على تعلم تمثيلات معرفية موجزة، ثم استخلاص هذه المعرفة في النموذج الصغير، بتدريبه على تعلم المخرجات غير الدقيقة للنموذج الكبير. [ 2 ]
الصياغة الرياضية
بافتراض وجود نموذج كبير كدالة للمتغير المتجهعادةً ما تكون الطبقة الأخيرة من شبكات التصنيف، التي تم تدريبها لمهمة تصنيف محددة ، عبارة عن دالة softmax بالشكل التالي:
أينتمثل درجة الحرارة ، وهي مُعامل يتم ضبطه على 1 في دالة softmax القياسية. يقوم مُعامل softmax بتحويل قيم اللوجيت .بالنسبة للاحتمالات الزائفة: تؤدي قيم درجات الحرارة الأعلى إلى توزيعات أكثر مرونة للاحتمالات الزائفة بين فئات المخرجات. تتكون عملية تقطير المعرفة من تدريب شبكة أصغر، تُسمى النموذج المُقطّر ، على مجموعة بيانات تُسمى مجموعة النقل ، والتي قد تتوافق مع مجموعة التدريب الأصلية أو تتكون من بيانات جديدة، وربما غير مُصنّفة. عادةً ما تُستخدم دالة خسارة الإنتروبيا المتقاطعة ، والتي تُحسب بين مخرجات النموذج المُقطّرومخرجات النموذج الكبيرعلى نفس السجل (أو متوسط المخرجات الفردية، إذا كان النموذج الكبير عبارة عن مجموعة)، باستخدام قيمة عالية لدرجة حرارة softmaxلكلا النموذجين: [ 2 ]
في هذا السياق، تؤدي درجة الحرارة المرتفعة إلى زيادة إنتروبيا المخرجات، وبالتالي توفير المزيد من المعلومات للتعلم للنموذج المُستخلص مقارنةً بالأهداف الصلبة، وفي الوقت نفسه تقليل تباين التدرج بين السجلات المختلفة، مما يسمح بمعدل تعلم أعلى . [ 2 ]
إذا كانت البيانات الحقيقية متوفرة لمجموعة النقل، فيمكن تعزيز العملية بإضافة الانتروبيا المتقاطعة بين المخرجات إلى الخسارةمن النموذج المُقطّر المحسوب باستخداموالعلامة التجارية المعروفة
حيث يتم ترجيح عنصر الخسارة بالنسبة للنموذج الكبير بمعامل قدرهبما أن تدرج الفقد بالنسبة لأوزان النموذج يتناسب مع درجة الحرارة، فإنه يتناسب مع عامل[ 2 ]
العلاقة بضغط النموذج
بافتراض أن متوسط اللوجيت يساوي صفرًا ، يمكن إثبات أن ضغط النموذج هو حالة خاصة من تقطير المعرفة. تدرج خسارة تقطير المعرفةفيما يتعلق باللوجيت للنموذج المقطريُعطى بواسطة
أينهي اللوغاريتمات للنموذج الكبير. بالنسبة للقيم الكبيرة لـيمكن تقريب ذلك على النحو التالي
وفي ظل فرضية المتوسط الصفرييصبح، وهو مشتق منأي أن الخسارة تعادل مطابقة اللوغاريتمات للنموذجين، كما هو الحال في ضغط النموذج. [ 2 ]
خوارزمية "الضرر الدماغي الأمثل"
خوارزمية تلف الدماغ الأمثل (OBD) هي كما يلي: [ 8 ]
- استمر حتى الوصول إلى مستوى التباعد أو الأداء المطلوب:
- قم بتدريب الشبكة (باستخدام طرق مثل الانتشار العكسي) حتى يتم الحصول على حل معقول
- احسب مدى أهمية كل معلمة
- احذف بعض المعلمات الأقل بروزًا
حذف مُعامل يعني تثبيت قيمته على الصفر. "أهمية" المُعامليُعرَّف بأنه، أينهي دالة الخسارة. المشتقة الثانيةيمكن حسابها بواسطة الانتشار العكسي من الدرجة الثانية .
تتمثل فكرة تحقيق الضرر الدماغي الأمثل في تقريب دالة الخسارة في نطاق المعلمة المثلىبواسطة توسيع تايلور :أين، منذالأمثل، والمشتقات المتقاطعةيتم تجاهلها لتوفير موارد الحوسبة. وبالتالي، فإن أهمية المعلمة تقارب الزيادة في الخسارة إذا تم حذف تلك المعلمة.
تاريخ
من المنهجيات ذات الصلة ضغط النموذج أو تقليمه ، حيث يتم تقليل حجم الشبكة المدربة. وقد طُبّق هذا لأول مرة عام 1965 على يد أليكسي إيفاخنينكو وفالنتين لابا في الاتحاد السوفيتي . [ 9 ] [ 10 ] [ 11 ] دُرّبت شبكاتهم العميقة طبقةً تلو الأخرى من خلال تحليل الانحدار . وتم تقليم الوحدات المخفية الزائدة باستخدام مجموعة تحقق منفصلة. [ 12 ] وتشمل طرق ضغط الشبكات العصبية الأخرى انحلال الوزن المتحيز [ 13 ] وتلف الدماغ الأمثل. [ 8 ]
نُشر مثال مبكر على تقطير الشبكات العصبية بواسطة يورغن شميدهوبر عام 1991، في مجال الشبكات العصبية المتكررة (RNNs). تمثلت المشكلة في التنبؤ بتسلسلات طويلة، أي التعلم العميق . تمثلت طريقتهم في استخدام شبكتين عصبيتين متكررتين. تتنبأ إحداهما ( المُؤتمتة ) بالتسلسل، بينما تتنبأ الأخرى ( المُجزئ ) بأخطاء المُؤتمتة. في الوقت نفسه، تتنبأ المُؤتمتة بالحالات الداخلية للمُجزئ. بعد أن تنجح المُؤتمتة في التنبؤ بالحالات الداخلية للمُجزئ بدقة، تبدأ بتصحيح الأخطاء، وسرعان ما يُستغنى عن المُجزئ، ليتبقى في النهاية شبكة عصبية متكررة واحدة فقط. [ 14 ] [ 15 ]
تمت دراسة فكرة استخدام مخرجات شبكة عصبية لتدريب شبكة عصبية أخرى، وذلك في إطار ما يُعرف بتكوين شبكة المعلم والمتعلم. [ 16 ] وفي عام 1992، تناولت عدة أبحاث الآليات الإحصائية لتكوينات المعلم والمتعلم باستخدام آلات اللجان [ 17 ] [ 18 ] أو آلات التكافؤ. [ 19 ]
في عام 2006، أُطلق مصطلح ضغط النماذج على عملية دمج معارف نماذج متعددة في شبكة عصبية واحدة . وقد تحقق هذا الضغط من خلال تدريب نموذج أصغر على كميات كبيرة من البيانات الوهمية المصنفة بواسطة نموذج تجميعي ذي أداء أعلى، مع تحسين النموذج لمطابقة لوغاريتم النموذج المضغوط مع لوغاريتم النموذج التجميعي. [ 20 ] وقد صاغ جيفري هينتون وآخرون (2015) [ 2 ] هذا المفهوم في ورقة بحثية أولية حول تقطير المعرفة ، وعرضوا بعض النتائج التي تم تحقيقها في مهمة تصنيف الصور .
يرتبط تقطير المعرفة أيضًا بمفهوم الاستنساخ السلوكي الذي ناقشه فراز ترابي وآخرون [ 21 ].
مراجع
- ↑ يو، شان؛ شو، تشانغ؛ شو، تشاو؛ تاو، داشنغ (2017). التعلم من شبكات المعلمين المتعددة . وقائع المؤتمر الدولي الثالث والعشرين لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات. الصفحات 1285-1294 .
- 1 2 3 4 5 6 7 هينتون، جيفري؛ فينيالز، أوريول؛ دين، جيف (2015). "استخلاص المعرفة في الشبكة العصبية". arXiv : 1503.02531 [ stat.ML ].
- ^ Yifan Xu وYuxiang Wu وZhiqiang Hu وHang Xu وZhongwei Wan وYongfeng Zhang وYu Qiao وZhen Wang (2023). “RestGPT: توصيل نماذج اللغات الكبيرة بواجهات برمجة تطبيقات RESTful في العالم الحقيقي”. أرخايف : 2307.10698 [ cs.CV ].
- ↑ تشين، غوبين؛ تشوي، وونغون؛ يو، شيانغ؛ هان، توني؛ تشاندراكير، مانموهان (2017). "تعلم نماذج فعالة للكشف عن الأجسام باستخدام تقطير المعرفة". التقدم في أنظمة معالجة المعلومات العصبية : 742-751 .
- ↑ أسامي، تايتشي؛ ماسومورا، ريو؛ ياماغوتشي، يوشيكازو؛ ماساتاكي، هيروكازو؛ أونو، يوشي (2017). تكييف نماذج الصوت للشبكات العصبية العميقة مع المجال باستخدام تقطير المعرفة . المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات التابع لمعهد مهندسي الكهرباء والإلكترونيات. الصفحات 5185-5189 .
- ↑ كوي، جيا؛ كينغسبري، برايان؛ رامابادران، بوفانا ؛ ساون، جورج؛ سيركو، توم؛ أودخاسي، كارتيك؛ سيثي، أبهيناف؛ نوسباوم-ثوم، ماركوس؛ روزنبرغ، أندرو (2017). تقطير المعرفة عبر مجموعات من النماذج متعددة اللغات للغات ذات الموارد المحدودة . المؤتمر الدولي لهندسة الصوت والكلام ومعالجة الإشارات التابع لمعهد مهندسي الكهرباء والإلكترونيات. الصفحات 4825-4829 .
- ↑ يانغ، ييدينغ؛ جيايان، تشيو؛ مينغلي، سونغ؛ داشنغ، تاو؛ شينتشاو، وانغ (2020). "استخلاص المعرفة من الشبكات العصبية الالتفافية للرسوم البيانية" (ملف PDF) . وقائع مؤتمر IEEE حول رؤية الحاسوب والتعرف على الأنماط : 7072-7081 . arXiv : 2003.10477 . Bibcode : 2020arXiv200310477Y .
- 1 2 لوكون، يان؛ دينكر، جون؛ سولا، سارة (1989). "الضرر الدماغي الأمثل" . التقدم في أنظمة معالجة المعلومات العصبية . 2. مورغان كوفمان.
- ↑ إيفاخنينكو، أ.ج.؛ لابا، ف.ج. (1967). علم التحكم الآلي وتقنيات التنبؤ . شركة النشر الأمريكية إلسيفير. رقم ISBN 978-0-444-00020-0.
- ↑ إيفاخنينكو، أ.ج. (مارس 1970). "التنظيم الذاتي الاستدلالي في مشاكل هندسة التحكم الآلي" . أوتوماتيكا . 6 (2): 207-219 . doi : 10.1016/0005-1098(70)90092-0 .
- ↑ إيفاخنينكو، أليكسي (1971). "نظرية كثيرات الحدود للأنظمة المعقدة" (ملف PDF) . معاملات IEEE في الأنظمة والإنسان وعلم التحكم الآلي . SMC-1 (4): 364-378 . doi : 10.1109/TSMC.1971.4308320 . مؤرشف (ملف PDF) من الأصل بتاريخ 29 أغسطس 2017. تم الاطلاع عليه بتاريخ 5 نوفمبر 2019 .
- ↑ شميدهوبر، يورغن (2022). "تاريخ مشروح للذكاء الاصطناعي الحديث والتعلم العميق". arXiv : 2212.11279 [ cs.NE ].
- ↑ هانسون، ستيفن؛ برات، لورين (1988). "مقارنة التحيزات لبناء الشبكة الدنيا باستخدام الانتشار العكسي" . التقدم في أنظمة معالجة المعلومات العصبية . 1. مورغان كوفمان.
- ↑ شميدهوبر، يورغن (أبريل 1991). "مجزئات التسلسل العصبي" (ملف PDF) . تقرير فني رقم 148، جامعة ميونخ التقنية .
- ↑ شميدهوبر، يورغن (1992). "تعلم التسلسلات المعقدة والممتدة باستخدام مبدأ ضغط التاريخ" (ملف PDF) . الحوسبة العصبية . 4 (2): 234-242 . doi : 10.1162/neco.1992.4.2.234 . S2CID 18271205. مؤرشف من الأصل (ملف PDF) بتاريخ 2017-07-06.
- ↑ واتكين، تيموثي إل إتش؛ راو، ألبريشت؛ بيهل، مايكل (1993-04-01). "الميكانيكا الإحصائية لتعلم قاعدة" . مراجعات الفيزياء الحديثة . 65 (2): 499-556 . Bibcode : 1993RvMP...65..499W . doi : 10.1103/RevModPhys.65.499 . hdl : 11370/02b0cd15-dfc5-4acb-9566-4ab937ee0d13 .
- ↑ شوارز، هـ؛ هيرتز، ج (15-10-1992). "التعميم في آلة لجنة كبيرة" . رسائل الفيزياء الأوروبية . 20 (4): 375-380 . رمز Bibcode : 1992EL.....20..375S . doi : 10.1209/0295-5075/20/4/015 . ISSN 0295-5075 .
- ↑ ماتو، ج؛ بارغا، ن (7 أكتوبر 1992). "خصائص التعميم للشبكات العصبية متعددة الطبقات" . مجلة الفيزياء أ: الرياضية والعامة . 25 (19): 5047-5054 . رمز Bibcode : 1992JPhA...25.5047M . doi : 10.1088/0305-4470/25/19/017 . ISSN 0305-4470 .
- ↑ هانزل، د؛ ماتو، ج؛ مونييه، س (1992-11-01). "الحفظ دون تعميم في شبكة عصبية متعددة الطبقات" . رسائل الفيزياء الأوروبية . 20 (5): 471-476 . رمز Bibcode : 1992EL.....20..471H . doi : 10.1209/0295-5075/20/5/015 . ISSN 0295-5075 .
- ↑ Buciluǎ, Cristian; Caruana, Rich; Niculescu-Mizil, Alexandru (2006). "ضغط النموذج". وقائع المؤتمر الدولي الثاني عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات .
- ↑ تورابي، فراز؛ وارنيل، غاريت؛ ستون، بيتر (2018). "الاستنساخ السلوكي من الملاحظة". arXiv : 1805.01954 [ cs.AI ].
روابط خارجية
- التعلم العميق
