التجميع القائم على النموذج

في الإحصاء ، يُعرف تحليل التجميع بأنه عملية تصنيف خوارزمية للعناصر إلى مجموعات متجانسة بناءً على القياسات العددية. يعتمد التجميع القائم على النموذج [ 1 ] على نموذج إحصائي للبيانات، وعادةً ما يكون نموذجًا مختلطًا . يتميز هذا الأسلوب بعدة مزايا، منها توفير أساس إحصائي متين للتجميع، وإمكانية اختيار عدد المجموعات، واختيار أفضل نموذج للتجميع، وتقييم عدم اليقين في عملية التجميع، وتحديد القيم الشاذة التي لا تنتمي إلى أي مجموعة.

التجميع القائم على النموذج

لنفترض أنه لكل منن{\displaystyle n}الملاحظات التي لدينا بيانات عنها د{\displaystyle d}المتغيرات، المشار إليها بـyأنا=(yأنا،1،...،yأنا،د){\displaystyle y_{i}=(y_{i,1},\ldots ,y_{i,d})} للمراقبةأنا{\displaystyle i}ثم يعبر التجميع القائم على النموذج عن دالة كثافة الاحتمال لـ yأنا{\displaystyle y_{i}}كمزيج محدود، أو متوسط ​​مرجح لـ جي{\displaystyle G}دوال كثافة الاحتمال للمكونات :

ص(yأنا)=ز=1جيτزوز(yأنا|θز)،{\displaystyle p(y_{i})=\sum _{g=1}^{G}\tau _{g}f_{g}(y_{i}\mid \theta _{g}),}

أينوز{\displaystyle f_{g}}هي دالة كثافة احتمالية ذات معاملθز{\displaystyle \theta _{g}}،τز{\displaystyle \tau _{g}}يمثل احتمال الخليط المقابل حيثز=1جيτز=1{\displaystyle \sum _{g=1}^{G}\tau _{g}=1}ثم في أبسط أشكالها، ينظر التجميع القائم على النموذج إلى كل مكون من مكونات نموذج الخليط على أنه مجموعة، ويقدر معلمات النموذج، ويخصص كل ملاحظة لمجموعة تتوافق مع مكون الخليط الأكثر احتمالاً.

نموذج خليط غاوسي

النموذج الأكثر شيوعًا للبيانات المستمرة هو ذلكوز{\displaystyle f_{g}}هو توزيع طبيعي متعدد المتغيرات ذو متجه متوسطμز{\displaystyle \mu _{g}} ومصفوفة التغايرΣز{\displaystyle \Sigma _{g}}، لهذا السبب θز=(μز،Σز){\displaystyle \theta _{g}=(\mu _{g},\Sigma _{g})}يُعرّف هذا نموذج خليط غاوسي . معلمات النموذج، τز{\displaystyle \tau _{g}}وθز{\displaystyle \theta _{g}}لز=1،...،جي{\displaystyle g=1,\ldots ,G}، يتم تقديرها عادة عن طريق تقدير الاحتمال الأقصى باستخدام خوارزمية التوقع والتعظيم (EM)؛ انظر أيضًا خوارزمية EM ونموذج GMM .

يُستخدم الاستدلال البايزي أيضًا بشكل متكرر للاستدلال حول نماذج الخليط المحدود. [ 2 ] كما يسمح النهج البايزي بالحالة التي يكون فيها عدد المكونات،جي{\displaystyle G}، لا نهائية، باستخدام عملية ديريشليه المسبقة، مما ينتج عنه نموذج خليط عملية ديريشليه للتجميع. [ 3 ]

اختيار عدد المجموعات

تتمثل إحدى مزايا التجميع القائم على النماذج في أنه يوفر طرقًا مبنية على أسس إحصائية لاختيار عدد المجموعات. كل اختيار مختلف لعدد المجموعات له تأثيره.جي{\displaystyle G}يتوافق ذلك مع نموذج خليط مختلف. بعد ذلك، يمكن استخدام معايير اختيار النموذج الإحصائي القياسية مثل معيار معلومات بايز (BIC) للاختيارجي{\displaystyle G}[ 4 ] إن الاحتمالية المكتملة المتكاملة (ICL) [ 5 ] هي معيار مختلف مصمم لاختيار عدد المجموعات بدلاً من عدد مكونات الخليط في النموذج؛ وغالبًا ما تكون هذه مختلفة إذا كانت هناك مجموعات غير غاوسية للغاية.

نموذج خليط غاوسي بسيط

بالنسبة للبيانات ذات الأبعاد العالية،د{\displaystyle d}يتطلب استخدام مصفوفة تباين كاملة لكل مكون من مكونات الخليط تقدير العديد من المعلمات، مما قد يؤدي إلى فقدان الدقة والتعميم وقابلية التفسير. لذا، يشيع استخدام مصفوفات تباين للمكونات أكثر اقتصادًا، مستغلةً تفسيرها الهندسي. تكون التجمعات الغاوسية بيضاوية الشكل، حيث يُحدد حجمها وشكلها واتجاهها بواسطة مصفوفة التباين. لننظر في تحليل القيم الذاتية لمصفوفة ما.

Σز=λزدزأزدزتي،{\displaystyle \Sigma _{g}=\lambda _{g}D_{g}A_{g}D_{g}^{T},}

أيندز{\displaystyle D_{g}}هي مصفوفة المتجهات الذاتية لـ Σز{\displaystyle \Sigma _{g}}، أز=التشخيص{أ1،ز،...،أد،ز}{\displaystyle A_{g}={\mbox{diag}}\{A_{1,g},\ldots ,A_{d,g}\}} هي مصفوفة قطرية تتناسب عناصرها مع القيم الذاتية لـΣز{\displaystyle \Sigma _{g}}بالترتيب التنازلي، وλز{\displaystyle \lambda _{g}}هو ثابت التناسب المرتبط. إذنλز{\displaystyle \lambda _{g}}يتحكم في حجم الشكل الإهليلجي، أز{\displaystyle A_{g}}شكله، ودز{\displaystyle D_{g}}اتجاهها. [ 6 ] [ 7 ]

يمكن تقييد حجم وشكل واتجاه كل مجموعة من المجموعات بحيث تكون متساوية (E) أو السماح لها بالتغير (V)؛ كما يمكن أن يكون الاتجاه كرويًا، مع قيم ذاتية متطابقة (I). ينتج عن ذلك 14 نموذجًا محتملاً للتجميع، موضحة في هذا الجدول:

تمثيلات بسيطة لمصفوفة التغايرΣز{\displaystyle \Sigma _{g}} مع عدد من المعلمات عندماجي=4{\displaystyle G=4}ود=9{\displaystyle d=9}
نموذجوصف# حدود
EIIكروي، متساوي الحجم1
السابعكروي، حجم متغير9
معهد إدنبرة للهندسةقطري، حجم وشكل متساويان4
VEIقطري، شكل متساوي12
إيفيقطري، متساوي الحجم، شكل متغير28
VVIقطري، حجم وشكل متفاوت36
إييييمتساوي10
VEEشكل واتجاه متساويان18
حواءحجم واتجاه متساويان34
VVEالتوجه المتساوي42
EEVحجم وشكل متساويان58
VEVشكل متساوي66
EVVحجم متساوٍ82
VVVمتفاوت90

يتضح أن العديد من هذه النماذج أكثر اقتصادًا، حيث تحتوي على عدد أقل بكثير من المعلمات مقارنةً بالنموذج غير المقيد الذي يحتوي على 90 معلمة عندما جي=4{\displaystyle G=4}ود=9{\displaystyle d=9}.

تتوافق العديد من هذه النماذج مع أساليب التجميع الاستدلالية المعروفة. على سبيل المثال، يُعادل تجميع k-means تقدير نموذج تجميع EII باستخدام خوارزمية التصنيف EM. [ 8 ] يمكن استخدام معيار معلومات بايز ( BIC) لاختيار أفضل نموذج تجميع، بالإضافة إلى عدد المجموعات. كما يمكن استخدامه كأساس لطريقة اختيار المتغيرات في نموذج التجميع، مع استبعاد المتغيرات غير المفيدة للتجميع. [ 9 ] [ 10 ]

طُوِّرت طرقٌ مختلفةٌ للتجميع العنقودي تعتمد على نموذج غاوسي، بهدف معالجة البيانات عالية الأبعاد. وتشمل هذه الطرق طريقة pgmm [ 11 ] ، التي تعتمد على نموذج مزيج محللات العوامل، وطريقة HDclassif، التي تعتمد على فكرة تجميع الفضاءات الفرعية [ 12 ] .

يُوسّع إطار عمل مزيج الخبراء نطاق التجميع القائم على النموذج ليشمل المتغيرات المصاحبة. [ 13 ] [ 14 ]

مثال

نوضح الطريقة باستخدام مجموعة بيانات تتكون من ثلاثة قياسات (الجلوكوز، والأنسولين، وسكر الدم تحت الجلد) على 145 شخصًا بهدف تشخيص داء السكري ونوعه. [ 15 ] تم تصنيف الأشخاص سريريًا إلى ثلاث مجموعات: طبيعي، وداء السكري الكيميائي، وداء السكري الظاهر، ولكننا نستخدم هذه المعلومات فقط لتقييم طرق التجميع، وليس لتصنيف الأشخاص.

مخطط BIC لتجميع بيانات مرض السكري بناءً على النموذج

يُظهر مخطط BIC قيم BIC لكل تركيبة من عدد المجموعات،جي{\displaystyle G}ونموذج التجميع من الجدول. كل منحنى يمثل نموذج تجميع مختلف. يُفضل معيار BIC ثلاث مجموعات، وهو ما يتوافق مع التقييم السريري. كما يُفضل نموذج التغاير غير المقيد، VVV. يتوافق هذا النموذج مع البيانات بشكل جيد، لأن المرضى الأصحاء لديهم قيم منخفضة لكل من sspg والأنسولين، بينما تكون توزيعات مجموعتي السكري الكيميائي والظاهر مُستطيلة، ولكن في اتجاهات مختلفة. وبالتالي، فإن أحجام وأشكال واتجاهات المجموعات الثلاث مختلفة بشكل واضح، ولذلك يُعد النموذج غير المقيد مناسبًا، كما تم اختياره بواسطة طريقة التجميع القائمة على النموذج.

التصنيف القائم على النماذج لبيانات مرض السكري

يُظهر مخطط التصنيف تصنيف العينات باستخدام التجميع القائم على النموذج. كان التصنيف دقيقًا للغاية، حيث بلغت نسبة الخطأ 12% وفقًا للتصنيف السريري. أما طرق التجميع الأخرى المعروفة، فقد كان أداؤها أسوأ بنسبة خطأ أعلى، مثل التجميع أحادي الارتباط (46%)، والتجميع متوسط ​​الارتباط (30%)، والتجميع كامل الارتباط ( 30%)، والتجميع باستخدام خوارزمية k-means (28%).

القيم المتطرفة في التجميع

في التجميع، تُعرَّف القيمة الشاذة بأنها نقطة بيانات لا تنتمي إلى أي من المجموعات. إحدى طرق نمذجة القيم الشاذة في التجميع القائم على النماذج هي إضافة مكون خليط إضافي شديد التشتت، على سبيل المثال، بتوزيع منتظم. [ 6 ] [ 16 ] وثمة نهج آخر يتمثل في استبدال كثافات التوزيع الطبيعي متعدد المتغيرات بـت{\displaystyle t}التوزيعات، [ 17 ] مع فكرة أن الذيول الطويلة لـ ت{\displaystyle t}يضمن توزيع t-distribution متانة النموذج في مواجهة القيم المتطرفة. مع ذلك، فهو ليس متينًا في حالة انهيار النموذج. [ 18 ] أما النهج الثالث فهو "tclust" أو نهج تقليم البيانات [ 19 ] الذي يستبعد الملاحظات المصنفة كقيم متطرفة عند تقدير معلمات النموذج.

التجمعات غير الغاوسية والاندماج

أحيانًا، تنحرف مجموعة أو أكثر انحرافًا كبيرًا عن التوزيع الطبيعي. إذا تمّت ملاءمة مزيج غاوسي لهذه البيانات، فغالبًا ما يتم تمثيل المجموعة غير الغاوسية بشدة بعدة مكونات من المزيج بدلًا من مكون واحد. في هذه الحالة، يمكن استخدام دمج المجموعات لإيجاد تصنيف أفضل. [ 20 ] ثمة نهج آخر يتمثل في استخدام مزيج من كثافات المكونات المعقدة لتمثيل المجموعات غير الغاوسية. [ 21 ] [ 22 ]

البيانات غير المتصلة

البيانات الفئوية

يتم تجميع البيانات الفئوية متعددة المتغيرات في أغلب الأحيان باستخدام نموذج الفئة الكامنة . ويفترض هذا النموذج أن البيانات تنشأ من نموذج خليط محدود، حيث تكون المتغيرات داخل كل مجموعة مستقلة.

بيانات مختلطة

تنشأ هذه المشكلات عندما تكون المتغيرات من أنواع مختلفة، مثل البيانات المستمرة أو الفئوية أو الترتيبية. يفترض نموذج الفئات الكامنة للبيانات المختلطة استقلالًا محليًا بين المتغيرات. [ 23 ] بينما يُخفف نموذج الموقع من افتراض الاستقلال المحلي. [ 24 ] ويفترض نهج التجميع متعدد المتغيرات (clustMD) أن المتغيرات المرصودة هي تجليات لمتغيرات كامنة غاوسية مستمرة. [ 25 ]

بيانات العد

تعتمد أبسط طرق التجميع القائمة على النماذج لبيانات العد متعددة المتغيرات على مزيج محدود ذي توزيعات بواسون مستقلة محليًا، على غرار نموذج الفئة الكامنة . وتسمح الطرق الأكثر واقعية بالتبعية والتشتت الزائد في العد. [ 26 ] وتشمل هذه الطرق أساليب تعتمد على توزيع بواسون متعدد المتغيرات ، وتوزيع بواسون-لوغاريتمي طبيعي متعدد المتغيرات، ونموذج الانحدار الذاتي ذي القيم الصحيحة (INAR)، ونموذج كوكس الغاوسي.

بيانات التسلسل

تتألف هذه النماذج من سلاسل من القيم الفئوية من مجموعة محدودة من الاحتمالات، مثل مسارات الحياة. تشمل أساليب التجميع القائمة على النماذج نماذج المسار والنمو المختلطة القائمة على المجموعات [ 27 ] ونموذج الخليط القائم على المسافة [ 28 ] .

بيانات الترتيب

تنشأ هذه البيانات عندما يُرتب الأفراد الأشياء حسب تفضيلهم. وتكون البيانات حينها عبارة عن قوائم مُرتبة من الأشياء، كما هو الحال في التصويت والتعليم والتسويق وغيرها من المجالات. تشمل أساليب التجميع القائمة على النماذج لبيانات الترتيب مزيجًا من نماذج بلاكيت-لوس ومزيجًا من نماذج بينتر، [ 29 ] [ 30 ] ومزيجًا من نماذج مالوز. [ 31 ]

بيانات الشبكة

تتضمن هذه النماذج وجود أو غياب أو قوة الروابط بين الأفراد أو العقد، وهي شائعة في العلوم الاجتماعية وعلم الأحياء. يقوم نموذج الكتل العشوائي بتجميع العقد في الشبكة بناءً على نموذج، بافتراض وجود تجميع كامن وأن الروابط تتشكل بشكل مستقل في ضوء هذا التجميع. [ 32 ] يفترض نموذج التجميع الموضعي الكامن أن كل عقدة تشغل موقعًا في فضاء كامن غير مُلاحظ ، وأن هذه المواقع تنشأ من مزيج من التوزيعات الغاوسية، وأن وجود أو غياب الرابط يرتبط بالمسافة في الفضاء الكامن. [ 33 ]

برمجة

تتوفر معظم برامج التجميع القائمة على النماذج على شكل حزمة R متاحة للعموم ومجانًا . وقد أُدرج العديد منها في قسم "عرض المهام" على موقع CRAN حول تحليل التجميع ونماذج الخلط المحدود. [ 34 ] وتُعد حزمة mclust الأكثر استخدامًا من بين هذه الحزم ، [ 35 ] [ 36 ] حيث تُستخدم لتجميع البيانات المتصلة، وقد تم تنزيلها أكثر من 8 ملايين مرة. [ 37 ]

تقوم حزمة poLCA [ 38 ] بتجميع البيانات الفئوية باستخدام نموذج الفئة الكامنة . أما حزمة clustMD [ 25 ] فتقوم بتجميع البيانات المختلطة، بما في ذلك المتغيرات المستمرة والثنائية والترتيبية والاسمية.

تُجري حزمة flexmix [ 39 ] عملية التجميع العنقودي القائم على النموذج لمجموعة من توزيعات المكونات. بينما تستطيع حزمة mixtools [ 40 ] تجميع أنواع مختلفة من البيانات. وتُطبّق كلتا الحزمتين flexmix و mixtools التجميع العنقودي القائم على النموذج مع المتغيرات المصاحبة.

تاريخ

تم اختراع التجميع القائم على النموذج لأول مرة في عام 1950 بواسطة بول لازارسفيلد لتجميع البيانات المنفصلة متعددة المتغيرات، في شكل نموذج الفئة الكامنة . [ 41 ]

في عام ١٩٥٩، ألقى لازارسفيلد محاضرةً حول تحليل البنية الكامنة في جامعة كاليفورنيا، بيركلي، حيث كان جون إتش. وولف طالب ماجستير. دفع هذا وولف إلى التفكير في كيفية تطبيق الأمر نفسه على البيانات المتصلة، وفي عام ١٩٦٥، قام بذلك، مقترحًا نموذج خليط غاوسي للتجميع. [ ٤٢ ] [ ٤٣ ] كما أنتج أول برنامج لتقدير هذا النموذج، أطلق عليه اسم NORMIX. وكان داي (١٩٦٩)، الذي عمل بشكل مستقل، أول من نشر مقالًا في مجلة علمية حول هذا النهج. [ ٤٤ ] ومع ذلك، يُنسب الفضل إلى وولف باعتباره مخترع التجميع القائم على النموذج للبيانات المتصلة.

طوّر مورتاغ ورافتر (1984) طريقةً للتجميع العنقودي تعتمد على نموذج تحليل القيم الذاتية لمصفوفات التغاير للمكونات. [ 45 ] وكان كتاب ماكلاكلان وباسفورد (1988) أول كتاب يتناول هذا النهج، مما ساهم في تطوير المنهجية وإثارة الاهتمام بها. [ 46 ] صاغ بانفيلد ورافتر (1993) مصطلح "التجميع العنقودي القائم على النموذج"، وقدّما مجموعة النماذج المُقتصدة، ووصفا معيارًا معلوماتيًا لاختيار عدد العناقيد، واقترحا النموذج الموحد للقيم الشاذة، وقدّما برنامج mclust . [ 6 ] بيّن سيليو وغوفيرت (1995) كيفية إجراء تقدير الاحتمال الأقصى للنماذج. [ 7 ] وهكذا، بحلول عام 1995، كانت المكونات الأساسية للمنهجية قد اكتملت، مما مهّد الطريق لتطوير واسع النطاق منذ ذلك الحين.

للمزيد من القراءة

  • سكروكا، ل.؛ فرالي، س.؛ مورفي، ت.ب.؛ رافتري، أ.إ. (2023). التجميع والتصنيف وتقدير الكثافة باستخدام نموذج mclust في لغة R. تشابمان آند هول/سي آر سي برس. ISBN 978-1-032-23495-3.
  • بوفيرون، سي.؛ سيليو، جي.؛ مورفي، تي بي؛ رافتري، إيه إي (2019). التجميع والتصنيف القائم على النماذج لعلوم البيانات: مع تطبيقات في لغة البرمجة R. مطبعة جامعة كامبريدج. ISBN 978-1-108-49420-5.

تحميل مجاني: https://math.univ-cotedazur.fr/~cbouveyr/MBCbook/

  • سيليو، جي؛ فروويرث-شنايتر، إس؛ روبرت، سي بي (2018). دليل تحليل المخاليط . تشابمان آند هول/سي آر سي برس. رقم ISBN 978-0-367-73206-6.
  • ماكنيكولاس، بي دي (2016). التجميع العنقودي القائم على نموذج الخليط . تشابمان آند هول/سي آر سي برس. رقم ISBN 978-0-367-73695-8.
  • هينينغ، سي.؛ ميليا، إم.؛ مورتاغ، إف.؛ روكي، آر. (2015). دليل تحليل التجميع . تشابمان آند هول/سي آر سي برس. ISBN 978-1-4665-5188-6.
  • مينجرسن، ك. ل.؛ روبرت، س. ب.؛ تيتيرنجتون، د. م. (2011). المخاليط: التقدير والتطبيقات . وايلي. ISBN 978-1-119-99389-6.
  • ماكلاكلان، جي جي؛ بيل، دي. (2000). نماذج الخلط المحدود . وايلي-إنترساينس. ISBN 978-0-471-00626-8.

مراجع

  1. فرالي، سي.؛ رافتري، إيه إي (2002). "التجميع القائم على النموذج، والتحليل التمييزي، وتقدير الكثافة". مجلة الجمعية الإحصائية الأمريكية . 97 (458): 611-631 . doi : 10.1198/016214502760047131 . S2CID 14462594 . 
  2. فروويرث-شنايتر، س. (2006). نماذج الخلط المحدود ونماذج ماركوف التبديلية . سبرينغر. ISBN 978-0-387-32909-3.
  3. كوينتانا، ف. أ.؛ إغليسياس، ب. ل. (2003). "التجميع البايزي ونماذج تقسيم المنتج". مجلة الجمعية الإحصائية الملكية، السلسلة ب . 65 (2): 557-575 . doi : 10.1111/1467-9868.00402 . hdl : 10533/174571 . S2CID 120362310 . 
  4. داسغوبتا، أ.؛ رافتري، أ. إي. (1998). "الكشف عن السمات في عمليات النقاط المكانية مع التشويش عبر التجميع القائم على النموذج". مجلة الجمعية الإحصائية الأمريكية . 93 (441): 294-302 . Bibcode : 1998JASA...93..294D . doi : 10.1080/01621459.1998.10474110 .
  5. بيرناكي، سي.؛ سيلو، جي.؛ جوفيرت، جي. (2000). "تقييم نموذج خليط للتجميع باستخدام الاحتمالية المكتملة المتكاملة". معاملات IEEE في تحليل الأنماط والذكاء الآلي . 22 (7): 719-725 . Bibcode : 2000ITPAM..22..719B . doi : 10.1109/34.865189 .
  6. 1 2 3 بانفيلد، جيه دي؛ رافتري، إيه إي (1993). "التجميع الغاوسي وغير الغاوسي القائم على النموذج". القياسات الحيوية . 49 (3): 803-821 . doi : 10.2307/2532201 . JSTOR 2532201 . 
  7. 1 2 سيليو، ج.؛ جوفيرت، ج. (1995). "نماذج التجميع الغاوسية المقتصدة" (ملف PDF) . التعرف على الأنماط . 28 (5): 781-793 . Bibcode : 1995PatRe..28..781C . doi : 10.1016/0031-3203(94)00125-6 .
  8. سيليو، ج.؛ جوفيرت، ج. (1992). "خوارزمية تصنيف EM للتجميع ونسختان عشوائيتان" (ملف PDF) . الإحصاءات الحاسوبية وتحليل البيانات . 14 (3): 315-332 . doi : 10.1016/0167-9473(92)90042-E . S2CID 121694251 . 
  9. رافتري، أ. إي.؛ دين، ن. (2006). "اختيار المتغيرات للتجميع القائم على النموذج". مجلة الجمعية الإحصائية الأمريكية . 101 (473): 168-178 . Bibcode : 2006JASA..101..168R . doi : 10.1198/016214506000000113 . S2CID 7738576 . 
  10. موجيس، سي.؛ سيليو، جي.؛ مارتن-ماغنييت، إم إل (2009). "اختيار المتغيرات للتجميع باستخدام نماذج خليط غاوسي" ( ملف PDF) . القياسات الحيوية . 65 (3): 701-709 . doi : 10.1111/j.1541-0420.2008.01160.x . PMID 19210744. S2CID 1326823 .  
  11. ماكنيكولاس، ب.د.؛ مورفي، ت.ب. (2008). "نماذج خليط غاوسي مُقتصدة". الإحصاء والحوسبة . 18 (3): 285-296 . doi : 10.1007/s11222-008-9056-0 . S2CID 13287886 . 
  12. بوفيرون، سي.؛ جيرارد، إس.؛ شميد، سي. (2007). "تجميع البيانات عالية الأبعاد". الإحصاءات الحاسوبية وتحليل البيانات . 52 : 502-519 . arXiv : math/0604064 . doi : 10.1016/j.csda.2007.02.009 .
  13. مورفي، ك.؛ مورفي، ت. ب. (2020). "نماذج التجميع الغاوسية المقتصدة مع المتغيرات المصاحبة ومكون الضوضاء". التقدم في تحليل البيانات والتصنيف . 14 (2): 293-325 . arXiv : 1711.05632 . doi : 10.1007/s11634-019-00373-8 . S2CID 204210043 . 
  14. جاكوبس، ر. أ.؛ جوردان ، م. إ.؛ نولان، س. ج.؛ هينتون، ج. إ. (1991). "مزيج تكيفي من الخبراء المحليين". الحوسبة العصبية . 3 (1): 79-87 . doi : 10.1162/neco.1991.3.1.79 . PMID 31141872. S2CID 572361 .  
  15. ريفن، جي إم؛ ميلر، آر جي (1979). "محاولة لتحديد طبيعة داء السكري الكيميائي باستخدام تحليل متعدد الأبعاد". مجلة داء السكري . 16 (1): 17-24 . doi : 10.1007/BF00423145 . PMID 761733 . 
  16. هينينغ، سي. (2004). "نقاط الانهيار لمقدرات الاحتمال الأقصى لخلائط الموقع والمقياس". حوليات الإحصاء . 32 (4): 1313-1340 . arXiv : math/0410073 . doi : 10.1214/009053604000000571 .
  17. ماكلاكلان، جي جي؛ بيل، دي. (2000). نماذج الخلط المحدود . وايلي-إنترساينس. ISBN 978-0-471-00626-8.
  18. كوريتو، ب.؛ هينيغ، س. (2016). "الاحتمال الأقصى غير المناسب القوي: الضبط، والحساب، والمقارنة مع طرق أخرى للتجميع الغاوسي القوي". مجلة الجمعية الإحصائية الأمريكية . 111 (516): 1648-1659 . arXiv : 1406.0808 . doi : 10.1080/01621459.2015.1100996 .
  19. غارسيا-إسكوديرو، ل. أ.؛ غورداليزا، أ.؛ ماتران، س.؛ مايو-إسكار، أ. (2008). "نهج تقليم عام لتحليل التجميع القوي". حوليات الإحصاء . 36 (3): 1324-1345 . arXiv : 0806.2976 . doi : 10.1214/07-AOS515 .
  20. بودري، جيه بي؛ رافتري، إيه إي؛ سيليو، جي؛ لو، كيه؛ جوتاردو، آر. (2010). " دمج مكونات الخليط للتجميع" . مجلة الإحصاءات الحاسوبية والرسومية . 19 (2): 332-353 . doi : 10.1198/jcgs.2010.08111 . PMC 2953822. PMID 20953302 .  
  21. موراي، بي إم؛ براون، آر بي؛ ماكنيكولاس، بي دي (2020). "مزيج من محللات العوامل القطعية المخفية". مجلة التصنيف . 37 (2): 366-379 . arXiv : 1711.01504 . doi : 10.1007/s00357-019-9309-y .
  22. لي، إس إكس؛ ماكلاكلان، جي جي (2022). "نظرة عامة على التوزيعات الملتوية في التجميع القائم على النموذج". مجلة التحليل متعدد المتغيرات . 188 104853. doi : 10.1016/j.jmva.2021.104853 .
  23. إيفريت، ب. (1984). مقدمة في نماذج المتغيرات الكامنة . تشابمان وهول.
  24. هانت، ل.؛ يورغنسن، م. (1999). "النظرية والأساليب: تجميع نماذج الخليط باستخدام برنامج MULTIMIX". المجلة الأسترالية والنيوزيلندية للإحصاء . 41 (2): 154-171 . doi : 10.1111/1467-842X.00071 . S2CID 118269232 . 
  25. 1 2 ماكبارلاند، د.؛ غورملي، آي سي (2016). "التجميع القائم على النموذج للبيانات المختلطة: clustMD". التقدم في تحليل البيانات وتصنيفها . 10 (2): 155-169 . arXiv : 1511.01720 . doi : 10.1007/s11634-016-0238-x . S2CID 29492339 . 
  26. كارليس، د. (2019). "نمذجة المخاليط للبيانات المنفصلة". في: فروويرث-شنايتر، س.؛ سيليو، ج.؛ روبرت، س.ب. (محررون). دليل تحليل المخاليط . تشابمان آند هول/سي آر سي برس. ص 193-218 . ISBN  978-0-429-05591-1.
  27. إيروشيفا، إي. أ.؛ ماتسويدا، ر. ل.؛ تيليسكا، د. (2014). "الخروج عن المألوف: عقدان من تحليل بيانات مسار الحياة في علم الجريمة، وعلم النفس التنموي، وما وراءهما". المراجعة السنوية للإحصاء وتطبيقاته . 1 (1): 301-332 . Bibcode : 2014AnRSA...1..301E . doi : 10.1146/annurev-statistics-022513-115701 .
  28. مورفي، ك.؛ مورفي، ت.ب.؛ بيكاريتا، ر.؛ غورملي، إ.س. (2021). "تجميع تسلسلات مسار الحياة الطولية باستخدام مزيج من نماذج المسافة الأسية" (ملف PDF) . مجلة الجمعية الإحصائية الملكية، السلسلة أ . 184 (4): 1414-1451 . doi : 10.1111/rssa.12712 . S2CID 235828978 . 
  29. غورملي، آي سي؛ مورفي، تي بي (2008). "استكشاف الكتل التصويتية داخل الهيئة الانتخابية الأيرلندية: نهج نمذجة الخليط". مجلة الجمعية الإحصائية الأمريكية . 103 : 1014-1027 . doi : 10.1198/016214507000001049 . hdl : 10197/7122 . S2CID 55004915 . 
  30. موليكا، سي.؛ تارديلا، إل. (2017). "نماذج خليط بلاكيت-لوس البايزية للبيانات المصنفة جزئيًا". مجلة القياس النفسي . 82 (2): 442-458 . arXiv : 1501.03519 . doi : 10.1007/s11336-016-9530-0 . PMID 27734294. S2CID 6903655 .  
  31. بيرناكي، سي.؛ جاك، ج. (2013). "نموذج توليدي لبيانات الترتيب قائم على خوارزمية فرز الإدراج" (ملف PDF) . الإحصاءات الحاسوبية وتحليل البيانات . 58 : 162-176 . doi : 10.1016/j.csda.2012.08.008 .
  32. نوفيكي، ك.؛ سنايدرز، ت. أ. ب. (2001). "تقدير وتوقع الهياكل الكتلية العشوائية". مجلة الجمعية الإحصائية الأمريكية . 96 (455): 1077-1087 . doi : 10.1198/016214501753208735 . S2CID 9478789 . 
  33. هانكوك، إم إس؛ رافتري، إيه إي؛ تانتروم، جيه إم (2007). "التجميع القائم على النموذج للشبكات الاجتماعية". مجلة الجمعية الإحصائية الملكية، السلسلة أ . 107 (2): 1-22 . doi : 10.1111/j.1467-985X.2007.00471.x . hdl : 11370/3bcfa52a-26ad-451a-91dc-3c6a5680e3ea .
  34. https://cran.r-project.org/web/views/Cluster.html ، تم الاطلاع عليه في 25 فبراير 2024
  35. سكروكا، ل.؛ فوب، م.؛ مورفي، ت.ب.؛ رافتري، أ.إ. (2016). "mclust 5: التجميع والتصنيف وتقدير الكثافة باستخدام نماذج الخليط المحدود الغاوسي" . مجلة R. 8 ( 1): 289-317 . doi : 10.32614/RJ-2016-021 . PMC 5096736. PMID 27818791 .  
  36. سكروكا، ل.؛ فرالي، س.؛ مورفي، ت.ب.؛ رافتري، أ.إ. (2023). التجميع والتصنيف وتقدير الكثافة القائم على النموذج . تشابمان آند هول/سي آر سي برس. رقم ISBN 978-1-032-23495-3.
  37. https://www.datasciencemeta.com/rpackages ، تم الاطلاع عليه في 25 فبراير 2024
  38. لينزر، د.أ.؛ لويس، ج.ب. (2011). "poLCA: حزمة R لتحليل الفئات الكامنة للمتغيرات متعددة التصنيفات" . مجلة البرمجيات الإحصائية . 42 (10): 1-29 . doi : 10.18637/jss.v042.i10 .
  39. غرون، ب.؛ لييش، ف. (2008). "FlexMix الإصدار 2: الخلطات المحدودة مع المتغيرات المصاحبة والمعلمات المتغيرة والثابتة" . مجلة البرمجيات الإحصائية . 28 (4): 1-35 . doi : 10.18637/jss.v028.i04 .
  40. بيناجليا، ت.؛ شوفو، د.؛ هنتر، د.ر.؛ يونغ، د. (2009). "mixtools: حزمة R لتحليل نماذج الخليط المحدود" . مجلة البرمجيات الإحصائية . 32 (6): 1-29 . doi : 10.18637/jss.v032.i06 .
  41. لازارسفيلد، ب. ف. (1950). "الأسس المنطقية والرياضية لتحليل البنية الكامنة". في: ستوفر، س. أ.؛ غوتمان، ل.؛ سوشمان، إ. أ.؛ لازارسفيلد، ب. ف. (محررون). دراسات في علم النفس الاجتماعي في الحرب العالمية الثانية. المجلد الرابع: القياس والتنبؤ . مطبعة جامعة برينستون. ص 362-412 . 
  42. وولف، جيه إتش (1965). برنامج حاسوبي لتحليل الأنواع باستخدام طريقة الاحتمال الأقصى. النشرة الفنية 65-15 (تقرير) الصادرة عن مكتب أبحاث شؤون الأفراد التابع للبحرية الأمريكية. سان دييغو، كاليفورنيا.
  43. بوفيرون، سي.؛ سيليو، جي.؛ مورفي، تي. بي.؛ رافتري، إيه. إي. (2019). "القسم 2.8". التجميع والتصنيف القائم على النماذج لعلوم البيانات: مع تطبيقات في لغة R. مطبعة جامعة كامبريدج. ISBN 978-1-108-49420-5.
  44. داي، ن. إي. (1969). "تقدير مكونات مزيج من توزيعين طبيعيين". بيومتريكا . 56 (3): 463-474 . doi : 10.1093/biomet/56.3.463 .
  45. مورتاغ، ف.؛ رافتري، أ. إي. (1984). "ملاءمة الخطوط المستقيمة لأنماط النقاط". التعرف على الأنماط . 17 (5): 479-483 . Bibcode : 1984PatRe..17..479M . doi : 10.1016/0031-3203(84)90045-1 .
  46. ماكلاكلان، جي جي؛ باسفورد، كي إي (1988). نماذج الخليط: الاستدلال وتطبيقاتها في التجميع . مارسيل ديكر. ISBN 978-0-8247-7691-6.