اختبار G
في الإحصاء ، تُعد اختبارات G اختبارات إحصائية تعتمد على نسبة الاحتمال أو الاحتمال الأقصى ، ويتم استخدامها بشكل متزايد في الحالات التي كانت يوصى فيها سابقًا باختبارات مربع كاي . [ 1 ]
التركيبة
الصيغة العامة لإحصائيات اختبار G هي
أينهو العدد المرصود في الخلية،هو العدد المتوقع في ظل الفرضية الصفرية ،يرمز إلى اللوغاريتم الطبيعي ، ويتم حساب المجموع على جميع الخلايا غير الفارغة. والنتيجة هييتم توزيعها بشكل تقاربي وفقًا لتوزيع مربع كاي عندما يميل العدد الإجمالي للملاحظات إلى اللانهاية ( التقارب في التوزيع [ 2 ] ).
علاوة على ذلك، يجب أن يكون إجمالي العدد المرصود مساوياً لإجمالي العدد المتوقع:
أينيمثل العدد الإجمالي للملاحظات.
كلاهما، إحصائيات اختبار Gوإحصائيات اختبار مربع كايهي حالات خاصة من عائلة عامة من إحصاءات تباعد القوى التي وضعها كريسي وريد [ 2 ] .تعيين
ثم،
الاشتقاق
يمكننا استخلاص قيمة اختبار G من اختبار نسبة الاحتمالية اللوغاريتمية حيث يكون النموذج الأساسي نموذجًا متعدد الحدود .
لنفترض أن لدينا عينةحيث كلهو عدد المرات التي يكون فيها كائن من النوعلوحظ ذلك. علاوة على ذلك، دعليكن العدد الإجمالي للمشاهدات. إذا افترضنا أن النموذج الأساسي متعدد الحدود، فإن إحصائية الاختبار تُعرَّف بـ
أينهي الفرضية الصفرية ويمثل تقدير الاحتمال الأقصى (MLE) للمعلمات بالنظر إلى البيانات. تذكر أنه بالنسبة للنموذج متعدد الحدود، فإن تقدير الاحتمال الأقصى لـبفرض أن بعض البيانات معطاة بواسطة
علاوة على ذلك، يمكننا تمثيل كل معلمة من معلمات الفرضية الصفريةمثل
أينهو العدد المتوقع للكائنات من النوعفي ظل الفرضية الصفرية. وبالتالي، من خلال استبدال تمثيلاتوفي نسبة الاحتمالية اللوغاريتمية، تتبسط المعادلة إلى
وأخيرًا، اضرب في عامل من(يُستخدم لجعل صيغة اختبار G مكافئة تقاربياً لإحصائيات اختبار مربع كاي لبيرسون ) لتحقيق الشكل
يمكن للمرء أن يتخيل ذلك بشكل استدلاليباعتبارها دالة متصلة وتقترب من الصفر، وفي هذه الحالةويمكن ببساطة حذف الحدود التي لا تحتوي على أي مشاهدات. ومع ذلك، يجب أن يكون العدد المتوقع في كل خلية أكبر من الصفر تمامًا لكل خلية (للجميع) لتطبيق الطريقة.
التوزيع والاستخدام
بافتراض الفرضية الصفرية القائلة بأن التكرارات الملاحظة ناتجة عن أخذ عينات عشوائية من توزيع ذي تكرارات متوقعة معينة، فإن توزيع إحصائيات الاختباروهو تقريبًا توزيع مربع كاي ، بنفس عدد درجات الحرية كما في اختبار مربع كاي المقابل.
بالنسبة للعينات الصغيرة جدًا، يُفضّل استخدام اختبار الانحدار متعدد الحدود لجودة المطابقة، واختبار فيشر الدقيق لجداول التوافق، أو حتى اختيار الفرضيات البايزية، على اختبار G. [ 3 ] يوصي ماكدونالد دائمًا باستخدام اختبار دقيق (اختبار دقيق لجودة المطابقة، اختبار فيشر الدقيق ) إذا كان حجم العينة الإجمالي أقل من 1000.
- لا يوجد شيء مميز في حجم عينة يبلغ 1000، إنه مجرد رقم صحيح يقع ضمن النطاق الذي تعطي فيه الاختبارات الدقيقة، واختبار مربع كاي، واختبار G قيم p متطابقة تقريبًا . لن تواجه جداول البيانات، وآلات حاسبة صفحات الويب، وبرنامج SAS أي مشكلة في إجراء اختبار دقيق على عينة بحجم 1000.
- — جون إتش. ماكدونالد (2014) [ 3 ]
وقد تم التوصية باختبارات G على الأقل منذ طبعة عام 1981 من كتاب Biometry ، وهو كتاب مدرسي في الإحصاء من تأليف روبرت ر. سوكال وإف . جيمس رولف . [ 4 ]
العلاقة بالمقاييس الأخرى
العلاقة باختبار مربع كاي
إن اختبارات مربع كاي الشائعة الاستخدام لتقييم مدى ملاءمة البيانات للتوزيع وللاستقلال في جداول التوافق هي في الواقع تقريبات لنسبة الاحتمال اللوغاريتمي التي تستند إليها اختبارات G. [ 5 ]
الصيغة العامة لإحصائية اختبار مربع كاي لبيرسون هي
يتم الحصول على تقريب إحصائيات اختبار G بواسطة إحصائيات اختبار مربع كاي عن طريق توسيع تايلور من الدرجة الثانية للوغاريتم الطبيعي حول 1 (انظر الاشتقاق أدناه). لديناعندما تكون الأعداد المرصودةتقترب من الأعداد المتوقعةلكن عندما يكون هذا الاختلاف كبيرًا، يبدأ تقريب إحصائية اختبار مربع كاي بالتلاشي. في هذه الحالة، يكون تأثير القيم المتطرفة في البيانات أكثر وضوحًا، وهذا ما يفسر فشل اختبارات مربع كاي في الحالات التي تكون فيها البيانات قليلة.
بالنسبة للعينات ذات الحجم المعقول، سيؤدي اختبار G واختبار مربع كاي إلى نفس النتائج. ومع ذلك، فإن تقريب اختبار G لتوزيع مربع كاي النظري أفضل من تقريب اختبار مربع كاي لبيرسون . [ 6 ] في الحالات التيفي بعض حالات الخلايا، يكون اختبار G دائمًا أفضل من اختبار مربع كاي.
لاختبار مدى ملاءمة البيانات، يُعد اختبار G أكثر كفاءة بشكل كبير من اختبار مربع كاي وفقًا لمفهوم بهادور، لكن الاختبارين متساويان في الكفاءة وفقًا لمفهوم بيتمان أو وفقًا لمفهوم هودجز وليمان. [ 7 ] [ 8 ]
الاشتقاق (اختبار مربع كاي)
يعتبر
ودعمعبحيث يبقى العدد الإجمالي للعدّات كما هو. افترض أنصغير مقارنة بـللجميعوبعبارة أدق، لاحظ أنباستخدام رمز Θ الكبير . إذااستخدام ترميز Big O للأشياء الكبيرة، وهو ما ينبغي أن يكون صحيحًا في ظل الفرضية الصفرية بسبب نظرية النهاية المركزية ، إذنو
اتبع ذلك، والذي سيتم استخدامه لاحقًا.
وبالتعويض نجد،
باستخدام متسلسلة تايلورالعائد
وتوزيع الشروط التي نجدها،
الآن، باستخدامووللكبيريمكننا كتابة النتيجة،
العلاقة بتباعد كولباك-لايبير
تتناسب إحصائية اختبار G مع تباعد كولباك -لايبير للتوزيع النظريفرضية العدم من التوزيع التجريبيمن البيانات المرصودة:
أينيمثل العدد الإجمالي للملاحظات ووهي الاحتمالات النظرية والتجريبية لأشياء من النوع، على التوالى.
العلاقة بالمعلومات المتبادلة
لتحليل جداول الطوارئ ، يمكن أيضًا التعبير عن قيمة إحصائيات اختبار G من حيث المعلومات المتبادلة .
في هذه الحالة، الكائنات ذات الأنواع ثنائية الأبعاديتم أخذها في الاعتبار. لنفترضليكن عدد الكائنات من النوع، أي،هو المدخل في جدول الطوارئ في الصفوالعمود. تعيين
ثم العدد المتوقع المقدر للكائنات من النوعبافتراض أن الاستقلال معطى بواسطة
وأخيرًا، تُعطى إحصائية اختبار G في هذه الحالة بواسطة
يتركلتكن متغيرات عشوائية ذات توزيع مشترك معطى بالتوزيع التجريبيمن جدول الطوارئ، أي
ثم يمكن التعبير عن إحصائيات اختبار G بعدة أشكال بديلة:
حيث الإنتروبياويتم تقديمها
والإنتروبيا المشتركةيُعطى بواسطة
والمعلومات المتبادلة لـويكون
يمكن أيضًا إثبات أن ترجيح تردد المستند العكسي، الشائع استخدامه في استرجاع النصوص، هو تقريب لـ G، وينطبق عندما يكون مجموع صفوف الاستعلام أصغر بكثير من مجموع صفوف بقية المجموعة النصية. وبالمثل، فإن نتيجة الاستدلال البايزي المطبق على اختيار توزيع متعدد الحدود واحد لجميع صفوف جدول التوافق مجتمعة، مقابل البديل الأكثر عمومية المتمثل في توزيع متعدد الحدود منفصل لكل صف، تُنتج نتائج مشابهة جدًا لإحصائية اختبار G.
طلب
- اختبار ماكدونالد -كريتمان في علم الوراثة الإحصائي هو تطبيق لاختبار G.
- قام دانينج [ 9 ] بتقديم الاختبار إلى مجتمع اللغويات الحاسوبية حيث يتم استخدامه الآن على نطاق واسع.
- يستخدم برنامج R-scape (المستخدم بواسطة Rfam ) اختبار G للكشف عن التباين المشترك بين مواقع محاذاة تسلسل الحمض النووي الريبي. [ 10 ]
البرامج الإحصائية
- في لغة R، يمكن إيجاد تطبيقات سريعة في حزمتي AMR و Rfast . بالنسبة لحزمة AMR، فإن الأمر هو
g.testالذي يعمل تمامًا كما هو الحالchisq.testفي R الأساسية. كما تحتوي R على دالة likelihood.test ( مؤرشفة بتاريخ 16-12-2013 في Wayback Machine ) في حزمة Deducer ( مؤرشفة بتاريخ 09-03-2012 في Wayback Machine ). ملاحظة: اختبار Fisher's G في حزمة GeneCycle الخاصة بلغة برمجة R لاfisher.g.testيُنفذ اختبار G كما هو موضح في هذه المقالة، بل يُنفذ اختبار Fisher الدقيق للضوضاء البيضاء الغاوسية في سلسلة زمنية. [ 11 ] - توفر حزمة entropy في لغة R تطبيقًا آخر لحساب إحصائية اختبار G وقيم p المقابلة لها . تُستخدم الأوامر لحساب إحصائية G القياسية وقيمة p المرتبطة بها، وكذلك لحساب إحصائية G المستخدمة لمقارنة التوزيعات المشتركة والتوزيعات الناتجة لاختبار الاستقلال.
GstatGstatindep - في برنامج SAS ، يمكن إجراء اختبار G عن طريق تطبيق
/chisqالخيار بعدproc freq. [ 12 ] - في برنامج Stata ، يمكن إجراء اختبار G عن طريق تطبيق
lrالخيار بعدtabulateالأمر. - في لغة جافا ، استخدم
org.apache.commons.math3.stat.inference.GTest. [ 13 ] - في لغة بايثون ، استخدم
scipy.stats.power_divergenceمعlambda_=0. [ 14 ]
مراجع
- ↑ ماكدونالد، جيه إتش (2014). "اختبار جي لجودة المطابقة" . دليل الإحصاء البيولوجي ( الطبعة الثالثة). بالتيمور، ماريلاند: دار سباركي هاوس للنشر. ص 53-58 .
- 1 2 كريسي، نويل؛ ريد، تيموثي آر سي (1984). "اختبارات جودة المطابقة متعددة الحدود" . مجلة الجمعية الإحصائية الملكية. السلسلة ب (المنهجية) . 46 (3): 440-464 . doi : 10.1111/j.2517-6161.1984.tb01318.x . JSTOR 2345686. تاريخ الاسترجاع: 14 يناير 2026 .
- 1 2 ماكدونالد، جون هـ. (2014). "الأعداد الصغيرة في اختبارات مربع كاي واختبارات G " . دليل الإحصاء البيولوجي ( الطبعة الثالثة). بالتيمور، ماريلاند: دار سباركي هاوس للنشر. ص 86-89 .
- ↑ سوكال، ر. ر.؛ رولف، ف. ج. (1981). القياسات الحيوية: مبادئ وممارسة الإحصاء في البحوث البيولوجية ( الطبعة الثانية). نيويورك: فريمان. ISBN 978-0-7167-2411-7.
- ↑ هوي، ج. (2012). "اختبار نسبة الاحتمالية ثنائية الاتجاه (G) ومقارنته باختبار مربع كاي ثنائي الاتجاه". arXiv : 1206.4881 [ stat.ME ].
- ↑ هاريموس، ب.؛ توسنادي، ج. (2012). "تباين المعلومات يتبع توزيع كاي تربيع أكثر من إحصائية كاي تربيع". وقائع مؤتمر ISIT 2012. الصفحات 538-543 . arXiv : 1202.1125 . Bibcode : 2012arXiv1202.1125H .
- ↑ كوين، إم بي؛ روبنسون، جيه. (1985). "كفاءة اختبارات مربع كاي واختبارات نسبة الاحتمال لجودة المطابقة" . حوليات الإحصاء . 13 (2): 727-742 . doi : 10.1214/aos/1176349550 .
- ↑ هاريموس، ب.؛ فاجدا، إ. (2008). "حول اختبار باهادور الفعال للانتظام باستخدام الإنتروبيا". معاملات IEEE في نظرية المعلومات . 54 (1): 321-331 . Bibcode : 2008ITIT...54..321H . CiteSeerX 10.1.1.226.8051 . doi : 10.1109/tit.2007.911155 . S2CID 2258586 .
- ↑ دانينغ، تيد (1993). "طرق دقيقة لإحصاءات المفاجأة والمصادفة" . اللغويات الحاسوبية . 19 (1): 61-74 .
- ↑ ريفاس، إيلينا (30 أكتوبر 2020). "التنبؤ ببنية الحمض النووي الريبوزي باستخدام المعلومات التطورية الإيجابية والسلبية" . مجلة PLOS للبيولوجيا الحاسوبية . 16 (10) e1008387. رمز Bibcode : 2020PLSCB..16E8387R . doi : 10.1371/journal.pcbi.1008387 . PMC 7657543. PMID 33125376 .
- ↑ فيشر، ر. أ. (1929). "اختبارات الدلالة في التحليل التوافقي" . وقائع الجمعية الملكية في لندن، السلسلة أ . 125 (796): 54-59 . Bibcode : 1929RSPSA.125...54F . doi : 10.1098/rspa.1929.0151 . hdl : 2440/15201 .
- ↑ اختبار G للاستقلال ، واختبار G لجودة المطابقة في كتاب "دليل الإحصاء البيولوجي"، جامعة ديلاوير. (الصفحات 46-51، 64-69 في: ماكدونالد، جيه إتش (2009) دليل الإحصاء البيولوجي (الطبعة الثانية). دار سباركي هاوس للنشر، بالتيمور، ماريلاند.)
- ↑ "org.apache.commons.math3.stat.inference.GTest" . مؤرشف من الأصل بتاريخ 26-07-2018 . تم الاطلاع عليه بتاريخ 11-07-2018 .
- ↑ "Scipy.stats.power_divergence — SciPy v1.7.1 Manual" .
روابط خارجية
- الاختبارات الإحصائية لجداول التوافق
