القوة (الإحصاء)
في الإحصاء التكراري ، تُعرَّف القوة الإحصائية بأنها احتمالية الكشف عن تأثير ما (أي رفض الفرضية الصفرية) بافتراض وجود تأثير محدد مسبقًا، وذلك باستخدام اختبار معين في سياق محدد. وفي الاستخدام الشائع، تعتمد القوة الإحصائية على الاختبار المحدد المستخدم (بما في ذلك اختيار إحصائية الاختبار ومستوى الدلالة )، وحجم العينة (حيث أن زيادة حجم البيانات تُعزز القوة الإحصائية)، وحجم التأثير (حيث أن التأثيرات أو الارتباطات الكبيرة نسبيًا مقارنةً بتباين البيانات تُعزز القوة الإحصائية).
بصورة أكثر رسمية، في حالة اختبار فرضية بسيط يتضمن فرضيتين، فإن قوة الاختبار هي احتمال رفض الاختبار للفرضية الصفرية بشكل صحيح () عندما تكون الفرضية البديلة () صحيح. ويُشار إليه عادةً بـ، أينهل احتمال ارتكاب خطأ من النوع الثاني ( نتيجة سلبية خاطئة ) مشروط بوجود تأثير أو ارتباط حقيقي؟
خلفية
تستخدم الاختبارات الإحصائية بيانات من عينات لتقييم مجتمع إحصائي أو استخلاص استنتاجات بشأنه . على سبيل المثال، قد نقيس غلة عينات من صنفين من محصول ما، ونستخدم اختبار عينتين لتقييم ما إذا كانت القيم المتوسطة لهذه الغلة تختلف بين الصنفين.
في إطار اختبار الفرضيات التكراري، يتم ذلك بحساب إحصائية اختبار (مثل إحصائية t ) لمجموعة البيانات، والتي لها توزيع احتمالي نظري معروف في حالة عدم وجود فرق (ما يُسمى بالفرضية الصفرية). إذا كانت القيمة الفعلية المحسوبة على العينة غير محتملة بما يكفي للظهور في ظل الفرضية الصفرية، نقول إننا حددنا تأثيرًا ذا دلالة إحصائية.
يمكن تحديد عتبة دلالة إحصائية منخفضة لضمان تقليل احتمالية الكشف الخاطئ عن تأثير غير موجود. مع ذلك، فإن عدم تحديد تأثير ذي دلالة إحصائية لا يعني بالضرورة عدم وجوده. فإذا أصررنا على توخي الحذر لتجنب النتائج الإيجابية الخاطئة، فقد نخلق نتائج سلبية خاطئة بدلاً من ذلك. قد يكون من المبالغة توقع إيجاد دليل قوي كافٍ على وجود فرق دقيق للغاية حتى لو كان موجودًا. تُعدّ القوة الإحصائية محاولةً لتقييم هذه المسألة كميًا.
في حالة مقارنة نوعي المحاصيل، فإن ذلك يمكّننا من الإجابة على أسئلة مثل:
- هل هناك خطر كبير من أن ينتج نوعان مختلفان تمامًا عينات تبدو متطابقة تمامًا عن طريق الصدفة البحتة؟
- ما مقدار الجهد الذي نحتاج إلى بذله في هذه المقارنة لتجنب هذا الخطر؟
- How different do these varieties need to be before we can expect to notice a difference?
Description

Suppose we are conducting a hypothesis test. We define two hypotheses the null hypothesis, and the alternative hypothesis. If we design the test such that α is the significance level (α being the probability of rejecting when is in fact true) then the power of the test is 1 − β where β is the probability of failing to reject when the alternative is true.
| Probability to reject | Probability to not reject | |
|---|---|---|
| If is True | α | 1 − α |
| If is True | 1 − β (power) | β |
To make this more concrete, a typical statistical test would be based on a test statistict calculated from the sampled data, which has a particular probability distribution under . A desired significance levelα would then define a corresponding "rejection region" (bounded by certain "critical values"), a set of values t is unlikely to take if was correct. If we reject in favor of only when the sample t takes those values, we would be able to keep the probability of falsely rejecting within our desired significance level. At the same time, if defines its own probability distribution for t (the difference between the two distributions being a function of the effect size), the power of the test would be the probability, under , that the sample t falls into our defined rejection region and causes to be correctly rejected.
القوة الإحصائية هي واحد ناقص احتمال الخطأ من النوع الثاني، وهي أيضًا حساسية إجراء اختبار الفرضيات في الكشف عن تأثير حقيقي. عادةً ما يكون هناك توازن دقيق بين طلب اختبارات أكثر صرامة (وبالتالي، مناطق رفض أصغر) ومحاولة الحصول على احتمال عالٍ لرفض الفرضية الصفرية في ظل الفرضية البديلة. يمكن أيضًا توسيع نطاق القوة الإحصائية ليشمل حالة اختبار فرضيات متعددة بناءً على تجربة أو استطلاع. ولذلك، من الشائع أيضًا الإشارة إلى قوة الدراسة ، وتقييم مشروع علمي من حيث قدرته على الإجابة عن أسئلة البحث التي يسعى إلى الإجابة عنها.
التطبيقات
يُعدّ "تحليل القدرة الإحصائية" التطبيق الرئيسي للقوة الإحصائية، وهو حسابٌ يُجرى عادةً قبل تنفيذ التجربة باستخدام بيانات من دراسات تجريبية أو مراجعة للأدبيات. يُمكن استخدام تحليلات القدرة الإحصائية لحساب الحد الأدنى لحجم العينة المطلوب لضمان احتمال معقول لاكتشاف تأثير بحجم مُحدد (أي تحقيق مستوى مقبول من القدرة الإحصائية). على سبيل المثال: "كم مرة أحتاج إلى رمي عملة معدنية لأستنتج أنها مُزوّرة بمقدار مُعين؟" [ 2 ] إذا كانت الموارد، وبالتالي أحجام العينات، ثابتة، يُمكن أيضًا استخدام تحليلات القدرة الإحصائية لحساب الحد الأدنى لحجم التأثير الذي يُحتمل اكتشافه.
كثيرًا ما تطلب جهات التمويل ولجان الأخلاقيات ولجان مراجعة البحوث من الباحثين إجراء تحليل إحصائي للقوة الإحصائية. من المرجح أن تكون الدراسة ذات القوة الإحصائية المنخفضة غير حاسمة، إذ تعجز عن تحديد الفرضية الأنسب عند مستوى الدلالة المطلوب، بينما ستتكبد الدراسة ذات القوة الإحصائية العالية نفقات باهظة في سبيل الإبلاغ عن تأثيرات ذات دلالة إحصائية حتى لو كانت ضئيلة، وبالتالي عديمة الجدوى عمليًا. إذا أُجري عدد كبير من الدراسات ذات القوة الإحصائية المنخفضة ونُشرت نتائج ذات دلالة إحصائية ، فمن المرجح أن تكون النتائج المنشورة إيجابية كاذبة أكثر من كونها نتائج حقيقية، مما يُسهم في أزمة تكرار النتائج . مع ذلك، قد يرتبط الإفراط في طلب القوة الإحصائية بهدر الموارد ومشاكل أخلاقية، كاستخدام عدد كبير من حيوانات التجارب في حين كان عدد أقل كافيًا. وقد يدفع ذلك أيضًا الباحثين الساعين للحصول على تمويل إلى المبالغة في تقدير أحجام التأثيرات المتوقعة، أو تجنب البحث عن تأثيرات تفاعلية دقيقة يصعب رصدها. [ 3 ]
يُعد تحليل القدرة الإحصائية أداة إحصائية أساسية في الإحصاء التكراري . أما في الإحصاء البايزي ، فلا يُجرى اختبار الفرضيات من النوع المستخدم في تحليل القدرة الإحصائية التقليدي. في الإطار البايزي، يُحدِّث الباحث معتقداته المسبقة باستخدام البيانات المُستقاة من دراسة مُحددة. من حيث المبدأ، يُمكن استخدام دراسة تُعتبر ضعيفة القدرة الإحصائية من منظور اختبار الفرضيات في عملية التحديث هذه. مع ذلك، تبقى القدرة الإحصائية مقياسًا مفيدًا لمدى تأثير حجم التجربة المُحدد على تحسين المعتقدات. فمن غير المرجح أن تُؤدي دراسة ذات قدرة إحصائية منخفضة إلى تغيير كبير في المعتقدات.
بالإضافة إلى ذلك، يُستخدم مفهوم القوة الإحصائية لإجراء مقارنات بين إجراءات الاختبار الإحصائي المختلفة، على سبيل المثال، بين اختبار معلمي واختبار لا معلمي لنفس الفرضية. قد تتساوى الاختبارات في حجمها ، وبالتالي في معدلات النتائج الإيجابية الخاطئة، ولكنها تختلف في قدرتها على كشف التأثيرات الحقيقية. ويُعدّ النظر في خصائص قوتها النظرية سببًا رئيسيًا للاستخدام الشائع لاختبارات نسبة الاحتمال .
قاعدة عامة لاختبار t
تنص قاعدة لير [ 4 ] [ 5 ] (التقريبية) على أن حجم العينة(لكل مجموعة) في الحالة الشائعة لاختبار t ثنائي الجانب لعينتين بقوة 80% () ومستوى الدلالةينبغي أن يكون: أينهو تقدير لتباين السكان والفرق المراد رصده في متوسط قيم كلتا العينتين. يمكن إعادة ترتيب هذه الصيغة، مما يعني على سبيل المثال أنه يتم الحصول على قوة إحصائية بنسبة 80% عند البحث عن فرق في المتوسطات يتجاوز حوالي أربعة أضعاف الخطأ المعياري للمتوسط على مستوى المجموعة .
في اختبار t لعينة واحدة، يتم استبدال 16 بـ 8. توفر القيم الأخرى تقريبًا مناسبًا عندما تختلف القدرة أو مستوى الدلالة المطلوب. [ 6 ]
ومع ذلك، ينبغي دائمًا إجراء تحليل كامل للطاقة لتأكيد هذا التقدير وتحسينه.
العوامل المؤثرة على السلطة

قد تعتمد القوة الإحصائية على عدد من العوامل. قد تكون بعض هذه العوامل خاصة بحالة اختبار معينة، ولكن في الاستخدام العادي، تعتمد القوة على الجوانب الثلاثة التالية التي يمكن للممارس التحكم بها:
- الاختبار نفسه ومعيار الدلالة الإحصائية المستخدم
- حجم التأثير محل الاهتمام
- حجم العينة المستخدمة للكشف عن التأثير ومدى تباينها
في أي اختبار، يحدد معيار الدلالة الإحصائية درجة الدقة المطلوبة، موضحًا مدى احتمالية رفض الفرضية الصفرية (عدم وجود تأثير) إذا كانت صحيحة بالفعل. العتبة الأكثر شيوعًا هي احتمالية رفض تبلغ 0.05، مع أنه تُستخدم أحيانًا قيم أصغر مثل 0.01 أو 0.001. تشير هذه العتبة إلى أن احتمالية حدوث الملاحظة يجب أن تكون على الأقل بهذا القدر (ربما من خلال الإشارة إلى تقدير كبير بما يكفي للفرق) لتُعتبر دليلًا قويًا ضد الفرضية الصفرية. إن اختيار قيمة أصغر لتضييق العتبة، بهدف تقليل احتمالية الحصول على نتيجة إيجابية خاطئة، سيؤدي أيضًا إلى تقليل قوة الاختبار (وبالتالي زيادة احتمالية الحصول على نتيجة سلبية خاطئة). بعض الاختبارات الإحصائية تُنتج بطبيعتها قوة اختبار أفضل ، وإن كان ذلك غالبًا على حساب اشتراط افتراضات أقوى.
يُحدد حجم التأثير محل الاهتمام ما يبحث عنه الاختبار. قد يكون حجم التأثير المتوقع ، إن وُجد، كفرضية علمية توصل إليها الباحث ويرغب في اختبارها. أو، في سياق عملي، قد يُحدد حجم التأثير بالحد الأدنى اللازم ليكون مفيدًا، كالتأثير المطلوب ليكون ذا دلالة سريرية . يمكن أن يكون حجم التأثير قيمة مباشرة للكمية محل الاهتمام (مثل فرق في المتوسطات بحجم معين)، أو مقياسًا معياريًا يأخذ في الحسبان التباين في المجتمع (مثل فرق في المتوسطات مُعبرًا عنه كمضاعف للانحراف المعياري). إذا كان الباحث يبحث عن تأثير أكبر، فسيكون من الأسهل إيجاده باستخدام تصميم تجريبي أو تحليلي مُحدد، وبالتالي ستكون قوة الاختبار أعلى.
تُشكّل طبيعة العينة أساس المعلومات المستخدمة في الاختبار. ويشمل ذلك عادةً حجم العينة، وتباينها، إن لم يكن ذلك مُضمّنًا في تعريف حجم التأثير. وبشكلٍ أعم، تُعدّ دقة قياس البيانات عاملًا مهمًا (مثل الموثوقية الإحصائية )، فضلًا عن تصميم التجربة أو الدراسة الرصدية. وتؤدي هذه العوامل في نهاية المطاف إلى مقدارٍ مُتوقع من خطأ المعاينة . ويمكن تقليل خطأ المعاينة من خلال زيادة حجم العينة من مجتمع ذي تباين أقل، أو من خلال قياسات أكثر دقة، أو من خلال تصميمات تجريبية أكثر كفاءة (على سبيل المثال، مع الاستخدام المناسب للحجب ) ، ومن شأن هذه الأخطاء الأقل أن تُحسّن القدرة الإحصائية، وإن كان ذلك عادةً على حساب الموارد. وتُعدّ كيفية ترجمة زيادة حجم العينة إلى قدرة إحصائية أعلى مقياسًا لكفاءة الاختبار ، على سبيل المثال، حجم العينة المطلوب للحصول على قدرة إحصائية مُحددة. [ 7 ]
مناقشة
تؤثر القوة الإحصائية لاختبار الفرضية على تفسير نتائجه. فعدم التوصل إلى نتيجة في دراسة ذات قوة إحصائية أعلى يُعد دليلاً أقوى على عدم وجود التأثير مقارنةً بالتوصل إلى النتيجة نفسها في دراسة ذات قوة إحصائية أقل. مع ذلك، لا يُعد هذا دليلاً قاطعاً. فقد يكون التأثير موجوداً، ولكنه أقل مما كان متوقعاً، ما يعني أن الدراسة في الواقع ذات قوة إحصائية منخفضة، وبالتالي فإن العينة غير قادرة على تمييزه عن الصدفة. [ 8 ] على سبيل المثال، تتمتع العديد من التجارب السريرية بقوة إحصائية منخفضة للكشف عن الاختلافات في الآثار الجانبية للعلاجات، لأن هذه الآثار قد لا تؤثر إلا على عدد قليل من المرضى، حتى وإن كان هذا الاختلاف مهماً . [ 9 ] كما ينبغي أن تأخذ الاستنتاجات المتعلقة باحتمالية وجود تأثير فعلي في الاعتبار عوامل أخرى إلى جانب اختبار واحد، خاصةً وأن القوة الإحصائية في الواقع العملي نادراً ما تقترب من 1.
في الواقع، على الرغم من عدم وجود معايير رسمية لقياس القدرة الإحصائية، فإن العديد من الباحثين وهيئات التمويل يقيمون القدرة الإحصائية باستخدام 0.80 (أو 80%) كمعيار للكفاءة. ويشير هذا العرف إلى وجود مفاضلة بنسبة أربعة إلى واحد بين مخاطر بيتا (β) ومخاطر ألفا (α) ، حيث تُحدد احتمالية الخطأ من النوع الثاني (β) بـ 1 - 0.8 = 0.2، بينما تُحدد احتمالية الخطأ من النوع الأول (α) عادةً بـ 0.05. وتتطلب بعض التطبيقات مستويات قدرة إحصائية أعلى بكثير. فعلى سبيل المثال، قد تُصمم الاختبارات الطبية لتقليل عدد النتائج السلبية الكاذبة ( الخطأ من النوع الثاني) عن طريق تخفيف عتبة الدلالة الإحصائية، مما يزيد من خطر الحصول على نتيجة إيجابية كاذبة ( الخطأ من النوع الأول). ويكمن الأساس المنطقي في أنه من الأفضل إخبار مريض سليم "ربما وجدنا شيئًا ما - دعنا نجري المزيد من الاختبارات"، بدلاً من إخبار مريض "كل شيء على ما يرام". [ 10 ]
يركز تحليل القدرة الإحصائية على رفض الفرضية الصفرية بشكل صحيح. مع ذلك، قد تحفز اعتبارات أخرى إجراء تجربة، مما يؤدي إلى اختلاف حجم العينة المطلوب. في كثير من السياقات، لا يتعلق الأمر كثيرًا بالاختيار بين الفرضيات، بل بالحصول على تقدير دقيق لحجم تأثير المجتمع. على سبيل المثال، يمكن لتحليل دقيق للقدرة الإحصائية أن يوضح أن 55 زوجًا من العينات الموزعة توزيعًا طبيعيًا بمعامل ارتباط 0.5 ستكون كافية لمنح قدرة إحصائية بنسبة 80% لرفض الفرضية الصفرية التي تنص على أن معامل الارتباط لا يتجاوز 0.2 (باستخدام اختبار أحادي الجانب، α = 0.05). لكن فاصل الثقة النموذجي بنسبة 95% مع هذه العينة سيكون حوالي [0.27، 0.67]. يتطلب قياس معامل الارتباط بدقة ± 0.1 تحليلًا بديلًا، وإن كان ذا صلة، مما يعني حجم عينة مختلفًا (أكبر في هذه الحالة). بدلاً من ذلك، يمكن أن تكون الدراسات المتعددة ذات القدرة الإحصائية المنخفضة مفيدة، إذا تم دمجها بشكل مناسب من خلال تحليل تجميعي .
تتضمن العديد من التحليلات الإحصائية تقدير عدة كميات مجهولة. في الحالات البسيطة، تُعتبر جميع هذه الكميات، باستثناء واحدة، معلمات مُزعجة . في هذا السياق، تقتصر القدرة الإحصائية ذات الصلة على الكمية الوحيدة التي ستخضع للاستدلال الإحصائي الرسمي. في بعض السياقات، لا سيما إذا كانت الأهداف استكشافية، قد يكون هناك عدد من الكميات ذات الأهمية في التحليل. على سبيل المثال، في تحليل الانحدار المتعدد ، قد نُدرج عدة متغيرات مُصاحبة ذات أهمية مُحتملة. في مثل هذه الحالات، حيث تُدرس عدة فرضيات، من الشائع أن تختلف القدرات الإحصائية المرتبطة بالفرضيات المختلفة. على سبيل المثال، في تحليل الانحدار المتعدد، ترتبط القدرة على اكتشاف تأثير بحجم مُعين بتباين المتغير المُصاحب. وبما أن المتغيرات المُصاحبة المختلفة لها تباينات مختلفة، فإن قدراتها الإحصائية ستختلف أيضًا.
تنشأ تعقيدات إضافية عند دراسة هذه الفرضيات المتعددة معًا. على سبيل المثال، إذا اعتبرنا النتيجة الإيجابية الخاطئة بمثابة رفض خاطئ لأي من هذه الفرضيات، فإن احتمال حدوث هذا "الخطأ الشامل" سيزداد إذا لم تُتخذ التدابير المناسبة. تتضمن هذه التدابير عادةً تطبيق عتبة أعلى من الصرامة لرفض الفرضية (كما هو الحال مع طريقة بونفيروني )، مما يُقلل من قوة الاختبار. بدلاً من ذلك، قد توجد مفاهيم مختلفة لقوة الاختبار مرتبطة بكيفية دراسة الفرضيات المختلفة. تتطلب "قوة الاختبار الكاملة" الكشف عن جميع التأثيرات الحقيقية في جميع الفرضيات، وهو شرط أقوى بكثير من "قوة الاختبار الدنيا" المتمثلة في القدرة على إيجاد تأثير حقيقي واحد على الأقل، وهو نوع من قوة الاختبار قد يزداد مع ازدياد عدد الفرضيات. [ 11 ]
التحليل المسبق مقابل التحليل اللاحق
يمكن إجراء تحليل القدرة الإحصائية إما قبل جمع البيانات ( تحليل القدرة الإحصائية المسبق أو الاستباقي) أو بعد جمعها (تحليل القدرة الإحصائية اللاحق أو الاسترجاعي). يُجرى تحليل القدرة الإحصائية المسبق قبل بدء الدراسة البحثية، ويُستخدم عادةً لتقدير أحجام العينات الكافية لتحقيق قدرة إحصائية مناسبة. أما تحليل القدرة الإحصائية اللاحق، فيُجرى بعد اكتمال الدراسة، ويستخدم حجم العينة وحجم التأثير لتحديد القدرة الإحصائية في الدراسة، بافتراض أن حجم التأثير في العينة يساوي حجم التأثير في المجتمع الإحصائي. في حين أن فائدة تحليل القدرة الإحصائية الاستباقي في تصميم التجارب مقبولة عالميًا، فإن تحليل القدرة الإحصائية اللاحق مثير للجدل. وقد جادل العديد من الإحصائيين بأن حسابات القدرة الإحصائية اللاحقة مُضللة ولا معنى لها في جوهرها. [ 12 ] [ 13 ]
مثال
فيما يلي مثال يوضح كيفية حساب قوة الاختبار لتجربة عشوائية: لنفترض أن هدف التجربة هو دراسة تأثير علاج ما على كمية معينة، ولذلك سنقارن بين المشاركين في البحث بقياس هذه الكمية قبل العلاج وبعده، ثم نحلل البيانات باستخدام اختبار t أحادي الجانب للعينات المزدوجة ، بمستوى دلالة إحصائية قدره 0.05. نهتم بالقدرة على رصد تغير إيجابي في حجم هذه الكمية..
نبدأ أولاً بتحديد المشكلة وفقًا لاختبارنا. لنفترضوتشير إلى التدابير التي تُتخذ قبل العلاج وبعده على الشخص المعنيعلى التوالي. ينبغي أن يظهر التأثير المحتمل للعلاج في الاختلافاتوالتي يُفترض أنها مستقلة ومتطابقة في التوزيع الطبيعي ، مع قيمة متوسطة غير معروفةوالتباين.
Here, it is natural to choose our null hypothesis to be that the expected mean difference is zero, i.e. For our one-sided test, the alternative hypothesis would be that there is a positive effect, corresponding to The test statistic in this case is defined as:
where is the mean under the null so we substitute in 0, n is the sample size (number of subjects), is the sample mean of the difference
and is the sample standard deviation of the difference.
Analytic solution
We can proceed according to our knowledge of statistical theory, though in practice for a standard case like this software will exist to compute more accurate answers.
Thanks to t-test theory, we know this test statistic under the null hypothesis follows a Student t-distribution with degrees of freedom. If we wish to reject the null at significance level , we must find the critical value such that the probability of under the null is equal to . If n is large, the t-distribution converges to the standard normal distribution (thus no longer involving n) and so through use of the correspondingquantile function, we obtain that the null should be rejected if
Now suppose that the alternative hypothesis is true so . Then, writing the power as a function of the effect size, , we find the probability of being above under .
again follows a student-t distribution under , converging on to a standard normal distribution for large n. The estimated will also converge on to its population value Thus power can be approximated as
According to this formula, the power increases with the values of the effect size and the sample size n, and reduces with increasing variability . In the trivial case of zero effect size, power is at a minimum (infimum) and equal to the significance level of the test in this example 0.05. For finite sample sizes and non-zero variability, it is the case here, as is typical, that power cannot be made equal to 1 except in the trivial case where so the null is always rejected.
We can invert to obtain required sample sizes:
Suppose and we believe is around 2, say, then we require for a power of , a sample size
Simulation solution
Alternatively we can use a Monte Carlo simulation method that works more generally.[14] Once again, we return to the assumption of the distribution of and the definition of لنفترض أن لدينا قيمًا ثابتة لحجم العينة، والتباين، وحجم التأثير، ونرغب في حساب القدرة الإحصائية. يمكننا اتباع هذه العملية:
1. توليد عدد كبير من مجموعاتوفقًا للفرضية الصفرية،
2. احسب إحصائية الاختبار الناتجةلكل مجموعة.
3. احسبالكمية المئوية من المحاكاةواستخدم ذلك كتقدير لـ.
4. الآن قم بإنشاء عدد كبير من مجموعاتوفقًا للفرضية البديلة،، ثم احسب إحصائيات الاختبار المقابلة مرة أخرى.
5. انظر إلى نسبة هذه البدائل المحاكاةالتي فوقتم حسابها في الخطوة 3، وبالتالي يتم رفضها. هذه هي القوة الإحصائية.
يمكن القيام بذلك باستخدام مجموعة متنوعة من البرامج. وباستخدام هذه المنهجية مع القيم السابقة، يؤدي تحديد حجم العينة بـ 25 إلى قوة إحصائية مُقدَّرة تبلغ حوالي 0.78. ويعود الاختلاف الطفيف مع القسم السابق بشكل رئيسي إلى عدم دقة التقريب الطبيعي.
السلطة في مختلف التخصصات
سعت العديد من الدراسات إلى تقدير المستويات النموذجية للقوة الإحصائية في مختلف المجالات الأكاديمية. يعتمد أحد المناهج الشائعة على التحليلات التلوية لتقييم ما إذا كانت الدراسات الفردية تتمتع بقوة كافية للكشف عن متوسط حجم التأثير المُقدَّر من التحليل التلوي نفسه. يتساءل هذا المنهج أساسًا: ما مدى احتمالية أن تكشف كل دراسة عن التأثير المتفق عليه في الأدبيات الأوسع؟ تُظهر هذه التقييمات باستمرار مستويات منخفضة من القوة الإحصائية في العديد من التخصصات. على سبيل المثال، باستخدام هذا المنهج، تبلغ القوة المتوسطة 18% في الاقتصاد، [ 15 ] و10% في العلوم السياسية، [ 16 ] و36% في علم النفس، [ 17 ] و15% في علم البيئة وعلم الأحياء التطوري. [ 18 ]
امتداد
قوة بايز
في المنهج التكراري ، يُفترض أن للمعلمات قيمة محددة، وهو أمرٌ من غير المرجح أن يكون صحيحًا. يمكن معالجة هذه المشكلة بافتراض أن للمعلمة توزيعًا. تُعرف القدرة الناتجة أحيانًا بالقدرة البايزية، وهي شائعة الاستخدام في تصميم التجارب السريرية .
احتمالية النجاح المتوقعة
يستخدم كل من اختبار القوة الإحصائية التكراري واختبار القوة الإحصائية البايزي الدلالة الإحصائية كمعيار للنجاح. مع ذلك، غالبًا ما تكون الدلالة الإحصائية غير كافية لتحديد النجاح. ولمعالجة هذه المشكلة، يمكن توسيع مفهوم القوة الإحصائية ليشمل مفهوم الاحتمالية التنبؤية للنجاح (PPOS). لا يقتصر معيار النجاح في PPOS على الدلالة الإحصائية، ويُستخدم بشكل شائع في تصميم التجارب السريرية .
برنامج لحسابات القدرة وحجم العينة
تتوفر العديد من البرامج المجانية و/أو مفتوحة المصدر لإجراء حسابات القدرة الإحصائية وحجم العينة. وتشمل هذه البرامج:
- جي باور ( https://www.gpower.hhu.de/ )
- تحليل القوة الإحصائية المجاني عبر الإنترنت من WebPower ( https://webpower.psychstat.org )
- حاسبات مجانية ومفتوحة المصدر عبر الإنترنت ( https://powerandsamplesize.com )
- يوفر برنامج PowerUp! وظائف تعتمد على برنامج Excel لتحديد الحد الأدنى لحجم التأثير القابل للكشف والحد الأدنى لحجم العينة المطلوب لمختلف التصاميم التجريبية وشبه التجريبية.
- PowerUpR هي نسخة حزمة R من PowerUp! وتتضمن بالإضافة إلى ذلك وظائف لتحديد حجم العينة لمختلف التجارب العشوائية متعددة المستويات مع أو بدون قيود على الميزانية.
- حزمة R المسماة pwr ( https://cran.r-project.org/web/packages/pwr/ )
- حزمة R WebPower ( https://cran.r-project.org/web/packages/WebPower/index.html )
- حزمة Spower في لغة R ( https://cran.r-project.org/web/packages/Spower/index.html ) لتحليلات الطاقة العامة باستخدام تجارب المحاكاة
- نماذج إحصائيات حزمة بايثون ( https://www.statsmodels.org/ )
انظر أيضاً
- القيم التنبؤية الإيجابية والسلبية – مقاييس إحصائية لتحديد ما إذا كانت النتيجة محتملة الصدق
- حجم التأثير – مقياس إحصائي لحجم الظاهرة
- الكفاءة - مقياس جودة الأسلوب الإحصائي
- مبرهنة نيمان-بيرسون – نظرية حول قوة اختبار نسبة الاحتمال
- حجم العينة – اعتبارات إحصائية حول عدد الملاحظات المطلوب إجراؤها. صفحات تعرض أوصافًا مختصرة لأهداف إعادة التوجيه
- الاختبار الأقوى بشكل موحد – اختبار الفرضية الأمثل نظريًا
مراجع
- ↑ بيتر دالغارد. "حسابات القدرة لاختبار النسب لعينتين" . وثائق R.
- ↑ "القوة الإحصائية والإحصاءات ذات القوة المنخفضة - الإحصاءات المستخدمة بشكل خاطئ" . www.statisticsdonewrong.com . تاريخ الاطلاع: 30 سبتمبر 2019 .
- ↑ ناكاغاوا، شينيتشي؛ لاغيسز، مالغورزاتا؛ يانغ، ييفنغ؛ دروبنياك، سيمون م. (2024). "إيجاد التوازن الأمثل للقوة: تصميم دراسة أفضل وتعاون يمكن أن يقلل الاعتماد على القوة الإحصائية" . مجلة PLOS Biology . 22 (1) e3002423. doi : 10.1371/journal.pbio.3002423 . PMC 10773938. PMID 38190355 .
- ↑ روبرت لير (1992)، "ستة عشر مربعًا من S على مربع D: علاقة لتقديرات حجم العينة الخام"، الإحصاء في الطب (بالألمانية)، المجلد 11، العدد 8، الصفحات 1099-1102، doi : 10.1002/sim.4780110811 ، ISSN 0277-6715 ، PMID 1496197
- ↑ فان بيل، جيرالد (18 أغسطس/آب 2008). القواعد الإحصائية العامة، الطبعة الثانية . سلسلة وايلي في الاحتمالات والإحصاء. هوبوكين، نيوجيرسي، الولايات المتحدة الأمريكية: جون وايلي وأولاده. doi : 10.1002/9780470377963 . ISBN 978-0-470-37796-3.
- ↑ تقدير حجم العينة في البحوث السريرية من التجارب المعشاة ذات الشواهد إلى الدراسات الرصدية، 2020، doi: 10.1016/j.chest.2020.03.010، شياوفينغ وانغ، دكتوراه؛ وشينغ جي، ماجستير (ملف PDF)
- ↑ إيفريت، برايان س. (2002). قاموس كامبريدج للإحصاء . مطبعة جامعة كامبريدج. ص 321. ISBN 0-521-81099-X.
- ↑ إليس، بول (2010). الدليل الأساسي لأحجام التأثير: القوة الإحصائية، والتحليل التلوي، وتفسير نتائج البحوث . مطبعة جامعة كامبريدج. ص 52. ISBN 978-0-521-14246-5.
- ↑ تسانغ، ر.؛ كولي، ل.؛ ليند، ل.د. (2009). "عدم كفاية القدرة الإحصائية للكشف عن الفروق ذات الدلالة السريرية في معدلات الأحداث الضائرة في التجارب المعشاة ذات الشواهد". مجلة علم الأوبئة السريرية . 62 (6): 609-616 . doi : 10.1016/j.jclinepi.2008.08.005 . PMID 19013761 .
- ↑ إليس، بول د. (2010). الدليل الأساسي لأحجام التأثير: مقدمة في القوة الإحصائية، والتحليل التلوي، وتفسير نتائج البحوث . المملكة المتحدة: مطبعة جامعة كامبريدج. ص 56.
- ↑ "تقدير القوة الإحصائية عند استخدام إجراءات اختبار متعددة" . mdrc.org . نوفمبر 2017.
- ↑ هونيغ؛ هايسي (2001). "إساءة استخدام السلطة". الإحصائي الأمريكي . 55 (1): 19-24 . doi : 10.1198/000313001300339897 .
- ↑ توماس، ل. (1997). "تحليل القدرة الإحصائية بأثر رجعي" (ملف PDF) . علم الأحياء الحفظي . 11 (1): 276-280 . Bibcode : 1997ConBi..11..276T . doi : 10.1046/j.1523-1739.1997.96102.x . hdl : 10023/679 .
- ↑ غرايبنر، روبرت و. (1999). تصميم الدراسة باستخدام برنامج SAS: تقدير القوة الإحصائية باستخدام طرق مونت كارلو (ملف PDF) . SUGI 24.
- ^ يوانيديس ، جون بنسلفانيا. ستانلي، تد؛ دوكولياجوس ، خريستوس (1 أكتوبر 2017). “قوة التحيز في البحوث الاقتصادية”. المجلة الاقتصادية . 127 (605): F236 – F265. دوى : 10.1111/ecoj.12461 .
- ^ آريل بوندوك، فنسنت. بريجز ، ريان سي. دوكولياجوس، خريستوس؛ مندوزا أفينيا، ماركو؛ ستانلي ، تد (13 ديسمبر 2024). “أبحاث العلوم السياسية الكمية ضعيفة إلى حد كبير”. مجلة السياسة . دوى : 10.1086/734279 .
- ↑ ستانلي، تي دي؛ كارتر، إيفان سي؛ دوكولياغوس، هريستوس (ديسمبر 2018). "ما تكشفه التحليلات التلوية عن إمكانية تكرار البحوث النفسية". النشرة النفسية . 144 (12): 1325-1346 . doi : 10.1037/bul0000169 . PMID 30321017 .
- ↑ يانغ، ييفنغ؛ سانشيز-توجار، ألفريدو؛ أوديا، روز إي؛ نوبل، دانيال دبليو إيه؛ كوريتشيفا، جوليا؛ جينيونز، مايكل دي؛ باركر، تيموثي إتش؛ لاغيسز، مالغورزاتا؛ ناكاغاوا، شينيتشي (3 أبريل 2023). "تأثير تحيز النشر على حجم التأثير، والقوة الإحصائية، وأخطاء الحجم (النوع م) والإشارة (النوع س) في علم البيئة وعلم الأحياء التطوري" . مجلة BMC Biology . 21 (1) 71. doi : 10.1186/s12915-022-01485-y . PMC 10071700. PMID 37013585 .
مصادر
روابط خارجية
- اختبار الفرضيات الإحصائية
