طريقة CLs (فيزياء الجسيمات)

في فيزياء الجسيمات ، تُمثل حدود الثقة [ 1 ] طريقة إحصائية لتحديد حدود عليا (تُسمى أيضًا حدود الاستبعاد [ 2 ] ) لمعاملات النموذج ، وهي شكل خاص من تقدير الفترات يُستخدم للمعاملات التي لا تأخذ إلا قيمًا غير سالبة. على الرغم من أن حدود الثقة تُشير إلى مستويات الثقة ، إلا أن "اسم الطريقة مُضلل، لأن منطقة الاستبعاد في حدود الثقة ليست فترة ثقة ." [ 3 ] طُورت هذه الطريقة لأول مرة من قِبل الفيزيائيين العاملين في تجربة LEP في CERN ، ومنذ ذلك الحين استُخدمت في العديد من تجارب فيزياء الطاقة العالية . وهي طريقة إحصائية تكرارية بمعنى أن خصائص الحد تُحدد بواسطة احتمالات الخطأ ، إلا أنها تختلف عن فترات الثقة القياسية في أن مستوى الثقة المُحدد للفترة لا يُساوي احتمال تغطيتها . يرجع سبب هذا الانحراف إلى أن الحدود العليا القياسية المستندة إلى أقوى اختبار تنتج بالضرورة فترات فارغة باحتمالية ثابتة عندما تكون قيمة المعلمة صفرًا، وتعتبر هذه الخاصية غير مرغوب فيها من قبل معظم الفيزيائيين والإحصائيين. [ 4 ]

تتضمن الحدود العليا المُستنتجة باستخدام طريقة حدود الثقة دائمًا القيمة الصفرية للمعامل، وبالتالي فإن احتمال التغطية عند هذه النقطة يكون دائمًا 100%. لا يستند تعريف حدود الثقة إلى أي إطار نظري دقيق للاستدلال الإحصائي ، ولذلك يُوصف أحيانًا بأنه تعريف مخصص . ومع ذلك، فهو يُشابه إلى حد كبير مفاهيم الأدلة الإحصائية [ 5 ] التي اقترحها الإحصائي آلان بيرنباوم .

تعريف

ليكن X عينة عشوائية من توزيع احتمالي ذي معلمة حقيقية غير سالبةθ[0،){\displaystyle \theta \in [0,\infty )}حد أعلى لمستوى الثقة للمعامل θ ، مع مستوى الثقة1-α{\displaystyle 1-\alpha '}، هو إحصائية (أي متغير عشوائي قابل للملاحظة )θuص(X){\displaystyle \theta _{up}(X)}والتي تمتلك الخاصية التالية:

The inequality is used in the definition to account for cases where the distribution of X is discrete and an equality can not be achieved precisely. If the distribution of X is continuous then this should be replaced by an equality. Note that the definition implies that the coverage probabilityP(θup(X)θ|θ){\displaystyle \mathbb {P} (\theta _{up}(X)\geq \theta |\theta )} is always larger than 1α{\displaystyle 1-\alpha '}.

An equivalent definition can be made by considering a hypothesis test of the null hypothesis H0:θ=θ0{\displaystyle H_{0}:\theta =\theta _{0}} against the alternative H1:θ=0{\displaystyle H_{1}:\theta =0}. Then the numerator in (1), when evaluated at θ0{\displaystyle \theta _{0}}, correspond to the type-I error probability (α{\displaystyle \alpha }) of the test (i.e., θ0{\displaystyle \theta _{0}} is rejected when θup(X)<θ0{\displaystyle \theta _{up}(X)<\theta _{0}}) and the denominator to the power (1β{\displaystyle 1-\beta }). The criterion for rejecting H0{\displaystyle H_{0}} thus requires that the ratio α/(1β){\displaystyle \alpha /(1-\beta )} will be smaller than α{\displaystyle \alpha '}. This can be interpreted intuitively as saying that θ0{\displaystyle \theta _{0}} is excluded because it is α{\displaystyle \alpha '} less likely to observe such an extreme outcome as X when θ0{\displaystyle \theta _{0}} is true than it is when the alternative θ=0{\displaystyle \theta =0} is true.

The calculation of the upper limit is usually done by constructing a test statisticqθ(X){\displaystyle q_{\theta }(X)} and finding the value of θ{\displaystyle \theta } for which

P(qθ(X)qθ|θ)P(qθ(X)qθ|0)=α.{\displaystyle {\frac {\mathbb {P} (q_{\theta }(X)\geq q_{\theta }^{*}|\theta )}{\mathbb {P} (q_{\theta }(X)\geq q_{\theta }^{*}|0)}}=\alpha '.}

where qθ{\displaystyle q_{\theta }^{*}} is the observed outcome of the experiment.

Usage in high energy physics

Upper limits based on the CLs method were used in numerous publications of experimental results obtained at particle accelerator experiments such as LEP, the Tevatron and the LHC, most notable in the searches for new particles.

Origin

The original motivation for CLs was based on a conditional probability calculation suggested by physicist G. Zech[6] for an event counting experiment. Suppose an experiment consists of measuring n{\displaystyle n} events coming from signal and background processes, both described by Poisson distributions with respective rates s{\displaystyle s} and b{\displaystyle b}, namely nPoiss(s+b){\displaystyle n\sim {\text{بويس}}(s+b)}. b{\displaystyle b} is assumed to be known and s{\displaystyle s} is the parameter to be estimated by the experiment. The standard procedure for setting an upper limit on s{\displaystyle s} given an experimental outcome n{\displaystyle n^{*}} consists of excluding values of s{\displaystyle s} for which P(nn|s+b)α{\displaystyle \mathbb {P} (n\leq n^{*}|s+b)\leq \alpha }, which guarantees at least 1α{\displaystyle 1-\alpha } coverage. Consider, for example, a case where b=3{\displaystyle b=3} and n=0{\displaystyle n^{*}=0} events are observed, then one finds that s+b3{\displaystyle s+b\geq 3} is excluded at 95% confidence level. But this implies that s0{\displaystyle s\geq 0} is excluded, namely all possible values of s{\displaystyle s}. Such a result is difficult to interpret because the experiment cannot essentially distinguish very small values of s{\displaystyle s} from the background-only hypothesis, and thus declaring that such small values are excluded (in favor of the background-only hypothesis) seems inappropriate. To overcome this difficulty Zech suggested conditioning the probability that nn{\displaystyle n\leq n^{*}} on the observation that nbn{\displaystyle n_{b}\leq n^{*}}, where nb{\displaystyle n_{b}}يمثل عدد الأحداث الخلفية (غير القابل للقياس). والسبب وراء ذلك هو أنه عندمانب{\displaystyle n_{b}}عندما تكون القيمة صغيرة، يكون الإجراء أكثر عرضة لإنتاج خطأ (أي، فترة لا تغطي القيمة الحقيقية) مقارنةً بما هو عليه عندمانب{\displaystyle n_{b}}واسعة، وتوزيعهانب{\displaystyle n_{b}}هي نفسها مستقلة عنs{\displaystyle s}أي أنه لا ينبغي الإبلاغ عن احتمال الخطأ الإجمالي، بل عن الاحتمال الشرطي بناءً على المعرفة المتوفرة حول عدد الأحداث الخلفية في العينة. هذا الاحتمال الشرطي هو

P(نن*|نبن*،s+ب)=P(نن*،نبن*|s+ب)P(نبن*|s+ب)=P(نن*|s+ب)P(نن*|ب).{\displaystyle \mathbb {P} (n\leq n^{*}|n_{b}\leq n^{*},s+b)={\frac {\mathbb {P} (n\leq n^{*},n_{b}\leq n^{*}|s+b)}{\mathbb {P} (n_{b}\leq n^{*}|s+b)}}={\frac {\mathbb {P} (n\leq n^{*}|s+b)}{\mathbb {P} (n\leq n^{*}|b)}}.}

وهذا يتوافق مع التعريف المذكور أعلاه للاحتمالات الشرطية. تستخدم المساواة الأولى تعريف الاحتمال الشرطي ، وتأتي المساواة الثانية من حقيقة أنه إذانن*نبن*{\displaystyle n\leq n^{*}\Rightarrow n_{b}\leq n^{*}}وعدد الأحداث الخلفية مستقل بحكم التعريف عن قوة الإشارة.

تعميم الحجة الشرطية

يمكن تعميم حجة زيك الشرطية رسميًا لتشمل الحالة العامة. لنفترض أنq(X){\displaystyle q(X)}هي إحصائية اختبار يتم من خلالها اشتقاق فترة الثقة، ولتكن

صθ=P(q(X)>q*|θ){\displaystyle p_{\theta }=\mathbb {P} (q(X)>q^{*}|\theta )}

أينq*{\displaystyle q*}هي النتيجة التي تم رصدها من خلال التجربة. ثمصθ{\displaystyle p_{\theta }}يمكن اعتبارها غير قابلة للقياس (لأنθ{\displaystyle \theta }متغير عشوائي غير معروف، توزيعه منتظم بين 0 و1 بغض النظر عنθ{\displaystyle \theta }إذا كان الاختبار غير متحيز، فإن النتيجة ستكونq*{\displaystyle q*}يشير إلى

صθP(q(X)>q*|0)ص0*{\displaystyle p_{\theta }\leq \mathbb {P} (q(X)>q^{*}|0)\equiv p_{0}^{*}}

ومنها، على غرار التكييف علىنب{\displaystyle n_{b}}في الحالة السابقة، نحصل على

P(q(X)q*|صθص0*،θ)=P(q(X)q*|θ)P(صθص0*|θ)=P(q(X)q*|θ)ص0*=P(q(X)q*|θ)P(q(X)>q*|0).{\displaystyle \mathbb {P} (q(X)\geq q^{*}|p_{\theta }\leq p_{0}^{*},\theta )={\frac {\mathbb {P} (q(X)\geq q^{*}|\theta )}{\mathbb {P} (p_{\theta }\leq p_{0}^{*}|\theta )}}= {\frac {\mathbb {P} (q(X)\geq q^{*}|\theta )}{p_{0}^{*}}}={\frac {\mathbb {P} (q(X)\geq q^{*}|\theta )}{\mathbb {P} (q(X)>q^{*}|0)}}.}

العلاقة بالمبادئ الأساسية

يمكن اعتبار الحجج المذكورة أعلاه متوافقة مع روح مبدأ الشرطية في الاستدلال الإحصائي، على الرغم من أنها تعبر عن مفهوم أعمّ للشرطية لا يتطلب وجود إحصائية مساعدة . مع ذلك، فإن مبدأ الشرطية ، حتى في صيغته الأصلية الأكثر تقييدًا، يستلزم مبدأ الاحتمالية ، وهي نتيجة أثبتها بيرنباوم بشكلٍ شهير . [ 7 ] لا تخضع CLs لمبدأ الاحتمالية ، وبالتالي لا يمكن استخدام هذه الاعتبارات إلا للإشارة إلى المعقولية، وليس إلى الاكتمال النظري من وجهة النظر التأسيسية. (وينطبق الأمر نفسه على أي طريقة إحصائية تكرارية إذا اعتُبر مبدأ الشرطية ضروريًا).

اقترح بيرنباوم نفسه في بحثه المنشور عام 1962 أن نسبة CLsα/(1-β){\displaystyle \alpha /(1-\beta )}ينبغي استخدامها كمقياس لقوة الأدلة الإحصائية التي توفرها اختبارات الدلالة، بدلاً منα{\displaystyle \alpha }بمفرده. وقد نتج هذا عن تطبيق بسيط لمبدأ الاحتمالية : إذا كان من المقرر الإبلاغ عن نتيجة تجربة ما فقط في شكل قرار "قبول" / "رفض"، فإن الإجراء العام يعادل تجربة لها نتيجتان محتملتان فقط، باحتمالاتα{\displaystyle \alpha }،(1-β){\displaystyle (1-\beta )}و1-α{\displaystyle 1-\alpha }،(β){\displaystyle (\beta )}تحتح1،(ح2){\displaystyle H_{1},(H_{2})}نسبة الاحتمال المرتبطة بنتيجة "الرفض"ح1{\displaystyle H_{1}}"لذلك"α/(1-β){\displaystyle \alpha /(1-\beta )}وبالتالي، ينبغي تحديد التفسير الدلالي لهذه النتيجة. (إذ أن نسبة الاحتمال، لاختبار فرضيتين بسيطتين، هي تمثيل موجز لدالة الاحتمال ). من جهة أخرى، إذا أردنا اتباع مبدأ الاحتمال باستمرار، فينبغي استخدام نسبة احتمال النتيجة الأصلية وليسα/(1-β){\displaystyle \alpha /(1-\beta )}مما يجعل أساس هذا التفسير موضع شك. وصف بيرنباوم هذا لاحقًا بأنه "ذو قيمة استدلالية في أحسن الأحوال، وليست جوهرية، لتفسير الأدلة".

يمكن إيجاد نهج أكثر مباشرة يؤدي إلى نتيجة مماثلة في صياغة بيرنباوم لمبدأ الثقة ، والذي، على عكس الصيغة الأكثر شيوعًا، يشير إلى احتمالات الخطأ بنوعيها. وقد ورد ذلك على النحو التالي: [ 8 ]

لا يكون مفهوم الدليل الإحصائي معقولاً إلا إذا وجد "دليلاً قوياً علىح2{\displaystyle H_{2}}ضدح1{\displaystyle H_{1}}باحتمالية ضئيلة(α){\displaystyle (\alpha )}متىح1{\displaystyle H_{1}}هذا صحيح، وباحتمالية أكبر بكثير (1-β) {\displaystyle \ (1-\beta )\ }متىح2{\displaystyle H_{2}}هذا صحيح.

قد يبدو تعريف الثقة هذا متوافقًا ظاهريًا مع تعريف فترات الثقة. مع ذلك، يبقى صحيحًا أن كلا من هذا التعريف والصيغة الأكثر شيوعًا (المرتبطة بنظرية نيمان - بيرسون ) لمبدأ الثقة لا يتوافقان مع مبدأ الاحتمالية، وبالتالي لا يمكن اعتبار أي طريقة إحصائية تكرارية حلًا كاملًا للمشاكل التي تثيرها دراسة الخصائص الشرطية لفترات الثقة.

الحساب في حالة العينة الكبيرة

إذا تحققت شروط انتظام معينة، فإن دالة الاحتمال العامة ستصبح دالة غاوسية في حالة العينات الكبيرة. في هذه الحالة، يكون الحد الأعلى لمستوى الثقة عند مستوى الثقة1-α{\displaystyle 1-\alpha '}(المستمد من الاختبار الأكثر قوة بشكل موحد ) يتم تقديمه بواسطة [ 9 ]

θuص=θ^+σΦ-1(1-αΦ(θ^/σ))،{\displaystyle \theta _{up}={\hat {\theta }}+\sigma \Phi ^{-1}(1-\alpha '\Phi ({\hat {\theta }}/\sigma )),}

أينΦ{\displaystyle \Phi }هو التوزيع التراكمي الطبيعي القياسي ،θ^{\displaystyle {\hat {\theta }}}هو مقدر الاحتمال الأقصى لـθ{\displaystyle \theta }وσ{\displaystyle \sigma }يمثل انحرافها المعياري ؛ ويمكن تقدير هذا الأخير من معكوس مصفوفة معلومات فيشر أو باستخدام مجموعة بيانات "أسيموف" [ 9 ] . وتُعادل هذه النتيجة فترة ثقة بايزية إذا كان التوزيع الاحتمالي المسبق منتظمًا لـθ{\displaystyle \theta }يتم استخدامه.

مراجع

  1. ريد، أ. ل. (2002). "عرض نتائج البحث: تقنية CL(s)". مجلة الفيزياء G: الفيزياء النووية وفيزياء الجسيمات . 28 (10): 2693-2704 . Bibcode : 2002JPhG...28.2693R . doi : 10.1088/0954-3899/28/10/313 .
  2. Particle Physics at the Tercentenary of Mikhail Lomonosov, p. 13, at Google Books
  3. Amnon Harel. "Statistical methods in CMS searches"(PDF). indico.cern.ch. Retrieved 2015-04-10.
  4. Mark Mandelkern (2002). "Setting Confidence Intervals for Bounded Parameters". Statistical Science. 17 (2): 149–159. doi:10.1214/ss/1030550859. JSTOR 3182816.
  5. Ronald N. Giere (1977). "Allan Birnbaum's Conception of Statistical Evidence". Synthese. 36 (1): 5–13. doi:10.1007/bf00485688. S2CID 46973213.
  6. G. Zech (1989). "Upper limits in experiments with background or measurement errors"(PDF). Nucl. Instrum. Methods Phys. Res. A. 277 (2–3): 608–610. Bibcode:1989NIMPA.277..608Z. doi:10.1016/0168-9002(89)90795-X.
  7. Birnbaum, Allan (1962). "On the foundations of statistical inference". Journal of the American Statistical Association. 57 (298): 269–326. doi:10.2307/2281640. JSTOR 2281640. MR 0138176.(With discussion.)
  8. Birnbaum, Allan (1977). "The Neyman-Pearson Theory as Decision Theory, and as Inference Theory; with a Criticism of the Lindley-Savage Argument for Bayesian Theory". Synthese. 36 (1): 19–49. doi:10.1007/bf00485690. S2CID 35027844.
  9. 12G. Cowan; K. Cranmer; E. Gross; O. Vitells (2011). "Asymptotic formulae for likelihood-based tests of new physics". Eur. Phys. J. C. 71 (2): 1554. arXiv:1007.1727. Bibcode:2011EPJC...71.1554C. doi:10.1140/epjc/s10052-011-1554-0.

Further reading