الفكرة كلّها.
لا يفعل الـ z-score أكثر من إعادة التعبير عن القراءة بدلالة كم standard deviation تبعد عن
الـ mean:
z = (x − μ) / σ
هذه هي الطريقة بأكملها. وليس لديها أيّ مفهوم عن الشذوذ — أنت من يزوّدها به، باختيار
cut-off واعتبار كلّ ما تجاوزه غريبًا. والخيارات المعتادة هي 2 و2.5 و3، وهي أعراف لا اكتشافات.
كلٌّ من μ وσ يُقاس من البيانات نفسها التي تفحصها، وهنا مكمن ضعفها!
Cut-off
في بيانات طبيعية فعلًا، يَسِم هذا
من أصل 200 قراءة
|z| > 2
4.6% من النقاط العادية تمامًا
نحو 9
|z| > 2.5
1.2%
نحو 2 أو 3
|z| > 3
0.3%
نحو قراءة واحدة في كلّ عيّنتين
أمور تستحقّ التجربة:
1. أبقِ None و|z| > 2، واضغط New random sample عدّة مرّات. لا عيب في هذه
البيانات — إنّها منحنى bell نظيف واحد — ومع ذلك تُوسَم نحو 9 نقاط في كلّ مرّة. وهذا
ليس فشلًا للطريقة: فعند |z| > 2 تكون قد طلبت الـ 4.6% الطرفية بنفسك، فتأتيك الإنذارات
الكاذبة حتى على بيانات نظيفة.
2. والآن Many مع |z| > 3. عشرون قراءة غريبة، وقد تضاعف الـ σ وزيادة — من
نحو 15 إلى نحو 32. لقد مطّت القيم الشاذّة المسطرة نفسها التي تقيسها بها، فلم يعد
يُضبَط منها سوى 7 من أصل 20 تقريبًا؛ أمّا الـ 13 الباقية فتختبئ خلف الـ σ الذي
ضخّمته بنفسها. وهذا ما يُسمّى masking. أنزِل الـ cut-off إلى |z| > 2 فتعود
العشرون كلّها بلا إنذارات كاذبة تقريبًا — لكن لسبب واحد فقط: أنّ σ صار من الاتّساع
بحيث لا تبلغ القراءة العادية 2σ أصلًا. الحلّ ليس cut-off مختلفًا. الحلّ إحصاءة لا
تستطيع القيم الشاذّة جرّها: فالـ median والـ quartiles بالكاد تتحرّك، ولهذا تضبط قاعدة الـ IQR
هذه العشرين جميعًا.