Z-Score, point by point


Sample
Odd readings
Flag when

الفكرة كلّها.
لا يفعل الـ z-score أكثر من إعادة التعبير عن القراءة بدلالة كم standard deviation تبعد عن الـ mean:

z = (x − μ) / σ

هذه هي الطريقة بأكملها. وليس لديها أيّ مفهوم عن الشذوذ — أنت من يزوّدها به، باختيار cut-off واعتبار كلّ ما تجاوزه غريبًا. والخيارات المعتادة هي 2 و2.5 و3، وهي أعراف لا اكتشافات. كلٌّ من μ وσ يُقاس من البيانات نفسها التي تفحصها، وهنا مكمن ضعفها!

Cut-offفي بيانات طبيعية فعلًا، يَسِم هذامن أصل 200 قراءة
|z| > 24.6% من النقاط العادية تمامًانحو 9
|z| > 2.51.2%نحو 2 أو 3
|z| > 30.3%نحو قراءة واحدة في كلّ عيّنتين

أمور تستحقّ التجربة:
1. أبقِ None و|z| > 2، واضغط New random sample عدّة مرّات. لا عيب في هذه البيانات — إنّها منحنى bell نظيف واحد — ومع ذلك تُوسَم نحو 9 نقاط في كلّ مرّة. وهذا ليس فشلًا للطريقة: فعند |z| > 2 تكون قد طلبت الـ 4.6% الطرفية بنفسك، فتأتيك الإنذارات الكاذبة حتى على بيانات نظيفة.

2. والآن Many مع |z| > 3. عشرون قراءة غريبة، وقد تضاعف الـ σ وزيادة — من نحو 15 إلى نحو 32. لقد مطّت القيم الشاذّة المسطرة نفسها التي تقيسها بها، فلم يعد يُضبَط منها سوى 7 من أصل 20 تقريبًا؛ أمّا الـ 13 الباقية فتختبئ خلف الـ σ الذي ضخّمته بنفسها. وهذا ما يُسمّى masking. أنزِل الـ cut-off إلى |z| > 2 فتعود العشرون كلّها بلا إنذارات كاذبة تقريبًا — لكن لسبب واحد فقط: أنّ σ صار من الاتّساع بحيث لا تبلغ القراءة العادية 2σ أصلًا. الحلّ ليس cut-off مختلفًا. الحلّ إحصاءة لا تستطيع القيم الشاذّة جرّها: فالـ median والـ quartiles بالكاد تتحرّك، ولهذا تضبط قاعدة الـ IQR هذه العشرين جميعًا.