মূল ধারণাটি। z-score শুধু একটি রিডিংকে অন্যভাবে প্রকাশ করে: এটি mean থেকে কত standard deviation দূরে
বসে আছে:
z = (x − μ) / σ
পদ্ধতিটি এইটুকুই। anomaly বলতে এর নিজস্ব কোনো ধারণা নেই — সেটি আপনিই সরবরাহ করেন, একটি
cut-off বেছে নিয়ে এবং তার বাইরের সবকিছুকে অস্বাভাবিক বলে ঘোষণা করে। প্রচলিত পছন্দ 2, 2.5 ও 3,
আর এগুলো নিছক রীতি, কোনো আবিষ্কার নয়।
μ ও σ দুটিই মাপা হয় ঠিক সেই ডেটা থেকেই যেটি আপনি পরীক্ষা করছেন,
এখানেই এর দুর্বলতা!
Cut-off
সত্যিই normal এমন ডেটায় এটি যত পয়েন্ট চিহ্নিত করে
200টি রিডিংয়ে
|z| > 2
পুরোপুরি স্বাভাবিক পয়েন্টের 4.6%
আনুমানিক 9টি
|z| > 2.5
1.2%
আনুমানিক 2 বা 3টি
|z| > 3
0.3%
প্রতি 2টি নমুনায় প্রায় 1টি
যা চেষ্টা করে দেখার মতো:
1. None, |z| > 2 রেখে New random sample কয়েকবার চাপুন। এই ডেটায় কোনো
গণ্ডগোল নেই — এটি একটিমাত্র পরিচ্ছন্ন bell curve — তবুও প্রতিবারই প্রায় 9টি পয়েন্ট
চিহ্নিত হয়। এটি পদ্ধতির ব্যর্থতা নয়। |z| > 2-তে আপনি নিজেই বাইরের 4.6% চেয়ে নিয়েছেন,
তাই পরিচ্ছন্ন ডেটাতেও মিথ্যা সতর্কতা পাবেনই।
2. এবার Many, |z| > 3। কুড়িটি অস্বাভাবিক রিডিং, আর σ দ্বিগুণেরও বেশি হয়ে গেছে
— প্রায় 15 থেকে প্রায় 32। outlier-গুলো ঠিক সেই মাপকাঠিটিকেই টেনে লম্বা করে
দিয়েছে যেটি দিয়ে আপনি তাদের মাপছেন, ফলে 20টির মধ্যে মাত্র 7টির মতো ধরা পড়ে; বাকি
13টি নিজেদেরই ফোলানো σ-এর আড়ালে লুকিয়ে থাকে। এটিকেই বলে masking।
cut-off নামিয়ে |z| > 2 করুন, কুড়িটিই ফিরে আসবে, প্রায় কোনো মিথ্যা সতর্কতা ছাড়াই —
তবে কেবল এই কারণে যে σ এখন এত চওড়া যে সাধারণ কোনো রিডিংও 2σ পর্যন্ত পৌঁছাতে পারে না।
সমাধান ভিন্ন কোনো cut-off নয়। সমাধান এমন একটি পরিসংখ্যান যাকে outlier টেনে নিয়ে যেতে পারে
না: median ও quartile সামান্যই নড়ে, আর সেই কারণেই IQR নিয়ম এই 20টিকেই ধরে ফেলে।