Z-Score, point by point


Sample
Odd readings
Flag when

মূল ধারণাটি।
z-score শুধু একটি রিডিংকে অন্যভাবে প্রকাশ করে: এটি mean থেকে কত standard deviation দূরে বসে আছে:

z = (x − μ) / σ

পদ্ধতিটি এইটুকুই। anomaly বলতে এর নিজস্ব কোনো ধারণা নেই — সেটি আপনিই সরবরাহ করেন, একটি cut-off বেছে নিয়ে এবং তার বাইরের সবকিছুকে অস্বাভাবিক বলে ঘোষণা করে। প্রচলিত পছন্দ 2, 2.5 ও 3, আর এগুলো নিছক রীতি, কোনো আবিষ্কার নয়। μ ও σ দুটিই মাপা হয় ঠিক সেই ডেটা থেকেই যেটি আপনি পরীক্ষা করছেন, এখানেই এর দুর্বলতা!

Cut-offসত্যিই normal এমন ডেটায় এটি যত পয়েন্ট চিহ্নিত করে200টি রিডিংয়ে
|z| > 2পুরোপুরি স্বাভাবিক পয়েন্টের 4.6%আনুমানিক 9টি
|z| > 2.51.2%আনুমানিক 2 বা 3টি
|z| > 30.3%প্রতি 2টি নমুনায় প্রায় 1টি

যা চেষ্টা করে দেখার মতো:
1. None, |z| > 2 রেখে New random sample কয়েকবার চাপুন। এই ডেটায় কোনো গণ্ডগোল নেই — এটি একটিমাত্র পরিচ্ছন্ন bell curve — তবুও প্রতিবারই প্রায় 9টি পয়েন্ট চিহ্নিত হয়। এটি পদ্ধতির ব্যর্থতা নয়। |z| > 2-তে আপনি নিজেই বাইরের 4.6% চেয়ে নিয়েছেন, তাই পরিচ্ছন্ন ডেটাতেও মিথ্যা সতর্কতা পাবেনই।

2. এবার Many, |z| > 3। কুড়িটি অস্বাভাবিক রিডিং, আর σ দ্বিগুণেরও বেশি হয়ে গেছে — প্রায় 15 থেকে প্রায় 32। outlier-গুলো ঠিক সেই মাপকাঠিটিকেই টেনে লম্বা করে দিয়েছে যেটি দিয়ে আপনি তাদের মাপছেন, ফলে 20টির মধ্যে মাত্র 7টির মতো ধরা পড়ে; বাকি 13টি নিজেদেরই ফোলানো σ-এর আড়ালে লুকিয়ে থাকে। এটিকেই বলে maskingcut-off নামিয়ে |z| > 2 করুন, কুড়িটিই ফিরে আসবে, প্রায় কোনো মিথ্যা সতর্কতা ছাড়াই — তবে কেবল এই কারণে যে σ এখন এত চওড়া যে সাধারণ কোনো রিডিংও 2σ পর্যন্ত পৌঁছাতে পারে না। সমাধান ভিন্ন কোনো cut-off নয়। সমাধান এমন একটি পরিসংখ্যান যাকে outlier টেনে নিয়ে যেতে পারে না: median ও quartile সামান্যই নড়ে, আর সেই কারণেই IQR নিয়ম এই 20টিকেই ধরে ফেলে।