tensor + aquarium, planetarium-এর -arium: যেখানে আপনি tensor-কে বয়ে যেতে দেখেন। খেলাচ্ছলে রাখা, অথচ স্বতন্ত্র একটি নাম।
লেবেলবিহীন ডেটায় গ্রুপ খুঁজে বের করার চারটি উপায়। প্রতিটি পাতা ব্রাউজারেই সরাসরি চলে — ক্লিক করে পয়েন্ট বসান, অ্যালগরিদমকে এক ধাপ করে এগিয়ে নিন, আর ঠিক কোথায় সেটি সফল হয় ও কোথায় ভেঙে পড়ে তা দেখুন।
centroid-গুলো নিজে বসান, তারপর দুটি ধাপ পালা করে চালান: প্রতিটি পয়েন্টকে তার নিকটতম centroid-এ আবার ভাগ করুন, আর প্রতিটি centroid-কে তার পয়েন্টগুলোর গড়ে সরিয়ে নিন। J-এর পতন দেখুন — আর cluster গোলাকার না হলে সেটি কীভাবে ভুল উত্তরে থিতু হয় তাও দেখুন।
প্রতিটি পয়েন্টকে নিজস্ব cluster ধরে শুরু করুন এবং বারবার নিকটতম জোড়া merge করতে থাকুন, যতক্ষণ না একটিই বাকি থাকে। single, complete ও average linkage তুলনা করুন, তারপর cluster সংখ্যা বা উচ্চতা ধরে ট্রি cut করুন।
কেন্দ্র থেকে দূরত্বের বদলে ঘনত্ব ধরে cluster করুন। ε ও minPts ঠিক করে দিন, আর অ্যালগরিদম core পয়েন্ট থেকে যেকোনো আকৃতির cluster বাড়িয়ে তুলবে — বাকি যা থাকে তাকে noise বলে চিহ্নিত করবে।
soft clustering। প্রতিটি cluster একেকটি ellipse, যার নিজস্ব আকার ও হেলান আছে, আর প্রতিটি পয়েন্ট লেবেলের বদলে পায় অন্তর্ভুক্তির সম্ভাবনা। E-step ও M-step ধাপে ধাপে নিজে চালিয়ে দেখুন।
কোনো রিডিং যে এখানকার নয়, তা ঠিক করার তিনটি উপায়। এর দুটি এমন হিসাব যা আপনি কাগজেই কষতে পারেন; তৃতীয়টি একটি model। প্রতিটি পাতা নিজের ডেটা নিজেই তৈরি করে, তাই বোতামটি কয়েকবার চেপে দেখুন উত্তরটি কতটা বদলায়।
mean থেকে কত standard deviation দূরে? নতুন একটি bell curve তৈরি করুন, একটি cut-off বেছে নিন, আর z-score দেখুন। তারপর কয়েকটি অস্বাভাবিক রিডিং যোগ করে দেখুন সেগুলো ঠিক সেই σ-কেই কীভাবে ফুলিয়ে দেয় যার সাপেক্ষে আপনি তাদের মাপছেন।
ডেটার মাঝের অর্ধেক, box plot হিসেবে আঁকা। outlier যোগ করলেও quartile সামান্যই নড়ে, আর ঠিক এ কারণেই যে দূষণ z-score-কে হারিয়ে দেয়, এই নিয়ম তা টিকে যায়।
একটি পয়েন্ট একা না হওয়া পর্যন্ত এলোমেলোভাবে তল কাটতে থাকুন, আর কাটগুলো গুনুন। যাদের আলাদা করা সহজ, সেগুলোই anomaly। একটিমাত্র ট্রি-কে কাজটি করতে দেখুন, তারপর একশোটি বাড়ান।