খালি ডেটার স্ট্যান্ডার্ড ডেভিয়েশন: ক্রিকেট বিশ্লেষণে 'অজানা'-কে 'পরিষ্কার' ভাবার বিপদ
মূল উত্তর: ক্রিকেট ডেটা বিশ্লেষণে খালি বা শূন্য ইনপুটকে 'পরিষ্কার' ধরে নেওয়া ভুল; তথ্য-বিন্দু না থাকলে বিশ্লেষণ থামিয়ে EXTRACTION_FAILED চিহ্নিত করা উচিত। মূল তথ্য: - শূন্য তথ্য-বিন্দু ও ফাঁকা সারসংক্ষেপযুক্ত আউটপুট দেখতে স্কিমা-সম্মত হলেও কোনো প্রমাণ বহন করে না। - 'অজানা' আর 'অনুপস্থিত' আলাদা; ফাঁকা ঘর কখনোই দুর্নীতি-মুক্তির সনদ নয়। - প্রতি ১০০ বিশ্লেষণে ২ শতাংশের বেশি শূন্য আউটপুট হলে তা পদ্ধতিগত ত্রুটি। - সূত্র ও প্রকাশের তারিখ হওয়া উচিত শীর্ষস্তরের বাধ্যতামূলক ঘর। - বাধ্যতামূলক আট-মাত্রার ছাঁচ ও শূন্য প্রমাণ একসঙ্গে থাকলে তথ্য বানিয়ে ফেলার ঝুঁকি তৈরি হয়। সূত্র: Stage-2 গভীর বিশ্লেষণ প্রতিবেদন (ক্রিকেট ডোমেইন)। প্রকাশের তারিখ: নির্দিষ্ট নয় (উৎসে উল্লেখ নেই)। | Cross-checked: cricsultan.com সম্পর্কিত প্রশ্নোত্তর: প্রশ্ন: কেন খালি ডেটা বিপজ্জনক? উত্তর: কারণ সুগঠিত ফাঁকা রিপোর্ট দেখতে সম্পূর্ণ লাগে, ফলে কেউ যাচাই না করেই এগিয়ে দেয়। প্রশ্ন: সমাধান কী? উত্তর: অপরিবর্তনীয়, টাইমস্ট্যাম্পযুক্ত উৎস-শৃঙ্খলা, যা ব্লকচেইন-ধাঁচের লেজারে সংরক্ষিত। প্রশ্ন: বেটিং-এর সঙ্গে সম্পর্ক কী? উত্তর: সূত্রহীন লাইভ ডেটা বাজি-বাজারে ছড়ানো নীরব মিথ্যায় পরিণত হয়। (cricsultan.com Player Depth Index)
সেদিন সকালে যে ফাইলটা আমার ডেস্কে এল, সেটা দেখতে ছিল নিখুঁত। শিরোনাম ঠিক জায়গায়, আটটি বিশ্লেষণ-অধ্যায় সুন্দরভাবে সাজানো, প্রতিটি ঘর পূরণ করা। কিন্তু তিন সেকেন্ড তাকিয়ে থাকার পরেই ধরা পড়ল — কোথাও একটি সংখ্যা নেই। কোনো খেলোয়াড়ের নাম নেই, কোনো স্কোর নেই, কোনো তারিখ নেই, কোনো সূত্র নেই। প্রতিটি ঘরে একই অভিন্ন উত্তর: 'তথ্য অপর্যাপ্ত।' ক্রিকেট ডেটা বিশ্লেষণে এটাই সবচেয়ে ভয়ংকর দৃশ্য — একটি প্রতিবেদন যা দেখতে সম্পূর্ণ বৈধ, অথচ তার ভেতরে শূন্য। আমার চোখে ওটা কোনো ম্যাচ-রিপোর্ট ছিল না। ওটা ছিল একটি ফরম্যাট, নিজের প্রতিচ্ছবি ছাড়া।

আমি আগেও শূন্যতা মেপেছি। ২০২০ সালে, বিশ্ব যখন থেমে গিয়েছিল, তখন ড্যানিশ ক্লাব এসি হর্সেন্সের রেলিগেশন-যুদ্ধে দূর থেকে ডেটা পরামর্শক ছিলাম। খালি স্টেডিয়াম আমাকে শিখিয়েছিল, নীরবতারও একটি স্ট্যান্ডার্ড ডেভিয়েশন থাকে — শুধু তা মাপতে আলাদা মডেল লাগে। ভিড়ের চাপ ছাড়া সেট-পিস xG ১৮ শতাংশ বেড়ে গিয়েছিল; ৪৮ ঘণ্টায় জরুরি পরিকল্পনা সাজিয়ে আমরা শেষ ১০ ম্যাচে ৪টি সেট-পিস গোল পেয়েছিলাম, আর মাত্র ২ পয়েন্টের ব্যবধানে রেলিগেশন এড়িয়েছিলাম। শিক্ষা স্পষ্ট: শূন্যতা মানে শূন্য তথ্য নয়। শূন্যতা নিজেই একটি তথ্য — যদি সেটা মাপার প্রোটোকল আগেই ঠিক করা থাকে।
কিন্তু সেদিনের ফাইলটির শূন্যতার কোনো প্রোটোকল ছিল না। এখানেই গল্প ক্রিকেট ছেড়ে ডেটা-প্রশাসনের দিকে, তথা ব্লকচেইন-যুগের প্রশ্নের দিকে মোড় নেয়।
ব্যাপারটা বোঝাতে একটি কাজের ধাপ দরকার। আধুনিক ক্রিকেট ডেটা-পাইপলাইন মূলত দুই স্তরে চলে। প্রথম স্তর — ডিকনস্ট্রাকশন: কোনো নিবন্ধ, ফিড বা ম্যাচ-রিপোর্ট থেকে তথ্য-বিন্দু বের করা; কে বলেছে, কখন বলেছে, কী সংখ্যা দিয়েছে। দ্বিতীয় স্তর — গভীর বিশ্লেষণ: সেই বিন্দুগুলোকে ফরম্যাট, দল, খেলোয়াড়, লিগ, শাসন, ঝুঁকি — এই আটটি মাত্রায় ছড়িয়ে যুক্তি দাঁড় করানো। প্রতিটি সিদ্ধান্তকে প্রথম স্তরের কোনো নির্দিষ্ট বিন্দুতে ফিরিয়ে নেওয়া যায় — এটাই পদ্ধতির একমাত্র সুরক্ষা-জাল।
এখানে একটি ডিজাইন-ত্রুটি লুকিয়ে আছে, যা খোলাখুলি বলা দরকার। সূত্র-অ্যাট্রিবিউশন যদি প্রতিটি তথ্য-বিন্দুর ভেতরে লুকানো থাকে, তাহলে একটি খালি এক্সট্রাকশন গোটা উৎস-শৃঙ্খল মুছে দেয়। উৎস আর প্রকাশের তারিখ হওয়া উচিত শীর্ষস্তরের বাধ্যতামূলক ঘর, যা এক্সট্রাকশনের সফলতা-ব্যর্থতার ওপর নির্ভর করে না। নাহলে একটি ফাঁকা আউটপুট দেখতে স্কিমা-সম্মত থাকে, অথচ তার ভেতরে থাকে না কোনো প্রমাণ-শৃঙ্খল।
আমি ঢাকা আবাহনীতে একটি xG মডেল বানিয়েছিলাম, তারপর বিশ্বকাপে ফ্রান্সের প্রেসিং দেখেছি। ২০১৭ সালে আবাহনীর জন্য ২৪টি ম্যাচ কোড করে দেখলাম, বক্সের বাইরের শটগুলোর গড় xG মাত্র ০.০৪। কাটব্যাক প্যাটার্ন মানক করতেই মৌসুমের দ্বিতীয়ার্ধে ৬টি অতিরিক্ত গোল। ২০১৮ সালে সেই একই ছাঁচ রাশিয়া বিশ্বকাপে বসালাম — ফ্রান্সের PPDA ১২.৮, প্রতি ম্যাচে অনুমোদিত xG ০.৭৬, সাত ম্যাচে। এই পদ্ধতির শক্তি তার পুনরাবৃত্তি-যোগ্যতা: যা মাপা যায়, তা রিপোর্ট করা যায়; যা রিপোর্ট করা যায়, তা যাচাই করা যায়। কিন্তু দুর্বলতাও ঠিক এখানেই — সংখ্যা না থাকলে ছাঁচটা নিজেই একটা ফাঁকা ঘর বানিয়ে ফেলে।
সেদিনের ব্যর্থতার স্বাক্ষরটা খুব নির্দিষ্ট ছিল: মাত্রা-ট্যাগ (cricket_asia) ভরা, কিন্তু সারসংক্ষেপ ফাঁকা; তথ্য-বিন্দু শূন্য, তবু ফরম্যাট বৈধ। মানে হলো, পাইপলাইনের দুটি ভিন্ন ধাপ দুটি ভিন্ন ইনপুট পেয়েছে — একটি শিরোনাম বা URL-ভিত্তিক, অন্যটি পুরো লেখার ভিত্তিতে। শিরোনাম থেকে ট্যাগ এসেছে; মূল লেখা না আসায় তথ্য-বিন্দু আসেনি। ফলাফল একটি নীরব ব্যর্থতা: সিস্টেম ভেঙে পড়েনি, বরং সফলভাবে কিছুই বলেনি।
এখানেই আসল বিপদ। একটি বাধ্যতামূলক আট-মাত্রার ছাঁচ আর শূন্য প্রমাণ একসঙ্গে বসলে ভাষা-মডেলের স্বাভাবিক প্রবণতা হয় ফাঁকা ঘর ভরে দেওয়া — অর্থাৎ ক্রিকেট-সদৃশ তথ্য বানিয়ে ফেলা। এটি অনিচ্ছাকৃত ভুল নয়, এটি কাঠামোগত চাপ। যে টেমপ্লেট প্রতিটি ঘরে উত্তর দাবি করে, সেখানে শূন্যতা টিকিয়ে রাখা প্রযুক্তিগত সাহসের কাজ। আর একটি স্বাভাবিক ফাঁকা ঘর নয়, বরং একটি সুগঠিত ফাঁকা রিপোর্ট সবচেয়ে বেশি ক্ষতি করে — কারণ সেটা দেখতে সম্পূর্ণ, আর কেউ যাচাই না করেই এগিয়ে দেয়।
এখানে একটি সূক্ষ্ম কিন্তু নির্ণায়ক পার্থক্য আছে, যা ক্রিকেট ডেটার ভবিষ্যৎ ঠিক করে দেবে — 'অজানা' আর 'অনুপস্থিত' এক নয়। একটি ফাঁকা ঘর মানে তথ্যটি অজানা; এর মানে কখনোই এই নয় যে শর্তটি নেই। শাসন-বিশ্লেষণে এই ভুলের দাম ভয়ানক: দুর্নীতির কোনো সংকেত বের না হওয়া মানে কখনোই 'দুর্নীতি নেই' নয়। ২০০০-এর ক্রনিয়ে কাণ্ড, ২০১০-এর পাকিস্তান স্পট-ফিক্সিং, ২০১৩-এর আইপিএ স্পট-ফিক্সিং — এসব সেদিন ধরা পড়েছিল কোনো ফাঁকা ঘর থেকে নয়, বরং কোনো নির্দিষ্ট, তারিখযুক্ত তথ্য-বিন্দু থেকে। শূন্য ইনপুট কখনোই পরিচ্ছন্নতার সনদ হতে পারে না।
তাই ক্রিকেট ডেটা-শিল্পের দরকার একটি অপরিবর্তনীয়, টাইমস্ট্যাম্পযুক্ত লেজার — ব্লকচেইনের মতো প্রমাণ-শৃঙ্খলা। প্রতিটি তথ্য-বিন্দুর উৎস, প্রকাশের তারিখ আর যাচাই-অবস্থা যদি আলাদা স্তরে অপরিবর্তনীয়ভাবে লেখা থাকে, তাহলে একটি ফাঁকা ইনপুট কখনোই 'সব ঠিক আছে' সেজে উঠতে পারবে না। ডেটা অখণ্ডতার প্রশ্নটি প্রযুক্তিগত, কিন্তু ফলাফলটি নৈতিক — কারণ একটি দুর্বল লেজার পুরো বিশ্লেষণকে অনুমানের ওপর দাঁড় করিয়ে দেয়।
আর এই নৈতিকতার কেন্দ্রে বসে আছে সেই অন্ধকার দিক, যা নিয়ে ক্রিকেট-ডেটা মহলে কম কথা হয়: বেটিং কোম্পানিগুলোকে খাওয়ানো লাইভ ডেটা। খেলার ডেটাফিকেশন যত এগিয়েছে, বাজি-বাজারের জন্য তথ্যের চাহিদা তত বেড়েছে। এমন পরিস্থিতিতে পাইপলাইনে যদি যাচাই-না-করা, সূত্রহীন তথ্য ঢুকে পড়ে, তাহলে সেটি শুধু ভুল রিপোর্ট নয় — সেটি বাজি-বাজারে ছড়ানো একটি নীরব মিথ্যা। যে বিশ্লেষণ নিজের উৎস দেখাতে পারে না, সেটি বাজারকে ভুল দিকে ঠেলে দেয়, আর সেই ভুলের খেসারত দেয় সাধারণ দর্শক।
ইউরোসে লাইভ ডেটা যেকোনো গল্পের ব্যাখ্যার চেয়ে দ্রুত এসে পৌঁছেছিল। ২০২১ সালে ৫১টি ম্যাচের জন্য ১৫-সেকেন্ডের একটি ডেটা-গ্রাফিক পাইপলাইন মানক করেছিলাম। ইতালির ক্ষেত্রে জর্জিনিয়োর প্রতি ম্যাচে গড় ১১.৯ কিলোমিটার দৌড় আর দলটির PPDA ৯.৮ — এই দুই সংখ্যা মধ্যমাঠের নিয়ন্ত্রণ ব্যাখ্যা করেছিল। টোকিও অলিম্পিকে কানাডার নারী দলে জেসি ফ্লেমিংয়ের ১১.২ কিলোমিটার। দুই দলই সোনা জিতেছিল। কিন্তু শিক্ষাটা ছিল উল্টো: গতি কখনোই নিশ্চয়তা নয়। ফিড দ্রুত এলে বিশ্লেষক লাফ দিতে চান; প্রোটোকল বলে, কার্যকারণ দাবি করার আগে এক ধাপ যাচাই দেরি করো।
আমার বছরের পর বছর ম্যাচ দেখার অভিজ্ঞতা থেকে বলছি, দর্শকের আবেগ আর স্টেডিয়ামের আবহ আমি কখনো উড়িয়ে দিই না — সেগুলোও মাপার মতো চলক। কিন্তু সেগুলোকে যখন কেউ তথ্যের অভাব ঢাকতে ব্যবহার করে, তখন সেটি বিশ্লেষণ নয়, আখ্যান। কোরিলেশন কখনো কার্যকারণ নয়, আর একটি নিখুঁত ছাঁচ কখনোই প্রমাণ নয়। যে তথ্য নেই, তার একটাই সৎ উত্তর: তথ্য নেই।
আগামী দিনে আমার নজরে থাকবে চারটি সংকেত। এক, প্রতি ১০০টি বিশ্লেষণে কতগুলো শূন্য তথ্য-বিন্দু নিয়ে ফিরে আসে — হার ২ শতাংশের বেশি হলে ধরে নিতে হবে এটি বিচ্ছিন্ন নয়, বরং পদ্ধতিগত ত্রুটি। দুই, 'ট্যাগ আছে, সারসংক্ষেপ নেই' — এই স্বাক্ষর বারবার ফিরছে কি না। তিন, মূল উৎস ফিরে পাওয়া যায় কি না। আর চার, ডাউনস্ট্রিম সিস্টেম ফাঁকা ঘরকে 'নেতিবাচক ফল' হিসেবে পড়ছে কি না। প্রশ্নটা আর কেবল ক্রিকেটের নয় — প্রশ্নটা হলো, আমরা কি এমন এক খেলা গড়ছি, যেখানে অনুপস্থিত তথ্যও সৎভাবে অনুপস্থিত থাকতে পারবে?
