ভুল লেবেল, ভাঙা পাইপলাইন: পাকিস্তানের আইএমএফ নথি যেভাবে ক্রিকেট ডেটা করপাসে ঢুকে পড়ল
**মূল উত্তর:** পাকিস্তানের আইএমএফ কর্মসূচির একটি নথি ভুলভাবে cricket_asia লেবেল পেয়েছিল। নথিটির ৩৯টি তথ্যবিন্দুর একটিও ক্রিকেট-সংক্রান্ত নয়; এটি একটি শ্রেণিবিন্যাস ত্রুটি, তাই নথিটি ক্রিকেট ডেটা করপাস থেকে বাদ দেওয়া উচিত। **মূল তথ্য:** - নথির বিষয়: পাকিস্তানের ৭ বিলিয়ন মার্কিন ডলারের ইএফএফ ও ১.৪ বিলিয়ন মার্কিন ডলারের আরএসএফ পর্যালোচনা। - নথিতে ১.২ বিলিয়ন মার্কিন ডলারের বিতরণ ও স্টাফ-লেভেল চুক্তির উল্লেখ আছে। - বিশ্বব্যাংকের তথ্য অনুযায়ী পাকিস্তানে দারিদ্র্যের হার ৪৪.৭ শতাংশ। - নথিতে প্রধানমন্ত্রী শেহবাজ শরিফ ও অর্থমন্ত্রী মুহাম্মদ আওরঙ্গজেবের প্রতিশ্রুতির উল্লেখ আছে। - ৩৯টি তথ্যবিন্দুর একটিও ক্রিকেট দল, খেলোয়াড়, ম্যাচ বা ফরম্যাটের কথা বলে না। **সূত্র স্বীকৃতি:** মূল সূত্র: স্টেজ-১ ডেটা-বিশ্লেষণ প্রতিবেদন | প্রকাশ: ১৩ আগস্ট, ২০২৬ | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর:** প্রশ্ন: এই নথিটি কি ক্রিকেট-সংক্রান্ত? উত্তর: না, এতে কোনো ক্রিকেট তথ্য নেই; এটি একটি শ্রেণিবিন্যাস ত্রুটি। প্রশ্ন: সঠিক বিভাগ কোনটি হওয়া উচিত? উত্তর: সম্ভবত economics_pakistan বা sovereign_finance, এবং ক্রিকেট করপাস থেকে এটি বাদ দিতে হবে। প্রশ্ন: এই ধরনের ভুল কীভাবে প্রতিরোধ করা যায়? উত্তর: ক্লাসিফায়ারের কীওয়ার্ড-লজিক অডিট করে, সত্তা-নিষ্পত্তির নিয়ম স্পষ্ট করে, এবং আত্মবিশ্বাস-থ্রেশহোল্ডসহ সংস্করণযুক্ত শ্রেণিবিন্যাস-লেজার চালু করে।
চট্টগ্রামে ভোর তিনটায় আমি একটি ট্যাগিং ফাইল খুলেছিলাম। আমি একটি স্কোরকার্ড খুঁজছিলাম, হাতে এল একটি অর্থনৈতিক সম্পাদকীয়। ফাইলের বিষয়বস্তু ছিল পাকিস্তানের আইএমএফ কর্মসূচি — চতুর্থ ইএফএফ পর্যালোচনা, আরএসএফ পর্যালোচনা, ১.২ বিলিয়ন মার্কিন ডলারের বিতরণ। কিন্তু ফাইলের গায়ে বসানো লেবেল একটিমাত্র শব্দ: cricket_asia।
উনচল্লিশটি তথ্যবিন্দু। একটি টিম নেই, একটি খেলোয়াড় নেই, একটি ম্যাচ নেই, একটি ফরম্যাট নেই, একটি লিগ নেই, একটি ক্রিকেট-গভর্ন্যান্স বিন্দুও নেই। যা আছে তা হলো ইএফএফ, আরএসএফ, রুপির বাহ্যিক মূল্য, বৈদেশিক মুদ্রার রিজার্ভ, পিএসডিপি, ঋণ পরিষেবা, এবং প্রধানমন্ত্রী শেহবাজ শরিফ ও অর্থমন্ত্রী মুহাম্মদ আওরঙ্গজেবের প্রবৃদ্ধিমুখী প্রতিশ্রুতি।
একান্ন বছর ধরে আমি ম্যাচের ভেতরের গল্প খুঁজেছি। আজ আমার হাতে যে গল্পটি এল, সেটি কোনো ইনিংসের নয় — একটি পাইপলাইনের। একটি ডেটা সিস্টেম নিজের সম্পর্কে মিথ্যা বলেছে, আর সেটি আমার পেশার সবচেয়ে গুরুত্বপূর্ণ প্রশ্নটি সামনে এনেছে: আমরা যখন কোনো জিনিসকে নাম দিই, আমরা কি জানি আমরা কী নাম দিচ্ছি?
প্রেক্ষাপট: লেবেল বসানো মানে একটি চুক্তি করা
২০১৭ সালে, আটান্ন বছর বয়সে, আমি চট্টগ্রাম আবাহনীতে ডেটা পরামর্শক হিসেবে যোগ দিয়েছিলাম। বাংলাদেশ প্রিমিয়ার লিগের চব্বিশটি ম্যাচে আমি দলকে xG ও PPDA ট্র্যাক করতে বাধ্য করি। জোনাল-মার্কিং ডেটা মানসম্মত করে সেট-পিস থেকে খাওয়া গোল চোদ্দো থেকে ছয়ে নামাই, দল শেষ করে চতুর্থ হয়ে। সেই টেমপ্লেটই ২০১৮ সালে আমাকে রাশিয়া বিশ্বকাপে একটি ঢাকা-ভিত্তিক নিউ-মিডিয়া আউটলেটের কাজ এনে দেয়।
বেলজিয়াম জাপানকে ৩-২ গোলে হারানোর পর আমি একটি PPDA ব্রেকডাউন প্রকাশ করি। জাপানের প্রেস ষাট মিনিটের পর ৬.৮ থেকে ১৪.২-তে নেমে গিয়েছিল — সেটাই চ্যাডলির চুরানব্বই মিনিটের জয়সূচক গোলের ব্যাখ্যা দিয়েছিল। ওখানেই আমি বুঝেছিলাম, প্রতিটি সংখ্যার আগে একটি সংজ্ঞা থাকতে হয়, নাহলে সংখ্যা কেবল আওয়াজ। রাশিয়া ২০১৮-র আগে আমি শিখেছিলাম PPDA-কে ব্যক্তিগত কোড নয়, একটি ভাগাভাগি করা উপভাষা বানাতে — যাতে অন্য কেউ আমার টেবিলটি পড়ে একই সিদ্ধান্তে পৌঁছাতে পারে।
করোনাকালে, একষট্টি বছর বয়সে, বিপিএল স্থগিত হলে আমি বাশুন্ধরা কিংসের জন্য একটি দূরবর্তী জিপিএস লোড-ম্যানেজমেন্ট প্রোটোকল ডিজাইন করি। কিনেসিওলজিতে আমার এমএস কাজে লাগিয়ে বাইশ জন খেলোয়াড়ের হাই-স্পিড রানিং ট্র্যাক করি; ফাঁকা স্টেডিয়ামের প্রীতি ম্যাচে তিনজন প্রতি সেশনে ৮৫০ মিটারের বেশি ছাড়িয়ে গেলে আমি তাদের কম মিনিটের জন্য ফ্ল্যাগ করি এবং হ্যামস্ট্রিং চোট এড়াই। ক্লাব ফিরে এসে ২০২১ সালের শিরোপা জেতে। মহামারি আমার বসার ঘরকে দূরবর্তী লোড-ম্যানেজমেন্ট কন্ট্রোল রুমে পরিণত করেছিল, আর সেই কন্ট্রোল রুমই আমাকে শিখিয়েছিল — স্ক্রিনে যা দেখছি, মাঠে তা যাচাই না করলে সিদ্ধান্ত অন্ধ হয়ে যায়।
ইউরো ২০২০-তে আমি PPDA-থেকে-xG মডেল দিয়ে ভেরাত্তির ফেরার পর ইতালির প্রেস চিহ্নিত করি; ইতালির চূড়ান্ত PPDA ছিল ৭.৯, ইংল্যান্ডের ১১.৪। টোকিও অলিম্পিকে দূরত্ব-কভারেজ বেঞ্চমার্ক প্রয়োগ করে নোট করি, নারী ফাইনালে কানাডা দলগতভাবে ১০৮.৬ কিলোমিটার দৌড়েছিল। ইউরো ও টোকিওর বেঞ্চমার্ক আমাকে শিখিয়েছে রিকভারি একটি ক্রস-স্পোর্ট চুক্তি — এক খেলার সীমা অন্য খেলায় অনুবাদ করা যায়, কিন্তু কেবল সেমান্টিক্স না বদলে।
এই সব অভিজ্ঞতার প্রথম ধাপ সবসময় একই ছিল: যা মাপছি, তার সংজ্ঞা দাও। একটি ট্যাগ কোনো সাজসজ্জা নয়, একটি চুক্তি। লেবেল বসানোর মানে দাবি করা — এই নথির বিষয়বস্তু এই বিভাগের অন্তর্গত। আর যখন সেই দাবিটি মিথ্যা হয়, তখন সমস্যাটি নিছক ভুল নয়, সমস্যাটি প্রতারণা।
মূল বিশ্লেষণ: উনচল্লিশটি বিন্দুর ভেতরে শূন্য ক্রিকেট
পাকিস্তানের এই নথিটির তথ্যবিন্দুগুলো আমি শ্রেণিবদ্ধ করলাম। সার্বভৌম অর্থায়ন: ৭ বিলিয়ন মার্কিন ডলারের ইএফএফ, ১.৪ বিলিয়ন মার্কিন ডলারের আরএসএফ, ১.২ বিলিয়ন মার্কিন ডলারের বিতরণ, স্টাফ-লেভেল চুক্তি, এবং সৌদি আরব ও চীনের রোলওভার। রাজস্ব ও মুদ্রা নীতি: রুপির বাহ্যিক মূল্য, রিজার্ভের পর্যাপ্ততা, ট্যারিফে খরচ পুনরুদ্ধার, নতুন কাঠামোগত শর্ত না থাকা। বাজেট কাঠামো: পিএসডিপি, ঋণ পরিষেবা, পেনশন, প্রতিরক্ষা খাত, এবং শতকরা হিস্যা ৩, ৪, ৪৩, ৬, ১৬, ৫.৭ এবং ৮৫-৮৬। সামাজিক বাস্তবতা: ৪৪.৭ শতাংশ দারিদ্র্য — যা বিশ্বব্যাংকের তথ্য হিসেবে নথিতে উদ্ধৃত — মুদ্রাস্ফীতি, জনদুর্ভোগ, এবং মধ্যপ্রাচ্যের সংঘাতের মতো বাহ্যিক ভেরিয়েবল।
অভিনেতা দুজন — শেহবাজ শরিফ এবং মুহাম্মদ আওরঙ্গজেব — রাজনৈতিক ও আর্থিক ব্যক্তিত্ব, ক্রিকেট কর্মী নন। উনচল্লিশটি বিন্দুর একটিও ক্রিকেটের দিকে ইশারা করে না। কোনো টেস্ট, ওয়ানডে, টি-টোয়েন্টি বা হান্ড্রেডের উল্লেখ নেই; কোনো ভেন্যু, পিচ, ডিউ, ডিএলএস নেই; কোনো আইসিসি র্যাঙ্কিং, ওয়ার্ল্ড টেস্ট চ্যাম্পিয়নশিপ বা ফিউচার ট্যুরস প্রোগ্রাম নেই।

এখানেই মূল উপলব্ধি: বিশ্লেষণ কাঠামোর আটটি মাত্রার প্রতিটিই এখানে শূন্য প্রতিদান দেয়, এবং সেটি ব্যর্থতা নয় — সেটি সঠিক আচরণ। ফরম্যাট ও ম্যাচ বিশ্লেষণ, খেলোয়াড় কৌশল ও ডেটা, দল ও র্যাঙ্কিং, লিগ ও বাণিজ্যিক ইকোসিস্টেম, নিয়ম ও গভর্ন্যান্স, ঝুঁকি, জন-আখ্যান, এবং শিল্প-সংক্রমণ — আটটিই ফিরে আসে একই উত্তরে: প্রযোজ্য নয়, পর্যাপ্ত তথ্য নেই।
এখানে একটি সূক্ষ্ম কিন্তু জরুরি পার্থক্য আছে। নথিটিতে গভর্ন্যান্স আছে — কিন্তু তা সার্বভৌম-অর্থনৈতিক গভর্ন্যান্স, আইসিসি বা বোর্ড-স্তরের ক্রিকেট গভর্ন্যান্স নয়। আইএমএফের শর্তাধীনতা, শুল্ক নীতি, রাজস্ব নিয়ম — এগুলো ঋণদান-গভর্ন্যান্স। এগুলোকে ক্রিকেট গভর্ন্যান্স বলে চালিয়ে দেওয়া হবে বিভাগীয় ভুল, category error। আর একটি বিশ্লেষক যখন টেমপ্লেট পূরণ করতে গিয়ে সেই ভুলটি করে, তখন সে ডেটা বিশ্লেষণ করে না, ডেটা বানায়।
কেন এই ভুলটি ঘটল? ক্লাসিফায়ারটি সম্ভবত 'এশিয়া' শব্দটি ধরে মিলিয়েছে। 'পাকিস্তান' এশিয়ায় অবস্থিত; 'এশিয়া' ট্যাগে আছে cricket_asia; অতএব নথিটি ক্রিকেট। এটি তথাকথিত কীওয়ার্ড ম্যাচিংয়ের চিরচেনা ফাঁদ। কিন্তু আসল সমস্যা কীওয়ার্ড নয়, আসল সমস্যা অভিধানহীনতা। ক্লাসিফায়ারের কাছে কোনো ডেটা ডিকশনারি নেই — কোন শব্দ কোন বিভাগের অন্তর্গত, তার কোনো লিখিত, সংস্করণযুক্ত সংজ্ঞা নেই।
আরেকটি সম্ভাব্য ভুল আছে, যা আমার কাছে আরও চিন্তার: রাষ্ট্র ও দলের বিভ্রান্তি। 'পাকিস্তান রাষ্ট্র' আর 'পাকিস্তান ক্রিকেট দল' — এই দুটি সত্তার নাম এক, কিন্তু তাদের ডেটা-স্পেস সম্পূর্ণ আলাদা। একটি সিস্টেম যদি সত্তা-নিষ্পত্তি (entity resolution) না করে, সে এই দুটিকে এক ভাগে ফেলে দেবে। একই সমস্যা 'ভারত', 'বাংলাদেশ', 'অস্ট্রেলিয়া' নামেও ঘটতে পারে — রাষ্ট্র না দল, সেটি যদি লেবেলে না লেখা থাকে, করপাস দূষিত হবে।
৬৭ বছর বয়সেও আমি চতুর হট-টেকের চেয়ে পরিচ্ছন্ন ডেটা ডিকশনারিকে বেশি বিশ্বাস করি। ডিকশনারি ছাড়া একটি ক্লাসিফায়ার অন্ধ দাবাড়ু; সে চাল দিতে পারে, কিন্তু জানে না কোন বোর্ডে খেলছে।
এখন সমাধানটির কথা। আমার কাছে লেবেল বসানো একটি ব্লক, আর প্রতিটি ব্লক একটি লেজারে লিখিত হওয়া উচিত — সংযোজন-মাত্র, পুনর্লিখন-অযোগ্য। ব্লকচেইন প্রযুক্তি এখানে কেবল ফ্যাশন নয়; এটি অডিট-ট্রেইলের একটি দর্শন। প্রতিটি লেবেলের ব্লকে থাকবে: সত্তা, দাবিকৃত বিভাগ, সাক্ষ্যপ্রমাণ, আত্মবিশ্বাসের মাত্রা, সংস্করণ নম্বর, এবং সময়। এই লেজারে কোনো ব্লক চুপিসারে বদলানো যায় না। আজ কেউ যদি নথিটিকে cricket_asia লেবেল দেয়, আগামীকাল কেউ যদি সেটি মুছে দিতে চায়, লেজার প্রমাণ রাখবে কে, কখন, কেন সেটি বসিয়েছিল।
দ্বিতীয় ধাপ: থ্রেশহোল্ড গভর্ন্যান্স। আমার ওয়ার্কলোড মডেলে আমি ৮৫০ মিটার ও ১০৫০ মিটারের সীমা ব্যবহার করি — সীমা ছাড়ালে ফ্ল্যাগ। একই যুক্তি শ্রেণিবিন্যাসে প্রযোজ্য। একটি নথি ক্রিকেট করপাসে ঢুকবে কেবল যদি তার আত্মবিশ্বাসের মাত্রা ০.৯০ ছাড়ায় এবং নথিতে অন্তত একটি যাচাইযোগ্য ক্রিকেট-সত্তা (দল, খেলোয়াড়, ম্যাচ বা ফরম্যাট) উপস্থিত থাকে। এই দুই শর্তের যেকোনো একটিতে ব্যর্থ নথি যাবে কোয়ারান্টাইন বাকেটে, মূল করপাসে নয়।
আত্মবিশ্বাসের মাত্রা একটি সীমা, একটি অনুভূতি নয়। যদি ক্লাসিফায়ার ০.৬ আত্মবিশ্বাসে 'ক্রিকেট' বলে, সেটি প্রবেশের অনুমতি নয় — সেটি মানুষের পর্যালোচনার আমন্ত্রণ। থ্রেশহোল্ড ছাড়া সিস্টেমে সব লেবেল সমান ওজনের হয়ে যায়, আর তখন সর্বনিম্ন-মানের লেবেলই সর্বোচ্চ ক্ষতি করে।
তৃতীয় ধাপ: ফিডব্যাক লুপ। আমি যতদিন ব্যক্তিগত ড্যাশবোর্ডে বসে সিদ্ধান্ত নিয়েছি, ততদিন ভুলগুলো অদৃশ্য থেকেছে। মহামারি আমাকে শিখিয়েছিল স্ক্রিনের পেছনের সিদ্ধান্তের সঙ্গে মাঠের পর্যবেক্ষণের সংযোগ রাখতে হয়। শ্রেণিবিন্যাসেও তাই — মাসে একবার ট্যাগড করপাস থেকে নমুনা নিয়ে যাচাই করতে হবে, ক্লাসিফায়ারকে জানাতে হবে কোথায় সে ভুল করেছে, আর সংশোধিত সংস্করণ লেজারে যুক্ত করতে হবে।
চতুর্থ ধাপ: নাম-স্থানের নিয়ন্ত্রণ। একটি করপাসে 'পাকিস্তান' স্ট্রিং থাকলে সেটি কখনোই স্বয়ংক্রিয়ভাবে দল-ট্যাগ পাবে না, যদি না সত্তা-নিষ্পত্তির নিয়ম স্পষ্ট হয়। ক্রিকেট-সত্তার একটি তালিকা থাকতে হবে — দল, খেলোয়াড়, ভেন্যু, প্রতিযোগিতা — আর সেই তালিকার বাইরের যেকোনো 'পাকিস্তান' যাবে রাষ্ট্র-বিভাগে।
বিপরীতমুখী কোণ: দোষ মেশিনের নয়
এখন সহজ গল্পটি বলার প্রলোভন আছে: 'কৃত্রিম বুদ্ধিমত্তা ডেটা নষ্ট করেছে।' আমি সেই গল্পে বিশ্বাস করি না। ক্লাসিফায়ার যা করেছে, ঠিক তাই করেছে যা একটি সংজ্ঞাহীন সিস্টেম করতে বাধ্য — সে প্যাটার্ন মিলিয়েছে। দোষ মেশিনের নয়, দোষ সেই প্রক্রিয়ার, যে প্রক্রিয়া মেশিনকে সংজ্ঞা দেয়নি।
দ্বিতীয় বিপরীতমুখী পর্যবেক্ষণ: একটি ভুল লেবেল আবর্জনা নয়, এটি অডিট-সিস্টেমের সফল সংকেত। ফ্ল্যাগটি যদি না ওঠে, তাহলে ভুলটি নীরবে ক্রিকেট করপাসে ঢুকে পরবর্তী বিশ্লেষণকে দূষিত করত। ধরা পড়া ভুল সংশোধনযোগ্য ভুল; না-ধরা ভুল সংক্রামক।
তৃতীয়টি সবচেয়ে গুরুত্বপূর্ণ। আমরা লেবেলকে রায় হিসেবে ব্যবহার করতে অভ্যস্ত। 'cricket_asia' লেখা দেখে আমরা ধরে নিই নথিটি ক্রিকেট। অথচ একটি ট্যাগ একটি ভাষা, একটি রায় নয় — ঠিক যেমন xG একটি ভাষা, চূড়ান্ত সত্য নয়। চট্টগ্রাম আমাকে শিখিয়েছে xG একটি ভাষা, কোনো রায় নয়। শ্রেণিবিন্যাসের লেবেলের ক্ষেত্রেও একই নিয়ম। লেবেল বলে দেয় কোন বিভাগে তাকাতে হবে, লেবেল বলে দেয় না কী পাওয়া যাবে।
আর একটি ফাঁদ আমার নিজের পেশার জন্য প্রযোজ্য: টেমপ্লেট-অতিরিক্ত প্রসার। ফুটবলের PPDA-সেমান্টিক্স জোর করে ক্রিকেটে চাপিয়ে দেওয়া যেমন ভুল, তেমনি একটি আট-মাত্রার বিশ্লেষণ-টেমপ্লেট জোর করে একটি অ-ক্রিকেট নথিতে চাপিয়ে দেওয়া ভুল। টেমপ্লেট হলো কাঠামো, শয্যা নয়। যে নথি তার আকারে ফিট করে না, তাকে টেমপ্লেটে ঠেলে ঢোকানো মানে বিশ্লেষণের নামে কল্পকাহিনি লেখা। আর এই ফাঁদটি সবচেয়ে বিপজ্জনক তখন, যখন বিশ্লেষক জানেন যে খালি ঘর ফেলে রাখা 'দুর্বল কাজ' বলে গণ্য হবে।
টেকঅ্যাওয়ে: পরবর্তী রাউন্ডের সংকেত
পরবর্তী রাউন্ডে আমার চারটি কাজ। প্রথমে, এই নথিটিকে স্টেজ-১-এ ফেরত পাঠানো — সম্ভবত economics_pakistan বা sovereign_finance বিভাগে পুনঃশ্রেণিবদ্ধ করা, এবং ক্রিকেট করপাস থেকে বাদ দেওয়া। দ্বিতীয়ে, ক্লাসিফায়ারের কীওয়ার্ড-লজিক অডিট করা, যাতে 'এশিয়া' বা 'পাকিস্তান' শব্দমাত্রই cricket_asia না হয়ে ওঠে। তৃতীয়ে, সংস্করণযুক্ত শ্রেণিবিন্যাস-লেজার চালু করা — প্রতিটি লেবেল সাক্ষ্যসহ, পুনর্লিখন-অযোগ্য। চতুর্থে, আত্মবিশ্বাস-থ্রেশহোল্ড ও কোয়ারান্টাইন বাকেট বাধ্যতামূলক করা।

যে প্রশ্নটি আমি খোলা রাখছি: আমরা যদি কোনো লেবেলকে কখনো রায় না ভাবি, তাহলে আমাদের বিশ্লেষণ কতটা বদলে যাবে? উত্তরটা হয়তো পরের ম্যাচেই, হয়তো পরের ফাইলেই। কিন্তু আমি জানি, একটি পরিষ্কার ডেটা ডিকশনারি যেদিন চালু হবে, সেদিন একটি ভুল ট্যাগ আর কখনো কোনো ইনিংসের গল্প লিখতে পারবে না।
