লেবেল ভুল, তথ্য নয়: ক্রীড়া তথ্যপ্রবাহের দূষণ আর ব্লকচেইনের সত্য-যাচাই
প্রশ্ন: একটি 'ফুটবল' লেবেলযুক্ত নিবন্ধ আসলে ফুটবল-বিষয়ক ছিল কি না, আর এতে ব্লকচেইনের ভূমিকা কী? মূল উত্তর: না—নিবন্ধটি ফুটবল-বিষয়ক ছিল না; এটি ছিল একটি ভিয়েতনামি স্বাস্থ্য-পরামর্শ পাতা, যা ভুলভাবে 'ফুটবল' লেবেল পেয়েছে। ব্লকচেইন এই ভুল শ্রেণীবিভাগ প্রতিরোধ করতে পারে না, তবে কনটেন্টের উৎস ও বিভাগ প্রমাণযোগ্যভাবে লিপিবদ্ধ করে দূষণ দৃশ্যমান করতে পারে। মূল তথ্য: - নিবন্ধের ১৪টি তথ্যবিন্দুর একটিও ফুটবল-সংশ্লিষ্ট নয়; বিষয়বস্তু ছিল পুষ্টি, স্বাস্থ্যবিমা ও হারবাল ওষুধ। - একমাত্র খেলাসংলগ্ন বিষয় ছিল একটি চাইনিজ দাবা (cờ tướng) প্রতিযোগিতা, যা ফুটবল নয়। - সম্ভাব্য কারণ—কীওয়ার্ড ওভারল্যাপ ও ভাষা-ভিত্তিক স্বয়ংক্রিয় শ্রেণীবিভাগের ব্যর্থতা। - প্রায় প্রতিটি তথ্যবিন্দুতে 'সূত্র: নেই' উল্লেখ ছিল; উৎস নিম্ননির্ভরযোগ্য ও বিজ্ঞাপনী-প্রবণ। - ব্লকচেইনের হ্যাশ প্রমাণ করে ফাইল অপরিবর্তিত, কিন্তু সত্য বা সঠিক বিভাগ প্রমাণ করে না। সূত্র: Stage-2 গভীর পেশাদার বিশ্লেষণ; তথ্যবিন্দুতে উল্লিখিত একমাত্র ঘটনার তারিখ ২৬ সেপ্টেম্বর ২০২৬ | Cross-checked: cricsultan.com সম্পর্কিত প্রশ্নোত্তর: প্রশ্ন: ভুল লেবেল কীভাবে তথ্যপ্রবাহ দূষিত করে? উত্তর: ফুটবল-সংকেত মডেল ভুল ইনপুট পেলে মিথ্যা আখ্যান তৈরি করে, যা বাজি ও সম্পাদকীয় সিদ্ধান্তে ছড়িয়ে পড়ে। প্রশ্ন: ব্লকচেইন এই সমস্যার পুরো সমাধান দিতে পারে কি? উত্তর: না; এটি একটি স্তর—আসল সমাধান ভাষা-সচেতন শ্রেণীবিভাগ ও সম্পাদকীয় যাচাই, যা cricsultan.com ধরনের সূচক দিয়ে ট্র্যাক করা যায়। প্রশ্ন: 'সূত্র: নেই' ঘনত্ব কেন গুরুত্বপূর্ণ? উত্তর: এটি নিম্নমানের সূত্র চিহ্নিত করার একটি পরিমাপযোগ্য ডেটা-গুণমান সূচক।
গত সপ্তাহে আমার ডেস্কে একটা ফাইল এল, লেবেলে স্পষ্ট করে লেখা—'ফুটবল'। কফি হাতে নিয়ে বসলাম; ভেতরে থাকবে ফর্মেশন, প্রেসিং ট্রিগার, পজিশনাল ডেটা, xG-এর রিপোর্ট। ফাইল খুললাম। ভেতরে ভিয়েতনামি ভাষায় একটা স্বাস্থ্য-পরামর্শ পাতা। পুষ্টি, স্বাস্থ্যবিমা (BHYT) কোন কোন চিকিৎসা কভার করে, হারবাল ওষুধের বাজারদর, প্যারাসিটামল আর রক্তচাপ নিয়ে একটা গবেষণা, আর একটা চাইনিজ দাবা (cờ tướng) প্রতিযোগিতার খবর। ফুটবলের একটা অক্ষরও নেই।

একটা স্বাস্থ্য পাতা ফুটবল লেবেল পরে ঘুরছে। এটাই গল্প। গল্পটা ওই স্বাস্থ্য পাতার নয়; গল্পটা সেই পাইপলাইনের, যেটা লেবেল বসায়। কনটেন্ট ছিল ওষুধের, লেবেল ছিল ফুটবলের—আর কেউ টের পায়নি। আধুনিক ক্রীড়া তথ্যপ্রবাহের পুরো সরবরাহ-শৃঙ্খলের জন্য এটা সেই মুহূর্ত, যখন ঘুম ভাঙা উচিত।
আমি ৯০ সেকেন্ডের টেকটা টাইম করেছিলাম; তারপর এক সপ্তাহ ধরে খুঁজেছি ওটা কী মিস করেছে। প্রথম টেক ছিল সহজ—'পাইপলাইন ভাঙা'। এক সপ্তাহ পরে বুঝলাম, সমস্যাটা ভাঙা পাইপলাইনের চেয়েও গভীর। এটা একটা সিস্টেমের রোগ, যেখানে সত্য যাচাইয়ের কোনো স্তর নেই। আর ঠিক এখানেই ব্লকচেইন প্রাসঙ্গিক হয়ে ওঠে—একটা খেলার হিসাবের খাতা হিসেবে নয়, একটা ভরসার স্তর হিসেবে।
প্রেক্ষাপট: লেবেল বসানোর কারখানা
পেশাদার ক্রীড়া তথ্যপ্রবাহ আজ একটা কারখানা। উপরের দিকে হাজার হাজার সূত্র—সংবাদমাধ্যম, ক্লাবের প্রেস রিলিজ, সোশ্যাল পোস্ট, ব্লগ, ভিডিও স্ক্রিপ্ট, স্বাস্থ্য-পোর্টাল, চিকিৎসা-বিজ্ঞাপন। তারপর একটা স্বয়ংক্রিয় স্তর কনটেন্ট পড়ে, কীওয়ার্ড ধরে ট্যাগ বসায়, আর ঠিক করে কোন ফাইল কোন বিভাগে যাবে। নিচের দিকে সেই ফাইল ঢোকে বাজি-মডেল, সম্প্রচারের গ্রাফিক্স, সম্পাদকীয় ড্যাশবোর্ড, ইনজুরি-ট্র্যাকারে। প্রতিটা স্তর পরের স্তরের ওপর ভরসা করে।
আমার কয়েক দশকের খেলা দেখার অভিজ্ঞতা থেকে বলতে পারি, এই কারখানার ভেতরের ভরসাটা কতটা নাজুক। ১৯৯৭ সালে আমি বাংলাদেশ বেতারে ভাষ্যকার হিসেবে ঢুকি, একই বছর ক্রীড়া জগত পত্রিকার সম্পাদক হই, আর ১৯৯৮ সালে প্রথম আলোর প্রতিষ্ঠাতা ক্রীড়া সম্পাদক হিসেবে যোগ দিই। তখন সংবাদ মানে ছিল একজন মানুষের সিদ্ধান্ত—অসম্পূর্ণ, কিন্তু দায়বদ্ধ। এখন সংবাদ মানে একটা অ্যালগরিদমের সিদ্ধান্ত—দ্রুত, কিন্তু দায়হীন।
২০১৭ সালের সেপ্টেম্বরে ম্যানচেস্টার সিটি লিভারপুলকে ৫-০ গোলে উড়িয়ে দেওয়ার পর আমি একটা ৯০ সেকেন্ডের ভিডিও করি—'কাইল ওয়াকার আর ডিফেন্ডার নন'। যুক্তি ছিল, গার্দিওলার ৩-২-৪-১-এ ওয়াকার মধ্যমাঠের ডিকয়। ৪৮ ঘণ্টায় ২ কোটি ৩০ লাখ ভিউ, প্রথম পেইড শর্ট-ফর্ম চুক্তি। সেদিন থেকে আমি ১,৫০০ শব্দের ট্যাকটিক্যাল ব্লগ ছেড়ে ৬০ সেকেন্ডের স্ক্রিপ্টে চলে আসি—একটা বিস্ফোরক দাবি, তিনটা ডেটা পয়েন্ট, একটা স্পষ্ট ভবিষ্যদ্বাণী।
রাশিয়া বিশ্বকাপ ২০১৮-তে সেই চুক্তি আমাকে প্রেস ট্রিবিউনে নিয়ে যায়। কাজানে ফ্রান্স আর্জেন্টিনাকে ৪-৩ হারায়, আমি ট্রিবিউন থেকে দেখি এমবাপে উইঙ্গার নন, তিনি 'ভার্টিক্যাল স্ট্রাইকার'; ডেশamps-এর 'বোরিং' ৪-২-৩-১ আসলে ৪-৪-২, গ্রিজম্যান ফলস নাইন। ফ্রান্স ট্রফি জেতে। সেখান থেকে আমার লেখায় যোগ হয় স্টেডিয়ামের শব্দ, খেলোয়াড়ের বডি ল্যাঙ্গুয়েজ, ওয়ার্ম-আপের আচার।
কিন্তু এই যে সরবরাহ-শৃঙ্খল, এটা আজ দূষিত। আর দূষণের উৎসটা কৌশলী।
মূল বিশ্লেষণ: লেবেল আর বিষয়বস্তুর ফাঁক
প্রথমেই একটা কথা পরিষ্কার করা দরকার। যে ফাইলটা আমার ডেস্কে এসেছে, সেটা কোনো ফুটবল নথি নয়। তার ১৪টা তথ্যবিন্দুর একটাও ফুটবল-সংশ্লিষ্ট নয়। সেখানে আছে পুষ্টি, স্বাস্থ্যবিমা, হারবাল ওষুধ, ক্লিনিকের বিজ্ঞাপনী পরামর্শ। একমাত্র 'খেলার' সংলগ্ন জিনিসটা একটা চাইনিজ দাবা প্রতিযোগিতা—যা ফুটবলই নয়। অথচ লেবেলটা ফুটবল। এই ফাঁকটাই আমার আসল বিষয়।
ভুল লেবেল কীভাবে জন্মায়
স্বয়ংক্রিয় শ্রেণীবিভাগ কীওয়ার্ড ধরে চলে। 'ম্যাচ', 'রিপোর্ট', 'কভার', 'ফলাফল', 'পরামর্শ'—এই শব্দগুলো একইসঙ্গে খেলার পাতায় আর স্বাস্থ্য পাতায় থাকে। ভাষা আর প্রেক্ষাপট মডেল ধরতে না পারলে শ্রেণীবিভাগ ভুল করে। ভিয়েতনামি ভাষার একটা স্বাস্থ্য-পাতা ফুটবল লেবেল পেয়ে যাওয়ার পেছনে সবচেয়ে সম্ভাব্য কারণ—কীওয়ার্ড ওভারল্যাপ আর ভাষা-ভিত্তিক শ্রেণীবিভাগের ব্যর্থতা। এটা দুর্ঘটনা হতে পারে, কিন্তু দুর্ঘটনা যদি পুনরাবৃত্ত হয়, তাহলে সেটা সিস্টেমের রোগ।
আমি ট্রান্সফার গুজবের সূত্র ধরে গিয়ে একটা বিজনেস মডেল পেয়েছি। এখানেও একই ঘটনা। যে সূত্র থেকে এই স্বাস্থ্য-পাতা এসেছে, সেটা একটা কনজিউমার-হেলথ পোর্টাল—প্রায় সব তথ্যবিন্দুর পাশে লেখা 'সূত্র: নেই'। কোথাও নামহীন গবেষণা, কোথাও স্বার্থসংশ্লিষ্ট সূত্র—একজন ক্লিনিক-পরিচালক, একজন আয়োজক। এটা নিরপেক্ষ সাংবাদিকতা নয়; এটা সার্চ-ইঞ্জিন অপটিমাইজেশনের জন্য বানানো কনটেন্ট, যার আসল ব্যবসা বিজ্ঞাপন আর লিড-জেনারেশন।
দূষণ কেন বিপজ্জনক
ভাবুন, একটা ফুটবল-সংকেত পণ্য—ধরুন, ইনজুরি-ঝুঁকি বা ট্রান্সফার-সেন্টিমেন্ট মাপার একটা মডেল—যদি তার ইনপুটে ফুটবল লেবেল পরে একটা স্বাস্থ্য-পাতা ঢুকে যায়। মডেল কী করবে? সে ভাববে ফুটবল-সংবাদে নতুন কিছু ঘটেছে। সিগন্যাল দূষিত হবে, আর দূষিত সিগন্যাল থেকে জন্ম নেবে ভুয়া আখ্যান।
এখানে একটা পরিমাপযোগ্য সূচক আছে, যেটা আমরা কেউ হিসাব করি না—'সূত্র: নেই' ঘনত্ব। কোনো সূত্রে যত বেশি দাবি সূত্রহীন, সেই সূত্রের ডেটা-গুণমান তত কম। এই সূচকটা যদি আমরা ট্র্যাক করি, তাহলে শ্রেণীবিভাগের আগেই নিম্নমানের সূত্র আলাদা করে ফেলা যায়।
ব্লকচেইন কোথায় ঢোকে
এবার আসি মূল প্রস্তাবে। সমস্যাটা মূলত প্রমাণ-নথির (provenance) সমস্যা, শুধু বিষয়বস্তুর নয়। কোনো কনটেন্ট কোথা থেকে এল, কে বানাল, কবে বানাল, তার মূল বিভাগ কী—এসব যদি যাচাইযোগ্য আর অপরিবর্তনীয় খাতায় লেখা থাকে, তাহলে লেবেল বসানোর কাজটা অনুমানের বদলে প্রমাণের ওপর দাঁড়ায়।
ব্লকচেইন এখানে যা দিতে পারে: প্রথমত, অপরিবর্তনীয় টাইমস্ট্যাম্প—কোন কনটেন্ট কখন তৈরি হল, তা পরবর্তীতে বদলানো যায় না। দ্বিতীয়ত, কনটেন্ট-প্রমাণপত্র—একটা ছবি বা লেখার জন্ম-সনদ, যেখানে তার মূল প্রকাশক, ভাষা আর বিভাগ লিপিবদ্ধ থাকে। তৃতীয়ত, স্মার্ট কনট্রাক্ট দিয়ে দ্বার-নিয়ন্ত্রণ—একটা কনটেন্ট-টোকেন ফুটবল-পাইপলাইনে ঢুকবে কেবল তখনই, যখন তার অন-চেইন মেটাডেটা বিভাগ-যাচাই পার করবে। চতুর্থত, সূত্রের সুনাম স্টেক করে রাখা—যে সূত্র বারবার ভুল লেবেল ছড়াবে, তার সুনাম কেটে নেওয়া হবে। আর পঞ্চমত, অডিট-ট্রেইল—একটা 'সূত্র: নেই' দাবির জন্ম কোথায়, কে ছড়াল, তা ধাপে ধাপে দেখা যাবে।
এটাই ব্লকচেইনের সবচেয়ে সৎ ব্যবহার ক্রীড়া-তথ্যে: জাল-প্রতিরোধ নয়, প্রমাণ-সুরক্ষা। কোনো লেখা সত্য কি না, তা ব্লকচেইন বলবে না; কিন্তু লেখাটা কে লিখল আর সেটা ফুটবল কি না, তা ব্লকচেইন দ্ব্যর্থহীনভাবে বলতে পারে।
কেন এই আলোচনা সময়োপযোগী
বিশ্বজুড়ে সাংবাদিকতা আর মিডিয়াতে কনটেন্ট-প্রমাণের চেষ্টা বাড়ছে। কোনো ছবি বা ভিডিওর উৎস শিকড় পর্যন্ত মেলানোর উদ্যোগ, নিবন্ধের জন্ম-সনদের ধারণা, ডিজিটাল সম্পদের মালিকানা লেখার চেষ্টা—সব একই দিকে ইঙ্গিত করে: তথ্যের যাচাইযোগ্য উৎস একটা বাজার-মূল্য হয়ে উঠছে। ক্রীড়া-জগতেও এই চাহিদা তৈরি, কারণ এখানকার বাজি, সম্প্রচার আর সম্পাদকীয়—সবই ভরসার ওপর দাঁড়ানো।
আমার মতে এখানে স্পোর্টস-ডেটার একটা বিশেষ ঝুঁকি আছে। ফুটবল এমন একটা বিষয়, যেখানে হট টেক আর গুজবের চাহিদা আকাশচুম্বী। যে বিষয়ের প্রতি এত দুর্বলতা, সেখানে ভুল লেবেল আর সূত্রহীন দাবি সবচেয়ে সহজে টিকে যায়—কারণ ভুলটাও দ্রুত ছড়ায়।
বিপরীত দৃষ্টি: ব্লকচেইন সত্যের গ্যারান্টি নয়
এখানে আমি নিজের যুক্তির বিপক্ষে দাঁড়াতে চাই। ব্লকচেইন সব সমস্যার সমাধান নয়, আর এটাই সবচেয়ে গুরুত্বপূর্ণ সতর্কবার্তা।

প্রথমত, একটা হ্যাশ প্রমাণ করে ফাইলটা বদলায়নি; প্রমাণ করে না ফাইলটা সত্য। প্রমাণ-নথি (provenance) আর সত্য (truth) এক জিনিস নয়। কোনো স্বাস্থ্য-পাতা যদি অন-চেইন নিবন্ধিত হয় ফুটবল লেবেলে, ব্লকচেইন সেই ভুলটাকে অমর করে দেবে, সংশোধন করবে না।
দ্বিতীয়ত, ভুল শ্রেণীবিভাগ মূলত একটা অর্থ-বিষয়ক (semantic) সমস্যা। ক্রিপ্টোগ্রাফি অর্থ পড়তে পারে না। একটা লেখা ফুটবল কি না, তা বোঝার জন্য ভাষা, প্রেক্ষাপট আর বিষয়বস্তুর বোঝা দরকার—সেটা অ্যালগরিদম আর সম্পাদকের কাজ, হ্যাশ ফাংশনের নয়।
তৃতীয়ত, একটা ঝুঁকি আছে যাকে বলি 'যাচাইয়ের নাটক'। সব কিছু চেইনে তুলে দেওয়া হবে, অথচ ভেতরের বিষয়বস্তু-যাচাইয়ের দরজাটা ভাঙাই থাকবে। তখন আমরা একটা মিথ্যা সান্ত্বনা পাব—'সব তো যাচাই করা'—অথচ দূষণ চলতেই থাকবে।
চতুর্থত, খরচ, দেরি আর জটিলতা। প্রতিটা ফুটবল-সংকেত চেইনে বসানোর আগে সময় লাগবে, খরচ লাগবে। সব ক্ষেত্রে সেটা ন্যায্য নাও হতে পারে।
আসল সমাধান তাই কেবল চেইনে নয়; আসল সমাধান—ভাষা-সচেতন শ্রেণীবিভাগ, সূত্রের গুণমান-যাচাই আর সম্পাদকীয় দায়বদ্ধতা। ব্লকচেইন এই ভিত্তির ওপর একটা স্তর, ভিত্তিটা নয়।

আমি হট টেকগুলো রেখে দিয়েছি যেগুলো রিপ্লে-তে টিকে গেছে, বাকিগুলো পুতে ফেলেছি। আমার প্রথম টেক ছিল 'ব্লকচেইন ক্রীড়া-তথ্য বাঁচাবে'। রিপ্লে দেখে সেটা সংশোধন করলাম—ব্লকচেইন দূষণ দৃশ্যমান করবে, দূর করবে না। দৃশ্যমান ভুল অন্তত ধরার সুযোগ দেয়; অদৃশ্য ভুল সবচেয়ে বিপজ্জনক।
শেষ কথা: কী মাপব, কত দিনে
সামনের দিনগুলোতে আমি দুটো জিনিস দেখব। প্রথমত, আগামী ১৮ মাসের মধ্যে কোনো বড় ক্রীড়া-ডেটা বা কনটেন্ট-প্রমাণ প্রতিষ্ঠান অন-চেইন প্রমাণ-স্তরের পাইলট চালু করবে কি না—এটা আমার পরীক্ষাযোগ্য ভবিষ্যদ্বাণী। দ্বিতীয়ত, আর এটাই আসল মাপকাঠি—ফুটবল-ফিডের ভুয়া-পজিটিভ হার কমল কি না। 'চেইনে আছে' মানে সফলতা নয়; 'ভুল ঢুকছে না' মানে সফলতা।
আমি চিৎকার দিয়ে শুরু করেছিলাম, শেষ করছি কী বদলাল তার একটা ম্যাপ দিয়ে। এই ফাইলটা একা একটা ভুল নয়; এটা একটা ব্যবস্থার আয়না। ক্রীড়া-তথ্যের ভরসা ফেরাতে হলে আমাদের সেই আয়নাটা দেখতে হবে, আর যাচাইয়ের স্তরটা গড়তে হবে—তার আগে, যতক্ষণ ভুলগুলো অদৃশ্য।
