লাভ:
- কৃত্রিম বুদ্ধিমত্তা সহ একটি ডেটা সেট অন্বেষণ করার ক্ষমতা, খবরের উপযুক্ত প্রশ্ন তৈরি করা এবং সংবেদনশীল ডেটা বের করার ক্ষমতা
- কৃত্রিম বুদ্ধিমত্তার পরিবর্তে গণনা করুন, বর্ণিত পদ্ধতিটি একটি নিরীক্ষণযোগ্য সরঞ্জামে চালানো এবং কাঁচা ডেটা থেকে প্রতিটি অনুসন্ধান যাচাই করার অভ্যাস অর্জন করুন।
- এটি বোঝা যে সাংবাদিকের দায়িত্ব বহিঃপ্রকাশের খসড়া তৈরি করা এবং আর্কাইভ সম্পর্কের নথিভুক্ত করা এবং তাদের মূল উত্সে নিশ্চিত করা।
অনুসন্ধানী সাংবাদিকতা প্রায়শই একটি গাদা দিয়ে শুরু হয়: হাজার হাজার লাইনের একটি টেন্ডার স্প্রেডশীট, শত শত পৃষ্ঠার একটি ব্যালেন্স শীট, একটি ফাঁস হওয়া ইমেল সংরক্ষণাগার, একটি ওপেন সোর্স পাবলিক এক্সপেনডিচার সেট৷ ডেটা সাংবাদিকতা - সংখ্যাসূচক এবং ডকুমেন্টারি ডেটাতে প্যাটার্ন, অসঙ্গতি এবং সম্পর্কগুলি খুঁজে বের করার অনুশীলন এবং সেগুলিকে সংবাদে পরিণত করা - ঠিক এই ভর বোঝানোর কাজ। এই পাইলসগুলিতে, যা ম্যানুয়ালি দেখতে মানুষের জীবনকাল লাগবে, কৃত্রিম বুদ্ধিমত্তা (AI) একটি শক্তিশালী প্রথম-স্ক্রীনিং এবং ধারণা তৈরির সরঞ্জাম: এটি একটি টেবিলের সংক্ষিপ্তসার করতে পারে, একটি টেক্সট আর্কাইভে ডুপ্লিকেট নামগুলি বের করতে পারে, বিশ্লেষণের জন্য কোন প্রশ্নগুলি জিজ্ঞাসা করতে হবে তা পরামর্শ দিতে পারে, এমনকি ডেটা পরিষ্কারের পদক্ষেপগুলি বর্ণনা করতে পারে৷ তবে শুরু থেকে একটি বাক্য রাখা যাক: AI ডেটা বিশ্লেষণের অংশীদার; সাংবাদিকরাই ফলাফলের নির্ভুলতা এবং সংবাদের মান নির্ধারণ করে এবং অপরিশোধিত তথ্য থেকে নম্বরটি পুনরায় পরীক্ষা করে। হ্যালুসিনেশনের ঝুঁকি এখানে সংখ্যায় সবচেয়ে বিপজ্জনক।
ধাপে ধাপে: AI দিয়ে একটি ডেটা সেট অন্বেষণ করা
ধাপ 1 - ডেটা জানুন। প্রথমে কলাম, সারির সংখ্যা, তারিখ পরিসীমা, একক বুঝুন। আপনি AI এ কাঁচা ফাইল লোড করার আগে এটি কী তা নিজের জন্য জানুন; অন্যথায়, AI এর "ফাইন্ডিং" বাতাসে থাকবে।
ধাপ 2 — সংবেদনশীল ডেটা বের করুন। যদি এটিতে ব্যক্তিগত ডেটা (নাম, টিআর আইডি, ঠিকানা, স্বাস্থ্য) থাকে, তবে এটি পাবলিক এআই টুলকে না দিয়ে বেনামে রাখুন বা বিশ্লেষণ করার জন্য শুধুমাত্র কলামগুলি পাঠান। ফাঁস হওয়া নথিগুলির চিহ্ন যা উত্স প্রকাশ করে তাও সাফ করা হয়েছে (ইউনিট 1 এবং 10)।
ধাপ 3 — AI দিয়ে আবিষ্কারের প্রশ্ন তৈরি করুন। "এই ডেটা সেটটি কী খবর লুকিয়ে রাখতে পারে?" বলে শুরু করুন। AI জিজ্ঞাসা করার জন্য প্রশ্নের একটি তালিকা নিয়ে আসে: শীর্ষ 10টি আইটেম, পুনরাবৃত্তি সরবরাহকারী, অস্বাভাবিক লাফানো, স্থানগুলি ফাঁকা রাখা।
ধাপ 4 — এআইকে বিশ্লেষণ করতে হবে না, এটি বর্ণনা করুন। এই সমালোচনামূলক পয়েন্ট. এআই মাথার মধ্যে যে গড় বা শতাংশ গণনা করে তা প্রায়শই ভুল হয়। পরিবর্তে, আপনি একটি নির্ভরযোগ্য টুলে (স্প্রেডশীট সূত্র, ক্যোয়ারী, স্ক্রিপ্ট) চালাবেন এমন পদক্ষেপগুলির জন্য AI-কে জিজ্ঞাসা করুন। এইভাবে ক্যালকুলাসকে একটি নিরীক্ষণযোগ্য হাতিয়ার করে, এআই কেবল পদ্ধতিটি দেয়।
ধাপ 5 - অনুসন্ধান যাচাই করুন। কাঁচা লাইনে ফিরে গিয়ে AI নির্দেশ করে এমন প্রতিটি অসঙ্গতি দেখুন। টেবিল ফিল্টার করুন এবং দাবি গণনা করুন "এই কোম্পানিটি 40 টেন্ডারের মধ্যে 31টি জিতেছে"। কোনো অযাচাইকৃত সংখ্যা এটিকে সংবাদে পরিণত করবে না।
ধাপ 6 — প্রসঙ্গ স্থাপন করুন। সংখ্যা একা খবর নয়। তুলনা (গত বছর, অনুরূপ প্রতিষ্ঠান, জনসংখ্যার অনুপাত), প্রসঙ্গ এবং বিশেষজ্ঞের মতামত সাংবাদিকের কাজ।
মনোযোগ: AI বলে "এই টেবিলের গড় গণনা করুন" এবং ফলাফলটি সরাসরি সংবাদে রাখা ডেটা সাংবাদিকতার সবচেয়ে সাধারণ দাবিত্যাগ-উত্পাদক ভুল। এআই একটি ভাষার মডেল, ক্যালকুলেটর নয়। টুলটিকে গণিত করতে দিন, শুধু পদ্ধতি এবং ব্যাখ্যার জন্য এআইকে জিজ্ঞাসা করুন।
মেটাডেটা এবং নথি বিশ্লেষণ
সংখ্যাসূচক সারণী ছাড়াও, অনুসন্ধানী সাংবাদিকতা বড় টেক্সট সংরক্ষণাগারগুলির সাথেও কাজ করে: ইমেল, মিনিট, চুক্তি। এখানে, AI সম্পর্কের মানচিত্র খসড়া করতে পারে যেমন "কে কার সাথে কথা বলল কখন", "কোন বিষয়ের পুনরাবৃত্তি হয়", "কোন নাম একসাথে উল্লেখ করা হয়"। আবার, নিয়ম একই: AI একটি প্রাথমিক মানচিত্র দেয়; প্রতিটি লিঙ্ক মূল নথিতে নিশ্চিত করা হয়েছে, কারণ AI বিশ্বাসযোগ্যভাবে একটি লিঙ্ক ব্যাখ্যা করতে পারে যা বিদ্যমান নেই।
তিনটি মিনি কেস
কেস 1 - গোপন ঘনীভবন। একজন প্রতিবেদকের কাছে 2,400টি সারি সহ একটি পাবলিক প্রকিউরমেন্ট স্প্রেডশীট ছিল। তার কাছে এআই তৈরির অনুসন্ধানমূলক প্রশ্ন ছিল; প্রশ্ন "একই সরবরাহকারী কয়টি দরপত্র পেয়েছিল?" সামনে এসেছিল। প্রতিবেদকের কাছে এআই এর হিসাব ছিল না; তিনি নিজে YZ দ্বারা প্রস্তাবিত স্প্রেডশীট সূত্রটি চালান এবং দেখেন যে একটি একক ফার্ম 2,400টি আইটেমের মধ্যে 380 (15.8%) পেয়েছে। তিনি ম্যানুয়ালি এটি পরীক্ষা করে দেখেন এবং নম্বরটি সঠিক ছিল। AI-এর প্রাথমিক "অনুমান" 22% বলেছে - তাই যদি AI বিশ্বাস করা হয়, তাহলে খবরটি ভুল হবে।
কেস 2 — টাইম সেভার, ইমেল আর্কাইভ। 6,000 ইমেলের সংরক্ষণাগারে "কী বিষয়গুলি চলছে" ম্যানুয়ালি অনুসন্ধান করতে দিন লাগবে। AI 15 মিনিটের মধ্যে বিষয় ক্লাস্টারগুলির একটি রূপরেখা তৈরি করেছে; এগুলি থেকে, প্রতিবেদক 3টি প্রতিশ্রুতিবদ্ধ ক্লাস্টার নির্বাচন করেছেন এবং মূল ইমেলগুলি পড়েছেন। মোট আবিষ্কারের সময় ~3 দিনে কমিয়ে আনা হয়েছিল, কিন্তু লাইভ হওয়া প্রতিটি উদ্ধৃতি আসল ইমেল থেকে মৌখিকভাবে যাচাই করা হয়েছিল।
কেস 3 - হ্যালুসিনেশন ধরা পড়েছে। একজন অর্থনৈতিক প্রতিবেদক YZ থেকে একটি সারসংক্ষেপ পেয়েছেন যে ব্যালেন্স শীট থেকে "এক বছরে কর্মীদের ব্যয় 60% বৃদ্ধি পেয়েছে"। যখন তিনি কাঁচা টেবিলে ফিরে আসেন, তিনি দেখেন যে বৃদ্ধি 6% এবং AI একটি সংখ্যা ভুল পড়েছে। একটি একক ফ্যাক্ট চেক "60% বিস্ফোরণ" এর মতো একটি মিথ্যা এবং ছদ্মবেশী শিরোনামকে অবরুদ্ধ করেছে।
অনুলিপিযোগ্য টেমপ্লেট
1) ডেটা সেট স্বীকৃতি এবং আবিষ্কার প্রশ্ন:
আমি আপনাকে কলামের শিরোনাম এবং একটি ডেটা সেটের প্রথম 20টি সারি দেব। 10টি সাংবাদিকতামূলক প্রশ্ন তৈরি করুন যা এই ডেটা দিয়ে করা যেতে পারে: ঘনত্বের পরিপ্রেক্ষিতে, বাইরের দিক থেকে, সময়মতো লাফানো, অনুপস্থিত/খালি জায়গা, পুনরাবৃত্ত অভিনেতা। কোন সংখ্যা গণনা; শুধু লিখুন কোন প্রশ্নগুলি জিজ্ঞাসা করা মূল্যবান এবং কেন তারা সংবাদ তৈরি করতে পারে৷ ডেটা: [শিরোনাম + নমুনা লাইন]
2) গণনা করা নয়, তাদের বর্ণনা করা:
আমি নিম্নলিখিত বিশ্লেষণ করতে চাই: [যেমন প্রতিটি সরবরাহকারীর মোট দরপত্রের পরিমাণ এবং ভাগ শতাংশ খুঁজুন]। আমি এটি একটি স্প্রেডশীটে নিজেকে চালাতে চাই। কোন সূত্র/পিভট সেটিংস ইনস্টল করতে হবে তা আমাকে ধাপে ধাপে লিখুন। সেন গণনার ফলাফল; শুধু পদ্ধতি দিন। আমার কলাম: [কলামের নাম]
3) বহিরাগত শিকার:
আমি নীচে সারাংশ পরিসংখ্যান (মিনিট, সর্বোচ্চ, গড়, মাঝারি) দেব। কোন মানগুলি অস্বাভাবিক/সন্দেহজনক এবং কেন খবরের জন্য আমার সেগুলি পরীক্ষা করা উচিত তা ব্যাখ্যা করুন৷ চূড়ান্ত বিচার করবেন না; একটি চেকলিস্ট ফরম্যাটে প্রদর্শিত হবে "নিম্নলিখিত লাইন ম্যানুয়ালি চেক করা উচিত"। সারাংশ: [এখানে]
4) নথি সংরক্ষণাগার সম্পর্ক মানচিত্র (খসড়া):
আমি আপনাকে নথি পাঠের একটি সেট দেব। একটি খসড়া হিসাবে নিম্নলিখিত আউটপুট: যে নামগুলি প্রায়শই একসাথে ঘটে, পুনরাবৃত্ত বিষয়, উল্লেখযোগ্য তারিখ। যে ডকুমেন্টটি থেকে প্রতিটি লিঙ্ক আসে সেটি চিহ্নিত করুন, যেমন [B12]। নথিতে স্পষ্টভাবে লেখা নেই এমন কোনো সম্পর্ক যুক্ত করবেন না। ডকুমেন্টেশন: [এখানে]
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট: "এই চার্টটি বিশ্লেষণ করুন এবং কোন উল্লেখযোগ্য ফলাফলগুলি জানান।"
ফলাফল: AI শতকরা হার তৈরি করে এবং গড় গড় করে, অসামঞ্জস্যতা কল্পনা করে, এটি কোন লাইনের উপর ভিত্তি করে তা স্পষ্ট নয়। এটা যাচাই করা যাবে না।
শক্তিশালী প্রম্পট: "আমি এই টেবিলের কলাম এবং প্রথম 20টি সারি দিচ্ছি। (1) তালিকা যা বিশ্লেষণগুলি সংবাদযোগ্য হতে পারে। (2) প্রতিটি বিশ্লেষণের জন্য একটি স্প্রেডশীট সূত্র প্রস্তাব করুন যাতে আমি এটি চালাতে পারি। (3) কোনো ফলাফল গণনা করবেন না। (4) চেক করার জন্য সারিগুলি চিহ্নিত করুন, যেমন [S45]।"
পার্থক্য: শক্তিশালী প্রম্পট গণনাকে নিয়ন্ত্রণযোগ্য সরঞ্জামে ছেড়ে দেয়, পদ্ধতি এবং দিকনির্দেশের ভূমিকায় AI-কে হ্রাস করে; সংখ্যায় ফাঁস থেকে হ্যালুসিনেশন প্রতিরোধ করে।
তুলনা চার্ট
মঞ্চ
এআই করে
সাংবাদিক করে
যাচাইকরণ
তথ্য সনাক্তকরণ
কলাম/প্যাটার্ন সারাংশ
একক এবং প্রসঙ্গ জানেন
উৎস তথ্য অভিধান
আবিষ্কার প্রশ্ন
প্রশ্নের একটি তালিকা তৈরি করে
সংবাদ মান নির্বাচন করে
-
গণনা
পদ্ধতি বর্ণনা করে
যানবাহনে সূত্র চালায়
ম্যানুয়াল বিধান
outlier
প্রার্থীদের চিহ্নিত করে
কাঁচা লাইনের দিকে তাকায়
ফিল্টার এবং গণনা
মন্তব্য/প্রসঙ্গ
খসড়া ফ্রেম
তুলনা, বিশেষজ্ঞ
দ্বিতীয় উৎস
সাধারণ ভুল
- AI গণনা করা। AI থাকলে গড়, শতাংশ, মোট ইত্যাদি গণনা করুন এবং ফলাফল ব্যবহার করুন; AI প্রায়শই ভুল করে, যানটিকে গণিত করতে দিন।
- ফাইন্ডিংকে কাঁচা লাইনের সাথে সংযুক্ত করা হচ্ছে না। টেবিল ফিল্টার এবং গণনা ছাড়াই "এই কোম্পানিটি বেশিরভাগ দরপত্র জিতেছে" দাবি লেখা।
- প্রসঙ্গ ছাড়াই সংখ্যা প্রকাশ করা। তুলনা এবং অনুপাত ছাড়া খালি সংখ্যার রিপোর্ট করা বিভ্রান্তিকর।
- সংবেদনশীল ডেটা আপলোড করা হচ্ছে। গাড়ি পরিষ্কার না করে ব্যক্তিগত ডেটা বা উৎস প্রকাশ করে এমন একটি নথি দেওয়া।
- ভাবছেন মিথ্যে সম্পর্কটা সত্যি। মূল নথিতে নিশ্চিত না করেই ম্যাপে আর্কাইভে যে লিঙ্কটি AI "দেখেছে" সেটিকে প্রক্রিয়া করা হচ্ছে।
সংক্ষেপে
ডেটা সাংবাদিকতায়, এআই একটি আবিষ্কার এবং অন্তর্দৃষ্টি অংশীদার: এটি গাদা স্ক্যান করে, জিজ্ঞাসা করার জন্য প্রশ্ন তৈরি করে, বিশ্লেষণের পদ্ধতি বর্ণনা করে, বহিরাগতদের জন্য প্রার্থীদের পতাকা দেয়। কিন্তু AI-র কাছেই সংখ্যা গণনা করা সবচেয়ে ঝুঁকিপূর্ণ ভুল; একটি নিরীক্ষণযোগ্য টুলে গণনাটি আউটসোর্স করুন, কাঁচা ডেটাতে ফিরে গিয়ে প্রতিটি অনুসন্ধান যাচাই করুন এবং সংখ্যার সাথে প্রসঙ্গ এবং তুলনা যোগ করুন। নথি সংরক্ষণাগারে, এআই একটি প্রারম্ভিক মানচিত্র দেয়; প্রতিটি লিঙ্ক মূল নথিতে নিশ্চিত করা হয়.
আবেদন টাস্ক
আপনার কাছে থাকা একটি ডেটা সেট নিন (বা সর্বজনীনভাবে উপলব্ধ)। প্রথমে, তাদের "অন্বেষণ প্রশ্ন" প্রম্পটের সাথে 10টি প্রশ্ন তৈরি করতে বলুন। একটি প্রশ্ন নির্বাচন করুন, "গণনার বর্ণনা করুন" প্রম্পটের সাথে AI থেকে সূত্রটি পান এবং এটি নিজে চালান। তারপরে একই হিসাবের জন্য সরাসরি AI কে জিজ্ঞাসা করুন এবং দুটি ফলাফলের তুলনা করুন; পার্থক্য এবং এর পাঠ নোট করুন।
চেকলিস্ট
- টুলটিতে ডেটা দেওয়ার আগে আমি কলাম, ইউনিট এবং সংবেদনশীল ক্ষেত্রগুলি বুঝতে পেরেছি।
- [] আমি AI কে গণনা করতে দিই না; আমি পদ্ধতিটি বর্ণনা করি এবং এটি নিরীক্ষণযোগ্য টুলে চালাই।
- [ ] আমি ম্যানুয়ালি কাঁচা সারিতে ফিরে গিয়ে প্রতিটি অনুসন্ধান যাচাই করি৷
- [ ] আমি সংখ্যার সাথে তুলনা এবং প্রসঙ্গ যোগ করি; আমি খালি সংখ্যা রিপোর্ট করছি না.
- [ ] আমি মূল নথিতে সংরক্ষণাগারে থাকা প্রতিটি সম্পর্ক নিশ্চিত করি৷