ইউনিট
1. সাংবাদিকতার নতুন অংশীদার: ভূমিকা, সীমানা এবং যাচাইকরণ প্রতিচ্ছবি 2. ইনভেস্টিগেটিভ জার্নালিজমের ডেটা অ্যানালাইসিস: ডকুমেন্টের স্ট্যাককে নিউজে পরিণত করা 3. ট্রান্সক্রিপশন এবং অডিও/ভিডিও বিশ্লেষণ: টেক্সট থেকে সাক্ষাত্কার, টেক্সট টু নিউজ 4. উৎস যাচাই এবং নিশ্চিতকরণ (তথ্য-চেক): দাবি থেকে প্রমাণ পর্যন্ত 5. ডিসইনফরমেশন এবং সিন্থেটিক কনটেন্ট: ডিপফেকের যুগে সাংবাদিকতা 6. সংবাদ লেখা: খসড়া থেকে প্রকাশনা, ইনভার্টেড পিরামিড থেকে শিরোনাম পর্যন্ত 7. সারসংক্ষেপ, সংক্ষিপ্তকরণ, এবং পুনরায় প্যাকেজিং বিষয়বস্তু 8. বহুভাষিক সাংবাদিকতা: অনুবাদ, স্থানীয়করণ এবং এর সীমা 9. নৈতিকতা, সততা এবং স্বচ্ছতা: নিউজরুমে এআই নীতি 10. সম্পদ সুরক্ষা, গোপনীয়তা এবং ডিজিটাল নিরাপত্তা 11. এন্ড-টু-এন্ড ওয়ার্কফ্লো: একটি সংবাদের সম্পূর্ণ এআই-চালিত যাত্রা
ইউনিট 2 / 11

ইনভেস্টিগেটিভ জার্নালিজমের ডেটা অ্যানালাইসিস: ডকুমেন্টের স্ট্যাককে নিউজে পরিণত করা

লাভ:

  • কৃত্রিম বুদ্ধিমত্তা সহ একটি ডেটা সেট অন্বেষণ করার ক্ষমতা, খবরের উপযুক্ত প্রশ্ন তৈরি করা এবং সংবেদনশীল ডেটা বের করার ক্ষমতা
  • কৃত্রিম বুদ্ধিমত্তার পরিবর্তে গণনা করুন, বর্ণিত পদ্ধতিটি একটি নিরীক্ষণযোগ্য সরঞ্জামে চালানো এবং কাঁচা ডেটা থেকে প্রতিটি অনুসন্ধান যাচাই করার অভ্যাস অর্জন করুন।
  • এটি বোঝা যে সাংবাদিকের দায়িত্ব বহিঃপ্রকাশের খসড়া তৈরি করা এবং আর্কাইভ সম্পর্কের নথিভুক্ত করা এবং তাদের মূল উত্সে নিশ্চিত করা।

অনুসন্ধানী সাংবাদিকতা প্রায়শই একটি গাদা দিয়ে শুরু হয়: হাজার হাজার লাইনের একটি টেন্ডার স্প্রেডশীট, শত শত পৃষ্ঠার একটি ব্যালেন্স শীট, একটি ফাঁস হওয়া ইমেল সংরক্ষণাগার, একটি ওপেন সোর্স পাবলিক এক্সপেনডিচার সেট৷ ডেটা সাংবাদিকতা - সংখ্যাসূচক এবং ডকুমেন্টারি ডেটাতে প্যাটার্ন, অসঙ্গতি এবং সম্পর্কগুলি খুঁজে বের করার অনুশীলন এবং সেগুলিকে সংবাদে পরিণত করা - ঠিক এই ভর বোঝানোর কাজ। এই পাইলসগুলিতে, যা ম্যানুয়ালি দেখতে মানুষের জীবনকাল লাগবে, কৃত্রিম বুদ্ধিমত্তা (AI) একটি শক্তিশালী প্রথম-স্ক্রীনিং এবং ধারণা তৈরির সরঞ্জাম: এটি একটি টেবিলের সংক্ষিপ্তসার করতে পারে, একটি টেক্সট আর্কাইভে ডুপ্লিকেট নামগুলি বের করতে পারে, বিশ্লেষণের জন্য কোন প্রশ্নগুলি জিজ্ঞাসা করতে হবে তা পরামর্শ দিতে পারে, এমনকি ডেটা পরিষ্কারের পদক্ষেপগুলি বর্ণনা করতে পারে৷ তবে শুরু থেকে একটি বাক্য রাখা যাক: AI ডেটা বিশ্লেষণের অংশীদার; সাংবাদিকরাই ফলাফলের নির্ভুলতা এবং সংবাদের মান নির্ধারণ করে এবং অপরিশোধিত তথ্য থেকে নম্বরটি পুনরায় পরীক্ষা করে। হ্যালুসিনেশনের ঝুঁকি এখানে সংখ্যায় সবচেয়ে বিপজ্জনক।

ধাপে ধাপে: AI দিয়ে একটি ডেটা সেট অন্বেষণ করা

ধাপ 1 - ডেটা জানুন। প্রথমে কলাম, সারির সংখ্যা, তারিখ পরিসীমা, একক বুঝুন। আপনি AI এ কাঁচা ফাইল লোড করার আগে এটি কী তা নিজের জন্য জানুন; অন্যথায়, AI এর "ফাইন্ডিং" বাতাসে থাকবে।

ধাপ 2 — সংবেদনশীল ডেটা বের করুন। যদি এটিতে ব্যক্তিগত ডেটা (নাম, টিআর আইডি, ঠিকানা, স্বাস্থ্য) থাকে, তবে এটি পাবলিক এআই টুলকে না দিয়ে বেনামে রাখুন বা বিশ্লেষণ করার জন্য শুধুমাত্র কলামগুলি পাঠান। ফাঁস হওয়া নথিগুলির চিহ্ন যা উত্স প্রকাশ করে তাও সাফ করা হয়েছে (ইউনিট 1 এবং 10)।

ধাপ 3 — AI দিয়ে আবিষ্কারের প্রশ্ন তৈরি করুন। "এই ডেটা সেটটি কী খবর লুকিয়ে রাখতে পারে?" বলে শুরু করুন। AI জিজ্ঞাসা করার জন্য প্রশ্নের একটি তালিকা নিয়ে আসে: শীর্ষ 10টি আইটেম, পুনরাবৃত্তি সরবরাহকারী, অস্বাভাবিক লাফানো, স্থানগুলি ফাঁকা রাখা।

ধাপ 4 — এআইকে বিশ্লেষণ করতে হবে না, এটি বর্ণনা করুন। এই সমালোচনামূলক পয়েন্ট. এআই মাথার মধ্যে যে গড় বা শতাংশ গণনা করে তা প্রায়শই ভুল হয়। পরিবর্তে, আপনি একটি নির্ভরযোগ্য টুলে (স্প্রেডশীট সূত্র, ক্যোয়ারী, স্ক্রিপ্ট) চালাবেন এমন পদক্ষেপগুলির জন্য AI-কে জিজ্ঞাসা করুন। এইভাবে ক্যালকুলাসকে একটি নিরীক্ষণযোগ্য হাতিয়ার করে, এআই কেবল পদ্ধতিটি দেয়।

ধাপ 5 - অনুসন্ধান যাচাই করুন। কাঁচা লাইনে ফিরে গিয়ে AI নির্দেশ করে এমন প্রতিটি অসঙ্গতি দেখুন। টেবিল ফিল্টার করুন এবং দাবি গণনা করুন "এই কোম্পানিটি 40 টেন্ডারের মধ্যে 31টি জিতেছে"। কোনো অযাচাইকৃত সংখ্যা এটিকে সংবাদে পরিণত করবে না।

ধাপ 6 — প্রসঙ্গ স্থাপন করুন। সংখ্যা একা খবর নয়। তুলনা (গত বছর, অনুরূপ প্রতিষ্ঠান, জনসংখ্যার অনুপাত), প্রসঙ্গ এবং বিশেষজ্ঞের মতামত সাংবাদিকের কাজ।

মনোযোগ: AI বলে "এই টেবিলের গড় গণনা করুন" এবং ফলাফলটি সরাসরি সংবাদে রাখা ডেটা সাংবাদিকতার সবচেয়ে সাধারণ দাবিত্যাগ-উত্পাদক ভুল। এআই একটি ভাষার মডেল, ক্যালকুলেটর নয়। টুলটিকে গণিত করতে দিন, শুধু পদ্ধতি এবং ব্যাখ্যার জন্য এআইকে জিজ্ঞাসা করুন।

মেটাডেটা এবং নথি বিশ্লেষণ

সংখ্যাসূচক সারণী ছাড়াও, অনুসন্ধানী সাংবাদিকতা বড় টেক্সট সংরক্ষণাগারগুলির সাথেও কাজ করে: ইমেল, মিনিট, চুক্তি। এখানে, AI সম্পর্কের মানচিত্র খসড়া করতে পারে যেমন "কে কার সাথে কথা বলল কখন", "কোন বিষয়ের পুনরাবৃত্তি হয়", "কোন নাম একসাথে উল্লেখ করা হয়"। আবার, নিয়ম একই: AI একটি প্রাথমিক মানচিত্র দেয়; প্রতিটি লিঙ্ক মূল নথিতে নিশ্চিত করা হয়েছে, কারণ AI বিশ্বাসযোগ্যভাবে একটি লিঙ্ক ব্যাখ্যা করতে পারে যা বিদ্যমান নেই।

তিনটি মিনি কেস

কেস 1 - গোপন ঘনীভবন। একজন প্রতিবেদকের কাছে 2,400টি সারি সহ একটি পাবলিক প্রকিউরমেন্ট স্প্রেডশীট ছিল। তার কাছে এআই তৈরির অনুসন্ধানমূলক প্রশ্ন ছিল; প্রশ্ন "একই সরবরাহকারী কয়টি দরপত্র পেয়েছিল?" সামনে এসেছিল। প্রতিবেদকের কাছে এআই এর হিসাব ছিল না; তিনি নিজে YZ দ্বারা প্রস্তাবিত স্প্রেডশীট সূত্রটি চালান এবং দেখেন যে একটি একক ফার্ম 2,400টি আইটেমের মধ্যে 380 (15.8%) পেয়েছে। তিনি ম্যানুয়ালি এটি পরীক্ষা করে দেখেন এবং নম্বরটি সঠিক ছিল। AI-এর প্রাথমিক "অনুমান" 22% বলেছে - তাই যদি AI বিশ্বাস করা হয়, তাহলে খবরটি ভুল হবে।

কেস 2 — টাইম সেভার, ইমেল আর্কাইভ। 6,000 ইমেলের সংরক্ষণাগারে "কী বিষয়গুলি চলছে" ম্যানুয়ালি অনুসন্ধান করতে দিন লাগবে। AI 15 মিনিটের মধ্যে বিষয় ক্লাস্টারগুলির একটি রূপরেখা তৈরি করেছে; এগুলি থেকে, প্রতিবেদক 3টি প্রতিশ্রুতিবদ্ধ ক্লাস্টার নির্বাচন করেছেন এবং মূল ইমেলগুলি পড়েছেন। মোট আবিষ্কারের সময় ~3 দিনে কমিয়ে আনা হয়েছিল, কিন্তু লাইভ হওয়া প্রতিটি উদ্ধৃতি আসল ইমেল থেকে মৌখিকভাবে যাচাই করা হয়েছিল।

কেস 3 - হ্যালুসিনেশন ধরা পড়েছে। একজন অর্থনৈতিক প্রতিবেদক YZ থেকে একটি সারসংক্ষেপ পেয়েছেন যে ব্যালেন্স শীট থেকে "এক বছরে কর্মীদের ব্যয় 60% বৃদ্ধি পেয়েছে"। যখন তিনি কাঁচা টেবিলে ফিরে আসেন, তিনি দেখেন যে বৃদ্ধি 6% এবং AI একটি সংখ্যা ভুল পড়েছে। একটি একক ফ্যাক্ট চেক "60% বিস্ফোরণ" এর মতো একটি মিথ্যা এবং ছদ্মবেশী শিরোনামকে অবরুদ্ধ করেছে।

অনুলিপিযোগ্য টেমপ্লেট

1) ডেটা সেট স্বীকৃতি এবং আবিষ্কার প্রশ্ন:

আমি আপনাকে কলামের শিরোনাম এবং একটি ডেটা সেটের প্রথম 20টি সারি দেব। 10টি সাংবাদিকতামূলক প্রশ্ন তৈরি করুন যা এই ডেটা দিয়ে করা যেতে পারে: ঘনত্বের পরিপ্রেক্ষিতে, বাইরের দিক থেকে, সময়মতো লাফানো, অনুপস্থিত/খালি জায়গা, পুনরাবৃত্ত অভিনেতা। কোন সংখ্যা গণনা; শুধু লিখুন কোন প্রশ্নগুলি জিজ্ঞাসা করা মূল্যবান এবং কেন তারা সংবাদ তৈরি করতে পারে৷ ডেটা: [শিরোনাম + নমুনা লাইন]

2) গণনা করা নয়, তাদের বর্ণনা করা:

আমি নিম্নলিখিত বিশ্লেষণ করতে চাই: [যেমন প্রতিটি সরবরাহকারীর মোট দরপত্রের পরিমাণ এবং ভাগ শতাংশ খুঁজুন]। আমি এটি একটি স্প্রেডশীটে নিজেকে চালাতে চাই। কোন সূত্র/পিভট সেটিংস ইনস্টল করতে হবে তা আমাকে ধাপে ধাপে লিখুন। সেন গণনার ফলাফল; শুধু পদ্ধতি দিন। আমার কলাম: [কলামের নাম]

3) বহিরাগত শিকার:

আমি নীচে সারাংশ পরিসংখ্যান (মিনিট, সর্বোচ্চ, গড়, মাঝারি) দেব। কোন মানগুলি অস্বাভাবিক/সন্দেহজনক এবং কেন খবরের জন্য আমার সেগুলি পরীক্ষা করা উচিত তা ব্যাখ্যা করুন৷ চূড়ান্ত বিচার করবেন না; একটি চেকলিস্ট ফরম্যাটে প্রদর্শিত হবে "নিম্নলিখিত লাইন ম্যানুয়ালি চেক করা উচিত"। সারাংশ: [এখানে]

4) নথি সংরক্ষণাগার সম্পর্ক মানচিত্র (খসড়া):

আমি আপনাকে নথি পাঠের একটি সেট দেব। একটি খসড়া হিসাবে নিম্নলিখিত আউটপুট: যে নামগুলি প্রায়শই একসাথে ঘটে, পুনরাবৃত্ত বিষয়, উল্লেখযোগ্য তারিখ। যে ডকুমেন্টটি থেকে প্রতিটি লিঙ্ক আসে সেটি চিহ্নিত করুন, যেমন [B12]। নথিতে স্পষ্টভাবে লেখা নেই এমন কোনো সম্পর্ক যুক্ত করবেন না। ডকুমেন্টেশন: [এখানে]

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট: "এই চার্টটি বিশ্লেষণ করুন এবং কোন উল্লেখযোগ্য ফলাফলগুলি জানান।"

ফলাফল: AI শতকরা হার তৈরি করে এবং গড় গড় করে, অসামঞ্জস্যতা কল্পনা করে, এটি কোন লাইনের উপর ভিত্তি করে তা স্পষ্ট নয়। এটা যাচাই করা যাবে না।

শক্তিশালী প্রম্পট: "আমি এই টেবিলের কলাম এবং প্রথম 20টি সারি দিচ্ছি। (1) তালিকা যা বিশ্লেষণগুলি সংবাদযোগ্য হতে পারে। (2) প্রতিটি বিশ্লেষণের জন্য একটি স্প্রেডশীট সূত্র প্রস্তাব করুন যাতে আমি এটি চালাতে পারি। (3) কোনো ফলাফল গণনা করবেন না। (4) চেক করার জন্য সারিগুলি চিহ্নিত করুন, যেমন [S45]।"

পার্থক্য: শক্তিশালী প্রম্পট গণনাকে নিয়ন্ত্রণযোগ্য সরঞ্জামে ছেড়ে দেয়, পদ্ধতি এবং দিকনির্দেশের ভূমিকায় AI-কে হ্রাস করে; সংখ্যায় ফাঁস থেকে হ্যালুসিনেশন প্রতিরোধ করে।

তুলনা চার্ট

মঞ্চ

এআই করে

সাংবাদিক করে

যাচাইকরণ

তথ্য সনাক্তকরণ

কলাম/প্যাটার্ন সারাংশ

একক এবং প্রসঙ্গ জানেন

উৎস তথ্য অভিধান

আবিষ্কার প্রশ্ন

প্রশ্নের একটি তালিকা তৈরি করে

সংবাদ মান নির্বাচন করে

-

গণনা

পদ্ধতি বর্ণনা করে

যানবাহনে সূত্র চালায়

ম্যানুয়াল বিধান

outlier

প্রার্থীদের চিহ্নিত করে

কাঁচা লাইনের দিকে তাকায়

ফিল্টার এবং গণনা

মন্তব্য/প্রসঙ্গ

খসড়া ফ্রেম

তুলনা, বিশেষজ্ঞ

দ্বিতীয় উৎস

সাধারণ ভুল

  • AI গণনা করা। AI থাকলে গড়, শতাংশ, মোট ইত্যাদি গণনা করুন এবং ফলাফল ব্যবহার করুন; AI প্রায়শই ভুল করে, যানটিকে গণিত করতে দিন।
  • ফাইন্ডিংকে কাঁচা লাইনের সাথে সংযুক্ত করা হচ্ছে না। টেবিল ফিল্টার এবং গণনা ছাড়াই "এই কোম্পানিটি বেশিরভাগ দরপত্র জিতেছে" দাবি লেখা।
  • প্রসঙ্গ ছাড়াই সংখ্যা প্রকাশ করা। তুলনা এবং অনুপাত ছাড়া খালি সংখ্যার রিপোর্ট করা বিভ্রান্তিকর।
  • সংবেদনশীল ডেটা আপলোড করা হচ্ছে। গাড়ি পরিষ্কার না করে ব্যক্তিগত ডেটা বা উৎস প্রকাশ করে এমন একটি নথি দেওয়া।
  • ভাবছেন মিথ্যে সম্পর্কটা সত্যি। মূল নথিতে নিশ্চিত না করেই ম্যাপে আর্কাইভে যে লিঙ্কটি AI "দেখেছে" সেটিকে প্রক্রিয়া করা হচ্ছে।

সংক্ষেপে

ডেটা সাংবাদিকতায়, এআই একটি আবিষ্কার এবং অন্তর্দৃষ্টি অংশীদার: এটি গাদা স্ক্যান করে, জিজ্ঞাসা করার জন্য প্রশ্ন তৈরি করে, বিশ্লেষণের পদ্ধতি বর্ণনা করে, বহিরাগতদের জন্য প্রার্থীদের পতাকা দেয়। কিন্তু AI-র কাছেই সংখ্যা গণনা করা সবচেয়ে ঝুঁকিপূর্ণ ভুল; একটি নিরীক্ষণযোগ্য টুলে গণনাটি আউটসোর্স করুন, কাঁচা ডেটাতে ফিরে গিয়ে প্রতিটি অনুসন্ধান যাচাই করুন এবং সংখ্যার সাথে প্রসঙ্গ এবং তুলনা যোগ করুন। নথি সংরক্ষণাগারে, এআই একটি প্রারম্ভিক মানচিত্র দেয়; প্রতিটি লিঙ্ক মূল নথিতে নিশ্চিত করা হয়.

আবেদন টাস্ক

আপনার কাছে থাকা একটি ডেটা সেট নিন (বা সর্বজনীনভাবে উপলব্ধ)। প্রথমে, তাদের "অন্বেষণ প্রশ্ন" প্রম্পটের সাথে 10টি প্রশ্ন তৈরি করতে বলুন। একটি প্রশ্ন নির্বাচন করুন, "গণনার বর্ণনা করুন" প্রম্পটের সাথে AI থেকে সূত্রটি পান এবং এটি নিজে চালান। তারপরে একই হিসাবের জন্য সরাসরি AI কে জিজ্ঞাসা করুন এবং দুটি ফলাফলের তুলনা করুন; পার্থক্য এবং এর পাঠ নোট করুন।

চেকলিস্ট

  • টুলটিতে ডেটা দেওয়ার আগে আমি কলাম, ইউনিট এবং সংবেদনশীল ক্ষেত্রগুলি বুঝতে পেরেছি।
  • [] আমি AI কে গণনা করতে দিই না; আমি পদ্ধতিটি বর্ণনা করি এবং এটি নিরীক্ষণযোগ্য টুলে চালাই।
  • [ ] আমি ম্যানুয়ালি কাঁচা সারিতে ফিরে গিয়ে প্রতিটি অনুসন্ধান যাচাই করি৷
  • [ ] আমি সংখ্যার সাথে তুলনা এবং প্রসঙ্গ যোগ করি; আমি খালি সংখ্যা রিপোর্ট করছি না.
  • [ ] আমি মূল নথিতে সংরক্ষণাগারে থাকা প্রতিটি সম্পর্ক নিশ্চিত করি৷