หน่วย
1. พันธมิตรใหม่ของวารสารศาสตร์: บทบาท ขอบเขต และการสะท้อนการตรวจสอบ 2. การวิเคราะห์ข้อมูลในวารสารศาสตร์เชิงสืบสวน: เปลี่ยนกองเอกสารให้เป็นข่าว 3. การถอดเสียงและการวิเคราะห์เสียง/วิดีโอ: บทสัมภาษณ์ด้วยข้อความ ข้อความเป็นข่าว 4. การตรวจสอบและยืนยันแหล่งที่มา (การตรวจสอบข้อเท็จจริง): จากการอ้างสิทธิ์ไปจนถึงหลักฐาน 5. ข้อมูลบิดเบือนและเนื้อหาสังเคราะห์: วารสารศาสตร์ในยุคแห่ง Deepfake 6. การเขียนข่าว: จากฉบับร่างสู่การตีพิมพ์ จากพีระมิดกลับหัวไปจนถึงหัวข้อข่าว 7. การสรุป การบรรยายสรุป และการบรรจุเนื้อหาใหม่ 8. วารสารศาสตร์หลายภาษา: การแปล การแปลเป็นภาษาท้องถิ่น และข้อจำกัด 9. จริยธรรม ความซื่อสัตย์ และความโปร่งใส: นโยบาย AI ในห้องข่าว 10. การคุ้มครองทรัพยากร ความเป็นส่วนตัว และความปลอดภัยทางดิจิทัล 11. เวิร์กโฟลว์แบบ end-to-End: การเดินทางของข่าวที่ขับเคลื่อนโดย AI อย่างสมบูรณ์
หน่วย 2 / 11

การวิเคราะห์ข้อมูลในวารสารศาสตร์เชิงสืบสวน: เปลี่ยนกองเอกสารให้เป็นข่าว

กำไร:

  • ความสามารถในการสำรวจชุดข้อมูลด้วยปัญญาประดิษฐ์ สร้างคำถามที่น่าสนใจในข่าวสาร และดึงข้อมูลที่ละเอียดอ่อน
  • แทนที่จะให้ปัญญาประดิษฐ์ทำการคำนวณ มีวิธีการอธิบายและทำงานในเครื่องมือที่ตรวจสอบได้ และได้รับนิสัยในการตรวจสอบการค้นพบแต่ละครั้งจากข้อมูลดิบ
  • การทำความเข้าใจว่าเป็นความรับผิดชอบของนักข่าวในการร่างค่าผิดปกติและบันทึกความสัมพันธ์และยืนยันความสัมพันธ์ในแหล่งต้นฉบับ

การรายงานข่าวเชิงสืบสวนมักจะเริ่มต้นด้วยกอง: สเปรดชีตที่ชำระเงินจำนวนหลายพันบรรทัด งบดุลที่มีหลายร้อยหน้า คลังอีเมลที่รั่วไหล ชุดรายจ่ายสาธารณะแบบโอเพ่นซอร์ส การสื่อสารมวลชนด้วยข้อมูล ซึ่งเป็นแนวทางปฏิบัติในการค้นหารูปแบบ ความผิดปกติ และความสัมพันธ์ในข้อมูลเชิงตัวเลขและสารคดี แล้วเปลี่ยนให้เป็นข่าว ถือเป็นหน้าที่ในการทำความเข้าใจมวลนี้อย่างแท้จริง ในกองข้อมูลเหล่านี้ ซึ่งจะต้องใช้เวลาทั้งชีวิตของมนุษย์ในการพิจารณาด้วยตนเอง ปัญญาประดิษฐ์ (AI) เป็นเครื่องมือคัดกรองครั้งแรกและสร้างแนวคิดที่ทรงพลัง โดยสามารถสรุปตาราง แยกชื่อที่ซ้ำกันในที่เก็บถาวรข้อความ แนะนำคำถามที่ควรถามเพื่อการวิเคราะห์ แม้กระทั่งอธิบายขั้นตอนการล้างข้อมูล แต่ลองมาประโยคหนึ่งตั้งแต่ต้น: AI เป็นพันธมิตรในการวิเคราะห์ข้อมูล นักข่าวเป็นผู้ตัดสินความถูกต้องและมูลค่าข่าวของผลลัพธ์และตรวจสอบตัวเลขอีกครั้งจากข้อมูลดิบ ความเสี่ยงต่อการเกิดอาการประสาทหลอนนับว่าอันตรายที่สุดในจำนวนนี้

ทีละขั้นตอน: สำรวจชุดข้อมูลด้วย AI

ขั้นตอนที่ 1 — ทำความรู้จักกับข้อมูล ขั้นแรกให้ทำความเข้าใจคอลัมน์ จำนวนแถว ช่วงวันที่ หน่วย รู้ด้วยตัวเองว่ามันคืออะไรก่อนที่คุณจะโหลดไฟล์ Raw ลงใน AI มิฉะนั้น "การค้นพบ" ของ AI จะยังคงอยู่ในอากาศ

ขั้นตอนที่ 2 — แยกข้อมูลที่ละเอียดอ่อน หากมีข้อมูลส่วนบุคคล (ชื่อ, TR ID, ที่อยู่, สุขภาพ) ให้ลบข้อมูลระบุตัวตนโดยไม่ต้องมอบให้กับเครื่องมือ AI สาธารณะ หรือส่งเฉพาะคอลัมน์ที่จะวิเคราะห์ ร่องรอยของเอกสารรั่วไหลที่เปิดเผยแหล่งที่มาก็ถูกเคลียร์เช่นกัน (หน่วยที่ 1 และ 10)

ขั้นตอนที่ 3 — สร้างคำถามเพื่อการค้นพบด้วย AI “ชุดข้อมูลนี้สามารถซ่อนข่าวอะไรได้บ้าง” เริ่มด้วยการพูดว่า. AI ​​มาพร้อมกับรายการคำถามที่จะถาม: 10 อันดับแรก, ซัพพลายเออร์ที่ทำซ้ำ, การกระโดดที่ผิดปกติ, พื้นที่เว้นว่างไว้

ขั้นตอนที่ 4 — อย่าให้ AI ทำการวิเคราะห์ อธิบายมันเลย นี่คือจุดวิกฤติ ค่าเฉลี่ยหรือเปอร์เซ็นต์ที่ AI คำนวณในหัวมักจะผิด ให้ถาม AI เกี่ยวกับขั้นตอนที่คุณจะใช้ในเครื่องมือที่เชื่อถือได้แทน (สูตรสเปรดชีต ข้อความค้นหา สคริปต์) ดังนั้นการทำให้แคลคูลัสเป็นเครื่องมือที่สามารถตรวจสอบได้ AI ก็แค่ให้วิธีการดังกล่าว

ขั้นตอนที่ 5 — ตรวจสอบการค้นพบ เห็นทุกความผิดปกติที่ AI ชี้ให้เห็นโดยย้อนกลับไปที่เส้นดิบ กรองตารางและนับการอ้างสิทธิ์ "บริษัทนี้ชนะการประมูล 31 รายการจาก 40 รายการ" ตัวเลขที่ไม่ได้รับการยืนยันจะไม่ทำให้เป็นข่าว

ขั้นตอนที่ 6 — สร้างบริบท จำนวนเพียงอย่างเดียวไม่ใช่ข่าว การเปรียบเทียบ (ปีที่แล้ว สถาบันที่คล้ายกัน อัตราส่วนต่อประชากร) บริบทและความคิดเห็นของผู้เชี่ยวชาญถือเป็นงานของนักข่าว

ข้อควรสนใจ: การที่ AI พูดว่า "คำนวณค่าเฉลี่ยของตารางนี้" และใส่ผลลัพธ์ลงในข่าวโดยตรงถือเป็นข้อผิดพลาดที่ก่อให้เกิดข้อจำกัดความรับผิดชอบที่พบบ่อยที่สุดของการสื่อสารมวลชนด้วยข้อมูล AI เป็นรูปแบบภาษา ไม่ใช่เครื่องคิดเลข ให้เครื่องมือคำนวณ เพียงขอวิธีการและการตีความจาก AI

การวิเคราะห์ข้อมูลเมตาและเอกสาร

นอกจากตารางตัวเลขแล้ว วารสารศาสตร์เชิงสืบสวนยังเกี่ยวข้องกับคลังข้อความขนาดใหญ่ เช่น อีเมล นาที สัญญา ที่นี่ AI สามารถร่างแผนผังความสัมพันธ์ เช่น "ใครคุยกับใครเมื่อใด" "หัวข้อไหนซ้ำ" "ชื่อไหนเอ่ยร่วมกัน" กฎก็เหมือนกันอีกครั้ง: AI ให้แผนที่เริ่มต้น ทุกลิงก์ได้รับการยืนยันในเอกสารต้นฉบับ เนื่องจาก AI สามารถอธิบายลิงก์ที่ไม่มีอยู่ได้อย่างน่าเชื่อถือ

มินิเคสสามอัน

กรณีที่ 1 — การควบแน่นแบบปกปิด นักข่าวคนหนึ่งมีสเปรดชีตการจัดซื้อจัดจ้างสาธารณะจำนวน 2,400 แถว เขาให้ AI สร้างคำถามเชิงสำรวจ คำถาม "ซัพพลายเออร์รายเดียวกันได้รับการประมูลกี่ราย" มาถึงข้างหน้า นักข่าวไม่มี AI คำนวณเรื่องนี้ เขาใช้สูตรสเปรดชีตที่แนะนำโดย YZ เอง และพบว่าบริษัทเดียวได้รับสินค้า 380 รายการ (15.8%) จาก 2,400 รายการ เขาตรวจสอบด้วยตนเองและหมายเลขก็ถูกต้อง “ประมาณการ” เบื้องต้นของ AI อยู่ที่ 22% ดังนั้นหาก AI เชื่อถือได้ ข่าวก็จะผิด

กรณีที่ 2 — ประหยัดเวลา การเก็บถาวรอีเมล อาจต้องใช้เวลาหลายวันในการค้นหา "หัวข้อที่กำลังเกิดขึ้น" ด้วยตนเองในคลังอีเมลจำนวน 6,000 ฉบับ AI จัดทำโครงร่างของกลุ่มหัวข้อภายใน 15 นาที จากสิ่งเหล่านี้ ผู้รายงานได้เลือกกลุ่มที่มีแนวโน้มดี 3 กลุ่มและอ่านอีเมลต้นฉบับ เวลาค้นหาทั้งหมดลดลงเหลือประมาณ 3 วัน แต่ทุกใบเสนอราคาที่เผยแพร่ได้รับการยืนยันคำต่อคำจากอีเมลต้นฉบับ

กรณีที่ 3 — มีอาการประสาทหลอน นักข่าวเศรษฐกิจคนหนึ่งได้รับสรุปจาก YZ ว่า "ค่าใช้จ่ายบุคลากรเพิ่มขึ้น 60% ในหนึ่งปี" จากงบดุล เมื่อเขากลับมาที่โต๊ะดิบเขาเห็นว่าเพิ่มขึ้น 6% และ AI อ่านตัวเลขผิดไปหนึ่งหลัก การตรวจสอบข้อเท็จจริงเพียงรายการเดียวได้บล็อกพาดหัวข่าวที่เป็นเท็จและอวดรู้ เช่น "การระเบิด 60%"

เทมเพลตที่คัดลอกได้

1) คำถามเกี่ยวกับการจดจำและการค้นพบชุดข้อมูล:

ฉันจะให้ส่วนหัวของคอลัมน์และ 20 แถวแรกของชุดข้อมูลแก่คุณ สร้างคำถามนักข่าว 10 ข้อที่สามารถทำได้ด้วยข้อมูลนี้: ในแง่ของสมาธิ ค่าผิดปกติ การข้ามเวลา พื้นที่ที่ขาดหายไป/ว่างเปล่า นักแสดงที่เกิดซ้ำ ไม่มีการคำนวณตัวเลข แค่เขียนว่าคำถามไหนน่าถาม และทำไมถึงทำข่าวได้ ข้อมูล: [พาดหัวข่าว + ตัวอย่างบรรทัด]

2) ไม่ได้ทำการคำนวณ แต่ให้อธิบาย:

ฉันต้องการทำการวิเคราะห์ต่อไปนี้: [เช่น ค้นหายอดรวมการประกวดราคาและส่วนแบ่งเปอร์เซ็นต์ของซัพพลายเออร์แต่ละราย] ฉันต้องการเรียกใช้สิ่งนี้ด้วยตนเองในสเปรดชีต เขียนให้ฉันทราบทีละขั้นตอนว่าจะติดตั้งสูตร/การตั้งค่าเดือยใดบ้าง ผลการคำนวณ SEN เพียงแค่ให้วิธีการ คอลัมน์ของฉัน: [ชื่อคอลัมน์]

3) การล่าสัตว์นอกกรอบ:

ฉันจะให้สถิติสรุป (ต่ำสุด, สูงสุด, เฉลี่ย, มัธยฐาน) ด้านล่าง อธิบายว่าค่าใดผิดปกติ/น่าสงสัย และเหตุใดฉันจึงควรตรวจสอบข่าวสารเหล่านั้น อย่าตัดสินขั้นสุดท้าย รายการตรวจสอบจะปรากฏในรูปแบบ "ควรตรวจสอบบรรทัดต่อไปนี้ด้วยตนเอง" เรื่องย่อ: [ที่นี่]

4) แผนผังความสัมพันธ์เอกสารเก็บถาวร (ร่าง):

ฉันจะให้ชุดข้อความเอกสารแก่คุณ ส่งออกข้อมูลต่อไปนี้เป็น DRAFT: ชื่อที่เกิดขึ้นร่วมกันบ่อยๆ หัวข้อที่เกิดซ้ำ วันที่ที่น่าสังเกต ทำเครื่องหมายเอกสารที่มาแต่ละลิงก์ เช่น [B12] อย่าเพิ่มความสัมพันธ์ใดๆ ที่ไม่ได้เขียนไว้อย่างชัดเจนในเอกสาร เอกสาร: [ที่นี่]

พรอมต์อ่อน / พรอมต์แข็งแกร่ง

ข้อความเตือนที่อ่อนแอ: "วิเคราะห์แผนภูมินี้และระบุการค้นพบที่สำคัญ"

ผลลัพธ์: AI สร้างเปอร์เซ็นต์และค่าเฉลี่ย จินตนาการถึงความผิดปกติ ยังไม่ชัดเจนว่าอิงจากบรรทัดใด ไม่สามารถตรวจสอบได้

ข้อความแจ้งที่มีประสิทธิภาพ: "ฉันให้คอลัมน์และ 20 แถวแรกของตารางนี้ (1) รายการการวิเคราะห์ที่อาจคุ้มค่าแก่การรายงานข่าว (2) แนะนำสูตรสเปรดชีตสำหรับการวิเคราะห์แต่ละรายการเพื่อให้ฉันสามารถดำเนินการได้ (3) อย่าคำนวณผลลัพธ์ใดๆ (4) ทำเครื่องหมายแถวที่จะตรวจสอบ เช่น [S45]"

ความแตกต่าง: การแจ้งเตือนที่ชัดเจนทำให้การคำนวณเป็นเครื่องมือที่ควบคุมได้ ส่งผลให้ AI กลายเป็นวิธีการและทิศทาง ป้องกันภาพหลอนรั่วไหลเข้าสู่ตัวเลข

แผนภูมิเปรียบเทียบ

เวที

เอไอทำ

นักข่าวทำ

การตรวจสอบ

การรับรู้ข้อมูล

สรุปคอลัมน์/รูปแบบ

รู้หน่วยและบริบท

พจนานุกรมแหล่งข้อมูล

คำถามค้นพบ

สร้างรายการคำถาม

เลือกค่าข่าว

การคำนวณ

อธิบายวิธีการ

รันสูตรในรถ

การจัดเตรียมด้วยตนเอง

ผิดปกติ

ทำเครื่องหมายผู้สมัคร

ดูเป็นเส้นดิบ

กรองและนับ

ความคิดเห็น/บริบท

ร่างกรอบ

การเปรียบเทียบ, ผู้เชี่ยวชาญ

แหล่งที่สอง

ข้อผิดพลาดทั่วไป

  • ทำให้ AI คำนวณ ให้ AI คำนวณค่าเฉลี่ย เปอร์เซ็นต์ รวม ฯลฯ แล้วใช้ผลลัพธ์ AI ทำผิดพลาดบ่อยครั้ง ให้ยานพาหนะคำนวณเอง
  • ไม่เชื่อมต่อสิ่งที่ค้นพบกับเส้นดิบ การเขียนคำกล่าวอ้าง "บริษัทนี้ชนะการประกวดราคาส่วนใหญ่" โดยไม่ต้องกรองตารางและนับ
  • การเผยแพร่ตัวเลขโดยไม่มีบริบท การรายงานตัวเลขเปล่าโดยไม่มีการเปรียบเทียบและอัตราส่วนถือเป็นการทำให้เข้าใจผิด
  • การอัปโหลดข้อมูลที่ละเอียดอ่อนตามที่เป็นอยู่ การให้ข้อมูลส่วนบุคคลหรือเอกสารเปิดเผยที่มาแก่ตัวรถโดยไม่ได้ทำความสะอาด
  • คิดว่าความสัมพันธ์จอมปลอมมีจริง ประมวลผลลิงก์ที่ AI "เห็น" ในไฟล์เก็บถาวรลงในแผนที่โดยไม่ต้องยืนยันในเอกสารต้นฉบับ

โดยสรุป

ในวารสารศาสตร์ข้อมูล AI เป็นพันธมิตรด้านการค้นพบและข้อมูลเชิงลึก โดยจะสแกนกอง สร้างคำถามที่จะถาม อธิบายวิธีการวิเคราะห์ ตั้งค่าสถานะผู้สมัครเพื่อหาค่าผิดปกติ แต่การให้ AI คำนวณตัวเลขเองถือเป็นความผิดพลาดที่เสี่ยงที่สุด จ้างบุคคลภายนอกในการคำนวณให้กับเครื่องมือที่ตรวจสอบได้ ตรวจสอบการค้นพบแต่ละรายการโดยกลับไปที่ข้อมูลดิบ และเพิ่มบริบทและการเปรียบเทียบตัวเลข ในคลังเอกสาร AI จะให้แผนที่เริ่มต้น แต่ละลิงก์ได้รับการยืนยันในเอกสารต้นฉบับ

งานสมัคร

นำชุดข้อมูลที่คุณมี (หรือเปิดเผยต่อสาธารณะ) ขั้นแรก ให้พวกเขาสร้างคำถาม 10 ข้อพร้อมข้อความ "คำถามสำรวจ" เลือกคำถาม รับสูตรจาก AI พร้อมข้อความแจ้ง "อธิบายการคำนวณ" และดำเนินการด้วยตนเอง จากนั้นถาม AI โดยตรงสำหรับการคำนวณเดียวกันและเปรียบเทียบผลลัพธ์ทั้งสอง สังเกตความแตกต่างและบทเรียนของมัน

รายการตรวจสอบ

  • [ ] ฉันเข้าใจคอลัมน์ หน่วย และฟิลด์ที่ละเอียดอ่อนก่อนที่จะให้ข้อมูลแก่เครื่องมือ
  • [ ] ฉันไม่ปล่อยให้ AI คำนวณ ฉันอธิบายวิธีการและเรียกใช้ในเครื่องมือที่ตรวจสอบได้
  • [ ] ฉันตรวจสอบการค้นพบแต่ละรายการด้วยตนเองโดยกลับไปที่แถวดิบ
  • [ ] ฉันเพิ่มการเปรียบเทียบและบริบทให้กับตัวเลข ฉันไม่ได้รายงานตัวเลขเปลือย
  • [ ] ฉันยืนยันทุกความสัมพันธ์ในไฟล์เก็บถาวรในเอกสารต้นฉบับ