หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นในประวัติศาสตร์และการเก็บถาวร: บทบาท ขอบเขต การตรวจสอบความถูกต้อง และจริยธรรม 2. การแปลงเอกสารเป็นดิจิทัลและ OCR: การแปลงข้อความที่พิมพ์เป็นข้อความในเครื่อง 3. การถอดความ: ภาษาตุรกีออตโตมัน และต้นฉบับ 4. ข้อมูลเมตา การทำรายการและการจำแนกประเภท 5. การสแกนแหล่งที่มา การค้นพบ และการสรุป 6. การแปลทางประวัติศาสตร์และการทำให้เข้าใจง่าย 7. การตรวจสอบแหล่งที่มา ยุคสมัย และภาพหลอน 8. การวิเคราะห์เนื้อหาและการค้นพบรูปแบบ 9. การเข้าถึงเอกสารคำอธิบายและบริการผู้ใช้ 10. การอนุรักษ์ การฟื้นฟู และการอนุรักษ์ดิจิทัล 11. จริยธรรม ลิขสิทธิ์ ความเป็นส่วนตัว และความอ่อนไหวทางวัฒนธรรม 12. โครงการแบบครบวงจร: การประมวลผลคอลเลกชันเอกสารสำคัญด้วยปัญญาประดิษฐ์
หน่วย 8 / 12

การวิเคราะห์เนื้อหาและการค้นพบรูปแบบ

กำไร:

  • ความสามารถในการดึงรูปแบบจากชุดข้อความขนาดใหญ่โดยใช้เทคนิค เช่น NER, การแยกความสัมพันธ์, ไทม์ไลน์ และการวิเคราะห์เครือข่าย
  • ความสามารถในการมองเห็นรูปแบบเป็นสมมติฐานมากกว่าหลักฐาน เชื่อมโยงเอนทิตีกับแหล่งที่มา และทำให้เป็นมาตรฐานโดยได้รับการอนุมัติจากมนุษย์
  • ความสามารถในการเข้าใจว่าตัวเลขอาจทำให้เข้าใจผิดได้อย่างไรเนื่องจากข้อมูลขาดหายไปและอคติในการสุ่มตัวอย่าง และเพื่อหลีกเลี่ยงความสัมพันธ์และเหตุการณ์ที่สมมติขึ้น

การวิจัยเชิงประวัติศาสตร์ไม่ใช่แค่การอ่านเอกสารแต่ละฉบับเท่านั้น มักจะมองหารูปแบบในเอกสารชุดใหญ่ ชื่อเฉพาะปรากฏในบริบทใดในช่วงหลายปีที่ผ่านมา? คนใดบ้างที่เกี่ยวข้องกับการตั้งถิ่นฐาน? หัวข้อมีการเปลี่ยนแปลงอย่างไรเมื่อเวลาผ่านไป? ใครตรงกับใคร? คำถามดังกล่าวไม่จำเป็นต้องดูเอกสารเพียงฉบับเดียว แต่ต้องดูเอกสารหลายร้อยฉบับรวมกัน สิ่งนี้มักเรียกว่ามนุษยศาสตร์ดิจิทัล—การประยุกต์ใช้วิธีคำนวณกับสาขาต่างๆ เช่น ประวัติศาสตร์และวรรณกรรม

AI มีประสิทธิภาพในการดึงข้อมูลที่มีโครงสร้างจากชุดข้อความขนาดใหญ่ ในหน่วยนี้ คุณจะได้เรียนรู้ NER (การจดจำเอนทิตีที่มีชื่อ) การแยกรูปแบบและความสัมพันธ์ ตรรกะการสร้างแบบจำลองหัวข้อ และการสร้างไทม์ไลน์ แต่เราจะพูดถึงหลุมพรางที่อันตรายที่สุดของเทคนิคเหล่านี้ด้วย ซึ่ง AI นำเสนอตัวเองว่า "พบ" รูปแบบที่ไม่มีอยู่จริง

เทคนิคพื้นฐาน

  • NER (การจดจำเอนทิตีที่มีชื่อ): การแยกเอนทิตี เช่น บุคคล สถานที่ สถาบัน วันที่ ออกจากข้อความโดยอัตโนมัติ โดยจะสร้างรายการเช่น "ชื่อสถานที่ทั้งหมดที่กล่าวถึงในเอกสาร 500 รายการนี้" ในเวลาไม่กี่นาที
  • การอนุมานความสัมพันธ์: การทำเครื่องหมายความสัมพันธ์ระหว่างเอนทิตี (“บุคคล X ที่สถานที่ Y”, “A สอดคล้องกับ B”)
  • การสร้างแบบจำลองหัวข้อ: การค้นหากลุ่มของหัวข้อที่เกิดซ้ำทางสถิติในชุดข้อความขนาดใหญ่ แสดงให้เห็นว่าประเด็นใดเข้มข้นในช่วงเวลาใด
  • การอนุมานไทม์ไลน์: การจัดเรียงเหตุการณ์ลงวันที่ในเอกสารตามลำดับเวลา
  • การวิเคราะห์เครือข่าย: การแสดงภาพความสัมพันธ์ระหว่างบุคคล/สถาบันเป็นเครือข่าย (ใครเป็นศูนย์กลาง ใครคือจุดเชื่อมต่อ)

เป้าหมายร่วมกันของสิ่งเหล่านี้คือการเปิดเผยโครงสร้างที่ไม่ปรากฏในเอกสารฉบับเดียว แต่ปรากฏตลอดทั้งคอลเลกชัน เทคนิคเหล่านี้สร้างรูปแบบที่มองเห็นได้ซึ่งไม่อาจมองเห็นได้จากการอ่านเพียงอย่างเดียว แต่แต่ละคนก็เป็น "สัญลักษณ์" ไม่ใช่ "หลักฐาน" จำเป็นอย่างยิ่งที่จะต้องตรวจสอบสิ่งที่พบในเอกสารต้นฉบับ

แนวคิดที่ใช้บ่อยในสาขานี้คือความแตกต่างระหว่างการอ่านอย่างใกล้ชิด (การอ่านข้อความเชิงลึก ทีละบรรทัด) และการอ่านระยะไกล (โดยพิจารณาจากข้อความนับร้อย/พันข้อความรวมกันในเชิงสถิติ) AI ทำให้สามารถอ่านจากระยะไกลได้: คุณจะเห็นรูปแบบในคลังข้อมูลที่ใหญ่พอที่จะอยู่ได้ตลอดชีวิตของมนุษย์ แต่เมื่อการอ่านระยะไกลชี้ไปที่รูปแบบ จำเป็นต้องกลับไปอ่านแบบปิด ซึ่งก็คือ ไปยังเอกสารต้นฉบับ เพื่อให้เข้าใจถึงสิ่งนั้น ทั้งสองวิธีไม่สามารถใช้แทนกันได้ อันหนึ่งแสดงรูปแบบ อีกอันให้ความหมาย การวิจัยที่แข็งแกร่งที่สุดใช้ทั้งสองอย่างร่วมกัน

เคล็ดลับ: ใช้การวิเคราะห์รูปแบบเป็นตัวสร้างสมมติฐาน: “AI เห็นรูปแบบตรงนี้แล้ว มันเป็นเรื่องจริงหรือเปล่า?” จากนั้นตรวจสอบรูปแบบนั้นในเอกสารทีละรายการ รูปแบบคือจุดเริ่มต้นของการวิจัยของคุณ ไม่ใช่ผลลัพธ์

ขั้นตอนการทำงาน: ทีละขั้นตอน

1. ชี้แจงคำถาม “คนไหนที่ปรากฏตัวพร้อมกันบ่อยที่สุดในคอลเลกชันนี้” คำถามรูปแบบที่ชัดเจนเช่น

2. จัดทำและติดฉลากข้อมูล จัดระเบียบข้อความด้วยการอ้างอิงแหล่งที่มาเพื่อให้สามารถเชื่อมโยงเนื้อหาใดๆ ที่พบกลับไปยังเอกสารได้

3. เอนทิตี/รูปแบบปรากฏขึ้น สร้าง NER ความสัมพันธ์หรือโครงร่างไทม์ไลน์ด้วย AI

4. ทำให้เป็นมาตรฐาน รวมการสะกดคำต่างๆ ของบุคคล/สถานที่เดียวกัน (“อิสตันบูล / อิสตันบูล / คอสแทนตินี” สถานที่เดียวกัน?) ขั้นตอนนี้มีความสำคัญ หากละเว้นรูปแบบจะแตกสลาย

5. ตรวจสอบในเอกสาร ตรวจสอบเอกสารจริงเพื่อดูรูปแบบที่สำคัญที่ถูกตั้งค่าสถานะ ตรวจสอบให้แน่ใจว่า AI ไม่ได้เพิ่มลิงก์ที่สร้างขึ้น

6. ความคิดเห็น. รูปแบบหมายถึงอะไรคือการตัดสินของนักประวัติศาสตร์ AI เพียงทำเครื่องหมายรูปแบบ

กับดักตัวเลขและสถิติ

การวิเคราะห์รูปแบบมักจะสร้างตัวเลข: “ชื่อ X เกิดขึ้น 47 ครั้ง”, “หัวข้อนี้มีอยู่ใน 30% ของเอกสาร” ตัวเลขเหล่านี้ดูเหมือนเป็นกลางแต่อาจทำให้เข้าใจผิดได้:

  • ข้อมูลที่ขาดหายไป: หากการรวบรวมไม่สมบูรณ์แล้ว (เอกสารสูญหาย ไม่เคยมีการบันทึกกลุ่ม) ตัวเลขดังกล่าวสะท้อนถึงเอกสารที่ยังหลงเหลืออยู่ ไม่ใช่ความเป็นจริง
  • ข้อผิดพลาดในการทำให้เป็นมาตรฐาน: หากบุคคลเดียวกันสะกดต่างกันและนับแยกกัน ตัวเลขจะไม่ถูกต้อง
  • สูญเสียบริบท: "เกิดขึ้น 47 ครั้ง" ไม่ได้พูดอะไร; วิธีการส่งผ่าน (บวก/ลบ หัวเรื่อง/วัตถุ) เป็นสิ่งสำคัญ

เอาท์พุทรูปแบบ

ความหมายที่ชัดเจน

ความเสี่ยงที่แท้จริง

"X เกิดขึ้น 47 ครั้ง"

บุคคลสำคัญ

การรวบรวมที่ไม่สมบูรณ์ รูปแบบการสะกดคำ

"ธีม 30%"

หัวข้อที่โดดเด่น

อคติในการสุ่มตัวอย่าง

“A-B อยู่ด้วยกันบ่อยๆ”

ความสัมพันธ์ใกล้ชิด

ความบังเอิญ บริบทที่ขาดหายไป

"ไทม์ไลน์"

ลำดับเหตุการณ์ที่แน่นอน

เอกสารไม่ระบุวันที่ สั่งปลอม

มินิเคสสามอัน

กรณีที่ 1 — การวิเคราะห์เครือข่ายเผยให้เห็นตัวกลางที่ซ่อนอยู่ นักวิจัยตรวจสอบคอลเลกชั่นจดหมายจำนวน 800 ฉบับ ด้วย AI ที่เขียนถึงใครที่ถูกกำหนดและสร้างเครือข่าย เครือข่ายแสดงให้เห็นว่าบุคคลที่ดูเหมือนไม่มีนัยสำคัญเมื่อมองแวบแรก แท้จริงแล้วคือจุดติดต่อสำคัญระหว่างทั้งสองกลุ่ม ผู้วิจัยมุ่งความสนใจไปที่จดหมายของบุคคลนี้และค้นพบสิ่งใหม่ แต่ก่อนอื่นให้ตรวจสอบลิงก์ทั้งหมดในเอกสารก่อน

กรณีที่ 2 — ข้อผิดพลาดการทำให้เป็นมาตรฐานทำให้ตัวเลขเสียหาย นักเรียนคนหนึ่งให้นับจำนวนครั้งที่สถานที่ปรากฏในเอกสาร เนื่องจาก AI นับการสะกดที่แตกต่างกันสามตัวของสถานที่เดียวกันแยกจากกัน ตัวเลขจึงกลายเป็นหนึ่งในสามของจำนวนจริง เมื่อรวมการสะกดแล้ว สถานที่นั้นอยู่ในตำแหน่งที่เกิดขึ้นบ่อยที่สุดเป็นอันดับสาม บทเรียน: หากไม่มีการทำให้เป็นมาตรฐาน ตัวเลขจะไม่สามารถเชื่อถือได้

กรณีที่ 3 — ไทม์ไลน์ที่สร้างขึ้น นักวิจัยสร้างไทม์ไลน์จากเอกสารที่ไม่ระบุวันที่ AI จัดกิจกรรมที่ไม่รู้จักตามลำดับ "ตรรกะ" และนำเสนอเหตุการณ์ที่แม่นยำ อย่างไรก็ตาม ลำดับนี้ไม่ได้อยู่ในเอกสาร AI เป็นผู้จัดทำขึ้น บทเรียน: เส้นเวลาสร้างขึ้นจากเหตุการณ์ที่มีวันที่ในเอกสารเท่านั้น ส่วนที่เหลือยังคงเป็น "ไม่ระบุ"

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) NER (การอนุมานเอนทิตี):

บุคคล สถานที่ สถาบัน และวันที่ที่กล่าวถึงในเอกสารด้านล่างนี้ปรากฏเป็นรายการแยกกัน ระบุว่าเอกสาร (อ้างอิง) ใดที่กล่าวถึงแต่ละเอนทิตี รับเฉพาะสิ่งที่ระบุไว้อย่างชัดเจนในข้อความ เพิ่มโดยการเดา ทำเครื่องหมาย [?] หากคุณไม่แน่ใจในการออกเสียง เอกสาร: [ที่นี่]

2) การทำให้เอนทิตีเป็นมาตรฐาน:

ในรายการเอนทิตีด้านล่าง จัดกลุ่มการสะกดที่แตกต่างกันซึ่งอาจเป็นบุคคล/สถานที่เดียวกัน (เช่น "อิสตันบูล / Kostantinyye") แนะนำรูปแบบทั่วไปที่เป็นไปได้สำหรับแต่ละกลุ่ม แต่อย่ากำหนดชุดค่าผสมที่แน่นอน เพิ่มหมายเหตุ "อาจจะเหมือนกัน ให้คนตรวจสอบ" ปล่อยมันไว้คนเดียวหากคุณไม่แน่ใจ รายการ: [ที่นี่]

3) โครงร่างความสัมพันธ์/เครือข่าย:

แยกลิงก์ "ผู้เกี่ยวข้องกับใคร" ออกจากชุดจดหมาย/เอกสารต่อไปนี้ สำหรับแต่ละลิงก์ ให้ระบุว่าลิงก์นั้นใช้เอกสารใด (ข้อมูลอ้างอิง) สร้างความสัมพันธ์ที่ไม่ชัดเจนในเอกสาร ทำเครื่องหมายลิงก์ที่ไม่ชัดเจน [ไม่ชัดเจน] เอกสาร: [ที่นี่]

4) ไทม์ไลน์วันที่:

แสดงรายการตามลำดับเหตุการณ์เฉพาะเหตุการณ์ที่ระบุไว้อย่างชัดเจนในเอกสารต่อไปนี้ เชื่อมโยงทุกเหตุการณ์กับแหล่งที่มา แสดงรายการเหตุการณ์ที่มีวันที่ไม่แน่นอนแยกกันภายใต้หัวข้อ "ไม่ระบุ" อย่าเรียงลำดับเหตุการณ์ อย่าสร้างวันที่โดยประมาณ เอกสาร: [ที่นี่]

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ:

วิเคราะห์เอกสารเหล่านี้และดึงรูปแบบ ความสัมพันธ์ และลำดับเวลาที่สำคัญออกมา

“แยกรูปแบบที่สำคัญ” ผลักดันให้ AI สร้างการเชื่อมต่อที่ไม่มีอยู่จริงและลำดับเหตุการณ์ที่แม่นยำ โดยนำเสนอตัวเลขโดยไม่มีการทำให้เป็นมาตรฐาน

แข็งแกร่ง:

แยกเอนทิตีบุคคล/สถานที่/สถาบันออกจากเอกสารต่อไปนี้โดยเชื่อมต่อแต่ละรายการเข้ากับการอ้างอิงเอกสาร ทำเครื่องหมายการสะกดคำต่างๆ ที่อาจเหมือนกับ "อาจผสาน" แต่อย่าผสาน ความสัมพันธ์ที่ไม่ได้ระบุไว้อย่างชัดเจนในเอกสารและเหตุการณ์ที่มีวันที่ไม่แน่นอนห้ามปลอมแปลง ให้แยกวันที่ไม่มีวันที่ออกจากกัน เอกสาร: [ที่นี่]

ความแตกต่าง: การระบุแหล่งที่มา การปล่อยให้มนุษย์สร้างมาตรฐาน การห้ามความสัมพันธ์/ประวัติศาสตร์ที่สมมติขึ้น และการแยกเหตุการณ์ที่ไม่ระบุวันที่ ทำให้รูปแบบนี้สามารถป้องกันได้

ข้อผิดพลาดทั่วไป

  • ผิดรูปแบบเพื่อเป็นหลักฐาน รูปแบบคือสมมติฐาน ได้รับการตรวจสอบในเอกสารแล้ว
  • ข้ามการทำให้เป็นมาตรฐาน การสะกดที่แตกต่างกันของเอนทิตีเดียวกันบิดเบือนตัวเลขและเครือข่าย
  • ความเชื่อใจแบบตาบอดในตัวเลข การรวบรวมที่ไม่สมบูรณ์และอคติในการสุ่มตัวอย่างทำให้ตัวเลขดังกล่าวทำให้เข้าใจผิด
  • ไทม์ไลน์ที่จัดทำขึ้น เหตุการณ์ที่ไม่ระบุวันที่จะไม่รวมอยู่ในลำดับเหตุการณ์
  • ละเลยบริบท ไม่สำคัญว่า "ผ่านไปกี่ครั้ง" แต่ "ผ่านไปอย่างไร" ต่างหากที่สำคัญ

โดยสรุป

การวิเคราะห์เนื้อหาและการค้นพบรูปแบบเป็นสาขาที่ทรงพลังซึ่ง AI สร้างโครงสร้างที่มองเห็นได้ซึ่งจะไม่สามารถมองเห็นได้ผ่านการอ่านเพียงอย่างเดียว: การแยกเอนทิตี เครือข่ายความสัมพันธ์ คลัสเตอร์หัวข้อ ไทม์ไลน์ แต่ทุกรูปแบบเป็นเพียงสมมติฐาน ไม่ใช่หลักฐาน เชื่อมโยงเนื้อหาไปยังแหล่งที่มา ปรับมาตรฐานอย่างระมัดระวังและด้วยการตรวจสอบโดยมนุษย์ ค้นหาหมายเลขสำหรับข้อมูลที่ขาดหายไปและความโน้มเอียง หลีกเลี่ยงความสัมพันธ์และเหตุการณ์ที่สมมติขึ้นมา AI ทำเครื่องหมายรูปแบบ ความหมายและเป็นจริงหรือไม่นั้นขึ้นอยู่กับการตัดสินของนักประวัติศาสตร์

งานสมัคร

รวบรวมเอกสารอย่างน้อย 15 ชิ้น (พร้อมข้อมูลอ้างอิง) แยกบุคคลและสถานที่ด้วยเทมเพลต "NER" จากนั้นจัดกลุ่มการสะกดที่แตกต่างกันด้วย "การทำให้เอนทิตีเป็นมาตรฐาน" และตรวจสอบกลุ่มด้วยตนเอง สุดท้าย เรียกใช้เทมเพลต "ไทม์ไลน์วันที่" และดูจำนวนกิจกรรมที่ "ไม่ระบุวันที่" เปรียบเทียบจำนวนลิงก์หรือเหตุการณ์ที่ AI สร้างขึ้นโดยมีการแจ้งเตือนที่ไม่ดี

รายการตรวจสอบ

  • [ ] ฉันได้กำหนดคำถามรูปแบบของฉันไว้อย่างชัดเจน
  • [ ] ฉันมีแต่ละเอนทิตีเชื่อมโยงกับการอ้างอิงเอกสาร
  • [ ] ฉันทำให้การพิมพ์เอนทิตีเป็นมาตรฐานและรวมเข้ากับการอนุมัติของมนุษย์
  • [ ] ฉันถามตัวเลขว่ามีข้อมูลและความลำเอียงหายไป
  • [ ] ฉันไม่ได้จัดเหตุการณ์ที่ไม่ระบุวันที่ไว้ในลำดับเหตุการณ์ ฉันเก็บแยกไว้ต่างหาก