กำไร:
- ความสามารถในการเข้าใจว่าภาพหลอนนั้นมีอยู่ในโมเดลภาษา และเลือกวิธีการตรวจสอบที่เหมาะสมสำหรับผลลัพธ์แต่ละประเภท
- ตรวจสอบค่าวิกฤตในสองวิธีแยกจากกันด้วยสมการ และไม่สับสนระหว่างความคล่องและความแม่นยำ
- ความสามารถในการใช้ความโปร่งใส การตรวจสอบย้อนกลับ ความสมบูรณ์ของข้อมูล และความรับผิดชอบของมนุษย์เป็นพื้นฐานของความสมบูรณ์ทางวิทยาศาสตร์
วลีเดียวที่กลับมาซ้ำแล้วซ้ำเล่าตลอดโมดูลนี้: “AI ผลิต มนุษย์ตรวจสอบ” ในหน่วยนี้ เราเปลี่ยนประโยคนั้นให้เป็นระบบ จุดมุ่งหมายคือการรับรู้ภาพหลอน (การสร้างข้อมูลที่เป็นเท็จ/ปลอมแปลงด้วยภาษาที่มั่นใจ) ซึ่งเป็นพฤติกรรมที่อันตรายที่สุดของ AI เพื่อสร้างวิธีการตรวจสอบที่เป็นรูปธรรมสำหรับผลลัพธ์แต่ละประเภท และเพื่อวางสิ่งเหล่านี้ทั้งหมดภายในกรอบของความสมบูรณ์ทางวิทยาศาสตร์ (ความซื่อสัตย์ ความโปร่งใส การตรวจสอบย้อนกลับ) ผลลัพธ์ด้านเคมีของ AI ที่ไม่ผ่านการตรวจสอบไม่ได้เป็นเพียงความผิดพลาดเท่านั้น อาจเป็นการทดลองระเบิด คนถูกวางยาพิษ หรือกระดาษถูกดึงกลับ
เหตุใดภาพหลอนจึงหลีกเลี่ยงไม่ได้?
โมเดลภาษาขนาดใหญ่สร้าง "คำที่มีแนวโน้มมากที่สุดถัดไป"; มันมุ่งเป้าไปที่สิ่งที่เป็นไปได้ ไม่ใช่สิ่งที่เป็นจริง ดังนั้นเขาจึงสามารถเติมน้ำหนักโมเลกุล DOI หรือจุดเดือดด้วยค่าที่ “ดูสมเหตุสมผล” โดยไม่ต้องตรวจสอบว่าเป็นจริงหรือไม่ อาการประสาทหลอนไม่ใช่ความผิดปกติ แต่เป็นผลมาจากธรรมชาติของเทคโนโลยีนี้ วิธีแก้ไขไม่ใช่การ "พยายามแก้ไข" โมเดล แต่เป็นการสร้างเชลล์ตรวจสอบความถูกต้องรอบๆ แต่ละเอาต์พุต
ลักษณะที่ร้ายกาจที่สุดของภาพหลอนคือภาษาที่มั่นใจ น้ำหนักโมเลกุลที่ไม่ถูกต้องจะแสดงด้วยความมั่นใจเช่นเดียวกับน้ำหนักที่ถูกต้อง ดังนั้น "ดูมั่นใจ" ไม่เคยแปลว่า "ถูกต้อง"
ข้อควรสนใจ: AI พูดในเรื่องใดได้อย่างคล่องแคล่วและมั่นใจเพียงใดนั้นไม่เกี่ยวข้องกับความถูกต้องของข้อมูลนั้น ความคล่องแคล่วโน้มน้าว; มีเพียงแหล่งข้อมูลอิสระเท่านั้นที่จะกำหนดความถูกต้อง
การตรวจสอบตามประเภทผลลัพธ์ในวิชาเคมี
เอาต์พุตแต่ละประเภทมีวิธีการตรวจสอบของตัวเอง แทนที่จะจดจำกฎข้อเดียว ให้ใช้เครื่องมือที่เหมาะสมสำหรับผลลัพธ์:
ประเภทเอาต์พุต
วิธีการตรวจสอบ
ยานพาหนะ
น้ำหนักโมเลกุลสูตร
คำนวณใหม่จากสูตร
RDKit / ด้วยตนเอง
รอยยิ้ม/โครงสร้าง
แยกวิเคราะห์ + กำหนดมาตรฐาน
RDKit
การอ้างอิง/ดอย
แก้ในฐานข้อมูล
doi.org, Crossref
ค่าคงที่ทางกายภาพ (kn, pKa)
ฐานข้อมูลอ้างอิง
PubChem หนังสือคู่มือ
การคำนวณเชิงตัวเลข
เขียน+รันโค้ด
หลาม
ปฏิกิริยา/สภาวะ
การยืนยันวรรณกรรม
Reaxys บทความ
การเรียกร้องความปลอดภัย
SDS/GHS
เอกสารความปลอดภัยอย่างเป็นทางการ
การมอบหมายสเปกตรัม
พหุเทคนิค + มนุษย์
สเปกตรัมการทดลอง
ตารางนี้เป็นสรุปของโมดูลนี้จริงๆ: แต่ละหน่วยมีหนึ่งแถว
สามเหลี่ยม: สามเส้นทางอิสระ
เทคนิคการตรวจสอบที่ทรงพลังที่สุดคือ "สามเหลี่ยม" ซึ่งได้ข้อสรุปเดียวกันด้วยวิธีอิสระสามวิธี ตัวอย่างเช่น สำหรับน้ำหนักโมเลกุล: (1) สิ่งที่ YZ พูด (2) การคำนวณของ RDKit (3) การคำนวณด้วยมือจากสูตร หากทั้งสามทับซ้อนกัน แสดงว่าความไว้วางใจมีสูง หากมีใครหลงทางให้หยุดและตรวจสอบ อย่าพึ่งพาแหล่งเดียวในวิชาเคมี มองหาเส้นทางอิสระอย่างน้อยสองเส้นทาง
ทีละขั้นตอน: ขั้นตอนการตรวจสอบ
- จำแนกผลลัพธ์: เป็นตัวเลข โครงสร้าง การระบุแหล่งที่มา การยืนยันความปลอดภัยหรือไม่
- เลือกเครื่องมือที่เหมาะสม: รับเส้นทางการตรวจสอบที่เหมาะสมสำหรับประเภทเอาต์พุตจากตารางด้านบน
- คำนวณ/ค้นหาอย่างอิสระ: ขับเคลื่อนยานพาหนะโดยอิสระจาก AI; เปรียบเทียบผลลัพธ์
- หากมีการเบี่ยงเบนให้หยุด : หากค่าไม่ตรงกันอย่าดำเนินการต่อโดยไม่ตรวจสอบว่าค่าใดถูกต้อง
- ทิ้งเครื่องหมายไว้: บันทึกสิ่งที่คุณตรวจสอบและอย่างไร (ความสมบูรณ์ทางวิทยาศาสตร์)
- ระบุความไม่แน่นอน: ทำเครื่องหมายสิ่งที่ไม่สามารถยืนยันได้ว่า "ยังไม่ยืนยัน" อย่าซ่อนไว้
เทมเพลตที่สามารถคัดลอกได้สี่แบบ
1) การยืนยันตนเอง:
คุณเพิ่งให้ผลลัพธ์ต่อไปนี้: [OUTPUT] ภารกิจ: แสดงรายการการยืนยันตัวเลข/ข้อเท็จจริงของผลลัพธ์นี้แยกบรรทัดกัน สำหรับการยืนยันแต่ละครั้ง: "จะตรวจสอบอย่างอิสระได้อย่างไร" วิธีการเขียน (เครื่องมือ/ฐานข้อมูลใด) อย่าอ้างว่าการกล่าวอ้างนั้นเป็นความจริง เพียงแค่ให้วิธีการตรวจสอบมัน
2) การควบคุมรูปสามเหลี่ยม:
ฉันต้องการตรวจสอบน้ำหนักของโมเลกุลต่อไปนี้ในสามวิธี: [ยิ้ม] งาน: 1) หาสูตรโมเลกุล 2) แสดงการคำนวณน้ำหนักโมเลกุลตามอะตอม (การมีส่วนร่วมของแต่ละองค์ประกอบ) หมายเหตุ: ฉันจะคำนวณใน RDKit ด้วย และเปรียบเทียบกับที่คุณให้อย่างที่สาม หากทั้งสามไม่ทับซ้อนกันให้เตือน
3) เครื่องหมายความคลุมเครือ:
มีการกล่าวอ้างข้อเท็จจริงหลายรายการในข้อความต่อไปนี้:[ข้อความ]งาน: ใส่ป้ายกำกับระดับความเชื่อมั่นถัดจากการอ้างสิทธิ์แต่ละรายการ:[ยืนยันแล้ว] / [ตรวจสอบแล้ว] / [ไม่แน่นอน] อย่าทำเครื่องหมายสิ่งใดเลยเป็น [ยืนยันแล้ว] หากคุณไม่แน่ใจ
4) แบบสอบถามข้ามความสอดคล้อง:
ฉันจะถามคำถามเดียวกันในสองวิธีที่แตกต่างกัน ดูว่าคำตอบของคุณสอดคล้องกันหรือไม่ คำถาม A: สูตรโมเลกุลของสารประกอบคืออะไร
พรอมต์อ่อน / พรอมต์แรง
อ่อนแอ:
เขียนทุกสิ่งที่คุณรู้เกี่ยวกับสารประกอบนี้
AI ผสมผสานข้อมูลที่ตรวจสอบได้และข้อมูลที่ประดิษฐ์ขึ้นอย่างไม่เลือกปฏิบัติ ไม่ชัดเจนว่าอันไหนเป็นของจริง
แข็งแกร่ง:
ให้ข้อมูลเกี่ยวกับสารประกอบนี้ แต่ติดป้ายกำกับการกล่าวอ้างแต่ละรายการเป็น:[DETERMINISTIC - ตรวจสอบโดยเครื่องมือ] เช่น สูตรโมเลกุล[ทดลอง - จำเป็นต้องมีการอ้างอิง] เช่น จุดหลอมเหลว[ไม่แน่นอน - ไม่แน่ใจ] ห้ามเขียนคำกล่าวอ้างใดๆ ที่ไม่มีป้ายกำกับ
ความแตกต่าง: เราบังคับให้ AI ทำเครื่องหมายความไม่แน่นอนของตัวเอง We made the verification work plannable.
ความสมบูรณ์ทางวิทยาศาสตร์: ความซื่อสัตย์และการตรวจสอบย้อนกลับ
การยืนยันไม่ได้เป็นเพียงขั้นตอนทางเทคนิคเท่านั้น แต่ยังเป็นปัญหาด้านจริยธรรมอีกด้วย ความสมบูรณ์ทางวิทยาศาสตร์ต้องการ:
- ความโปร่งใส: อย่าปิดบังว่าคุณกำลังใช้ AI; ระบุตามนโยบายสิ่งพิมพ์/รายงานของคุณ
- ความสามารถในการตรวจสอบย้อนกลับ: บันทึกว่าเอาต์พุตใดมาจาก AI และวิธีการตรวจสอบ
- ความสมบูรณ์ของข้อมูล: ผลลัพธ์ "การทำให้สวยงาม" ด้วย AI การละทิ้งค่าผิดปกติโดยไม่มีเหตุผลอันสมควรถือเป็นการฉ้อโกง
- ความรับผิดชอบ: คุณต้องรับผิดชอบต่อผลลัพธ์สุดท้าย “AI พูดอย่างนั้น” ไม่ใช่ข้อแก้ตัว
เคล็ดลับ: ยอมรับตั้งแต่เริ่มแรกว่าคุณไม่สามารถใช้วลี "The AI said so" ในการรายงานหรือการป้องกันได้ การยอมรับนี้ทำให้เกิดนิสัยในการตรวจสอบทุกเอาต์พุตโดยอัตโนมัติ
กรณีขนาดเล็ก
กรณีที่ 1 — สามเหลี่ยมตรวจพบข้อผิดพลาด นักเรียนคนหนึ่งตรวจสอบน้ำหนักโมเลกุลสามวิธี: YZ บอกว่า 178.2, การคำนวณด้วยตนเองให้ 180.16, RDKit ให้ 180.16 เส้นทางอิสระสองเส้นทางซ้อนทับกันและกำจัด AI บทเรียน: การตรวจสอบอิสระสองครั้งเอาชนะเอาต์พุตปลอมหนึ่งรายการอย่างเงียบๆ
กรณีที่ 2 — ภาษาที่ปลอดภัย ข้อมูลไม่ถูกต้อง AI เขียนอย่างมั่นใจมากว่าปฏิกิริยา "เกิดขึ้นเองตามธรรมชาติที่อุณหภูมิห้อง" งานวิจัยแสดงให้เห็นว่าสิ่งนี้จำเป็นต้องมีการให้ความร้อนและตัวเร่งปฏิกิริยา นักเรียนเชื่อถือแหล่งที่มา ไม่ใช่ภาษาที่ปลอดภัย บทเรียน: ความคล่องไม่ใช่ความแม่นยำ
กรณีที่ 3 — ได้รับความโปร่งใส ในส่วนวิธีการของรายงานของเขา นักวิจัยคนหนึ่งระบุอย่างชัดเจนถึงขั้นตอนที่เขาใช้ AI (การแก้ไขข้อความ การร่างโค้ด) และเขียนว่าเขาตรวจสอบผลลัพธ์ที่เป็นตัวเลขทั้งหมดอย่างอิสระ กระบวนการตัดสินเป็นไปอย่างราบรื่น บทเรียน: ความโปร่งใสสร้างความไว้วางใจ การปกปิดสร้างความเสี่ยง
ข้อผิดพลาดทั่วไป
- ไว้วางใจภาษาที่ปลอดภัย น้ำเสียงที่มั่นใจของ AI ไม่ได้บ่งบอกถึงความแม่นยำ
- อาศัยแหล่งเดียว การรับเอาต์พุตเดี่ยวโดยไม่มีรูปสามเหลี่ยม
- ไม่แยกประเภทเอาต์พุต คิดว่าฉัน "ตรวจสอบ" หมายเลข การระบุแหล่งที่มา และการยืนยันความปลอดภัยด้วยวิธีเดียวกัน
- ซ่อนความไม่แน่นอน. การรายงานสิ่งที่ไม่สามารถตรวจสอบได้เหมือนกับว่าเป็นสิ่งที่แน่นอน
- การซ่อนการใช้ AI การขาดความโปร่งใสจะบ่อนทำลายความสมบูรณ์ทางวิทยาศาสตร์
- การมอบหมายความรับผิดชอบ ข้อแก้ตัว "AI กล่าวเช่นนั้น" ไม่ถูกต้อง ความรับผิดชอบอยู่ที่บุคคลนั้น
โดยสรุป
- ภาพหลอนมีอยู่ในแบบจำลองภาษา วิธีแก้ไขคือสร้างเชลล์ตรวจสอบความถูกต้องรอบๆ เอาต์พุตแต่ละรายการ
- เอาต์พุตแต่ละประเภทมีวิธีการตรวจสอบของตัวเอง จำแนกผลลัพธ์และใช้เครื่องมือที่เหมาะสม
- สมการ (สองเส้นทางที่เป็นอิสระ) คือการควบคุมที่แข็งแกร่งที่สุด อย่าเชื่อถือแหล่งเดียว
- ภาษาที่คล่องแคล่วและมั่นใจไม่เกี่ยวข้องกับความถูกต้อง
- ความสมบูรณ์ทางวิทยาศาสตร์ต้องการความโปร่งใส การตรวจสอบย้อนกลับ ความสมบูรณ์ของข้อมูล และความรับผิดชอบของมนุษย์
งานสมัคร
จงใจสร้างผลลัพธ์ที่หลากหลายในเซสชัน AI: น้ำหนักโมเลกุล ข้อมูลอ้างอิง ค่าคงที่ทางกายภาพ คำกล่าวอ้างด้านความปลอดภัย การคำนวณเชิงตัวเลข ตรวจสอบแต่ละอย่างแยกกันด้วยวิธีที่ถูกต้อง (ดูตาราง) พยายามจับภาพหลอนอย่างน้อยหนึ่งครั้ง จากนั้นเตรียม "เมทริกซ์การตรวจสอบ": เอาต์พุตแถว, คอลัมน์ (ค่า AI / ค่าอิสระ / มันทับซ้อนกัน / ฉันจะตรวจสอบได้อย่างไร) คุณจะรายงานเซสชันนี้ในแง่ของความสมบูรณ์ทางวิทยาศาสตร์อย่างไร
รายการตรวจสอบ
- [ ] ฉันเข้าใจว่าทำไมภาพหลอนจึงเป็นสิ่งที่หลีกเลี่ยงไม่ได้
- [ ] ฉันจัดประเภทเอาต์พุตแต่ละรายการตามประเภทของมัน และตรวจสอบด้วยวิธีที่เหมาะสม
- [ ] ฉันทำรูปสามเหลี่ยม (สองเส้นทางที่เป็นอิสระ) กับค่าวิกฤต
- [ ] ฉันเชื่อถือแหล่งที่มา ไม่ใช่ภาษาที่ปลอดภัย
- [ ] ฉันทำเครื่องหมายสิ่งที่ไม่สามารถยืนยันได้ว่า "ไม่แน่นอน"
- [ ] ฉันมีความโปร่งใสในการใช้ AI และรับผิดชอบต่อผลลัพธ์ที่เกิดขึ้น