กำไร:
- สามารถรับรู้ได้ว่าเหตุใดปัญญาประดิษฐ์จึงทำผิดพลาดในวิชาคณิตศาสตร์ (เป็นแบบจำลองทางภาษา ไม่ใช่ตรวจสอบตรรกะ) และข้อผิดพลาดหลักเจ็ดประเภท
- ความสามารถในการอธิบายว่าทำไมจึงจำเป็นต้องตรวจสอบแต่ละขั้นตอนโดยเข้าใจว่าข้อผิดพลาดนั้นแพร่กระจายออกไปและความแม่นยำถือเป็นเลขฐานสองในคณิตศาสตร์
- ความสามารถในการใช้ระเบียบวินัยในการตรวจสอบแบบหลายชั้นผ่านการทดสอบสามัญสำนึก การตรวจสอบลำดับความสำคัญ การตรวจสอบผลรวม การตรวจสอบข้าม และวิธีการอิสระ
หน่วยนี้ทำให้แนวคิดที่เป็นหัวใจของโมดูลลึกซึ้งยิ่งขึ้น: เหตุใด AI จึงทำผิดพลาดทางคณิตศาสตร์และอย่างไร ข้อผิดพลาดประเภทนี้มีอะไรบ้าง และเราจะตรวจจับข้อผิดพลาดเหล่านี้อย่างเป็นระบบได้อย่างไร ในหน่วยก่อนหน้านี้ เราได้เห็นวิธีการยืนยันสำหรับแต่ละหัวข้อแล้ว ที่นี่เรารวบรวมกายวิภาคของข้อผิดพลาดไว้ใต้หลังคาเดียวกัน ประเด็นก็คือ เมื่อคุณดูเอาต์พุตของ AI คุณจะสงสัยว่า "มีอะไรผิดพลาดที่นี่" คือการได้รับความคิดที่ถูกต้องซึ่งคิดแบบสะท้อนกลับ
คำเตือน: อาการประสาทหลอนเกิดขึ้นเมื่อ AI สร้างข้อมูลที่ไม่เป็นความจริงอย่างมั่นใจ ในทางคณิตศาสตร์ ภาพหลอนมักปรากฏในรูปแบบของ "โน้มน้าวใจแต่เป็นเท็จ" ทำไม AI ถึงทำผิดพลาด? เนื่องจากเป็นโมเดลภาษา ไม่ใช่กลไกลอจิก กล่าวคือ สร้างข้อความที่มีรูปแบบทางสถิติ จึงไม่ตรวจสอบความถูกต้องเชิงตรรกะของขั้นตอนต่างๆ "การคูณ 3 หลัก" และ "การพิสูจน์ที่ถูกต้อง" เป็นงานสำหรับเขาในการสร้างข้อความประเภทเดียวกัน ไม่มีกลไกภายในที่จะรับประกันความถูกต้อง
กายวิภาคของข้อผิดพลาดทางคณิตศาสตร์: เจ็ดประเภท
รายการประเภทต่อไปนี้สรุปข้อผิดพลาดทั่วไปที่คุณจะพบในเอาต์พุต AI และยาแก้พิษสำหรับแต่ละรายการ
ประเภทข้อผิดพลาด
มันมีลักษณะอย่างไร
ยาแก้พิษ
ข้อผิดพลาดทางคณิตศาสตร์
ตัวเลขผิดพลาด เช่น 7×8=54
เครื่องคิดเลข/SymPy
เข้าสู่ระบบผิดพลาด
−(a−b)=−a−b
เปิดชื่อของฉันด้วยตนเอง
ทฤษฎีบทที่สร้างขึ้น
ชื่อทฤษฎีบทที่ไม่มีอยู่จริง
การยืนยันจากแหล่งที่มา
การใช้กฎเกณฑ์ในทางที่ผิด
อย่าลืมกฎลูกโซ่นะ
“กฎข้อไหน?” คำถาม
ข้ามสถานะแล้ว
ละเว้นรากที่เป็นลบ
แสดงรายการสถานะทั้งหมด
ช่องว่างของการพิสูจน์
“ดังนั้น” โดยไม่มีเหตุอันควร
ตั้งคำถามทุกครั้งที่ผ่าน
ข้อมูลเก่า/ไม่ถูกต้อง
ข้อมูลที่ล้าสมัย
การจัดหา
เหตุใดคณิตศาสตร์จึงต้องการความสนใจเป็นพิเศษ?
ในพื้นที่ส่วนใหญ่ ความผิดพลาดเล็กๆ น้อยๆ ย่อมส่งผลที่ตามมาเล็กน้อย ในทางคณิตศาสตร์ ข้อผิดพลาดจะแพร่กระจายและเพิ่มมากขึ้น ข้อผิดพลาดของเครื่องหมายในบรรทัดแรกของสมการทำให้สิบบรรทัดถัดไปและผลลัพธ์สุดท้ายผิดทั้งหมด ช่องว่างตรงกลางหลักฐานทำให้หลักฐานทั้งหมดไม่ถูกต้อง “ความเปราะบาง” นี้ทำให้จำเป็นต้องตรวจสอบแต่ละขั้นตอนทางคณิตศาสตร์ — “โดยทั่วไปแล้วดูเหมือนจริง” ยังไม่เพียงพอ
ยิ่งไปกว่านั้น ความจริงในคณิตศาสตร์นั้นเป็นเลขฐานสอง ผลลัพธ์จะเป็นจริงหรือเท็จ ไม่มีสิ่งใดอยู่ระหว่างนั้น "ถูกต้องแปดสิบเปอร์เซ็นต์" อาจถือว่ายอมรับได้ในข้อความสรุป ไม่มีสิ่งที่เรียกว่า "ถูกต้องแปดสิบเปอร์เซ็นต์" ในปริพันธ์ ไม่ว่าจะเป็นผลลัพธ์ที่ถูกต้องหรือไม่ก็ตาม ลักษณะที่เป็นสองขั้วนี้ทำให้การยืนยันมีความสำคัญมากขึ้นและ (โชคดี) เป็นไปได้มากขึ้น: ผลลัพธ์ที่ได้จะผ่านการตรวจสอบหรือไม่ก็ตาม
ทีละขั้นตอน: วินัยในการตรวจสอบอย่างเป็นระบบ
1. ยืนยันผลลัพธ์ตัวเลขแต่ละรายการด้วยเครื่องมือ อย่าปล่อยให้เลขคณิตต้องพึ่งพา AI SymPy เครื่องคิดเลขหรือด้วยมือ
2. ตรวจสอบผลลัพธ์เชิงสัญลักษณ์แต่ละรายการด้วย SymPy อินทิกรัล, อนุพันธ์, ลดความซับซ้อน, สมการ—ทั้งหมดสามารถตรวจสอบได้ด้วย SymPy
3. ยืนยันแต่ละทฤษฎีบท/สูตรจากแหล่งที่มา ชื่อและสำนวนถูกต้องหรือไม่? ทฤษฎีบทที่สร้างขึ้นเป็นกับดักที่ร้ายกาจที่สุด
4. ตั้งคำถามทุกเหตุการณ์ในทุกหลักฐาน “นี่เป็นไปตามขั้นตอนที่แล้วจริงๆ เหรอ?” กรณีฐาน สมมติฐานโดยนัย การตรวจสอบช่องว่าง
5. ตรวจสอบและตอบโต้ การดำเนินการผกผัน การทดแทน สถานะขีดจำกัด การวิเคราะห์มิติ
6. นำไปทดสอบสามัญสำนึก ผลลัพธ์สมเหตุสมผลหรือไม่? หากความน่าจะเป็นมากกว่า 1 จะเกิดข้อผิดพลาดหากความยาวเป็นลบ
คำแนะนำ: การทดสอบสามัญสำนึกที่เร็วที่สุดคือการตรวจสอบ "ลำดับความสำคัญ" ผลลัพธ์อยู่ในช่วงที่คาดไว้โดยประมาณหรือไม่ หากค่าเฉลี่ยของชั้นเรียนคือ 250 (เต็ม 100) หรือความน่าจะเป็นคือ 3.5 คุณจะรู้ว่ามีข้อผิดพลาดโดยไม่ต้องดูรายละเอียด การตรวจสอบ 5 วินาทีนี้จะช่วยลดผลลัพธ์ที่ไร้สาระมากมายที่เกิดขึ้นในตา
มินิเคสสามอัน
กรณีที่ 1 — ข้อผิดพลาดของสัญญาณลูกโซ่ นักเรียนคนหนึ่งพบว่าในการทำให้พีชคณิตแบบ 8 บรรทัดง่ายขึ้น มีสัญญาณผิดพลาดที่ AI สร้างขึ้นในบรรทัดที่ 2 แพร่กระจายไปยัง 6 บรรทัดถัดไป ผลลัพธ์สุดท้ายผิดอย่างสิ้นเชิง แต่ AI นำเสนอด้วยความมั่นใจเต็มร้อย เมื่อนักเรียนทำให้ง่ายขึ้นตั้งแต่ต้นด้วย SymPy ผลลัพธ์ที่ถูกต้องก็ได้รับและอนุญาตให้ AI ค้นหาข้อผิดพลาดในบรรทัดที่ 2 ป้ายเดียวข้องแวะ 6 บรรทัด
กรณีที่ 2 — สามัญสำนึกบันทึกการทดสอบ ครูมี AI แก้ปัญหาความน่าจะเป็น ผลลัพธ์คือ 1.4 โดยไม่ได้ดูรายละเอียด ครูบอกว่า "ความน่าจะเป็นต้องไม่มากกว่า 1" และมองหาข้อผิดพลาด: AI ได้รวบรวมเหตุการณ์ที่ไม่ต่อเนื่องราวกับว่าเป็นเหตุการณ์ที่ไม่ต่อเนื่องกัน การทดสอบสามัญสำนึกชี้ให้เห็นข้อผิดพลาดภายในไม่กี่วินาที
กรณีที่ 3 — สูตรที่สร้างขึ้น วิศวกรคนหนึ่งขอให้ AI หา "สูตรปิด" เพื่อหาผลรวมเป็นชุด AI ได้ให้สูตรที่น่าเชื่อถือ วิศวกรทดสอบสูตรด้วยค่าเล็กน้อยที่ n (n=3) ทั้งโดยสูตรและการเติมด้วยมือ ผลลัพธ์ไม่ตรงกัน สูตรถูกสร้างขึ้น การปรับแต่งเล็กน้อยช่วยป้องกันการใช้งานในทางที่ผิดได้หลายชั่วโมง
เทมเพลตที่สามารถคัดลอกได้สี่แบบ
1) คำขอตรวจสอบหลายชั้น:
คุณพบ: [ผลลัพธ์] ตอนนี้ตรวจสอบสามวิธีที่แตกต่างกัน: (1) แฮชมันแบบย้อนกลับ (2) ทดสอบค่าที่กำหนดเองอย่างง่าย (3) โค้ดบางส่วนเพื่อตรวจสอบด้วย SymPy (ฉันจะเห็นผลลัพธ์) บอกฉันว่าทั้งสามวิธีสอดคล้องกันหรือไม่ ถ้าไม่ ให้แสดงว่าขั้นตอนใดมีข้อผิดพลาด
2) การทดสอบสามัญสำนึก/ยศ:
คุณพบ: [ผลลัพธ์] ลองทดสอบสามัญสำนึกเพื่อดูว่าผลลัพธ์นี้สมเหตุสมผลหรือไม่: ลำดับความสำคัญที่คาดหวังคืออะไร เครื่องหมายถูกต้องหรือไม่ มันอยู่ภายในขีดจำกัด (เช่น ความน่าจะเป็น 0-1) หรือไม่ หากไม่สมเหตุสมผลให้ตรวจสอบจุดที่อาจมีข้อผิดพลาด
3) การยืนยันทฤษฎีบท/สูตร:
[ทฤษฎีบท/สูตร] ที่คุณใช้เป็นมาตรฐานและถูกต้องจริงๆ หรือไม่ เขียนนิพจน์และเงื่อนไขมาตรฐาน แสดงบัญชีที่ทดสอบสิ่งนี้ด้วยตัวอย่างเล็กๆ น้อยๆ (เช่น n=3) ถ้าเป็นสูตรแต่งหน้าหรืออะไรไม่แน่ใจก็พูดให้ชัดเจน
4) การวินิจฉัยโหมดข้อผิดพลาด:
ฉันรู้ว่ามีข้อบกพร่องในวิธีแก้ปัญหาด้านล่าง ตรวจสอบประเภทข้อผิดพลาดเหล่านี้ทีละรายการ: เลขคณิต เครื่องหมาย กฎผิด เงื่อนไขที่ข้าม โดเมน บอกฉันว่าเป็นข้อผิดพลาดประเภทใดและขั้นตอนใด วิธีแก้ปัญหา: [ที่นี่]
พรอมต์อ่อน / พรอมต์แรง
อ่อนแอ: "ข้อสรุปนี้ถูกต้องหรือไม่?" [วางผลลัพธ์]
ผลลัพธ์: AI มักจะพูดว่า “ใช่แล้ว” (มีแนวโน้มที่จะยืนยันผลลัพธ์ของตัวเอง); ไม่น่าเชื่อถือเนื่องจากไม่มีการตรวจสอบที่เป็นอิสระ
แข็งแกร่ง: "ตรวจสอบผลลัพธ์นี้ด้วยวิธีอิสระ: ใช้วิธีแก้ไขปัญหาอื่นหรือตรวจสอบด้วยโค้ด SymPy (ฉันจะเรียกใช้โค้ด) อย่าเพิ่งพูดว่า 'จริง/เท็จ' แสดงว่าการตรวจสอบใดที่คุณทำและผลลัพธ์ หากผลรวมตรวจสอบล้มเหลว ให้ค้นหาข้อผิดพลาด"
ผลลัพธ์: วิธีการควบคุมที่เป็นอิสระถูกท้าทาย AI ถูกป้องกันไม่ให้สุ่มสี่สุ่มห้าอนุมัติผลลัพธ์ของตัวเอง
ข้อผิดพลาดทั่วไป
- การรับ AI เพื่อตรวจสอบผลลัพธ์ของตัวเอง “เรื่องนี้จริงเหรอ?” AI มักจะยืนยันความผิดพลาดของตัวเอง ต้องใช้วิธีอิสระ
- ข้ามการทดสอบสามัญสำนึก เรื่องไร้สาระ เช่น ความน่าจะเป็นที่มากกว่า 1 และความยาวเป็นลบสามารถจับได้โดยไม่ต้องดูรายละเอียด
- อาศัยการตรวจสอบเพียงครั้งเดียว ใช้หลายเส้นทางอิสระ (แฮช + SymPy + ค่าที่กำหนดเอง) กับผลลัพธ์ที่สำคัญ
- ไม่ใช่การทดสอบสูตรด้วยตัวอย่างเล็กๆ สูตรที่สร้างขึ้นจะยุบทันทีด้วยค่าน้อย เช่น n=2, n=3
- โดยลืมไปว่าแมลงกำลังแพร่กระจาย ข้อผิดพลาดในบรรทัดแรกทำให้ผลลัพธ์ทั้งหมดเสียหาย หากพบข้อผิดพลาดให้ตรวจสอบตั้งแต่ต้น
ข้อควรระวัง: ไม่มีความสัมพันธ์กันระหว่างความมั่นใจของ AI และความแม่นยำ ประโยคที่ดูเหมือนตั้งใจที่สุด คล่องแคล่วที่สุด และ "แน่ใจ" ที่สุด อาจจะผิดโดยสิ้นเชิง เชื่อถือการตรวจสอบโดยอิสระ ไม่ใช่โทนเสียง พิจารณาผลลัพธ์ที่ "จริง" เท่านั้นเมื่อคุณยืนยันด้วยมือหรือด้วยเครื่องมือกำหนด ไม่ใช่เพราะ AI บอกว่า "แน่นอน"
โดยสรุป
AI ทำผิดพลาดในวิชาคณิตศาสตร์ เนื่องจากเป็นโมเดลภาษาที่สร้างข้อความทางสถิติ ไม่ใช่กลไกที่ควบคุมตรรกะ ข้อผิดพลาดแบ่งออกเป็นเจ็ดประเภทหลัก: เลขคณิต เครื่องหมาย ทฤษฎีบทที่สร้างขึ้น การใช้กฎในทางที่ผิด ตัวพิมพ์ละเว้น ช่องว่างการพิสูจน์ ข้อมูลเก่า ในทางคณิตศาสตร์ ข้อผิดพลาดแพร่กระจายและขยายใหญ่ขึ้น ความจริงก็คือเลขฐานสอง ดังนั้นทุกขั้นตอนจึงต้องได้รับการตรวจสอบ ระเบียบวินัยที่เป็นระบบ: ตรวจสอบเครื่องมือตัวเลขทุกอัน ผลลัพธ์เชิงสัญลักษณ์ทุกรายการด้วย SymPy ทุกทฤษฎีบทจากแหล่งที่มา ทุกข้อพิสูจน์ผ่านการตั้งคำถาม ใช้การตรวจสอบ การตรวจสอบย้อนกลับ และการทดสอบสามัญสำนึก ความมั่นใจของ AI ไม่ใช่หลักฐานยืนยันความถูกต้อง
งานสมัคร
เลือกปัญหาที่มีความยาวปานกลาง (อย่างน้อย 6-8 ขั้นตอน) แล้วให้ AI แก้ปัญหา จากนั้นทำการตรวจสอบยืนยันแบบหลายชั้นโดยใช้รูปแบบ 1 และ 4 จากหน่วยนี้: (a) การทดสอบสามัญสำนึก/อันดับ (b) ตรวจสอบด้วย SymPy (c) การทดสอบด้วยค่าพิเศษ จากนั้นทำตามขั้นตอนการแก้ปัญหาทีละบรรทัดด้วย "การล่าแมลง" อย่างตั้งใจ และตรวจสอบว่าข้อผิดพลาดประเภทใดในเจ็ดประเภทที่อาจเกิดขึ้น บันทึกข้อผิดพลาดแต่ละข้อที่คุณพบพร้อมกับประเภทของข้อผิดพลาด
รายการตรวจสอบ
- [ ] ฉันยืนยันผลลัพธ์ตัวเลขแต่ละรายการด้วยเครื่องมือกำหนด
- [ ] ฉันตรวจสอบผลลัพธ์เชิงสัญลักษณ์แต่ละรายการด้วย SymPy
- [ ] ฉันตรวจสอบทฤษฎีบท/สูตรที่ใช้จากแหล่งที่มาหรือด้วยตัวอย่างเล็กๆ น้อยๆ
- [ ] ฉันใช้สามัญสำนึก/ลำดับของการทดสอบขนาด
- [ ] ฉันตรวจสอบในลักษณะที่เป็นอิสระ (โดยไม่ต้องอาศัยการอนุมัติของ AI เอง)
- [ ] เมื่อฉันพบข้อผิดพลาด ฉันได้ตรวจสอบวิธีแก้ปัญหาอีกครั้งตั้งแต่ต้น