หน่วย
1. ปัญญาประดิษฐ์เบื้องต้นทางคณิตศาสตร์: บทบาท ขอบเขต การตรวจสอบแต่ละขั้นตอน และจริยธรรม 2. การสนับสนุนการแก้ปัญหาและการควบคุมทีละขั้นตอน 3. การสร้างร่างหลักฐานและการตรวจสอบหลักฐาน 4. การคำนวณเชิงสัญลักษณ์: การควบคุมปัญญาประดิษฐ์ด้วย SymPy 5. การคำนวณเชิงตัวเลข Python และการสร้างโค้ด 6. การแสดงภาพทางคณิตศาสตร์ 7. การผลิตวัสดุหลักสูตร 8. การผลิตคำถามและการสอบ 9. อาการประสาทหลอน ข้อผิดพลาดทางคณิตศาสตร์ที่พบบ่อย และวินัยในการตรวจสอบ 10. น้ำยาง สัญกรณ์และการเขียนทางคณิตศาสตร์ 11. จริยธรรม ความซื่อสัตย์ทางวิชาการ ขอบเขต และกระบวนการทำงานแบบครบวงจร
หน่วย 9 / 11

อาการประสาทหลอน ข้อผิดพลาดทางคณิตศาสตร์ที่พบบ่อย และวินัยในการตรวจสอบ

กำไร:

  • สามารถรับรู้ได้ว่าเหตุใดปัญญาประดิษฐ์จึงทำผิดพลาดในวิชาคณิตศาสตร์ (เป็นแบบจำลองทางภาษา ไม่ใช่ตรวจสอบตรรกะ) และข้อผิดพลาดหลักเจ็ดประเภท
  • ความสามารถในการอธิบายว่าทำไมจึงจำเป็นต้องตรวจสอบแต่ละขั้นตอนโดยเข้าใจว่าข้อผิดพลาดนั้นแพร่กระจายออกไปและความแม่นยำถือเป็นเลขฐานสองในคณิตศาสตร์
  • ความสามารถในการใช้ระเบียบวินัยในการตรวจสอบแบบหลายชั้นผ่านการทดสอบสามัญสำนึก การตรวจสอบลำดับความสำคัญ การตรวจสอบผลรวม การตรวจสอบข้าม และวิธีการอิสระ

หน่วยนี้ทำให้แนวคิดที่เป็นหัวใจของโมดูลลึกซึ้งยิ่งขึ้น: เหตุใด AI จึงทำผิดพลาดทางคณิตศาสตร์และอย่างไร ข้อผิดพลาดประเภทนี้มีอะไรบ้าง และเราจะตรวจจับข้อผิดพลาดเหล่านี้อย่างเป็นระบบได้อย่างไร ในหน่วยก่อนหน้านี้ เราได้เห็นวิธีการยืนยันสำหรับแต่ละหัวข้อแล้ว ที่นี่เรารวบรวมกายวิภาคของข้อผิดพลาดไว้ใต้หลังคาเดียวกัน ประเด็นก็คือ เมื่อคุณดูเอาต์พุตของ AI คุณจะสงสัยว่า "มีอะไรผิดพลาดที่นี่" คือการได้รับความคิดที่ถูกต้องซึ่งคิดแบบสะท้อนกลับ

คำเตือน: อาการประสาทหลอนเกิดขึ้นเมื่อ AI สร้างข้อมูลที่ไม่เป็นความจริงอย่างมั่นใจ ในทางคณิตศาสตร์ ภาพหลอนมักปรากฏในรูปแบบของ "โน้มน้าวใจแต่เป็นเท็จ" ทำไม AI ถึงทำผิดพลาด? เนื่องจากเป็นโมเดลภาษา ไม่ใช่กลไกลอจิก กล่าวคือ สร้างข้อความที่มีรูปแบบทางสถิติ จึงไม่ตรวจสอบความถูกต้องเชิงตรรกะของขั้นตอนต่างๆ "การคูณ 3 หลัก" และ "การพิสูจน์ที่ถูกต้อง" เป็นงานสำหรับเขาในการสร้างข้อความประเภทเดียวกัน ไม่มีกลไกภายในที่จะรับประกันความถูกต้อง

กายวิภาคของข้อผิดพลาดทางคณิตศาสตร์: เจ็ดประเภท

รายการประเภทต่อไปนี้สรุปข้อผิดพลาดทั่วไปที่คุณจะพบในเอาต์พุต AI และยาแก้พิษสำหรับแต่ละรายการ

ประเภทข้อผิดพลาด

มันมีลักษณะอย่างไร

ยาแก้พิษ

ข้อผิดพลาดทางคณิตศาสตร์

ตัวเลขผิดพลาด เช่น 7×8=54

เครื่องคิดเลข/SymPy

เข้าสู่ระบบผิดพลาด

−(a−b)=−a−b

เปิดชื่อของฉันด้วยตนเอง

ทฤษฎีบทที่สร้างขึ้น

ชื่อทฤษฎีบทที่ไม่มีอยู่จริง

การยืนยันจากแหล่งที่มา

การใช้กฎเกณฑ์ในทางที่ผิด

อย่าลืมกฎลูกโซ่นะ

“กฎข้อไหน?” คำถาม

ข้ามสถานะแล้ว

ละเว้นรากที่เป็นลบ

แสดงรายการสถานะทั้งหมด

ช่องว่างของการพิสูจน์

“ดังนั้น” โดยไม่มีเหตุอันควร

ตั้งคำถามทุกครั้งที่ผ่าน

ข้อมูลเก่า/ไม่ถูกต้อง

ข้อมูลที่ล้าสมัย

การจัดหา

เหตุใดคณิตศาสตร์จึงต้องการความสนใจเป็นพิเศษ?

ในพื้นที่ส่วนใหญ่ ความผิดพลาดเล็กๆ น้อยๆ ย่อมส่งผลที่ตามมาเล็กน้อย ในทางคณิตศาสตร์ ข้อผิดพลาดจะแพร่กระจายและเพิ่มมากขึ้น ข้อผิดพลาดของเครื่องหมายในบรรทัดแรกของสมการทำให้สิบบรรทัดถัดไปและผลลัพธ์สุดท้ายผิดทั้งหมด ช่องว่างตรงกลางหลักฐานทำให้หลักฐานทั้งหมดไม่ถูกต้อง “ความเปราะบาง” นี้ทำให้จำเป็นต้องตรวจสอบแต่ละขั้นตอนทางคณิตศาสตร์ — “โดยทั่วไปแล้วดูเหมือนจริง” ยังไม่เพียงพอ

ยิ่งไปกว่านั้น ความจริงในคณิตศาสตร์นั้นเป็นเลขฐานสอง ผลลัพธ์จะเป็นจริงหรือเท็จ ไม่มีสิ่งใดอยู่ระหว่างนั้น "ถูกต้องแปดสิบเปอร์เซ็นต์" อาจถือว่ายอมรับได้ในข้อความสรุป ไม่มีสิ่งที่เรียกว่า "ถูกต้องแปดสิบเปอร์เซ็นต์" ในปริพันธ์ ไม่ว่าจะเป็นผลลัพธ์ที่ถูกต้องหรือไม่ก็ตาม ลักษณะที่เป็นสองขั้วนี้ทำให้การยืนยันมีความสำคัญมากขึ้นและ (โชคดี) เป็นไปได้มากขึ้น: ผลลัพธ์ที่ได้จะผ่านการตรวจสอบหรือไม่ก็ตาม

ทีละขั้นตอน: วินัยในการตรวจสอบอย่างเป็นระบบ

1. ยืนยันผลลัพธ์ตัวเลขแต่ละรายการด้วยเครื่องมือ อย่าปล่อยให้เลขคณิตต้องพึ่งพา AI SymPy เครื่องคิดเลขหรือด้วยมือ

2. ตรวจสอบผลลัพธ์เชิงสัญลักษณ์แต่ละรายการด้วย SymPy อินทิกรัล, อนุพันธ์, ลดความซับซ้อน, สมการ—ทั้งหมดสามารถตรวจสอบได้ด้วย SymPy

3. ยืนยันแต่ละทฤษฎีบท/สูตรจากแหล่งที่มา ชื่อและสำนวนถูกต้องหรือไม่? ทฤษฎีบทที่สร้างขึ้นเป็นกับดักที่ร้ายกาจที่สุด

4. ตั้งคำถามทุกเหตุการณ์ในทุกหลักฐาน “นี่เป็นไปตามขั้นตอนที่แล้วจริงๆ เหรอ?” กรณีฐาน สมมติฐานโดยนัย การตรวจสอบช่องว่าง

5. ตรวจสอบและตอบโต้ การดำเนินการผกผัน การทดแทน สถานะขีดจำกัด การวิเคราะห์มิติ

6. นำไปทดสอบสามัญสำนึก ผลลัพธ์สมเหตุสมผลหรือไม่? หากความน่าจะเป็นมากกว่า 1 จะเกิดข้อผิดพลาดหากความยาวเป็นลบ

คำแนะนำ: การทดสอบสามัญสำนึกที่เร็วที่สุดคือการตรวจสอบ "ลำดับความสำคัญ" ผลลัพธ์อยู่ในช่วงที่คาดไว้โดยประมาณหรือไม่ หากค่าเฉลี่ยของชั้นเรียนคือ 250 (เต็ม 100) หรือความน่าจะเป็นคือ 3.5 คุณจะรู้ว่ามีข้อผิดพลาดโดยไม่ต้องดูรายละเอียด การตรวจสอบ 5 วินาทีนี้จะช่วยลดผลลัพธ์ที่ไร้สาระมากมายที่เกิดขึ้นในตา

มินิเคสสามอัน

กรณีที่ 1 — ข้อผิดพลาดของสัญญาณลูกโซ่ นักเรียนคนหนึ่งพบว่าในการทำให้พีชคณิตแบบ 8 บรรทัดง่ายขึ้น มีสัญญาณผิดพลาดที่ AI สร้างขึ้นในบรรทัดที่ 2 แพร่กระจายไปยัง 6 บรรทัดถัดไป ผลลัพธ์สุดท้ายผิดอย่างสิ้นเชิง แต่ AI นำเสนอด้วยความมั่นใจเต็มร้อย เมื่อนักเรียนทำให้ง่ายขึ้นตั้งแต่ต้นด้วย SymPy ผลลัพธ์ที่ถูกต้องก็ได้รับและอนุญาตให้ AI ค้นหาข้อผิดพลาดในบรรทัดที่ 2 ป้ายเดียวข้องแวะ 6 บรรทัด

กรณีที่ 2 — สามัญสำนึกบันทึกการทดสอบ ครูมี AI แก้ปัญหาความน่าจะเป็น ผลลัพธ์คือ 1.4 โดยไม่ได้ดูรายละเอียด ครูบอกว่า "ความน่าจะเป็นต้องไม่มากกว่า 1" และมองหาข้อผิดพลาด: AI ได้รวบรวมเหตุการณ์ที่ไม่ต่อเนื่องราวกับว่าเป็นเหตุการณ์ที่ไม่ต่อเนื่องกัน การทดสอบสามัญสำนึกชี้ให้เห็นข้อผิดพลาดภายในไม่กี่วินาที

กรณีที่ 3 — สูตรที่สร้างขึ้น วิศวกรคนหนึ่งขอให้ AI หา "สูตรปิด" เพื่อหาผลรวมเป็นชุด AI ได้ให้สูตรที่น่าเชื่อถือ วิศวกรทดสอบสูตรด้วยค่าเล็กน้อยที่ n (n=3) ทั้งโดยสูตรและการเติมด้วยมือ ผลลัพธ์ไม่ตรงกัน สูตรถูกสร้างขึ้น การปรับแต่งเล็กน้อยช่วยป้องกันการใช้งานในทางที่ผิดได้หลายชั่วโมง

เทมเพลตที่สามารถคัดลอกได้สี่แบบ

1) คำขอตรวจสอบหลายชั้น:

คุณพบ: [ผลลัพธ์] ตอนนี้ตรวจสอบสามวิธีที่แตกต่างกัน: (1) แฮชมันแบบย้อนกลับ (2) ทดสอบค่าที่กำหนดเองอย่างง่าย (3) โค้ดบางส่วนเพื่อตรวจสอบด้วย SymPy (ฉันจะเห็นผลลัพธ์) บอกฉันว่าทั้งสามวิธีสอดคล้องกันหรือไม่ ถ้าไม่ ให้แสดงว่าขั้นตอนใดมีข้อผิดพลาด

2) การทดสอบสามัญสำนึก/ยศ:

คุณพบ: [ผลลัพธ์] ลองทดสอบสามัญสำนึกเพื่อดูว่าผลลัพธ์นี้สมเหตุสมผลหรือไม่: ลำดับความสำคัญที่คาดหวังคืออะไร เครื่องหมายถูกต้องหรือไม่ มันอยู่ภายในขีดจำกัด (เช่น ความน่าจะเป็น 0-1) หรือไม่ หากไม่สมเหตุสมผลให้ตรวจสอบจุดที่อาจมีข้อผิดพลาด

3) การยืนยันทฤษฎีบท/สูตร:

[ทฤษฎีบท/สูตร] ที่คุณใช้เป็นมาตรฐานและถูกต้องจริงๆ หรือไม่ เขียนนิพจน์และเงื่อนไขมาตรฐาน แสดงบัญชีที่ทดสอบสิ่งนี้ด้วยตัวอย่างเล็กๆ น้อยๆ (เช่น n=3) ถ้าเป็นสูตรแต่งหน้าหรืออะไรไม่แน่ใจก็พูดให้ชัดเจน

4) การวินิจฉัยโหมดข้อผิดพลาด:

ฉันรู้ว่ามีข้อบกพร่องในวิธีแก้ปัญหาด้านล่าง ตรวจสอบประเภทข้อผิดพลาดเหล่านี้ทีละรายการ: เลขคณิต เครื่องหมาย กฎผิด เงื่อนไขที่ข้าม โดเมน บอกฉันว่าเป็นข้อผิดพลาดประเภทใดและขั้นตอนใด วิธีแก้ปัญหา: [ที่นี่]

พรอมต์อ่อน / พรอมต์แรง

อ่อนแอ: "ข้อสรุปนี้ถูกต้องหรือไม่?" [วางผลลัพธ์]
ผลลัพธ์: AI มักจะพูดว่า “ใช่แล้ว” (มีแนวโน้มที่จะยืนยันผลลัพธ์ของตัวเอง); ไม่น่าเชื่อถือเนื่องจากไม่มีการตรวจสอบที่เป็นอิสระ
แข็งแกร่ง: "ตรวจสอบผลลัพธ์นี้ด้วยวิธีอิสระ: ใช้วิธีแก้ไขปัญหาอื่นหรือตรวจสอบด้วยโค้ด SymPy (ฉันจะเรียกใช้โค้ด) อย่าเพิ่งพูดว่า 'จริง/เท็จ' แสดงว่าการตรวจสอบใดที่คุณทำและผลลัพธ์ หากผลรวมตรวจสอบล้มเหลว ให้ค้นหาข้อผิดพลาด"
ผลลัพธ์: วิธีการควบคุมที่เป็นอิสระถูกท้าทาย AI ถูกป้องกันไม่ให้สุ่มสี่สุ่มห้าอนุมัติผลลัพธ์ของตัวเอง

ข้อผิดพลาดทั่วไป

  • การรับ AI เพื่อตรวจสอบผลลัพธ์ของตัวเอง “เรื่องนี้จริงเหรอ?” AI มักจะยืนยันความผิดพลาดของตัวเอง ต้องใช้วิธีอิสระ
  • ข้ามการทดสอบสามัญสำนึก เรื่องไร้สาระ เช่น ความน่าจะเป็นที่มากกว่า 1 และความยาวเป็นลบสามารถจับได้โดยไม่ต้องดูรายละเอียด
  • อาศัยการตรวจสอบเพียงครั้งเดียว ใช้หลายเส้นทางอิสระ (แฮช + SymPy + ค่าที่กำหนดเอง) กับผลลัพธ์ที่สำคัญ
  • ไม่ใช่การทดสอบสูตรด้วยตัวอย่างเล็กๆ สูตรที่สร้างขึ้นจะยุบทันทีด้วยค่าน้อย เช่น n=2, n=3
  • โดยลืมไปว่าแมลงกำลังแพร่กระจาย ข้อผิดพลาดในบรรทัดแรกทำให้ผลลัพธ์ทั้งหมดเสียหาย หากพบข้อผิดพลาดให้ตรวจสอบตั้งแต่ต้น
ข้อควรระวัง: ไม่มีความสัมพันธ์กันระหว่างความมั่นใจของ AI และความแม่นยำ ประโยคที่ดูเหมือนตั้งใจที่สุด คล่องแคล่วที่สุด และ "แน่ใจ" ที่สุด อาจจะผิดโดยสิ้นเชิง เชื่อถือการตรวจสอบโดยอิสระ ไม่ใช่โทนเสียง พิจารณาผลลัพธ์ที่ "จริง" เท่านั้นเมื่อคุณยืนยันด้วยมือหรือด้วยเครื่องมือกำหนด ไม่ใช่เพราะ AI บอกว่า "แน่นอน"

โดยสรุป

AI ทำผิดพลาดในวิชาคณิตศาสตร์ เนื่องจากเป็นโมเดลภาษาที่สร้างข้อความทางสถิติ ไม่ใช่กลไกที่ควบคุมตรรกะ ข้อผิดพลาดแบ่งออกเป็นเจ็ดประเภทหลัก: เลขคณิต เครื่องหมาย ทฤษฎีบทที่สร้างขึ้น การใช้กฎในทางที่ผิด ตัวพิมพ์ละเว้น ช่องว่างการพิสูจน์ ข้อมูลเก่า ในทางคณิตศาสตร์ ข้อผิดพลาดแพร่กระจายและขยายใหญ่ขึ้น ความจริงก็คือเลขฐานสอง ดังนั้นทุกขั้นตอนจึงต้องได้รับการตรวจสอบ ระเบียบวินัยที่เป็นระบบ: ตรวจสอบเครื่องมือตัวเลขทุกอัน ผลลัพธ์เชิงสัญลักษณ์ทุกรายการด้วย SymPy ทุกทฤษฎีบทจากแหล่งที่มา ทุกข้อพิสูจน์ผ่านการตั้งคำถาม ใช้การตรวจสอบ การตรวจสอบย้อนกลับ และการทดสอบสามัญสำนึก ความมั่นใจของ AI ไม่ใช่หลักฐานยืนยันความถูกต้อง

งานสมัคร

เลือกปัญหาที่มีความยาวปานกลาง (อย่างน้อย 6-8 ขั้นตอน) แล้วให้ AI แก้ปัญหา จากนั้นทำการตรวจสอบยืนยันแบบหลายชั้นโดยใช้รูปแบบ 1 และ 4 จากหน่วยนี้: (a) การทดสอบสามัญสำนึก/อันดับ (b) ตรวจสอบด้วย SymPy (c) การทดสอบด้วยค่าพิเศษ จากนั้นทำตามขั้นตอนการแก้ปัญหาทีละบรรทัดด้วย "การล่าแมลง" อย่างตั้งใจ และตรวจสอบว่าข้อผิดพลาดประเภทใดในเจ็ดประเภทที่อาจเกิดขึ้น บันทึกข้อผิดพลาดแต่ละข้อที่คุณพบพร้อมกับประเภทของข้อผิดพลาด

รายการตรวจสอบ

  • [ ] ฉันยืนยันผลลัพธ์ตัวเลขแต่ละรายการด้วยเครื่องมือกำหนด
  • [ ] ฉันตรวจสอบผลลัพธ์เชิงสัญลักษณ์แต่ละรายการด้วย SymPy
  • [ ] ฉันตรวจสอบทฤษฎีบท/สูตรที่ใช้จากแหล่งที่มาหรือด้วยตัวอย่างเล็กๆ น้อยๆ
  • [ ] ฉันใช้สามัญสำนึก/ลำดับของการทดสอบขนาด
  • [ ] ฉันตรวจสอบในลักษณะที่เป็นอิสระ (โดยไม่ต้องอาศัยการอนุมัติของ AI เอง)
  • [ ] เมื่อฉันพบข้อผิดพลาด ฉันได้ตรวจสอบวิธีแก้ปัญหาอีกครั้งตั้งแต่ต้น