Unit 9 / 11

Halusinasi, Kesilapan Biasa Matematik, dan Disiplin Pengesahan

Keuntungan:

  • Dapat mengenali sebab kecerdasan buatan membuat kesilapan dalam matematik (menjadi model bahasa, bukan menyemak logik) dan tujuh jenis ralat utama
  • Keupayaan untuk menerangkan mengapa penting untuk mengesahkan setiap langkah dengan memahami bahawa ralat disebarkan dan ketepatan adalah binari dalam matematik.
  • Keupayaan untuk menerapkan disiplin pengesahan berbilang lapisan melalui ujian akal, semakan tertib magnitud, semakan, semakan silang dan kaedah bebas

Unit ini memperdalam idea di tengah-tengah modul: mengapa dan bagaimana AI membuat kesilapan dalam matematik, apakah jenis kesilapan ini dan bagaimana kita menangkapnya secara sistematik? Dalam unit sebelumnya, kami telah melihat kaedah pengesahan untuk setiap topik; Di sini kami mengumpulkan anatomi kesilapan di bawah satu bumbung. Intinya ialah, apabila anda melihat output AI, anda tertanya-tanya "apa yang boleh menjadi kesilapan di sini?" Ia adalah untuk mendapatkan mentaliti pengesahan yang berfikir secara refleks.

Peringatan: halusinasi ialah apabila AI dengan yakin menghasilkan maklumat yang sebenarnya tidak benar. Dalam matematik, halusinasi sering muncul dalam bentuk "persuasif tetapi palsu." Mengapa AI membuat kesilapan? Kerana ia adalah model bahasa, bukan enjin logik — iaitu, ia menghasilkan teks dengan corak statistik, ia tidak menyemak kesahihan logik langkah. "Pendaraban 3 digit" dan "bukti yang sah" adalah baginya tugas untuk menghasilkan jenis teks yang sama; Ia tidak mempunyai mekanisme dalaman untuk menjamin ketepatan.

Anatomi kesilapan matematik: tujuh jenis

Senarai jenis berikut meringkaskan ralat paling biasa yang anda akan hadapi dalam output AI dan penawar untuk setiap ralat.

Jenis ralat

Macam mana rupanya

penawar

ralat aritmetik

Ralat nombor seperti 7×8=54

Kalkulator/SymPy

ralat tanda

−(a−b)=−a−b

Buka nama saya secara manual

Teorem yang dibuat-buat

nama teorem yang tidak wujud

Pengesahan daripada sumber

Salah guna peraturan

Jangan lupa peraturan rantai

"Peraturan yang mana?" soalan

Status dilangkau

Abaikan akar negatif

Senaraikan semua status

jurang pembuktian

"Oleh itu" tanpa alasan

Menyoal setiap pas

Data lama/salah

maklumat lapuk

penyumberan

Mengapakah matematik memerlukan perhatian khusus?

Dalam kebanyakan kawasan, kesilapan kecil mempunyai akibat yang kecil. Dalam matematik, kesilapan merebak dan berkembang. Ralat tanda dalam baris pertama persamaan menjadikan sepuluh baris seterusnya dan keputusan akhir benar-benar salah. Jurang di tengah-tengah bukti menjadikan keseluruhan bukti tidak sah. "Kerapuhan" ini menjadikannya perlu untuk mengesahkan setiap langkah dalam matematik - "secara umumnya nampaknya benar" tidak mencukupi.

Lebih-lebih lagi, kebenaran dalam matematik adalah binari: hasilnya sama ada benar atau salah, tiada di antaranya. "Tepat lapan puluh peratus" boleh dianggap boleh diterima dalam ringkasan teks; Tiada perkara seperti "lapan puluh peratus betul" dalam kamiran—sama ada hasil yang betul atau tidak. Sifat dwi ini menjadikan pengesahan lebih kritikal dan (mujurlah) lebih mungkin: hasilnya sama ada melepasi pengesahan atau tidak.

Langkah demi langkah: disiplin pengesahan sistematik

1. Sahkan setiap hasil berangka dengan alat. Jangan sekali-kali meninggalkan aritmetik untuk bergantung pada AI; SymPy, kalkulator atau dengan tangan.

2. Semak setiap hasil simbolik dengan SymPy. Kamiran, terbitan, permudahkan, persamaan—semuanya boleh disahkan dengan SymPy.

3. Sahkan setiap teorem/rumus daripada sumber. Adakah nama dan ungkapan itu betul? Teorem yang dibuat-buat adalah perangkap yang paling berbahaya.

4. Persoalkan setiap kejadian dalam setiap bukti. "Adakah ini benar-benar mengikuti dari langkah sebelumnya?" Kes asas, andaian tersirat, semakan jurang.

5. Semak dan semak balas. Operasi songsang, penggantian, keadaan had, analisis dimensi.

6. Letakkannya kepada ujian akal. Adakah hasilnya munasabah? Jika kebarangkalian lebih besar daripada 1, terdapat ralat jika panjang adalah negatif.

Petunjuk: Ujian akal terpantas ialah semakan "tertib magnitud". Adakah hasilnya kira-kira dalam julat yang dijangkakan? Jika purata kelas ialah 250 (daripada 100), atau kebarangkalian ialah 3.5, anda akan tahu terdapat ralat tanpa melihat butirannya. Pemeriksaan 5 saat ini menghapuskan banyak keputusan yang tidak masuk akal dalam tunas.

tiga kes mini

Kes 1 — Ralat tanda rantai. Seorang pelajar mendapati bahawa dalam penyederhanaan algebra 8 baris, ralat tanda yang dibuat oleh AI dalam baris 2 merambat ke 6 baris seterusnya. Keputusan akhir adalah salah sama sekali, tetapi AI membentangkannya dengan penuh keyakinan. Apabila pelajar memudahkannya dari awal dengan SymPy, hasil yang betul diperoleh dan membolehkan AI mencari ralat dalam baris ke-2. Satu tanda menafikan 6 baris.

Kes 2 — Akal sehat menyelamatkan ujian. Seorang guru mempunyai AI menyelesaikan masalah kebarangkalian; Hasilnya ialah 1.4. Tanpa melihat butiran, guru berkata "kebarangkalian tidak boleh lebih daripada 1" dan mencari ralat: AI telah mengumpul peristiwa bukan diskret seolah-olah ia adalah diskret. Ujian akal menunjukkan ralat dalam beberapa saat.

Kes 3 — Formula buatan. Seorang jurutera meminta AI untuk "formula tertutup" untuk jumlah siri. AI telah memberikan formula yang meyakinkan. Jurutera menguji formula untuk nilai kecil n (n=3) dengan formula dan penambahan tangan; Keputusan tidak sepadan. Formula itu dibuat-buat. Sedikit pengubahsuaian menghalang penyalahgunaan berjam-jam.

Empat templat yang boleh disalin

1) Permintaan pengesahan berbilang lapisan:

Anda menemui: [hasil]. Sekarang sahkan TIGA cara berbeza ini: (1) pencincangan secara terbalik, (2) menguji nilai tersuai yang mudah, (3) beberapa kod untuk menyemak dengan SymPy (saya akan melihat output). Beritahu saya jika ketiga-tiga cara adalah konsisten; Jika tidak, tunjukkan langkah yang mempunyai ralat.

2) Ujian akal/pangkat:

Anda menemui: [hasil]. Letakkannya pada ujian akal sehat untuk melihat sama ada keputusan ini MASALAH: apakah susunan magnitud yang dijangkakan, adakah tanda itu betul, adakah ia dalam had (cth. kebarangkalian 0-1)? Jika tidak munasabah, siasat di mana mungkin terdapat kesilapan.

3) Pengesahan teorem/rumus:

Adakah [teorem/rumus] yang anda gunakan benar-benar standard dan betul? Tulis ungkapan dan syarat piawainya. Tunjukkan akaun yang menguji ini dengan sampel kecil (mis. n=3). Jika ia adalah formula rekaan atau sesuatu yang anda tidak pasti, nyatakan dengan jelas.

4) Diagnosis mod ralat:

Saya tahu terdapat pepijat dalam penyelesaian di bawah. Semak jenis ralat ini satu persatu: aritmetik, tanda, peraturan salah, syarat langkau, domain. Beritahu saya jenis ralat itu dan pada langkah mana. Penyelesaian: [di sini]

Gesaan lemah / Gesaan kuat

Lemah: "Adakah kesimpulan ini betul?" [tampalkan hasilnya]
Keputusan: AI sering berkata "ya betul" (kecenderungan untuk mengesahkan outputnya sendiri); tidak boleh dipercayai kerana tiada audit bebas.
Kuat: "SEMAK hasil ini dengan cara bebas: gunakan penyelesaian yang berbeza atau semak dengan kod SymPy (saya akan menjalankan kod). Jangan hanya sebut 'benar/salah'; tunjukkan pemeriksaan yang anda lakukan dan hasilnya. Jika jumlah semak gagal, cari ralat."
Keputusan: Kaedah kawalan bebas dicabar; AI dihalang daripada meluluskan keluarannya sendiri secara membuta tuli.

Kesilapan biasa

  • Mendapatkan AI untuk mengesahkan outputnya sendiri. "Adakah ini benar?" AI sering mengesahkan kesilapannya sendiri; Kaedah bebas diperlukan.
  • Melangkau ujian akal. Karut seperti kebarangkalian lebih daripada 1 dan panjang negatif boleh ditangkap tanpa melihat butirannya.
  • Bergantung pada satu pengesahan. Gunakan berbilang laluan bebas (cincang + SymPy + nilai tersuai) pada hasil kritikal.
  • Tidak menguji formula dengan sampel kecil. Formula buatan runtuh serta-merta pada nilai kecil seperti n=2, n=3.
  • Terlupa bahawa pepijat itu disebarkan. Ralat dalam baris pertama merosakkan keseluruhan hasil; Jika anda mendapati ralat, semaknya dari awal.
Awas: Tiada korelasi antara keyakinan AI dan ketepatannya. Ayat yang nampaknya paling tegas, paling fasih, paling "pasti" mungkin salah sama sekali. Percayai pengesahan bebas, bukan nada. Hanya pertimbangkan keputusan "benar" apabila anda mengesahkannya dengan tangan atau dengan alat penentu - bukan kerana AI mengatakan "pasti."

Secara ringkasnya

AI membuat kesilapan dalam matematik kerana ia adalah model bahasa yang secara statistik menghasilkan teks, bukan enjin yang mengawal logik. Ralat terbahagi kepada tujuh jenis utama: aritmetik, tanda, teorem yang dibuat, salah guna peraturan, kes tertinggal, jurang pembuktian, data basi. Dalam matematik, ralat merebak dan berkembang, kebenaran adalah binari — jadi setiap langkah mesti disahkan. Disiplin sistematik: sahkan setiap alat berangka, setiap hasil simbolik dengan SymPy, setiap teorem daripada sumber, setiap bukti lulus dengan menyoal; Gunakan semakan, semakan balas dan ujian akal. Keyakinan AI bukanlah bukti ketepatan.

Tugasan permohonan

Pilih masalah dengan penyelesaian sederhana panjang (sekurang-kurangnya 6-8 langkah) dan minta AI menyelesaikannya. Kemudian lakukan pengesahan berbilang lapisan menggunakan pola 1 dan 4 daripada unit ini: (a) ujian akal/pangkat, (b) semak dengan SymPy, (c) ujian pada nilai istimewa. Kemudian pergi melalui penyelesaian baris demi baris dengan mata "memburu pepijat" yang disengajakan dan semak yang mana antara tujuh jenis ralat mungkin berlaku. Catatkan setiap ralat yang anda temui bersama-sama dengan jenisnya.

senarai semak

  • [ ] Saya mengesahkan setiap keputusan berangka dengan alat penentu.
  • [ ] Saya menyemak setiap hasil simbolik dengan SymPy.
  • [ ] Saya mengesahkan teorem/rumus yang digunakan daripada sumber atau dengan contoh kecil.
  • [ ] Saya menggunakan ujian akal/tertib magnitud.
  • [ ] Saya mengauditnya secara bebas (tanpa bergantung pada kelulusan AI sendiri).
  • [ ] Apabila saya menemui ralat, saya menyemak semula penyelesaian dari awal.