Yunit 9 / 11

Halucination, Karaniwang Mga Mali sa Matematika, at Disiplina ng Pagpapatunay

Mga nadagdag:

  • Makilala kung bakit nagkakamali ang artificial intelligence sa matematika (pagiging modelo ng wika, hindi sinusuri ang lohika) at ang pitong pangunahing uri ng mga pagkakamali
  • Kakayahang ipaliwanag kung bakit kinakailangang i-verify ang bawat hakbang sa pamamagitan ng pag-unawa na ang error ay pinalaganap at ang katumpakan ay binary sa matematika.
  • Kakayahang maglapat ng multi-layered verification discipline sa pamamagitan ng common sense testing, order of magnitude checking, checksum, cross-checking at mga independiyenteng pamamaraan

Ang yunit na ito ay nagpapalalim sa ideya sa gitna ng modyul: bakit at paano nagkakamali ang AI sa matematika, ano ang mga uri ng mga pagkakamaling ito at paano natin sistematikong nahuhuli ang mga ito? Sa mga nakaraang unit, nakita namin ang mga paraan ng pag-verify para sa bawat paksa; Dito tinitipon namin ang anatomya ng mga pagkakamali sa ilalim ng isang bubong. Ang punto ay, kapag tumingin ka sa isang output ng AI, nagtataka ka "ano ang maaaring maging pagkakamali dito?" Ito ay upang makakuha ng validation mentality na reflexively thinks.

Paalala: ang isang guni-guni ay kapag ang isang AI ay may kumpiyansa na gumagawa ng impormasyon na hindi talaga totoo. Sa matematika, madalas na lumilitaw ang guni-guni sa anyo ng "mapanghikayat ngunit mali." Bakit nagkakamali ang AI? Dahil ito ay isang modelo ng wika, hindi isang makina ng lohika — ibig sabihin, gumagawa ito ng teksto na may mga pattern ng istatistika, hindi nito sinusuri ang lohikal na bisa ng mga hakbang. Ang isang "3-digit multiplication" at isang "valid proof" ay para sa kanya ang gawain ng paggawa ng parehong uri ng teksto; Wala itong panloob na mekanismo upang magarantiya ang katumpakan.

Anatomy ng mga pagkakamali sa matematika: pitong uri

Ang sumusunod na listahan ng mga uri ay nagbubuod sa mga pinakakaraniwang error na makikita mo sa AI output at ang antidote para sa bawat isa.

Uri ng error

Ano ang hitsura nito

panlunas

error sa aritmetika

Error sa numero tulad ng 7×8=54

Calculator/SymPy

error sa pag-sign

−(a−b)=−a−b

Buksan ang aking pangalan nang manu-mano

Ginawang teorama

hindi umiiral na pangalan ng teorama

Kumpirmasyon mula sa pinagmulan

Maling paggamit ng panuntunan

Huwag kalimutan ang panuntunan ng kadena

"Aling panuntunan?" tanong

Nilaktawan ang katayuan

Huwag pansinin ang negatibong ugat

Ilista ang lahat ng katayuan

gap ng patunay

"Samakatuwid" nang walang katwiran

Nagtatanong sa bawat pagpasa

Luma/maling data

hindi napapanahong impormasyon

pinagmumulan

Bakit nangangailangan ng espesyal na atensyon ang matematika?

Sa karamihan ng mga lugar, ang isang maliit na pagkakamali ay may maliit na kahihinatnan. Sa matematika, ang error ay kumakalat at lumalaki. Ang isang sign error sa unang linya ng isang equation ay ginagawang ganap na mali ang susunod na sampung linya at ang huling resulta. Ang isang puwang sa gitna ng isang patunay ay ginagawang hindi wasto ang buong patunay. Dahil sa "pagkarupok" na ito ay kinakailangan na i-verify ang bawat hakbang sa matematika - "sa pangkalahatan ay tila totoo" ay hindi sapat.

Bukod dito, ang katotohanan sa matematika ay binary: ang isang resulta ay tama o mali, walang pagitan. Ang "walumpung porsyentong tumpak" ay maaaring ituring na katanggap-tanggap sa isang buod ng teksto; Walang bagay na "walumpung porsyentong tama" sa isang integral—ito man ang tamang resulta o hindi. Ang dalawahang katangiang ito ay ginagawang mas kritikal ang pag-verify at (sa kabutihang palad) mas posible: ang resulta ay pumasa sa pag-verify o hindi.

Hakbang-hakbang: ang disiplina ng sistematikong pag-verify

1. Kumpirmahin ang bawat numerical na resulta gamit ang isang tool. Huwag kailanman iwanan ang aritmetika upang umasa sa AI; SymPy, calculator o sa pamamagitan ng kamay.

2. Suriin ang bawat simbolikong resulta gamit ang SymPy. Integral, derivative, simplify, equation—lahat ay mabe-verify gamit ang SymPy.

3. Kumpirmahin ang bawat teorama/pormula mula sa pinagmulan. Tama ba ang pangalan at ekspresyon? Ang mga gawa-gawang theorems ay ang pinaka mapanlinlang na bitag.

4. Tanungin ang bawat pangyayari sa bawat patunay. "Talaga bang sumusunod ito sa nakaraang hakbang?" Base case, implicit assumption, gap check.

5. Suriin at i-countercheck. Baliktad na operasyon, pagpapalit, mga estado ng limitasyon, pagsusuri ng dimensyon.

6. Ilagay ito sa pagsusulit sa sentido komun. Makatwiran ba ang resulta? Kung ang isang probabilidad ay mas malaki kaysa sa 1, mayroong isang error kung ang isang haba ay negatibo.

Hint: Ang pinakamabilis na pagsusulit sa sentido komun ay ang "order of magnitude" check. Ang resulta ba ay halos nasa loob ng inaasahang hanay? Kung ang average ng klase ay 250 (mula sa 100), o ang probabilidad ay 3.5, malalaman mong may error nang hindi tinitingnan ang mga detalye. Ang 5-segundong pagsusuri na ito ay nag-aalis ng maraming katawa-tawang resulta sa pag-usbong.

tatlong mini case

Case 1 — Error sa chain sign. Nalaman ng isang mag-aaral na sa isang 8-line na algebraic simplification, isang sign error na ginawa ng AI sa line 2 ay pinalaganap sa susunod na 6 na linya. Ang huling resulta ay ganap na mali, ngunit ipinakita ito ng AI nang may kumpletong kumpiyansa. Kapag pinasimple ito ng mag-aaral mula sa simula gamit ang SymPy, nakuha ang tamang resulta at pinahintulutan ang AI na mahanap ang error sa 2nd line. Ang isang solong senyas ay pinabulaanan ang 6 na linya.

Kaso 2 — Nailigtas ng sentido komun ang pagsubok. Ang isang guro ay may AI na lumutas ng probabilidad na problema; Ang resulta ay 1.4. Nang hindi tinitingnan ang mga detalye, sinabi ng guro na "ang posibilidad ay hindi maaaring mas malaki kaysa sa 1" at hinanap ang error: ang AI ay nakolekta ang mga hindi discrete na kaganapan na parang discrete. Itinuro ng isang common sense test ang error sa loob ng ilang segundo.

Case 3 — Made-up na formula. Hiniling ng isang inhinyero ang AI para sa isang "closed formula" para sa isang serye ng kabuuan. Nagbigay ang AI ng isang nakakumbinsi na formula. Sinubukan ng inhinyero ang formula para sa isang maliit na halaga ng n (n=3) kapwa sa pamamagitan ng formula at sa pamamagitan ng pagdaragdag ng kamay; Hindi tumugma ang mga resulta. Ang formula ay ginawa. Napigilan ng kaunting pagsasaayos ang mga oras ng maling paggamit.

Apat na maaaring kopyahin na mga template

1) Kahilingan sa multi-layer na pag-verify:

Natagpuan mo ang: [resulta]. Ngayon i-verify ang TATLONG iba't ibang paraan: (1) pag-hash nito nang baligtad, (2) pagsubok ng isang simpleng custom na halaga, (3) ilang code upang suriin sa SymPy (makikita ko ang output). Sabihin sa akin kung ang lahat ng tatlong paraan ay pare-pareho; Kung hindi, ipakita kung aling hakbang ang may error.

2) Common sense/ranggo na pagsubok:

Natagpuan mo ang: [resulta]. Ilagay ito sa pagsusulit sa sentido komun upang makita kung makatwiran ang resultang ito: ano ang inaasahang pagkakasunud-sunod ng magnitude, tama ba ang senyales, nasa loob ba ito ng mga limitasyon (hal. probabilidad 0-1)? Kung hindi ito makatwiran, siyasatin kung saan maaaring magkamali.

3) Theorem/formula confirmation:

Talaga bang pamantayan at tama ang [theorem/formula] na ginagamit mo? Isulat ang karaniwang ekspresyon at kundisyon nito. Magpakita ng account na sumusubok dito gamit ang isang maliit na sample (hal. n=3). Kung ito ay isang gawa-gawang formula o isang bagay na hindi ka sigurado, sabihin ito nang malinaw.

4) Diagnosis ng error mode:

Alam kong mayroong isang bug sa solusyon sa ibaba. Isa-isang suriin ang mga uri ng error na ito: arithmetic, sign, maling panuntunan, nilaktawan na kundisyon, domain. Sabihin sa akin kung anong uri ng error ito at sa anong hakbang. Solusyon: [dito]

Mahinang prompt / Malakas na prompt

Mahina: "Tama ba ang konklusyong ito?" [idikit ang resulta]
Resulta: Madalas na sinasabi ng AI na "oo tama" (hilig na kumpirmahin ang sarili nitong output); hindi mapagkakatiwalaan dahil walang independent audit.
Strong: "SURIIN ang resultang ito sa isang malayang paraan: gumamit ng ibang workaround o suriin gamit ang SymPy code (patakbuhin ko ang code). Huwag lang sabihin ang 'true/false'; ipakita kung aling pagsusuri ang ginawa mo at ang resulta. Kung nabigo ang checksum, hanapin ang error."
Resulta: Hinamon ang isang malayang paraan ng pagkontrol; Ang AI ay pinipigilan na bulag na aprubahan ang sarili nitong output.

Mga karaniwang pagkakamali

  • Pagkuha ng AI na patunayan ang sarili nitong output. "Totoo ba ito?" Madalas na kinukumpirma ng AI ang sarili nitong pagkakamali; Kinakailangan ang independiyenteng pamamaraan.
  • Nilaktawan ang pagsusulit sa sentido komun. Ang katarantaduhan tulad ng posibilidad na higit sa 1 at ang haba ng pagiging negatibo ay maaaring makuha nang hindi tinitingnan ang mga detalye.
  • Umaasa sa isang pag-verify. Gumamit ng maraming independiyenteng landas (hashes + SymPy + custom na halaga) sa mga kritikal na resulta.
  • Hindi sinusubukan ang mga formula na may maliliit na sample. Ang mga ginawang formula ay agad na bumagsak sa maliliit na halaga gaya ng n=2, n=3.
  • Nakakalimutan na ang bug ay pinalaganap. Ang isang error sa unang linya ay sumisira sa buong resulta; Kung makakita ka ng error, suriin ito mula sa simula.
Babala: Walang ugnayan sa pagitan ng kumpiyansa ng AI at katumpakan nito. Ang pangungusap na tila ang pinaka-determinado, ang pinaka matatas, ang pinaka "sigurado" ay maaaring maging ganap na mali. Magtiwala sa independiyenteng pag-verify, hindi sa tono. Isaalang-alang lamang ang isang resulta na "totoo" kapag kinumpirma mo ito sa pamamagitan ng kamay o gamit ang isang deterministikong tool - hindi dahil ang AI ​​ay nagsasabing "sigurado."

Sa buod

Ang AI ay nagkakamali sa matematika dahil ito ay isang modelo ng wika na gumagawa ng teksto ayon sa istatistika, hindi isang makina na kumokontrol sa lohika. Ang mga error ay nahahati sa pitong pangunahing uri: arithmetic, sign, made-up theorem, maling paggamit ng panuntunan, inalis na case, proof gap, stale data. Sa matematika, ang error ay kumakalat at lumalaki, ang katotohanan ay binary — kaya bawat hakbang ay dapat ma-verify. Systematic na disiplina: i-verify ang bawat numerical na tool, bawat simbolikong resulta gamit ang SymPy, bawat theorem mula sa source, bawat proof pass sa pamamagitan ng pagtatanong; Mag-apply ng check, counter-check at common sense testing. Ang kumpiyansa ng AI ay hindi katibayan ng katumpakan.

Gawain ng aplikasyon

Pumili ng problema na may solusyon na katamtaman ang haba (hindi bababa sa 6-8 na hakbang) at ipalutas ito sa AI. Pagkatapos ay gawin ang multi-layer na pag-verify gamit ang pattern 1 at 4 mula sa unit na ito: (a) common sense/rank testing, (b) checking gamit ang SymPy, (c) testing sa isang espesyal na value. Pagkatapos ay dumaan sa solusyon sa linya sa pamamagitan ng linya na may sinadyang "pangangaso ng bug" at tingnan kung alin sa pitong uri ng mga error ang maaaring mangyari. Itala ang bawat error na makikita mo kasama ang uri nito.

checklist

  • [ ] Kinumpirma ko ang bawat numerical na resulta gamit ang isang deterministic na tool.
  • [ ] Sinuri ko ang bawat simbolikong resulta gamit ang SymPy.
  • [ ] Na-verify ko ang theorem/formula na ginamit mula sa pinagmulan o sa maliit na halimbawa.
  • [ ] Inilapat ko ang common sense/order of magnitude test.
  • [ ] Sinuri ko ito sa isang malayang paraan (nang hindi umaasa sa sariling pag-apruba ng AI).
  • [ ] Kapag nakakita ako ng error, muli kong sinuri ang solusyon mula sa simula.