zisky:
- Byť schopný rozpoznať, prečo umelá inteligencia robí chyby v matematike (byť jazykovým modelom, nekontrolovať logiku) a sedem hlavných typov chýb
- Schopnosť vysvetliť, prečo je nevyhnutné overiť každý krok pochopením, že chyba sa šíri a presnosť je v matematike binárna.
- Schopnosť aplikovať viacvrstvovú overovaciu disciplínu prostredníctvom testovania zdravého rozumu, rádovej kontroly, kontrolných súčtov, krížovej kontroly a nezávislých metód
Táto časť prehlbuje myšlienku v jadre modulu: prečo a ako robí AI chyby v matematike, aké sú typy týchto chýb a ako ich systematicky zachytávame? V predchádzajúcich častiach sme videli metódy overovania pre každú tému; Tu zhromažďujeme anatómiu chýb pod jednou strechou. Ide o to, že keď sa pozriete na výstup AI, pýtate sa: „Čo tu môže byť chyba?“ Ide o získanie overovacej mentality, ktorá reflexívne uvažuje.
Pripomienka: Halucinácia je, keď AI s istotou produkuje informácie, ktoré v skutočnosti nie sú pravdivé. V matematike sa halucinácie často objavujú vo forme „presvedčivé, ale falošné“. Prečo robí AI chyby? Pretože ide o jazykový model, nie o logický nástroj – to znamená, že vytvára text so štatistickými vzormi, nekontroluje logickú platnosť krokov. "3-miestne násobenie" a "platný dôkaz" sú pre neho úlohou vytvoriť rovnaký druh textu; Nemá žiadny vnútorný mechanizmus zaručujúci presnosť.
Anatómia matematických chýb: sedem typov
Nasledujúci zoznam typov sumarizuje najčastejšie chyby, s ktorými sa pri výstupe AI stretnete, a protijed pre každú z nich.
Typ chyby
Ako to vyzerá
protijed
aritmetická chyba
Chyba čísla, napríklad 7×8=54
Kalkulačka/SymPy
chyba znamienka
−(a−b)=−a−b
Manuálne otvorte moje meno
Vymyslená veta
neexistujúci názov vety
Potvrdenie zo zdroja
Nesprávne uplatňovanie pravidiel
Nezabudnite na pravidlo reťaze
"Aké pravidlo?" otázka
Stav vynechaný
Ignorujte záporný koreň
Zoznam všetkých stavov
medzera v dôkaze
"Preto" bez opodstatnenia
Spochybňovanie každého prechodu
Staré/nesprávne údaje
zastarané informácie
získavanie zdrojov
Prečo si matematika vyžaduje osobitnú pozornosť?
Vo väčšine oblastí má malá chyba malý následok. V matematike sa chyba šíri a rastie. Chyba znamienka v prvom riadku rovnice spôsobuje, že ďalších desať riadkov a konečný výsledok sú úplne nesprávne. Medzera v strede dôkazu robí celý dôkaz neplatným. Táto „krehkosť“ si vyžaduje overenie každého kroku v matematike – „vo všeobecnosti sa zdá byť pravdivé“ nestačí.
Pravda v matematike je navyše binárna: výsledok je buď pravdivý alebo nepravdivý, nič medzi tým neexistuje. "Osemdesiat percent presné" možno považovať za prijateľné v textovom zhrnutí; V integráli neexistuje nič také ako „na osemdesiat percent správne“ – buď je to správny výsledok, alebo nie. Táto dvojaká povaha robí overovanie kritickejším a (našťastie) aj možným: výsledok buď overením prejde, alebo neprejde.
Krok za krokom: disciplína systematického overovania
1. Potvrďte každý číselný výsledok pomocou nástroja. Nikdy neopúšťajte aritmetiku a spoliehajte sa na AI; SymPy, kalkulačkou alebo ručne.
2. Skontrolujte každý symbolický výsledok pomocou SymPy. Integrál, derivácia, zjednodušenie, rovnica – to všetko je možné overiť pomocou SymPy.
3. Potvrďte každú vetu/vzorec zo zdroja. Je názov a výraz správny? Vymyslené vety sú najzákernejšou pascou.
4. Spochybňujte každý výskyt v každom dôkaze. "Naozaj to vyplýva z predchádzajúceho kroku?" Základný prípad, implicitný predpoklad, kontrola medzier.
5. Kontrola a protikontrola. Inverzná operácia, substitúcia, medzné stavy, rozmerová analýza.
6. Dajte to na test zdravého rozumu. Je výsledok primeraný? Ak je pravdepodobnosť väčšia ako 1, nastáva chyba, ak je dĺžka záporná.
Tip: Najrýchlejším testom zdravého rozumu je kontrola „poradia“. Je výsledok približne v očakávanom rozsahu? Ak je priemer triedy 250 (zo 100) alebo pravdepodobnosť 3,5, budete vedieť, že ide o chybu, bez toho, aby ste sa pozreli na detaily. Táto 5-sekundová kontrola eliminuje veľa smiešnych výsledkov v zárodku.
tri mini prípady
Prípad 1 – Chyba reťaze. Jeden študent zistil, že pri 8-riadkovom algebraickom zjednodušení sa chyba znamienka, ktorú AI urobila v riadku 2, rozšírila na ďalších 6 riadkov. Konečný výsledok bol úplne nesprávny, ale AI ho prezentovala s úplnou dôverou. Keď to študent od začiatku zjednodušil pomocou SymPy, získal sa správny výsledok a umožnil AI nájsť chybu v 2. riadku. Jediný znak vyvrátil 6 riadkov.
Prípad 2 – Zdravý rozum zachránil test. Učiteľ mal AI vyriešiť problém pravdepodobnosti; Výsledok bol 1,4. Bez toho, aby sa pozrel na detaily, učiteľ povedal, že „pravdepodobnosť nemôže byť väčšia ako 1“ a hľadal chybu: AI zozbierala nediskrétne udalosti, ako keby boli diskrétne. Test zdravého rozumu poukázal na chybu v priebehu niekoľkých sekúnd.
Prípad 3 – Vymyslený vzorec. Inžinier požiadal AI o „uzavretý vzorec“ pre súčet série. AI poskytla presvedčivý vzorec. Inžinier testoval vzorec na malú hodnotu n (n=3) pomocou vzorca aj ručným sčítaním; Výsledky sa nezhodovali. Vzorec bol vymyslený. Malé úpravy zabránili hodinám nesprávneho používania.
Štyri kopírovateľné šablóny
1) Žiadosť o viacvrstvové overenie:
Našli ste: [výsledok]. Teraz si to overte TRI rôznymi spôsobmi: (1) opačne hašovanie, (2) testovanie jednoduchej vlastnej hodnoty, (3) nejaký kód na kontrolu pomocou SymPy (uvidím výstup). Povedzte mi, či sú všetky tri spôsoby konzistentné; Ak nie, ukážte, ktorý krok obsahuje chybu.
2) Test zdravého rozumu/hodnotenia:
Našli ste: [výsledok]. Otestujte ho zdravým rozumom, aby ste zistili, či je tento výsledok PRIMERANÝ: aká je očakávaná rádová veľkosť, je znamienko správne, je v medziach (napr. pravdepodobnosť 0 – 1)? Ak to nie je rozumné, zistite, kde by mohla byť chyba.
3) Potvrdenie vety/vzorca:
Je [teorém/vzorec], ktorý používate, skutočne štandardný a správny? Napíšte jeho štandardné vyjadrenie a podmienky. Ukážte účet, ktorý to testuje na malej vzorke (napr. n=3). Ak je to vymyslený vzorec alebo niečo, čím si nie ste istý, povedzte to jasne.
4) Diagnostika chybového režimu:
Viem, že v nižšie uvedenom riešení je chyba. Skontrolujte tieto typy chýb jeden po druhom: aritmetika, znamienko, nesprávne pravidlo, preskočená podmienka, doména. Povedzte mi, o aký typ chyby ide a v ktorom kroku. Riešenie: [tu]
Slabá výzva / Silná výzva
Slabý: "Je tento záver správny?" [prilepiť výsledok]
Výsledok: AI často hovorí „áno správne“ (s tendenciou potvrdzovať svoj vlastný výstup); nespoľahlivé, pretože neexistuje nezávislý audit.
Strong: "SKONTROLOVAŤ tento výsledok nezávislým spôsobom: použite iné riešenie alebo skontrolujte pomocou kódu SymPy (ja spustím kód). Nehovorte len ‚pravda/nepravda'; ukážte, ktorú kontrolu ste vykonali a výsledok. Ak kontrolný súčet zlyhá, nájdite chybu."
Výsledok: Nezávislá metóda kontroly je spochybnená; Umelá inteligencia nemôže slepo schvaľovať svoj vlastný výstup.
Časté chyby
- Prinútite AI overiť svoj vlastný výstup. "Je to pravda?" AI často potvrdzuje svoju vlastnú chybu; Vyžaduje sa nezávislá metóda.
- Preskočenie testu zdravého rozumu. Nezmysel, ako je pravdepodobnosť väčšia ako 1 a záporná dĺžka, možno zachytiť bez toho, aby ste sa pozreli na detaily.
- Spoliehanie sa na jediné overenie. Pri kritických výsledkoch použite viacero nezávislých ciest (hash + SymPy + vlastná hodnota).
- Netestovať vzorce s malými vzorkami. Vymyslené vzorce sa okamžite zrútia pri malých hodnotách, ako sú n=2, n=3.
- Zabúdame na to, že sa chyba šíri. Chyba v prvom riadku poškodí celý výsledok; Ak nájdete chybu, skontrolujte ju od začiatku.
Upozornenie: Medzi spoľahlivosťou AI a jej presnosťou neexistuje žiadna korelácia. Veta, ktorá sa javí ako najrozhodnejšia, najplynulejšia, najistejšia, môže byť úplne nesprávna. Dôverujte nezávislému overeniu, nie tónu. Výsledok považujte za „pravdivý“ iba vtedy, keď ho potvrdíte ručne alebo pomocou deterministického nástroja – nie preto, že AI hovorí „iste“.
V súhrne
AI robí chyby v matematike, pretože je to jazykový model, ktorý štatisticky vytvára text, nie motor, ktorý riadi logiku. Chyby spadajú do siedmich hlavných typov: aritmetika, znamienko, vymyslená veta, nesprávne použitie pravidiel, vynechaný prípad, medzera v dôkaze, neaktuálne údaje. V matematike sa chyba šíri a rastie, pravda je binárna – takže každý krok musí byť overený. Systematická disciplína: overiť každý numerický nástroj, každý symbolický výsledok pomocou SymPy, každú vetu zo zdroja, každý dôkaz prejsť otázkou; Aplikujte kontrolu, protikontrolu a testovanie zdravého rozumu. Dôvera AI nie je dôkazom presnosti.
Aplikačná úloha
Vyberte si problém s riešením strednej dĺžky (aspoň 6-8 krokov) a nechajte ho vyriešiť AI. Potom vykonajte viacvrstvové overenie pomocou vzorov 1 a 4 z tejto jednotky: (a) testovanie zdravého rozumu/hodnotenia, (b) kontrola pomocou SymPy, (c) testovanie na špeciálnej hodnote. Potom prechádzajte riešením riadok po riadku zámerným okom na „hon na chyby“ a skontrolujte, ktorý zo siedmich typov chýb sa môže vyskytnúť. Zaznamenajte každú chybu, ktorú nájdete, spolu s jej typom.
kontrolný zoznam
- [ ] Každý číselný výsledok som potvrdil deterministickým nástrojom.
- [ ] Každý symbolický výsledok som skontroloval pomocou SymPy.
- [ ] Použitý teorém/vzorec som overil zo zdroja alebo na malom príklade.
- [ ] Použil som test zdravého rozumu/radu.
- [ ] Auditoval som to nezávislým spôsobom (bez spoliehania sa na vlastný súhlas AI).
- [ ] Keď som našiel chybu, znova som skontroloval riešenie od začiatku.