zisky:
- Umět rozpoznat, proč umělá inteligence dělá chyby v matematice (je jazykovým modelem, nekontroluje logiku) a sedm hlavních typů chyb
- Schopnost vysvětlit, proč je nezbytné ověřit každý krok pochopením, že chyba se šíří a přesnost je v matematice binární.
- Schopnost aplikovat vícevrstvou ověřovací disciplínu prostřednictvím testování selským rozumem, řádové kontroly, kontrolních součtů, křížové kontroly a nezávislých metod
Tato jednotka prohlubuje myšlenku v jádru modulu: proč a jak AI dělá chyby v matematice, jaké jsou typy těchto chyb a jak je systematicky chytáme? V předchozích dílech jsme viděli metody ověřování pro každé téma; Zde shromažďujeme anatomii chyb pod jednou střechou. Jde o to, že když se podíváte na výstup umělé inteligence, ptáte se: "Co by tady mohlo být za chybu?" Jde o získání ověřovací mentality, která reflexivně myslí.
Připomenutí: Halucinace je, když AI sebevědomě produkuje informace, které ve skutečnosti nejsou pravdivé. V matematice se halucinace často objevují ve formě „přesvědčivé, ale falešné“. Proč AI dělá chyby? Protože se jedná o jazykový model, nikoli o logický stroj – to znamená, že vytváří text se statistickými vzory, nekontroluje logickou platnost kroků. "3místné násobení" a "platný důkaz" jsou pro něj úkolem vytvořit stejný druh textu; Nemá žádný vnitřní mechanismus zaručující přesnost.
Anatomie matematických chyb: sedm typů
Následující seznam typů shrnuje nejčastější chyby, se kterými se ve výstupu AI setkáte, a protijed pro každou z nich.
Typ chyby
Jak to vypadá
protijed
aritmetická chyba
Chyba čísla jako 7×8=54
Kalkulačka/SymPy
chyba podepsat
−(a−b)=−a−b
Otevřete moje jméno ručně
Vymyšlená věta
název neexistující věty
Potvrzení ze zdroje
Nesprávné použití pravidel
Nezapomeňte na pravidlo řetězu
"Jaké pravidlo?" otázka
Stav přeskočeno
Ignorujte záporný kořen
Seznam všech stavů
mezera v důkazu
"Proto" bez odůvodnění
Zpochybňování každého průchodu
Stará/nesprávná data
zastaralé informace
získávání zdrojů
Proč matematice vyžaduje zvláštní pozornost?
Ve většině oblastí má malá chyba malý následek. V matematice se chyba šíří a roste. Chyba znaménka v prvním řádku rovnice způsobí, že dalších deset řádků a konečný výsledek bude úplně špatný. Mezera uprostřed důkazu činí celý důkaz neplatným. Tato „křehkost“ vyžaduje ověřovat každý krok v matematice – „obecně řečeno se zdá pravdivé“ nestačí.
Pravda v matematice je navíc binární: výsledek je buď pravdivý, nebo nepravdivý, nic mezi tím neexistuje. "Osmdesát procent přesné" může být považováno za přijatelné v textovém shrnutí; V integrálu neexistuje nic takového jako „osmdesát procent správně“ – buď je to správný výsledek, nebo není. Tato dvojí povaha činí ověřování kritičtějším a (naštěstí) více možným: výsledek buď ověřením projde, nebo ne.
Krok za krokem: disciplína systematického ověřování
1. Potvrďte každý číselný výsledek pomocí nástroje. Nikdy nenechávejte aritmetiku spoléhat na AI; SymPy, kalkulačkou nebo ručně.
2. Zkontrolujte každý symbolický výsledek pomocí SymPy. Integrál, derivace, zjednodušení, rovnice – to vše lze ověřit pomocí SymPy.
3. Potvrďte každou větu/vzorec ze zdroje. Je název a výraz správný? Vymyšlené teorémy jsou nejzákeřnější pastí.
4. Zpochybňujte každý výskyt v každém důkazu. "Opravdu to vyplývá z předchozího kroku?" Základní případ, implicitní předpoklad, kontrola mezer.
5. Kontrola a protikontrola. Inverzní operace, substituce, mezní stavy, rozměrová analýza.
6. Otestujte to zdravým rozumem. Je výsledek rozumný? Pokud je pravděpodobnost větší než 1, dojde k chybě, pokud je délka záporná.
Tip: Nejrychlejším testem zdravého rozumu je kontrola „řádové velikosti“. Je výsledek zhruba v očekávaném rozmezí? Pokud je průměr třídy 250 (ze 100) nebo pravděpodobnost 3,5, budete vědět, že došlo k chybě, aniž byste se podívali na podrobnosti. Tato 5sekundová kontrola eliminuje mnoho směšných výsledků v zárodku.
tři mini pouzdra
Případ 1 — Chyba ve znaku řetězu. Jeden student zjistil, že při 8řádkovém algebraickém zjednodušení se znaménková chyba, kterou AI udělala na řádku 2, rozšířila na dalších 6 řádků. Konečný výsledek byl zcela chybný, ale AI jej prezentovala s naprostou důvěrou. Když to student zjednodušil od začátku pomocí SymPy, byl získán správný výsledek a umožnil AI najít chybu ve 2. řádku. Jediný znak vyvrátil 6 řádků.
Případ 2 — Test zachránil zdravý rozum. Učitel nechal AI vyřešit problém pravděpodobnosti; Výsledek byl 1.4. Aniž by se učitel podíval na detaily, řekl „pravděpodobnost nemůže být větší než 1“ a hledal chybu: AI shromáždila nediskrétní události, jako by byly diskrétní. Test zdravého rozumu ukázal na chybu během několika sekund.
Případ 3 – Vymyšlený vzorec. Inženýr požádal AI o „uzavřený vzorec“ pro sériový součet. AI poskytla přesvědčivý vzorec. Technik testoval vzorec na malou hodnotu n (n=3) jak vzorcem, tak ručním sčítáním; Výsledky se neshodovaly. Vzorec byl vymyšlen. Drobné úpravy zabránily hodinám zneužití.
Čtyři kopírovatelné šablony
1) Žádost o vícevrstvé ověření:
Našli jste: [výsledek]. Nyní to ověřte TŘI různými způsoby: (1) zpětné hašování, (2) testování jednoduché vlastní hodnoty, (3) nějaký kód ke kontrole pomocí SymPy (uvidím výstup). Řekněte mi, zda jsou všechny tři způsoby konzistentní; Pokud ne, ukažte, který krok obsahuje chybu.
2) Test zdravého rozumu/hodnocení:
Našli jste: [výsledek]. Proveďte test zdravého rozumu, abyste zjistili, zda je tento výsledek ROZUMNÝ: jaká je očekávaná řádová velikost, je znaménko správné, je v mezích (např. pravděpodobnost 0-1)? Pokud to není rozumné, prozkoumejte, kde by mohla být chyba.
3) Potvrzení věty/vzorce:
Je [teorém/vzorec], který používáte, skutečně standardní a správný? Napište jeho standardní výraz a podmínky. Ukažte účet, který to testuje na malém vzorku (např. n=3). Pokud je to vymyšlený vzorec nebo něco, čím si nejste jisti, řekněte to jasně.
4) Diagnostika chybového režimu:
Vím, že v níže uvedeném řešení je chyba. Zkontrolujte tyto typy chyb jeden po druhém: aritmetika, znaménko, nesprávné pravidlo, přeskočená podmínka, doména. Řekněte mi, o jaký typ chyby se jedná a v jakém kroku. Řešení: [zde]
Slabá výzva / Silná výzva
Slabý: "Je tento závěr správný?" [vložte výsledek]
Výsledek: AI často říká „yeah right“ (tendence potvrzovat svůj vlastní výstup); nespolehlivé, protože neexistuje nezávislý audit.
Strong: "ZKONTROLUJTE tento výsledek nezávislým způsobem: použijte jiné řešení nebo zkontrolujte pomocí kódu SymPy (já spustím kód). Neříkejte pouze 'pravda/nepravda'; ukažte, kterou kontrolu jste provedli, a výsledek. Pokud kontrolní součet selže, najděte chybu."
Výsledek: Nezávislá kontrolní metoda je zpochybněna; AI je zabráněno slepě schvalovat svůj vlastní výstup.
Časté chyby
- Přimět AI, aby ověřila svůj vlastní výstup. "Je to pravda?" AI často potvrzuje svou vlastní chybu; Je vyžadována nezávislá metoda.
- Vynechání testu zdravého rozumu. Nesmysly jako pravděpodobnost větší než 1 a záporná délka lze zachytit, aniž byste se podívali na detaily.
- Spoléhání na jediné ověření. U kritických výsledků použijte více nezávislých cest (hash + SymPy + vlastní hodnota).
- Netestovat vzorce s malými vzorky. Vymyšlené vzorce se okamžitě zhroutí při malých hodnotách, jako je n=2, n=3.
- Zapomínání, že se chyba šíří. Chyba v prvním řádku poškodí celý výsledek; Pokud najdete chybu, zkontrolujte ji od začátku.
Upozornění: Mezi spolehlivostí AI a její přesností neexistuje žádná korelace. Věta, která se zdá být nejrozhodnější, nejplynulejší, nejjistější, může být zcela nesprávná. Důvěřujte nezávislému ověření, nikoli tónu. Výsledek považujte za „pravdivý“, pouze když jej potvrdíte ručně nebo pomocí deterministického nástroje – ne proto, že AI říká „jistě“.
V souhrnu
Umělá inteligence dělá chyby v matematice, protože je to jazykový model, který statisticky vytváří text, nikoli motor, který řídí logiku. Chyby spadají do sedmi hlavních typů: aritmetika, znaménko, vytvořená věta, nesprávná aplikace pravidel, vynechaný případ, mezera v důkazu, zastaralá data. V matematice se chyba šíří a roste, pravda je binární – takže každý krok musí být ověřen. Systematická disciplína: ověřte každý numerický nástroj, každý symbolický výsledek pomocí SymPy, každý teorém ze zdroje, každý důkaz projde dotazováním; Aplikujte kontrolu, protikontrolu a testování zdravého rozumu. Důvěra AI není důkazem přesnosti.
Aplikační úkol
Vyberte si problém s řešením střední délky (alespoň 6-8 kroků) a nechte ho vyřešit AI. Poté proveďte vícevrstvé ověření pomocí vzorů 1 a 4 z této jednotky: (a) testování selským rozumem/hodnocení, (b) kontrola pomocí SymPy, (c) testování na speciální hodnotě. Poté procházejte řešení řádek po řádku záměrným okem „hledání na chyby“ a zjistěte, který ze sedmi typů chyb se může vyskytnout. Zaznamenejte každou chybu, kterou najdete, spolu s jejím typem.
kontrolní seznam
- [ ] Každý číselný výsledek jsem potvrdil deterministickým nástrojem.
- [ ] Kontroloval jsem každý symbolický výsledek pomocí SymPy.
- [ ] Použitou větu/vzorec jsem ověřil ze zdroje nebo na malém příkladu.
- [ ] Použil jsem test zdravého rozumu/řádu.
- [ ] Auditoval jsem to nezávislým způsobem (aniž bych se spoléhal na vlastní souhlas AI).
- [ ] Když jsem našel chybu, znovu jsem zkontroloval řešení od začátku.