Dobici:
- Biti u stanju prepoznati zašto umjetna inteligencija griješi u matematici (jer je jezični model, ne provjerava logiku) i sedam glavnih vrsta pogrešaka
- Sposobnost objašnjenja zašto je neophodno provjeriti svaki korak razumijevanjem da se pogreška širi i da je točnost u matematici binarna.
- Sposobnost primjene višeslojne discipline verifikacije kroz testiranje zdravog razuma, provjeru reda veličine, kontrolne zbrojeve, unakrsnu provjeru i neovisne metode
Ova jedinica produbljuje ideju u središtu modula: zašto i kako umjetna inteligencija čini pogreške u matematici, koje su vrste tih pogrešaka i kako ih sustavno otkrivamo? U prethodnim jedinicama vidjeli smo metode provjere za svaku temu; Ovdje okupljamo anatomiju pogrešaka pod jednim krovom. Poanta je u tome da se kada pogledate AI izlaz pitate "što bi ovdje mogla biti pogreška?" To je steći mentalitet potvrđivanja koji refleksivno razmišlja.
Podsjetnik: halucinacija je kada umjetna inteligencija samouvjereno proizvodi informacije koje zapravo nisu istinite. U matematici se halucinacija često pojavljuje u obliku "uvjerljivo, ali lažno". Zašto umjetna inteligencija griješi? Budući da je to jezični model, a ne logički mehanizam — to jest, proizvodi tekst sa statističkim uzorcima, ne provjerava logičku valjanost koraka. "Troznamenkasto množenje" i "valjani dokaz" za njega su zadatak stvaranja iste vrste teksta; Nema unutarnji mehanizam koji bi jamčio točnost.
Anatomija matematičkih pogrešaka: sedam vrsta
Sljedeći popis vrsta sažima najčešće pogreške na koje ćete naići u AI izlazu i protuotrov za svaku od njih.
Vrsta greške
Kako to izgleda
protuotrov
aritmetička pogreška
Pogreška broja kao što je 7×8=54
Kalkulator/SymPy
pogreška znaka
−(a−b)=−a−b
Otvori moje ime ručno
Izmišljeni teorem
nepostojeći naziv teorema
Potvrda iz izvora
Pogrešna primjena pravila
Ne zaboravite pravilo lanca
"Koje pravilo?" pitanje
Preskočen status
Zanemarite negativni korijen
Navedite sve statuse
praznina u dokazu
„Dakle“ bez opravdanja
Preispitivanje svakog prolaza
Stari/netočni podaci
zastarjele informacije
izvorište
Zašto matematika zahtijeva posebnu pozornost?
U većini područja mala pogreška ima male posljedice. U matematici se pogreška širi i raste. Pogreška predznaka u prvom retku jednadžbe čini sljedećih deset redaka i konačni rezultat potpuno pogrešnim. Praznina u sredini dokaza čini cijeli dokaz nevažećim. Ova "krhkost" čini nužnim provjeru svakog koraka u matematici - "općenito govoreći čini se istinitim" nije dovoljno.
Štoviše, istina u matematici je binarna: rezultat je ili istinit ili lažan, ne postoji između. "Osamdeset posto točno" može se smatrati prihvatljivim u tekstualnom sažetku; Ne postoji nešto poput "osamdeset posto točno" u integralu - ili je točan rezultat ili nije. Ova dvojna priroda provjeru čini kritičnijom i (srećom) mogućom: rezultat ili prolazi provjeru ili ne.
Korak po korak: disciplina sustavne provjere
1. Svaki numerički rezultat potvrdite alatom. Nikada ne ostavljajte aritmetiku da biste se oslonili na AI; SymPy, kalkulator ili ručno.
2. Provjerite svaki simbolički rezultat sa SymPy. Integral, derivacija, pojednostavljenje, jednadžba—sve se može provjeriti uz SymPy.
3. Potvrdite svaki teorem/formulu iz izvora. Jesu li naziv i izraz točni? Izmišljeni teoremi su najpodmuklija zamka.
4. Dovedite u pitanje svaku pojavu u svakom dokazu. "Proizlazi li ovo stvarno iz prethodnog koraka?" Osnovni slučaj, implicitna pretpostavka, provjera praznina.
5. Provjera i protuprovjera. Inverzna operacija, supstitucija, granična stanja, dimenzijska analiza.
6. Stavite to na test zdravog razuma. Je li rezultat razuman? Ako je vjerojatnost veća od 1, postoji pogreška ako je duljina negativna.
Savjet: Najbrži test zdravog razuma je provjera "reda veličine". Je li rezultat otprilike unutar očekivanog raspona? Ako je prosjek klase 250 (od 100) ili je vjerojatnost 3,5, znat ćete da postoji pogreška bez gledanja u detalje. Ova provjera od 5 sekundi uklanja mnoge smiješne rezultate u startu.
tri mini kućišta
Slučaj 1 — Pogreška znaka lanca. Jedan je student otkrio da se u algebarskom pojednostavljenju s 8 redaka pogreška predznaka koju je umjetna inteligencija napravila u retku 2 prenosi na sljedećih 6 redaka. Konačni rezultat bio je potpuno pogrešan, ali AI ga je prikazao s potpunim povjerenjem. Kada je student to ispočetka pojednostavio sa SymPyjem, dobiven je točan rezultat i omogućio je umjetnoj inteligenciji da pronađe pogrešku u 2. retku. Jedan znak opovrgao je 6 redaka.
Slučaj 2 — Zdrav razum je spasio test. Učitelj je pomoću umjetne inteligencije riješio problem vjerojatnosti; Rezultat je bio 1.4. Ne gledajući detalje, učitelj je rekao da "vjerojatnost ne može biti veća od 1" i potražio pogrešku: AI je prikupio nediskretne događaje kao da su diskretni. Test zdravog razuma pokazao je pogrešku u roku od nekoliko sekundi.
Slučaj 3 — Izmišljena formula. Inženjer je od umjetne inteligencije zatražio "zatvorenu formulu" za zbroj serije. AI je dao uvjerljivu formulu. Inženjer je testirao formulu za malu vrijednost n (n=3) i formulom i ručnim zbrajanjem; Rezultati se nisu podudarali. Formula je izmišljena. Malo dotjerivanje spriječilo je sate zlouporabe.
Četiri predloška za kopiranje
1) Zahtjev za višeslojnu provjeru:
Našli ste: [rezultat]. Sada provjerite ovo na TRI različita načina: (1) raspršivanje obrnutim redom, (2) testiranje jednostavne prilagođene vrijednosti, (3) neki kod za provjeru pomoću SymPy (vidjet ću izlaz). Reci mi jesu li sva tri načina dosljedna; Ako nije, pokažite koji korak ima pogrešku.
2) Test zdravog razuma/ranga:
Našli ste: [rezultat]. Stavite to na test zdravog razuma da vidite je li ovaj rezultat RAZUMAN: koji je očekivani red veličine, je li predznak točan, je li unutar granica (npr. vjerojatnost 0-1)? Ako nije razumno, istražite gdje bi mogla biti greška.
3) Potvrda teorema/formule:
Je li [teorem/formula] koju koristite stvarno standardna i točna? Napiši njegov standardni izraz i uvjete. Pokažite račun koji to testira s malim uzorkom (npr. n=3). Ako je to izmišljena formula ili nešto u što niste sigurni, jasno to recite.
4) Dijagnoza načina pogreške:
Znam da postoji greška u rješenju u nastavku. Provjerite ove vrste pogrešaka jednu po jednu: aritmetika, znak, pogrešno pravilo, preskočeni uvjet, domena. Recite mi koja je to vrsta greške i u kojem koraku. Rješenje: [ovdje]
Slab upit / Jak upit
Slab: "Je li ovaj zaključak točan?" [zalijepi rezultat]
Rezultat: AI često kaže "da, točno" (tendencija potvrđivanja vlastitog rezultata); nepouzdana jer ne postoji neovisna revizija.
Jako: "PROVJERITE ovaj rezultat na neovisni način: upotrijebite drugačije rješenje ili provjerite sa SymPy kodom (ja ću pokrenuti kod). Nemojte samo reći 'točno/netočno'; pokažite koju ste provjeru napravili i rezultat. Ako kontrolni zbroj ne uspije, pronađite pogrešku."
Rezultat: Neovisna metoda kontrole je dovedena u pitanje; AI je spriječena da slijepo odobri vlastiti rezultat.
Uobičajene greške
- Natjerati AI da potvrdi vlastiti rezultat. "Je li ovo istina?" AI često potvrđuje vlastitu pogrešku; Potrebna je neovisna metoda.
- Preskakanje testa zdravog razuma. Besmislice poput vjerojatnosti veće od 1 i negativne duljine mogu se uhvatiti bez gledanja u detalje.
- Oslanjanje na jednu provjeru. Upotrijebite više neovisnih putova (raspršivači + SymPy + prilagođena vrijednost) na kritičnim rezultatima.
- Ne testira formule s malim uzorcima. Izmišljene formule odmah se skupljaju na malim vrijednostima kao što su n=2, n=3.
- Zaboravljajući da se bug širi. Pogreška u prvom retku kvari cijeli rezultat; Ako pronađete grešku, provjerite je od početka.
Oprez: ne postoji korelacija između pouzdanosti AI-a i njegove točnosti. Rečenica koja se čini najodlučnijom, najtečnijom, najsigurnijom može biti potpuno pogrešna. Vjerujte neovisnoj provjeri, a ne tonu. Smatrajte rezultat "točnim" samo kada ga potvrdite ručno ili determinističkim alatom - ne zato što AI kaže "sigurno".
Ukratko
AI čini pogreške u matematici jer je to jezični model koji statistički proizvodi tekst, a ne motor koji kontrolira logiku. Pogreške se mogu podijeliti u sedam glavnih tipova: aritmetika, znak, izmišljeni teorem, pogrešna primjena pravila, izostavljeni slučaj, praznina u dokazu, zastarjeli podaci. U matematici se pogreška širi i raste, istina je binarna — stoga se svaki korak mora provjeriti. Sustavna disciplina: provjerite svaki numerički alat, svaki simbolički rezultat sa SymPyjem, svaki teorem iz izvora, svaki dokaz proći kroz ispitivanje; Primijenite provjeru, protuprovjeru i testiranje zdravog razuma. Samopouzdanje umjetne inteligencije nije dokaz točnosti.
Zadatak aplikacije
Odaberite problem s rješenjem srednje duljine (najmanje 6-8 koraka) i neka ga AI riješi. Zatim izvršite višeslojnu provjeru pomoću uzoraka 1 i 4 iz ove jedinice: (a) testiranje zdravog razuma/ranga, (b) provjera sa SymPy, (c) testiranje posebne vrijednosti. Zatim prođite kroz rješenje redak po redak s namjernim okom "lov na greške" i provjerite koja bi se od sedam vrsta grešaka mogla pojaviti. Zabilježite svaku pogrešku koju pronađete zajedno s njezinom vrstom.
popis za provjeru
- [ ] Svaki numerički rezultat potvrdio sam determinističkim alatom.
- [ ] Provjerio sam svaki simbolički rezultat sa SymPy.
- [ ] Provjerio sam teorem/formulu korištenu iz izvora ili malim primjerom.
- [ ] Primijenio sam test zdravog razuma/reda veličine.
- [ ] Provjerio sam to na neovisan način (bez oslanjanja na vlastito odobrenje AI).
- [ ] Kad sam pronašao pogrešku, ponovno sam provjerio rješenje od početka.