Nyereség:
- Legyen képes felismerni, hogy a mesterséges intelligencia miért hibázik a matematikában (lévén nyelvi modell, nem ellenőrzi a logikát) és a hét fő hibatípust
- Képes megmagyarázni, miért feltétlenül szükséges minden egyes lépést ellenőrizni, megértve, hogy a hiba terjed, és a pontosság bináris a matematikában.
- Többrétegű verifikációs fegyelem alkalmazásának képessége józan ész tesztelésen, nagyságrendi ellenőrzésen, ellenőrző összegeken, keresztellenőrzésen és független módszereken keresztül
Ez az egység elmélyíti a modul lényegét: miért és hogyan hibázik a mesterséges intelligencia a matematikában, milyen típusai vannak ezeknek a hibáknak, és hogyan tudjuk szisztematikusan elkapni őket? A korábbi egységekben minden témakörhöz láthattunk ellenőrzési módszereket; Itt egy fedél alá gyűjtjük a hibák anatómiáját. A lényeg az, hogy amikor egy AI-kimenetet nézel, azon tűnődsz, "mi lehet itt a hiba?" Ez egy olyan érvényesítési mentalitás elnyerése, amely reflexszerűen gondolkodik.
Emlékeztető: a hallucináció az, amikor egy mesterséges intelligencia magabiztosan állít elő olyan információkat, amelyek valójában nem igazak. A matematikában a hallucináció gyakran „meggyőző, de hamis” formában jelenik meg. Miért hibázik az AI? Mivel nyelvi modellről van szó, nem logikai motorról – vagyis statisztikai mintázatú szöveget állít elő, ezért nem ellenőrzi a lépések logikai érvényességét. A "3 számjegyű szorzás" és az "érvényes bizonyítás" számára ugyanaz a fajta szöveg előállításának feladata; Nincs belső mechanizmusa a pontosság garantálására.
Matematikai hibák anatómiája: hét típusa
A következő típuslista összefoglalja a leggyakoribb hibákat, amelyekkel az AI-kimenetben találkozhat, és ezek ellenszerét.
Hiba típusa
Hogy néz ki
ellenszere
számtani hiba
Számhiba, például 7×8=54
Számológép/SymPy
jel hiba
−(a−b)=−a−b
Nyissa meg a nevemet manuálisan
Kitalált tétel
nem létező tételnév
Forrás megerősítése
A szabály helytelen alkalmazása
Ne felejtsd el a láncszabályt
– Melyik szabály? kérdésre
Átugrott állapot
A negatív gyökér figyelmen kívül hagyása
Sorolja fel az összes állapotot
bizonyítási hézag
"Ezért" indoklás nélkül
Minden passz megkérdőjelezése
Régi/hibás adatok
elavult információk
beszerzése
Miért igényel különös figyelmet a matematika?
A legtöbb területen egy kis hibának csekély következménye van. A matematikában a hiba terjed és növekszik. Az egyenlet első sorában lévő előjelhiba a következő tíz sort és a végeredményt teljesen hibássá teszi. Egy rés a bizonyítás közepén érvényteleníti az egész bizonyítást. Ez a „törékenység” szükségessé teszi a matematika minden egyes lépésének ellenőrzését – az „általában igaznak tűnik” nem elég.
Ráadásul a matematikában az igazság bináris: az eredmény vagy igaz vagy hamis, a kettő között nincs. A „nyolcvan százalékos pontosság” szöveges összefoglalóban elfogadhatónak tekinthető; Integrálban nincs olyan, hogy „nyolcvan százalékban helyes” – vagy helyes eredmény, vagy nem. Ez a kettős természet kritikusabbá és (szerencsére) lehetővé teszi az ellenőrzést: az eredmény vagy átmegy az ellenőrzésen, vagy nem.
Lépésről lépésre: a szisztematikus ellenőrzés tudománya
1. Erősítse meg minden numerikus eredményt egy eszközzel. Soha ne hagyja az aritmetikát az AI-ra hagyatkozni; SymPy, számológép vagy kézzel.
2. Ellenőrizze az egyes szimbolikus eredményeket a SymPy segítségével. Integrál, derivált, egyszerűsítés, egyenlet – mindez ellenőrizhető a SymPy segítségével.
3. Erősítse meg az egyes tételeket/képleteket a forrásból. Helyes a név és a kifejezés? A kitalált tételek a legálomosabb csapda.
4. Kérdőjelezz meg minden előfordulást minden bizonyításban. – Valóban ez következik az előző lépésből? Alapeset, implicit feltételezés, résellenőrzés.
5. Ellenőrizze és ellenőrzi. Inverz művelet, helyettesítés, határállapotok, dimenzióanalízis.
6. Tedd próbára a józan észt. Ésszerű az eredmény? Ha a valószínűség nagyobb, mint 1, akkor hiba lép fel, ha a hossza negatív.
Tipp: A józan ész leggyorsabb tesztje a "nagyságrendi" ellenőrzés. Az eredmény nagyjából a várt tartományon belül van? Ha az osztály átlaga 250 (100-ból), vagy a valószínűség 3,5, akkor anélkül fogja tudni, hogy hiba történt, anélkül, hogy megnézné a részleteket. Ez az 5 másodperces ellenőrzés sok nevetséges eredményt kiküszöböl.
három mini tok
1. eset – Láncjel hiba. Egy diák azt találta, hogy egy 8 soros algebrai egyszerűsítésben az AI 2. sorban elkövetett előjelhibája továbbterjedt a következő 6 sorra. A végeredmény teljesen rossz volt, de az AI teljes magabiztossággal mutatta be. Amikor a hallgató a semmiből leegyszerűsítette a SymPy segítségével, a megfelelő eredményt kapta, és lehetővé tette az AI számára, hogy megtalálja a hibát a 2. sorban. Egyetlen jel 6 sort cáfolt.
2. eset – A józan ész megmentette a tesztet. Egy tanár egy MI-vel megoldott egy valószínűségi problémát; Az eredmény 1,4 lett. A tanár anélkül, hogy megvizsgálta volna a részleteket, azt mondta, "a valószínűség nem lehet nagyobb 1-nél", és kereste a hibát: az AI úgy gyűjtötte össze a nem diszkrét eseményeket, mintha azok diszkrétek lennének. A józan ész tesztje másodperceken belül rámutatott a hibára.
3. eset – Összeállított képlet. Egy mérnök „zárt képletet” kért az AI-tól sorozatösszegért. Az AI meggyőző képletet adott. A mérnök a képletet kis n értékre (n=3) tesztelte mind képletekkel, mind kézi összeadással; Az eredmények nem egyeztek. A képletet kitalálták. Egy kis finomítás megakadályozta a több órás visszaélést.
Négy másolható sablon
1) Többrétegű ellenőrzési kérelem:
Ezt találta: [eredmény]. Most ellenőrizze ezt HÁROM különböző módon: (1) fordított kivonatolás, (2) egyszerű egyéni érték tesztelése, (3) néhány kód, amelyet a SymPy segítségével ellenőrizni kell (látom a kimenetet). Mondd meg nekem, hogy mindhárom út következetes-e; Ha nem, mutassa meg, melyik lépésben van hiba.
2) Józan ész/rang teszt:
Ezt találta: [eredmény]. Tedd a józan ész próbára, hogy MEGFELELŐ-e ez az eredmény: mi a várható nagyságrend, helyes-e az előjel, határokon belül van-e (pl. 0-1 valószínűség)? Ha nem ésszerű, vizsgálja meg, hol lehet a hiba.
3) Tétel/képlet megerősítése:
Az Ön által használt [tétel/képlet] valóban szabványos és helyes? Írja le a standard kifejezését és feltételeit! Mutasson egy fiókot, amely ezt egy kis mintával teszteli (pl. n=3). Ha ez egy kitalált képlet vagy valami, amiben nem vagy biztos, mondd ki egyértelműen.
4) Hibamód diagnosztika:
Tudom, hogy hiba van az alábbi megoldásban. Egyenként ellenőrizze ezeket a hibatípusokat: aritmetika, előjel, rossz szabály, kihagyott feltétel, tartomány. Mondja el, milyen típusú hiba és melyik lépésnél. Megoldás: [itt]
Gyenge felszólítás / Erős felszólítás
Gyenge: "Helyes ez a következtetés?" [illessze be az eredményt]
Eredmény: A mesterséges intelligencia gyakran azt mondja, hogy „igen, helyes” (hajlam arra, hogy megerősítse saját kimenetét); megbízhatatlan, mert nincs független audit.
Erős: "Ellenőrizze ezt az eredményt független módon: használjon más megoldást, vagy ellenőrizze a SymPy kódot (én futtatom a kódot). Ne csak azt mondja, hogy "igaz/hamis", hanem mutassa meg, melyik ellenőrzést végezte el, és az eredményt. Ha az ellenőrző összeg nem sikerül, keresse meg a hibát."
Eredmény: Egy független ellenőrzési módszer megkérdőjeleződött; A mesterséges intelligencia nem hagyhatja jóvá saját kimenetét.
Gyakori hibák
- A mesterséges intelligencia ellenőrzése a saját kimenetén. – Ez igaz? Az AI gyakran megerősíti saját hibáját; Független módszer szükséges.
- A józan ész tesztjének kihagyása. Az olyan ostobaságokat, mint az 1-nél nagyobb valószínűség és a negatív hosszúság, el lehet fogni anélkül, hogy megnéznénk a részleteket.
- Egyetlen ellenőrzésre támaszkodva. Használjon több független elérési utat (kivonat + SymPy + egyéni érték) a kritikus eredményekhez.
- Nem tesztelik a képleteket kis mintákkal. Az összeállított képletek azonnal összeomlanak kis értékeknél, például n=2, n=3.
- Elfelejti, hogy a hiba terjed. Egy hiba az első sorban elrontja a teljes eredményt; Ha hibát talál, ellenőrizze az elejétől.
Figyelem: Nincs összefüggés az AI megbízhatósága és pontossága között. A legelszántabbnak, legfolyékonyabbnak, "legbiztosabbnak" tűnő mondat nagyon könnyen lehet, hogy teljesen téves. Bízzon a független ellenőrzésben, ne a hangban. Csak akkor tekintse „igaznak” az eredményt, ha kézzel vagy egy determinisztikus eszközzel megerősíti – nem azért, mert az AI azt mondja, hogy „biztos”.
Összefoglalva
A mesterséges intelligencia hibázik a matematikában, mert ez egy nyelvi modell, amely statisztikailag szöveget állít elő, nem pedig egy logikát vezérlő motor. A hibák hét fő típusba sorolhatók: számtani, előjel, kitalált tétel, szabálytalan alkalmazás, kihagyott kis- és nagybetűk, bizonyítási hiányosságok, elavult adatok. A matematikában a hibák terjednek és nőnek, az igazság bináris – ezért minden lépést ellenőrizni kell. Szisztematikus fegyelem: ellenőrizze minden numerikus eszközt, minden szimbolikus eredményt a SymPy segítségével, minden tételt a forrásból, minden bizonyítást megkérdőjelezéssel; Alkalmazzon ellenőrzést, ellenellenőrzést és józan ész tesztelését. Az AI magabiztossága nem a pontosság bizonyítéka.
Pályázati feladat
Válasszon egy problémát közepes hosszúságú (legalább 6-8 lépésből álló) megoldással, és oldja meg a mesterséges intelligencia. Ezután végezzen többrétegű ellenőrzést az egység 1. és 4. mintájával: (a) józan ész/rangteszt, (b) ellenőrzés SymPy-vel, (c) speciális érték tesztelése. Ezután haladjon végig a megoldáson soronként tudatos „hibavadászat” szemmel, és ellenőrizze, hogy a hét hibatípus közül melyik fordulhat elő. Rögzítsen minden talált hibát a típusával együtt.
ellenőrző lista
- [ ] Minden numerikus eredményt determinisztikus eszközzel igazoltam.
- [ ] Minden szimbolikus eredményt ellenőriztem a SymPy segítségével.
- [ ] A felhasznált tételt/képletet a forrásból vagy kis példával igazoltam.
- [ ] A józan ész/nagyságrend tesztet alkalmaztam.
- [ ] Független módon (az AI saját jóváhagyására támaszkodva) auditáltam.
- [ ] Amikor hibát találtam, az elejétől újra ellenőriztem a megoldást.