Fitimet:
- Të jeni në gjendje të dalloni pse inteligjenca artificiale bën gabime në matematikë (të qenit model gjuhësor, duke mos kontrolluar logjikën) dhe shtatë llojet kryesore të gabimeve
- Aftësia për të shpjeguar pse është e domosdoshme të verifikohet çdo hap duke kuptuar se gabimi përhapet dhe saktësia është binar në matematikë.
- Aftësia për të aplikuar një disiplinë verifikimi me shumë shtresa përmes testimit të sensit të përbashkët, kontrollit të rendit të madhësisë, shumave të kontrollit, kontrollit të kryqëzuar dhe metodave të pavarura
Kjo njësi thellon idenë në zemër të modulit: pse dhe si AI bën gabime në matematikë, cilat janë llojet e këtyre gabimeve dhe si i kapim sistematikisht ato? Në njësitë e mëparshme, ne kemi parë metoda verifikimi për secilën temë; Këtu mbledhim anatominë e gabimeve nën një çati. Çështja është, kur shikoni një dalje të AI, pyesni veten "çfarë mund të jetë një gabim këtu?" Është për të fituar një mentalitet vërtetues që mendon në mënyrë refleksive.
Kujtesë: një halucinacion është kur një AI prodhon me besim informacion që nuk është në të vërtetë i vërtetë. Në matematikë, halucinacionet shpesh shfaqen në formën e "bindës por false". Pse AI bën gabime? Për shkak se është një model gjuhësor, jo një motor logjik - domethënë, ai prodhon tekst me modele statistikore, nuk kontrollon vlefshmërinë logjike të hapave. Një "shumëzimi 3-shifror" dhe një "provë e vlefshme" janë për të detyra e prodhimit të të njëjtit lloj teksti; Nuk ka asnjë mekanizëm të brendshëm për të garantuar saktësinë.
Anatomia e gabimeve matematikore: shtatë lloje
Lista e mëposhtme e llojeve përmbledh gabimet më të zakonshme që do të hasni në daljen e AI dhe antidotin për secilin.
Lloji i gabimit
Si duket
antidot
gabim aritmetik
Gabim numerik si 7×8=54
Llogaritësi/SymPy
gabim i shenjës
−(a−b)=−a−b
Hape emrin tim me dorë
Teorema e krijuar
emër i teoremës joekzistente
Konfirmim nga burimi
Zbatimi i gabuar i rregullit
Mos harroni rregullin e zinxhirit
"Cili rregull?" pyetje
Statusi i anashkaluar
Injoroni rrënjën negative
Listoni të gjitha statuset
boshllëk provash
"Prandaj" pa justifikim
Duke vënë në pikëpyetje çdo kalim
Të dhëna të vjetra/të pasakta
informacion i vjetëruar
ndihmuese
Pse matematika kërkon vëmendje të veçantë?
Në shumicën e fushave, një gabim i vogël ka një pasojë të vogël. Në matematikë, gabimi përhapet dhe rritet. Një gabim i shenjës në rreshtin e parë të një ekuacioni i bën dhjetë rreshtat e ardhshëm dhe rezultatin përfundimtar krejtësisht të gabuar. Një boshllëk në mes të një prove e bën të gjithë provën të pavlefshme. Kjo "brishtësi" e bën të nevojshme verifikimin e çdo hapi në matematikë - "në përgjithësi duket e vërtetë" nuk mjafton.
Për më tepër, e vërteta në matematikë është binar: një rezultat është ose i vërtetë ose i rremë, nuk ka asnjë në mes. "Tetëdhjetë për qind e saktë" mund të konsiderohet e pranueshme në një përmbledhje teksti; Nuk ka gjë të tillë si "tetëdhjetë për qind e saktë" në një integral - ose është rezultati i saktë ose nuk është. Kjo natyrë e dyfishtë e bën verifikimin edhe më kritik dhe (për fat të mirë) më të mundshëm: rezultati ose e kalon verifikimin ose jo.
Hap pas hapi: disiplina e verifikimit sistematik
1. Konfirmoni çdo rezultat numerik me një mjet. Asnjëherë mos e lini aritmetikën të mbështeteni në AI; SymPy, kalkulator ose me dorë.
2. Kontrolloni çdo rezultat simbolik me SymPy. Ekuacioni integral, derivati, thjeshtimi - të gjitha mund të verifikohen me SymPy.
3. Konfirmoni çdo teoremë/formulë nga burimi. A janë të sakta emri dhe shprehja? Teoremat e sajuara janë kurthi më tinëzar.
4. Pyetni çdo dukuri në çdo provë. "A rrjedh vërtet kjo nga hapi i mëparshëm?" Rasti bazë, supozimi i nënkuptuar, kontrolli i boshllëqeve.
5. Kontrollo dhe kundërkontroll. Operacioni i anasjelltë, zëvendësimi, gjendjet kufitare, analiza dimensionale.
6. Vendoseni në testin e sensit të përbashkët. A është rezultati i arsyeshëm? Nëse një probabilitet është më i madh se 1, ka një gabim nëse një gjatësi është negative.
Këshillë: Testi më i shpejtë i sensit të përbashkët është kontrolli i "rendit të madhësisë". A është rezultati afërsisht brenda intervalit të pritur? Nëse mesatarja e klasës është 250 (nga 100), ose probabiliteti është 3.5, do ta dini se ka një gabim pa shikuar detajet. Ky kontroll prej 5 sekondash eliminon shumë rezultate qesharake në syth.
tre mini kuti
Rasti 1 - Gabim i shenjës së zinxhirit. Një student zbuloi se në një thjeshtim algjebrik me 8 rreshta, një gabim shenjash që AI bëri në rreshtin 2 u përhap në 6 rreshtat e ardhshëm. Rezultati përfundimtar ishte krejtësisht i gabuar, por AI e prezantoi atë me besim të plotë. Kur studenti e thjeshtoi atë nga e para me SymPy, u mor rezultati i saktë dhe lejoi që AI të gjente gabimin në rreshtin e 2-të. Një shenjë e vetme hodhi poshtë 6 rreshta.
Rasti 2 - Mendja e shëndoshë e shpëtoi testin. Një mësues kishte një AI të zgjidhte një problem probabiliteti; Rezultati ishte 1.4. Pa shikuar detajet, mësuesi tha "probabiliteti nuk mund të jetë më i madh se 1" dhe kërkoi gabimin: AI kishte mbledhur ngjarje jo-diskrete sikur të ishin diskrete. Një test i sensit të përbashkët vuri në dukje gabimin brenda sekondave.
Rasti 3 — Formula e krijuar. Një inxhinier i kërkoi AI një "formulë të mbyllur" për një shumë seri. AI ka dhënë një formulë bindëse. Inxhinieri testoi formulën për një vlerë të vogël prej n (n=3) si me formulë ashtu edhe me mbledhje me dorë; Rezultatet nuk përputheshin. Formula u krijua. Një ndryshim i vogël parandaloi keqpërdorimin e orëve.
Katër shabllone të kopjueshëm
1) Kërkesa për verifikim me shumë shtresa:
Ju gjetët: [rezultati]. Tani verifikoni këtë TRE mënyra të ndryshme: (1) duke e hasur në të kundërt, (2) duke testuar një vlerë të thjeshtë të personalizuar, (3) një kod për të kontrolluar me SymPy (do të shoh rezultatin). Më thuaj nëse të tre mënyrat janë të qëndrueshme; Nëse jo, tregoni se cili hap ka një gabim.
2) Testi i logjikës/gradës:
Ju gjetët: [rezultati]. Vendoseni në testin e sensit të përbashkët për të parë nëse ky rezultat është i ARSYESHËM: cili është rendi i pritshëm i madhësisë, a është shenja e saktë, a është brenda kufijve (p.sh. probabiliteti 0-1)? Nëse nuk është e arsyeshme, hetoni se ku mund të ketë një gabim.
3) Konfirmimi i teoremës/formulës:
A është [teorema/formula] që po përdorni vërtet standarde dhe e saktë? Shkruani shprehjen standarde dhe kushtet e tij. Trego një llogari që e teston këtë me një mostër të vogël (p.sh. n=3). Nëse është një formulë e sajuar ose diçka për të cilën nuk jeni të sigurt, thuajeni qartë.
4) Diagnoza e mënyrës së gabimit:
E di që ka një gabim në zgjidhjen e mëposhtme. Kontrolloni këto lloje gabimesh një nga një: aritmetikë, shenjë, rregull i gabuar, kusht i anashkaluar, domen. Më tregoni se çfarë lloj gabimi është dhe në cilin hap. Zgjidhja: [këtu]
Prompt i dobët / Prompt i fortë
I dobët: "A është i saktë ky përfundim?" [ngjit rezultatin]
Rezultati: AI shpesh thotë “po, në rregull” (prirje për të konfirmuar rezultatin e vet); jo të besueshme sepse nuk ka auditim të pavarur.
Strong: "Kontrollo këtë rezultat në një mënyrë të pavarur: përdor një zgjidhje tjetër ose kontrollo me kodin SymPy (Unë do të ekzekutoj kodin). Mos thuaj thjesht 'e vërtetë/e gabuar'; trego cilin kontroll ke bërë dhe rezultatin. Nëse shuma e kontrollit dështon, gjej gabimin."
Rezultati: Një metodë e pavarur e kontrollit është sfiduar; UA pengohet të miratojë verbërisht rezultatin e vet.
Gabimet e zakonshme
- Bërja e AI për të vërtetuar prodhimin e vet. "A është e vërtetë kjo?" AI shpesh konfirmon gabimin e vet; Kërkohet një metodë e pavarur.
- Duke anashkaluar testin e sensit të përbashkët. Marrëzitë si probabiliteti më i madh se 1 dhe gjatësia negative mund të kapen pa shikuar detajet.
- Duke u mbështetur në një verifikim të vetëm. Përdorni shtigje të shumta të pavarura (hashes + SymPy + vlerë të personalizuar) në rezultatet kritike.
- Mos testimi i formulave me mostra të vogla. Formulat e krijuara shemben menjëherë në vlera të vogla si n=2, n=3.
- Duke harruar që bug është përhapur. Një gabim në rreshtin e parë korrupton të gjithë rezultatin; Nëse gjeni një gabim, kontrollojeni që në fillim.
Kujdes: Nuk ka asnjë korrelacion midis besimit të AI dhe saktësisë së tij. Fjalia që duket më e vendosur, më e rrjedhshme, më e “sigurt” fare mirë mund të jetë krejtësisht e gabuar. Besojini verifikimit të pavarur, jo tonit. Konsideroni një rezultat "të vërtetë" vetëm kur e konfirmoni atë me dorë ose me një mjet përcaktues - jo sepse AI thotë "sigurisht".
Në përmbledhje
AI bën gabime në matematikë, sepse është një model gjuhësor që prodhon statistikisht tekst, jo një motor që kontrollon logjikën. Gabimet ndahen në shtatë lloje kryesore: aritmetika, shenja, teorema e krijuar, keqzbatimi i rregullit, rasti i lënë pas dore, boshllëku i provës, të dhëna bajate. Në matematikë, gabimi përhapet dhe rritet, e vërteta është binare - kështu që çdo hap duhet të verifikohet. Disiplinë sistematike: verifikoni çdo mjet numerik, çdo rezultat simbolik me SymPy, çdo teoremë nga burimi, çdo provë që kalon duke pyetur; Aplikoni kontrollin, kundër-kontrollin dhe testimin e sensit të përbashkët. Besimi i AI nuk është dëshmi e saktësisë.
Detyra e aplikimit
Zgjidhni një problem me një zgjidhje me gjatësi mesatare (të paktën 6-8 hapa) dhe lërini AI ta zgjidhë atë. Më pas bëni verifikimin me shumë shtresa duke përdorur modelet 1 dhe 4 nga kjo njësi: (a) testimi i sensit të shëndoshë/rangut, (b) kontrollimi me SymPy, (c) testimi në një vlerë të veçantë. Më pas kaloni zgjidhjen rresht pas rreshti me një sy të qëllimshëm "gjueti të insekteve" dhe kontrolloni se cili nga shtatë llojet e gabimeve mund të ndodhë. Regjistroni çdo gabim që gjeni së bashku me llojin e tij.
listë kontrolli
- [ ] Unë konfirmova çdo rezultat numerik me një mjet përcaktues.
- [ ] Kam kontrolluar çdo rezultat simbolik me SymPy.
- [ ] Kam verifikuar teoremën/formulën e përdorur nga burimi ose me shembull të vogël.
- [ ] Kam aplikuar testin e sensit të përbashkët/rendit të madhësisë.
- [ ] Unë e auditova atë në mënyrë të pavarur (pa u mbështetur në miratimin e vetë UA).
- [ ] Kur gjeta një gabim, e rishikova zgjidhjen që në fillim.