Nyereség:
- Meg tudja különböztetni a kockázati szint szerint, hogy a mesterséges intelligencia hol takarít meg időt a matematikai feladatokban (stratégia, vázlat, szerkesztés) és hol szükséges ellenőrzés (pontos számítás, bizonyítás érvényessége).
- Legyen képes felismerni, hogyan keletkezik a hallucináció a matematikában (kitalált tétel, félrelépés, nem létező képlet), és megérteni, hogy a nyelvi modell miért nem számológép
- Képes olyan munkafolyamat megvalósítására, amely lépésről lépésre ellenőrzi az egyes kimeneteket, determinisztikus eszközellenőrzés és ellenellenőrzési fegyelem segítségével.
A matematika egy olyan terület, ahol egy rossz előjel megcáfolja a teljes eredményt. Ha elfelejti a mínuszjelet egy integrálban, kihagy egy „nyilvánvalóan” lépést a bizonyításban, vagy helytelen kitevőt használ a képletben – mindez teljesen érvényteleníti az eredményt. Éppen ezért a mesterséges intelligencia (AI) matematikában való alkalmazása alaposabb fegyelmet igényel, mint sok más területen. Ebben az egységben megvizsgáljuk, hogy az általunk nagynyelvi modellnek nevezett eszközök (LLM - Large Language Model; a mesterséges intelligencia egy olyan fajtája, amely statisztikailag előrejelezve szöveget állít elő) hol takarítanak meg ténylegesen időt a matematikai feladatokban, és hol lehetnek veszélyesek; és lépésről lépésre megtanulja, hogyan ellenőrizheti az egyes kimeneteket.
Először is, egy világos koncepció: A hallucináció az, amikor a mesterséges intelligencia olyan információkat állít elő, amelyek valójában nem igazak, teljes bizalommal, mintha igaz lenne. A matematikában ez egy kitalált tétel, egy hibás algebrai lépés vagy egy nem létező képlet neve formájában jelenik meg. A kritikus pont a következő: az LLM nem egy számológép. Ez egy szöveggenerátor, amely megjósolja a "következő legvalószínűbb szót". Legtöbbször helyes matematikát állít elő, mert sok helyes matematikát látott a képzési adatokban; de a különbség a "legtöbbször igaz" és a "mindig igaz" között minden a matematikában.
Hol működik a mesterséges intelligencia a matematikában és hol nem?
Gondoljon az AI-ra, mint intelligens terv- és ötletpartnerre: gyors, de ellenőrizni kell. A következő megkülönböztetés képezi ennek a modulnak a gerincét.
Quest
Az AI hozzájárulása
emberi felelősség
Módot találni a probléma megoldására
Különféle megoldási stratégiákat ajánl
A megfelelő stratégia kiválasztása és megvalósítása
Algebrai/szimbolikus számítás
Vázlatokat generál, egyenleteket gyorsan megold
Érvényesítsen minden lépést a SymPy segítségével vagy manuálisan
bizonyító tervezet
Keretet és ötleteket ad
Minden egyes logikai átmenet ellenőrzése
numerikus számítás
Python kódot ír
Futtassa a kódot, és erősítse meg az eredményt
vizualizáció
Grafikus kódot generál
A grafikon látása tükrözi a matematikát
Lecke/kérdésgenerálás
Vázlatot, mintát, disztraktort generál
Erősítse meg a pontosságot és a pedagógiai alkalmasságot
Ökölszabályként: használja az AI-t a fiók elérési útjának megkeresésére és szerkesztésére, ne magát a fiókot; Az eredményt mindig determinisztikus eszközzel (SymPy, számológép, kézi ellenőrzés) ellenőrizze. A „determinisztikus” itt azt jelenti, hogy „mindig ugyanazt és pontosan helyes kimenetet ad ugyanarra a bemenetre”; A szimbolikus számítástechnikai könyvtárak, mint például a SymPy, ilyenek, az LLM nem.
Lépésről lépésre: biztonságos mesterséges intelligencia munkafolyamat a matematikában
1. Határozza meg egyértelműen a problémát. A kétértelmű kérdés kétértelmű választ hoz. Az „Értékelje ki ezt az integrált” helyett mondja azt, hogy „Oldja meg a ∫ x·e^x dx határozatlan integrált lépésről lépésre részleges integrálással, és mutasson be minden lépést”.
2. Kérjen lépésről lépésre megoldásokat. Kérje meg az AI-t a közbenső lépésekről, ne csak az eredményről. A lépések az egyetlen módja a hiba észlelésének.
3. Ellenőrizzük független eszközzel. Érvényesítse a szimbolikus eredményt a SymPy-hez, a numerikus eredményt pedig egy számításhoz. Ez a modul központi elve.
4. Ellenellenőrzés. Vegye vissza a derivált eredményét integrálással; helyettesítsd be az egyenlet gyökét; ellenőrizze, hogy a valószínűség 0 és 1 között van-e. A matematika tele van önellenőrzési eszközökkel.
5. Maradj szkeptikus. Amikor az AI azt mondja, hogy „ez a tétel azt mondja”, erősítse meg a tétel nevét és állítását megbízható forrásból. Gyakoriak a kitalált tételnevek.
Tipp: Kérdezd meg minden AI kimenetet, hogy "hogyan tudom ezt függetlenül ellenőrizni?" Megközelítés a kérdéssel. A matematikában szinte minden eredménynek van igazolási módja: derivált-integrál fordított, gyökhelyettesítés, dimenzióanalízis, határesetek. Ha nem találja az ellenőrzés módját, ne bízzon az eredményben.
három mini tok
1. eset – Készített tétel. Egy tanár megkérdezi az AI-t: "milyen tétellel bizonyítom ezt az egyenlőtlenséget?" – kérdezte. Az AI egy nem létező tételt javasolt, amelyet "Hölmgren-Bernoulli egyenlőtlenségnek" neveztek, és meggyőző kijelentést tett. Amikor a tanár rákeresett a névre egy matematikai forrásban, nem jött eredmény. Az igazi megoldás a klasszikus Cauchy-Schwarz egyenlőtlenség volt. Időveszteség: 20 perc; De ha nem a tények ellenőrzésének szokása lenne, egy előadáson téves információkat közölnének.
2. eset – Jelhiba. Egy mérnökhallgató a ∫ (2x − 3) dx eredményt kérte az AI-tól. YZ x² − 3x + C-t adott (helyes), de a következő lépésben, a határozott integrál [0,2] kiszámításakor a −3·2-t +6-ra cserélte, és 10 helyett −2-t kapott. A tanuló deriváltokkal ellenőrizte az eredményt; 2 perc alatt elkapta a hibát.
3. eset – Megerősítést kaptunk. Egy középiskolai tanár arra kérte az AI-t, hogy állítson elő másodfokú egyenletre vonatkozó kérdéseket egy 15 kérdésből álló vizsgához. Bár a diszkrimináns a 15 kérdésből 2-ben negatív volt, a mesterséges intelligencia "igazi gyökeret" adott. A tanár az összes kérdést SymPy-vel oldotta meg és hasonlította össze; 5 perc alatt 2 hibát észlelt és javított ki. Ellenőrzés nélkül a tanulókat rossz válaszkulccsal értékelnék.
Négy másolható sablon
1) Lépésről lépésre és ellenőrizhető megoldás:
Az Ön szerepe: matematikai asszisztens. Oldja meg a következő problémát LÉPÉSRE LÉPÉSRE:[probléma]. Írja le, melyik szabályt/tételt használta az egyes lépéseknél. A végén mondd el egy mondatban, hogyan tudom az eredményt önállóan ellenőrizni (pl. derivált/integrál inverz, gyökhelyettesítés). Ha egy lépésben nem biztos, jelölje be "ezt a lépést ellenőrizni kell".
2) Tétel/fogalom megerősítése:
Mesélj a [tétel/fogalom]-ról. Írja le a tétel TELJES standard kijelentését, a közönséges nevét, ha van, és feltételeit! Ha nincs szabványos tétel ezen a néven, akkor kifejezetten mondja ki, hogy "ez a név nem szabványos", és ne találja ki. Adja meg azokat a területeket, amelyekben nem vagy biztos.
3) A saját megoldásom ellenőrzése:
Lentebb az én megoldásom. Ellenőrizze az egyes lépéseket, ha van HIBA, mutassa meg, melyik lépésben és miért; Ha helyes, mondja azt, hogy "ez a lépés helyes". Ne írjon új megoldást; csak ellenőrizze a lépéseimet.Az én megoldásom: [itt]
4) Stratégiai javaslat (nem számla):
Javasoljon 3 különböző MÓDSZERT/stratégiát a következő probléma megoldására (ne számoljon). Írd le egy mondatban az egyes módszerek előnyeit és hátrányait! Mondja el, melyik a legalkalmasabb erre a problémára, és miért.
Gyenge felszólítás / Erős felszólítás
Gyenge: "Oldja meg ezt az integrált: ∫ x·sin(x) dx"
Eredmény: egysoros válasz; Nincs köztes lépés, nincs ellenőrzés, nem lehet elkapni a hibákat.
Erős: "Oldja meg a ∫ x·sin(x) dx határozatlan integrált LÉPÉSRE LÉPÉSRE parciális integrálással. Mutasd meg az u és dv választását minden lépésben. A végén különböztesd meg az eredményt, és ellenőrizd, és mutasd meg, hogy visszatér-e x·sin(x)-hez."
Az eredmény: Ellenőrizhető lépések, beépített ellenőrzés (derivatív visszaellenőrzés) és a hiba észlelésének képessége.
Gyakori hibák
- Vakon bízva az eredményben. Az LLM magabiztos hangvétele nem garancia a pontosságra. Még a legmagabiztosabbnak tűnő mondat is hibás lehet.
- Nem akar egy köztes lépést. Ha csak az eredményt akarod, lehetetlen elkapni a hibát.
- Nem determinisztikus eszközökkel történő ellenőrzés. SymPy, számológép vagy manuális ellenellenőrzés nélkül semmilyen eredményt ne vegyen magától értetődőnek.
- Nem erősíti meg a tétel/képlet neveket. A kitalált tételnevek a hallucináció legálomosabb típusai.
- Nem ad kontextust. A tanulói szint és a megengedett módszerek (pl. "származékok használata") nem említése használhatatlan megoldásokat eredményez.
Vigyázat: Ügyeljen arra, hogy ellenőrizze az AI-kimenetet, mielőtt továbbadná egy diáknak vagy kollégának. A matematikában a helytelen információ más hibák láncolatát hozza létre, amíg ki nem javítják. A nem ellenőrzött kimenet soha nem helyettesíti a hozzáértő emberi lény jóváhagyását.
Összefoglalva
A mesterséges intelligencia hatékony vázlat-, stratégia- és szervezési eszköz a matematikában; de ez nem számológép vagy bizonylatellenőrző. A hallucinációk kockázata valós, és egy apró matematikai hiba megcáfolja a teljes következtetést. Az alapfegyelem tehát egyértelmű: lépésről lépésre megoldani, determinisztikus eszközökkel ellenőrizni, ellenőrni, tételeket megerősíteni, maradni szkeptikus. A modul során minden egységben elmélyítjük ezt az érvényesítési gondolkodásmódot.
Pályázati feladat
Válasszon ki egy közepesen nehéz matematikai feladatot a területéről (egy integrált, egyenletrendszert vagy valószínűségi kérdést). A mesterséges intelligencia lépésről lépésre oldja meg a fenti 1. sablont. Ezután ellenőrizze az eredményt független módon (derivált-integrál inverz, gyökös helyettesítés vagy SymPy). Legalább egy lépésben: "Vajon lehet-e itt hiba?" Állj meg és ellenőrizd. Írja le 5-6 mondatban a megállapításait: Hol működött az AI, hol volt szüksége validálásra?
ellenőrző lista
- [ ] Világosan és kontextusban határoztam meg a problémát.
- [ ] A mesterséges intelligencia lépésről lépésre történő megoldását kértem, nem csak az eredményt.
- [ ] Az eredményt determinisztikus eszközzel vagy manuálisan ellenőriztem.
- [ ] Legalább egy ellenellenőrzést végeztem (visszadifferenciálás, radikális helyettesítés stb.).
- [ ] Megbízható forrásból megerősítettem az említett tételt/képletet.
- [ ] Nem adtam tovább ellenőrizetlen eredményeket.