Zyski:
- Potrafić rozpoznać, dlaczego sztuczna inteligencja popełnia błędy w matematyce (będąc modelem języka, a nie sprawdzać logikę) oraz siedem głównych rodzajów błędów
- Umiejętność wyjaśnienia, dlaczego konieczna jest weryfikacja każdego kroku, poprzez zrozumienie, że błąd się propaguje, a dokładność w matematyce jest binarna.
- Umiejętność stosowania wielopoziomowej weryfikacji poprzez testowanie zdroworozsądkowe, sprawdzanie rzędu wielkości, sumy kontrolne, sprawdzanie krzyżowe i metody niezależne
Ta część pogłębia ideę leżącą u podstaw modułu: dlaczego i w jaki sposób sztuczna inteligencja popełnia błędy w matematyce, jakie są rodzaje tych błędów i jak je systematycznie wyłapywać? W poprzednich rozdziałach widzieliśmy metody weryfikacji dla każdego tematu; Tutaj gromadzimy anatomię błędów pod jednym dachem. Rzecz w tym, że patrząc na wyniki AI, zastanawiasz się „co może być tutaj błędem?” Chodzi o zdobycie mentalności walidacji, która myśli refleksyjnie.
Przypomnienie: halucynacja ma miejsce wtedy, gdy sztuczna inteligencja z pewnością generuje informacje, które w rzeczywistości nie są prawdziwe. W matematyce halucynacje często pojawiają się w formie „przekonującej, ale fałszywej”. Dlaczego sztuczna inteligencja popełnia błędy? Ponieważ jest to model językowy, a nie silnik logiczny — to znaczy generuje tekst ze wzorcami statystycznymi, nie sprawdza logicznej ważności kroków. „3-cyfrowe mnożenie” i „ważny dowód” są dla niego zadaniem wytworzenia tego samego rodzaju tekstu; Nie posiada wewnętrznego mechanizmu gwarantującego dokładność.
Anatomia błędów matematycznych: siedem typów
Poniższa lista typów podsumowuje najczęstsze błędy, jakie można napotkać w wynikach AI, oraz antidotum na każdy z nich.
Typ błędu
Jak to wygląda
antidotum
błąd arytmetyczny
Błąd liczbowy, np. 7×8=54
Kalkulator/SymPy
błąd podpisu
−(a−b)=−a−b
Otwórz moje imię i nazwisko ręcznie
Zmyślone twierdzenie
nieistniejąca nazwa twierdzenia
Potwierdzenie ze źródła
Błędne zastosowanie przepisu
Nie zapomnij o zasadzie łańcucha
„Jaka zasada?” pytanie
Stan pominięty
Zignoruj pierwiastek ujemny
Lista wszystkich statusów
luka w dowodzie
„Dlatego” bez uzasadnienia
Kwestionowanie każdego przejścia
Stare/nieprawidłowe dane
nieaktualne informacje
zaopatrzenie
Dlaczego matematyka wymaga szczególnej uwagi?
W większości obszarów mały błąd ma niewielkie konsekwencje. W matematyce błąd rozprzestrzenia się i rośnie. Błąd znaku w pierwszej linii równania powoduje, że kolejne dziesięć linii i wynik końcowy są całkowicie błędne. Luka w środku dowodu powoduje, że cały dowód jest nieważny. Ta „kruchość” powoduje konieczność weryfikacji każdego kroku w matematyce – „ogólnie rzecz biorąc wydaje się to prawdą” nie wystarczy.
Co więcej, prawda w matematyce jest binarna: wynik jest albo prawdziwy, albo fałszywy, nie ma nic pomiędzy. „Dokładność w osiemdziesięciu procentach” można uznać za akceptowalną w streszczeniu tekstowym; W całce nie ma czegoś takiego jak „poprawność w osiemdziesięciu procentach” — albo jest to wynik poprawny, albo nie. Ta podwójna natura sprawia, że weryfikacja jest zarówno bardziej krytyczna, jak i (na szczęście) bardziej możliwa: wynik albo przechodzi weryfikację, albo nie.
Krok po kroku: dyscyplina systematycznej weryfikacji
1. Potwierdź każdy wynik numeryczny za pomocą narzędzia. Nigdy nie zostawiaj arytmetyki, aby polegać na sztucznej inteligencji; SymPy, kalkulator lub ręcznie.
2. Sprawdź każdy symboliczny wynik za pomocą SymPy. Całka, pochodna, uproszczenie, równanie – wszystko można zweryfikować za pomocą SymPy.
3. Potwierdź każde twierdzenie/wzór ze źródła. Czy nazwa i wyrażenie są prawidłowe? Wymyślone twierdzenia są najbardziej podstępną pułapką.
4. Kwestionuj każde wystąpienie w każdym dowodzie. „Czy to naprawdę wynika z poprzedniego kroku?” Przypadek podstawowy, ukryte założenie, sprawdzenie luk.
5. Sprawdzaj i sprawdzaj ponownie. Działanie odwrotne, podstawienie, stany graniczne, analiza wymiarowa.
6. Poddaj to testowi zdrowego rozsądku. Czy wynik jest rozsądny? Jeśli prawdopodobieństwo jest większe niż 1, występuje błąd, jeśli długość jest ujemna.
Wskazówka: najszybszym testem zdrowego rozsądku jest sprawdzenie „rzędu wielkości”. Czy wynik mieści się mniej więcej w oczekiwanym zakresie? Jeśli średnia w klasie wynosi 250 (na 100) lub prawdopodobieństwo wynosi 3,5, bez sprawdzania szczegółów będziesz wiedział, że wystąpił błąd. Ta 5-sekundowa kontrola eliminuje wiele absurdalnych wyników w zarodku.
trzy mini etui
Przypadek 1 — Błąd znaku łańcucha. Jeden z uczniów odkrył, że w 8-wierszowym uproszczeniu algebraicznym błąd znaku popełniony przez sztuczną inteligencję w wierszu 2 przeniósł się do kolejnych 6 wierszy. Wynik końcowy był całkowicie błędny, ale sztuczna inteligencja przedstawiła go z całkowitą pewnością. Kiedy uczeń uprościł to od zera za pomocą SymPy, uzyskano poprawny wynik i pozwoliłem sztucznej inteligencji znaleźć błąd w drugiej linii. Pojedynczy znak obalił 6 linii.
Przypadek 2 — Zdrowy rozsądek uratował test. Sztuczna inteligencja nauczyciela rozwiązała problem prawdopodobieństwa; Wynik wyniósł 1,4. Nie patrząc na szczegóły, nauczyciel stwierdził, że „prawdopodobieństwo nie może być większe niż 1” i szukał błędu: sztuczna inteligencja zebrała niedyskretne zdarzenia tak, jakby były dyskretne. Zdrowy rozsądek wykazał błąd w ciągu kilku sekund.
Przypadek 3 – Gotowa formuła. Inżynier poprosił sztuczną inteligencję o „zamkniętą formułę” na sumę szeregową. AI podała przekonującą formułę. Inżynier przetestował wzór dla małej wartości n (n=3), zarówno metodą wzoru, jak i dodawania ręcznego; Wyniki nie zgadzały się. Formuła została wymyślona. Niewielkie poprawki zapobiegły wielogodzinnym nadużyciom.
Cztery szablony do kopiowania
1) Żądanie weryfikacji wielowarstwowej:
Znaleziono: [wynik]. Teraz zweryfikuj to na TRZY różne sposoby: (1) mieszając to w odwrotnej kolejności, (2) testując prostą wartość niestandardową, (3) kod do sprawdzenia w SymPy (zobaczę wynik). Powiedz mi, czy wszystkie trzy sposoby są spójne; Jeśli nie, pokaż, w którym kroku wystąpił błąd.
2) Test zdrowego rozsądku/rankingu:
Znaleziono: [wynik]. Poddaj to testowi zdrowego rozsądku, aby sprawdzić, czy ten wynik jest ROZSĄDNY: jaki jest oczekiwany rząd wielkości, czy znak jest poprawny, czy mieści się w określonych granicach (np. prawdopodobieństwo 0-1)? Jeśli nie jest to uzasadnione, sprawdź, gdzie może wystąpić błąd.
3) Potwierdzenie twierdzenia/wzoru:
Czy [twierdzenie/wzór], którego używasz, jest naprawdę standardowe i poprawne? Zapisz jego standardowe wyrażenie i warunki. Pokaż konto, które testuje to na małej próbie (np. n=3). Jeśli jest to wymyślona formuła lub coś, czego nie jesteś pewien, powiedz to wyraźnie.
4) Diagnoza trybu błędu:
Wiem, że w poniższym rozwiązaniu jest błąd. Sprawdź po kolei te typy błędów: arytmetyka, znak, zła reguła, pominięty warunek, dziedzina. Powiedz mi, jakiego rodzaju jest to błąd i na którym etapie. Rozwiązanie: [tutaj]
Słaba zachęta/silna zachęta
Słaby: „Czy ten wniosek jest słuszny?” [wklej wynik]
Wynik: AI często mówi „tak, racja” (tendencja do potwierdzania własnych wyników); niewiarygodne, ponieważ nie ma niezależnego audytu.
Strong: „SPRAWDŹ ten wynik w niezależny sposób: użyj innego obejścia lub sprawdź za pomocą kodu SymPy (uruchomię kod). Nie mów tylko „prawda/fałsz”; pokaż, które sprawdzenie wykonałeś i wynik. Jeśli suma kontrolna się nie powiedzie, znajdź błąd.
Wynik: niezależna metoda kontroli jest kwestionowana; Sztuczna inteligencja nie może ślepo zatwierdzać własnych wyników.
Typowe błędy
- Nakłonienie sztucznej inteligencji do sprawdzenia własnych wyników. „Czy to prawda?” AI często potwierdza swój własny błąd; Wymagana jest niezależna metoda.
- Pomijam test zdrowego rozsądku. Nonsensy, takie jak prawdopodobieństwo większe niż 1 i długość ujemna, można wychwycić bez patrzenia na szczegóły.
- Opierając się na jednej weryfikacji. Użyj wielu niezależnych ścieżek (hasze + SymPy + wartość niestandardowa) w przypadku krytycznych wyników.
- Nie testowanie formuł na małych próbkach. Gotowe formuły załamują się natychmiast przy małych wartościach, takich jak n=2, n=3.
- Zapominanie, że błąd jest propagowany. Błąd w pierwszej linii psuje cały wynik; Jeśli znajdziesz błąd, sprawdź go od początku.
Uwaga: nie ma korelacji pomiędzy pewnością AI a jej dokładnością. Zdanie, które wydaje się najbardziej zdecydowane, najbardziej płynne i najbardziej „pewne”, może równie dobrze być całkowicie błędne. Zaufaj niezależnej weryfikacji, a nie tonowi. Wynik uznaj za „prawdziwy” tylko wtedy, gdy potwierdzisz go ręcznie lub za pomocą narzędzia deterministycznego – a nie dlatego, że sztuczna inteligencja powie „pewno”.
Podsumowując
Sztuczna inteligencja popełnia błędy w matematyce, ponieważ jest modelem języka, który statystycznie generuje tekst, a nie silnikiem kontrolującym logikę. Błędy dzielą się na siedem głównych typów: arytmetyczne, znakowe, zmyślone twierdzenia, błędne zastosowanie reguł, pominięte przypadki, luka w dowodzie, nieaktualne dane. W matematyce błąd rozprzestrzenia się i rośnie, prawda jest binarna — dlatego każdy krok musi być weryfikowany. Systematyczna dyscyplina: weryfikuj każde narzędzie numeryczne, każdy wynik symboliczny w SymPy, każde twierdzenie ze źródła, każdy dowód przechodzący przez kwestionowanie; Zastosuj kontrolę, kontrkontrolę i testy oparte na zdrowym rozsądku. Zaufanie AI nie jest dowodem dokładności.
Zadanie aplikacji
Wybierz problem z rozwiązaniem średniej długości (co najmniej 6-8 kroków) i poproś sztuczną inteligencję o jego rozwiązanie. Następnie wykonaj weryfikację wielowarstwową, korzystając ze wzorców 1 i 4 z tej jednostki: (a) zdrowy rozsądek/testowanie rang, (b) sprawdzanie za pomocą SymPy, (c) testowanie na specjalnej wartości. Następnie przejrzyj rozwiązanie linia po linii, celowo „wyszukując błędy” i sprawdź, który z siedmiu typów błędów może wystąpić. Zapisz każdy znaleziony błąd wraz z jego typem.
lista kontrolna
- [ ] Każdy wynik numeryczny potwierdzałem narzędziem deterministycznym.
- [ ] Sprawdziłem każdy symboliczny wynik za pomocą SymPy.
- [ ] Sprawdziłem zastosowane twierdzenie/wzór ze źródła lub na małym przykładzie.
- [ ] Zastosowałem test zdrowego rozsądku/rzędu wielkości.
- [ ] Przeprowadziłem audyt w sposób niezależny (bez polegania na zgodzie AI).
- [ ] Kiedy znalazłem błąd, ponownie sprawdzałem rozwiązanie od początku.