единица 9 / 11

Халюцинации, често срещани математически грешки и дисциплината на проверката

Печалби:

  • Да може да разпознае защо изкуственият интелект прави грешки в математиката (като е езиков модел, а не проверява логиката) и седемте основни вида грешки
  • Способност да се обясни защо е наложително да се проверява всяка стъпка, като се разбере, че грешката се разпространява и точността е двоична в математиката.
  • Способност за прилагане на многопластова дисциплина за проверка чрез тестване на здравия разум, проверка на порядъка на величината, контролни суми, кръстосана проверка и независими методи

Този модул задълбочава идеята в основата на модула: защо и как изкуственият интелект прави грешки в математиката, какви са видовете тези грешки и как систематично да ги улавяме? В предишните части видяхме методи за проверка за всяка тема; Тук събираме анатомията на грешките под един покрив. Въпросът е, че когато погледнете резултат от AI, се чудите "каква може да е грешка тук?" Това е да придобиете манталитет на валидиране, който рефлексивно мисли.

Напомняне: халюцинация е, когато AI уверено произвежда информация, която всъщност не е вярна. В математиката халюцинациите често се появяват под формата на "убедителни, но фалшиви". Защо AI прави грешки? Тъй като това е езиков модел, а не логическа машина - тоест, той произвежда текст със статистически модели, той не проверява логическата валидност на стъпките. „3-цифрено умножение“ и „валидно доказателство“ са за него задачата да произведе същия вид текст; Няма вътрешен механизъм, който да гарантира точност.

Анатомия на математическите грешки: седем вида

Следващият списък от типове обобщава най-често срещаните грешки, които ще срещнете в изхода на AI, и противоотровата за всяка от тях.

Тип грешка

Как изглежда

противоотрова

аритметична грешка

Числова грешка като 7×8=54

Калкулатор/SymPy

грешка в знака

−(a−b)=−a−b

Отворете името ми ръчно

Измислена теорема

несъществуващо име на теорема

Потвърждение от източника

Неправилно прилагане на правилото

Не забравяйте правилото за веригата

"Кое правило?" въпрос

Пропуснато състояние

Игнорирайте отрицателния корен

Избройте всички състояния

пропуск в доказателство

„Следователно“ без оправдание

Разпитва всеки пас

Стари/неверни данни

остаряла информация

снабдяване

Защо математиката изисква специално внимание?

В повечето области малка грешка има малки последствия. В математиката грешката се разпространява и расте. Грешка в знака в първия ред на уравнение прави следващите десет реда и крайния резултат напълно грешни. Празнина в средата на доказателството прави цялото доказателство невалидно. Тази „крехкост“ налага да се проверява всяка стъпка в математиката – „най-общо казано изглежда вярно“ не е достатъчно.

Освен това истината в математиката е бинарна: резултатът е или верен, или неверен, между тях няма нищо друго. „Осемдесет процента точно“ може да се счита за приемливо в текстово резюме; Няма такова нещо като "осемдесет процента правилен" в интеграла - или е правилният резултат, или не е. Тази двойна природа прави проверката едновременно по-критична и (за щастие) по-възможна: резултатът или преминава проверката, или не.

Стъпка по стъпка: дисциплината систематична проверка

1. Потвърдете всеки цифров резултат с инструмент. Никога не оставяйте аритметиката, за да разчитате на AI; SymPy, калкулатор или на ръка.

2. Проверете всеки символен резултат със SymPy. Интеграл, производна, опростяване, уравнение - всичко може да се провери със SymPy.

3. Потвърдете всяка теорема/формула от източника. Правилни ли са името и изразът? Измислените теореми са най-коварният капан.

4. Подлагайте на съмнение всяко събитие във всяко доказателство. „Това наистина ли следва от предишната стъпка?“ Основен случай, имплицитно предположение, проверка на пропуски.

5. Чек и контрачек. Обратна операция, заместване, гранични състояния, размерен анализ.

6. Подложете го на тест за здравия разум. Резултатът разумен ли е? Ако вероятността е по-голяма от 1, има грешка, ако дължината е отрицателна.

Съвет: Най-бързият тест за здравия разум е проверката на "порядъка на величината". Резултатът приблизително в рамките на очаквания ли е? Ако средната класа е 250 (от 100) или вероятността е 3,5, ще знаете, че има грешка, без да разглеждате подробностите. Тази 5-секундна проверка елиминира много нелепи резултати в зародиш.

три мини калъфа

Случай 1 — Грешка във верижен знак. Един ученик установи, че при 8-редово алгебрично опростяване грешка в знака, направена от AI в ред 2, се разпространява в следващите 6 реда. Крайният резултат беше напълно грешен, но AI го представи с пълна увереност. Когато студентът го опрости от нулата със SymPy, правилният резултат беше получен и позволи на AI ​​да намери грешката във 2-рия ред. Един единствен знак опроверга 6 реда.

Случай 2 — Здравият разум спаси теста. Учител имаше изкуствен интелект да реши вероятностен проблем; Резултатът беше 1,4. Без да разглежда подробностите, учителят каза, че „вероятността не може да бъде по-голяма от 1“ и потърси грешката: AI беше събрал недискретни събития, сякаш бяха дискретни. Тестът на здравия разум показа грешката за секунди.

Случай 3 — Измислена формула. Инженер поиска от AI "затворена формула" за серия сума. AI е дал убедителна формула. Инженерът тества формулата за малка стойност на n (n=3) както чрез формула, така и чрез събиране на ръка; Резултатите не съвпаднаха. Формулата беше измислена. Малко настройване предотврати часове на злоупотреба.

Четири копируеми шаблона

1) Искане за многослойна проверка:

Намерихте: [резултат]. Сега проверете това по ТРИ различни начина: (1) хеширане в обратен ред, (2) тестване на проста персонализирана стойност, (3) някакъв код за проверка със SymPy (ще видя резултата). Кажете ми дали и трите начина са последователни; Ако не, покажете коя стъпка има грешка.

2) Тест за здрав разум/ранг:

Намерихте: [резултат]. Подложете го на теста на здравия разум, за да видите дали този резултат е РАЗУМЕН: какъв е очакваният порядък на величината, правилен ли е знакът, в границите ли е (напр. вероятност 0-1)? Ако не е разумно, проучете къде може да има грешка.

3) Потвърждение на теорема/формула:

Стандартна и правилна ли е [теоремата/формулата], която използвате? Напишете неговия стандартен израз и условия. Покажете акаунт, който тества това с малка извадка (напр. n=3). Ако това е измислена формула или нещо, в което не сте сигурни, кажете го ясно.

4) Диагностика на режим на грешка:

Знам, че има грешка в решението по-долу. Проверете тези типове грешки един по един: аритметика, знак, грешно правило, пропуснато условие, домейн. Кажете ми какъв тип е грешката и на коя стъпка. Решение: [тук]

Слаба подкана / Силна подкана

Слаб: "Това заключение правилно ли е?" [поставете резултата]
Резултат: AI често казва „да, правилно“ (тенденция да потвърждава собствения си резултат); ненадеждни, защото няма независим одит.
Силно: „ПРОВЕРЕТЕ този резултат по независим начин: използвайте различно заобиколно решение или проверете с кода на SymPy (ще стартирам кода). Не казвайте просто „вярно/невярно“; покажете коя проверка сте направили и резултата. Ако контролната сума е неуспешна, намерете грешката.“
Резултат: Оспорва се независим контролен метод; AI е възпрепятстван от сляпо одобряване на собствената си продукция.

Често срещани грешки

  • Накарайте AI да валидира своя собствен изход. — Това вярно ли е? AI често потвърждава собствената си грешка; Необходим е независим метод.
  • Прескачане на теста за здравия разум. Глупости като вероятност, по-голяма от 1 и дължина, която е отрицателна, могат да бъдат уловени, без да се разглеждат подробностите.
  • Разчитане на една единствена проверка. Използвайте множество независими пътища (хешове + SymPy + персонализирана стойност) за критични резултати.
  • Без тестване на формули с малки проби. Измислените формули се свиват незабавно при малки стойности като n=2, n=3.
  • Забравяйки, че грешката се разпространява. Грешка в първия ред поврежда целия резултат; Ако намерите грешка, проверете я от самото начало.
Внимание: Няма връзка между увереността на AI и неговата точност. Изречението, което изглежда най-решително, най-плавно, най-„сигурно“, може да е напълно погрешно. Доверете се на независима проверка, а не на тон. Считайте резултата за „верен“ само когато го потвърдите на ръка или с детерминистичен инструмент — не защото AI казва „сигурен“.

В обобщение

AI прави грешки в математиката, защото е езиков модел, който статистически произвежда текст, а не двигател, който контролира логиката. Грешките попадат в седем основни типа: аритметика, знак, измислена теорема, неправилно прилагане на правило, пропуснат случай, пропуск в доказателство, остарели данни. В математиката грешката се разпространява и расте, истината е двоична - така че всяка стъпка трябва да бъде проверена. Систематична дисциплина: проверете всеки числен инструмент, всеки символен резултат със SymPy, всяка теорема от източника, всяко доказателство преминава чрез разпит; Прилагайте проверка, насрещна проверка и тестване на здравия разум. Увереността на AI не е доказателство за точност.

Задача за приложение

Изберете проблем с решение със средна дължина (поне 6-8 стъпки) и накарайте AI да го реши. След това направете многослойна проверка, като използвате модели 1 и 4 от тази единица: (a) тестване на здрав разум/ранг, (b) проверка със SymPy, (c) тестване на специална стойност. След това преминете през решението ред по ред с преднамерено око на „лов на грешки“ и проверете кой от седемте вида грешки може да възникне. Запишете всяка открита грешка заедно с нейния тип.

контролен списък

  • [ ] Потвърдих всеки числен резултат с детерминистичен инструмент.
  • [ ] Проверих всеки символен резултат със SymPy.
  • [ ] Проверих използваната теорема/формула от източника или с малък пример.
  • [ ] Приложих теста за здравия разум/порядъка на величината.
  • [ ] Проверих го по независим начин (без да разчитам на собственото одобрение на AI).
  • [ ] Когато открих грешка, проверих отново решението от самото начало.