Единица 9 / 11

Халуцинација, вообичаени математички грешки и дисциплина на верификација

Добивки:

  • Бидете способни да препознаете зошто вештачката интелигенција прави грешки во математиката (да се биде јазичен модел, не проверува логика) и седумте главни типови на грешки
  • Способност да се објасни зошто е императив да се потврди секој чекор со разбирање дека грешката се шири и точноста е бинарна во математиката.
  • Способност да се примени повеќеслојна дисциплина за верификација преку тестирање на здравиот разум, проверка на редоследот на големината, контролни суми, вкрстена проверка и независни методи

Оваа единица ја продлабочува идејата во срцето на модулот: зошто и како вештачката интелигенција прави грешки во математиката, кои се видовите на овие грешки и како систематски ги фаќаме? Во претходните единици, видовме методи за верификација за секоја тема; Овде ја собираме анатомијата на грешките под еден покрив. Поентата е, кога гледате излез на вештачка интелигенција, се прашувате „што би можело да биде грешка овде? Тоа е да се добие менталитет за валидација кој рефлексно размислува.

Потсетување: халуцинација е кога вештачката интелигенција самоуверено произведува информации што всушност не се вистинити. Во математиката, халуцинацијата често се појавува во форма на „убедлива, но лажна“. Зошто вештачката интелигенција прави грешки? Бидејќи тоа е јазичен модел, а не логички мотор - т.е. произведува текст со статистички обрасци, не ја проверува логичката валидност на чекорите. „3-цифрено множење“ и „валиден доказ“ за него се задача да произведе ист вид на текст; Нема внатрешен механизам кој гарантира точност.

Анатомија на математички грешки: седум видови

Следната листа на типови ги сумира најчестите грешки што ќе ги сретнете при излезот на вештачката интелигенција и противотровот за секоја од нив.

Тип на грешка

Како изгледа

противотров

аритметичка грешка

Бројна грешка како 7×8=54

Калкулатор/SymPy

грешка во знакот

−(a−b)=−a−b

Отвори го моето име рачно

Измислена теорема

непостоечко име на теорема

Потврда од изворот

Погрешна примена на правилата

Не заборавајте на правилото на синџирот

„Кое правило? прашање

Прескокнат статус

Игнорирај го негативниот корен

Наведете ги сите статуси

празнина на докажување

„Затоа“ без оправдување

Преиспитување на секое поминување

Стари/неточни податоци

застарени информации

извори

Зошто математиката бара посебно внимание?

Во повеќето области, мала грешка има мала последица. Во математиката, грешката се шири и расте. Грешка во знакот во првата линија од равенката ги прави следните десет линии и конечниот резултат целосно погрешни. Празнината во средината на доказот го прави целиот доказ неважечки. Оваа „кршливост“ го прави неопходно да се потврди секој чекор во математиката - „генерално кажано изгледа вистинито“ не е доволно.

Освен тоа, вистината во математиката е бинарна: резултатот е или вистинит или неточен, нема помеѓу. „Осумдесет проценти точно“ може да се смета за прифатливо во резиме на текст; Не постои такво нешто како „осумдесет проценти точно“ во интегралот - или е точниот резултат или не е. Оваа двојна природа ја прави верификацијата и покритична и (за среќа) повозможна: резултатот или ја поминува верификацијата или не.

Чекор по чекор: дисциплина на систематска верификација

1. Потврдете го секој нумерички резултат со алатка. Никогаш не оставајте аритметиката да се потпира на вештачката интелигенција; SymPy, калкулатор или рачно.

2. Проверете го секој симболичен резултат со SymPy. Интеграл, извод, поедноставување, равенка - сè може да се потврди со SymPy.

3. Потврдете ја секоја теорема/формула од изворот. Дали името и изразот се точни? Измислените теореми се најподмолната замка.

4. Преиспитувајте ја секоја појава во секој доказ. „Дали ова навистина следи од претходниот чекор? Основен случај, имплицитна претпоставка, проверка на јазот.

5. Проверете и контрапроверете. Инверзна операција, замена, гранични состојби, димензионална анализа.

6. Ставете го на тест за здравиот разум. Дали резултатот е разумен? Ако веројатноста е поголема од 1, има грешка ако должината е негативна.

Совет: Најбрзиот тест за здрав разум е проверката на „редот на големината“. Дали резултатот е приближно во рамките на очекуваниот опсег? Ако просечната класа е 250 (од 100), или веројатноста е 3,5, ќе знаете дека има грешка без да ги погледнете деталите. Оваа проверка од 5 секунди елиминира многу смешни резултати во пупката.

три мини футроли

Случај 1 - Грешка во знакот на синџирот. Еден студент открил дека при алгебарско поедноставување од 8 линии, грешка во знакот што вештачката интелигенција ја направила во линијата 2 се шири во следните 6 линии. Конечниот резултат беше целосно погрешен, но вештачката интелигенција го претстави со целосна доверба. Кога ученикот го поедностави од нула со SymPy, беше добиен точниот резултат и ѝ дозволи на вештачката интелигенција да ја пронајде грешката во втората линија. Еден знак поби 6 реда.

Случај 2 - Здравиот разум го спаси тестот. Наставник имал вештачка интелигенција да реши проблем со веројатност; Резултатот беше 1,4. Без да ги разгледа деталите, наставникот рече „веројатноста не може да биде поголема од 1“ и ја бараше грешката: вештачката интелигенција собрала недискретни настани како да се дискретни. Тестот за здрав разум ја покажа грешката за неколку секунди.

Случај 3 - Направена формула. Еден инженер побарал од вештачката интелигенција „затворена формула“ за сериска сума. Вештачката интелигенција даде убедлива формула. Инженерот ја тестирал формулата за мала вредност од n (n=3) и со формула и со рачно собирање; Резултатите не се поклопија. Формулата беше измислена. Малку дотерување спречи повеќечасовна злоупотреба.

Четири шаблони за копирање

1) Барање за повеќеслојна верификација:

Најдовте: [резултат]. Сега потврдете го ова на ТРИ различни начини: (1) хеширање обратно, (2) тестирање на едноставна приспособена вредност, (3) некој код за проверка со SymPy (ќе го видам излезот). Кажи ми дали сите три начини се конзистентни; Ако не, покажете кој чекор има грешка.

2) Тест за здрав разум/ранг:

Најдовте: [резултат]. Ставете го на тест за здрав разум за да видите дали овој резултат е РАЗУМЕН: кој е очекуваниот редослед на големина, дали знакот е точен, дали е во граници (на пример, веројатност 0-1)? Ако не е разумно, истражете каде може да има грешка.

3) Потврда на теорема/формула:

Дали [теоремата/формулата] што ја користите навистина е стандардна и точна? Напишете го неговиот стандарден израз и услови. Прикажи сметка што го тестира ова со мал примерок (на пр. n=3). Ако се работи за измислена формула или нешто за што не сте сигурни, кажете го јасно.

4) Дијагноза на режим на грешка:

Знам дека има грешка во решението подолу. Проверете ги овие типови грешки еден по еден: аритметика, знак, погрешно правило, прескокната состојба, домен. Кажи ми за каков тип на грешка се работи и на кој чекор. Решение: [тука]

Слаб промпт / Силен промпт

Слаб: „Дали овој заклучок е точен? [залепете го резултатот]
Резултат: вештачката интелигенција често вели „да, нели“ (тенденција да го потврди својот излез); неверодостојни бидејќи нема независна ревизија.
Силно: "ПРОВЕРЕТЕ го овој резултат на независен начин: користете различно решение или проверете со SymPy код (јас ќе го извршам кодот). Не кажувајте само "точно/неточно"; покажете која проверка сте ја направиле и резултатот. Ако контролната сума не успее, пронајдете ја грешката."
Резултат: Се оспорува независен метод на контрола; ВИ е спречено слепо да го одобри сопствениот излез.

Вообичаени грешки

  • Да се натера вештачката интелигенција да го потврди сопствениот излез. „Дали е ова вистина? ВИ често ја потврдува сопствената грешка; Потребен е независен метод.
  • Прескокнување на тестот за здрав разум. Глупости како веројатноста поголема од 1 и должината да биде негативна може да се фатат без да се гледаат деталите.
  • Потпирајќи се на една потврда. Користете повеќе независни патеки (хеш + SymPy + прилагодена вредност) за критични резултати.
  • Не тестирање на формули со мали примероци. Составените формули веднаш се колабираат при мали вредности како што се n=2, n=3.
  • Заборавајќи дека бубачката се пропагира. Грешка во првата линија го корумпира целиот резултат; Ако најдете грешка, проверете ја од почеток.
Внимание: Не постои корелација помеѓу довербата на вештачката интелигенција и нејзината точност. Реченицата што изгледа најодлучно, најтечно, најсигурно може да биде сосема погрешна. Верувајте во независна проверка, а не на тон. Сметајте го резултатот „вистинит“ само кога ќе го потврдите рачно или со детерминистичка алатка - не затоа што вештачката интелигенција вели „сигурно“.

Сумирано

ВИ прави грешки во математиката бидејќи е јазичен модел кој статистички произведува текст, а не мотор кој ја контролира логиката. Грешките спаѓаат во седум главни типа: аритметика, знак, измислена теорема, погрешна примена на правила, испуштени букви, празнина во доказот, застарени податоци. Во математиката, грешката се шири и расте, вистината е бинарна - така што секој чекор мора да се потврди. Систематска дисциплина: проверете ја секоја нумеричка алатка, секој симболичен резултат со SymPy, секоја теорема од изворот, секој доказ поминува со испрашување; Примени проверка, контра-проверка и тестирање на здравиот разум. Довербата на вештачката интелигенција не е доказ за точноста.

Задача за апликација

Изберете проблем со решение со средна должина (најмалку 6-8 чекори) и нека вештачката интелигенција го реши. Потоа направете повеќеслојна верификација користејќи ги обрасците 1 и 4 од оваа единица: (а) тестирање на здрав разум/ранг, (б) проверка со SymPy, (в) тестирање на посебна вредност. Потоа поминете низ решението ред по ред со намерно око за „лов на бубачки“ и проверете кој од седумте типови на грешки може да се појави. Запишете ја секоја грешка што ќе ја најдете заедно со нејзиниот тип.

листа за проверка

  • [ ] Го потврдив секој нумерички резултат со детерминистичка алатка.
  • [ ] Го проверив секој симболичен резултат со SymPy.
  • [ ] Ја потврдив теоремата/формулата користена од изворот или со мал пример.
  • [ ] Го применив тестот за здрав разум/ред на големина.
  • [ ] Ја ревидирав на независен начин (без да се потпирам на сопственото одобрение на вештачката интелигенција).
  • [ ] Кога најдов грешка, повторно го проверив решението од почеток.