Прибыль:
- Уметь распознавать, почему искусственный интеллект совершает ошибки в математике (являясь языковой моделью, а не проверяя логику) и семь основных типов ошибок.
- Способность объяснить, почему необходимо проверять каждый шаг, понимая, что ошибка распространяется, а точность в математике является двоичной.
- Способность применять многоуровневую дисциплину проверки посредством тестирования здравого смысла, проверки порядка величины, контрольных сумм, перекрестной проверки и независимых методов.
Этот модуль углубляет идею, лежащую в основе модуля: почему и как ИИ совершает ошибки в математике, каковы типы этих ошибок и как мы их систематически выявляем? В предыдущих модулях мы видели методы проверки для каждой темы; Здесь мы собираем анатомию ошибок под одной крышей. Дело в том, что когда вы смотрите на результаты ИИ, вы задаетесь вопросом: «В чем здесь может быть ошибка?» Это значит обрести менталитет проверки, который мыслит рефлексивно.
Напоминание: галлюцинация — это когда ИИ уверенно выдает информацию, которая на самом деле не соответствует действительности. В математике галлюцинация часто выступает в форме «убедительно, но ложно». Почему ИИ совершает ошибки? Поскольку это языковая модель, а не логическая машина, то есть она создает текст со статистическими шаблонами, она не проверяет логическую обоснованность шагов. «Трёхзначное умножение» и «действительное доказательство» являются для него задачей создания одного и того же вида текста; У него нет внутреннего механизма, гарантирующего точность.
Анатомия математических ошибок: семь типов
В следующем списке типов приведены наиболее распространенные ошибки, с которыми вы можете столкнуться при выводе ИИ, и противоядие от каждой из них.
Тип ошибки
Как это выглядит
противоядие
арифметическая ошибка
Ошибка числа, например 7×8=54.
Калькулятор/SymPy
ошибка знака
−(a−b)=−a−b
Открыть мое имя вручную
Выдуманная теорема
несуществующее название теоремы
Подтверждение от источника
Неправильное применение правил
Не забывайте правило цепочки
«Какое правило?» вопрос
Пропущенный статус
Не обращайте внимания на отрицательный корень
Перечислить все статусы
пробел в доказательствах
«Поэтому» без обоснования
Опрос каждого прохода
Старые/неправильные данные
устаревшая информация
поиск
Почему математика требует особого внимания?
В большинстве областей небольшая ошибка имеет небольшие последствия. В математике ошибки распространяются и растут. Ошибка знака в первой строке уравнения делает следующие десять строк и конечный результат совершенно неверными. Пробел в середине доказательства делает все доказательство недействительным. Эта «хрупкость» заставляет выверять каждый шаг в математике — «вообще говоря, кажется верным» недостаточно.
Более того, истина в математике бинарна: результат может быть либо истинным, либо ложным, среднего не существует. «Точность на восемьдесят процентов» может считаться приемлемой в текстовом резюме; В интеграле не существует такого понятия, как «восемьдесят процентов правильных» — либо это правильный результат, либо нет. Эта двойственная природа делает проверку одновременно более важной и (к счастью) более возможной: результат либо проходит проверку, либо нет.
Шаг за шагом: дисциплина систематической проверки
1. Подтвердите каждый численный результат с помощью инструмента. Никогда не оставляйте арифметику, полагаясь на ИИ; SymPy, калькулятор или вручную.
2. Проверьте каждый символьный результат с помощью SymPy. Интеграл, производная, упрощение, уравнение — все можно проверить с помощью SymPy.
3. Подтвердите каждую теорему/формулу из источника. Название и выражение верны? Выдуманные теоремы — самая коварная ловушка.
4. Подвергайте сомнению каждое явление в каждом доказательстве. «Неужели это следует из предыдущего шага?» Базовый случай, неявное предположение, проверка на пробелы.
5. Проверка и контрпроверка. Обратная операция, замена, предельные состояния, анализ размерностей.
6. Проверьте это на здравый смысл. Является ли результат разумным? Если вероятность больше 1, возникает ошибка, если длина отрицательна.
Подсказка: самая быстрая проверка здравого смысла — это проверка «порядка величины». Находится ли результат примерно в ожидаемом диапазоне? Если среднее значение класса равно 250 (из 100) или вероятность равна 3,5, вы поймете, что произошла ошибка, даже не вдаваясь в подробности. Эта 5-секундная проверка исключает многие нелепые результаты на корню.
три мини-кейса
Случай 1 — Ошибка знака цепи. Один студент обнаружил, что при 8-строчном алгебраическом упрощении ошибка знака, допущенная ИИ во второй строке, распространилась на следующие 6 строк. Итоговый результат оказался совершенно неверным, но ИИ представил его с полной уверенностью. Когда студент упростил его с нуля с помощью SymPy, был получен правильный результат и позволил ИИ найти ошибку во 2-й строке. Один знак опровергал 6 строк.
Случай 2. Здравый смысл спас тест. Учитель поручил ИИ решить вероятностную задачу; Результат был 1,4. Не вдаваясь в подробности, учитель сказал «вероятность не может быть больше 1» и поискал ошибку: ИИ собрал недискретные события так, как если бы они были дискретными. Проверка здравого смысла выявила ошибку в течение нескольких секунд.
Случай 3. Придуманная формула. Инженер попросил у ИИ «закрытую формулу» суммы ряда. ИИ дал убедительную формулу. Инженер проверил формулу для небольшого значения n (n=3) как по формуле, так и путем сложения вручную; Результаты не совпали. Формула была составлена. Небольшая доработка предотвратила многочасовое неправильное использование.
Четыре копируемых шаблона
1) Запрос многоуровневой проверки:
Вы нашли: [результат]. Теперь проверьте это ТРИ разных способа: (1) обратное хеширование, (2) тестирование простого пользовательского значения, (3) некоторый код для проверки с помощью SymPy (я посмотрю результат). Скажите мне, согласуются ли все три способа; Если нет, покажите, на каком этапе есть ошибка.
2) Проверка здравого смысла/ранга:
Вы нашли: [результат]. Проведите тест на здравый смысл, чтобы увидеть, является ли этот результат РАЗУМНЫМ: каков ожидаемый порядок величины, правильный ли знак, находится ли он в определенных пределах (например, вероятность 0–1)? Если это неразумно, выясните, где может быть ошибка.
3) Подтверждение теоремы/формулы:
Является ли [теорема/формула], которую вы используете, действительно стандартной и правильной? Напишите его стандартное выражение и условия. Покажите аккаунт, который проверяет это на небольшой выборке (например, n=3). Если это вымышленная формула или что-то, в чем вы не уверены, скажите это четко.
4) Диагностика режима ошибки:
Я знаю, что в приведенном ниже решении есть ошибка. Проверьте эти типы ошибок один за другим: арифметика, знак, неправильное правило, пропущенное условие, домен. Подскажите, что это за ошибка и на каком этапе. Решение: [здесь]
Слабая подсказка / Сильная подсказка
Слабый: «Правильен ли этот вывод?» [вставить результат]
Результат: ИИ часто говорит «да, верно» (склонность подтверждать свои результаты); ненадежны, поскольку нет независимого аудита.
Сильный: «ПРОВЕРЬТЕ этот результат независимым способом: используйте другой обходной путь или проверьте с помощью кода SymPy (я запущу код). Не говорите просто «истина/ложь»; покажите, какую проверку вы выполнили, и результат. Если контрольная сумма не удалась, найдите ошибку».
Результат: независимый метод контроля подвергается сомнению; ИИ не может слепо одобрять свои собственные результаты.
Распространенные ошибки
- Заставить ИИ проверять свои результаты. «Это правда?» ИИ часто подтверждает свою ошибку; Требуется независимый метод.
- Пропуская проверку здравого смысла. Глупости вроде вероятности больше 1 и отрицательной длины можно уловить, не вдаваясь в подробности.
- Опираясь на единственную проверку. Используйте несколько независимых путей (хеши + SymPy + пользовательское значение) для критических результатов.
- Не тестировать формулы на небольших выборках. Придуманные формулы сразу схлопываются при малых значениях, таких как n=2, n=3.
- Забывая, что ошибка распространяется. Ошибка в первой строке искажает весь результат; Если вы обнаружили ошибку, проверьте ее с самого начала.
Внимание: нет никакой корреляции между уверенностью ИИ и его точностью. Предложение, которое кажется самым решительным, самым плавным, самым «верным», вполне может оказаться совершенно неверным. Доверяйте независимой проверке, а не тону. Считайте результат «истинным» только тогда, когда вы подтверждаете его вручную или с помощью детерминированного инструмента, а не потому, что ИИ говорит «конечно».
В заключение
ИИ допускает ошибки в математике, потому что это языковая модель, статистически создающая текст, а не машина, управляющая логикой. Ошибки делятся на семь основных типов: арифметические, знаковые, выдуманная теорема, неправильное применение правил, пропущенный регистр, пробел в доказательстве, устаревшие данные. В математике ошибки распространяются и растут, истина двоична — поэтому каждый шаг должен быть проверен. Систематическая дисциплина: проверяйте каждый численный инструмент, каждый символьный результат с помощью SymPy, каждую теорему из источника, каждое доказательство путем допроса; Применяйте проверку, контрпроверку и проверку здравого смысла. Уверенность ИИ не является свидетельством точности.
Задача приложения
Выберите задачу с решением средней длины (минимум 6-8 шагов) и попросите ИИ решить ее. Затем выполните многоуровневую проверку, используя шаблоны 1 и 4 из этого модуля: (а) тестирование здравого смысла/ранга, (б) проверка с помощью SymPy, (в) тестирование специального значения. Затем просмотрите решение построчно, целенаправленно «поиски ошибок» и проверьте, какой из семи типов ошибок может возникнуть. Записывайте каждую обнаруженную ошибку вместе с ее типом.
контрольный список
- [ ] Я подтвердил каждый численный результат с помощью детерминированного инструмента.
- [ ] Я проверил каждый символьный результат с помощью SymPy.
- [ ] Я проверил теорему/формулу, использованную в источнике или на небольшом примере.
- [ ] Я применил тест здравого смысла/порядка величины.
- [ ] Я проверил это независимым образом (не полагаясь на собственное одобрение ИИ).
- [ ] Когда я обнаружил ошибку, я перепроверил решение с самого начала.