ユニット 9 / 11

幻覚、よくある数学的間違い、検証の規律

利益:

  • 人工知能が数学で間違いを犯す理由 (ロジックのチェックではなく、言語モデルのため) と 7 つの主なタイプの間違いを認識できるようになります。
  • 数学では誤差は伝播し、精度は 2 値であることを理解して、各ステップを検証することが不可欠である理由を説明する能力。
  • 常識テスト、桁違いのチェック、チェックサム、クロスチェック、および独立した方法を通じて、多層の検証規律を適用する能力

この単元では、モジュールの中心となる考え方、つまり AI が数学でなぜ、どのように間違いを犯すのか、その間違いの種類は何なのか、そしてそれらを体系的に捉えるにはどうすればよいのか、という考えを深めます。前の単元では、各トピックの検証方法を見てきました。ここでは、エラーの構造を 1 つ屋根の下にまとめます。重要なのは、AI の出力を見るときに、「ここで何が間違いなのか?」と疑問に思うことです。反射的に考える検証精神を獲得することです。

注意: 幻覚とは、AI が実際には真実ではない情報を自信を持って生成することです。数学では幻覚は「説得力はあるが間違っている」という形で現れることが多い。なぜAIはミスをするのでしょうか?これは論理エンジンではなく言語モデルであるため、つまり、統計パターンを使用してテキストを生成するため、ステップの論理的妥当性はチェックされません。彼にとって、「3 桁の掛け算」と「有効な証明」は、同じ種類のテキストを生成するタスクです。精度を保証する内部メカニズムはありません。

数学的エラーの分析: 7 つのタイプ

次のタイプのリストは、AI 出力で発生する最も一般的なエラーと、それぞれの解決策をまとめたものです。

エラーの種類

どのように見えますか

解毒剤

算術エラー

7×8=54のような数字の間違い

電卓/SymPy

サインエラー

−(a−b)=−a−b

自分の名前を手動で開く

でっち上げ定理

存在しない定理名

情報源からの確認

ルールの誤適用

連鎖ルールを忘れずに

「どのルールですか?」質問

スキップステータス

負のルートを無視する

すべてのステータスをリストする

証拠のギャップ

正当な理由もなく「だから」

すべてのパスに疑問を抱く

古い/間違ったデータ

古い情報

調達

なぜ数学には特別な注意が必要なのでしょうか?

ほとんどの分野では、小さなミスが小さな影響を及ぼします。数学では、誤差は広がり、増大します。方程式の最初の行に符号の誤りがあると、次の 10 行と最終結果が完全に間違ったものになります。証明の途中にギャップがあると、証明全体が無効になります。この「脆弱性」により、数学の各ステップを検証する必要があります。「一般的に言えば正しいと思われる」だけでは十分ではありません。

さらに、数学における真理は二値的です。結果は真か偽のいずれかであり、その中間はありません。 「80% 正確」はテキスト要約では許容されると考えられるかもしれません。積分に「80% 正しい」などというものはありません。それが正しい結果であるか、そうでないかのどちらかです。この二重の性質により、検証がより重要になり、また (幸いなことに) 可能性も高まります。結果は検証に合格するか不合格になるかのどちらかです。

ステップバイステップ: 体系的な検証の規律

1. 各数値結果をツールで確認します。決して算術を AI に依存しないでください。 SymPy、電卓、または手書き。

2. SymPy で各シンボリック結果を確認します。積分、微分、簡略化、方程式など、すべて SymPy で検証できます。

3. 各定理/公式を出典から確認します。名前や表現は正しいですか?でっち上げの定理は最も狡猾な罠です。

4. あらゆる証明のあらゆる出来事に疑問を持ちます。 「これは本当に前のステップの結果ですか?」基本ケース、暗黙の仮定、ギャップチェック。

5. チェックとカウンターチェック。逆演算、代入、極限状態、次元解析。

6. 常識テストをしてみましょう。結果は妥当ですか?確率が 1 より大きい場合、長さが負の場合はエラーが発生します。

ヒント: 最も簡単な常識テストは、「桁数」のチェックです。結果はほぼ予想の範囲内ですか?クラスの平均が 250 (100 点中) である場合、または確率が 3.5 の場合、詳細を見なくてもエラーがあることがわかります。この 5 秒間のチェックにより、多くのばかげた結果が芽のうちに排除されます。

ミニケース3個

ケース 1 — チェーン サイン エラー。ある学生は、8行の代数単純化において、AIが2行目で犯した符号誤りが次の6行に伝播していることを発見しました。最終結果は完全に間違っていましたが、AI は完全な自信を持ってそれを提示しました。学生がSymPyで一から簡略化したところ、正しい結果が得られ、AIが2行目の誤りを見つけられるようになりました。単一の署名が 6 行を反論しました。

ケース 2 — 常識がテストを救った。教師は AI に確率の問題を解かせました。結果は1.4でした。詳細を見ずに、教師は「確率は 1 を超えることはできません」と言い、AI が非離散的なイベントを離散的であるかのように収集したという間違いを探しました。常識的なテストでは数秒以内にエラーが指摘されました。

ケース 3 — でっち上げられた公式。エンジニアはAIに級数和の「閉じた式」を求めました。 AIは説得力のある公式を与えてくれました。エンジニアは、式と手動加算の両方を使用して、n の小さい値 (n=3) について式をテストしました。結果は一致しませんでした。公式が出来上がった。少し調整するだけで、何時間もの誤用を防ぐことができました。

コピー可能な 4 つのテンプレート

1) 多層検証リクエスト:

見つかりました: [結果]。次に、これを 3 つの異なる方法で検証します: (1) 逆ハッシュする、(2) 単純なカスタム値をテストする、(3) SymPy でチェックするコード (出力を確認します)。 3 つの方法すべてに一貫性があるかどうか教えてください。そうでない場合は、どのステップにエラーがあるかを示します。

2) 常識/ランクテスト:

見つかりました: [結果]。この結果が合理的であるかどうかを常識的なテストに掛けて、予想される大きさは何桁か、符号は正しいか、制限内 (たとえば、確率 0 ~ 1) 内かどうかを確認します。合理的でない場合は、どこに間違いがあるかを調査します。

3) 定理/公式の確認:

あなたが使用している[定理/公式]は本当に標準的で正しいですか?その標準的な表現と条件を書きます。小さなサンプル (例: n=3) でこれをテストするアカウントを表示します。作り話やよくわからないことであれば、はっきりと言いましょう。

4) エラーモード診断:

以下のソリューションにバグがあることはわかっています。算術、符号、間違ったルール、スキップされた条件、ドメインなどのエラー タイプを 1 つずつ確認します。どのような種類のエラーなのか、どの段階で発生したのか教えてください。解決策: [ここ]

弱いプロンプト / 強いプロンプト

弱者:「この結論は正しいでしょうか?」 [結果を貼り付ける]
結果: AI はよく「そうだね」と言います (自身の出力を確認する傾向)。独立した監査がないため信頼性が低い。
Strong: 「この結果を独立した方法でチェックしてください。別の回避策を使用するか、SymPy コードでチェックしてください (コードを実行します)。単に「true/false」と言うのではなく、どのチェックを行ったのか、その結果を示してください。チェックサムが失敗した場合は、エラーを見つけてください。」
結果: 独立した制御方法が挑戦されます。 AI が自身の出力を盲目的に承認することは防止されます。

よくある間違い

  • AI に自身の出力を検証させます。 「これは本当ですか?」 AI は自分自身の間違いを確認することがよくあります。独自の方法が必要です。
  • 常識テストをスキップします。確率が 1 より大きく、長さが負であるなどのナンセンスは、詳細を見なくてもキャッチできます。
  • 単一の検証に依存します。重要な結果に対して複数の独立したパス (ハッシュ + SymPy + カスタム値) を使用します。
  • 小さなサンプルで数式をテストしていない。でっち上げた数式は、n=2、n=3 などの小さな値ですぐに崩壊します。
  • バグが伝播していることを忘れています。最初の行にエラーがあると、結果全体が破損します。間違いを見つけた場合は、最初から確認してください。
注意: AI の信頼度と精度の間に相関関係はありません。最も決意が強く、最も流暢で、最も「確実」に見える文章は、完全に間違っている可能性があります。論調ではなく、独立した検証を信頼してください。 AI が「確かに」と言ったからではなく、手動または決定論的ツールを使用して結果を確認した場合にのみ、結果が「正しい」とみなしてください。

要約すると

AI は論理を制御するエンジンではなく、統計的にテキストを生成する言語モデルであるため、数学で間違いを犯します。エラーは、算術、符号、でっちあげの定理、ルールの誤適用、ケースの省略、プルーフ ギャップ、古いデータの 7 つの主なタイプに分類されます。数学では誤差が広がり、増大し、真実は二値的なものとなるため、すべてのステップを検証する必要があります。体系的な規律: すべての数値ツール、SymPy によるすべての記号結果、ソースからのすべての定理、すべての証明が質問によって検証されます。チェック、カウンターチェック、常識テストを適用します。 AI の信頼性は正確さの証拠ではありません。

アプリケーションタスク

中程度の長さの解決策 (少なくとも 6 ~ 8 ステップ) の問題を選択し、AI に解決させます。次に、このユニットのパターン 1 と 4 を使用して多層検証を実行します: (a) 常識/ランク テスト、(b) SymPy によるチェック、(c) 特別な値でのテスト。次に、意図的な「バグハント」の目でソリューションを 1 行ずつ検討し、7 種類のエラーのうちどれが発生する可能性があるかを確認します。見つかった各エラーをその種類とともに記録します。

チェックリスト

  • [ ] 各数値結果を確定ツールで確認しました。
  • [ ] 各シンボリック結果をSymPyで確認してみました。
  • [ ] ソースまたは小さな例で使用されている定理/公式を検証しました。
  • [ ] 常識/桁違いのテストを適用しました。
  • [ ] (AI 自身の承認に依存せずに) 独立した方法で監査しました。
  • [ ] エラーを見つけたので、最初から解決方法を再確認しました。