ユニット 3 / 11

モデルのトレーニングと評価: 正確なメトリクス、誠実なベンチマーク

利益:

  • 問題のタイプとビジネスコンテキストに適切なメトリック(不均衡データの PR-AUC/再現率、回帰の MAE/RMSE)を選択し、学習の過不足を認識する機能
  • ベースラインに対して各メトリクスを解釈し、偏差を測定し、相互検証により進行状況からノイズを分離する機能
  • 検証セットを使用してハイパーパラメータを調整し、最後にのみテスト セットを使用することにより、楽観的でない結果をレポートする機能

モデル トレーニング (トレーニング: データからパターンを学習するプロセス) は、ML エンジニアリングの中で最も目に見えますが、最も誤解を招きやすいステップです。 「精度95%」といった満足のいく数値が出ているため表示されます。その数字が間違った質問に対する正しい答えであることが多いため、誤解を招きます。この単元では、教育と評価を工学分野と合わせて説明します。私たちは実験計画のパートナーとして人工知能を使用し、測定に基づいて意思決定を行います。

トレーニングサイクルのロジック

モデルは、損失関数 (モデルの誤差を数値的に測定する関数) を最小化することによって、データ内のパターンを学習します。最適化アルゴリズム (勾配降下法など) は、パラメーターを段階的に調整することで損失を削減します。目的は、トレーニング データを記憶することではなく、それを前例のないデータに一般化することです。

2 つの主な危険:

  • 過学習: モデルはトレーニング データを記憶し、新しいデータでは失敗します。トレーニングの成功率は高くなりますが、検証の成功率は低くなります。
  • アンダーフィッティング: モデルはパターンをキャプチャできません。トレーニングと検証の成功率はどちらも低いです。

バランスを見つけるのは教育の芸術です。検証セットはこのバランスを監視するためにあります。トレーニングの成功が増加する一方で、検証の成功が​​減少し始めた場合、過学習が始まっています。

ヒント: 各ステップでトレーニング損失と検証損失を一緒にプロットします。 2 つの曲線が発散し始める点は、過学習が始まる場所であり、「早期停止」するのに適切な瞬間です。

指標の選択: 最も重要な決定

メトリクスが間違っていると、良いモデルは悪く見え、悪いモデルは良く見えます。問題によってメトリクスが決まります。

  • 不均衡な分類 (1 つのクラスが非常にまれである、例: 詐欺): 正確さは誤解を招きます。 「すべてを正常とみなす」というモデルは 99% の精度を獲得しますが、不正行為は 1 つも検出できません。代わりに、精度 (どの程度が実際に陽性であるかを捕捉したもの)、再現率 (どの程度が真陽性であるかを捕捉したもの)、およびそれらのバランス F1 または PR-AUC が使用されます。
  • バランスの取れた分類: 精度と ROC-AUC が適切である可能性があります。
  • 回帰 (数値推定): MAE (平均絶対誤差)、RMSE (大きな誤差にペナルティを課す)、MAPE (パーセント誤差)。
  • ランキング/おすすめ: NDCG、MRR、Recall@K。

精度と再現率のどちらが重要かは、ビジネスの状況によって異なります。リコール(患者を一人も見逃さないこと)はがんスクリーニングの優先事項です。スパムフィルターの精度(重要な電子メールをスパムに送信しない)は重要です。これは技術的な決定ではなくビジネス上の決定であり、エンジニアとオーナーが協力して決定します。

弱いプロンプト / 強いプロンプト

弱いプロンプト: 「モデルのパフォーマンスを評価してください。精度は 0.97 です。」

強力なプロンプト: 「不正検出モデルがあります。陽性クラス率は 1.5% です。精度は 0.97 と報告されています。この指標が誤解を招く可能性がある理由を説明し、どの指標 (精度、再現率、PR-AUC) を優先すべきか、そしてその理由を教えてください。また、このデータに対して「すべてを否定的と呼ぶ」ベースライン モデルがどの程度正確になるかを計算して、実際の付加価値を確認します。

違い: 強力なプロンプトにより、クラス比とビジネス コンテキストが得られます。また、ベースライン モデルの比較も求められます。これは、メトリクスが意味があるかどうかを判断するための最も重要なアンカーです。

ベースライン: 比較のないメトリックは無意味です

メトリクス自体は良いか悪いかではありません。基本モデルによって良くも悪くもなります。基本モデルは、思いつく最も単純な解決策です。「常に多数派のクラスに伝える」、「先週の値を繰り返す」、「平均を推測する」です。モデルがこの単純なソリューションを明確に通過できない場合、すべての複雑さは無駄になります。

注意: 「私のモデルは 85% 正確です」という文自体は何も言いません。基本モデルがすでに 84% を取得している場合、モデルはほとんど価値がありません。基本モデルが 50% を達成すれば、モデルは完璧です。常に基本モデルの観点から話してください。

相互検証と信頼

単一のトレーニング/テストの分割は偶然によるものである可能性があります。相互検証: データを k 個の部分に分割し、各部分を順番にテストすることで、パフォーマンスがどの程度安定しているかを示します。 5 分割相互検証では、5 つの異なるスコアが得られます。それらの平均と標準偏差は重要です。平均が 80% であるが、偏差が ±12% である場合、モデルは不安定であり、次のデータ バッチではまったく異なる動作をする可能性があります。

これは「2 つのモデルの比較」にとっても重要です。モデル A が 81% で、モデル B が 82% だった場合、本当に B の方が優れていますか? ±3%の偏差がある場合、この差はノイズである可能性があります。決定する前に、その違いが有意かどうかを検討してください。

ハイパーパラメータの調整: テストではなく検証を行う

ハイパーパラメータ (学習率、ツリーの深さなど、トレーニング前に手動で決定される設定) は、検証セットを使用して設定されます。テスト セットは最後に 1 回だけ使用されます。テスト セットを見てハイパーパラメータを選択すると、テスト セットが汚染され、報告されるパフォーマンスは楽観的なものになりますが、実際にはそうではありません。

人工知能は、ハイパーパラメータ検索空間の設計と検索コード (グリッド検索、ランダム検索、ベイジアン最適化) の作成に役立ちます。しかし、「どの指標を最適化するか?」を決めるのはあなた自身です。

ミニケース3個

ケース 1 - 精度のトラップ。医療チームは、希少疾患を 98% の精度で検出したモデルを誇りに思っていました。基本モデルの比較が行われたとき、真実が明らかになりました。疾病率が 2% だったため、「すべての人を健康であると主張する」モデルでも 98% が得られました。モデルの再現率はわずか 11% で、ほとんどの患者を見逃していました。メトリクスが PR-AUC に変換されると、実際のパフォーマンスが測定され、モデルが再設計されました。

ケース 2 - 騒音を進行状況と間違えます。チームは数カ月を費やしてモデルを 86.2% から 86.9% に改善しました。相互検証により、バイアスは ±1.4% であることが示されました。つまり、0.7 ポイントの「改善」は統計的なノイズでした。チームは非現実的な収入で 3 週間を無駄にしていました。教訓: 改善が偏差よりも大きいことを確認せずに勝利を宣言しないでください。

ケース 3 - テストセットの汚染。エンジニアはテスト セットを繰り返し確認して、最適なハイパーパラメータを選択しました。それが報告した91%は、本番環境では83%に低下しました。理由: 彼は、テスト セットを何度も見て、無意識のうちにそれに応じてモデルを選択していました (テスト セットでの過剰学習)。別の検証セットを使用した場合、報告されたパフォーマンスと実際のパフォーマンスは重複しました。

コピー可能なテンプレート

この分類問題に適切な指標を選択するのを手伝ってください。問題: [何が予測されるか] クラス分布: [陽性率]

次の 2 つのモデルの比較を評価します。モデル A 相互検証: [スコアのリスト]モデル B 相互検証: [スコアのリスト] 平均と標準偏差を計算します。その差は統計的に有意ですか、それとも偏差内の単なるノイズですか?どちらを選択することをお勧めしますか?またその理由は何ですか?

このトレーニング コードで次の点を確認してください:1) ハイパーパラメータはテスト セットまたは検証セットで選択されていますか?2) 早期停止は正しいセットで監視されていますか?3) 過学習の兆候はありますか (トレーニング/検証損失の差)?コード: [コード]

この回帰問題では、MAE、RMSE、MAPE のどれを報告すべきですか?ターゲット変数のスケール: [範囲] 大きなエラーは不釣り合いに悪いですか (RMSE)、またはそれらはすべて等しいですか (MAE)?ゼロに近い値はありますか (MAPE を歪めますか)?簡単な根拠を示して提案します。

メトリック選択テーブル

問題の種類

適切な指標

避けるべきもの

なぜ

アンバランスな分類

PR-AUC、F1、リコール

精度

マジョリティクラスがメトリクスを水増しする

バランスのとれた分類

精度、ROC-AUC

バランスのとれたデータの信頼性

回帰 (重大な外れ値)

RMSE

MAPE (ゼロの場合)

重大なミスを罰する

回帰 (等しい重み)

解釈しやすい

ランキング・おすすめ

NDCG、リコール@K

精度

順序は重要です

よくある間違い

  • 不平衡データの精度を使用します。最も一般的なメトリック エラー。
  • 基本モデルの比較は行っていません。これにより、指標の意味が失われます。
  • ハイパーパラメータのテストセットを確認します。楽観的で非現実的な結果。
  • 単一のコンパートメントに依存します。相互検証がなければ、偏りはわかりません。
  • 騒音を進歩と勘違いする。逸脱による小さな「改善」はほとんどが運です。
  • ビジネスの文脈を無視する。精度と再現率のバランスはビジネス上の決定です。

要約すると

モデル トレーニングの本当のスキルは、高い数値を生成することではなく、その数値が何を意味するかを知ることです。問題とビジネスの状況によって適切な指標が決まります。ベースラインモデルに従って各メトリクスを解釈します。相互検証でバイアスを測定し、ノイズを進歩と誤解しないでください。テストセットは最後に 1 回だけ使用してください。 AI は実験計画のパートナーですが、「十分である」かの判断はあなた自身にかかっています。

アプリケーションタスク

分類モデルの場合: (1) クラス分布を記述し、(2) 適切な基本モデルを構築してそのスコアを測定し、(3) 5 分割相互検証でモデルを評価し、平均と標準偏差を報告し、(4) 精度ではなく問題に適切なメトリクス (PR-AUC など) を計算します。モデルがベースライン モデルをバイアスなく大幅に上回っているかどうかを書き留めます。

チェックリスト

  • [ ] 問題の種類とビジネスの背景に基づいて指標を選択しました。
  • [ ] 基本モデルを構築し、それと比較しました。
  • [ ] 交差検定を使用して平均と偏差を報告しました。
  • [ ] 偏差よりも改善が大きいことを確認しました。
  • [ ] 検証が設定されたハイパーパラメータを選択しました。
  • [ ] テスト セットを使用したのは、最後の最後に 1 回だけです。