利益:
- バイアスがデータ (履歴、代表、測定、集計) から生じていることを理解し、サブグループに基づいてモデルを評価することにより、隠れた差別を検出する能力
- モデルカードを使用して、影響の大きい意思決定における説明可能性、人間による監視と説明責任、および文書の透明性を提供する能力
- 適切な最小モデル、迅速な短縮、キャッシュおよびバッチにより、品質を損なうことなく財務コストと環境コストを管理する能力
モデルは技術的には完璧に機能していても、一部の人にとって不公平だったり、説明が不可能だったり、持続不可能なコストが発生したりする場合には、依然として間違っている可能性があります。この単元では、ML エンジニアリングの 3 つの「目に見えない」、しかし決定的な側面、つまりバイアスと公平性、倫理と透明性、コストと持続可能性について説明します。これらは後から追加される装飾品ではなく、エンジニアリング品質の不可欠な部分です。
偏見はどこから来るのでしょうか?
モデルのバイアス (特定のグループに対するモデルの体系的な扱い) は、通常、モデルではなくデータに由来します。出典:
- 歴史的バイアス: データは過去の不正義を反映しています。特定のグループが過去にあまり信用されていない場合、そのデータに基づいてトレーニングされたモデルはこの差別を学習し、永続化します。
- 代表バイアス: 一部のグループはデータ内で過小評価されています。モデルのパフォーマンスは低くなります (例: 少数のサンプル人口統計では精度が低い)。
- 測定バイアス: ラベル自体にバイアスがあります (例: 「優秀な従業員」の定義が過去の昇進決定に基づいている場合)。
- 集計バイアス: データは特定のチャネルから取得されるため、データは全体を代表するものではありません。
モデルはこれらのバイアスを学習するだけではありません。自動化することでスケールアップします。ある人の偏見のある決定は別の人に影響を与えます。偏ったモデルの評決は何百万ドルにも及びます。
注意: 「モデルは単なる数学であるため中立である」という間違いに陥らないようにしてください。このモデルは、データ内の人間の偏見を学習して自動化します。中立性はデフォルトではなく、測定され確保される必要がある結果です。
正義を測る
正義を管理するには、まず正義を測定する必要があります。これを行うには、サブグループ ベースでモデルを評価します。精度、再現率、偽陽性率などの指標は、異なる人口統計グループ間で等しいか?正義のいくつかの概念:
- グループの公平性: モデルは異なるグループを同様の割合で正しく/誤って扱っていますか?
- 機会の平等: モデルはすべてのグループで真にポジティブなものを均等に捉えていますか (再現率が等しい)?
重要な事実: 異なる正義の定義が同時に満たされるとは限りません (これは数学的な結果です)。この文脈においてどの正義の定義が優先されるかは、技術的な決定ではなく倫理的およびビジネス上の決定であり、利害関係者とともに決定されます。
弱いアプローチ / 強いアプローチ
悪い: 「モデルの全体的な精度は 88% で、まあまあです。」
ギュシュル氏: 「全体的な精度は 88% でしたが、サブグループに分割したところ、再現率は 1 つのグループで 91%、別のグループで 67% でした。モデルには体系的にそのグループが欠落していました。私たちはその理由 (代表性の欠如) を文書化し、そのグループのデータを収集し、均等再現率の目標に基づいて再評価しました。どの公平性の定義を優先するかを関係者と決定しました。」
違い: 強力なアプローチは一般的な指標の背後に隠れず、サブグループを分離し、公平性をオープンな決定として扱います。
倫理と透明性
責任ある AI の中核となる原則は次のとおりです。
- 説明可能性: モデルがこの決定を下した理由を説明できますか?大きな影響を与える決定(信用、雇用、医療)においては、人には説明を受ける権利があります。説明できないモデルは、これらの分野では使用すべきではありません。または、説明可能な方法でサポートされる必要があります。
- 人間の監視: 影響の大きい決定は自動的に行われるべきではありません。モデルが示唆し、人間がそれを確認します。
- 説明責任: モデルがエラーを起こした場合、誰が責任を負うのかを明確にする必要があります。 「モデルが決まったから」は言い訳にならない。
- 透明性: ユーザーは、自分が AI と対話していること、および自分のデータがどのように使用されるかを認識する必要があります。
多くの国や分野では、これらの原則は法律にも組み込まれています(高リスク AI システムに対する透明性、監査、人間による監督義務)。エンジニアには、自分の分野の規制を知る責任があります。
ヒント: 影響力の高いモデルごとに「モデル カード」を作成してください。モデルが何を行うか、どのようなデータでトレーニングされたか、どのグループでどの程度うまく機能するか、どの程度機能しないか、既知の制限は何かなどです。この文書は透明性と説明責任の両方のツールです。
コストと持続可能性
AI は安くありません。コストは 2 つの次元で管理されます。
財務コスト:
- トークンコスト (LLM): 各リクエストと応答にはトークンがかかります。量が増えると請求額も増えます。不必要に長いプロンプト、大きすぎるモデル選択、および制御されていないエージェント ループ (ユニット 5) により、コストが膨らみます。
- トレーニングとホスティング: 微調整とモデルのプレゼンテーションにはハードウェアのコストがかかります。
- 最適化: 小さなモデルで十分な場合は、大きなモデルを使用しないでください。よくある質問をキャッシュします。プロンプトを短くします。処理できるものをバッチ化します。
環境コスト: 大規模なモデルのトレーニングと推論は大量のエネルギーを消費します。持続可能性により、不必要な計算 (正しいサイズ モデル、効率的なアーキテクチャ) を回避することが専門家の責任となります。
ヒント: コスト最適化の最初のルール: 「このジョブに適した最小のモデルは何ですか?」最も強力なモデルをあらゆる場所に配置することは、大ハンマーで釘を打ち込むようなものであり、高価で不必要です。
ミニケース3個
ケース 1 - 隠れた差別。採用選考モデルは全体的に良好に見えました。サブグループ分析では、過去のデータが男性優位であったため、モデルが体系的に女性候補者を強調しており、歴史的なバイアスを学習していることが判明しました。モデルが停止され、データのバランスがとられ、公平性メトリクスが監視されました。一般的な正義が隠れた差別を覆い隠した。
ケース 2 - 原因不明の拒絶反応。信用モデルが申請を拒否していましたが、その理由を誰も説明できませんでした。顧客が法的な説明を求めたとき、チームは応じることができませんでした。このモデルは、説明可能な方法が追加され、各拒否の正当化が行われるまで、影響の大きい意思決定での使用が中止されました。教訓: 影響力の大きい意思決定には説明可能性が不可欠です。
ケース 3 - ビルショック。あるチームは、最大の LLM と各リクエストに対して非常に長いプロンプトを使用していました。月々の請求額が思いの外高くなってしまいました。事後分析: ほとんどのリクエストは小規模なモデルで解決でき、プロンプトの半分は冗長で、頻繁な質問はキャッシュできました。これら 3 つの最適化により、品質を損なうことなくコストが大幅に削減されました。教訓: 最も強力なモデルがどこにでも必要なわけではありません。
コピー可能なテンプレート
このモデルのバイアス/公平性の評価にご協力ください。どのサブグループ (人口統計/セグメント) に分割して測定する必要がありますか?どのような指標 (精度、再現率、グループ別の誤検知率) を比較する必要がありますか?公平性のさまざまな定義が矛盾する可能性はありますか? この文脈ではどちらを優先すべきですか?またその理由は何ですか?モデル/決定コンテキスト: [説明]
このインパクトの大きいモデルのドラフト モデル カードを作成します。目的、トレーニング データと日付、サブグループでのパフォーマンス、既知の制限、適切/不適切な使用、説明可能性のステータス、人間による監視のポイントを含める必要があります。モデル: [説明]
品質を損なうことなく、この LLM 実装のコストを削減するのを手伝ってください。利用可能なもの: モデル サイズ、平均プロンプト長、リクエスト量、キャッシュはありますか?評価:1) 小さいモデルで十分ですか (どのタスクに)?2) プロンプトを短くできますか?3) 頻繁なリクエストをキャッシュできますか?4) バッチに使用できる作業はありますか?各提案の推定影響を書き留めます。
この影響の大きい意思決定システムの倫理/責任チェックリストを作成します。 - 説明可能性: 意思決定の正当性を提示できますか? - 人間の監視: 影響の大きい決定は承認の対象ですか? - 説明責任: エラーが発生した場合の責任は誰にありますか? - 透明性: ユーザーは AI が使用されていることを知っていますか? - 規制: どのような法的義務が関係していますか? システム: [説明]
バイアスソーステーブル
ソース
症状
予防措置
歴史的偏見
過去の差別は今も続いている
データ監査 + 公平性指標
表現バイアス
小さなサンプルグループでは精度が低い
サブグループ分析 + バランシング
測定バイアス
偏ったラベル
ラベルプロセスのレビュー
集計バイアス
宇宙は表現されていない
資源の多様化
よくある間違い
- 全体的な指標に依存します。隠れた差別はサブグループ分析なしには見えてきません。
- 「モデルが中立」であると仮定します。モデルはデータの偏りを学習して増幅します。
- 影響の大きい決定を説明のつかないモデルに任せる。法的および倫理的なリスク。
- 人間の監視を回避します。 「モデルが決まったから」という言い訳は通用しません。
- 最大のモデルを随所に配置。不必要なコストとエネルギー。
- コストを追跡しません。勘定は静かに膨らむ。
要約すると
技術的に正しいモデルであっても、それが公平で、説明可能で、持続可能でなければ失敗です。バイアスは主にデータから生じ、モデルはそれを大規模に拡大します。サブグループごとに公平性を測定し、どの公平性の定義を優先するかを関係者と合意します。影響の大きい意思決定には、説明可能性、人間による監視、説明責任が不可欠です。モデルカード付きの文書の透明性。コストとエネルギーを管理します。適切な最小のモデルを選択し、プロンプトを短くし、キャッシュとバッチを使用します。これらの寸法はエンジニアリング品質の不可欠な部分であり、後から追加される余分なものではありません。
アプリケーションタスク
モデルを少なくとも 2 つのサブグループに分割し、グループごとに再現率と偽陽性率を比較します。大きく異なる場合は、その理由と注意事項を記入してください。影響力の高いモデル (目的、データ、サブグループのパフォーマンス、境界、説明可能性) の簡単なモデル カードの草案を作成します。 LLM の実装コストを削減するための少なくとも 2 つの具体的な最適化 (最小/プロンプト切り捨て/キャッシュ/バッチ) を特定し、その推定影響を書き留めます。
チェックリスト
- [ ] 私はサブグループに基づいてモデルを評価しましたが、一般的な指標には依存しませんでした。
- [ ] 私はどの正義の定義を優先するかを関係者と決めました。
- [ ] 大きな影響を与える決定は説明可能であり、人間の承認が必要です。
- [ ] パターン カードを使用して透明性と境界を文書化しました。
- [ ] 私は最小の適切なモデルを選択しました。プロンプト/キャッシュ/バッチを最適化しました。
- [ ] 私はコストとエネルギーへの影響を監視しています。