利益:
- EDRM ワークフローと TAR/予測コーディングの概念を理解し、人工知能を使用してレビュー フェーズを加速する能力
- 再現率と精度のバランスを理解し、法医学の観点から高い再現率を優先することで関連文書を見逃さないようにする能力
- 特権および個人データに関する決定に対する法的責任は人間の弁護士にあり、方法論の透明性が必要であることを理解する
民事訴訟や規制調査では、一方の当事者が他方の当事者が保持する電子文書(電子メール、契約書、チャット ログ、ファイル)を要求します。法律に従ってこれらの文書を収集し、調査し、関連するものを整理して相手方当事者/法廷に提出するプロセスは、電子証拠開示と呼ばれます。これは、法的紛争の範囲内で電子証拠を発見、検討、提示することです。電子情報開示は、コンピューター フォレンジックが法律と最も密接に関係している分野であり、おそらく AI の最も成熟し、広く使用されている分野です。この単元では、EDRM ワークフロー、TAR/予測コーディングの概念、および AI がこのプロセスをどのように変革するかを学びます。
EDRM: 電子情報開示の標準ワークフロー
世界の電子証拠開示は主に EDRM (電子証拠開示参照モデル - 電子証拠開示プロセスの標準段階を定義する参照モデル) のフレームワーク内で行われます。主なステージ:
- 情報の管理と識別: どのデータがどこにあるかを判断します。
- 保存と収集: 関連データの削除を防止し (訴訟ホールド - 訴訟を予期してデータの削除を停止する義務)、完全性を持ってデータを収集します。
- 処理: データを検索可能にする、重複を削除する、形式を変換する。
- 復習: 文書が機密文書か特権文書かを決定します。弁護士と依頼者の特権の対象となり、引き渡されません。
- 作成:関連書類を相手方当事者/裁判所に提出します。
最も費用と労力がかかるのはレビューです。弁護士に何十万もの書類を一つ一つ読んでもらうのは、非常に費用がかかるだけでなく、非常に時間がかかります。まさに、AI が革命を起こすのです。
TAR と予測コーディング
レビューを迅速化する鍵となるテクノロジーはTAR(Technology Assisted Review)です。最も一般的な形式は予測コーディングです。専門の弁護士はサンプル文書に「関連性/無関係性」のラベルを付けます。システムはこれらの例から学習し、残りの数十万のドキュメントを自動的に分類します。したがって、最も関連性が高い文書のみを読み取り、残りはサンプリングによってチェックします。
最新の AI (大規模言語モデル) はこれをさらに一歩進め、単に「関連性がある/無関係である」だけでなく、ドキュメントが関連性がある理由、トピックの要約、特権フラグを説明できます。しかし、基本原則は変わりません。AI は、関連性と特権の決定に対する法的責任は弁護士にあると示唆しています。
TAR の防御可能性は、プロセスが監査可能かどうかによって決まります。専門弁護士によってラベル付けされたトレーニング例、システムがこれらの例から学習し、残りの文書を分類するサイクルが繰り返されます。精度は各ラウンドでのサンプリングによって測定されます。このサイクルにより、「マシンは何を調べ、何を学習し、どの程度正確でしたか?」という質問に対する文書化された答えが得られます。相手側はこの方法論に疑問を抱くことがよくあります。したがって、トレーニング セットのサイズ、決定しきい値、検証サンプル レートが最初から記録されます。プロセスの透明性と再現性が高まるほど、結果が法廷で受け入れられる可能性が高くなります。
ヒント: TAR プロセスを防御可能にするには、「トレーニング」サンプル、検証メトリクス (再現率/精度)、および判定しきい値を文書化します。相手は「機械は何を見逃したのですか?」と尋ねます。彼は尋ねるかもしれない。透明性のある方法論により信頼が保証されます。
2 つの指標: 再現率と適合率
電子証拠開示には 2 つの概念が不可欠です。再現率 (感度 - すべての関連文書のうちどれだけを実際に見つけることができたか) は、紛失のリスクを測定します。関連書類の提出を怠ると制裁を受ける可能性があるため、これは法的に重要です。精度 (見つけた内容のうち実際に関連するものがどれだけあるか) は、不必要な読み取り負荷を測定します。コストに影響します。両者の間にはバランスがあり、閾値を緩めると再現率は増加しますが、不要な文書も増加します。法医学/法律の文脈では、高い再現率が優先されることが多く、読みすぎよりも見逃さないことが重要です。
特権とプライバシー: レッドライン
電子情報開示における最も危険な間違いは、特権文書を誤って相手方に渡してしまうことです (特権の放棄)。弁護士と依頼者の通信は一度配信されると、それを取り戻すのが非常に困難になります。 AI は特権のフラグを立てるのに役立ちますが、すべての特権の決定は人間の弁護士によって確認される必要があります。さらに、個人データを含む文書には編集が必要になる場合があります (KVKK/GDPR の範囲)。 AI が候補をマスキングしてフラグを立て、最終的な制御は人間が行います。
注意: 生の企業データを AI にロードするときは、データのプライバシーと管轄権 (データがどの国のデータ、どこに送られるか) の規則を順守してください。特権データおよび個人データは、データがモデルトレーニングに使用されない車両上で、契約に基づき、適切な管轄区域で処理されなければなりません。
ミニケース3個
ケース 1 — TAR によりコストが削減されました。 130 万件のドキュメントを扱う商用ケースでは、従来の線形レビューの見積もりは 14 か月でした。弁護士は予測コーディングを使用して 8,000 件の文書にタグを付けました。システムは残りを分類し、人間によるレビューは 90,000 件の文書に減りました。プロセスは 6 週間に短縮され、リコール サンプリングによって 92% が確認されました。
ケース 2 — 権限が保存されました。本番前 AI は、配信セット内の 240 のドキュメントに「特権が与えられている可能性がある」というフラグを付けました。弁護士チームは調査した。 210通は実際には弁護士と依頼者の通信であり、配達されなかった。 AI がなければ、これらの書類は誤って相手方に渡ってしまう可能性があります。
ケース 3 — 自信過剰のリスク。あるチームは、高精度を実現するために TAR しきい値を厳密に設定しました。システムは「無関係」と判断したものをサンプリングせずに排除した。その後の監査で、しきい値が厳格だったために、いくつかの重要な電子メールが見逃されていたことが判明しました。コール サンプリングが実行されなかったため、エラーの発見が遅れました。
コピー可能な 4 つのテンプレート
1) レビュープロトコル草案:
あなたの役割: 電子証拠開示コンサルタント。事件の件名: [契約違反]。対応基準、特権フラグ、個人データマスキングルール、TAR 検証手順 (リコール/精度サンプリング) など、レビュープロトコルの草案を作成してください。すべての決定には弁護士の確認が必要であると述べます。
2) 関連性の予備分類:
主題と関連性の基準: [こちら]。書類の概要を説明させていただきます。各文書について: 関連性/無関係/不確実性を示し、その理由を簡単に説明します。 「不明瞭」なものを強調表示します。これらは弁護士の審査を受けることになる。無関係と判断されたものはサンプリングによりチェックされますが、最終的な排除ではありません。
3) 特権スキャン:
弁護士と依頼者の特権を示唆する可能性がある次の文書にチェックを入れてください: 弁護士名、「機密/特権」文言、法的意見の内容。これらは最終的な決定ではなく、弁護士による確認が必要な候補です。各記号の正当性と関連する行を示します。
4) 個人データマスキングの対象者:
作成前に提出する文書でマスクする必要がある個人データの候補をリストします: TR、IBAN、健康、サードパーティの個人データ。候補としてのみマークします。マスキングの最終決定は私が行います。テキストを変更します。
弱いプロンプト / 強いプロンプト
弱いプロンプト:
これらの文書の中から、ケースに関連するものを選択します。
関連性の基準も排他性も検証もありません。 AI は主観的な決定を下し、重要な文書を見逃したり、特権情報を漏洩したりする可能性があります。
強力なプロンプト:
あなたの役割: 電子証拠開示レビューアシスタント。事例: X 社が Y 社との供給契約に違反したという申し立て。関連基準: 納期、価格変更、品質上の苦情、契約解除交渉。書類の概要を説明させていただきます。各文書に関連性/無関係/不確実性と正当性を示します。また、弁護士の名前または法的意見を含むものには「特権が与えられる可能性がある」とマークしてください。いかなる決定も最終的なものとは考えないでください。いずれも弁護士の確認が必要です。
実質的な基準、特権審査、および「弁護士の検証」という制約により、プロセスは防御可能になります。
EDRMステージとAIテーブル
ステージ
AIの貢献
人間の責任
コレクション
テンプレート、プラン
法的保持、保全性
処理中
重複排除、フォーマット、ディレクトリ
品質管理
レビュー
TAR、関連性の推奨事項
関連性の決定
特権
マーキング候補
最終決定、確認
生産
マスキング候補
最終チェック、納品
よくある間違い
- TAR を放置したままにする。コールサンプルを実行せずに「マシンは興味がないと言いました」と言うと、ハイジャックが発生します。
- 権限の決定を AI に任せます。誤配送は取り消し不能な権利放棄となるリスクがあります。
- 再現率ではなく精度のみに焦点を当てます。しきい値が厳しいと、関連するドキュメントが見つかりません。法律ではリコールが優先されます。
- 方法論を文書化していない。相手方は TAR プロセスに疑問を抱く可能性があります。透明性は必須です。
- 個人/特権データを不適切なツールにアップロードする。管轄権と機密保持規則を遵守してください。
要約すると
電子証拠開示は、企業の電子データから法的な方法で関連する証拠を見つけて提供するプロセスであり、EDRM のフレームワーク内で動作します。 AI は、TAR/予測コーディングを使用してレビューという最もコストのかかるフェーズを変革します。人間は、最も関連性が高く、曖昧な文書のみを読み取ります。しかし、関連性と特に特権の決定に対する法的責任は弁護士にあります。リコールサンプリング、方法論の透明性、個人データ保護は人間の規律によって確保されています。
アプリケーションタスク
架空のケースと 4 ~ 5 項目の関連性基準を定義します。 20 ~ 25 個の文書の要約を準備します (少数は特権的で、少数は無名です)。 「関連性の事前分類」および「権限のスクリーニング」テンプレートを適用します。次に、「無関係」なセットからサンプリングしてリコールを手動でチェックし、AIがフラグを立てた特権候補を確認します。
チェックリスト
- [ ] EDRM の段階と訴訟ホールドの義務を観察しました。
- [ ] TAR/事前分類結果をリコールサンプリングで確認しました。
- [ ] 私はあらゆる特権に関する決定を人間の弁護士の確認と結びつけてきました。
- [ ] 個人情報秘匿化候補者を最終チェックにより承認しました。
- [ ] 私が使用した方法論としきい値を文書化しました。