ユニット 2 / 11

証拠の収集と調査のサポート: 画像化、分類、分析の高速化

利益:

  • ボラティリティの順序、画像の取得、ハッシュ、保管管理などの収集ステップは人間の責任であり、人工知能はここで計画とテンプレートを生成するだけであることを理解する
  • 人工知能を安全に使用して、画像の撮影後にファイルのトリアージ、OCR、概要、資産抽出を行うことでレビューを迅速化する機能
  • トリアージは排除ではなく優先順位付けであり、偽陰性のリスクを回避するには優先度の低いグループからのサンプリングが必要であることを区別できるようにする必要があります。

あなたは犯罪現場に到着しました。テーブルの上に開かれたコンピューター、外付けドライブ、2 台の電話、サーバー ルームです。すべてのデバイスは潜在的な証拠源です。あらゆる間違った行動は法廷で却下される証拠となります。証拠の取得とは、デジタル証拠をそのままの状態で検証可能に、法律に従って取得してコピーするプロセスです。この単元では、このプロセスのどのステップを AI が安全に支援でき、どのステップを絶対に後回しにする必要があるかを学びます。最初からの重要なルール: AI は証拠を収集せず、画像も撮影しません。これは、収集および検証された証拠の確認と導出を促進するのに役立ちます。

収集順序と揮発性データ

証拠の収集には優先順位の原則があります。つまり、変動性の順序、つまり、最も急速に消失するデータから最も永続的なデータまで収集します。一番上にあるのは揮発性データです。デバイスがシャットダウンしたり、ネットワーク接続が開かれたり、プロセスが実行されたりすると、RAM の内容が失われます。次にディスク、そして外部録音が登場します。揮発性データは、一度失われると元に戻りません。したがって、実行中のシステムでは、ディスクよりも先に RAM がダンプされます。

AI はこの段階では意思決定を行いませんが、「このシナリオでは、何を、どの順序で、どのツールを使用して収集し、何を文書化する必要があるか」というチェックリストや手順の概要を作成するのに役立ちます。収集プロセス自体 (書き込みブロック バインディング、イメージ取得、ハッシュ検証、シーリング) は人間の手によって行われ、すべてのステップが文書化されます。

ヒント: ピッキングを開始する前に、AI にシナリオを説明し、「ボラティリティ順次ピッキング計画」を作成します。次に、この草案を貴機関の標準手順 (現地の法律や研究室の SOP など) と比較してください。 AI は権限ではなく、思い出させるものです。

イメージングとハッシュ: 不可侵の鎖

収集された各デバイスから正確な画像が取得されます。イメージのインポート中、ソースは書き込みブロッカーによって保護されます。画像が完成すると、ハッシュ (SHA-256 が推奨されます。現在は MD5 のみが弱いと考えられています) が計算されます。このハッシュは画像の指紋です。検査中のすべてのハッシュ チェックで同じでなければなりません。そうでない場合、画像は破損します。保管過程の記録フォーム (証拠が誰によって、いつ、どこで採取され、どこに置かれ、誰に届けられたか) は、所有者が変わるたびに更新されます。

ここで AI は 2 つの安全なジョブを実行します。(1) 収集中に記入される保管過程および証拠タグのテンプレートを生成します。 (2) 一貫性チェックのために収集したハッシュとタイムスタンプを整理します (「これら 3 つのハッシュは同じですか、どのイメージがどのデバイスに属しているか?」)。 AI はハッシュ自体を計算するのではなく、ハッシュをフォレンジック ツールにします。 AIは記録を編集するだけです。

レビューの高速化: AI の真の力

証拠が検証され、画像が撮影されると、AI が真価を発揮します。一般的な加速領域:

  • ファイル分類: 数万のファイルをタイプ、コンテンツ、および考えられる関連性ごとにグループ化し、優先順位を推奨します。
  • テキストと文書の概要: 長い契約書、電子メール、チャット記録の件名と当事者の抽出。
  • OCR とビジュアル コンテンツ: スキャンしたドキュメントからテキストを抽出し (OCR - 光学式文字認識、画像内のテキストを変換)、画像内のオブジェクト/テキストにタグを付けます。
  • エンティティ抽出 (NER - 固有エンティティ認識、テキストから個人、機関、アカウント、IP などの固有エンティティを検索): 数千の文書から個人、IBAN、電話、電子メール、暗号ウォレット アドレスをリストします。
  • コードとコマンドの説明: 見つかったスクリプトまたはコマンド履歴が何を行うかを平易な言葉で説明します (検証予定)。

それぞれにおいて、出力は出発点です。関連性と証拠価値に関する決定は専門家にあります。

注意: AI が「このファイルは無関係です」と言っただけでは、そのファイルを検査せずに削除するのに十分ではありません。トリアージは優先度を下げますが、重大な場合には、優先度の低いクラスターからもサンプリングが行われます。偽陰性(実際の証拠を「無関係」として省略すること)は、コンピュータフォレンジックにおいて最も高くつくミスです。

ミニケース3個

ケース 1 — OCR を使用した機密文書。ある汚職調査では 14,000 ページがスキャンされました。どれも検索可能なテキストではありませんでした。 AI を活用した OCR を使用して、すべてのページが転写され、「オフショア」、特定の企業名、IBAN などのパターンが検索されました。 40 分で 9 つの重要なページが見つかりました。手作業で読むと何週間もかかります。その後、各ページが専門家によって検証されました。

ケース 2 — エンティティ推論関係ネットワーク。 1 つの詐欺ファイルには 6,200 件の電子メールが含まれていました。 NER では、すべての連絡先、アカウント、電話が抽出され、関係リストが作成されました。このようにして、これまで注目されていなかった 2 つの証券口座が出現しました。 AI が接続をマークしました。検察官は電子メール自体の証拠を確認した。

ケース 3 — 偽陰性の危険性。あるチームは、AI が「関心が低い」と呼んだ 30,000 個のファイルのセットを完全に削除したいと考えていました。上級専門家はこのクラスターから 2% をランダムにサンプリングし、その中に重要な記録を発見しました。それは、異常な拡張子のために AI がファイルを誤って分類したというものです。サンプリング規律がこの事件を救った。

コピー可能な 4 つのテンプレート

1) 草案収集計画:

あなたの役割: 犯罪現場の法医学収集スペシャリスト。シナリオ: [PC 上、電話 2 台、NAS 1 台、サーバー実行中]。各デバイスで何を収集するか、どのツールが推奨されるか、何を文書化するかなど、変動性の高い順に収集計画の概要を説明します。これは草案であり、現地の法律に従って確認が必要であることに注意してください。

2) 加工管理テンプレート:

証拠番号、デバイスの説明、シリアル番号、収集者、日付/時刻、収集方法、ハッシュ (SHA-256)、受信者、配信者、保管場所、および各ハンドオフの行を含む加工管理フォーム テンプレートを生成します。

3) 一括ファイル優先順位付けリクエスト:

ファイルのリスト (名前、サイズ、日付、拡張子) を提供します。法医学的関心の可能性の高、中、低ごとにグループ化し、JUSTIFICATION を書き込みます。注: 「低」は削除されるのではなく、優先されるだけです。拡張子とコンテンツの不一致があるものを個別にマークします。

4) 見つかったスクリプトについて説明します。

このスクリプト/コマンドの履歴をフォレンジックの観点から説明してください。これは何を行うのか、どのようなファイル/ネットワーク アクセスがあるのか、永続化やデータ漏洩の痕跡はあるのか?各アサーションをスクリプト内の行にリンクします。不明な場合は、「確認が必要」とマークしてください。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

これらのファイルを重要なものに応じて分離します。

「実質的」とは定義されていません。 AI は独自の仮定を精査するため、重要な証拠を見逃す可能性があります。

強力なプロンプト:

あなたの役割: 法医学トリアージ分析者。状況: 私たちはランサムウェア事件、暗号化、データ漏洩を調査しています。名前、サイズ、作成/変更日、拡張子を含むファイルのリストを提供します。タスク: 暗号化ツール、圧縮/アーカイブ、異常な拡張子、過去 72 時間以内に変更され、大きなエクスポート ファイルを高優先度としてマークします。それぞれの決定の根拠を書きます。拡張子が予想されるコンテンツと一致しない場合も、警告が表示されます。ファイルを「削除/破棄」とは言わないでください。ただ優先するだけ。

コンテキスト、ターゲット、および「削除しない」制約により、出力が便利かつ安全になります。

収集とレビュー: AI の役割チャート

ステージ

AIは安全ですか?

AIの仕事

男の仕事

揮発性データの収集

いいえ(決定)

計画草案

コレクション、ドキュメント

画像取得

いいえ

テンプレート

書き込みブロッカー、ハッシュ

ハッシュ検証

いいえ

レコードの順序

車両経由での計算と確認

ファイルのトリアージ

はい

優先順位付け

決定、サンプリング

OCR/テキスト抽出

はい

変換

精度検証

エンティティ推論

はい

リストの生成

関連性の決定

よくある間違い

  • AI にピッキングを「実行」させようとしています。 AIは追加しません。プランとテンプレートを作成するだけです。画像とハッシュは人間の仕事です。
  • トリアージの結果を最終的な排除と誤解する。 「関心の低い」クラスターからのサンプリングをスキップしないでください。
  • OCR 出力を検証せずに引用します。 OCR では文字 (0/0、1/l) を混在させることができます。重要な値はソースで確認してください。
  • 拡張機能を盲目的に信頼します。拡張子が変更されている可能性があります。コンテンツタイプを確認してください。
  • マスクを着用せずに個人データを車両にアップロードする。 TC/IBAN/健康データが一括推論で漏洩する可能性があります。

要約すれば

証拠の収集は人間の責任です。ボラティリティ、画像、ハッシュ、保管過程の順序は人間の手に委ねられています。ここでAIは計画とテンプレートを生成するだけです。証拠が検証され、画像がキャプチャされると、AI はレビュー (トリアージ、OCR、要約、エンティティ抽出、コード アノテーション) を高速化するという真の価値を追加します。しかし、すべての出力は検証されるべき兆候です。関連性と証拠価値の決定は専門家にあり、専門家は偽陰性のリスクも考慮します。

アプリケーションタスク

架空の事件シナリオを説明します (例: 従業員がデータを漏洩した疑いがある)。まずは「収集計画案」テンプレートで計画を立て、現地の手順と照らし合わせます。次に、20 行のサンプル ファイル リストを準備し、「一括ファイル優先順位付け」テンプレートを使用して優先順位を付けます。少なくとも 10% を手作業でサンプリングし、AI の分類を検証します。

チェックリスト

  • [ ] 変動率の高い順に回収計画を立て、手順と比較してみました。
  • [ ] 画像とハッシュは人間/ツール経由で取得しました。 AIにやってもらったわけではない。
  • [ ] 管理者が変わるたびに、保管管理フォームを更新しました。
  • [ ] トリアージ結果の「低」クラスターからサンプリングしました。
  • [ ] OCR とアセット出力をソースで検証しました。個人情報をマスキングしました。