利益:
- データ ライフサイクルのあらゆる段階で AI に関する考慮事項を適用する
- 保存期間を設定し、AI チャット履歴を破棄ポリシーに含めます
- 匿名化と仮名化の違いを適用する
データの「後」の部分は、データ保護担当者が見落としがちな部分です。 AI にテキストが入力されると、仕事は完了したように見えます。ただし、そのデータはどこかに保存され、おそらくモデルのトレーニングに使用され、おそらく数か月間チャット履歴に蓄積されます。この単元では、個人データのライフサイクルについて段階的に説明します。保存期間、AI チャット履歴の破棄、および 2 つの重要な技術である匿名化と仮名化の区別について学びます。目標は、データが入力されたときだけでなく、データの存続期間全体にわたってデータを管理することです。
データのライフサイクルとAI
個人データはライフサイクルを経ます。各ステージにはAI特有の注目ポイントがあります。
ステージ
何が起こるでしょうか?
AIの注目ポイント
コレクション
データが取得される
目的や根拠は明確ですか?最小化されましたか?
使用・加工
AIに入力され、処理される
マスキングはされていますか?認定車両?
ストレージ
データは保持されます
チャット履歴はどのくらいの期間保存されますか?
転送
他の人のところへ行く
インターナショナルサーバー?適切な保証はありますか?
破壊
削除・匿名化
目的が終わったら削除されたのでしょうか?予備品は付属していますか?
最も無視されている 2 つの段階は、保管と廃棄です。データは「忘れられ」、システムに蓄積され続けます。これは KVKK 原則に違反し、侵害が発生した場合の被害を拡大します。
保存期間:どれくらい保存できますか?
KVKK の保持原則は明確です。個人データは、処理目的に必要な期間を超えて保持することはできません。目的が利用できなくなった場合は、データを削除、破棄、または匿名化する必要があります。機関は保管と廃棄の方針を作成します。各カテゴリのデータをどれだけ保持するかを決定します。
AI 特有の重要なポイント: AI のチャット履歴も保存されるデータです。従業員が何か月も同じチャットに顧客データを入力した場合、その履歴がデータ リポジトリになります。このために:
- エンタープライズ AI ツールでデータ保持設定を構成します (可能であれば履歴を自動削除するか、モデル トレーニングでの使用をオフにします)。
- チャット履歴を破棄スケジュールに含めます。
- 法人契約で「モデルのトレーニングでは使用しない」(オプトアウト) オプションを必ず選択してください。
注意: データの削除は、画面からデータを削除するだけではありません。プロバイダーのサーバー上のバックアップ、ログ、コピーも考慮する必要があります。 「削除した」と言う場合は、削除した内容が本当に復元不可能であることを確認してください。
匿名化か仮名化か?
これら 2 つの用語はよく混同されますが、法的な影響は正反対です。
- 匿名化: データを個人と関連付けることができないようにすること。正しく行われた場合、その結果は個人データではなくなり、KVKK の範囲外となります。例: 10,000 人のデータ セット内の個々の行を削除し、「イスタンブールの 25 ~ 34 歳の年齢層の平均支出」などの集計統計のみを残します。
- 仮名化: ID 情報はコード/タグに置き換えられますが、「キー」を使用して本人に返すことができます。例: 「Ahmet Yılmaz」の代わりに「Customer-4471」と書きますが、どのコードが誰に属するかを示す表を保持します。これは依然として個人データであり、KVKK の範囲内に含まれます。
特徴
匿名化
仮名化
その人を返してもらえるのでしょうか?
いいえ (正しく行われた場合)
はい、鍵付きです
やはり個人情報なのでしょうか?
いいえ
はい
KVKKのスコープ
外
で
AIに参入するには
最も安全な方法
繰り返しますが、根拠/ルールが必要です
ヒント:「リバーシブルですか?」 AIにデータを入力する前に。聞く。その中にキー/一致がある場合、それは仮名化されており、依然として個人データです。本当の匿名化は、個々の行ではなく、集計結果を共有することです。
ミニケース3個
ケース 1 — 偽の匿名性。ヘルスケア企業は、分析のために「匿名化」したとされる一連のデータを AI に提供します。ただし、このセットには生年月日、郡、およびまれな診断が含まれています。このトリオは、小さな郡に住む 1 人の人物を示している可能性があります。これは匿名化ではありません。データは依然として個人的なものです。正しい方法: 生年月日を年齢範囲に変換し、郡ごとに一般化し、まれな診断をグループ化します。つまり、真の集計です。
ケース 2 — 会話が山積しています。コールセンターでは、6 人のエージェントが顧客データを同じ企業 AI アカウントに 4 か月間入力します。過去を清算できる人は誰もいません。最終的には 12,000 を超える顧客とのやり取りが 1 か所に蓄積されました。監査では、この蓄積は重大なリスクとしてマークされます。解決策: 30 日ごとに履歴を自動的に削除するように設定し、ジョブが終了したらログアウトするルールを設定し、保持ポリシーに条項を追加します。
ケース 3 — 正しい仮名化。 AI を使用して従業員のパフォーマンスを分析する場合、人事チームは「Employee-001」などの名前をコード化し、アクセスが制限された別のファイルに照合テーブルを保存します。これは仮名化です。データは個人的なものであることに変わりはありませんが、リスクは軽減されます。チームはこれが匿名化ではないことを認識しており、それに応じて法的根拠と保存期間を決定します。
コピー可能なテンプレート
テンプレート 1 — 保存と破棄のポリシー ライン: 「次のデータ カテゴリに対する保存と破棄のポリシー ラインを提案します: [カテゴリ]。フィールド: 保存期間 (目的によって正当化される)、破棄方法 (削除/破棄/匿名化)、AI チャット履歴が含まれるかどうか、責任のある役割。法的な保存義務があるかどうかを思い出させます。」
テンプレート 2 — 匿名化チェック: 「次のデータセットが本当に匿名であるかどうかを評価します: [リスト フィールド]。どのようなフィールドの組み合わせによって個人を再識別可能にすることができますか (例: 生年月日 + 郵便番号 + 珍しい特徴)? 匿名性を強化するために、各リスク フィールド (年齢層、都道府県レベルなど) の一般化を提案します。」
テンプレート 3 — マスキング + リターン キーの分離: 「次のテキストに仮名を付けます。個人データをエンコードします ([名前]->K001 など)。ただし、一致するテーブルを別途提供してください。テキスト自体に実際の識別情報を残さないでください。一致するテーブルは「個人データ」であり、個別に保存する必要があることに注意してください。」
テンプレート 4 — AI ツールのデータ ストレージの監査: 「使用する AI ツールのデータ ストレージの動作を監査するための質問のリストを準備します。履歴はどのくらいの期間保持されますか、削除できるか、モデルのトレーニングに使用されますか、オプトアウトはありますか、データはどこで処理されますか、バックアップは何ですか? 各質問に対して期待される「安全な」回答を書いてください。」
弱いプロンプト / 強いプロンプト
弱み: 「このデータを匿名化します。」 (名前をコード化して残します) -> ニックネームのみ。生年月日、まれな特徴など、再識別のリスクが残ります。それは「匿名」であるかのような錯覚を生み出します。 GÜÇLÜ: 「このセット内で個人を再識別できるフィールドの組み合わせを見つけて、それぞれを一般化します (年齢層、州レベル)。私の目標は単一の記録ではなく、集計された統計です。その結果、誰も 1 人の個人として区別できず、これを検証できます。」 -> このモデルは真の匿名化に向かう傾向があり、再識別のリスクが軽減されます。
よくある間違い
- 仮名化を匿名化と間違える。それが個人データであることを忘れています。
- 名前を削除し、生年月日 + 場所 + 珍しい特性などの説明的な組み合わせを残します。
- AI チャット履歴には保持/破棄ルールが適用されません。無限に蓄積します。
- 契約の「モデルのトレーニングでは使用しない」(オプトアウト) 条項を保証していない。
- 削除とは、単に画面をクリアして、バックアップやログのことを忘れることを意味します。
- 目的のためではなく、「万が一」のために保管期間を長くしておくこと。
- 転送と保存がプロバイダーのサーバーでも行われることは無視します。
要約すると
- 個人データはライフサイクルを経ます。最も無視される段階は保管と廃棄です。
- データは、目的に必要な期間を超えて保存することはできません。機関は保管と破棄のポリシーを確立する必要があります。
- AI チャット履歴も保存データです。廃棄スケジュールと保管設定に含める必要があります。
- 匿名化により KVKK からデータが取り出されます。仮名化してもデータは個人的なままになります。
- 名前の削除は匿名化ではありません。再識別の危険性のあるすべての組み合わせを一般化する必要があります。
アプリケーションタスク
組織が AI を使用して処理するデータのカテゴリ (カスタマー サポート レコードなど) を選択します。このカテゴリの保持および破棄ポリシー行を作成します: 保持期間 (正当な理由)、破棄方法、AI チャット履歴が含まれるかどうか、責任のある役割。次に、同じデータからサンプル レコードを取得し、最初にそれを仮名化し (一致するテーブルを別にしておきます)、次にどのフィールドを一般化するか、およびこのレコードを真の匿名化にする方法を記述します。最後に、使用する AI ツールのデータ ストレージの動作を制御する 5 つの質問を用意し、それぞれに期待する「安全な」回答を追加します。
チェックリスト
- [ ] データカテゴリの保存期間と破棄方法を決定しました。
- [ ] AIチャット履歴を破棄スケジュールに記載させていただきました。
- [ ] オプトアウト項目「モデルトレーニングでは使用しない」にチェックを入れました。
- [ ] 仮名化と匿名化の違いを実装しました。
- [ ] 再識別の危険性があるフィールドの組み合わせを一般化しました。
- [ ] バックアップやログも削除対象に含めました。
- [ ] AI ツールのデータ保存動作を監査しました。