ユニット 10 / 11

データプライバシー、安全なツールの選択と匿名化

利益:

  • 顧客の機密データや財務データを人工知能ツールに渡す前の匿名化と必要性の評価
  • プライバシー、データ保持、教育での使用における企業 AI ツールと公共 AI ツールの違いを区別する能力
  • KVKKの枠組み内でデータ侵害、保存期間、サードパーティ共有リスクを管理する能力

保険業界は、最も機密性の高いデータを取り扱う職業の 1 つです。保険ファイル。これには、身元情報、住所、収入、銀行口座、健康歴、損害記録、ナンバープレート、権利書、さらには家族情報が含まれる場合があります。このデータの一部は、KVKK (個人データ保護法) における「特殊な性質の個人データ」として最高度の保護の対象となります。健康データ、生体認証データ、および同様のデータがこの典型的な例です。人工知能ツール (特にクラウドベースのもの) を使用する際に、このデータが制御されずに共有されると、侵害や信頼の喪失という重大なリスクが発生します。一度漏洩するとデータを取り戻すことはできません。この単元では、人工知能に渡す前に顧客データを匿名化する方法 (個人を特定できる情報を削除する)、企業ツールと公共ツールのプライバシーの違い、KVKK のフレームワーク内でデータ侵害、保管、サードパーティ共有のリスクを管理する方法を学びます。この単元は法的なアドバイスではありません。一般原則を説明します。特定の場合にはコンプライアンス/法務部門に相談してください。

プライバシーが重要な理由: データの種類

保険では、保護のレベルに応じてデータを分ける必要があります。

  • 識別データ: 名前、姓、TR ID 番号、生年月日、連絡先。それは個人を直接特定します。
  • 財務データ: 収入、銀行口座、支払い履歴。個人的で繊細。
  • 特別な品質のデータ: 健康、生体認証データ。最高の保護。処理にはより厳しい条件 (明示的な同意または法定の例外) が必要です。
  • ファイルデータ: 証券番号、ナンバープレート、権利証書、損傷の詳細。他のものと組み合わせると、アイデンティティが明らかになります。

最大の危険は、このデータをまとめるときに生じる識別可能性です。 「45歳女性」は匿名ですが、「45歳女性+特定のナンバープレート+特定の住所」は身元を明らかにすることができます。

注意: 人工知能ツールにデータを与えた後に「削除」と言っても、実際には削除されません。一部のツールは入力を保存し、それをモデルのトレーニングに使用することもあります。ルール: 機密データは決して送信しないでください。匿名化は送信前に行われます。

匿名化: その方法

匿名化とは、識別可能な情報を削除し、事実に相当するものに置き換えることです。目標は、出力品質を維持しながら人物を認識できないようにすることです。優れた匿名化:

  • 名前、TR ID、電話番号、住所、証券番号、ナンバー プレート、権利証書の情報を削除します。
  • 彼はそれらを、分析的に意味のある同等の言葉、「45 歳、男性、保険契約、中央アナトリア、一方的な衝突」に置き換えます。
  • 非常に特殊な職業と非常に小さな場所という、珍しい/独特の組み合わせを避けますが、それだけでアイデンティティを開くことができます。
  • 「補完的な健康、計画された整形外科手術」などの医学的/技術的な意味を保持します。
ヒント: 匿名化した後、「見知らぬ人がこのテキストを読んだ場合、その人物を見つけられるでしょうか?」と自問してください。答えが「はい」の場合は、さらに一般化してください。特にレアな組み合わせ(小地区+特定イベント)は危険です。

エンタープライズ ツールとパブリック ツールの比較

すべての AI ツールが同じレベルのプライバシーを備えているわけではありません。それらは次の 3 つの次元で異なります。

  1. データ保持: 入力はどのくらいの期間保持されますか?
  2. トレーニングでの使用: モデルをトレーニングするために入力を使用しますか?
  3. 場所と契約: データはどこで処理されますか。企業のデータ処理契約はありますか?

教育機関 (教育機関の契約上のデータ処理保証) ツールでは、教育におけるデータの使用および保存を禁止する制限が設けられていることがよくあります。公開されている無料ツールは入力を保存し、トレーニングで使用できます。ルール: 機密データは、機関が承認した契約された手段で、可能な限り匿名化された形式でのみ処理されます。未承認のツールに顧客データを入力すると、データ処理装置が監査できなくなります。

ステップバイステップ: 機密データを安全に扱う

  1. データを分類します。アイデンティティ/財務/特別な品質/ファイル データ。
  2. 必要性テスト。このデータはこのタスクに本当に必要ですか?そうでない場合は、使用しないでください。
  3. 匿名化します。識別子を削除し、事実に相当するものを置き換え、まれな組み合わせを一般化します。
  4. 車両を選択してください。代理店が承認した契約車両のみ。公開ツールで利用できる機密データはありません。
  5. 最小限のデータで作業します。業務に必要な最低限の情報を共有します。
  6. ストレージと共有を管理します。出力をどこに保存し、誰と共有しますか。 KVKK の保存期間とサードパーティの規則を遵守してください。あなたの痕跡を残してください。

ミニケース3個

ケース 1 — 機密データの保護。請求専門家は、複雑な健康保険ファイルについて AI に質問したいと考えていました。被保険者の名前、身分証明書、診断名を書く代わりに、「52歳、女性、補完医療政策、予定されている心臓弁手術、係争額」といった匿名のコンテキストを作成した。出力の品質は低下していません。個人データはどのクラウドにも送られませんでした。健康データは最高の保護の対象となります。この習慣が違反を防いだのです。

ケース 2 — まれな組み合わせのトラップ。 「38歳、女性、[非常に小さな郡]で唯一の薬剤師、専門職責任方針」とある専門家は書いている。これには厳密には名前が含まれていませんでしたが、彼がその地区で唯一の薬剤師であったため、彼の身元が直接明らかになりました。専門家はこれに気づき、「小規模集落、医療従事者」として一般化しました。匿名化は名前を削除するだけではなく、認識性を破壊します。

ケース 3 — 間違ったツールの選択。迅速化を図るため、従業員は顧客の請求の内訳を無料の公開ツールにアップロードします。チーム ポリシーが発効します。顧客データは、機関が承認した契約ツールでのみ処理されます。従業員はまずデータを匿名化し、承認されたツールで実行しました。未承認のツールが使用された場合、データの保管と教育での使用のリスクを制御できなくなります。

コピー可能な 4 つのプロンプト

1) 匿名化アシスタント:

次のテキストからすべての個人情報および個人を特定するデータを削除します: 名前、姓、ID、生年月日、電話番号、住所、保険証券番号、ナンバー プレート、権利証書、IBAN。分析的な意味を持つ事実に相当するものに置き換えます (例: 「45 歳、男性、保険契約、一方的な衝突」)。珍しい/特徴的な組み合わせ (狭い場所 + 特殊な職業) を一般化します。医学的/技術的な意味を保持します。テキスト: [貼り付け]

2) 認識性チェック:

次の匿名化されたテキストを確認して認識してください: [テキスト]質問: 見知らぬ人がこのテキストを使ってその人を見つけることができますか?まれな組み合わせ(少額決済 + 特定の職業/イベント)、固有の日付または金額はありますか?それぞれの危険な点を強調し、より安全に一般化する方法を提案します。

3) データ要件と分類:

次のタスクに必要なデータを分類して要件テストします。タスク: [説明] 私が持っているデータ: [リスト]各データ: タイプ (アイデンティティ/財務/特殊/ファイル)、このタスクに必要かどうか (はい/いいえ)、必要に応じて匿名で使用する方法。不要なデータは「使用しない」としてマークします。

4) 車両選択チェックリスト:

保険データを含む AI ツールを使用する前にチェックリストを作成します。質問を含めてください: 車両は機関によって承認されていますか?データ処理契約はありますか?トレーニングで入力を保存/使用しますか?データはどこで処理されますか?どのデータ型に適していますか?不適ですか?匿名化だけで十分ですか?

弱いプロンプト / 強いプロンプト

弱者: 「クライアント アフメット ユルマズ (TC 123...、医療報告書添付) のファイルを評価してください。」
問題: ID と機密 (健康) データが直接共有されます。 KVKK違反の大きなリスク。
ストロング: 「次の匿名化された状況を考えてみましょう: 52 歳、女性、補助医療政策、計画されている手術、金額について争われています。個人を特定できる情報はありません。」
これが良い理由: 分析の意味は保持され、ID や機密データは明らかにされません。

比較表

データ型

保護レベル

人工知能での利用

名前/TC/連絡先

高い

削除して同等のものを入れる

金融(収入/IBAN)

高い

削除/一般化

健康・特別な資格

最高の

決して生ではありません。匿名 + 承認済み車両

証券番号/プレート/権利証書

中~高

削除します。一人では危険です

集計/統計

低い

あり(連絡がない場合)

よくある間違い

  • 生の個人/健康データを貼り付けます。最も頻繁かつ最も重大な違反。
  • 名前を削除するだけで十分だと考えています。珍しい組み合わせでも正体が明らかになるかもしれません。
  • 「後で削除する」という言葉に頼る。ツールはトレーニング中にデータを保存または使用している可能性があります。
  • 無許可・公道運転。制御されていないデータ処理。
  • ストレージと共有を管理していない。出力を無制限に保存し、サードパーティと無制限に共有します。

要約すると

保険データは非常に機密です。健康などの特別なデータは、KVKK の下で最高の保護の対象となります。データを AI に渡す前に分類、異議申し立て、匿名化します。識別子を削除し、事実に相当するものを導入し、まれな組み合わせを一般化します。機密データは、機関が承認した契約ツールのみを使用し、最小限に処理してください。 KVKKの枠組み内で保管期間や第三者共有を管理し、痕跡を残します。特定のケースについてはコンプライアンス/法務を参照してください。漏洩したデータは回収できません。

アプリケーションタスク

実際のダメージ/参考テキストを取得します (テスト目的)。プロンプト #1 で匿名化し、プロンプト #2 で認識を確認します。テキストの中に、個人を明らかにする可能性のあるまれな組み合わせがまだありますか?見つかった各リスクを一般化します。また、使用する AI ツールをチェックリスト 4 で評価します。機密データに適していますか?

チェックリスト

  • [ ] データを種類別に分類してみました。
  • [ ] 必要性テストを適用しました。無駄なデータ通信はしませんでした。
  • [ ] 識別子を削除し、事実に相当するものに置き換えました。
  • [ ] 珍しい/特徴的な組み合わせを一般化しました。
  • [ ] 認識性チェックを行いました。
  • [ ] 会社が認めた契約車両のみを使用していました。
  • [ ] KVKK に従ってストレージとサードパーティの共有を管理しました。跡を残してしまいました。