单位 7 / 12

数据处理、存储、最小化和匿名化

收益:

  • 在数据生命周期的每个阶段应用人工智能考虑因素
  • 设置保留期限并将 AI 聊天记录纳入销毁政策
  • 应用匿名化和假名化之间的区别

数据的“之后”部分是数据保护官员经常忽视的地方。一旦文本输入人工智能,看起来工作就完成了;然而,这些数据存储在某个地方,可能用于模型训练,也可能在聊天历史记录中累积数月。在本单元中,我们将逐步讨论个人数据的生命周期;我们将了解保留期、人工智能聊天历史记录的销毁,以及区分两种关键技术——匿名化和假名化。目标是在数据的整个生命周期中对其进行管理,而不仅仅是在数据输入时进行管理。

数据生命周期和人工智能

个人数据有一个生命周期;每个阶段都有AI特定的关注点。

舞台

会发生什么?

AI关注点

收藏

获取数据

目的和依据是否明确?是否已被最小化?

使用/加工

进入AI,进行处理

是否已进行屏蔽?批准的车辆?

存储

数据被保留

聊天记录可以保存多久?

转移

去别人那里

国际服务器?有适当的保证吗?

毁灭

删除/匿名化

目的完成后是否被删除?包括备件吗?

最容易被忽视的两个阶段是储存和处置。数据被“遗忘”并继续在系统中累积——这既违反了 KVKK 原则,又放大了违规时的损失。

保存时间:可以保存多久?

KVKK 的保留原则很明确:个人数据的保留时间不得超过其处理目的所需的时间。当目的不再可用时,数据应被删除、销毁或匿名化。该机构制定储存和处置政策;确定每个类别的数据保留多少。

AI 的关键点:AI 聊天记录也是存储的数据。如果员工在同一个聊天中输入客户数据数月,那么该历史记录就会成为一个数据存储库。为此:

  • 在企业 AI 工具中配置数据保留设置(如果可能,自动删除历史记录或关闭模型训练中的使用)。
  • 将聊天记录纳入您的销毁计划中。
  • 确保公司合同中的“请勿在模型培训中使用”(选择退出)选项。
注意:删除数据不仅仅是将其从屏幕上删除。还应考虑提供商服务器上的备份、日志和副本。当您说“已删除”时,请确保您删除的内容确实无法恢复。

匿名还是假名?

这两个术语经常被混淆,但它们的法律后果却截然相反。

  • 匿名化:制作数据,使其无法以任何方式与个人相关联。如果操作正确,结果将不再是个人数据,并且不属于 KVKK 的范围。示例:删除 10,000 人的数据集中的各个行,只留下聚合统计信息,例如“伊斯坦布尔 25-34 岁年龄段的平均支出”。
  • 假名化:身份信息被代码/标签取代,但可以通过“密钥”返回给该人。示例:编写“Customer-4471”而不是“Ahmet Yılmaz”,但保留一个表格显示哪个代码属于谁。这仍然是个人数据,属于 KVKK 的范围。

特征

匿名化

假名化

人可以归还吗?

否(如果操作正确)

是的,有钥匙

仍然是个人数据吗?

是的

KVKK范围

外面

进入人工智能领域

最安全的方法

再次强调,需要一个基础/规则

提示:“它可以逆转吗?”在将数据输入人工智能之前。问。如果其中有密钥/匹配,则它是假名的并且仍然是个人数据。真正的匿名化是共享聚合结果,而不是单个行。

三个迷你箱子

案例 1——假匿名。一家医疗保健公司向人工智能提供了一组数据,并称其已“匿名化”以供分析。但该集合包括出生日期、县和罕见的诊断;这个三人组可能表示一个小县的一个人。这不是匿名化;而是匿名化。数据仍然是个人的。正确的做法是:将出生日期转换为年龄范围,按县进行概括,对罕见诊断进行分组——即真正的聚合。

案例 2——对话堆积。在呼叫中心,6 名客服人员将客户数据输入同一个企业 AI 账户,持续 4 个月。没有人能够清除过去;最终,超过 12,000 次客户互动累积在一处。在审计中,这种积累被标记为主要风险。解决方案:设置每30天自动删除历史记录、作业完成后注销的规则以及对保留策略开放的条款。

案例 3 — 正确的假名。在使用人工智能分析员工绩效时,人力资源团队会对“Employee-001”等名称进行编码,并将匹配表保存在一个单独的、访问受限的文件中。这是化名;数据仍然是个人的,但风险降低了。团队意识到这不是匿名,并相应地确定其法律依据和保留期限。

可复制模板

模板 1 — 保留和销毁政策线:“为以下数据类别提出保留-销毁政策线:[类别]。字段:保留期限(根据目的证明)、销毁方法(删除/销毁/匿名化)、是否包含 AI 聊天记录、责任角色。提醒是否存在法定保留义务。”

模板 2 — 匿名检查:“评估以下数据集是否真正匿名:[列表字段]。哪些字段组合可以使一个人重新识别(例如出生日期 + 邮政编码 + 罕见特征)?建议对每个风险字段(例如年龄范围、省级)进行概括以加强匿名性。”

模板 3 — 屏蔽 + 返回键分隔:“化名以下文本:对个人数据进行编码(如 [NAME]->K001),但单独给我一个匹配表。在文本本身中不要留下任何真实身份。请注意,匹配表是‘个人数据’,应单独存储。”

模板 4 — AI 工具数据存储审核:“准备一系列问题来审核我们使用的 AI 工具的数据存储行为:历史记录保留多长时间、是否可以删除、是否用于模型训练、是否有选择退出、数据在哪里处理、有哪些备份?为每个问题写下预期的‘安全’答案。”

弱提示/强提示

弱:“匿名化这些数据。” (编码并留下名字)-> 只是昵称;重新识别风险依然存在,例如出生日期、稀有特征;它造成了“匿名”的错觉。 GÜÇLÜ:“在这个集合中找到可以重新识别该人的字段组合;概括每个字段(年龄范围、省级)。我的目标不是单个记录,而是汇总统计数据。因此,没有人可以被区分为单个人并验证这一点。” -> 该模型倾向于真正的匿名化,降低重新识别的风险。

常见错误

  • 将假名误认为匿名;忘记它仍然是个人数据。
  • 删除名字并留下描述性组合,例如出生日期+地点+稀有特征。
  • 不让人工智能聊天记录受到保留/销毁规则的约束;无限累积。
  • 不确保合同中的“请勿在模型训练中使用”(选择退出)条款。
  • 当我说删除时,我的意思是清除屏幕并忘记备份和日志。
  • 延长保存期限是为了“以防万一”,而不是为了目的。
  • 忽略传输和存储也发生在提供商的服务器上。

综上所述

  • 个人数据有一个生命周期;最容易被忽视的阶段是储存和处置。
  • 数据的保存时间不得超过该目的所需的时间;机构应制定储存和销毁政策。
  • AI聊天记录也是存储的数据;应包含在处置计划和储存设置中。
  • 匿名化将数据从 KVKK 中取出;假名化仍然会使数据变得私密。
  • 删除名字并不是匿名化,而是匿名化。所有有重新识别风险的组合都应该被概括。

应用任务

选择您的组织使用 AI 处理的数据类别(例如客户支持记录)。为该类别编写保留和销毁政策线:保留期限(合理)、销毁方式、是否包含AI聊天记录、责任角色。然后从相同的数据中获取一个样本记录,并首先对其进行假名化(将匹配表分开),然后编写您将概括哪些字段以及如何使该记录真正匿名化。最后,准备五个控制你使用的人工智能工具的数据存储行为的问题,并为每个问题添加你期望的“安全”答案。

清单

  • [ ] 我已经确定了该数据类别的保留期限和销毁方式。
  • [ ] 我已将AI聊天记录纳入销毁计划中。
  • [ ] 我检查了“不要在模型训练中使用”选择退出项。
  • [ ] 我实现了假名化和匿名化的区别。
  • [ ] 我已经概括了存在重新识别风险的字段组合。
  • [ ] 我也将备份和日志纳入删除范围。
  • [ ] 我审核了AI工具的数据存储行为。