收益:
- 在数据生命周期的每个阶段应用人工智能考虑因素
- 设置保留期限并将 AI 聊天记录纳入销毁政策
- 应用匿名化和假名化之间的区别
数据的“之后”部分是数据保护官员经常忽视的地方。一旦文本输入人工智能,看起来工作就完成了;然而,这些数据存储在某个地方,可能用于模型训练,也可能在聊天历史记录中累积数月。在本单元中,我们将逐步讨论个人数据的生命周期;我们将了解保留期、人工智能聊天历史记录的销毁,以及区分两种关键技术——匿名化和假名化。目标是在数据的整个生命周期中对其进行管理,而不仅仅是在数据输入时进行管理。
数据生命周期和人工智能
个人数据有一个生命周期;每个阶段都有AI特定的关注点。
舞台
会发生什么?
AI关注点
收藏
获取数据
目的和依据是否明确?是否已被最小化?
使用/加工
进入AI,进行处理
是否已进行屏蔽?批准的车辆?
存储
数据被保留
聊天记录可以保存多久?
转移
去别人那里
国际服务器?有适当的保证吗?
毁灭
删除/匿名化
目的完成后是否被删除?包括备件吗?
最容易被忽视的两个阶段是储存和处置。数据被“遗忘”并继续在系统中累积——这既违反了 KVKK 原则,又放大了违规时的损失。
保存时间:可以保存多久?
KVKK 的保留原则很明确:个人数据的保留时间不得超过其处理目的所需的时间。当目的不再可用时,数据应被删除、销毁或匿名化。该机构制定储存和处置政策;确定每个类别的数据保留多少。
AI 的关键点:AI 聊天记录也是存储的数据。如果员工在同一个聊天中输入客户数据数月,那么该历史记录就会成为一个数据存储库。为此:
- 在企业 AI 工具中配置数据保留设置(如果可能,自动删除历史记录或关闭模型训练中的使用)。
- 将聊天记录纳入您的销毁计划中。
- 确保公司合同中的“请勿在模型培训中使用”(选择退出)选项。
注意:删除数据不仅仅是将其从屏幕上删除。还应考虑提供商服务器上的备份、日志和副本。当您说“已删除”时,请确保您删除的内容确实无法恢复。
匿名还是假名?
这两个术语经常被混淆,但它们的法律后果却截然相反。
- 匿名化:制作数据,使其无法以任何方式与个人相关联。如果操作正确,结果将不再是个人数据,并且不属于 KVKK 的范围。示例:删除 10,000 人的数据集中的各个行,只留下聚合统计信息,例如“伊斯坦布尔 25-34 岁年龄段的平均支出”。
- 假名化:身份信息被代码/标签取代,但可以通过“密钥”返回给该人。示例:编写“Customer-4471”而不是“Ahmet Yılmaz”,但保留一个表格显示哪个代码属于谁。这仍然是个人数据,属于 KVKK 的范围。
特征
匿名化
假名化
人可以归还吗?
否(如果操作正确)
是的,有钥匙
仍然是个人数据吗?
不
是的
KVKK范围
外面
在
进入人工智能领域
最安全的方法
再次强调,需要一个基础/规则
提示:“它可以逆转吗?”在将数据输入人工智能之前。问。如果其中有密钥/匹配,则它是假名的并且仍然是个人数据。真正的匿名化是共享聚合结果,而不是单个行。
三个迷你箱子
案例 1——假匿名。一家医疗保健公司向人工智能提供了一组数据,并称其已“匿名化”以供分析。但该集合包括出生日期、县和罕见的诊断;这个三人组可能表示一个小县的一个人。这不是匿名化;而是匿名化。数据仍然是个人的。正确的做法是:将出生日期转换为年龄范围,按县进行概括,对罕见诊断进行分组——即真正的聚合。
案例 2——对话堆积。在呼叫中心,6 名客服人员将客户数据输入同一个企业 AI 账户,持续 4 个月。没有人能够清除过去;最终,超过 12,000 次客户互动累积在一处。在审计中,这种积累被标记为主要风险。解决方案:设置每30天自动删除历史记录、作业完成后注销的规则以及对保留策略开放的条款。
案例 3 — 正确的假名。在使用人工智能分析员工绩效时,人力资源团队会对“Employee-001”等名称进行编码,并将匹配表保存在一个单独的、访问受限的文件中。这是化名;数据仍然是个人的,但风险降低了。团队意识到这不是匿名,并相应地确定其法律依据和保留期限。
可复制模板
模板 1 — 保留和销毁政策线:“为以下数据类别提出保留-销毁政策线:[类别]。字段:保留期限(根据目的证明)、销毁方法(删除/销毁/匿名化)、是否包含 AI 聊天记录、责任角色。提醒是否存在法定保留义务。”
模板 2 — 匿名检查:“评估以下数据集是否真正匿名:[列表字段]。哪些字段组合可以使一个人重新识别(例如出生日期 + 邮政编码 + 罕见特征)?建议对每个风险字段(例如年龄范围、省级)进行概括以加强匿名性。”
模板 3 — 屏蔽 + 返回键分隔:“化名以下文本:对个人数据进行编码(如 [NAME]->K001),但单独给我一个匹配表。在文本本身中不要留下任何真实身份。请注意,匹配表是‘个人数据’,应单独存储。”
模板 4 — AI 工具数据存储审核:“准备一系列问题来审核我们使用的 AI 工具的数据存储行为:历史记录保留多长时间、是否可以删除、是否用于模型训练、是否有选择退出、数据在哪里处理、有哪些备份?为每个问题写下预期的‘安全’答案。”
弱提示/强提示
弱:“匿名化这些数据。” (编码并留下名字)-> 只是昵称;重新识别风险依然存在,例如出生日期、稀有特征;它造成了“匿名”的错觉。 GÜÇLÜ:“在这个集合中找到可以重新识别该人的字段组合;概括每个字段(年龄范围、省级)。我的目标不是单个记录,而是汇总统计数据。因此,没有人可以被区分为单个人并验证这一点。” -> 该模型倾向于真正的匿名化,降低重新识别的风险。
常见错误
- 将假名误认为匿名;忘记它仍然是个人数据。
- 删除名字并留下描述性组合,例如出生日期+地点+稀有特征。
- 不让人工智能聊天记录受到保留/销毁规则的约束;无限累积。
- 不确保合同中的“请勿在模型训练中使用”(选择退出)条款。
- 当我说删除时,我的意思是清除屏幕并忘记备份和日志。
- 延长保存期限是为了“以防万一”,而不是为了目的。
- 忽略传输和存储也发生在提供商的服务器上。
综上所述
- 个人数据有一个生命周期;最容易被忽视的阶段是储存和处置。
- 数据的保存时间不得超过该目的所需的时间;机构应制定储存和销毁政策。
- AI聊天记录也是存储的数据;应包含在处置计划和储存设置中。
- 匿名化将数据从 KVKK 中取出;假名化仍然会使数据变得私密。
- 删除名字并不是匿名化,而是匿名化。所有有重新识别风险的组合都应该被概括。
应用任务
选择您的组织使用 AI 处理的数据类别(例如客户支持记录)。为该类别编写保留和销毁政策线:保留期限(合理)、销毁方式、是否包含AI聊天记录、责任角色。然后从相同的数据中获取一个样本记录,并首先对其进行假名化(将匹配表分开),然后编写您将概括哪些字段以及如何使该记录真正匿名化。最后,准备五个控制你使用的人工智能工具的数据存储行为的问题,并为每个问题添加你期望的“安全”答案。
清单
- [ ] 我已经确定了该数据类别的保留期限和销毁方式。
- [ ] 我已将AI聊天记录纳入销毁计划中。
- [ ] 我检查了“不要在模型训练中使用”选择退出项。
- [ ] 我实现了假名化和匿名化的区别。
- [ ] 我已经概括了存在重新识别风险的字段组合。
- [ ] 我也将备份和日志纳入删除范围。
- [ ] 我审核了AI工具的数据存储行为。