单位 9 / 11

隐私、KVKK 和数据安全:保护怀孕数据

收益:

  • 能够区分使孕妇直接或间接可识别的数据,并在将其交给人工智能之前对其进行去识别处理
  • 能够应用数据最小化并养成在 KVKK 框架内仅使用机构批准的工具的习惯
  • “从这段文字中可以找到这个人吗?”能够通过应用测试来管理重新识别的风险

助产士是一个涉及人们最私人信息的职业:怀孕如何发生、过去怀孕、流产、流产、人际关系、精神状态、性健康。当这些信息落入坏人之手时,就会造成不可逆转的伤害——国内危机、社会耻辱、失去信任。因此,保密并不是助产行业的“附加规则”,而是这个职业的基础。一旦将人工智能引入您的业务,隐私的新领域就会打开:您在聊天助手中输入的任何内容都可能超出您的控制。本单元端到端地教您如何在使用人工智能时保护怀孕数据,特别是在 KVKK(个人数据保护法;土耳其规范个人数据处理的法律)的框架内。

基本原则就是一句话:任何能让孕妇被识别的信息都不应该进入人工智能工具。学习此规则优先于模块中的所有其他技能;因为一旦泄露的数据就无法找回。

注意:您在人工智能工具中输入的文本将发送到该服务的服务器;可以被存储、处理,并且在某些情况下用于模型训练。说“我只是想要一个摘要”不会返回数据。唯一安全的方法是从一开始就不要输入凭据。

什么是个人数据,哪些信息使其可识别?

个人数据是指可以直接或间接识别个人身份的任何信息。在助产领域,这些尤其属于特殊类别(例如健康数据,受到法律的最高保护)。考虑提供两组认可的信息:

直接标识符:姓名、TR ID 号、文件/协议号、电话、地址、电子邮件、出生日期、社交媒体帐户、照片。

间接描述词(组合起来使其可识别):“该社区唯一的三胞胎怀孕”、“机构中唯一第一次怀孕的44岁女性”、罕见疾病+小定居点、工作场所+孕龄。一些单独看来无伤大雅的细节放在一起时却能指出一个人。这称为重新识别风险。

去识别化是从文本中删除这些标识符的过程。做得好的去身份识别可以清除直接和间接标识符。

一步一步:在将数据提供给人工智能之前进行去识别化

  1. 删除直接标识符:姓名、ID、电话号码、文件号、地址、日期——全部删除。将其替换为“怀孕 A”、“38 岁左右”、“中期妊娠”等笼统说法。
  2. 模糊间接线索:将准确的年龄转化为范围(例如“40岁出头”),将精确的位置转化为区域,将罕见的组合转化为一般。
  3. 丢弃不必要的细节:提供人工智能完成其工作所需的最少信息(数据最小化)。写母乳喂养卡不需要孕妇的病史。
  4. 检查机构政策:一些机构定义了批准/机构的人工智能工具;可能禁止将患者数据输入个人/免费工具。遵守您所在机构的规则。
  5. 终读:在发送提示“从这段文字中可以找到这个人吗?”之前再读一遍。

这五个步骤中最困难的是第二步——模糊间接线索——因为删除直接标识​​符很容易并且首先想到,但大多数识别实际上来自于间接细节的组合。职业、年龄、居住地和罕见状况的结合可以将一个人简化为一个人,即使没有提到名字。因此,去身份化不应被视为“删除名字”,而应被视为“确保阅读本文的人无法猜出此人”。这种心理框架从根本上降低了重新识别的风险。

提示:一个很好的测试:如果你把去识别化的文本展示给认识那位孕妇的同事,她会说“这是某某”吗?如果他能这么说,说明你还没有足够地去辨识他。

三个迷你箱子

案例1——间接识别:助产士在向人工智能询问历史摘要时,省略了ID,只留下了“我们镇上唯一的四胞胎怀孕”这句话。这一句话,直接指向了那个小地方的人。他的同事注意到并警告他;助产士将这种表述概括为“多胎妊娠”。教训:间接标识符与直接标识符一样危险。

案例2——数据最小化:第二位助产士习惯性地将孕妇的整个文件粘贴到AI中,而不是仅仅打印出一本“怀孕营养”手册。事实是:宣传册不需要个人数据。他接过小册子,没有交出文件,只是写下了主题。最安全的数据是从不共享的数据。

案例 3 — 错误的工具:在第三个示例中,助产士正要在个人手机上的随机应用程序中输入患者信息,这时她想起了机构政策:患者数据只能使用机构批准的工具进行去识别化处理。不使用个人应用程序。数据泄露往往是由于这样的“方便”时刻而引起的,而不是由于技术错误而引起的。

可复制模板

角色:你是去识别控制助理。任务:标记下面文本中每个可以直接或间接识别一个人的表达方式:- 直接:姓名、身份证、电话、地址、文件号、确切日期、照片。- 间接:罕见组合、小地方+特殊情况、确切年龄、工作场所、独特/独特品质。为每个表达提出更安全的概括。文本:[文本]

角色:您是一名数据最小化顾问。任务:我想做这份工作:[工作]。为了做到这一点,我必须向您提供的最少信息是什么?将不需要的患者信息标记为“[不提供]”。

角色:您是安全摘要助理。任务:总结下面的 DIDIDENTIFIED 故事。如果你在文中看到识别信息,不要总结;而是写“我检测到凭据,请清除并重新发送。”故事:[故事]

机构政策提醒清单(问问自己):- 此工具是否得到我的机构批准?- 我输入的数据中是否有任何个人身份信息?- 这项工作是否真的需要此信息?- 我认识的人如果阅读文本可以找到此人吗?- 保存输出时我会添加身份信息吗?

弱提示/强提示

弱:“Ayşe Y.,39 岁,第三次怀孕,在以下医院,档案号 4412;总结一下她的病史。”

这个提示充满了直接标识符;私人数据一发出就被泄露。

强:

作用:安全汇总助手。总结以下匿名历史。 “怀孕的A,30多岁,第三次怀孕,[相关医疗细节匿名]。”如果您在文本中看到识别信息,请勿总结,警告。

区别:强版本没有直接/间接标识符;只需要完成这项工作所需的无身份上下文即可。安全性在写入提示之前启动。

什么可以分享,什么不可以分享

信息类型

它属于人工智能吗?

另类

姓名、TR ID、电话、地址、档案号

从不

《怀孕的A》

确切年龄/确切日期

年龄范围/三个月

稀有+小地方组合

概括

一般医学背景(匿名)

是的,如果需要的话

应用数据最小化

照片/图像

否(脸部/标志)

没有必要

车辆未经机构批准

无患者数据

认可车辆

常见错误

  • 只是删除名字并留下间接线索:重新识别的风险仍然存在。
  • 为了“方便”而粘贴整个文件:违反了数据最小化原则。
  • 将患者数据输入个人/未经批准的设备:这可能违反机构政策和 KVKK。
  • 共享照片/屏幕截图:图像中的脸部、姓名和文件编号可以保密。
  • 在保存输出时添加 ID:向没有 ID 的输出添加 ID 会带来风险。
  • 假设“无论如何它都会被删除”:你不知道数据是什么;唯一的保证就是根本不发送任何东西。

总之

使用人工智能时,隐私是先决条件,而不是技术细节。任何能够直接(姓名、身份证、电话)或间接(罕见组合+小位置)识别孕妇的信息都不应该进入人工智能工具。实践数据最小化——提供完成工作所需的最少信息——并仅使用组织批准的工具。不发送提示“从这段文字中可以找到这个人吗?”做测试。一旦泄露,数据无法找回;因此,安全性在写入提示之前就开始了。

应用任务

获取真实的怀孕史(在纸上),并使用去识别模板逐步清除文本:首先是直接标识符,然后是间接标识符。将清除的文本展示给同事并询问“这可能是谁?”问;如果你能认出它,就进一步概括它。还要找到您自己机构的人工智能/数据政策,用一句话概括它,并记下哪些工具获得批准。

清单

  • [ ] 我删除了所有直接标识符(姓名、ID、电话、地址、文件号)。
  • [ ] 我概括了间接描述符(罕见的组合、小位置、确切的年龄)。
  • [ ] 我只提供了完成这项工作所需的最少信息。
  • [ ] 我仅使用了我所在机构认可的工具。
  • [ ]“从这段文字中可以找到这个人吗?”我做了测试。
  • [ ] 之后我没有在输出中添加任何凭据。