收益:
- 了解为什么基因数据是个人数据的特殊类别以及重新识别的风险
- 在向开放人工智能工具提供患者数据之前,能够应用匿名、同意和数据最小化原则
- 能够在 KVKK/GDPR 等框架内接受遗传数据处理和职业道德责任的限制
基因数据不是普通的个人数据。一个人的 DNA 序列;它唯一地识别您,无法更改(您可以更改您的密码,但不能更改您的基因组),可以揭示未来的疾病风险,并且不仅涉及个人,而且涉及所有有血缘关系的家庭成员。因此,在处理遗传数据时使用人工智能 (AI) 需要最高标准的保密性和道德标准。在本单元中,您将了解为什么基因数据必须受到特殊保护,使用人工智能工具时哪些错误会产生严重后果,以及安全的工作纪律。
关键原则:切勿将可识别的患者基因数据粘贴到公开可用的人工智能工具中。许多通用人工智能服务可以处理您输入的数据、存储数据或使用它来改进模型。当患者的罕见变异组合、姓名、身份证号码或出生日期被输入工具时,可能会发生不可逆转的隐私侵犯。
使遗传数据与众不同的五个特征
- 不变性:基因组在一生中都是相同的;如果披露,则无法“取消”。
- 身份:即使是少量的罕见变异也可以唯一地识别一个人;被认为是“匿名”的数据可以被重新识别。
- 家庭规模:一个人的基因组还包含其亲属的遗传信息;未经他们同意,信息可能会被披露。
- 可预测性:可以预示未来的疾病风险;保险可能成为就业歧视的理由。
- 重新识别风险:基因组数据可以通过与其他数据库交叉来与身份相关联。
法律框架:简要概述
基因数据在数据保护立法中属于特殊(敏感)个人数据范畴,受到更为严格的保护。在土耳其,KVKK(个人数据保护法)将健康和遗传数据视为特殊数据,并且通常将其处理绑定到明确同意或特殊例外。在欧洲,GDPR 同样将基因数据作为一个特殊类别进行保护。在美国,GINA 法禁止基于基因信息的保险和就业歧视。尽管各国的具体细节有所不同,但共同的原则是相同的:未经明确同意、目的限制和强有力的保护,基因数据不得被处理。
提示:当获得患者同意进行基因检测时,披露的内容可能包括人工智能工具将如何处理数据。 “我们使用什么工具以及在哪里处理您的数据进行分析?”能够透明地回答问题。
一步一步:使用安全的人工智能和秘密遗传数据
1. 分类。您所拥有的数据可以被识别吗?它是否包含姓名、身份证号码、日期、罕见变体的组合?
2. 匿名或根本不转移。删除直接标识符;但请记住,遗传数据中的“匿名化”并不能提供充分的保证。最安全的做法是根本不将个人身份数据引入开放式车辆中。
3. 阅读该工具的数据政策。选择企业工具、具有数据处理协议 (DPA)、承诺不在教育中使用数据,并且最好在本地/密切合作。
4. 将概念问题与数据分开。 “如何应用ACMG PM2?”您可以询问人工智能概念性问题,例如:为此不需要患者数据。仅在必要时以匿名形式使用数据。
5. 保存轨迹。记录您处理哪些数据、使用哪种工具以及出于什么目的;可审计性是一项道德和法律要求。
三个迷你箱子
案例 1 — 粘贴报告。为了加快速度,助理将包含患者全名和变异列表的报告粘贴到通用人工智能聊天中,并说“总结”。高级专家意识到了这一点:姓名和罕见变异一起识别了患者,并且该工具存储了数据。该事件需要隐私泄露通知。教训:即使是摘要,也不会传输任何识别数据。
案例 2——家人同意。在使用患者的数据时,一名研究人员告诉 AI,他的兄弟姐妹中也发现了该变异。然而,弟弟不同意处理他的数据。遗传数据的家庭方面也带来了第三方隐私的问题;调查员提取了有关兄弟的信息。
案例 3 — 获得确认。一个实验室在分析前实施了“匿名检查表”。他们提取姓名、身份证号码和日期,然后将其交给人工智能;此外,他们意识到仅靠一种非常罕见的变体组合就可以确定身份,并且根本没有报告该样本。如果没有清单,被认为是“匿名”的数据可能会被重新识别。
四个可复制模板
1)匿名化控制:
在将此文本输入人工智能工具之前,列出其中可以识别患者或其亲属的所有元素(姓名、ID 号、日期、地址、罕见变异组合、罕见表型)。对于每个,建议“省略”或“根本不转移样本”:[文本]。
2)概念问题(无数据):
在不共享患者数据的情况下,回答这个概念性问题:[ACMG/方法问题]。使用常见示例;我不需要真实的患者信息。
3)同意和透明度控制:
帮助我起草基因检测的信息/同意文本。它应该包括:数据的处理目的、使用什么类型的工具进行分析、涉及家庭成员的结果将如何处理、存储和删除。请参阅法律/道德部门的法律决定。
4)车辆选择标准:
在选择处理敏感遗传数据的人工智能/分析工具时,我应该询问哪些隐私标准(数据处理协议、承诺不在教育中使用、本地操作、访问控制、删除)?创建评估清单。
弱提示/强提示
弱:“评论 Ahmet Yılmaz 的(TC:...)BRCA1 结果:[完整变体列表]。”
问题:直接标识符+基因数据进入开放工具;严重违反保密规定。
Güçlü:“在不透露任何人身份的情况下,用一个一般性的例子解释一下 ACMG 是如何评估 BRCA1 中的移码变异的。我不分享实际的患者数据。”
为什么它强大:满足学习/评估需求,但不传输任何识别数据。
数据类型
是否进入开放AI工具?
另类
患者姓名/身份证号码
从不
不转帐
稀有变种+历史
从来没有(表明)
转移样品
概念问题
是的
一般示例
匿名的常见例子
小心
企业/本地工具
汇总、匿名统计数据
视情况而定
配备 DPA 的车辆
常见错误
- 将识别数据粘贴为“仅用于摘要”。无论出于何种目的,这都是违法行为。
- 将基因数据的“匿名化”误认为是完全安全的。可以重新识别。
- 忘记了家庭方面。一个人的数据还可以揭示其亲属。
- 不阅读车辆的数据政策。数据可以在训练中使用或存储。
- 不保留跟踪记录。如果没有可控性,责任就无法体现。
注意:大多数时候,侵犯隐私行为并不是出于恶意,而是出于“快速处理”的本能反应。最大的风险是在随意的工作流程中盲目地将报告粘贴到聊天窗口中。减速;遗传数据没有撤消按钮。
深度:重新识别和安全架构的真正数学
为什么认为“我删除了名字,现在是匿名的”是错误的?因为不需要名字来识别一个人;罕见功能的组合就足够了。根据一项经典发现,出生日期+性别+邮政编码三者可以识别出绝大多数美国人口。在遗传学中,情况更为尖锐:几种罕见变异(每种变异在人群中的出现率甚至是千分之一,加起来不到百万分之一)的组合都指向一个个体。此外,基因组数据可以与家谱数据库交叉,将个人与亲属的身份联系起来,即使该个人没有在其他地方提供任何数据——这是文献中已经证明的一种真正的攻击形式。
因此,保存需要超越“删除标识符”反射的架构决策。实用的选择:使用本地/自托管模型,永远不要将数据留在机构边界之外;如果要使用云,请选择具有数据处理协议(DPA)并承诺“不在培训中使用输入”的企业级;尽可能使用派生的汇总信息,而不是特定于患者的原始数据;并限制访问遵循最小特权原则。
具体案例:某中心将一系列“匿名”案例总结为通用人工智能工具。数据集不包含姓名,但每个患者都有罕见诊断+年龄+城市的组合;当与当地报纸的报道相比较时,就可以识别出病人的身份。缺乏原始标识符并不排除重新识别。
保护层
提供什么
限制
标识符删除
直接删除ID
罕见的组合仍然存在
本地/自托管模型
数据不会离开机构
安装/维护负担
DPA+ 不用于教育
法律/合同保证
有必要阅读政策
聚合/派生
减少个人疤痕
限制分析深度
综上所述
- 遗传数据是特殊的、不可变的、可识别的、与家族相关的数据;需要最高标准的保护。
- 可识别的患者基因数据永远不会输入到开放的人工智能工具中;概念问题与数据分开。
- KVKK、GDPR、GINA 等框架需要明确同意、目的限制和强有力的保护。
- 匿名并不能完全保证;最安全的事情是根本不传输关键数据。
应用任务
接收样本(虚构)基因报告。使用模板 1,列出其中的所有标识元素,并决定是否对每个元素“省略”或“不转移”。然后在没有任何识别数据的情况下重写相同的临床问题(使用模板 2 逻辑)。用一句话描述两个版本之间的隐私差异。
清单
- [ ] 我根据身份对数据进行了分类。
- [ ] 我没有将个人身份数据引入开放工具中。
- [ ] 我观察到可以识别出罕见变异的组合。
- [ ] 我检查了该工具的数据政策(保留、培训、DPA)。
- [ ] 我考虑了家庭方面和第三方同意。
- [ ] 我记录了交易轨迹,并在必要时将其转发给道德/法律部门。