单位 10 / 11

道德、隐私和数据保护:基因数据的特殊责任

收益:

  • 了解为什么基因数据是个人数据的特殊类别以及重新识别的风险
  • 在向开放人工智能工具提供患者数据之前,能够应用匿名、同意和数据最小化原则
  • 能够在 KVKK/GDPR 等框架内接受遗传数据处理和职业道德责任的限制

基因数据不是普通的个人数据。一个人的 DNA 序列;它唯一地识别您,无法更改(您可以更改您的密码,但不能更改您的基因组),可以揭示未来的疾病风险,并且不仅涉及个人,而且涉及所有有血缘关系的家庭成员。因此,在处理遗传数据时使用人工智能 (AI) 需要最高标准的保密性和道德标准。在本单元中,您将了解为什么基因数据必须受到特殊保护,使用人工智能工具时哪些错误会产生严重后果,以及安全的工作纪律。

关键原则:切勿将可识别的患者基因数据粘贴到公开可用的人工智能工具中。许多通用人工智能服务可以处理您输入的数据、存储数据或使用它来改进模型。当患者的罕见变异组合、姓名、身份证号码或出生日期被输入工具时,可能会发生不可逆转的隐私侵犯。

使遗传数据与众不同的五个特征

  1. 不变性:基因组在一生中都是相同的;如果披露,则无法“取消”。
  2. 身份:即使是少量的罕见变异也可以唯一地识别一个人;被认为是“匿名”的数据可以被重新识别。
  3. 家庭规模:一个人的基因组还包含其亲属的遗传信息;未经他们同意,信息可能会被披露。
  4. 可预测性:可以预示未来的疾病风险;保险可能成为就业歧视的理由。
  5. 重新识别风险:基因组数据可以通过与其他数据库交叉来与身份相关联。

法律框架:简要概述

基因数据在数据保护立法中属于特殊(敏感)个人数据范畴,受到更为严格的保护。在土耳其,KVKK(个人数据保护法)将健康和遗传数据视为特殊数据,并且通常将其处理绑定到明确同意或特殊例外。在欧洲,GDPR 同样将基因数据作为一个特殊类别进行保护。在美国,GINA 法禁止基于基因信息的保险和就业歧视。尽管各国的具体细节有所不同,但共同的原则是相同的:未经明确同意、目的限制和强有力的保护,基因数据不得被处理。

提示:当获得患者同意进行基因检测时,披露的内容可能包括人工智能工具将如何处理数据。 “我们使用什么工具以及在哪里处理您的数据进行分析?”能够透明地回答问题。

一步一步:使用安全的人工智能和秘密遗传数据

1. 分类。您所拥有的数据可以被识别吗?它是否包含姓名、身份证号码、日期、罕见变体的组合?

2. 匿名或根本不转移。删除直接标识​​符;但请记住,遗传数据中的“匿名化”并不能提供充分的保证。最安全的做法是根本不将个人身份数据引入开放式车辆中。

3. 阅读该工具的数据政策。选择企业工具、具有数据处理协议 (DPA)、承诺不在教育中使用数据,并且最好在本地/密切合作。

4. 将概念问题与数据分开。 “如何应用ACMG PM2?”您可以询问人工智能概念性问题,例如:为此不需要患者数据。仅在必要时以匿名形式使用数据。

5. 保存轨迹。记录您处理哪些数据、使用哪种工具以及出于什么目的;可审计性是一项道德和法律要求。

三个迷你箱子

案例 1 — 粘贴报告。为了加快速度,助理将包含患者全名和变异列表的报告粘贴到通用人工智能聊天中,并说“总结”。高级专家意识到了这一点:姓名和罕见变异一起识别了患者,并且该工具存储了数据。该事件需要隐私泄露通知。教训:即使是摘要,也不会传输任何识别数据。

案例 2——家人同意。在使用患者的数据时,一名研究人员告诉 AI,他的兄弟姐妹中也发现了该变异。然而,弟弟不同意处理他的数据。遗传数据的家庭方面也带来了第三方隐私的问题;调查员提取了有关兄弟的信息。

案例 3 — 获得确认。一个实验室在分析前实施了“匿名检查表”。他们提取姓名、身份证号码和日期,然后将其交给人工智能;此外,他们意识到仅靠一种非常罕见的变体组合就可以确定身份,并且根本没有报告该样本。如果没有清单,被认为是“匿名”的数据可能会被重新识别。

四个可复制模板

1)匿名化控制:

在将此文本输入人工智能工具之前,列出其中可以识别患者或其亲属的所有元素(姓名、ID 号、日期、地址、罕见变异组合、罕见表型)。对于每个,建议“省略”或“根本不转移样本”:[文本]。

2)概念问题(无数据):

在不共享患者数据的情况下,回答这个概念性问题:[ACMG/方法问题]。使用常见示例;我不需要真实的患者信息。

3)同意和透明度控制:

帮助我起草基因检测的信息/同意文本。它应该包括:数据的处理目的、使用什么类型的工具进行分析、涉及家庭成员的结果将如何处理、存储和删除。请参阅法律/道德部门的法律决定。

4)车辆选择标准:

在选择处理敏感遗传数据的人工智能/分析工具时,我应该询问哪些隐私标准(数据处理协议、承诺不在教育中使用、本地操作、访问控制、删除)?创建评估清单。

弱提示/强提示

弱:“评论 Ahmet Yılmaz 的(TC:...)BRCA1 结果:[完整变体列表]。”

问题:直接标识符+基因数据进入开放工具;严重违反保密规定。

Güçlü:“在不透露任何人身份的情况下,用一个一般性的例子解释一下 ACMG 是如何评估 BRCA1 中的移码变异的。我不分享实际的患者数据。”

为什么它强大:满足学习/评估需求,但不传输任何识别数据。

数据类型

是否进入开放AI工具?

另类

患者姓名/身份证号码

从不

不转帐

稀有变种+历史

从来没有(表明)

转移样品

概念问题

是的

一般示例

匿名的常见例子

小心

企业/本地工具

汇总、匿名统计数据

视情况而定

配备 DPA 的车辆

常见错误

  • 将识别数据粘贴为“仅用于摘要”。无论出于何种目的,这都是违法行为。
  • 将基因数据的“匿名化”误认为是完全安全的。可以重新识别。
  • 忘记了家庭方面。一个人的数据还可以揭示其亲属。
  • 不阅读车辆的数据政策。数据可以在训练中使用或存储。
  • 不保留跟踪记录。如果没有可控性,责任就无法体现。
注意:大多数时候,侵犯隐私行为并不是出于恶意,而是出于“快速处理”的本能反应。最大的风险是在随意的工作流程中盲目地将报告粘贴到聊天窗口中。减速;遗传数据没有撤消按钮。

深度:重新识别和安全架构的真正数学

为什么认为“我删除了名字,现在是匿名的”是错误的?因为不需要名字来识别一个人;罕见功能的组合就足够了。根据一项经典发现,出生日期+性别+邮政编码三者可以识别出绝大多数美国人口。在遗传学中,情况更为尖锐:几种罕见变异(每种变异在人群中的出现率甚至是千分之一,加起来不到百万分之一)的组合都指向一个个体。此外,基因组数据可以与家谱数据库交叉,将个人与亲属的身份联系起来,即使该个人没有在其他地方提供任何数据——这是文献中已经证明的一种真正的攻击形式。

因此,保存需要超越“删除标识符”反射的架构决策。实用的选择:使用本地/自托管模型,永远不要将数据留在机构边界之外;如果要使用云,请选择具有数据处理协议(DPA)并承诺“不在培训中使用输入”的企业级;尽可能使用派生的汇总信息,而不是特定于患者的原始数据;并限制访问遵循最小特权原则。

具体案例:某中心将一系列“匿名”案例总结为通用人工智能工具。数据集不包含姓名,但每个患者都有罕见诊断+年龄+城市的组合;当与当地报纸的报道相比较时,就可以识别出病人的身份。缺乏原始标识符并不排除重新识别。

保护层

提供什么

限制

标识符删除

直接删除ID

罕见的组合仍然存在

本地/自托管模型

数据不会离开机构

安装/维护负担

DPA+ 不用于教育

法律/合同保证

有必要阅读政策

聚合/派生

减少个人疤痕

限制分析深度

综上所述

  • 遗传数据是特殊的、不可变的、可识别的、与家族相关的数据;需要最高标准的保护。
  • 可识别的患者基因数据永远不会输入到开放的人工智能工具中;概念问题与数据分开。
  • KVKK、GDPR、GINA 等框架需要明确同意、目的限制和强有力的保护。
  • 匿名并不能完全保证;最安全的事情是根本不传输关键数据。

应用任务

接收样本(虚构)基因报告。使用模板 1,列出其中的所有标识元素,并决定是否对每个元素“省略”或“不转移”。然后在没有任何识别数据的情况下重写相同的临床问题(使用模板 2 逻辑)。用一句话描述两个版本之间的隐私差异。

清单

  • [ ] 我根据身份对数据进行了分类。
  • [ ] 我没有将个人身份数据引入开放工具中。
  • [ ] 我观察到可以识别出罕见变异的组合。
  • [ ] 我检查了该工具的数据政策(保留、培训、DPA)。
  • [ ] 我考虑了家庭方面和第三方同意。
  • [ ] 我记录了交易轨迹,并在必要时将其转发给道德/法律部门。