收益:
- 能够根据 KVKK、GDPR 和道德委员会规则保护敏感的人类/基因数据,并避免将其提供给开放模型
- 能够通过评估生物安全/双重用途和群体偏见的风险来质疑结果的有效性
- 了解道德责任不能委托给车辆,并且有意义的人机交互是必要的
在生物学中大力使用人工智能可以通过负责任地使用它来补充。生物学是一个敏感领域,涉及人类健康、遗传隐私、环境甚至生物安全。在本单元中,我们将讨论在生物学研究中使用人工智能时您将面临的道德、法律和安全责任。本单元是建立在之前所有单元的验证和诚实原则基础上的框架。
基本原理:人工智能是工具;道德责任始终在于人类。 “建议的模型”不是借口。
四大责任范围
1. 数据隐私和人类数据
来自人类参与者的遗传、临床或健康数据极其敏感。一个人的 DNA 序列可以揭示其及其亲属的疾病风险和身份;即使是被认为是匿名的基因组数据也可以被重新识别。将此数据粘贴到公开可用的人工智能模型中可能会违反数据保护法(土耳其的 KVKK、欧洲的 GDPR)和道德委员会(IRB/道德委员会)的批准。
- 不要向开放模型提供个人/临床数据。
- 避免超出同意范围的使用;参与者同意了什么?
- 选择企业/本地(本地)或数据处理合同工具。
2. 生物安全和双重用途
有些生物信息具有“双重用途”:既可以有用,也可以有害;例如,病原体(致病)序列、毒素产生。在大多数地方,向人工智能询问有关增强危险病原体或设计有害生物制剂的信息是不道德和非法的。
- 不要提出危险的双重用途请求。
- 遵循您所在机构的生物安全委员会 (IBC) 指南。
3.科学诚信
我们在之前的单元中看到的所有内容都集中在这里:没有虚假归因,没有数据美化,没有 p-hacking,没有选择性报告。人工智能可以使这些变得更容易或更困难;区别在于你的诚实。
- 报告所有结果(包括阴性结果)。
- 声明人工智能的使用。
- 通过共享原始数据和代码(如果可能)来支持可重复性。
4. 偏见和公平
人工智能模型所训练的数据存在偏差。基因组数据库主要来自欧洲血统人群;这会导致对其他人群的预测较差。在训练数据中代表性不足的情况下,图像模型可能表现不佳。
- 询问模型是根据哪些人群/数据进行训练的。
- 评估结果是否适用于所有组。
提示:问问自己:“如果我将此数据提供给模型,它属于谁?该人是否授予了许可?”如果答案含糊不清,请不要给出。违反保密规定是不可逆转的。
一步一步:负责任的人工智能控制
- 对数据源进行分类:个人/敏感还是公共?
- 检查同意和权限:此用途是否受到涵盖?
- 选择正确的工具:敏感数据的安全/本机环境。
- 考虑双重用途的风险。
- 问题偏差:结果在所有组中都有效吗?
- 记录并声明使用。
可复制的提示模板
从道德角度回顾我的分析计划:列出有关数据保密性、参与者同意、潜在偏见和双重使用风险的注意事项。计划:[文本](注意:我不分享实际的患者数据,只是分享计划。)
在使用此基因组数据集之前,我应该回答哪些隐私和同意问题?根据 KVKK/GDPR 和道德委员会准备了一份清单。
我应该如何透明地声明我在文章的方法部分使用的人工智能工具?写一个陈述句的例子;它应该包含哪些信息(工具、版本、使用范围)?
如何评估这个模型的结果是否存在总体偏差?列出我应该询问的有关训练数据和检查步骤的问题。
弱提示/强提示
弱:“分析以下患者的遗传数据:[真实数据]。”
Güçlü:“我正在制定一个针对临床基因组数据的分析计划,但我不共享真实的患者数据。仅从方法论的角度来看:我应该采取哪些保密措施,我应该在什么环境下处理数据,我应该满足哪些批准和伦理委员会的条件?你可以用虚拟/样本数据来显示流程。”
区别:强效提示中不共享实际敏感数据;只问方法。隐私得到了维护,该模型仍然有帮助。
三个迷你箱子
案例 1 — 侵犯隐私:一名研究人员将他认为是匿名的患者外显子组数据粘贴到一个开放模型中进行分析。当伦理委员会得知此事后,该研究被暂停;没有数据处理协议。教训:敏感数据永远不会进入开放模型。
案例 2 — 群体偏差:多基因风险评分工具根据欧洲来源的数据进行训练;在另一个人群中,风险估计明显不准确。当模型建议质疑训练数据的组成时,团队决定不在该人群中使用该工具。教训:偏见可以拯救生命,也可以伤害生命。
案例3——披露和透明度:一个团队用AI编写了数据清理代码,并在方法部分明确说明了这一点;他还分享了代码。审稿人对此表示欢迎,因为可重复性很强。教训:透明度孕育信任。
对比图
面积
安全行为
危险行为
患者数据
本地/安全环境
粘贴以打开模型
同意
在范围内使用
不要超出范围
生物安全
避免双重使用
危险的需求
诚信
报告所有结果
选择性报告
偏见
查询人口
盲目申请
透明度
声明用途
隐藏
常见错误
- 将敏感数据提供给开放模型:不可逆转的隐私侵犯。
- 超出同意范围:未经参与者授权使用。
- 忽略偏见:将结果推广到所有群体。
- 隐瞒使用:不声明人工智能贡献。
- “模型建议”辩护:将责任归咎于车辆。
注意:在高后果的生物工作(临床决策、生物安全、人类数据)中,人工智能输出不能替代有能力的专家验证和道德监督;它只会加快速度。最终的责任始终在于人类,以及决策的道德和科学后果。
环境、生态和传统知识
道德责任不仅限于人类数据。在生态学和保护生物学中使用人工智能时也需要谨慎。例如,由于存在偷猎的风险,濒危物种的精确位置数据(相机陷阱坐标)非常敏感;向开放模型或公众发布这些数据可能会损害该物种。同样,当未经许可使用当地社区的传统生物学知识(例如植物的使用)时,就会出现伦理和法律(例如《名古屋议定书》)问题。在使用数据之前,“这些信息属于谁?泄露后谁会受到伤害?”总是问问题。
人工监督和最终决定
整个模块的本质可以归结为一个原则:有意义的人类监督。 AI提出建议、写草稿、展示模式;但生物学、临床或伦理决策从来都不是直接基于模型输出的。尤其是在高风险领域(诊断、治疗、物种保护决策、放归),模型的作用不是做出决策,而是加速专家的决策。 “人在环”的方法不是口号,而是必然。
为了使这种监督发挥作用,主管必须有能力。盲目同意(“模型说,接受”)不是监督。真正的监督需要专业知识来质疑输出、发现错误并在必要时拒绝它。因此,人工智能并不能取代专家;这使得专家变得更加不可或缺。最善于使用车辆的人就是最能控制它的人。
综上所述
在生物学中负责任地使用人工智能涵盖四个领域:数据隐私(保护敏感的人类数据)、生物安全(避免重复使用)、科学完整性(诚实和完整的报告)和偏见意识(所有群体结果的有效性)。不要向开放模型提供敏感数据,透明地声明使用情况,质疑人口偏见。道德责任永远不能委托给代理人;它始终存在于人类之中。
应用任务
考虑您自己的工作空间中的场景(例如使用人类数据集或图像模型)。让人工智能在不共享真实数据的情况下列出该场景的道德清单(保密、同意、偏见、双重使用、透明度)。对于每个项目,根据您的情况将其标记为“适当/有风险/不确定”,并为有风险/不确定的项目编写行动计划。还为您的文章起草了一份人工智能使用声明。
清单
- [ ] 我没有向开放模型提供敏感/个人数据。
- [ ] 我检查了同意范围和道德委员会。
- [ ] 我已经评估了双重用途/生物安全风险。
- [ ] 我诚实地报告了所有结果。
- [ ] 我质疑人口/数据偏差。
- [ ] 我已经透明地声明了人工智能的使用并承担了责任。
模块考试
1. 一名学生询问语言模型“这个 FASTA 文件中有多少个字符串?”他问道,模型回答“48”。哪种做法才是最正确的呢?
- a) 直接使用型号给出的数字48;该模型是可靠的,因为它看到该文件
- B) 再次询问该数字,如果两个答案相同,则认为正确
- C) 使用 Biopython 读取文件,使用代码计算序列数并使用输出 ✔
- D) 手动打开文件并目视计数
说明:诸如计数和测量之类的确定性任务应留给您运行的代码,而不是语言模型。该模型不会“记住”数字,它会产生概率值,并且可能会出错;使用 Biopython 这样的工具进行计数可以提供准确且可重复的结果。
2. 您想要对显微镜图像中的细胞进行计数并测量每个细胞的面积。完成这项任务最合适的方法是什么?
- A) 使用 Cellpose/StarDist 等专家分割工具并手动验证结果 ✔
- B)将图像粘贴到通用语言模型中并询问“有多少个单元格”
- C) 向模型描述图像并询问估计数量
- D) 接受像素数作为细胞数,无需任何校准
说明:细胞分割和测量不是通用语言模型的领域,而是专门为此任务训练的专用图像模型(Cellpose、StarDist)的领域。语言模型编写调用这些工具的代码;专家模型进行测量,生物学家验证结果。
3. 一名研究生在论文引言中添加了语言模型生成的 8 个来源。顾问发现其中 3 个根本不存在。如何防止这种情况发生呢?
- A)通过要求模型再次生产资源
- B) 仅选择带有 DOI 的引文(如果有 DOI,则为真实引文)
- C) 通过指示模型“拟合”来请求列表
- D) 独立验证 PubMed/doi.org 上的每条引文,并仅引用他读过的文章 ✔
说明:通用语言模型不是文献数据库;它不是搜索真实记录,而是“生成”听起来逼真的归因(捏造归因)。每个署名和 DOI 不应在未经 PubMed/doi.org 等来源独立验证的情况下使用,并且仅引用已实际阅读过的文章。
4. 确保人工智能编写的数据清理代码的准确性最有力的方法是什么?
- A) 如果代码运行没有错误,则认为它是正确的。
- B) 使用已知的小样本测试结果并使用断言 ✔ 验证期望
- C) 询问模型“代码正确吗?”询问并相信答案“是”
- D)多次运行代码并每次得到相同的输出
备注:代码运行没有错误并不意味着它是正确的; “错误的代码没有错误地工作”是生物学中最危险的情况。使用您事先知道其结果的小样本进行测试,并使用断言将期望嵌入到代码中,这是防止无声错误结果的最有力的盾牌。
5. 在 RNA-seq 分析中,测试了 20,000 个基因,发现 3,800 个基因“显着”,且未经校正,p<0.05。这个结论的主要问题是什么?
- A) 样本数量过多,应减少
- B) p 阈值太高,应该使用 0.10
- C) 未进行多重比较校正(FDR);有很多误报✔
- D)应该测试样本而不是基因
解释:当你同时测试数千个基因时,许多基因偶然出现“显着”,即使没有真正的差异;这称为多重比较问题。解决方案是使用 Benjamini-Hochberg 等方法进行 FDR(错误发现率)校正;经过修正,该列表通常会减少到数十到数百个基因。
6. BLAST 结果中的最佳匹配的 E 值为 2.0。这意味着什么?
- A) 比赛很可能是随机的; ✔ 匹配不可靠
- B) 耦合性很强; e值越大越好
- C) 序列匹配率为2%
- D) 两个序列之间有 2 个碱基差异
解释:E值表示匹配是随机的期望;最好是小一点。 e 值大于 1 表示匹配很可能是随机的。对于可靠的匹配,通常会寻求非常小的阈值,例如 e < 1e-5。
7. 在 AlphaFold 模型中,蛋白质的末端区域显示出较低的 pLDDT 评分 (<50)。这个区域应该如何解读?
- A) AlphaFold 在该区域出现错误,应将该区域从分析中删除
- B)这个区域绝对是一个α螺旋
- C) 该模型完全不可靠,不应使用该结构
- D) 该区域可能不规则/有弹性;应被解释为“不清楚”而不是“错误”✔
描述:pLDDT是每个氨基酸的局部置信度得分;低于 50 的值通常反映真正不规则(灵活、非固定)的区域。将这些区域自动删除为“错误猜测”是错误的;低分应被解读为“不确定/灵活”,并应评估其生物学意义。
8. 研究人员仅以像素为单位报告细胞面积,结果与文献不一致。缺少什么步骤?
- A)应该计数更多的细胞
- B) 未进行刻度校准(像素到微米的转换),结果未转换为物理单位 ✔
- C) 分割工具选择不正确
- D) 图像分辨率太高
说明:比例校准(每个像素有多少微米)对于从图像中提取物理尺寸至关重要。如果跳过此步骤,则值仍然无法比较,具体取决于显微镜设置。面积必须转换为物理单位,例如平方微米。
9. 一名学生从一只小鼠身上采集了 10 个组织样本,并在统计中使用“n=10”。为什么这是不正确的?
- A) 10个样本太少,无法统计,至少需要30个
- B)组织样本必须取自不同的器官
- C) 这10个例子是技术重复;生物n仍然是1,这就是所谓的重复✔
- D) 样品无效,因为它们是在同一天采集的
解释:对同一个人进行重复测量属于技术重复;其中统计 n 是生物单位(此处为小鼠)的数量。将技术重复视为生物学(伪复制)会产生错误的意义。正确的设计意味着与多个人合作。
10. 一项分析发现 p=0.03。这个值的正确解释是什么?
- A) 有 3% 的机会看到这个或更极端的结果,而实际上没有差异 ✔
- B) 该效应真实发生的概率为 97%
- C) 原假设成立的概率为 3%
- D) 结果重复率为 97%
解释:p 值不是“假设为真的概率”或“效果为真的概率”。 p 值是看到差异与实际没有差异时观察到的差异相同或更极端的概率。因此p=0.03并不意味着“效果是97%真实的”;结果还应通过效应大小和置信区间进行评估。
11. 在演示中,通过将 y 轴压缩到 95-100 范围,可以将两组之间 3% 的差异显示为巨大。这是什么例子?
- A)良好的可视化技术;突出差异
- B) 色盲友好调色板问题
- C) 可接受的风格选择
- D) 具有误导性和不诚实的图表,夸大了与截断轴的差异 ✔
说明:不从零(截断轴)初始化轴会通过视觉夸大微小差异来误导观看者。这违反了诚实信用原则;特别是在条形图中,轴应从零开始,并且应以其实际大小显示差异。
12. 一名研究人员将他认为是匿名的患者外显子组数据粘贴到公共语言模型中进行分析。为什么这种行为有问题?
- A)没有问题;如果匿名,数据可以共享
- B) 向开放模型提供敏感患者数据违反隐私和道德/法律 (KVKK/GDPR),并且无法逆转 ✔
- C)这是有问题的只是因为分析速度会很慢
- D)模型有问题,因为它无法理解数据
描述:患者遗传/临床数据极其敏感;即使被认为是匿名的基因组数据也可以被重新识别。向公共模型提供此数据违反了 KVKK/GDPR 和道德委员会 (IRB) 的批准,并且是不可逆转的侵犯隐私行为。敏感数据应在本地/安全的合同环境中处理。
13. 在一项研究中,他们认为“患者与对照”的差异实际上是由于样本在不同的两天进行处理所致。这种情况叫什么?如何处理?
- A) 是异常值效应;点应该被删除
- B) 缺乏标准化;只需进行比例校正就足够了
- C) 批次效应;应在设计中保持平衡,并作为批量变量添加到模型中 ✔
- D)p-黑客攻击;测试应该改变
说明: 由于采样批次/处理日期而导致的技术差异称为批次效应,可能与生物差异混淆。正确的做法是平衡设计中的批次,并将批次变量添加到统计模型中(例如“~批次+条件”),从而将技术信号与生物信号分开。
14. 您想要计算 DNA 序列的 GC 比率。哪种方法是正确且可重复的?
- A) 使用 Biopython 打印计算 GC 率的代码,运行它并使用输出 ✔
- B) 给模型序列并要求它口头告知 GC 率
- C) 通过另一个模型确认模型给出的比率
- D) 查看该系列的前 100 个字母并用眼睛猜测
说明:GC率是确定性计算;应该基于处理数组的代码,而不是基于语言模型“记住”的值。不用让模型计算它,而是使用 Biopython 等工具打印计算代码并自己运行它,这将提供准确的输出,每次运行它都会给出相同的结果。