收益:
- 能够识别遗传学中幻觉(人工智能自信地产生错误)以哪种形式(虚构的基因/序列/变体/参考)发生
- 能够理解人工智能的“自信”语气并不是准确性的证据,并与独立来源交叉验证每个输出
- 能够通过源实施、坐标/版本确认和“如果你不知道,就弥补”指令来实施减少幻觉的工作流程
该模块的每个单元都会出现一个危险:人工智能 (AI) 的幻觉,即以完全可信的方式生成实际上并不存在的信息。该单元本身就解决了这一危险:人工智能在分子生物学和遗传学中的作用是什么以及如何适应;你怎么注意到这一点?以及您应该为每种类型的输出开发什么样的验证反射。我们的目标是让您将幻觉视为一种始终可以预期并系统捕获的现象,而不是“有时会发生的意外”。
为什么幻觉不可避免?因为LLM不是一个“知道真相”的系统,而是一个“产生下一个最有可能的单词”的系统。它已经了解了训练数据中的基因名称、变体形式或标签模式是什么样的;因此,它可以产生与现实非常相似但又不现实的输出。在遗传学中,这种相似性特别危险,因为肉眼无法区分虚构的“c.1234A>G”和真正的变体。
人工智能在遗传学中构成什么?一张地图
编造的东西
它看起来像什么
如何捕捉
基因名称/符号
现实但不存在的符号
HGNC/NCBI 基因
系列
正确字母的顺序错误
NCBI/Ensembl FASTA
变体坐标
采用 HGVS 格式,但错误/不存在
变体验证器、ClinVar
人口频率
合理的百分比
侏儒AD
功能性工作
有说服力的印记
公共医学/DOI
临床声称
“它是致病的”
ACMG 证据链
蛋白质坐标
带小数的 3D 数字
PDB/AlphaFold 文件
统计结果
未经校正的 p 值
重新运行代码
减少(但不是结束)幻觉的技术
1. 给出背景。你提供的上下文越准确(基因组版本、转录本、实际序列),人工智能弥补的就越少。但它不会重置。
2.“如果你不知道,请告诉我”指令。 “如果不确定,说‘必须验证’,不要编造”的指示减少了捏造行为——但不要完全相信它。
3. 需要资源。为每个声明请求可验证的来源(DOI、PMID、数据库记录)。
4.自检。 “此输出中的哪些元素需要独立验证?”问;人工智能通常可以标记有风险的物品。
5.最重要的是:亲自核实。以上降低了概率;只有您的主要源代码控制才能提供确定性。
提示:设定“验证预算”:对于每个人工智能输出,一定要验证对决策至关重要的事实(序列、变体、频率、归因);更宽松地对待低风险解释(概念的定义)。将您的资源集中在可能造成最大伤害的错误上。
三个迷你箱子
情况 1 — 不存在的基因。一名学生试图研究AI提到的一个“基因”,但在HGNC中找不到。 AI通过组合两个真实基因的名称,产生了一个并不存在的符号。如果没有 HGNC 控制,学生将花费数小时寻找幽灵基因。
案例 2——连锁幻觉。一位研究人员向 AI 询问了一个变体; AI 给出了一个虚构的频率,然后根据该频率建议了一个虚假的 ACMG 代码,然后添加了一篇支持该代码的虚假文章。单个错误值催生了三层错误链。当研究人员打开gnomAD时,链条中的第一个环节断裂了,一切都崩溃了。
案例 3 — 获得确认。技术人员收到人工智能发来的字符串分析代码;在代码中,人工智能嵌入了一个虚构的字符串作为“参考字符串”。技术人员读取了代码,并将该序列替换为 NCBI 的实际序列。如果他盲目地运行代码,结果就会默默地错误。
确认反应:按输出类型
当您看到 SEQUENCE -> 当您看到 NCBI/Ensembl FASTA 当您看到 VARIANT 时 -> 当您看到 VariantValidator + ClinVar + gnomADFREQUENCY 时 -> 当您看到 ATTRIBUTE 时在 gnomAD 本身中搜索 -> 打开 DOI/PMID,保留标题作者 当您看到 GENE NAME 时 -> 当您看到 HGNC / NCBI GeneCOORDINATE 时 -> 当您看到基因组版本 + 时liftOverSTATISTICS -> 自己运行代码,检查是否正确
四个可复制模板
1)自控提示:
在您刚刚给出的输出中,哪些元素(序列、变异、频率、基因名称、引文、编号)需要独立验证?将每一个标记为“确定/可能/不确定”,并写下要检查的来源。
2)来源强制回复:
回答这个问题,但为每个事实主张引用可验证的来源(数据库记录、DOI、PMID)。不要提出任何您无法提供来源的主张;写“必须验证”:[问题]。
3)组合序列扫描:
列出以下代码中嵌入的所有数组、常量和变体:[code]。对于每一个,如果不清楚它是来自真实来源还是您创建的占位符,请明确标记“必须经过验证”。
4)连锁控制:
每个步骤都建立在前一个步骤的基础上,推理如下:[链]。如果第一个链接(底层数据)错误,哪些后续步骤会崩溃?列出链上需要验证的KEY数据点。
弱提示/强提示
弱者:“告诉我们你所知道的关于这个变种的一切。”
问题:人工智能根据记忆捏造频率、归因、临床主张;没有验证挂钩。
强:“对此变体做出回应;说明每个事实主张要验证哪个来源,如果不确定,请标记“必须验证”,不要捏造任何频率或归因。”
为什么它强大:制造领域缩小了,每个声明都与验证挂钩相关联。
常见错误
- 将流畅性误认为准确性。最有说服力的句子可能是最危险的幻觉。
- 基于单个值而无需验证它。连锁幻觉就是这样诞生的。
- 不读取代码中嵌入的常量。 AI 可以将虚构的字符串/常量嵌入到代码中。
- 满足于“如果你不知道,请告诉我”。该指令降低了概率并且不提供确定性。
- 将验证预算花在错误的地方。检查不重要的事实,而不是最关键的事实。
注意:幻觉率因模型版本、问题和领域而异;但说“这个模型不再适合”是错误的。无论模型有多好,都必须遵守验证纪律。责任始终在于人。
深度:为什么 RAG 和“驾驶”并不能消除幻觉
近年来,许多人工智能工具都使用 RAG(检索增强生成——模型从数据库中检索相关文档并在生成答案之前使用它们的方法)或直接工具调用(例如实际搜索 PubMed)将其答案“链接”到真实来源。这些方法减少了幻觉,但并没有结束它,原因有两个。首先,模型可能会错误地总结捕获的文档,或者将结果归因于不在文档中的文档;即使来源是真实的,解释也可能是捏造的。其次,搜索可能会返回错误或不相关的文档,而模型仍会将其转换为权威答案。换句话说,即使是看似“有来源”的答案,如果不打开并阅读来源实际上支持该主张,也不应被认为是可靠的。
一个具体的例子:基于 RAG 的助手返回了一个变体的实际 ClinVar 页面,但将该页面总结为“致病”;然而,在该页面上,该变体被标记为“冲突的评论”。来源是正确的,摘要是错误的——而且是临床重要性的错误。第二个例子:文学工具提取了一篇实际的文章,但该文章是关于不同的基因;该模型被标题的相似性所愚弄,并将结果归因于问题。
经验法则:如果给出了链接,则打开该链接;如果给出了引用,请查看该引用是否在源中逐字引用。 “来源人工智能”有助于验证,而不是消除验证。无论车辆如何“连接”,您的验证反应都保持不变。
5)焊接响应检验模板:
对于您在此答案中提供的每个源链接/引用,请向我显示确切的句子/段落,我可以在其中检查该声明是否在源中完全出现。如果来源真实,但您的摘要与其有偏差,请标记它。
综上所述
- 幻觉是法学硕士作案手法的自然结果;这不是一个“意外”,而是一个必须系统地捕捉的预期现象。
- 在遗传学中,人工智能可以构建基因、序列、变异、频率、归因、坐标、统计数据和临床声明。
- 背景、资源需求和自我控制会减少但不会结束幻觉;只有主要源头控制才能提供准确性。
- 开发特定于输出类型的验证反应(序列→FASTA、引文→DOI);将验证预算集中在最关键的事实上。
应用任务
向人工智能询问一个遗传主题,并根据上面的反应列表亲自验证输出中的每个事实主张(基因、序列、变异、频率、归因)。计算有多少说法是真实的,有多少是虚假/捏造的,有多少是模糊的。将结果总结在表格中,并注意哪种类型的索赔最有捏造性。
清单
- [ ] 我对每种类型的输出应用了我的验证反射。
- [ ] 我亲自从主要来源检查了关键事实。
- [ ] 我确认了链式推理中的基本数据点。
- [ ] 我已阅读并确认了代码中嵌入的数组/常量。
- [ ] 我并不认为流畅而自信的语气是准确性的证据。
- [ ] 我将验证预算集中在风险最高的索赔上。