收益:
- 能够理解 VCF 格式、HGVS 符号 (c./p./g.) 和 ACMG 致病性标准,并让人工智能生成证据草稿
- 能够亲自验证 ClinVar 和 gnomAD 等来源中的每个 ACMG 证据(人口频率、计算机模拟、隔离、文献)
- 能够应用捕获基因组版本和坐标系统错误的原则,并且不将最终的致病性分类留给人工智能
个体的基因组与参考基因组有数百万个点不同;大多数这些差异是无害的(“良性”),少数会导致疾病(“致病性”)。变异解释的任务是确定差异属于哪一类,是临床遗传学的核心。在本单元中,您将学习如何使用人工智能(AI)作为变体解释中的证据收集、总结和起草助手;但您将了解为什么最终的致病性决定应始终经过专家批准。
首先严重警告:询问AI“这个变异是否致病?”永远不要相信你所问的一个词的答案。 AI可以在没有证据的情况下自信地说出一类;可以拟合变异的群体频率、之前的临床记录或功能研究。正确的做法是利用人工智能构建证据框架,亲自在第一手源核实每一条证据。
基本概念
- VCF(变体调用格式):列出样本中变体的标准文件格式;每条系都携带染色体、位置、参考碱基、替代碱基和质量信息。
- HGVS 表示法:具有变体的标准书写格式。 c.它在编码序列中的位置,p。蛋白质变化,g。指示基因组位置。例如 NM_000546.6:c.743G>A 和 p.Arg248Gln。
- gnomAD:收集数十万人的变异频率的数据库;它显示了变体在社会中的普遍性。常见变异通常不致病。
- ClinVar:收集变异临床解释的公共数据库。
- ACMG/AMP 标准:美国医学遗传学学院的证据系统将变异分为五类:致病性、可能致病性、意义不确定的变异 (VUS)、可能良性、良性。
ACMG 证据代码:简要地图
ACMG系统定义了致病方向(PVS、PS、PM、PP)和良性方向(BA、BS、BP)的证据代码;这些共同决定了类别。 AI很擅长解释这些代码的含义,但你必须验证代码实际实现的数据。
代码
意义(概要)
哪里可以验证来源
PVS1
非常有力的证据导致功能丧失(例如提前停药)
转录本、结构域、基因-疾病关系
PS1/PS3
与已知致病菌相同的氨基酸/功能研究
ClinVar,同行评审的功能性文章
颗粒物
非常罕见/不存在于人群中
gnomAD 频率
PP3/BP4
致病/良性方向的计算预测
估算工具(共识)
BA1/BS1
频率太高,不可能致病
gnomAD 频率
BP6/PP5
(不再推荐)依赖别人的解释
—
提示:PM2(稀有性)和 BA1/BS1(常见性)决策直接基于 gnomAD 频率,是最容易验证的证据。首先在 gnomAD 上查看变体;在超过 1% 的人群中流行的变异很可能不具有致病性。
一步一步:人工智能辅助变异解释
1. 修复标准符号的变体。阐明基因组版本、转录本和 HGVS 表示。都是 AI 的变体 c.两个页。两者都是g。 ,然后使用验证器(如 VariantValidator)确认它。
2.让AI构建证据框架。对于每个 ACMG 代码,“我应该查看哪些数据?”让人工智能回答问题——但暂时不要指定类别。
3. 验证主要来源的所有证据。 gnomAD 频率、ClinVar 记录、功能研究 — 全部打开并阅读。通过在 gnomAD 中搜索来检查 AI 的“在 gnomAD 中不可用”声明。
4. 合并代码并提取类。起草ACMG与AI的组合规则;但最终的课程要让专家批准。
5.如实报告VUS。如果证据不足,则类别为“Uncertain Meaning”;将其视为致病性或良性是错误的。
三个迷你箱子
情况 1——虚构的频率。一位专家向 AI 询问变种 gnomAD 的频率; “0.002%,”人工智能说。当专家亲自在 gnomAD 上查找时,他发现该变体的频率为 1.3%,这意味着 BS1(良性方向较强)的证据是有效的,并且该变体很可能是无害的。人工智能伪造的低频使该变体错误地显得罕见。
案例 2——假功能研究。一位研究人员想要为一个变体实现 PS3(功能证明); AI 给出了一篇有说服力的文章署名。当研究人员在PubMed上搜索时,发现没有这样的文章。错误的归因将会破坏证据链。
案例 3 — 获得确认。一位遗传咨询师用 AI 重新评估了“可能致病”的变异。 YZ指出了新添加的对ClinVar的相互矛盾的评论;顾问打开 ClinVar,看到两个实验室在 VUS 上检测到了该变异,并更新了报告。在这里,人工智能提醒我们可能被忽视的更新,但同样,是人类做出了决定。
四个可复制模板
1)建立证据框架(不让全班讲述):
您的角色:临床变异解释助理。为以下变体建立 ACMG/AMP 证据框架:[基因组版本、转录本、HGVS]。对于每个可能的证据代码(PVS1、PS1-4、PM1-6、PP1-5、BA1、BS1-4、BP1-7),“我应该查看哪些数据、哪个来源的数据来应用它?”写。先别说班级;只需列出需要的数据即可。
2)gnomAD/ClinVar确认计划:
一步步写下我应该在 gnomAD 和 ClinVar 中寻找以下变体的具体内容:[变体]。解释哪个群体频率阈值对应于哪个 ACMG 代码。价值观不是你编造的,而是你创造的。告诉我在哪里可以找到它。
3)课程大纲(经我批准):
我给出了以下经过验证的证据:[PM2存在,PP3存在,BS1不存在...]。根据ACMG组合规则起草可能的类别和理由。如果证据不足,请随意说“VUS”。我会批准最后的决定。
4)报告草稿:
将以下分类翻译成适合患者和医生的简单语言报告段落:[变体、类别、关键证据]。不要夸大确定性;如果存在不确定性,请明确说明。请咨询专家做出临床决定。
弱提示/强提示
弱:“TP53 c.743G>是否致病?”
问题:没有基因组版本/转录本,不需要证据,人工智能可以告诉班级并弥补频率。
Strong:“为 GRCh38、TP53 NM_000546.6:c.743G>A (p.Arg248Gln) 设置 ACMG 证明框架;告诉我在每个代码的哪个源中查找什么内容、值拟合、在验证后起草类。”
为什么它强大:背景清晰,证据路径开放,捏造的范围缩小,决定权掌握在个人手中。
常见错误
- 靠一字致病性回答。没有证据链的特定类别是毫无价值的。
- 未能验证频率和归因。 gnomAD 频率和文章引用可以调整;自己打开吧。
- 避免 VUS。当证据不足时说“致病/良性”是临床错误。
- 基因组版本/转录本改组。抄本不正确、不正确 C.意思是位置。
- 跳过 ClinVar 更新。解释随着时间的推移而改变;检查最新记录。
注意:ACMG 代码的组合是基于规则的,但需要专家判断;相同的证据在不同的基因疾病背景下可能具有不同的分量。 AI的结合只是一个蓝图,而不是一锤定音。
深度:正确读取 VCF 线和频率阈值
即使 VCF 文件中的一行也包含许多陷阱。示例行: 17 43091983 。 G A 60 PASS AF=0.0003;DP=45 GT:AD 0/1:22,23。你可以让人工智能解释这里的字段,但你自己确认三点。首先,染色体位置对属于哪个基因组版本?相同的变体出现在 GRCh37 和 GRCh38 的不同位置;如果不指定版本,位置就没有意义。第二个是GT(基因型)结构域:0/1杂合,1/1纯合;在隐性疾病中,单独的杂合变异是无法解释的。第三,DP(读段深度)和 AD(等位基因深度):低深度(例如 DP=8)使变体调用有问题;该技术可能会出现误报。 AI 正式解释了这些字段,但是“这个调用可靠吗?”决定权在你。
频率阈值的一个具体例子:一位专家想要将 PM2(稀有性)应用于隐性遗传的罕见疾病的变体。人工智能说:“gnomAD没有,PM2肯定有。”当专家打开 gnomAD 时,他发现该变体在一个亚群体中的出现频率为 0.8%——考虑到这种疾病的流行,这一频率足以排除 PM2。一个常见的错误是查看总体总体频率并跳过子总体。
等位基因频率(群体)
典型的 ACMG 评论
注释
无/非常罕见
可支持PM2
还要看看亚人群
高于疾病患病率
BS1(良性强)
隐性/显性区别很重要
高于5%
BA1(独立良性)
几乎肯定无害
5)VCF线控模板:
对下面的VCF行逐个字段进行解释,但不做可靠性判断:分别解释基因组版本、GT(接合性)、DP和AD字段。列出此调用在技术上可能存在问题的情况。行:[粘贴]。
综上所述
- 变异解释是基于证据的;人工智能在构建和总结证据方面非常强大,但集体决策取决于专家。
- 任何证据(gnomAD 频率、ClinVar 注册、功能研究)都必须在主要来源进行个人验证。
- 通过基因组版本、转录本和HGVS修复变异;与验证者确认。
- 如果证据不充分,诚实的答案是“意义不确定(VUS)”。
应用任务
选择一个示例变体(例如来自 ClinVar 的众所周知的记录)。让 AI 使用上面的模板 1 和 2 构建证据框架。然后自己打开gnomAD频率和ClinVar评论并与AI声称进行比较。注意人工智能和源之间至少在一项证据中是否存在差异,并自己证明可能的类别的合理性。
清单
- [ ] 我修复了基因组版本、转录本和 HGVS 的变体。
- [ ]我搭建了证明框架,我一开始就没有让AI说课。
- [ ] 我亲自检查了gnomAD频率。
- [ ] 我已确认 ClinVar 注册并处于最新状态。
- [ ] 我验证了 PubMed 中的功能研究引用。
- [ ]如果证据不足,我毫不犹豫地说VUS,并亲自批准了这个决定。