收益:
- 能够理解 RNA-seq 工作流程、差异表达分析和多重测试校正 (FDR),并让人工智能生成可验证的分析代码
- 能够从统计学和生物学角度批判性地解释通路富集结果
- 能够遵守检查统计假设和多重测试陷阱以及独立验证生物学意义的纪律。
“组学”是同时测量细胞或组织所有分子的方法的统称:基因组学(所有 DNA)、转录组学(所有 RNA/表达)、蛋白质组学(所有蛋白质)、代谢组学(所有代谢物)。这些数据非常庞大——RNA-seq 实验涉及对数万个基因的测量。在本单元中,您将学习如何使用人工智能 (AI) 作为组学分析的助手,编写代码、选择统计数据并起草生物学解释;但您将了解为什么必须验证统计和生物学结果。
严重警告:在组学中,最危险的错误是统计上的、看不见的。人工智能可以编写绕过多重比较校正(如下)的代码,选择错误的测试,或产生“假阳性”基因列表。此外,人工智能可以在没有任何来源的情况下编造生物学声明,例如“该基因在该疾病中增加”。正确的方法:使用可执行、可审计的代码进行分析,并确认文献中的每项生物学主张。
基本概念
- 表达:基因被翻译成RNA的程度; “活动”的衡量标准。
- 差异表达(DE):两组(例如患者/健康人)之间表达显着变化的基因。
- p值:差异是巧合的概率;如果很小,则差异被认为是“显着的”。
- 多重比较校正:当同时观察数以万计的基因时,偶然会出现一些“显着”的基因。为了解决这个问题,使用了 FDR(错误发现率)/Benjamini-Hochberg 等方法。如果忽略这一修正,就会出现数百个错误的发现。
- log2倍数变化(log2FC):两组间某基因表达量比值以2为底的对数; +1表示增加两倍,-1表示减少两倍。
- 通路富集:寻找变化的基因集中在哪些生物通路(例如细胞分裂、免疫);使用GO、KEGG等数据库。
- 批次效应:在不同日期/设备上处理样品所产生的非生物杂散差异。
一步一步:人工智能驱动的组学分析
1.明确实验设计和问题。有多少样本、多少组、多少次重复?统计功效是否足够?向人工智能解释设计。
2.选择合适的AI工具/方法。对于RNA-seq,选择标准方法,例如DESeq2/edgeR(为计数数据设计的统计包);使用经过验证的方法,而不是人工智能“编造”的统计数据。
3. 运行代码并检查中间输出。在没有标准化、批次效应控制、质量图 (PCA) 的情况下,请勿进行 DE 分析。
4. 强制多重比较校正。按校正值 (padj/FDR) 过滤结果,而不是原始 p 值。
5. 确认文献中的生物学解释。使用人工智能解释通路富集输出,但从源头验证每项声明。
提示:在 DE 分析中,首先查看质量和总体影响图。如果样本按处理当天而不是按生物群体进行聚类,那么您发现的大多数“重要”基因都是累积效应,而不是真正的生物学。
三个迷你箱子
情况 1 — 未修正的 p 值。一名学生用AI编写的代码测试了20000个基因,发现了“540个重要基因”。当他检查代码时,他发现人工智能跳过了多重比较校正。当添加 FDR 校正后,重要基因的数量减少到 32 个。如果没有校正,故事中将有超过 500 个错误基因。
案例 2——捏造的生物学声明。对于DE列表上的一个基因,研究人员询问AI“这个基因在这种疾病中起什么作用?”他问道; AI解释了一个令人信服的机制和文章。当他在 PubMed 上搜索时,他发现该机制和这篇文章都不存在。该声明已从报告中删除。
案例 3 — 获得确认。一名博士生注意到,在 PCA 图中,样本相隔两天。要求AI在代码中添加批量效果变量;修正后,基因列表完全改变并变得具有生物学意义。如果没有质量控制图,可能会发布虚假结果。
示例:使用校正后的 p 值进行过滤
import pandas as pd# 让表 'de' 为 DE 工具的结果 (DESeq2/edgeR):# 列:gene, log2FC, pvalue, padj (FDR 校正)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] < 0.05) & (de["log2FC"].abs() >= 1)]print("Raw p<0.05:", (de["pvalue"] < 0.05).sum())print("FDR 校正的 padj<0.05 & |log2FC|>=1:", len(significant))
原始数字和校正数字之间的差异说明了为什么多重比较至关重要。
四个可复制模板
1)分析方案及方法选择:
您的角色:生物信息学助理。为以下 RNA-seq 实验制定分析计划:[组数、样本/重复数、问题]。我应该选择哪种标准工具(DESeq2/edgeR),为什么,需要哪些质量控制步骤(PCA,批次效应),如何应用多重比较校正?一步步写。
2)代码+强制检查:
编写执行以下 DE 分析的可执行代码:[详细]。代码必须包括归一化、PCA 质量图、批量效应控制和 FDR (Benjamini-Hochberg) 校正。评论每一步。使用校正后的 p 值而不是原始 p 值进行过滤。
3)途径丰富评论:
帮助解释此重要基因列表的通路富集结果:[列表/输出]。解释哪些途径是突出的,但请告诉我在哪个来源(GO、KEGG、同行评审文章)中确认每个生物学主张。机制/物品配件。
4)统计审核:
检查以下分析代码是否有统计错误:[代码]。具体为:试验选择不正确、遗漏多重比较校正、忽视批次效应、重复性不足。列出您发现的每个问题及其解决方法。
弱提示/强提示
弱:“在 RNA-seq 数据中找到重要基因。”
问题:未指定方法、质量控制和多重比较;人工智能可以给出一个充满误报的列表,而无需纠正。
Strong:“编写一个代码,使用 DESeq2 逻辑对该 RNA-seq 计数数据执行 DE 分析,包括使用 PCA 进行质量控制和体效应控制,以及使用 FDR 校正进行过滤;对每个步骤进行评论并解释您选择此方法的原因。”
为什么强大:方法是标准的,质量和纠正是强制性的,结果是可审计的。
风险
症状
预防措施
误报
太多“有意义”的基因
FDR/多重比较校正
集体影响
样本按天聚类
PCA+批量变量
错误的测试
正常测试统计数据
适当的方法,如 DESeq2/edgeR
组成生物学
无焊机构
文献确认
电量不足
1-2 次
设计上有足够的重复
常见错误
- 跳过多重比较校正。最常见和最有害的统计错误。
- 忽略集体影响。它会产生错误的生物学差异。
- 应用不正确的测试来计数数据。 RNA-seq 需要特殊的方法。
- 接受没有来源的生物学主张。 AI可以编机制、编文章。
- 概括性的重复不足。没有统计能力,结果是不可靠的。
注意:“具有统计学意义”与“具有生物学意义”不同。一个非常小但技术上显着的倍数变化在生物学上可能是微不足道的;在大样本中,一切都可能变得“重要”。一起评估 log2FC 和 p 值。
深度:通路富集的背景和重复计算陷阱
通路富集结果依赖于大多数人没有意识到的两个隐藏假设,而人工智能可以悄悄绕过它们。第一个是背景/宇宙选择:富集将“发生变化的基因”集合与“查看了哪些基因”集合进行比较。如果背景取自整个基因组,但您的实验仅测量特定的组织组,则结果会显得人为“丰富”。正确的背景是在实验中实际可以表达/测量的基因。一个团队通过错误地背景化整个基因组发现了“免疫途径的高度显着富集”;当使用正确的背景(测量的基因)重复分析时,富集消失了——这一发现是方法假象。
其次,基因集大小和重复计算:非常大和一般的途径(例如“代谢过程”、数千个基因)几乎在每个列表中都显得“重要”;小而具体的路径信息更丰富。此外,由于在多个途径中发现了相同的基因,因此将重叠的途径视为独立证据是具有误导性的。第三点:没有表现出充实的方向;一条通路可能会被富集,但其中一半的基因可能会增加,另一半可能会减少。要了解这一点,有必要单独检查方向信息(例如 GSEA)。
陷阱
症状
预防措施
错误的背景
一切都显得充实
获取测量的基因背景
非常一般的途径
“新陈代谢”总是会出现
专注于小而具体的途径
重复计算
重叠路径
不要将其视为独立证据
跳过方向
混合升序/降序
使用 GSEA 进行方向控制
综上所述
- 组学分析中的人工智能;是选择方法、写代码、起草注释的助手;统计和生物学决策必须是合理的。
- 应使用标准的、经过验证的方法(DESeq2/edgeR);质量控制和集体影响审计不应被忽视。
- 多重比较校正(FDR)是强制性的;使用校正值过滤结果。
- 每一项生物学主张都必须在文献中得到证实; “重要”应与“重要”区分开来。
应用任务
获取样本 DE 结果表(或开放的 RNA-seq 数据集)。将基于原始 p 值和校正 padj 阈值的显着基因计数与上面的代码片段进行比较。用一句话评论差异。然后要求使用模板 3 对某个特征基因进行生物学解释,并在 PubMed 中自行检查该声明。
清单
- [ ] 我评估了实验设计和统计功效。
- [ ]我选择了一个标准的、方便的方法。
- [ ] 我做了PCA和批次效应质量控制。
- [ ] 我应用了多重比较 (FDR) 校正。
- [ ] 我用修正后的 p 值过滤了结果。
- [ ] 我证实了文献中的生物学主张。