单位 3 / 10

组学数据分析:转录组学、蛋白质组学和多组学集成

收益:

  • 差异表达分析中的多重测试校正(校正 p 值)以及正确解释倍数变化并避免假阳性的能力
  • 检测批次效应并将其添加到 PCA 模型中,并将技术噪声与生物差异分开
  • 能够将每个途径的身份与来源联系起来,并通过途径富集和多组学整合中的生物学一致性来控制它

单元格不是单个数字;而是一个单元格。在这个系统中,成千上万的基因、蛋白质和代谢物同时起舞。组学(测量整个生物层的方法的统称)试图捕捉整个舞蹈:基因组学(DNA)、转录组学(RNA - 哪些基因起作用以及作用程度)、蛋白质组学(蛋白质)、代谢组学(小分子)。每个组学层都会产生数千个维度、嘈杂且昂贵的数据。人工智能在扫描高维数据和标记图案方面非常强大;但你是决定哪种模式是生物学真理、哪种模式是技术噪音的人。

在本单元中,我们将继续进行转录组学,这是最常见的组学分析;这些原则也适用于其他层。典型的工作流程:原始数据的表达矩阵(行是基因,列是样本,细胞是表达水平),标准化(消除技术差异),差异表达分析(查找两种条件之间显着变化的基因),途径富集(查找变化的基因聚集在哪些生物途径)和解释。

差异表达:倍数变化和校正 p 值

为了判断基因是否发生了“改变”,需要观察两个数字:倍数变化——表达增加/减少的次数,通常以 log2 为单位——以及调整后的 p 值(padj——完成多次测试时控制误报的统计数据)。为什么要修?因为你同时测试20,000个基因;即使是偶然,数百个基因也可能被证明是“重要的”。如果没有多重测试校正(使用 Benjamini-Hochberg 等方法限制错误发现率),该列表就会产生误导。 AI可以编写计算这个统计数据的脚本,但如果它忽略了修正,你的结果在科学上是站不住脚的。

注意:AI 可能会根据原始 p 值说“500 个基因发生显着变化”。查看校正后的 p 值,该数字可能会下降到 30。请务必亲自检查多重测试校正;这就是出版物接受和拒绝之间的区别。

批次效应:最阴险的陷阱

批次效应(不同日期、不同设备或人员处理样本所产生的技术差异)是组学分析中最大的误差来源。如果您的两个条件是在不同的两天处理的,您看到的“生物差异”实际上可能是日间差异。 AI可能会建议将批次变量添加到模型中(例如〜批次+条件),但您有责任正确设置它并且不要在实验设计中将其混合。

提示:开始分析之前,先绘制一个 PCA(主成分分析 - 一种在多个轴上汇总和可视化高维数据的方法)图表。如果样品按批次而不是生物条件进行聚类,则批次效应占主导地位,必须首先进行校正。

多组学整合

真正的理解通常来自于将各层放在一起:如果一个基因更加努力地工作,但它的蛋白质没有增加,那么调节是在翻译水平上的。多组学集成——将不同的组学层组合成一个模型——是人工智能变得更强大的地方,但也是它最容易误导的地方;因为各层的尺度、噪声和样本匹配是不同的。 AI 建议采用集成工作流程,但您可以控制结果的生物学一致性。

三个迷你箱子

案例 1——富集加速。在一个癌症项目中发现了 1,240 个差异基因。 AI 为它们提供了通路富集的能力,突出了细胞周期和 DNA 修复通路;该团队在 2 小时内创建了假设图。但他们使用独立工具(g:Profiler)重新测试了每条路径,发现一条路径被人工智能错误映射。

案例 2 — 批量陷阱。一家实验室发现两个治疗组之间存在“惊人的”900 个基因差异。当他们进行 PCA 时,他们发现样品是通过测序批次分开的。经过批次校正后,实际差异减少至60个基因。人工智能在第一次分析中无意中省略了批次变量。

案例 3 — 虚构的路径名称。一名学生将基因列表交给AI并问道:“哪个KEGG途径?” AI 提供了路径 ID 和名称,就好像它是真实的一样。当学生在KEGG上搜索时,发现该ID不存在;验证防止了捏造的结果。

四个可复制模板

1)DESeq2工作流程概述:

您的角色:计算生物学家。使用 R/DESeq2 编写 RNA-seq 差异表达分析的分步脚本:计数矩阵读取、设计公式(~批次 + 条件)、归一化、结果表。明确应用多重测试校正 (BH) 并使用 padjcolumn。在注释行中解释每个步骤的作用。

2)质量/批次控制:

给我一份 RNA-seq QC 检查表:PCA 批次控制、文库大小、基因检测数量、异常值检测。对于每个指标,指定一个“我所看到的让我担心的”阈值。解释一下如果批次和生物条件混合我应该做什么。

3) 富集结果验证:

我会给你一个丰富的通路列表(通路数量、padj、基因)。逐字写下每个通路的身份(KEGG/GO ID),不要虚构。过滤 padj < 0.05 的结果。指定哪些途径在生物学上相互支持,但将每个身份标记为“必须在数据库中验证”。

4)多组学一致性检查:

转录组学和蛋白质组学对基因/蛋白质对的表达方向产生冲突。列出可能的生物学(翻译后编辑)和技术(测量噪声、样本匹配)原因,并告诉我如何测试每个原因。

弱提示/强提示

弱提示:

列出该基因列表中的重要途径。

没有来源,没有统计数据,捏造途径的风险很高。

强力提示:

您的角色:计算生物学家。所附差异基因表(gene, log2FC, padj)中仅取padj < 0.05的基因。告诉我使用这些基因进行 GO 富集分析的步骤以及我将使用的工具 (g:Profiler)。路径名称为 FAKE;我将运行该工具并进行分析,您只需描述正确的方法和多次测试修正即可。

区别:过滤清晰,注重方法论,禁止捏造,将验证留给用户。

组学分析步骤

步骤

目的

常见错误

人工智能角色

标准化

消除技术差异

方法选择错误

剧本+理由

主成分分析/质量控制

批量和异常值检测

跳过我的步骤

图片+评论

差异表达

寻找变化的基因

未校正的 p

剧本草稿

浓缩

找到一条路

人造通路

方法论

整合

合并图层

比例/匹配误差

工作流程推荐

单细胞组学:新尺度

近年来,单细胞测序(分别测量数千个细胞中每个细胞的表达谱)已将组学推向了一个新的维度。现在,我们可以分别看到该组织内的每种细胞类型,而不是“组织的平均表达”。这种能力引入了新的陷阱:数据极其稀疏(大多数基因在大多数细胞中的读数为零——丢失),大小为数万个细胞×2万个基因,并且分离细胞类型主要通过聚类来完成。人工智能在单细胞数据上生成聚类和细胞类型标记轮廓方面非常强大;但是您可以使用已知的标记基因验证每个簇是真实的细胞类型还是技术制品(例如死细胞、两个细胞聚集在一起)。在未在实际文献中确认该簇的标记基因之前,不要接受人工智能建议的细胞类型标签。

提示:在单细胞分析中,如果 AI 建议给某个簇添加“T 细胞”标签,请自行检查 T 细胞标记(例如 CD3)在该簇中确实高度表达。如果标签不被标记所支持,那么它只是一个假设,而不是一个结论。

常见错误

  • 跳过多次测试校正。该列表随着原始 p 值的增加而膨胀;应该使用padj。
  • 将批次效应误认为是生物学效应。应首先使用 PCA 检查。
  • 让楼层变化成为唯一的标准。高倍数变化可能会误导低表达、嘈杂的基因。
  • 接受虚构的途径/GO身份。每个身份都必须在数据库中进行验证。
  • 低估样本量。 2 x 2 设计的统计功效较低;应谨慎解释结果。

总之

组学分析适用于高维、嘈杂的数据,人工智能通过扫描数据、编写脚本和标记模式来加速这些数据。但差异表达中的多重测试校正、PCA的批次控制以及富集中的来源验证是必不可少的。多组学整合功能强大,但具有误导性;检查每个结果的生物学一致性,同时考虑各层的规模和噪声差异。

应用任务

查找公开可用的 RNA-seq 计数矩阵(例如来自 GEO)。让 AI 使用“DESeq2 工作流程”模板编写分析脚本,并检查代码是否已实际应用多重测试校正。然后向AI请求富集评论,并对照KEGG或GO数据库一一验证其返回的所有pathway ID;注意有多少是真实的。

清单

  • [ ] 我在差异分析中使用了 padj(已更正),而不是原始 p 值。
  • [ ] 我用PCA检查了批处理效果,并在必要时将其添加到模型中。
  • [ ] 我谨慎地解释了倍数变化高但表达低的基因。
  • [ ] 我根据真实数据库验证了每个路径/GO ID。
  • [ ] 我评估了样本量的统计功效。
  • [ ]我把多组学矛盾分为生物学原因和技术原因。