单位 6 / 11

图像分析和类型/细胞识别

收益:

  • 能够分离分割和分类任务,并为每个任务选择合适的现成工具(Cellpose、StarDist、MegaDetector)
  • 能够通过应用比例校准和手动验证从图像中提取可靠的测量结果
  • 了解将低置信度分数预测直接进行人工验证的必要性,并在训练分布之外确认模型。

生物学是一门视觉科学:显微镜下的细胞、培养皿中的菌落、森林相机中的动物、叶子上的病斑。对这些图像进行计数、测量和分类曾经是一项耗时数小时的乏味且主观的任务。人工智能,特别是基于深度学习(多层人工神经网络的模式识别)的图像模型,加速并标准化了这项工作。在本单元中,我们将讨论如何在生物图像分析中使用人工智能、现成的工具和验证要求。

从一开始就警告:模型可能“识别”细胞或物种,但也可能错误识别;人眼和真实标签验证对于关键决策至关重要。

两种类型的显示任务

  • 分割:逐像素分离和计数图像中的对象(细胞、细胞核)。示例工具:Cellpose、StarDist。 “这张显微镜图像中有多少个细胞,每个细胞有多大?”
  • 分类/检测:判断图像中的内容或找到其位置。示例:识别相机陷阱照片中的物种(iNaturist、MegaDetector),对叶子是否患病进行分类。

这两项任务需要不同的工具。人工智能 (LLM) 可帮助您选择正确的工具、编写安装和调用代码并解释输出。

提示:在图像分析中,大多数时候您不需要从头开始训练模型。 Cellpose 等预训练工具可直接作用于多种细胞类型。先尝试一下准备好的工具;但在几张图像中手动确认结果。

一步一步:在显微镜图像上计数细胞

  1. 准备图像:一致的放大倍数、照明;请注意文件格式(TIFF 等)。
  2. 刻度校准:了解每个像素有多少微米(对于尺寸测量至关重要)。
  3. 如果是核心染色,则选择分割工具:StarDist; Cellpose 为细胞质。
  4. 运行:在图像上尝试该工具。
  5. 手动验证:将模型找到的细胞与实际图像进行比较;计算合并/丢失的单元格。
  6. 批次:如果验证令人满意,则应用于整个集合。
  7. 报告:细胞数量、尺寸分布;记录方法和准确性。

可复制的提示模板

角色:您是生物图像分析助理。任务:编写 Python 代码,使用 Cellpose 对显微镜图像中的细胞进行分割和计数。输入:image.tif,单通道。输出:细胞计数和掩模可视化。提供带有注释的工作代码并证明模型选择的合理性。

如何验证我的分段输出?建议一种方法和指标(精度、召回率、F1)来将模型找到的细胞数量与我手动计数的样本进行比较。也写代码吧。

解释一下用于检测我的相机陷阱照片中的动物的 MegaDetector 工作流程。解释消除空白帧所节省的时间和漏报风险。

编写代码,利用比例尺信息进行像素到微米的转换,并计算每个单元格的面积(以平方微米为单位)。校准:[X] 像素 = [Y] 千分尺。

弱提示/强提示

弱:“数一下这张照片中的细胞。”

Strong:“我有一个 DAPI 染色的细胞核图像(TIFF,单通道,2048x2048,比例 0.32 µm/像素)。编写代码,使用 StarDist 预先训练的 2D 模型分割和计数细胞核,给出每个细胞核的面积(以平方微米为单位)。然后添加与 3 个图像中的手动计数进行比较的代码,并生成准确度报告。”

区别:强大的提示有图像类型、绘画、分辨率、比例和验证方案。该模型使用正确的工具和正确的比例。

三个迷你箱子

案例 1 — 汇合细胞:一名学生使用 Cellpose 对密集组织图像中的 400 个细胞进行了计数;当我用手数时,结果是 560 个。模型将相互接触的细胞合并为一个细胞。 AI建议调整细胞直径参数,改变流量阈值;计数上升到545。教训:根据实际图像调整参数。

案例 2 — 物种混淆:在一个生态项目中,自动物种识别在夜间图像中反复将狐狸标记为“猫”。该模型解释说,低光照和训练数据不平衡可能会导致此错误;该团队将不明确的标签转发给人工验证。教训:如果模型的置信度较低,则必须进行人工验证。

案例 3 — 比例错误:一位研究人员以像素为单位报告了细胞面积,但忘记转换为微米;结果与文献不相符。当人工智能添加校准步骤后,这些值落在了合理的范围内。教训:物理单位转换至关重要。

对比图

任务

合适的车辆

验证指标

核心细分

星距

F1 手动计数

细胞质/细胞边界

细胞姿势

IoU(重叠率)

物种鉴定(野生动物)

巨型探测器/iNaturist

信任评分+人工认可

疾病分类

经过专门训练的模型

混淆矩阵

常见错误

  • 无需手动验证的批处理:将模型的错误传播到整个数据。
  • 跳过比例校准:不将像素单位转换为物理单位。
  • 接受低置信度的预测:不向人类提及不确定的情况。
  • 将参数保留为默认值:不使细胞直径等设置适应图像。
  • 训练分布之外的图像:在从未见过的情况下(不同的颜色、类型)盲目地使用模型。
注意:图像模型可能在与训练数据相似的图像上表现良好,但在不同条件下(新染色、新物种、不同显微镜)却出乎意料地表现不佳。当转移到新的数据集时,如果没有在多个图像上手动验证模型,请不要信任该模型。人类的同意对于物种保护或诊断等重大决策至关重要。

从细分到测量:超越数字

细胞计数通常是第一步;内在值提取每个对象的测量值。每个细胞的数十个特征,例如面积、周长、圆度、荧光强度(标记的表达量),可以从分割掩模中计算出来。 scikit-image 库中的regionprops 函数可以执行此操作。人工智能编写代码来提取这些测量结果并将结果放入表格中;您还可以比较各组(例如“处理的细胞比对照组小吗?”)。

使用 scikit-image regionprops 从 Cellpose 掩模中提取每个细胞的面积、周长和平均荧光强度。将结果写入CSV;在箱线图中比较对照组和治疗组。应用刻度校准(微米/像素)。

提示:测量密度时不要忘记去除背景;未校准的强度值取决于显微镜设置,并且不是以绝对值进行比较,而是以在相同条件下拍摄的组之间的相对值进行比较。

何时训练模型:数据少,仔细标记

有时现成的工具是不够的,您需要训练自己的分类模型(例如特定的疾病症状)。这里有两个陷阱很突出。首先是数据泄漏:同一个人/样本的图像同时包含在训练集和测试集中,使模型看起来比实际更成功;在个人层面进行划分。第二类是不平衡类:如果患者样本很少,模型虽然说“永远健康”,但准确率很高,但毫无用处;查看灵敏度(召回率)和混淆矩阵而不是准确性。人工智能编写了这些训练代码,但你的工作就是克服这些方法论陷阱。

图像质量和预处理

显示模型的成功直接取决于您提供的图像的质量。失焦、曝光过度、对比度低或以不同放大倍率拍摄的图像即使是最好的模型也会让人困惑。这就是为什么分割之前的简单预处理步骤通常会显着改善结果:背景校正(消除照明不平衡)、对比度归一化和降噪。 AI编写此预处理代码(使用scikit-image或OpenCV);但您可以通过查看图像来决定需要进行哪些校正。过度的预处理也是危险的:过度“清理”图像会抹去实际的生物结构,变成数据美化。规则是这样的:预处理应该以相同的、预定义的方式应用于所有图像,而不是选择性地一张一张地进行以美化结果。

在分割之前对我的显微镜图像应用标准预处理:背景校正、对比度标准化、轻微降噪。对所有图像应用相同的参数(不是选择性的)。显示之前/之后的比较。使用 scikit 图像。

总之

人工智能在生物图像分析(细胞分割、物种/疾病检测)方面节省了大量时间。 Cellpose、StarDist、MegaDetector 等现成工具可以解决大多数任务,无需从头开始训练。然而,结果必须手动验证,量表必须校准,并且低置信度分数必须针对人类。该模型在训练分布之外是不可靠的;转移到新数据时,确认至关重要。

应用任务

拍摄显微镜图像(或样本数据)。让人工智能编写并运行使用 Cellpose 或 StarDist 对细胞进行分割和计数的代码。通过手动计数模型在至少一张图像中找到的细胞进行比较;注意有多少单元格被遗漏/合并。通过添加刻度校准来报告以平方微米为单位的细胞面积。

清单

  • [ ] 我在提示中添加了图像类型、绘画和分辨率。
  • [ ] 我应用了刻度校准(像素微米)。
  • [ ] 我在至少一张图像上手动验证了结果。
  • [ ]我根据图像设置分割参数。
  • [ ] 我将置信度较低的预测转发给人工验证。
  • [ ] 在没有在新数据集中确认模型的情况下,我并不信任该模型。