Прибыль:
- Коррекция множественного тестирования (скорректированное значение p) при дифференциальном анализе экспрессии и способность правильно интерпретировать изменение кратности и избегать ложноположительных результатов.
- Обнаружение пакетного эффекта и добавление его к модели с помощью PCA и отделение технического шума от биологического различия.
- Возможность связать каждую идентичность пути с источником и контролировать ее с биологической согласованностью при обогащении пути и интеграции нескольких омиков.
Ячейка — это не одно число; Это система, в которой одновременно танцуют тысячи генов, белков и метаболитов. Омика (собирательное название подходов, измеряющих биологический слой в целом) пытается охватить весь этот танец: геномика (ДНК), транскриптомика (РНК — какие гены работают и насколько), протеомика (белки), метаболомика (маленькие молекулы). Каждый слой омики генерирует тысячи размерных, зашумленных и дорогостоящих данных. ИИ способен сканировать эти многомерные данные и маркировать шаблоны; Но именно вы решаете, какая закономерность является биологической истиной, а какая техническим шумом.
В этом разделе мы рассмотрим транскриптомику, наиболее распространенный омик-анализ; Эти принципы применимы и к другим слоям. Типичный рабочий процесс: матрица экспрессии из необработанных данных (строки — это гены, столбцы — образцы, клетки — уровни экспрессии), нормализация (удаление технических различий), дифференциальный анализ экспрессии (поиск генов, которые значительно изменяются в зависимости от двух условий), обогащение путей (определение того, в каких биологических путях группируются измененные гены) и интерпретация.
Дифференциальное выражение: кратное изменение и скорректированное значение p
Чтобы определить, «изменился» ли ген, смотрят на два числа: кратное изменение — сколько раз экспрессия увеличивается/уменьшается, обычно по шкале log2 — и скорректированное значение p (padj — статистика, которая контролирует ложноположительные результаты при многократном тестировании). Зачем исправлять? Потому что вы тестируете 20 000 генов одновременно; Даже случайно сотни генов могут оказаться «значимыми». Без корректировки множественных тестов (ограничения количества ложных обнаружений с помощью таких методов, как Бенджамини-Хохберг) список вводит в заблуждение. ИИ может написать сценарий, вычисляющий эту статистику, но если он пропустит поправку, ваш результат будет неоправдан с научной точки зрения.
Внимание: ИИ может сказать, что «500 генов значительно изменились» на основе необработанного значения p. Глядя на скорректированное значение p, число может упасть до 30. Всегда проверяйте поправку по нескольким тестам самостоятельно; В этом разница между принятием и отклонением публикации.
Пакетный эффект: самая коварная ловушка
Эффект партии (технические различия, возникающие в результате обработки образцов в разные дни, устройствами или людьми) является крупнейшим источником ошибок при омическом анализе. Если ваши два состояния были обработаны в два разных дня, «биологическая разница», которую вы видите, на самом деле может быть разницей в день. ИИ может предложить добавить в модель пакетную переменную (например, ~партия + условие), но вы обязаны правильно ее настроить и не перепутать в схеме эксперимента.
Совет: Прежде чем приступить к анализу, нарисуйте диаграмму PCA (анализ главных компонентов — метод, который суммирует и визуализирует многомерные данные по нескольким осям). Если образцы группируются по партиям, а не по биологическому состоянию, эффект партии является доминирующим и должен быть скорректирован в первую очередь.
Интеграция мультиомики
Настоящее понимание часто приходит после объединения слоев: если ген работает усерднее, но количество белка в нем не увеличивается, регуляция происходит на уровне трансляции. Интеграция мультиомики — объединение различных уровней омики в единую модель — это то, где ИИ становится сильнее, но также и там, где он больше всего вводит в заблуждение; потому что масштабы, шум и совпадения выборок слоев разные. ИИ предлагает рабочий процесс интеграции, но вы контролируете биологическую согласованность результатов.
три мини-кейса
Случай 1 — Ускоренное обогащение. В рамках проекта по борьбе с раком было обнаружено 1240 дифференциальных генов. ИИ подготовил их к обогащению путей, высветив клеточный цикл и пути восстановления ДНК; Команда создала карту-гипотезу за 2 часа. Но они повторно протестировали каждый путь с помощью независимого инструмента (g:Profiler) и обнаружили, что один путь был неверно отображен ИИ.
Случай 2 — Пакетная ловушка. Одна лаборатория обнаружила «поразительную» разницу в 900 генов между двумя группами лечения. Когда они выполнили PCA, они увидели, что образцы были разделены партиями секвенирования. После пакетной коррекции фактическая разница уменьшилась до 60 генов. ИИ непреднамеренно пропустил переменную партии при первом анализе.
Случай 3 — Придуманное название пути. Студент дал список генов ИИ и спросил: «Какой путь KEGG?» ИИ предоставил идентификатор и имя пути, как если бы он был реальным. Когда студент выполнил поиск на KEGG, он увидел, что этого идентификатора не существует; проверка предотвратила сфабрикованный результат.
Четыре копируемых шаблона
1) Схема рабочего процесса DESeq2:
Ваша роль: компьютерный биолог. Напишите пошаговый сценарий дифференциального анализа экспрессии РНК-сек с помощью R/DESeq2: считывание матрицы подсчета, формулу расчета (~ партия + условие), нормализацию, таблицу результатов. ЯВНО примените множественную коррекцию тестирования (BH) и используйте Padjcolumn. Объясните, что делает каждый шаг, в строке комментария.
2) Контроль качества/партии:
Дайте мне контрольный список контроля качества РНК-секвенирования: контроль партии с помощью PCA, размер библиотеки, количество обнаружений генов, обнаружение выбросов. Для каждого показателя укажите пороговое значение «то, что я вижу, меня беспокоит». Объясните, что мне делать, если партия и биологическое состояние смешаны.
3) Проверка результатов обогащения:
Я дам вам расширенный список путей (количество путей, падж, гены). Запишите дословно название каждого пути (KEGG/GO ID) и не выдумывайте его. Отфильтруйте результаты с помощью paj < 0,05. Укажите, какие пути биологически поддерживают друг друга, но отметьте каждую идентичность как «необходимо проверить в базе данных».
4) Проверка согласованности нескольких омиков:
Транскриптомика и протеомика дают противоречивые направления экспрессии пары ген/белок. Перечислите возможные биологические (редактирование после перевода) и технические (шум измерений, сопоставление выборок) причины этого и расскажите, как проверить каждую из них.
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Назовите важные пути в этом списке генов.
Нет источников, нет статистики, высокий риск сфабрикованных путей.
Мощная подсказка:
Ваша роль: компьютерный биолог. В прилагаемой дифференциальной таблице генов (gene, log2FC,padj) берутся только гены с paj <0,05. Расскажите мне, какие этапы анализа обогащения GO необходимо выполнить с помощью этих генов, и инструмент (g:Profiler), который я буду использовать. Имя пути — FAKE; Я запущу инструмент и проведу анализ, вы просто опишите правильную методологию и коррекцию многократного тестирования.
Отличие: четкий фильтр, фокус на методологии, запрет на изготовление и оставление проверки пользователю.
Этапы омического анализа
шаг
Цель
распространенная ошибка
Роль ИИ
нормализация
Устранить техническую разницу
Неправильный выбор метода
Сценарий + обоснование
ПКА/КК
Обнаружение пакетов и выбросов
пропусти мой шаг
Изображение + комментарий
дифференциальное выражение
Обнаружение изменяющихся генов
Неисправленный р
Черновик сценария
обогащение
найти путь
сфабрикованный путь
методология
интеграция
объединить слои
Ошибка масштабирования/совпадения
Рекомендации по рабочему процессу
Омика одноклеточных клеток: новый масштаб
В последние годы секвенирование отдельных клеток — измерение профиля экспрессии каждой из тысяч клеток отдельно — вывело омику на новое измерение. Теперь вместо «средней экспрессии ткани» мы можем видеть каждый тип клеток в этой ткани отдельно. Эта сила создает новые ловушки: данные чрезвычайно скудны (большинство генов имеют нулевое чтение в большинстве клеток — выпадение), размер составляет десятки тысяч клеток × двадцать тысяч генов, а разделение типов клеток в основном осуществляется путем кластеризации. ИИ обладает мощными возможностями создания схем кластеризации и маркировки типов ячеек для данных одной ячейки; но вы проверяете с помощью известных генов-маркеров, является ли каждый кластер реальным типом клеток или техническим артефактом (например, мертвые клетки, две клетки, собранные вместе). Не принимайте обозначение типа клеток, предложенное AI, без подтверждения маркерных генов этого кластера в реальной литературе.
Совет: если при анализе отдельных клеток ИИ предлагает метку «Т-клетки» для кластера, убедитесь сами, что маркеры Т-клеток (например, CD3) действительно высоко экспрессируются в этом кластере. Если метка не поддерживается токеном, это гипотеза, а не вывод.
Распространенные ошибки
- Пропуск множественной коррекции тестирования. Список пополняется необработанным значением p; следует использовать падж.
- Принимаем пакетный эффект за биологию. Его следует сначала проверить с помощью PCA.
- Сделать смену пола единственным критерием. Высокие кратные изменения могут вводить в заблуждение в отношении шумных генов с низкой экспрессией.
- Принятие выдуманного пути/идентичности GO. Каждая личность должна быть проверена в базе данных.
- Недооценка размера выборки. Статистическая мощность низкая в схеме 2 на 2; Результаты следует интерпретировать с осторожностью.
В итоге
Анализ Omics работает с многомерными зашумленными данными, а ИИ ускоряет эти данные, сканируя их, записывая сценарии и отмечая шаблоны. Но множественная коррекция тестов при дифференциальном выражении, контроль партий с помощью PCA и проверка источника при обогащении необходимы. Интеграция мультиомики эффективна, но вводит в заблуждение; Проверьте каждый результат на биологическую состоятельность, принимая во внимание масштаб и шумовые различия слоев.
Задача приложения
Найдите общедоступную матрицу подсчета секвенирования РНК (например, из GEO). Попросите ИИ написать сценарий анализа с шаблоном «рабочий процесс DESeq2» и проверить код, действительно ли была применена коррекция множественного тестирования. Затем запросите у ИИ дополнительный комментарий и проверьте все идентификаторы пути, которые он возвращает, один за другим, с базой данных KEGG или GO; Обратите внимание, сколько из них настоящие.
контрольный список
- [ ] В дифференциальном анализе я использовал paj (скорректированный), а не необработанное значение p.
- [ ] Я проверил пакетный эффект с помощью PCA и при необходимости добавил его в модель.
- [ ] Я с осторожностью интерпретировал гены с высокой кратностью изменений, но с низкой экспрессией.
- [ ] Я сверил каждый идентификатор пути/GO с реальной базой данных.
- [ ] Я оценил статистическую мощность размера выборки.
- [ ] Я разделил противоречия мультиомики на биологические и технические причины.