Единица 4 / 11

Данные Omics и многомерный анализ

Прибыль:

  • Способность понимать проблему множественного сравнения и включать в анализ коррекцию FDR (коэффициента ложного обнаружения).
  • Способность различать статистическую и биологическую значимость путем совместной оценки значения p и размера эффекта (кратное изменение log2).
  • Способность распознавать и избегать ловушек многомерных данных, таких как пакетный эффект и скачок причинно-следственной связи.

Слово «омика» описывает подходы, которые измеряют целый класс молекул в клетке: геномика (все ДНК), транскриптомика (все экспрессии РНК/генов), протеомика (все белки), метаболомика (все малые молекулы). Общей чертой этих измерений является их высокая размерность: в одном образце одновременно измеряются тысячи или даже десятки тысяч переменных (генов, белков), но количество образцов обычно невелико (например, 20 пациентов). Эта ситуация «много переменных, мало образцов» является источником проблем, уникальных для биологии и областей, где ИИ может быть наиболее полезным.

В этом разделе мы обсудим дифференциальный анализ экспрессии (поиск генов, экспрессия которых значительно меняется между двумя группами) и роль искусственного интеллекта в этом рабочем процессе на примере транскриптомики (RNA-seq).

Основная проблема многомерных данных

Если вы протестируете тысячи генов одновременно, вы случайно обнаружите гены, которые покажутся «значимыми», даже если между ними нет реальных различий. Если вы протестируете 20 000 генов с погрешностью 5%, примерно 1000 генов могут случайно оказаться «значимыми». Это называется проблемой множественного сравнения и является наиболее серьезной ошибкой омического анализа. Решение состоит в том, чтобы скорректировать p-значения (например, рассчитать FDR — частоту ложных открытий с помощью метода Бенджамини-Хохберга). ИИ очень помогает объяснить эту концепцию и написать правильный код; но вы обязаны не забыть внести исправления.

Совет: если в результате омикса вы увидите цифру типа «3000 генов значительно изменились», встревожьтесь. Обычно это признак того, что коррекция множественного сравнения не была произведена. Реалистичный список мог бы включать от десятков до нескольких сотен генов в хорошо спланированном эксперименте.

Дифференциальная экспрессия RNA-seq: шаг за шагом

  1. Необработанные подсчеты: таблица, показывающая, сколько прочтений попало в каждый образец для каждого гена.
  2. Качество и фильтрация. Отбрасывайте гены с очень низкой экспрессией.
  3. Нормализация: исправлена ​​разница в размерах библиотек между образцами (грубое число несопоставимо).
  4. Статистическая модель: разница в тестовой группе с DESeq2 или EdgeR (библиотеки R) или pyDESeq2 в Python.
  5. Коррекция множественных сравнений: расчет FDR; обычно порог FDR < 0,05.
  6. Размер эффекта: Оцените с помощью изменения log2: во сколько раз увеличивается/уменьшается выражение.
  7. Комментарий: Свяжите значимые гены с биологическими путями.

Искусственный интеллект 3-6. Он кодирует шаги, объясняет концепции и помогает интерпретировать выходные данные. Однако модель не может сказать, «какой ген изменился», не видя ваших необработанных данных; Об этом вам говорят код и статистика.

Копируемые шаблоны подсказок

Роль: Вы ассистент по транскриптомному анализу. Контекст: у меня есть необработанная таблица подсчета РНК-секвенирования (CSV) из 12 контрольных и 12 обработанных образцов. Задание: Перечислите этапы дифференциального анализа выражений с помощью pyDESeq2, объясните, почему необходим каждый шаг. Сначала планируйте, потом код. Обязательно включите коррекцию множественного сравнения.

Результаты моего анализа показали, что 4200 генов имеют значение «p<0,05». Почему это может быть подозрительно? Объясните коррекцию множественного сравнения (FDR Бенджамини-Хохберга) и приведите код Python, который выполняет правильную фильтрацию.

Напишите код, который рисует график вулкана из моей таблицы результатов дифференциальных выражений (столбцы Gene, log2FC, Padj). Раскрасьте гены FDR<0,05 и |log2FC|>1, отметьте 10 верхних.

Как мне проанализировать этот важный список генов для обогащения путей? Объясните шаги gseapy или g:Profiler. Не претендуйте на абсолютную причинность в комментарии, используйте корреляционный язык. Список генов: [список]

Слабая подсказка / Сильная подсказка

Слабое: «Скажите мне, какие гены важны для выхода РНК-секвенирования».

Стронг: «У меня есть выходные данные pyDESeq2 из 12 контрольных и 12 обработанных образцов: таблица со столбцами Gene, log2FoldChange, Padj. Приведите код, который фильтрует значимые гены с порогами FDR<0,05 и |log2FC|>1, сообщает их количество и ранжирует 20 самых сильных генов по величине эффекта. Затем объясните, почему эти пороги разумны».

Разница: мощное приглашение содержит фактические выходные столбцы, пороговые значения и запрос проверки. Модель обрабатывает ваши данные вместо того, чтобы генерировать вымышленное имя гена.

три мини-кейса

Случай 1 — Катастрофа без коррекции: группа обнаружила 3800 «значимых» генов с p<0,05 без коррекции и представила их для публикации. Когда рефери попросил исправить ФДР, список сократился до 47 генов. Если бы искусственный интеллект добавил код Беньямини-Хохберга с самого начала, этого конфуза не произошло бы. Урок: исправление не подлежит обсуждению.

Случай 2 — Пакетный эффект. В одном исследовании образцы обрабатывались в два разных дня. То, что они считали разницей «пациент против контроля», на самом деле было разницей «1-й день против 2-го дня» (эффект партии: техническая разница, обусловленная стороной, производившей выборку). ИИ помог отсеять ложный сигнал, предложив добавить в модель пакетную переменную (~пакет + условие в формуле модели).

Случай 3 — Игнорирование кратности изменения: студент назвал «наиболее важным» ген, экспрессия которого изменилась на 2%, но была измерена как очень стабильная, просто взглянув на значение p. Тогда как размер эффекта (log2FC) был почти нулевым; статистическая значимость не является биологической значимостью. Модель объяснила это различие и предложила визуализировать его с помощью графика вулкана.

Сравнительная таблица: ясность концепции

концепция

Значение

Почему это важно?

p-значение

Вероятность того, что разница окажется совпадением

само по себе может ввести в заблуждение

Рузвельт (падж)

Исправлена частота ошибок при многократном тестировании.

Ограничивает ложные срабатывания

log2 кратное изменение

Размер эффекта

Указывает биологическое значение

пакетный эффект

Техническая разница в партиях

Создает ложный сигнал

нормализация

Межвыборочная коррекция масштаба

Делает сравнение справедливым

Распространенные ошибки

  • Пропуск исправления множественных сравнений: самая распространенная и самая серьезная ошибка.
  • Просто взглянем на значение p: обязательно учитывайте размер эффекта (log2FC) вместе.
  • Не включение группового эффекта в модель: принятие технической разницы за биологическую разницу.
  • Забываем о нормализации: прямое сравнение необработанных чисел.
  • Причинный язык: высказывание «Этот ген вызывает болезнь»; Данные Omics показывают корреляцию, причинно-следственная связь требует дополнительных экспериментов.
Внимание: в многомерных данных «статистически значимые» и «биологически значимые» — это две разные вещи. Список генов, созданный искусственным интеллектом, является первоначальной гипотезой; Каждый ген-кандидат не следует считать окончательным без проверки независимым методом (кПЦР, измерение белка).

Уменьшение размера и контроль качества

Первое, что нужно сделать при работе с многомерными данными, — это увидеть общую структуру выборок. PCA (анализ главных компонентов: объединение тысяч переменных в несколько сводных осей и отображение их в двух измерениях) является стандартным инструментом для этого. Если ожидаемые вами группы (контроль/лечение) разделены на диаграмме PCA, это хорошо; но если образцы сгруппированы по «дням обработки», а не по группам, это предупреждение о пакетном эффекте. На той же диаграмме также сразу же показан один пример выброса (неудачного).

Нарисуйте PCA из моей таблицы нормализованной экспрессии (ген строки, образец столбца). Цветные образцы по группам (контроль/обработка), форма по партиям обработки. Прокомментируйте, наблюдается ли на графике пакетный эффект или шаблон выброса.

Этот эвристический шаг определяет остальную часть анализа: лучше обнаружить выброс раньше, чем тратить месяцы на ложный результат.

Данные одной ячейки: новое измерение

В последние годы широкое распространение получило секвенирование одноклеточной РНК (single-cell RNA-seq: измерение профиля экспрессии тысяч отдельных клеток). Здесь данных становится еще больше: десятки тысяч клеток, каждая по тысяче генов. Эти данные обрабатываются такими инструментами, как Scanpy (Python); кластеризует ячейки и идентифицирует типы ячеек. ИИ пишет код для этого рабочего процесса, но биологическая номенклатура типов клеток (независимо от того, является ли кластер «Т-клеткой» или «макрофагом») опирается на маркерные гены и экспертные знания. Обязательно проверьте метку типа ячейки, которую модель присваивает кластеру с известными маркерами; Это наиболее часто неправильно понимаемый этап анализа отдельных клеток.

Открытые данные и воспроизводимость

Большинство омических исследований загружают свои данные в общедоступные репозитории: GEO (Gene Expression Omnibus) и ArrayExpress для экспрессии генов, SRA (Sequence Read Archive) для необработанных последовательностей, PRIDE для протеомики. Это очень важно для того, чтобы другие могли проверить ваши результаты и чтобы вы могли повторно проанализировать данные других исследований. ИИ может писать код (с помощью таких инструментов, как GEOparse), который загружает и систематизирует данные из регистрационного номера GEO (например, номера GSE); Но обязательно прочитайте и подтвердите оформление скачанных вами данных (сколько групп, сколько повторений, какую обработку) из исходной записи. Если модель утверждает, что «запоминает» план исследования, это почти всегда предположение, которое необходимо проверить.

В итоге

Данные Omics измеряют тысячи переменных в выборке небольшого размера; Это создает ловушки множественных сравнений, пакетных эффектов и чрезмерной интерпретации. Искусственный интеллект; Он пишет код для анализа дифференциальных выражений, объясняет концепции и помогает интерпретировать результаты. Однако вы обязаны применять поправку FDR, оценивать величину эффекта и избегать языка причинно-следственных связей. Гены-кандидаты являются гипотезой, пока не будут проверены независимым методом.

Задача приложения

Получите или создайте образец таблицы результатов дифференциальных выражений (gen, log2FC, Padj). Попросите ИИ написать код, который фильтрует по FDR<0,05 и |log2FC|>1, сообщает количество значимых генов и строит график вулкана. Запустите код. Затем модель должна вычислить, сколько генов выглядело бы «значимым», если бы не была сделана коррекция, и интерпретировать разницу.

контрольный список

  • [ ] Я применил коррекцию множественного сравнения (FDR).
  • Я оценил размер эффекта (log2FC), а также значение p [ ].
  • [ ] Я проверил пакетные/технические переменные.
  • [ ] Я не пропустил этап нормализации.
  • [ ] Я использовал язык корреляции, а не причинности.
  • [ ] Я отметил гены-кандидаты как гипотезы, требующие подтверждения.