Прибуток:
- Здатність зрозуміти проблему множинного порівняння та включити в аналіз корекцію FDR (швидкість помилкових відкриттів).
- Здатність розрізняти статистичну та біологічну значущість шляхом спільної оцінки p-value та розміру ефекту (log2-кратна зміна)
- Здатність розпізнавати та уникати пасток великих даних, таких як пакетний ефект і причинно-наслідковий стрибок
Слово «оміка» описує підходи, які вимірюють цілий клас молекул у клітині: геноміка (всі ДНК), транскриптоміка (всі експресії РНК/генів), протеоміка (усі білки), метаболоміка (усі малі молекули). Загальною рисою цих вимірювань є їх висока розмірність: тисячі або навіть десятки тисяч змінних (генів, білків) вимірюються одночасно в одній пробі, але кількість зразків зазвичай невелика (наприклад, 20 пацієнтів). Ця ситуація «багато змінних, мало зразків» є джерелом проблем, унікальних для біології та тих сфер, де ШІ може бути найбільш корисним.
У цьому розділі ми обговоримо диференціальний аналіз експресії (пошук генів, експресія яких суттєво змінюється між двома групами) і роль штучного інтелекту в цьому робочому процесі на прикладі транскриптоміки (RNA-seq).
Основна проблема даних великої розмірності
Якщо ви протестуєте тисячі генів одночасно, ви випадково знайдете гени, які здаються «значними», навіть якщо реальних відмінностей немає. Якщо ви протестуєте 20 000 генів із 5% похибкою, приблизно 1000 генів можуть випадково виявитися «значущими». Це називається проблемою множинного порівняння і є найбільш критичною підводним каменем аналізу omics. Рішення полягає в тому, щоб виправити р-значення (наприклад, розрахувати FDR — частоту помилкових відкриттів за методом Бенджаміні-Хохберга). ШІ дуже допомагає пояснити цю концепцію та написати правильний код; але це ваша відповідальність не забувати застосувати виправлення.
Порада: якщо ви бачите число на кшталт «3000 генів значно змінено» в результатах omics, стривожіться. Зазвичай це ознака того, що корекція множинного порівняння не була зроблена. Реалістичний список складався б із десятків чи кількох сотень генів у добре спланованому експерименті.
Диференціальна експресія RNA-seq: крок за кроком
- Необроблені підрахунки: таблиця, яка містить кількість зчитувань у кожному зразку для кожного гена.
- Якість і фільтрація: відкидайте гени з дуже низькою експресією.
- Нормалізація: правильна різниця розміру бібліотеки між зразками (грубе число не порівнюється).
- Статистична модель: Перевірте групову різницю за допомогою DESeq2 або edgeR (бібліотеки R) або pyDESeq2 у Python.
- Корекція множинного порівняння: обчислити FDR; зазвичай порогове значення FDR < 0,05.
- Розмір ефекту: оцініть за допомогою log2 fold change: у скільки разів вираз збільшується/зменшується.
- Коментар: пов’яжіть важливі гени з біологічними шляхами.
Штучний інтелект 3-6. Він кодує кроки, пояснює поняття та допомагає вам інтерпретувати результат. Однак модель не може сказати, «який ген змінився», не побачивши ваших вихідних даних; Про це вам говорять код і статистика.
Шаблони підказок, які можна копіювати
Роль: Ви асистент транскриптомічного аналізу. Контекст: у мене є таблиця необробленого підрахунку RNA-seq (CSV) із 12 контрольних і 12 зразків для лікування. Завдання: перелічіть кроки аналізу диференціального виразу за допомогою pyDESeq2, поясніть, чому кожен крок необхідний. Спочатку плануйте, потім кодуйте. Обов’язково внесіть корекцію множинного порівняння.
Результати мого аналізу показали 4200 генів як "p<0,05". Чому це може бути підозрілим? Поясніть корекцію множинного порівняння (Benjamini-Hochberg FDR) і надайте код Python, який виконує правильну фільтрацію.
Напишіть код, який малює графік вулкана з моєї таблиці результатів диференціального виразу (стовпці gene, log2FC, padj). Розфарбуйте гени FDR<0,05 і |log2FC|>1, позначте 10 найвищих.
Як мені проаналізувати цей значний список генів для збагачення шляху? Поясніть кроки gseapy або g:Profiler. Не стверджуйте абсолютну причинність у коментарі, використовуйте кореляційну мову. Список генів: [список]
Слабка підказка / Сильна підказка
Слабкий: «Скажіть мені, які гени важливі для виходу RNA-seq».
Сильно: «У мене є вихідні дані pyDESeq2 із 12 контрольних, 12 зразків лікування: таблиця зі стовпцями генів, log2FoldChange, padj. Надайте код, який фільтрує важливі гени з пороговими значеннями FDR<0,05 і |log2FC|>1, повідомляє їх кількість і ранжує 20 найсильніших генів за розміром ефекту. Потім поясніть, чому ці порогові значення розумні».
Відмінність: потужна підказка має фактичні вихідні стовпці, порогові значення та запит перевірки. Модель обробляє ваші дані замість того, щоб генерувати вигадану назву гена.
три міні-чохла
Випадок 1 — Катастрофа без корекції: група знайшла 3800 «значущих» генів з p<0,05 без корекції та подала це до публікації. Коли рефері попросив виправити FDR, список скоротився до 47 генів. Якби штучний інтелект з самого початку додав код Бенджаміні-Хохберга, цього конфузу не сталося б. Урок: виправлення не підлягає обговоренню.
Випадок 2 — Ефект партії: в одному дослідженні зразки обробляли в два різні дні. Те, що вони вважали різницею «пацієнт проти контролю», насправді було різницею «1-й день проти 2-го дня» (ефект партії: технічна різниця через групу відбору). ШІ допоміг усунути помилковий сигнал, запропонувавши додати змінну партії до моделі (~ партія + умова у формулі моделі).
Випадок 3 — Ігнорування кратної зміни: Студент оголосив «найважливішим» ген, експресія якого змінилася на 2%, але була визначена як дуже стабільна, просто дивлячись на p-значення. Тоді як розмір ефекту (log2FC) був майже нульовим; статистична значущість не є біологічною значущістю. Модель пояснила цю відмінність і запропонувала візуалізувати її за допомогою графіка вулканів.
Порівняльна таблиця: ясність концепції
концепція
Значення
Чому це важливо?
р-значення
Імовірність того, що різниця є випадковим збігом
сам по собі може ввести в оману
FDR (padj)
Виправлена кількість помилок під час багаторазового тестування
Обмежує помилкові спрацьовування
log2 кратна зміна
Розмір ефекту
Вказує на біологічне значення
пакетний ефект
Технічна різниця партії
Створює фальшивий сигнал
нормалізація
Корекція міжвибіркової шкали
Робить порівняння справедливим
Поширені помилки
- Пропуск корекції множинного порівняння: найпоширеніша та найсерйозніша помилка.
- Дивлячись лише на p-значення: обов’язково враховуйте розмір ефекту (log2FC) разом.
- Не враховуючи пакетний ефект у моделі: технічну різницю помилково прийняти за біологічну.
- Забути про нормалізацію: безпосередньо порівнювати необроблені числа.
- Причинно-наслідкова мова: вислів «Цей ген викликає хворобу»; Дані Omics показують кореляцію, причинність вимагає додаткових експериментів.
Застереження: у багатовимірних даних «статистично значущі» та «біологічно значущі» — це дві різні речі. Список генів, створений штучним інтелектом, є початковою гіпотезою; Кожен ген-кандидат не можна вважати остаточним без перевірки незалежним методом (qPCR, вимірювання білка).
Зменшення розміру та контроль якості
Перше, що потрібно зробити в даних великої розмірності, це побачити загальну структуру вибірок. Стандартним інструментом для цього є PCA (аналіз головних компонентів: зведення тисяч змінних до кількох підсумкових осей і відображення їх у 2 вимірах). Якщо очікувані групи (контроль/лікування) розділені в таблиці PCA, це добре; але якщо зразки згруповано за «день обробки», а не за групою, це попередження про груповий ефект. Ця сама діаграма також відразу показує один викид (невдалий) приклад.
Намалюйте PCA з моєї нормалізованої таблиці експресії (ген рядка, зразок стовпця). Кольорові зразки за групами (контроль/лікування), форма за партією обробки. Прокоментуйте, чи видно на графіку груповий ефект або викид.
Цей евристичний крок керує рештою аналізу: краще виявити викид раніше, ніж витрачати місяці на фальшивий результат.
Дані з однієї комірки: новий вимір
В останні роки набуло широкого поширення одноклітинне секвенування РНК (single-cell RNA-seq: вимірювання профілю експресії тисяч окремих клітин). Тут даних стає ще більше: десятки тисяч клітин, тисячі генів кожна. Такі інструменти, як Scanpy (Python), обробляють ці дані; кластеризує клітини та визначає типи клітин. ШІ пише код для цього робочого процесу, але біологічна номенклатура типів клітин (незалежно від того, чи є кластер «Т-клітиною» чи «макрофагом») спирається на гени-маркери та експертні знання. Обов’язково підтвердьте мітку типу клітинки, яку модель призначає кластеру з відомими маркерами; Це крок, який найчастіше неправильно розуміють в аналізі однієї клітини.
Відкриті дані та відтворюваність
Більшість досліджень omics завантажують свої дані в публічні репозиторії: GEO (Gene Expression Omnibus) і ArrayExpress для експресії генів, SRA (Sequence Read Archive) для необроблених послідовностей, PRIDE для протеоміки. Це важливо, щоб інші могли перевірити ваші результати, а ви могли повторно проаналізувати дані інших досліджень. ШІ може писати код (за допомогою таких інструментів, як GEOparse), який завантажує та впорядковує дані з реєстраційного номера GEO (наприклад, номера GSE); Але обов’язково прочитайте та підтвердьте дизайн даних, які ви завантажили (скільки груп, скільки повторень, який процес) з оригінального запису. Якщо модель стверджує, що «пам’ятає» дизайн дослідження, це майже завжди припущення, яке потрібно перевірити.
Підсумовуючи
Дані Omics вимірюють тисячі змінних у невеликій вибірці; Це створює пастки численних порівнянь, групових ефектів і надмірної інтерпретації. Штучний інтелект; Він пише код для диференціального аналізу виразів, пояснює поняття та допомагає вам інтерпретувати результати. Однак ви несете відповідальність за застосування корекції FDR, оцінку розміру ефекту та уникнення мови причинності. Гени-кандидати є гіпотезами, доки не будуть перевірені незалежним методом.
Аплікаційне завдання
Отримати або створити зразок таблиці результатів диференціального виразу (gen, log2FC, padj). Попросіть штучний інтелект написати код, який фільтрує за FDR<0,05 і |log2FC|>1, повідомляє про кількість значущих генів і будує графік вулкана. Запустіть код. Потім попросіть модель обчислити, скільки генів виглядатиме «значущим», якби виправлення не було зроблено, і інтерпретувати різницю.
контрольний список
- [ ] Я застосував корекцію множинного порівняння (FDR).
- Я оцінив розмір ефекту (log2FC), а також [ ] p-значення.
- [ ] Я перевірив партію/технічні змінні.
- [ ] Я не пропустив етап нормалізації.
- [ ] Я використовував мову кореляції, а не причинності.
- [ ] Я позначив гени-кандидати як гіпотези, які потребують підтвердження.