Прибуток:
- Корекція множинного тестування (скориговане значення p) у диференціальному аналізі експресії та здатність правильно інтерпретувати зміну кратності та уникати помилкових спрацьовувань
- Виявлення пакетного ефекту та додавання його до моделі за допомогою PCA та відділення технічного шуму від біологічної різниці
- Здатність пов’язувати ідентичність кожного шляху з джерелом і контролювати його за допомогою біологічної узгодженості в збагаченні шляху та інтеграції мультиоміки
Комірка – це не одне число; Це система, в якій тисячі генів, білків і метаболітів танцюють одночасно. Оміка (загальна назва підходів, які вимірюють біологічний шар у цілому) намагається охопити весь цей танець: геноміка (ДНК), транскриптоміка (РНК — які гени працюють і скільки), протеоміка (білки), метаболоміка (малі молекули). Кожен шар omics створює тисячі багатомірних, шумних і дорогих даних. AI є потужним у скануванні цих багатовимірних даних і маркування шаблонів; Але ви вирішуєте, який шаблон є біологічною правдою, а який технічним шумом.
У цьому розділі ми розглянемо транскриптоміку, найпоширеніший омічний аналіз; Ці принципи також застосовуються до інших рівнів. Типовий робочий процес: матриця експресії з необроблених даних (рядки — це гени, стовпці — зразки, клітини — рівні експресії), нормалізація (усунення технічних відмінностей), диференціальний аналіз експресії (пошук генів, які суттєво змінюються між двома умовами), збагачення шляху (виявлення біологічних шляхів, у яких згруповані змінені гени) та інтерпретація.
Диференціальний вираз: зміна кратності та виправлене значення p
Щоб визначити, чи «змінився» ген, розглядаються дві цифри: кратна зміна — у скільки разів збільшується/зменшується експресія, зазвичай за шкалою log2 — і скориговане значення p (padj — статистика, яка контролює хибнопозитивні результати під час багаторазового тестування). Навіщо виправляти? Тому що ви тестуєте 20 000 генів одночасно; Навіть випадково сотні генів можуть виявитися «значущими». Без коригування багаторазового тестування — обмеження частоти помилкових відкриттів за допомогою таких методів, як Бенджаміні-Хохберг — список вводить в оману. Штучний інтелект може написати сценарій, який обчислює цю статистику, але якщо він пропускає виправлення, ваш результат є науково необґрунтованим.
Застереження: штучний інтелект може сказати, що «500 генів суттєво змінилися» на основі необробленого p-значення. Дивлячись на виправлене значення p, число може впасти до 30. Завжди самостійно перевіряйте корекцію мультитесту; У цьому полягає різниця між прийняттям і відхиленням публікації.
Пакетний ефект: найпідступніша пастка
Пакетний ефект (технічна різниця, що виникає внаслідок обробки зразків різними днями, пристроями чи людьми) є найбільшим джерелом помилок в аналізі omics. Якщо ваші два захворювання були оброблені в два різні дні, «біологічна різниця», яку ви бачите, насправді може бути різницею в день. Штучний інтелект може запропонувати додати змінну партії до моделі (наприклад, ~ партія + умова), але ви несете відповідальність правильно налаштувати її та не змішувати в плані експерименту.
Порада: перед початком аналізу намалюйте діаграму PCA (аналіз основних компонентів – метод, який узагальнює та візуалізує багатовимірні дані на кількох осях). Якщо зразки групуються за партіями, а не за біологічними умовами, ефект партії є домінуючим, і його потрібно спочатку скорегувати.
Інтеграція Multi-omics
Справжнє розуміння часто приходить після об’єднання шарів: якщо ген працює більше, але його білок не збільшується, регуляція відбувається на трансляційному рівні. Інтеграція мультиоміки — поєднання різних рівнів оміки в одну модель — це те, де ШІ стає сильнішим, але також і там, де він найбільше вводить в оману; тому що масштаби, шум і збіги зразків шарів різні. AI пропонує робочий процес інтеграції, але ви контролюєте біологічну узгодженість результатів.
три міні-чохла
Випадок 1 — Прискорене збагачення. 1240 диференціальних генів були знайдені в проекті раку. ШІ підготував їх для збагачення шляхів, виділяючи клітинний цикл і шляхи відновлення ДНК; Команда створила карту гіпотези за 2 години. Але вони повторно протестували кожен шлях за допомогою незалежного інструменту (g:Profiler) і виявили, що штучний інтелект неправильно відобразив один шлях.
Випадок 2 — пакетна пастка. Одна лабораторія виявила «разючу» різницю в 900 генів між двома групами лікування. Коли вони провели PCA, вони побачили, що зразки були розділені партією секвенування. Після пакетної корекції фактична різниця зменшилася до 60 генів. ШІ ненавмисно пропустив змінну партії під час першого аналізу.
Випадок 3 — вигадана назва шляху. Студент дав список генів ШІ та запитав: «Який шлях KEGG?» Штучний інтелект надав ідентифікатор шляху та назву, ніби це було справжнім. Коли студент шукав у KEGG, він побачив, що цього ідентифікатора не існує; перевірка запобігла сфабрикованому результату.
Чотири шаблони, які можна копіювати
1) Схема робочого процесу DESeq2:
Ваша роль: обчислювальний біолог. Напишіть покроковий сценарій для диференціального аналізу експресії RNA-seq за допомогою R/DESeq2: зчитування матриці підрахунку, формула дизайну (~ партія + умова), нормалізація, таблиця результатів. ЯВНО застосуйте корекцію багаторазового тестування (BH) і використовуйте padjcolumn. Поясніть, що робить кожен крок, у рядку коментаря.
2) Контроль якості/серії:
Дайте мені контрольний список RNA-seq QC: контроль партії за допомогою PCA, розмір бібліотеки, кількість виявлень генів, виявлення викидів. Для кожного показника вкажіть порогове значення «те, що я бачу, викликає у мене занепокоєння». Поясніть, що мені робити, якщо партія та біологічний стан змішані.
3) Перевірка результату збагачення:
Я надам вам розширений список шляхів (кількість шляхів, padj, гени). Запишіть ідентичність кожного шляху (KEGG/GO ID) дослівно і не вигадуйте. Фільтрувати результати з padj < 0,05. Укажіть, які шляхи біологічно підтримують один одного, але позначте кожну ідентичність як «повинна бути перевірена в базі даних».
4) Перевірка узгодженості Multi-omics:
Транскриптомний і протеомний дають суперечливі напрямки експресії для пари ген/білок. Перелічіть можливі біологічні (редагування після перекладу) і технічні (шум вимірювання, збіг зразків) причини цього та скажіть, як перевірити кожну з них.
Слабка підказка / Сильна підказка
Слабка підказка:
Назвіть важливі шляхи в цьому списку генів.
Немає джерел, немає статистики, високий ризик сфабрикованих шляхів.
Потужна підказка:
Ваша роль: обчислювальний біолог. У доданій диференціальній таблиці генів (ген, log2FC, padj) беруть лише гени з padj < 0,05. Розкажіть мені про кроки аналізу збагачення GO, який потрібно виконати з цими генами, і інструмент (g:Profiler), який я буду використовувати. Ім'я шляху - FAKE; Я запусту інструмент і зроблю аналіз, а ви просто опишіть правильну методологію та кілька корекцій тестування.
Відмінність: чіткий фільтр, методологічний фокус, заборона на виготовлення та залишення перевірки користувачеві.
Кроки аналізу Omics
крок
призначення
типова помилка
роль ШІ
нормалізація
Усуньте технічну різницю
Неправильний вибір методу
Сценарій + обґрунтування
PCA/QC
Виявлення партій і викидів
пропусти мій крок
Зображення + коментар
диференційний вираз
Виявлення змінних генів
Невиправлена стор
Чернетка сценарію
збагачення
знайти шлях
виготовлений шлях
методологія
інтеграція
злиття шарів
Помилка масштабу/відповідності
Рекомендація щодо робочого процесу
Одноклітинна оміка: нова шкала
В останні роки секвенування однієї клітини — вимірювання профілю експресії кожної з тисяч клітин окремо — вивело оміку на новий вимір. Тепер замість «середнього виразу тканини» ми можемо бачити кожен тип клітин у цій тканині окремо. Ця потужність представляє нові підводні камені: дані надзвичайно мізерні (більшість генів мають нульове зчитування в більшості клітин — випадання), розмір становить десятки тисяч клітин × двадцять тисяч генів, а розділення типів клітин здебільшого здійснюється шляхом кластеризації. AI є потужним у створенні кластеризації та контурів маркування типів клітинок на даних однієї клітинки; але ви перевіряєте за допомогою відомих генів-маркерів, чи є кожен кластер справжнім типом клітини чи технічним артефактом (наприклад, мертві клітини, дві клітини, захоплені разом). Не приймайте мітку типу клітини, запропоновану ШІ, не підтвердивши маркерні гени цього кластера в фактичній літературі.
Порада: якщо в аналізі однієї клітини штучний інтелект пропонує мітку «Т-клітин» для кластера, переконайтеся самі, що маркери Т-клітин (наприклад, CD3) дійсно сильно експресуються в цьому кластері. Якщо мітка не підтверджується токеном, це гіпотеза, а не висновок.
Поширені помилки
- Пропуск багаторазового тестування виправлення. Список розповсюджується сирим p-значенням; слід використовувати padj.
- Плутаючи пакетний ефект з біологією. Спочатку його слід перевірити за допомогою PCA.
- Зробити зміну підлоги єдиним критерієм. Висока кратність зміни може вводити в оману щодо шумних генів із низькою експресією.
- Прийняття вигаданого шляху/ідентичності GO. Кожна особа має бути перевірена в базі даних.
- Заниження розміру вибірки. Статистична потужність низька в дизайні 2 на 2; Результати слід інтерпретувати з обережністю.
Підсумовуючи
Аналіз Omics працює з високорозмірними даними з шумом, а штучний інтелект прискорює ці дані, скануючи їх, створюючи сценарії та позначаючи шаблони. Але багаторазова корекція тесту в диференціальному виразі, контроль партії за допомогою PCA та перевірка джерела при збагаченні є незамінними. Інтеграція Multi-omics є потужною, але вводить в оману; Перевірте кожен результат на біологічну узгодженість, враховуючи масштаб і шумові відмінності шарів.
Аплікаційне завдання
Знайдіть загальнодоступну матрицю підрахунку RNA-seq (наприклад, від GEO). Нехай штучний інтелект напише сценарій аналізу за допомогою шаблону «Робочий процес DESeq2» і перевірить у коді, чи справді було застосовано корекцію багаторазового тестування. Потім попросіть штучного інтелекту надати коментар щодо збагачення та перевірте всі ідентифікатори шляхів, які він повертає, один за іншим у базі даних KEGG або GO; Зверніть увагу, скільки справжніх.
контрольний список
- [ ] Я використав padj (виправлений) у диференціальному аналізі, а не необроблене p-значення.
- [ ] Я перевірив груповий ефект за допомогою PCA та додав його до моделі, якщо необхідно.
- [ ] Я обережно інтерпретував гени з високою кратністю зміни, але низькою експресією.
- [ ] Я перевірив кожен шлях/ідентифікатор GO на реальну базу даних.
- [ ] Я оцінив статистичну потужність розміру вибірки.
- [ ] Я розділив мультиомічні протиріччя на біологічні та технічні причини.