Прибуток:
- Здатність розуміти робочий процес RNA-seq, диференціальний аналіз експресії та корекцію множинного тестування (FDR), а також мати штучний інтелект для створення верифікованого коду аналізу
- Здатність критично інтерпретувати статистичні та біологічні результати збагачення шляху
- Здатність виконувати дисципліну перевірки статистичних припущень і множинних помилок тестування та незалежної перевірки біологічної значущості.
«Оміка» — це загальна назва для підходів, які вимірюють усі молекули клітини або тканини разом: геноміка (всі ДНК), транскриптоміка (всі РНК/експресія), протеоміка (усі білки), метаболоміка (усі метаболіти). Ці дані величезні — експеримент RNA-seq передбачає вимірювання десятків тисяч генів. У цьому розділі ви дізнаєтеся, як використовувати штучний інтелект (AI) як помічника в аналізі omics, який пише код, вибирає статистичні дані та складає проекти біологічної інтерпретації; але ви дізнаєтеся, чому ви повинні перевірити статистичні та біологічні результати.
Критичне попередження: в Omics найнебезпечніші помилки є статистичними та невидимими. ШІ може написати код, який обходить корекцію багаторазового порівняння (нижче), вибирає неправильний тест або створює «хибнопозитивні» списки генів. Крім того, штучний інтелект може скласти біологічні твердження на кшталт «цей ген збільшується при тій хворобі» без жодного джерела. Правильний шлях: провести аналіз за допомогою виконуваного коду, який можна перевірити, і підтвердити кожне біологічне твердження в літературі.
Основні поняття
- Експресія: скільки гена транслюється в РНК; міра «активності».
- Диференціальна експресія (DE): гени, експресія яких значно змінюється між двома групами (наприклад, пацієнт/здоровий).
- p-value: ймовірність того, що різниця є збігом; якщо вона невелика, різниця вважається «значною».
- Корекція множинного порівняння: якщо одночасно розглядати десятки тисяч генів, випадково будуть деякі «значущі». Щоб виправити це, використовуються такі методи, як FDR (частота помилкових відкриттів) / Benjamini-Hochberg. Якщо це виправлення опущено, виникнуть сотні помилкових висновків.
- log2 кратна зміна (log2FC): логарифм співвідношення експресії гена між двома групами за основою 2; +1 означає збільшення вдвічі, −1 означає зменшення вдвічі.
- Збагачення шляхів: визначення, в яких біологічних шляхах (наприклад, поділ клітин, імунітет) зосереджені змінені гени; Використовуються такі бази даних, як GO та KEGG.
- Пакетний ефект: небіологічна помилкова різниця, що виникає внаслідок обробки зразків у різні дні/пристрої.
Крок за кроком: аналіз omics за допомогою ШІ
1. Уточніть схему експерименту та питання. Скільки зразків, скільки груп, скільки повторів? Чи достатньо статистичної потужності? Поясніть дизайн ШІ.
2. Виберіть відповідний інструмент/метод за допомогою ШІ. Для RNA-seq виберіть стандартні методи, такі як DESeq2/edgeR (статистичні пакети, призначені для підрахунку даних); Використовуйте перевірені методи, а не статистику, яку «придумав» ШІ.
3. Запустіть код і перевірте проміжні виходи. Не переходьте до аналізу DE без нормалізації, контролю ефекту партії, графіків якості (PCA).
4. Застосувати корекцію множинного порівняння. Фільтрувати результати за виправленим значенням (padj/FDR), а не за необробленим значенням p.
5. Підтвердьте біологічну інтерпретацію в літературі. Інтерпретуйте результати збагачення шляху за допомогою ШІ, але перевіряйте кожну заяву в джерелі.
Порада: в аналізі DE спочатку подивіться на графіки якості та сукупного впливу. Якщо зразки згруповані за днем їх обробки, а не за біологічними групами, більшість «значущих» генів, які ви знайдете, є сукупними ефектами, а не справжньою біологією.
три міні-чохла
Випадок 1 — невиправлене значення p. Студент протестував 20 000 генів за допомогою коду, написаного штучним інтелектом, і виявив «540 значущих генів». Коли він перевірив код, він побачив, що штучний інтелект пропустив корекцію багаторазового порівняння. Коли було додано корекцію FDR, кількість значущих генів зменшилася до 32. Без корекції більше ніж 500 помилкових генів базувалися б на історії.
Випадок 2 — Сфабрикована біологічна заява. Для гена зі списку DE дослідник запитав ШІ, «що цей ген робить при цій хворобі?» запитав він; AI пояснив переконливий механізм і статтю. Коли він шукав у PubMed, то побачив, що ні цього механізму, ні статті не існує. Претензію вилучено зі звіту.
Випадок 3 — Отримано підтвердження. Аспірант помітив, що зразки були розділені двома днями на графіку PCA. Попросили ШІ додати до коду змінну пакетного ефекту; Після корекції список генів був повністю змінений і став біологічно значущим. Без таблиці контролю якості можна було опублікувати підроблений результат.
Приклад: фільтрація з виправленим значенням p
імпортуйте панди як pd# нехай таблиця 'de' буде результатами інструменту DE (DESeq2/edgeR):# стовпців: gene, log2FC, pvalue, padj (FDR-corrected)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] < 0,05) & (de["log2FC"].abs() >= 1)]print("Raw p<0,05:", (de["pvalue"] < 0,05).sum())print("FDR-corrected padj<0,05 & |log2FC|>=1:", len(significant))
Різниця між необробленим і виправленим числом ілюструє, чому численні порівняння є критичними.
Чотири шаблони, які можна копіювати
1) План аналізу та вибір методу:
Ваша роль: асистент з біоінформатики. Налаштуйте план аналізу для наступного експерименту RNA-seq: [кількість груп, кількість зразків/повторів, питання]. Який стандартний інструмент (DESeq2/edgeR) мені вибрати і чому, які етапи контролю якості (PCA, пакетний ефект) потрібні, як застосувати корекцію множинного порівняння? Пишіть крок за кроком.
2) Код + обов'язкові перевірки:
Напишіть виконуваний код, який виконує такий аналіз DE: [детально]. Код ПОВИНЕН включати нормалізацію, графік якості PCA, контроль пакетного ефекту та корекцію FDR (Бенджаміні-Хохберга). Коментуйте кожен крок. Фільтр із виправленим значенням p, а не з необробленим значенням p.
3) Коментар щодо збагачення шляху:
Допоможіть інтерпретувати результати збагачення шляху для цього списку значущих генів: [список/вихід]. Поясніть, які шляхи є помітними, але скажіть мені, у якому джерелі (GO, KEGG, рецензована стаття) підтвердити кожну біологічну заяву. Механізм/артикул ПРИМІТКА.
4) Статистичний аудит:
Перевірте наступний код аналізу на наявність статистичних помилок: [код]. Зокрема: неправильний вибір тесту, пропуск корекції множинного порівняння, ігнорування пакетного ефекту, недостатнє повторення. Перелічіть кожну знайдену проблему та її вирішення.
Слабка підказка / Сильна підказка
Слабкий: «Знайдіть важливі гени в цих даних RNA-seq».
Проблема: не вказано метод, контроль якості та численні порівняння; ШІ може надати список, повний помилкових спрацьовувань без виправлення.
Сильно: «Напишіть код, який виконує аналіз DE для даних підрахунку РНК-послідовності за допомогою логіки DESeq2, включає контроль якості та контроль масового ефекту за допомогою PCA, а також фільтри з корекцією FDR; коментуйте кожен крок і пояснюйте, чому ви обрали цей метод».
Чому це потужно: Метод стандартний, якість і корекція обов'язкові, результат перевіряється.
Ризик
симптом
запобіжний захід
помилково спрацьовує
Занадто багато «значущих» генів
FDR/корекція множинного порівняння
колективний вплив
Зразки групуються за днями
PCA + пакетна змінна
неправильний тест
Звичайний тест для підрахунку даних
Відповідний метод, наприклад DESeq2/edgeR
складена біологія
Беззварний механізм
Літературне підтвердження
недостатня потужність
1-2 повторення
Досить повторення в дизайні
Поширені помилки
- Пропуск корекції множинного порівняння. Найпоширеніша і найшкідливіша статистична помилка.
- Ігнорування колективного впливу. Це породжує помилкові біологічні відмінності.
- Застосування неправильного тестування для підрахунку даних. RNA-seq вимагає спеціальних методів.
- Прийняття біологічних заяв без джерела. AI може створювати механізми та вироби.
- Узагальнення з недостатнім повторенням. Без статистичної потужності результат ненадійний.
Застереження: «Статистично значущий» не те саме, що «біологічно значущий». Дуже невелика, але технічно значуща зміна складки може бути біологічно незначущою; У великих вибірках все може виявитися «значним». Оцініть log2FC і p-значення разом.
Глибина: фон і подвійний підрахунок підводних каменів у збагаченні шляху
Результати збагачення шляху ґрунтуються на двох прихованих припущеннях, які більшість людей не усвідомлюють, і ШІ може мовчки їх обійти. Перший — вибір фону/всесвіту: збагачення порівнює набір «генів, які змінилися» з набором «які гени розглядалися». Якщо фон взято з усього геному, але ваш експеримент вимірює лише певну панель тканин, результати виглядають штучно «збагаченими». Правильним фоном є гени, які фактично можуть бути виражені/виміряні в експерименті. Одна команда виявила «дуже значне збагачення імунного шляху» шляхом помилкового створення фону для всього геному; Коли аналіз було повторено з правильним фоном (виміряними генами), збагачення зникло — знахідка була артефактом методу.
По-друге, розмір набору генів і подвійний підрахунок: дуже великі та загальні шляхи (наприклад, «метаболічні процеси», тисячі генів) є «значними» майже в кожному списку; малі, специфічні шляхи більш інформативні. Крім того, оскільки той самий ген міститься в кількох шляхах, вводить в оману розглядати шляхи, що збігаються, як незалежний доказ. Третій пункт: не показує напрямок збагачення; Шлях може бути збагачений, але половина генів у ньому може бути збільшена, а інша половина може бути зменшена. Щоб побачити це, необхідно окремо вивчити інформацію про напрямок (наприклад, GSEA).
пастка
симптом
запобіжний захід
неправильний фон
Все здається збагаченим
Отримайте фон виміряних генів
Дуже загальний шлях
«Метаболізм» завжди виникає
Зосередьтеся на невеликих конкретних шляхах
подвійний рахунок
шляхи, що перекриваються
Не сприймайте це як незалежний доказ
пропустити напрямок
змішаний висхідний/спадний
Спрямований контроль за допомогою GSEA
Підсумовуючи
- AI в omics аналізі; є помічником, який підбирає методи, пише код і пише коментарі; статистичні та біологічні рішення повинні бути обґрунтованими.
- Слід використовувати стандартні перевірені методи (DESeq2/edgeR); Не можна пропускати контроль якості та колективний аудит впливу.
- Корекція множинного порівняння (FDR) є обов’язковою; результати фільтруються з виправленим значенням.
- Кожне біологічне твердження повинно бути підтверджено в літературі; "значний" слід відрізняти від "важливого".
Аплікаційне завдання
Візьміть зразок таблиці результатів DE (або відкритий набір даних RNA-seq). Порівняйте значну кількість генів на основі необробленого p-значення та виправлених порогових значень padj із наведеним вище фрагментом. Прокоментуйте різницю одним реченням. Потім попросіть біологічну інтерпретацію за допомогою шаблону 3 для представленого гена та перевірте твердження самостійно в PubMed.
контрольний список
- [ ] Я оцінив план експерименту та статистичну потужність.
- [ ] Я вибрав стандартний, зручний спосіб.
- [ ] Я проводив контроль якості PCA та пакетного ефекту.
- [ ] Я застосував корекцію множинного порівняння (FDR).
- [ ] Я відфільтрував результати з виправленим значенням p.
- [ ] Я підтвердив біологічні твердження в літературі.