Печалби:
- Способност за разбиране на работния процес на RNA-seq, анализ на диференциална експресия и корекция на множество тестове (FDR) и изкуствен интелект да произвежда проверим код за анализ
- Способност за критично тълкуване на резултатите от обогатяване на пътя статистически и биологично
- Способност за упражняване на дисциплината за проверка на статистически предположения и множество клопки при тестване и независимо потвърждаване на биологичната значимост.
„Omics“ е общото име за подходи, които измерват всички молекули на клетка или тъкан заедно: геномика (всички ДНК), транскриптомика (всички РНК/експресия), протеомика (всички протеини), метаболомика (всички метаболити). Тези данни са огромни - един RNA-seq експеримент включва измервания на десетки хиляди гени. В този модул ще научите как да използвате изкуствения интелект (AI) като помощник в omics анализа, който пише код, избира статистики и изготвя биологична интерпретация; но ще научите защо трябва да проверите статистическия и биологичния резултат.
Критично предупреждение: В Omics най-опасните грешки са статистически и невидими. AI може да напише код, който заобикаля корекцията на множество сравнения (по-долу), избира грешен тест или произвежда „фалшиво положителни“ списъци с гени. Освен това изкуственият интелект може да състави биологични твърдения като „този ген се увеличава при тази болест“ без никакъв източник. Правилният начин: да се направи анализът с изпълним, подлежащ на проверка код и да се потвърди всяко биологично твърдение в литературата.
Основни понятия
- Експресия: Колко ген се транслира в РНК; мярка за "активност".
- Диференциална експресия (DE): Гени, чиято експресия се променя значително между две групи (напр. пациент/здрав).
- p-стойност: Вероятността разликата да е съвпадение; ако е малка, разликата се счита за "значителна".
- Корекция на множество сравнения: Когато десетки хиляди гени се разглеждат едновременно, случайно ще има някои, които са „значими“. За да се коригира това, се използват методи като FDR (процент на фалшиви открития) / Benjamini-Hochberg. Ако тази корекция бъде пропусната, ще възникнат стотици неверни констатации.
- log2 пъти промяна (log2FC): Логаритъмът на съотношението на експресия на ген между две групи към основа 2; +1 означава двойно увеличение, −1 означава двойно намаление.
- Обогатяване на пътя: Откриване в кои биологични пътища (напр. клетъчно делене, имунитет) са концентрирани променените гени; Използват се бази данни като GO и KEGG.
- Партиден ефект: Небиологична фалшива разлика, произтичаща от обработката на проби в различни дни/устройства.
Стъпка по стъпка: omics анализ, задвижван от AI
1. Изяснете плана на експеримента и въпроса. Колко проби, колко групи, колко повторения? Достатъчна ли е статистическата мощност? Обяснете дизайна на AI.
2. Изберете подходящия инструмент/метод с AI. За RNA-seq изберете стандартни методи като DESeq2/edgeR (статистически пакети, предназначени за данни за преброяване); Използвайте доказани методи, а не статистика, „измислена“ от AI.
3. Стартирайте кода и проверете междинните изходи. Не преминавайте към DE анализ без нормализиране, контрол на партидния ефект, графики на качеството (PCA).
4. Приложете корекция на множество сравнения. Филтрирайте резултатите по коригирана стойност (padj/FDR), а не по необработена p-стойност.
5. Потвърдете биологичната интерпретация в литературата. Интерпретирайте изхода за обогатяване на пътя с AI, но проверявайте всяко твърдение при източника.
Съвет: При анализ на DE първо погледнете графиките на качеството и съвкупното въздействие. Ако пробите са групирани по деня, в който са били обработени, а не по биологична група, повечето от „значимите“ гени, които откривате, са кумулативни ефекти, а не истинска биология.
три мини калъфа
Случай 1 — Некоригирана p-стойност. Студент тества 20 000 гена с кода, написан от AI и откри „540 значими гена“. Когато прегледа кода, той видя, че изкуственият интелект е пропуснал корекцията на множество сравнения. Когато беше добавена корекция на FDR, броят на значимите гени намаля до 32. Без корекцията повече от 500 фалшиви гена биха се основавали на историята.
Случай 2 — Изфабрикувано биологично твърдение. За ген в списъка на DE, изследовател попита AI "какво прави този ген при това заболяване?" попита той; AI обясни убедителен механизъм и статията. Когато потърси в PubMed, той видя, че нито този механизъм, нито статията съществуват. Искът беше премахнат от доклада.
Случай 3 — Получено потвърждение. Докторант забеляза, че пробите са разделени от два дни в диаграмата на PCA. Помолих AI да добави променлива за партиден ефект към кода; След корекцията генният списък беше напълно променен и стана биологично значим. Без диаграмата за контрол на качеството можеше да бъде публикуван фалшив резултат.
Пример: филтриране с коригирана p-стойност
импортиране на панди като pd# нека таблицата 'de' да бъде резултати от DE инструмент (DESeq2/edgeR):# колони: ген, log2FC, pvalue, padj (FDR-коригиран)de = pd.read_csv("de_results.csv")significant = de[(de["padj"] < 0,05) & (de["log2FC"].abs() >= 1)]print("Необработен p<0,05:", (de["pvalue"] < 0,05).sum())print("FDR-коригиран padj<0,05 & |log2FC|>=1:", len(значително))
Разликата между необработеното и коригираното число илюстрира защо множеството сравнения са критични.
Четири копируеми шаблона
1) План за анализ и избор на метод:
Вашата роля: асистент по биоинформатика. Настройте план за анализ за следния RNA-seq експеримент: [брой групи, брой проби/повторения, въпрос]. Кой стандартен инструмент (DESeq2/edgeR) да избера и защо, какви стъпки за контрол на качеството (PCA, партиден ефект) са необходими, как да приложа корекция на множество сравнения? Пишете стъпка по стъпка.
2) Код + задължителни проверки:
Напишете изпълним код, който извършва следния DE анализ: [подробност]. Кодът ТРЯБВА да включва нормализиране, диаграма на качеството на PCA, контрол на партидния ефект и корекция на FDR (Benjamini-Hochberg). Коментирайте всяка стъпка. Филтър с коригирана p-стойност, а не необработена p-стойност.
3) Коментар за обогатяване на пътя:
Помогнете за тълкуването на резултатите от обогатяване на пътя за този списък със значими гени: [списък/изход]. Обяснете кои пътища са видни, но ми кажете в кой източник (GO, KEGG, рецензирана статия) да потвърдя всяко биологично твърдение. Механизъм/артикул МОНТАЖ.
4) Статистически одит:
Проверете следния код за анализ за статистически грешки: [код]. По-конкретно: неправилен избор на тест, пропуск на корекция на множество сравнения, игнориране на пакетния ефект, недостатъчна репликация. Избройте всеки открит проблем и неговото решение.
Слаба подкана / Силна подкана
Слаб: „Намерете значими гени в тези RNA-seq данни.“
Проблем: Методът, контролът на качеството и множеството сравнения не са посочени; AI може да даде списък, пълен с фалшиви положителни резултати без корекция.
Силно: „Напишете код, който извършва DE анализ за тези данни за преброяване на RNA-seq с DESeq2 логика, включва контрол на качеството и контрол на групов ефект с PCA и филтри с FDR корекция; коментирайте всяка стъпка и обяснете защо сте избрали този метод.“
Защо е мощен: Методът е стандартен, качеството и корекцията са задължителни, резултатът се проверява.
Риск
симптом
предпазна мярка
фалшиво положително
Твърде много "смислени" гени
FDR/корекция на множество сравнения
колективно въздействие
Пробите са групирани по дни
PCA + партидна променлива
грешен тест
Нормален тест за преброяване на данни
Подходящ метод като DESeq2/edgeR
измислена биология
Беззаваръчен механизъм
Литературно потвърждение
недостатъчна мощност
1-2 повторения
Стига повторения в дизайна
Често срещани грешки
- Пропускане на корекция на множество сравнения. Най-честата и най-вредна статистическа грешка.
- Игнориране на колективното въздействие. Произвежда фалшива биологична разлика.
- Прилагане на неправилно тестване за преброяване на данни. RNA-seq изисква специални методи.
- Приемане на биологични твърдения без източник. AI може да създава механизми и артикули.
- Обобщаване с недостатъчно повторение. Без статистическа сила резултатът е ненадежден.
Внимание: „Статистически значимо“ не е същото като „биологично значимо“. Много малка, но технически значима промяна на гънките може да бъде биологично незначима; В големи извадки всичко може да се окаже "значимо". Оценете log2FC и p-стойността заедно.
Дълбочина: фон и клопки с двойно отчитане в обогатяването на пътя
Резултатите от обогатяване на пътя разчитат на две скрити предположения, които повечето хора не осъзнават, и AI може тихо да ги заобиколи. Първият е избор на фон/вселена: обогатяването сравнява набора от „гени, които са се променили“ с набора от „кои гени са били наблюдавани“. Ако фонът е взет от целия геном, но вашият експеримент измерва само конкретен тъканен панел, резултатите изглеждат изкуствено „обогатени“. Правилният фон са гени, които действително могат да бъдат експресирани/измерени в експеримента. Един екип откри „силно значително обогатяване на имунния път“ чрез погрешно фоново фониране на целия геном; Когато анализът беше повторен с правилния фон (измерени гени), обогатяването изчезна - находката беше артефакт на метода.
Второ, размерът на генния набор и двойното преброяване: много големи и общи пътища (напр. „метаболитни процеси“, хиляди гени) изглеждат „значими“ в почти всеки списък; малките, специфични пътища са по-информативни. Освен това, тъй като един и същ ген се намира в множество пътища, е подвеждащо да се третират припокриващите се пътища като независими доказателства. Трета точка: не показва посоката на обогатяване; Един път може да бъде обогатен, но половината от гените в него могат да бъдат увеличени, а другата половина може да бъде намалена. За да видите това, е необходимо да разгледате отделно информацията за посоката (като GSEA).
капан
симптом
предпазна мярка
грешен фон
Всичко изглежда обогатено
Получете измерен фон на гените
Много общ път
„Метаболизмът“ винаги се появява
Съсредоточете се върху малки, специфични пътища
двойно отчитане
припокриващи се пътища
Не го приемайте като независимо доказателство
посока на пропускане
смесено възходящо/низходящо
Управление на посоката с GSEA
В обобщение
- AI в omics анализ; е асистент, който избира методи, пише код и изготвя коментари; статистическите и биологичните решения трябва да бъдат обосновани.
- Трябва да се използват стандартни, доказани методи (DESeq2/edgeR); Контролът на качеството и колективният одит на въздействието не трябва да се пропускат.
- Корекцията на множество сравнения (FDR) е задължителна; резултатите се филтрират с коригираната стойност.
- Всяко биологично твърдение трябва да бъде потвърдено в литературата; "значително" трябва да се разграничава от "важно".
Задача за приложение
Вземете примерна таблица с резултати от DE (или отворен набор от данни за RNA-seq). Сравнете значителния брой гени въз основа на необработена p-стойност и коригирани прагове на padj с фрагмента по-горе. Коментирайте разликата в едно изречение. След това поискайте биологична интерпретация с шаблон 3 за представен ген и проверете сами твърдението в PubMed.
контролен списък
- [ ] Оцених експерименталния дизайн и статистическата мощност.
- [ ] Избрах стандартен, удобен метод.
- [ ] Направих PCA и партиден контрол на качеството.
- [ ] Приложих корекция за множествено сравнение (FDR).
- [ ] Филтрирах резултатите с коригирана p-стойност.
- [ ] Потвърдих биологичните твърдения в литературата.