Печалби:
- Корекция при многократно тестване (коригирана p-стойност) в диференциалния анализ на експресията и способността за правилно интерпретиране на промяната на гънките и избягване на фалшиви положителни резултати
- Откриване на пакетния ефект и добавянето му към модела с PCA и разделяне на техническия шум от биологичната разлика
- Възможност за свързване на идентичността на всеки път с източника и контрола му с биологична последователност при обогатяване на пътя и интеграция на мултиомика
Клетката не е едно число; Това е система, в която хиляди гени, протеини и метаболити танцуват едновременно. Omics (общо наименование за подходи, които измерват биологичния слой като цяло) се опитва да обхване целия този танц: геномика (ДНК), транскриптомика (РНК - кои гени работят и колко), протеомика (протеини), метаболомика (малки молекули). Всеки omics слой произвежда хиляди обемни, шумни и скъпи данни. AI е мощен при сканиране на тези високомерни данни и модели за маркиране; Но вие сте този, който решава кой модел е биологична истина и кой е технически шум.
В тази част ще преминем през транскриптомика, най-често срещаният омичен анализ; Принципите важат и за други слоеве. Типичен работен процес: експресионна матрица от необработени данни (редовете са гени, колоните са проби, клетките са нива на експресия), нормализиране (премахване на технически разлики), диференциален анализ на експресията (намиране на гени, които се променят значително между две състояния), обогатяване на пътя (откриване на кои биологични пътища са групирани променените гени) и интерпретация.
Диференциален израз: промяна на сгъване и коригирана p-стойност
За да се разбере дали даден ген се е „променил“, се разглеждат две числа: промяна на пъти — колко пъти се увеличава/намалява експресията, обикновено по скала log2 — и коригирана p-стойност (padj — статистиката, която контролира фалшивите положителни резултати, когато се извършва многократно тестване). Защо да се коригира? Защото тествате 20 000 гена едновременно; Дори случайно стотици гени може да се окажат „значими“. Без корекция на множество тестове - ограничаване на процента на фалшиви открития с методи като Benjamini-Hochberg - списъкът е подвеждащ. AI може да напише скрипта, който изчислява тази статистика, но ако пропусне корекцията, вашият резултат е научно незащитен.
Внимание: AI може да каже „500 гена са се променили значително“ въз основа на суровата p-стойност. Гледайки коригираната p-стойност, числото може да спадне до 30. Винаги проверявайте сами корекцията с множество тестове; Това е разликата между приемането и отхвърлянето на публикацията.
Партиден ефект: най-коварният капан
Пакетният ефект (техническа разлика, произтичаща от обработката на проби от различни дни, устройства или хора) е най-големият източник на грешка в omics анализа. Ако вашите две състояния са обработени в два различни дни, „биологичната разлика“, която виждате, всъщност може да е разликата в деня. AI може да предложи добавяне на партидната променлива към модела (напр. ~ партида + условие), но ваша отговорност е да я настроите правилно и да не я смесвате в експерименталния дизайн.
Съвет: Преди да започнете анализа, начертайте PCA (Анализ на основните компоненти - метод, който обобщава и визуализира високоразмерни данни по няколко оси) диаграма. Ако пробите са групирани по партида, а не по биологично състояние, партидният ефект е доминиращ и първо трябва да се коригира.
Мултиомика интеграция
Истинското разбиране често идва от събирането на слоевете заедно: ако един ген работи по-усилено, но протеинът му не се увеличава, регулацията е на транслационно ниво. Интегрирането на мулти-омика – комбиниране на различни слоеве на омика в един модел – е мястото, където AI става по-силен, но също така и където подвежда най-много; тъй като мащабите, шумът и съвпаденията на пробите на слоевете са различни. AI предлага работен процес за интегриране, но вие контролирате биологичната последователност на резултатите.
три мини калъфа
Случай 1 — Ускорено обогатяване. 1240 диференциални гена бяха открити в проект за рак. AI ги подготви за обогатяване на пътя, подчертавайки клетъчния цикъл и пътищата за възстановяване на ДНК; Екипът създаде карта на хипотезата за 2 часа. Но те тестваха повторно всеки път с независим инструмент (g:Profiler) и откриха, че един път е неправилно картографиран от AI.
Случай 2 — Партиден капан. Една лаборатория откри "поразителна" разлика от 900 гена между две третирани групи. Когато извършиха PCA, те видяха, че пробите са разделени чрез партида за секвениране. След корекция на партида действителната разлика намаля до 60 гена. AI неволно е пропуснал партидната променлива в първия анализ.
Случай 3 — Измислено име на пътя. Студент даде генния списък на AI и попита: „Кой път на KEGG?“ Изкуственият интелект предостави идентификационен номер и име на пътя, сякаш е истински. Когато ученикът потърси в KEGG, той видя, че този ID не съществува; проверката предотврати изфабрикуван резултат.
Четири копируеми шаблона
1) Описание на работния процес на DESeq2:
Вашата роля: изчислителен биолог. Напишете стъпка по стъпка скрипт за диференциален експресионен анализ на RNA-seq с R/DESeq2: четене на матрица за броене, формула за дизайн (~ партида + условие), нормализация, таблица с резултати. ИЗРИЧНО приложете корекция за многократно тестване (BH) и използвайте padjcolumn. Обяснете какво прави всяка стъпка в ред за коментар.
2) Контрол на качеството/партидата:
Дайте ми RNA-seq QC контролен списък: партиден контрол с PCA, размер на библиотеката, брой откривания на гени, откриване на отклонения. За всеки показател посочете праг „това, което виждам ме кара да се притеснявам“. Обяснете какво трябва да направя, ако партидата и биологичното състояние са смесени.
3) Проверка на резултата от обогатяването:
Ще ви дам обогатен списък с пътища (брой пътища, padj, гени). Запишете идентичността на всеки път (KEGG/GO ID) дословно и не го измисляйте. Филтрирайте резултатите с padj < 0,05. Посочете кои пътища се поддържат биологично един друг, но маркирайте всяка идентичност като „трябва да бъде потвърдена в база данни“.
4) Проверка на последователността на мулти-омика:
Транскриптомният и протеомният добив дават противоречиви посоки на експресия за двойка ген/протеин. Избройте възможните биологични (редактиране след превод) и технически (шум от измерване, съпоставяне на проби) причини за това и ми кажете как да тествам всяка.
Слаба подкана / Силна подкана
Слаба подкана:
Назовете важните пътища в този списък с гени.
Няма източници, няма статистика, висок риск от изфабрикувани пътища.
Мощна подкана:
Вашата роля: изчислителен биолог. В приложената диференциална генна таблица (ген, log2FC, padj) вземете само гени с padj < 0,05. Кажете ми стъпките на анализ на обогатяване на GO, който трябва да се извърши с тези гени и инструмента (g:Profiler), който ще използвам. Името на пътя е FAKE; Аз ще стартирам инструмента и ще направя анализа, вие просто опишете правилната методология и корекция на множество тестове.
Разлика: чист филтър, фокус върху методологията, забрана за производство и оставяне на проверката на потребителя.
Стъпки за анализ на Omics
стъпка
Цел
често срещана грешка
AI роля
нормализация
Премахнете техническата разлика
Грешен избор на метод
Сценарий + обосновка
PCA/QC
Откриване на партиди и отклонения
пропусни моята стъпка
Изображение + коментар
диференциален израз
Откриване на променящи се гени
Некоригирана стр
Чернова на сценария
обогатяване
намери пътека
измислен път
методология
интеграция
сливане на слоеве
Грешка в мащаба/съвпадението
Препоръка за работен процес
Едноклетъчна омика: нова скала
През последните години секвенирането на една клетка - измерване на профила на експресия на всяка от хиляди клетки поотделно - изведе омиката в ново измерение. Сега, вместо "средната експресия на тъкан", можем да видим всеки тип клетка в тази тъкан отделно. Тази мощност въвежда нови клопки: данните са изключително оскъдни (повечето гени имат нулеви четения в повечето клетки - отпадане), размерът е десетки хиляди клетки × двадесет хиляди гени и разделянето на типове клетки се извършва най-вече чрез групиране. AI е мощен при създаването на клъстери и очертания за етикетиране на типове клетки върху данни от една клетка; но вие проверявате с известни маркерни гени дали всеки клъстер е истински тип клетка или технически артефакт (напр. мъртви клетки, две клетки, хванати заедно). Не приемайте етикета за клетъчен тип, предложен от AI, без да потвърдите маркерните гени на този клъстер в действителната литература.
Съвет: При анализ на една клетка, ако изкуственият интелект предложи етикет „Т клетка“ на клъстер, проверете сами дали Т клетъчните маркери (напр. CD3) наистина са силно изразени в този клъстер. Ако етикетът не се поддържа от токена, това е хипотеза, а не заключение.
Често срещани грешки
- Пропускане на корекция на множество тестове. Списъкът набъбва със сурова p-стойност; трябва да се използва padj.
- Грешка за партидния ефект с биология. Първо трябва да се провери с PCA.
- Смяната на пода е единственият критерий. Промяната с голямо сгъване може да бъде подвеждаща при слабо изразени, шумни гени.
- Приемане на измислената пътека/GO идентичност. Всяка самоличност трябва да бъде потвърдена в базата данни.
- Подценяване на размера на извадката. Статистическата мощност е ниска при дизайн 2 на 2; Резултатите трябва да се тълкуват с повишено внимание.
В обобщение
Omics анализът работи с високомерни, шумни данни и AI ускорява тези данни, като ги сканира, пише скриптове и маркира модели. Но многократната корекция на теста в диференциалното изразяване, партидният контрол с PCA и проверката на източника при обогатяване са незаменими. Интегрирането на мултиомика е мощно, но подвеждащо; Проверете всеки резултат с биологична консистенция, като вземете предвид разликите в мащаба и шума на слоевете.
Задача за приложение
Намерете публично достъпна матрица за преброяване на RNA-seq (напр. от GEO). Накарайте изкуствения интелект да напише скрипт за анализ с шаблона „DESeq2 workflow“ и да провери в кода, че корекцията за многократно тестване действително е приложена. След това помолете AI за коментар за обогатяване и проверете всички идентификационни номера на пътя, които връща един по един спрямо базата данни KEGG или GO; Забележете колко са реални.
контролен списък
- [ ] Използвах padj (коригиран) в диференциалния анализ, а не необработената p-стойност.
- [ ] Проверих груповия ефект с PCA и го добавих към модела, ако е необходимо.
- [ ] Тълкувах гени с висока промяна на пъти, но ниска експресия с повишено внимание.
- [ ] Проверих всеки път/GO ID спрямо реалната база данни.
- [ ] Оцених статистическата сила на размера на извадката.
- [ ] Разделих мулти-омичните противоречия на биологични и технически причини.