Добивки:
- Способност да се разбере работниот тек на RNA-seq, анализата на диференцијална експресија и корекција на повеќекратно тестирање (FDR) и вештачката интелигенција да произведува проверлив код за анализа
- Способност за критичко толкување на резултатите од збогатувањето на патеката статистички и биолошки
- Способност за вежбање на дисциплината за проверка на статистички претпоставки и повеќекратни стапици за тестирање и независно потврдување на биолошкото значење.
„Омикс“ е колективното име за пристапите што ги мерат сите молекули на клетка или ткиво заедно: геномика (целата ДНК), транскриптомика (целата РНК/израз), протеомика (сите протеини), метаболомика (сите метаболити). Овие податоци се огромни - експериментот со RNA-seq вклучува мерења на десетици илјади гени. Во оваа единица, ќе научите како да ја користите вештачката интелигенција (АИ) како асистент во омиската анализа која пишува код, избира статистика и изготвува биолошко толкување; но ќе научите зошто мора да го потврдите статистичкиот и биолошкиот резултат.
Критично предупредување: Во Omics, најопасните грешки се статистички и невидливи. Вештачката интелигенција може да напише код што ја заобиколува повеќекратната корекција на споредба (подолу), избира погрешен тест или произведува „лажно позитивни“ списоци на гени. Дополнително, вештачката интелигенција може да создаде биолошки тврдења како „овој ген се зголемува кај таа болест“ без никаков извор. Вистински начин: да се направи анализата со извршна, ревидирана шифра и да се потврди секое биолошко тврдење во литературата.
Основни концепти
- Израз: Колку еден ген е преведен во РНК; мерка „дејност“.
- Диференцијална експресија (DE): Гени чиј израз значително се менува помеѓу две групи (на пр., пациент/здрав).
- p-вредност: Веројатноста дека разликата е случајност; ако е мала, разликата се смета за „значајна“.
- Корекција на повеќекратна споредба: Кога ќе се погледнат десетици илјади гени во исто време, случајно ќе има некои што се „значајни“. За да се поправи ова, се користат методи како FDR (стапка на лажни откритија) / Бенџамини-Хохберг. Ако оваа корекција се испушти, ќе се појават стотици лажни наоди.
- Промена на log2 пати (log2FC): логаритам на односот на изразување на ген помеѓу две групи до базата 2; +1 значи двојно зголемување, −1 значи двојно намалување.
- Збогатување на патеката: Наоѓање во кои биолошки патишта (на пр. клеточна делба, имунитет) се концентрирани променетите гени; Се користат бази на податоци како GO и KEGG.
- Сериски ефект: Небиолошка лажна разлика што произлегува од обработката на примероците во различни денови/уреди.
Чекор по чекор: омиска анализа на ВИ
1. Појасни го експерименталниот дизајн и прашањето. Колку примероци, колку групи, колку повторувања? Дали е доволна статистичката моќ? Објаснете го дизајнот на вештачката интелигенција.
2. Изберете ја соодветната алатка/метод со AI. За RNA-seq, изберете стандардни методи како што се DESeq2/edgeR (статистички пакети дизајнирани за броење податоци); Користете докажани методи наместо статистика што ја „измислила“ вештачката интелигенција.
3. Вклучете ја шифрата и проверете ги средните излези. Не продолжувајте со DE анализа без нормализација, контрола на сериски ефект, парцели за квалитет (PCA).
4. Спроведете корекција на повеќекратна споредба. Филтрирајте ги резултатите по коригирана вредност (padj/FDR), а не сурова p-вредност.
5. Потврдете ја биолошката интерпретација во литературата. Толкувајте го излезот за збогатување на патеката со вештачка интелигенција, но потврдете го секое тврдење на изворот.
Совет: во анализата на DE, прво погледнете ги графиконите за квалитет и збирното влијание. Ако примероците се групирани според денот кога биле обработени наместо по биолошка група, повеќето од „значајните“ гени што ги наоѓате се кумулативни ефекти, а не вистинска биологија.
три мини футроли
Случај 1 - Непоправена p-вредност. Студент тестирал 20.000 гени со кодот напишан од вештачката интелигенција и пронашол „540 значајни гени“. Кога го испитал кодот, видел дека вештачката интелигенција ја прескокнала повеќекратната корекција на споредба. Кога беше додадена корекција на FDR, бројот на значајни гени се намали на 32. Без корекцијата, повеќе од 500 лажни гени ќе се засноваат на приказната.
Случај 2 - Фабрикувано биолошко тврдење. За ген на списокот DE, истражувач ја праша вештачката интелигенција „што прави овој ген кај оваа болест? праша тој; АИ објасни убедлив механизам и статијата. Кога бараше на PubMed, виде дека ниту тој механизам, ниту статијата не постои. Тврдењето беше отстрането од извештајот.
Случај 3 - Добиена е потврда. Докторант забележал дека примероците се одвоени на два дена во парцелата PCA. Побара од вештачката интелигенција да додаде променлива за сериски ефект на кодот; По корекцијата, листата на гени беше целосно променета и стана биолошки значајна. Без графиконот за контрола на квалитетот, можеше да се објави лажен резултат.
Пример: филтрирање со корегирана p-вредност
увезете панди како pd# нека табелата „de“ е резултат од алатката DE (DESeq2/edgeR):# колони: ген, log2FC, pvalue, padj (FDR-corrected)de = pd.read_csv("de_results.csv")значително = de[(de["padj) и <0.0] (de["log2FC"].abs() >= 1)]печати("Суров p<0.05:", (de["pvalue"] <0.05).sum())print("FDR-corrected padj<0.05 & |log2FC|>=1:", len(значајно)
Разликата помеѓу суровиот и коригираниот број илустрира зошто повеќекратните споредби се критични.
Четири шаблони за копирање
1) План за анализа и избор на метод:
Вашата улога: асистент по биоинформатика. Поставете план за анализа за следниот RNA-seq експеримент: [број на групи, број на примероци/реплики, прашање]. Која стандардна алатка (DESeq2/edgeR) треба да ја изберам и зошто, кои чекори за контрола на квалитетот (PCA, ефект на серија) се потребни, како да применам корекција на повеќекратна споредба? Напишете чекор по чекор.
2) Код + задолжителни проверки:
Напишете извршна шифра која ја врши следната DE анализа: [детали]. Шифрата МОРА да вклучува нормализација, парцела за квалитет на PCA, контрола на серискиот ефект и корекција на FDR (Бенџамини-Хохберг). Коментирајте го секој чекор. Филтрирајте со корегирана p-вредност, а не со сурова p-вредност.
3) Коментар за збогатување на патеката:
Помогнете да се интерпретираат резултатите од збогатувањето на патеката за оваа листа на значајни гени: [листа/излез]. Објасни кои патишта се истакнати, но кажи ми во кој извор (GO, KEGG, рецензирана статија) да го потврди секое биолошко тврдење. Механизам/МОТИРАЊЕ НА артикли.
4) Ревизија на статистика:
Проверете го следниот код за анализа за статистички грешки: [шифра]. Поточно: неточен избор на тест, пропуст на корекција на повеќекратна споредба, игнорирање на ефектот на серија, недоволна репликација. Наведете го секој проблем што го најдовте и поправете го.
Слаб промпт / Силен промпт
Слабо: „Најдете значајни гени во овие податоци за RNA-seq“.
Проблем: Не се специфицирани методот, контролата на квалитетот и повеќекратните споредби; ВИ може да даде листа полна со лажни позитиви без корекција.
Силно: „Напишете код кој врши DE анализа за овие податоци за броење на RNA-seq со логика DESeq2, вклучува контрола на квалитетот и контрола на масовниот ефект со PCA и филтри со корекција на FDR; коментирајте го секој чекор и објаснете зошто го избравте овој метод.
Зошто е моќен: Методот е стандарден, квалитетот и корекција се задолжителни, резултатот може да се ревидира.
Ризик
симптом
претпазливост
лажно позитивно
Премногу „значајни“ гени
FDR/повеќе споредбена корекција
колективно влијание
Примероците се групирани по ден
PCA + сериска променлива
погрешен тест
Нормален тест за броење податоци
Соодветен метод како DESeq2/edgeR
составена биологија
Механизам без заварување
Потврда за литература
недоволна моќност
1-2 повторувања
Доволно повторување во дизајнот
Вообичаени грешки
- Прескокнување корекција на повеќекратна споредба. Најчеста и најштетна статистичка грешка.
- Игнорирање на колективното влијание. Тоа произведува лажна биолошка разлика.
- Примена на погрешно тестирање за броење податоци. RNA-seq бара посебни методи.
- Прифаќање на биолошки тврдења без извор. Вештачката интелигенција може да состави механизми и статии.
- Генерализирање со недоволно повторување. Без статистичка моќ, резултатот е несигурен.
Внимание: „Статистички значајно“ не е исто што и „биолошки значајно“. Многу мала, но технички значајна промена на наборот може да биде биолошки незначителна; Во големите примероци сè може да испадне „значајно“. Оценете ги log2FC и p-вредноста заедно.
Длабочина: позадина и стапици со двојно броење во збогатувањето на патеката
Резултатите од збогатувањето на патеката се потпираат на две скриени претпоставки што повеќето луѓе не ги сфаќаат, а вештачката интелигенција може тивко да ги заобиколи. Првата е селекција на позадина/универзум: збогатувањето го споредува множеството „гени што се променија“ со множеството „кои гени беа разгледани“. Ако позадината е земена од целиот геном, но вашиот експеримент мери само специфичен ткивен панел, резултатите изгледаат вештачки „збогатени“. Правилната позадина се гени кои всушност можат да се изразат/мерат во експериментот. Еден тим откри „многу значајно збогатување на имунолошкиот пат“ со погрешно поставување на целиот геном; Кога анализата се повтори со правилна позадина (измерени гени), збогатувањето исчезна - наодот беше артефакт на методот.
Второ, големината на генскиот сет и двојното броење: многу големи и општи патишта (на пр. „метаболички процеси“, илјадници гени) се појавуваат „значајни“ во речиси секоја листа; мали, специфични патишта се поинформативни. Дополнително, бидејќи истиот ген се наоѓа на повеќе патишта, погрешно е да се третираат преклопувачките патишта како независен доказ. Трета точка: не ја покажува насоката на збогатување; Патеката може да се збогати, но половина од гените во него може да се зголемат, а другата половина да се намалат. За да се види ова, потребно е посебно да се испитаат информациите за насочување (како што е GSEA).
стапица
симптом
претпазливост
погрешна позадина
Се чини дека сè е збогатено
Добијте измерена генска позадина
Многу општа патека
„Метаболизмот“ секогаш се појавува
Фокусирајте се на мали, специфични патишта
двојно броење
се преклопуваат патишта
Не го земајте како независен доказ
прескокнете насока
мешан растечки/опаѓачки
Контрола на насока со GSEA
Сумирано
- ВИ во омската анализа; е асистент кој избира методи, пишува код и изготвува коментари; статистичките и биолошките одлуки мора да бидат оправдани.
- Треба да се користат стандардни, докажани методи (DESeq2/edgeR); Контролата на квалитетот и колективната ревизија на влијание не треба да се прескокнат.
- Задолжителна е корекција на повеќекратна споредба (FDR); резултатите се филтрираат со поправената вредност.
- Секое биолошко тврдење мора да биде потврдено во литературата; „значајно“ треба да се разликува од „важно“.
Задача за апликација
Земете примерок од табела со резултати од DE (или отворена база на податоци за RNA-seq). Споредете го значајниот број на гени врз основа на суровата p-вредност и коригираните прагови на padj со фрагментот погоре. Коментирајте ја разликата во една реченица. Потоа побарајте биолошко толкување со шаблон 3 за истакнат ген и проверете го тврдењето сами во PubMed.
листа за проверка
- [ ] Го оценив експерименталниот дизајн и статистичката моќ.
- [ ] Избрав стандарден, удобен метод.
- [ ] Направив PCA и контрола на квалитетот на серискиот ефект.
- [ ] Применив корекција на повеќекратна споредба (FDR).
- [ ] Ги филтрирав резултатите со корегирана p-вредност.
- [ ] Ги потврдив биолошките тврдења во литературата.