Добици:
- Способност разумевања проблема вишеструког поређења и укључивања корекције ФДР-а (стопа лажног откривања) у анализу
- Способност разликовања статистичког и биолошког значаја проценом п-вредности и величине ефекта (лог2 пута промена) заједно
- Способност препознавања и избегавања замки података великих димензија као што су ефекат серије и скок узрочности
Реч „омика“ описује приступе који мере читаву класу молекула у ћелији: геномика (сва ДНК), транскриптомика (сва експресија РНК/гена), протеомика (сви протеини), метаболомика (сви мали молекули). Заједничка карактеристика ових мерења је њихова висока димензионалност: хиљаде или чак десетине хиљада варијабли (гени, протеини) мере се истовремено у једном узорку, али је број узорака обично мали (нпр. 20 пацијената). Ова ситуација „много варијабли, мало узорака“ извор је изазова јединствених за биологију и области у којима АИ може бити од највеће помоћи.
У овој јединици ћемо разговарати о анализи диференцијалне експресије (проналажењу гена чија се експресија значајно мења између две групе) и улози вештачке интелигенције у овом току рада на примеру транскриптомике (РНА-сек).
Главни проблем високодимензионалних података
Ако тестирате хиљаде гена одједном, наћи ћете гене који изгледају "значајно" случајно, чак и ако нема стварних разлика. Ако тестирате 20.000 гена са маргином грешке од 5%, ~1.000 гена може се случајно показати као „значајно“. Ово се зове проблем вишеструког поређења и представља најкритичнију замку омичне анализе. Решење је да се исправе п-вредности (нпр. израчунајте ФДР — стопу лажног откривања помоћу Бењамини-Хохбергове методе). АИ је од велике помоћи у објашњавању овог концепта и писању правог кода; али ваша је одговорност да запамтите да примените исправку.
Савет: Ако видите број попут „3.000 гена значајно промењених“ у резултату омике, будите узнемирени. Ово је обично знак да вишеструка корекција поређења није извршена. Реална листа би била десетине до неколико стотина гена у добро осмишљеном експерименту.
РНА-сек диференцијална експресија: корак по корак
- Необрађени бројеви: Табела која садржи колико је очитавања пало у сваком узорку за сваки ген.
- Квалитет и филтрирање: Одбаците гене са веома ниском експресијом.
- Нормализација: Исправите разлику у величини библиотеке између узорака (груб број није упоредив).
- Статистички модел: Разлика у групи тестова са ДЕСек2 или едгеР (Р библиотеке) или пиДЕСек2 у Питхон-у.
- Корекција вишеструког поређења: Израчунајте ФДР; обично је праг ФДР < 0,05.
- Величина ефекта: Процените помоћу лог2 пута промене: колико пута се израз повећава/смањује.
- Коментар: Повежите значајне гене са биолошким путевима.
Вештачка интелигенција 3-6. Он кодира кораке, објашњава концепте и помаже вам да тумачите излаз. Међутим, модел не може да каже „који ген се променио“ а да не види ваше необрађене податке; Код и статистика вам то говоре.
Шаблони упита који се могу копирати
Улога: Ви сте асистент за транскриптомску анализу. Контекст: Имам РНА-сек табелу сировог броја (ЦСВ) из 12 контролних, 12 узорака третмана. Задатак: Наведите кораке анализе диференцијалног израза са пиДЕСек2, објасните зашто је сваки корак неопходан. Прво планирајте, друго код. Обавезно укључите исправку вишеструког поређења.
Моја анализа је показала 4.200 гена као "п<0,05". Зашто би ово могло бити сумњиво? Објасните вишеструку корекцију поређења (Бењамини-Хоцхберг ФДР) и дајте Питхон код који ради исправно филтрирање.
Напишите код који црта графикон вулкана из моје табеле резултата диференцијалног израза (ген, лог2ФЦ, падј колоне). Обојите гене са ФДР<0,05 и |лог2ФЦ|>1, означите горњих 10.
Како да анализирам ову значајну листу гена за обогаћивање пута? Објасните гсеапи или г:Профилер кораке. Не тврдите апсолутну узрочност у коментару, користите језик корелације. Листа гена: [лист]
Слаби промпт / Јаки промпт
Слаб: "Реците ми који су гени важни у приносу РНА-сек."
Снажан: „Имам пиДЕСек2 излаз из 12 контролних, 12 узорака третмана: табела са геном, лог2ФолдЦханге, падј колоне. Дајте код који филтрира значајне гене са праговима ФДР<0,05 и |лог2ФЦ|>1, пријављује њихове бројеве и рангира 20 најјачих гена, а затим објашњава зашто су ови гени ефекти прихватљиве величине.“
Разлика: Моћна промпт има стварне излазне колоне, прагове и захтев за валидацију. Модел обрађује ваше податке уместо да генерише измишљено име гена.
три мини кофера
Случај 1 — Катастрофа без корекције: Група је пронашла 3.800 „значајних“ гена са п<0,05 без корекције и послала их у публикацију. Када је судија затражио исправку ФДР-а, листа је пала на 47 гена. Да је вештачка интелигенција додала Бењамини-Хохбергов код од почетка, до ове срамоте не би дошло. Поука: о исправци се не може преговарати.
Случај 2 — Серијски ефекат: У једној студији, узорци су обрађени два различита дана. Оно што су мислили да је разлика "пацијент у односу на контролу" заправо је била разлика "1. дан у односу на 2. дан" (ефекат серије: техничка разлика због стране узорковања). АИ је помогао у уклањању лажног сигнала сугеришући додавање променљиве серије у модел (~ серија + услов у формули модела).
Случај 3 — Занемаривање промене набора: Ученик је прогласио „најважнијим“ ген чија се експресија променила за 2%, али је измерено да је веома стабилан, само гледањем п-вредности. Док је величина ефекта (лог2ФЦ) била скоро нула; статистички значај није биолошки значај. Модел је објаснио ову разлику и предложио да се она визуализује помоћу графа вулкана.
Табела поређења: јасноћа концепта
концепт
Значење
Зашто је то важно?
п-вредност
Вероватноћа да је разлика случајност
само по себи може довести у заблуду
ФДР (падј)
Исправљена стопа грешака у вишеструком тестирању
Ограничава лажне позитивне резултате
лог2 фолд промена
Величина ефекта
Указује на биолошки значај
батцх ефекат
Техничка разлика у серији
Ствара лажни сигнал
нормализација
Корекција скале међу узорцима
Поређење чини поштеним
Уобичајене грешке
- Прескакање вишеструке корекције поређења: Најчешћа и најозбиљнија грешка.
- Само гледајући п-вредност: Обавезно узмите у обзир величину ефекта (лог2ФЦ).
- Не укључујући ефекат серије у модел: Погрешити техничку разлику за биолошку разлику.
- Заборављање нормализације: директно упоређивање необрађених бројева.
- Узрочни језик: Рећи „Овај ген изазива болест“; Омицс подаци показују корелацију, узрочност захтева додатно експериментисање.
Опрез: У високодимензионалним подацима, „статистички значајан“ и „биолошки значајан“ су две различите ствари. Листа гена коју производи вештачка интелигенција је почетна хипотеза; Сваки ген кандидат не треба сматрати дефинитивним без верификације независном методом (кПЦР, мерење протеина).
Смањење величине и контрола квалитета
Прва ствар коју треба урадити у високодимензионалним подацима је видети општу структуру узорака. ПЦА (анализа главних компоненти: редуковање хиљада варијабли у неколико сумарних оса и њихово приказивање у 2 димензије) је стандардни алат за ово. Ако су групе које очекујете (контрола/третман) раздвојене у ПЦА графикону, то је добро; али ако су узорци групирани према „дневној обради“ а не по групама, ово је упозорење о ефекту серије. Исти графикон такође одмах показује један изузетан (неуспешан) пример.
Нацртајте ПЦА из моје нормализоване табеле експресије (ред ген, узорак колоне). Боја узорака по групама (контрола/третман), облик према шаржи обраде. Коментирајте да ли се на графикону види серијски ефекат или узорак одступања.
Овај хеуристички корак покреће остатак анализе: боље је рано ухватити одступницу него губити месеце на лажан резултат.
Подаци једне ћелије: нова димензија
Последњих година, једноћелијско секвенцирање РНК (сингле-целл РНА-сек: мерење профила експресије хиљада појединачних ћелија) постало је широко распрострањено. Овде подаци постају још већи: десетине хиљада ћелија, по хиљаде гена. Алати као што је Сцанпи (Питхон) обрађују ове податке; групише ћелије и идентификује типове ћелија. АИ пише код за овај ток посла, али биолошка номенклатура типова ћелија (било да је кластер „Т ћелија“ или „макрофаг“) ослања се на гене маркере и стручно знање. Обавезно потврдите ознаку типа ћелије коју модел додељује групи са познатим маркерима; Ово је најчешће погрешно схваћени корак у анализи једне ћелије.
Отворени подаци и репродуктивност
Већина студија омике поставља своје податке у јавна спремишта: ГЕО (Омнибус генске експресије) и АрраиЕкпресс за експресију гена, СРА (архива читања секвенце) за необрађене секвенце, ПРИДЕ за протеомику. Ово је кључно како би други могли да верификују ваше резултате и како бисте могли поново да анализирате податке из других студија. АИ може да напише код (са алаткама као што је ГЕОпарсе) који преузима и организује податке са ГЕО регистрацијског броја (нпр. ГСЕ број); Али обавезно прочитајте и потврдите дизајн података које сте преузели (колико група, колико понављања, који процес) из оригиналног записа. Ако модел тврди да „сећа“ дизајн студије, то је скоро увек претпоставка коју треба проверити.
Укратко
Омицс подаци мере хиљаде варијабли у малој величини узорка; Ово ствара замке вишеструких поређења, групних ефеката и претеране интерпретације. Вештачка интелигенција; Пише код за анализу диференцијалних израза, објашњава концепте и помаже вам да тумачите резултате. Међутим, ваша је одговорност да примените ФДР корекцију, процените величину ефекта и избегавате језик узрочности. Гени кандидати су хипотезе док се не провере независном методом.
Задатак апликације
Набавите или направите узорак табеле резултата диференцијалног израза (ген, лог2ФЦ, падј). Нека АИ напише код који филтрира према ФДР<0,05 и |лог2ФЦ|>1, пријављује број значајних гена и прави граф вулкана. Покрените код. Затим нека модел израчуна колико би гена изгледало „значајно“ да корекција није направљена и протумачи разлику.
контролна листа
- [ ] Применио сам вишеструку корекцију поређења (ФДР).
- Проценио сам величину ефекта (лог2ФЦ) као и [ ] п-вредност.
- [ ] Проверио сам серијске/техничке варијабле.
- [ ] Нисам прескочио корак нормализације.
- [ ] Користио сам језик корелације, а не узрочности.
- [ ] Означио сам гене кандидате као хипотезе које треба потврдити.