Добици:
- Способност разумевања тока рада РНА-сек, анализе диференцијалне експресије и корекције вишеструког тестирања (ФДР) и вештачке интелигенције производи код за анализу који се може проверити
- Способност критичке интерпретације резултата обогаћивања путева статистички и биолошки
- Способност вежбања дисциплине провере статистичких претпоставки и вишеструких замки тестирања и независне провере биолошке важности.
„Омикс“ је заједнички назив за приступе који заједно мере све молекуле ћелије или ткива: геномика (сва ДНК), транскриптомика (сва РНК/експресија), протеомика (сви протеини), метаболомика (сви метаболити). Ови подаци су огромни - експеримент РНА-сек укључује мерења десетина хиљада гена. У овој јединици ћете научити како да користите вештачку интелигенцију (АИ) као помоћника у омички анализи која пише код, бира статистику и прави нацрте биолошке интерпретације; али ћете научити зашто морате да проверите статистички и биолошки резултат.
Критично упозорење: У Омицсу, најопасније грешке су статистичке и невидљиве. АИ може написати код који заобилази вишеструку корекцију поређења (испод), бира погрешан тест или производи „лажно позитивне“ листе гена. Поред тога, АИ може да измисли биолошке тврдње као што је „овај ген се повећава у тој болести“ без икаквог извора. Прави начин: урадити анализу помоћу извршног кода који се може ревидирати и потврдити сваку биолошку тврдњу у литератури.
Основни појмови
- Експресија: Колико је ген преведен у РНК; мера „активности“.
- Диференцијална експресија (ДЕ): Гени чија се експресија значајно мења између две групе (нпр. пацијент/здрав).
- п-вредност: вероватноћа да је разлика случајност; ако је мала, разлика се сматра „значајном“.
- Вишеструка корекција поређења: Када се истовремено посматрају десетине хиљада гена, случајно ће се наћи неки који су „значајни“. Да би се ово поправило, користе се методе као што су ФДР (стопа лажног откривања) / Бењамини-Хохберг. Ако се ова исправка изостави, појавиће се стотине лажних налаза.
- лог2 пута промена (лог2ФЦ): логаритам односа експресије гена између две групе према бази 2; +1 значи двоструко повећање, −1 значи двоструко смањење.
- Обогаћивање путева: Проналажење у којим биолошким путевима (нпр. деоба ћелија, имунитет) су измењени гени концентрисани; Користе се базе података као што су ГО и КЕГГ.
- Ефекат серије: Небиолошка лажна разлика која произилази из обраде узорака у различитим данима/уређајима.
Корак по корак: омика анализа помоћу вештачке интелигенције
1. Појасните експериментални дизајн и питање. Колико узорака, колико група, колико понављања? Да ли је статистичка моћ довољна? Објасните дизајн АИ.
2. Изаберите одговарајући алат/метод са АИ. За РНА-сек, изаберите стандардне методе као што су ДЕСек2/едгеР (статистички пакети дизајнирани за податке о бројању); Користите проверене методе, а не статистику коју је АИ „измислила“.
3. Покрените код и проверите средње излазе. Немојте наставити са анализом ДЕ без нормализације, контроле ефекта серије, графикона квалитета (ПЦА).
4. Примените корекцију вишеструког поређења. Филтрирајте резултате према исправљеној вредности (падј/ФДР), а не према сировој п-вредности.
5. Потврдите биолошко тумачење у литератури. Протумачите излаз обогаћивања пута помоћу АИ, али проверите сваку тврдњу на извору.
Савет: У анализи ДЕ, прво погледајте графиконе квалитета и укупног утицаја. Ако су узорци групирани према дану када су обрађени, а не према биолошкој групи, већина „значајних“ гена које нађете су кумулативни ефекти, а не права биологија.
три мини кофера
Случај 1 — Некоригована п-вредност. Студент је тестирао 20.000 гена са кодом који је написао АИ и пронашао „540 значајних гена“. Када је прегледао код, видео је да је АИ прескочио вишеструку корекцију поређења. Када је додата ФДР корекција, број значајних гена се смањио на 32. Без корекције, више од 500 лажних гена би се заснивало на причи.
Случај 2 — Измишљена биолошка тврдња. За ген на ДЕ листи, истраживач је питао АИ „шта овај ген ради у овој болести?“ упитао је; АИ је објаснио убедљив механизам и чланак. Када је претражио ПубМед, видео је да ни тај механизам ни чланак не постоје. Тужба је уклоњена из извештаја.
Случај 3 — Потврда добијена. Студент докторских студија је приметио да су узорци били раздвојени за два дана на ПЦА парцели. Замолио АИ да дода променљиву скупног ефекта у код; Након корекције, листа гена је потпуно промењена и постала биолошки значајна. Без табеле контроле квалитета, лажни резултат би могао бити објављен.
Пример: филтрирање са исправљеном п-вредношћу
увези панде као пд# нека табела 'де' буде резултат ДЕ алата (ДЕСек2/едгеР):# колоне: ген, лог2ФЦ, пвалуе, падј (исправљено ФДР)де = пд.реад_цсв("де_ресултс.цсв")сигнифицант = де[(де["падј"]) < (де["падј"] < 0.0"). 1)]принт("Рав п<0,05:", (де["пвалуе"] < 0,05).сум())принт("ФДР-исправљен падј<0,05 & |лог2ФЦ|>=1:", лен(значајно))
Разлика између необрађеног и исправљеног броја илуструје зашто су вишеструка поређења критична.
Четири шаблона за копирање
1) План анализе и избор метода:
Ваша улога: асистент за биоинформатику. Поставите план анализе за следећи експеримент РНА-сек: [број група, број узорака/репликација, питање]. Који стандардни алат (ДЕСек2/едгеР) треба да изаберем и зашто, који кораци контроле квалитета (ПЦА, батцх ефекат) су потребни, како да применим вишеструку корекцију поређења? Пишите корак по корак.
2) Шифра + обавезне провере:
Напишите извршни код који врши следећу ДЕ анализу: [детаљ]. Код МОРА да садржи нормализацију, графикон квалитета ПЦА, контролу ефекта серије и ФДР (Бењамини-Хоцхберг) корекцију. Коментаришите сваки корак. Филтрирајте са исправљеном п-вредношћу, а не сировом п-вредношћу.
3) Коментар о обогаћивању пута:
Помозите у тумачењу резултата обогаћивања путање за ову листу значајних гена: [листа/излаз]. Објасните који су путеви истакнути, али ми реците у ком извору (ГО, КЕГГ, рецензирани чланак) да потврдим сваку биолошку тврдњу. Механизам/артикал ФИТИНГ.
4) Статистичка ревизија:
Проверите следећи код анализе за статистичке грешке: [код]. Конкретно: нетачан избор теста, изостављање корекције вишеструког поређења, игнорисање ефекта серије, недовољна репликација. Наведите сваки проблем који сте пронашли и његово решење.
Слаби промпт / Јаки промпт
Слаб: "Пронађите значајне гене у овим РНА-сек подацима."
Проблем: Метода, контрола квалитета и вишеструка поређења нису наведени; АИ може дати листу пуну лажних позитивних резултата без исправке.
Снажан: „Напишите код који врши анализу ДЕ за ове податке о бројању РНА-сек помоћу ДЕСек2 логике, укључује контролу квалитета и контролу масовног ефекта помоћу ПЦА, и филтере са ФДР корекцијом; коментаришите сваки корак и објасните зашто сте изабрали овај метод.“
Зашто је моћан: Метода је стандардна, квалитет и корекција су обавезни, резултат је подложан ревизији.
Ризик
симптом
предострожности
лажно позитиван
Превише "смислених" гена
ФДР/исправка вишеструког поређења
колективни утицај
Узорци су групирани по дану
ПЦА + променљива серије
погрешан тест
Нормалан тест за бројање података
Одговарајући метод као што је ДЕСек2/едгеР
састављена биологија
Механизам без заваривања
Потврда књижевности
недовољна снага
1-2 понављања
Доста понављања у дизајну
Уобичајене грешке
- Прескакање вишеструке корекције поређења. Најчешћа и најштетнија статистичка грешка.
- Игноришући колективни утицај. То производи лажну биолошку разлику.
- Примена погрешног тестирања на податке о бројању. РНА-сек захтева посебне методе.
- Прихватање биолошких тврдњи без извора. АИ може да прави механизме и чланке.
- Уопштавање са недовољним понављањем. Без статистичке снаге, резултат је непоуздан.
Опрез: „Статистички значајан“ није исто што и „биолошки значајан“. Веома мала, али технички значајна промена набора може бити биолошки безначајна; У великим узорцима све се може испоставити као "значајно". Заједно процените лог2ФЦ и п-вредност.
Дубина: позадина и замке двоструког бројања у обогаћивању пута
Резултати обогаћивања путање ослањају се на две скривене претпоставке које већина људи не схвата, а вештачка интелигенција може тихо да их заобиђе. Први је селекција позадине/универзума: обогаћивање упоређује скуп „гена који су се променили“ са скупом „који су гени посматрани“. Ако је позадина узета из целог генома, али ваш експеримент мери само одређени панел ткива, резултати изгледају вештачки „обогаћени“. Исправна позадина су гени који се заиста могу изразити/измерити у експерименту. Један тим је открио „веома значајно обогаћивање имунолошког пута” грешком у позадини читавог генома; Када је анализа поновљена са тачном позадином (измерени гени), обогаћење је нестало - налаз је био артефакт методе.
Друго, величина скупа гена и двоструко бројање: веома велики и општи путеви (нпр. „метаболички процеси“, хиљаде гена) се појављују „значајни“ на скоро свакој листи; мали, специфични путеви су информативнији. Поред тога, пошто се исти ген налази на више путева, погрешно је третирати преклапајуће путеве као независан доказ. Трећа тачка: не показује правац богаћења; Пут може бити обогаћен, али половина гена у њему може бити повећана, а друга половина смањена. Да бисте то видели, потребно је одвојено испитати информације о смеру (као што је ГСЕА).
трап
симптом
предострожности
погрешна позадина
Све изгледа обогаћено
Добијте измерену позадину гена
Веома општи пут
"Метаболизам" се увек појављује
Фокусирајте се на мале, специфичне путеве
двоструко рачунање
путеви који се преклапају
Не узимајте то као независан доказ
прескочити правац
мешовито узлазно/силазно
Контрола правца са ГСЕА
Укратко
- АИ у анализи омике; је асистент који бира методе, пише код и прави нацрте коментара; статистике и биолошке одлуке морају бити оправдане.
- Треба користити стандардне, доказане методе (ДЕСек2/едгеР); Контролу квалитета и колективну ревизију утицаја не треба прескочити.
- Корекција вишеструког поређења (ФДР) је обавезна; резултати се филтрирају са исправљеном вредношћу.
- Свака биолошка тврдња мора бити потврђена у литератури; „значајно” треба разликовати од „важног”.
Задатак апликације
Узмите узорак ДЕ резултата табеле (или отворени РНА-сек скуп података). Упоредите значајан број гена на основу необрађене п-вредности и исправљених падј прагова са горњим исечком. Прокоментаришите разлику у једној реченици. Затим затражите биолошку интерпретацију са шаблоном 3 за истакнути ген и сами проверите тврдњу у ПубМеду.
контролна листа
- [ ] Оценио сам експериментални дизајн и статистичку моћ.
- [ ] Изабрао сам стандардни, погодан метод.
- [ ] Урадио сам ПЦА и контролу квалитета ефекта серије.
- [ ] Применио сам корекцију вишеструког поређења (ФДР).
- [ ] Филтрирао сам резултате са исправљеном п-вредношћу.
- [ ] Потврдио сам биолошке тврдње у литератури.