Единици
1. Вовед во вештачката интелигенција во биоинженерството: улоги, граници, валидација, етика и биосигурност 2. Биоинформатика и анализа на секвенци: Разбирање на ДНК, РНК и протеински секвенци со вештачка интелигенција 3. Анализа на податоци на Omics: транскриптомика, протеомика и мулти-омика интеграција 4. Структура на протеини и молекуларно моделирање: AlphaFold, Docking и молекуларен дизајн 5. Експериментален дизајн и оптимизација: DoE, активно учење и паметно лабораториско планирање 6. Лабораториски податоци и анализа на слики: микроскопија, цитометрија на проток и податоци од плоча 7. Развој и оптимизација на биопроцесот: од ферментација до зголемување 8. Преглед на литература и синтеза на знаење: RAG, систематска компилација и генерирање хипотези 9. Етика, биосигурност, двојна употреба и регулаторна усогласеност 10. Проект од крај до крај: Работен тек на биоинженеринг со помош на вештачка интелигенција и валидација со Python
Единица 3 / 10

Анализа на податоци на Omics: транскриптомика, протеомика и мулти-омика интеграција

Добивки:

  • Повеќекратна корекција на тестирање (поправена p-вредност) во анализата на диференцијални изрази и способност правилно да се интерпретираат промените на преклопот и да се избегнат лажни позитиви
  • Откривање на серискиот ефект и негово додавање на моделот со PCA и одвојување технички шум од биолошка разлика
  • Способност да се поврзе секој идентитет на патеката со изворот и да се контролира со биолошка конзистентност во збогатување на патеката и мулти-омика интеграција

Ќелијата не е единствен број; Тоа е систем каде илјадници гени, протеини и метаболити танцуваат истовремено. Омикс (колективното име за пристапите кои мерат биолошки слој како целина) се обидува да го долови целиот овој танц: геномика (ДНК), транскриптомика (РНК - кои гени функционираат и колку), протеомика (протеини), метаболомика (мали молекули). Секој омичен слој произведува илјадници димензионални, бучни и скапи податоци. Вештачката интелигенција е моќна во скенирањето на овие високодимензионални податоци и обрасци за обележување; Но, вие сте тој што одлучува кој модел е биолошка вистина, а кој технички шум.

Во оваа единица, ќе продолжиме преку транскриптомика, најчестата омична анализа; Принципите важат и за други слоеви. Типичен работен тек: матрица на изразување од необработени податоци (редовите се гени, колоните се примероци, клетките се нивоа на изразување), нормализација (отстранување на техничките разлики), анализа на диференцијална експресија (наоѓање гени кои значително се менуваат помеѓу два услови), збогатување на патеката (пронаоѓање на кои биолошки патишта се групирани променетите гени) и интерпретација.

Диференцијален израз: промена на преклопот и корегирана p-вредност

За да се каже дали некој ген е „променет“, се разгледуваат два броја: промена на преклопување - колку пати изразот се зголемува/намалува, обично на скала log2 - и приспособена p-вредност (padj - статистика што контролира лажни позитиви кога се врши повеќекратно тестирање). Зошто да се поправи? Затоа што тестирате 20.000 гени во исто време; Дури и случајно, стотици гени може да се покажат како „значајни“. Без корекција на повеќекратно тестирање - ограничување на стапката на лажни откритија со методи како Бенџамини-Хохберг - списокот е погрешен. Вештачката интелигенција може да ја напише скриптата што ја пресметува оваа статистика, но ако ја испушти корекцијата, вашиот резултат е научно неодбранлив.

Внимание: вештачката интелигенција може да каже „500 гени значително се променија“ врз основа на суровата p-вредност. Гледајќи ја поправената p-вредност, бројот може да падне на 30. Секогаш проверувајте ја корекцијата на повеќе тестови сами; Ова е разликата помеѓу прифаќањето и отфрлањето на публикацијата.

Сериски ефект: најподмолната стапица

Серискиот ефект (техничка разлика што произлегува од обработката на примероците од различни денови, уреди или луѓе) е најголемиот извор на грешка во омиската анализа. Ако вашите две состојби се обработени во два различни дена, „биолошката разлика“ што ја гледате можеби е всушност разликата во денот. Вештачката интелигенција може да предложи додавање на сериската променлива на моделот (на пр. ~ серија + состојба), но ваша одговорност е да ја поставите правилно и да не ја мешате во експерименталниот дизајн.

Совет: Пред да започнете со анализата, нацртајте PCA (Анализа на главни компоненти - метод што ги сумира и визуелизира високодимензионални податоци на неколку оски). Ако примероците се групирани по серија наместо по биолошка состојба, ефектот на серијата е доминантен и мора прво да се коригира.

Мулти-омика интеграција

Вистинското разбирање често доаѓа од спојување на слоевите: ако генот работи понапорно, но неговиот протеин не се зголемува, регулацијата е на ниво на трансплантација. Интеграцијата на мулти-омика - комбинирање на различни слоеви на омика во еден модел - е местото каде што вештачката интелигенција станува посилна, но и онаму каде што најмногу доведува во заблуда; бидејќи скалите, шумот и примероците на совпаѓањата на слоевите се различни. Вештачката интелигенција предлага процес на интеграција, но вие ја контролирате биолошката конзистентност на резултатите.

три мини футроли

Случај 1 - збогатувањето забрзано. Пронајдени се 1.240 диференцијални гени во проект за рак. Вештачката интелигенција ги подготви за збогатување на патеката, истакнувајќи ги патеките на клеточниот циклус и поправка на ДНК; Тимот создаде мапа на хипотези за 2 часа. Но, тие повторно ја тестираа секоја патека со независна алатка (g:Profiler) и открија дека една патека била погрешно мапирана од вештачката интелигенција.

Случај 2 - Сериска стапица. Една лабораторија открила „впечатлива“ разлика од 900 гени меѓу две групи на третмани. Кога изведоа PCA, видоа дека примероците се одвоени со серија на секвенционирање. По корекција на серијата, вистинската разлика се намали на 60 гени. ВИ ненамерно ја испушти сериската променлива во првата анализа.

Случај 3 - Измислено име на патека. Еден студент ѝ ја дал листата на гени на вештачката интелигенција и прашал: „Која патека на KEGG? Вештачката интелигенција обезбеди идентификација на патеката и име како да е вистинска. Кога студентот пребарувал на КЕГГ, видел дека таа лична карта не постои; верификацијата спречи фабрикуван резултат.

Четири шаблони за копирање

1) Преглед на работниот тек на DESeq2:

Вашата улога: компјутерски биолог. Напишете скрипта чекор-по-чекор за анализа на диференцијални изрази на RNA-seq со R/DESeq2: читање на матрицата за броење, формула за дизајн (~ серија + состојба), нормализација, табела со резултати. ЕКСПРЕСНО применувајте корекција на повеќекратно тестирање (BH) и користете padjcolumn. Објаснете што прави секој чекор во линијата за коментари.

2) Контрола на квалитет/серија:

Дајте ми листа за проверка на RNA-seq QC: сериска контрола со PCA, големина на библиотеката, број на детекции на гени, откривање на оддалеченост. За секоја метрика, наведете праг „она што го гледам ме прави загрижен“. Објаснете што треба да направам ако се мешаат серијата и биолошката состојба.

3) Потврда на резултатот од збогатувањето:

Ќе ви дадам збогатена листа на патеки (број на патеки, padj, гени). Запишете го идентитетот на секоја патека (KEGG/GO ID) дословно и не го измислувајте. Филтрирајте ги резултатите со padj < 0,05. Наведете кои патишта биолошки се поддржуваат едни со други, но означете го секој идентитет како „мора да се потврди во базата на податоци“.

4) Проверка на конзистентност на мулти-омика:

Транскриптомскиот и протеомскиот даваат спротивставени насоки на изразување за пар ген/протеин. Наведете ги можните биолошки (уредување по преводот) и технички (шум при мерење, совпаѓање на примероци) причини за ова и кажете ми како да ја тестирам секоја од нив.

Слаб промпт / Силен промпт

Слаба навестување:

Наведете ги важните патишта во оваа листа на гени.

Нема извори, нема статистика, висок ризик од фабрикувани патишта.

Моќен потсетник:

Вашата улога: компјутерски биолог. Во приложената табела за диференцијални гени (ген, log2FC, padj) земете само гени со padj < 0,05. Кажете ми ги чекорите од анализата за збогатување GO што треба да се изврши со овие гени и алатката (g:Profiler) што ќе ја користам. Името на патеката е ЛАЖЕН; Ќе ја активирам алатката и ќе ја направам анализата, вие само опишете ја правилната методологија и корекција на повеќекратно тестирање.

Разлика: јасен филтер, фокус на методологијата, забрана за изработка и препуштање на верификацијата на корисникот.

Чекори за анализа на Омикс

чекор

Цел

вообичаена грешка

Улога на вештачката интелигенција

нормализација

Елиминирајте ја техничката разлика

Погрешен избор на метод

Скрипта + образложение

PCA/QC

Откривање на серии и надворешни

прескокнете го мојот чекор

Слика + коментар

диференцијален израз

Наоѓање променливи гени

Непоправена стр

Нацрт на сценариото

збогатување

најдете патека

фабрикувана патека

методологија

интеграција

спојуваат слоеви

Грешка во скала/совпаѓање

Препорака за работниот тек

Омики со една ќелија: нова скала

Во последниве години, едноклеточното секвенционирање - мерење на профилот на изразување на секоја од илјадниците ќелии одделно - ја однесе омиката во нова димензија. Сега, наместо „просечниот израз на ткиво“, можеме да го видиме секој тип на клетка во тоа ткиво посебно. Оваа моќ воведува нови стапици: податоците се екстремно ретки (повеќето гени имаат нула читања во повеќето ќелии - отпаѓање), големината е десетици илјади клетки × дваесет и илјади гени, а одвојувањето на типовите клетки најчесто се врши со групирање. Вештачката интелигенција е моќна во производството на кластерирање и контури за означување на типот на ќелија на податоци од една ќелија; но вие проверувате со познати гени за маркери дали секој кластер е вистински тип на клетка или технички артефакт (на пр. мртви клетки, две ќелии фатени заедно). Не прифаќајте ја ознаката за тип на клетка предложена од вештачката интелигенција без да ги потврдите гените за маркери на тој кластер во вистинската литература.

Совет: во анализа на една клетка, ако вештачката интелигенција сугерира ознака „Т-клетка“ на кластерот, проверете сами дали маркерите на Т-клетките (на пр. ЦД3) се навистина високо изразени во тој кластер. Ако ознаката не е поддржана од токенот, тоа е хипотеза, а не заклучок.

Вообичаени грешки

  • Прескокнување на корекција на повеќекратно тестирање. Списокот отекува со сурова p-вредност; треба да се користи padj.
  • Погрешување на серискиот ефект со биологија. Прво треба да се провери со PCA.
  • Изработка на промена на подот единствениот критериум. Високата промена на наборите може да доведе до заблуда кај гените со низок израз и бучни гени.
  • Прифаќање на измислената патека/ГО идентитет. Секој идентитет мора да биде потврден во базата на податоци.
  • Потценување на големината на примерокот. Статистичката моќ е мала во дизајнот 2 на 2; Резултатите треба да се толкуваат со претпазливост.

Сумирано

Анализата на Omics работи со високодимензионални, бучни податоци, а вештачката интелигенција ги забрзува овие податоци со скенирање, пишување скрипти и обележување на обрасци. Но, повеќекратната корекција на тестот во диференцијалното изразување, сериската контрола со PCA и верификацијата на изворот при збогатување се неопходни. Интеграцијата на мулти-омика е моќна, но погрешна; Проверете го секој резултат со биолошка конзистентност, земајќи ги предвид разликите во обемот и бучавата на слоевите.

Задача за апликација

Најдете јавно достапна матрица за броење на RNA-seq (на пр. од GEO). Нека вештачката интелигенција напише скрипта за анализа со шаблонот „DESeq2 workflow“ и проверете го кодот дали навистина е применета корекцијата за повеќекратно тестирање. Потоа побарајте коментар за збогатување од вештачката интелигенција и потврдете ги сите идентификатори на патеката што ги враќа еден по еден во однос на базата на податоци KEGG или GO; Забележете колку се вистински.

листа за проверка

  • [ ] Јас користев padj (поправен) во диференцијалната анализа, а не суровата p-вредност.
  • [ ] Го проверив серискиот ефект со PCA и го додадов на моделот доколку е потребно.
  • [ ] Ги интерпретирав гените со голема промена на пати, но ниска експресија со претпазливост.
  • [ ] Ја потврдив секоја патека/GO ID во однос на вистинската база на податоци.
  • [ ] Ја проценив статистичката моќ на големината на примерокот.
  • [ ] Ги поделив мулти-омските противречности на биолошки и технички причини.