Јединице
1. Увод у вештачку интелигенцију у биоинжењерингу: улоге, границе, валидација, етика и биолошка безбедност 2. Биоинформатика и анализа секвенци: разумевање секвенци ДНК, РНК и протеина помоћу вештачке интелигенције 3. Омицс анализа података: транскриптомика, протеомика и мулти-омика интеграција 4. Структура протеина и молекуларно моделирање: АлпхаФолд, Доцкинг и Молецулар Десигн 5. Експериментални дизајн и оптимизација: ДоЕ, активно учење и паметно планирање лабораторије 6. Лабораторијски подаци и анализа слике: микроскопија, проточна цитометрија и подаци на плочи 7. Развој и оптимизација биопроцеса: од ферментације до повећања 8. Преглед литературе и синтеза знања: РАГ, систематска компилација и генерисање хипотеза 9. Етика, биолошка сигурност, двострука употреба и усклађеност са прописима 10. Пројекат од краја до краја: ток рада биоинжењеринга уз помоћ вештачке интелигенције и валидација са Питхон-ом
Јединица 3 / 10

Омицс анализа података: транскриптомика, протеомика и мулти-омика интеграција

Добици:

  • Корекција вишеструког тестирања (исправљена п-вредност) у анализи диференцијалне експресије и способност да се правилно интерпретира промена преклопа и избегавају лажни позитивни резултати
  • Откривање ефекта серије и додавање у модел са ПЦА и одвајање техничке буке од биолошке разлике
  • Способност повезивања сваког идентитета пута са извором и контроле са биолошком конзистентношћу у обогаћивању путева и мулти-омиц интеграцији

Ћелија није један број; То је систем у коме хиљаде гена, протеина и метаболита плешу истовремено. Омицс (збирни назив за приступе који мере биолошки слој у целини) покушава да ухвати цео овај плес: геномику (ДНК), транскриптомику (РНК — који гени раде и колико), протеомику (протеини), метаболомику (мали молекули). Сваки омицс слој производи хиљаде димензионалних, бучних и скупих података. АИ је моћан у скенирању ових високодимензионалних података и обележавању образаца; Али ви сте тај који одлучује који образац је биолошка истина, а који техничка бука.

У овој јединици ћемо наставити кроз транскриптомику, најобичнију омичку анализу; Принципи се примењују и на друге слојеве. Типичан ток посла: матрица експресије из необрађених података (редови су гени, колоне су узорци, ћелије су нивои експресије), нормализација (уклањање техничких разлика), анализа диференцијалне експресије (проналажење гена који се значајно мењају између два услова), обогаћивање пута (проналажење на којим биолошким путевима су промењени гени груписани) и интерпретација.

Диференцијални израз: фолд промена и коригована п-вредност

Да би се утврдило да ли се ген „променио“, посматрају се два броја: промена пута — колико пута се експресија повећава/смањује, обично на скали лог2 — и прилагођена п-вредност (падј — статистика која контролише лажно позитивне резултате када се ради вишеструко тестирање). Зашто поправити? Зато што тестирате 20.000 гена у исто време; Чак и случајно, стотине гена се могу показати као "значајне". Без вишеструке корекције тестирања – ограничавања стопе лажног откривања методама као што је Бењамини-Хохберг – листа је погрешна. АИ може написати скрипту која израчунава ову статистику, али ако изостави исправку, ваш резултат је научно неодбрањив.

Опрез: АИ би могао рећи „500 гена се значајно променило“ на основу сирове п-вредности. Гледајући исправљену п-вредност, број би могао пасти на 30. Увек сами проверите исправку вишеструког теста; Ово је разлика између прихватања и одбијања публикације.

Батцх ефекат: најподмуклија замка

Батцх ефекат (техничка разлика која произилази из обраде узорака по различитим данима, уређајима или људима) је највећи извор грешке у омицс анализи. Ако су ваша два стања обрађена два различита дана, „биолошка разлика“ коју видите може заправо бити разлика у дану. АИ може предложити додавање променљиве серије у модел (нпр. ~ батцх + услов), али ваша је одговорност да је правилно подесите и да је не мешате у експериментални дизајн.

Савет: Пре него што почнете са анализом, нацртајте графикон ПЦА (Принципал Цомпонент Аналисис – метода која сумира и визуелизује високодимензионалне податке на неколико оса). Ако су узорци групирани по серијама, а не према биолошком стању, ефекат серије је доминантан и прво се мора исправити.

Мулти-омицс интеграција

Право разумевање често долази од спајања слојева: ако ген ради више, али његов протеин се не повећава, регулација је на транслационом нивоу. Мулти-омицс интеграција—комбиновање различитих слојева омике у један модел—је место где АИ постаје јача, али и где највише обмањује; јер су размере, шум и подударање узорака слојева различити. АИ предлаже радни ток интеграције, али ви контролишете биолошку конзистентност резултата.

три мини кофера

Случај 1 — Обогаћивање убрзано. 1.240 диференцијалних гена је пронађено у пројекту рака. АИ их је припремио за обогаћивање путева, наглашавајући ћелијски циклус и путеве поправке ДНК; Тим је направио мапу хипотеза за 2 сата. Али они су поново тестирали сваки пут помоћу независног алата (г:Профилер) и открили да је један пут погрешно мапиран од стране АИ.

Случај 2 — Замка серије. Једна лабораторија је открила „упечатљиву“ разлику од 900 гена између две групе за лечење. Када су извршили ПЦА, видели су да су узорци одвојени серијама секвенцирања. Након корекције серије, стварна разлика се смањила на 60 гена. АИ је ненамерно изоставио променљиву серије у првој анализи.

Случај 3 — Измишљено име путање. Студент је дао листу гена АИ и питао: "Који КЕГГ пут?" АИ је дао ИД путање и име као да је стварно. Када је студент тражио КЕГГ, видео је да та ИД не постоји; верификација је спречила измишљени резултат.

Четири шаблона за копирање

1) Преглед тока посла ДЕСек2:

Ваша улога: рачунарски биолог. Напишите корак по корак скрипту за анализу диференцијалне експресије РНА-сек помоћу Р/ДЕСек2: читање матрице бројања, формула дизајна (~ серија + услов), нормализација, табела резултата. ИЗРИЧИТО примените вишеструку корекцију тестирања (БХ) и користите падјцолумн. Објасните шта сваки корак ради у реду за коментаре.

2) Контрола квалитета/серије:

Дајте ми РНА-сек КЦ контролну листу: контрола серије са ПЦА, величина библиотеке, број детекција гена, детекција одступања. За сваки показатељ наведите праг „оно што видим чини ме забринутим“. Објасните шта треба да урадим ако се мешају серија и биолошко стање.

3) Верификација резултата обогаћивања:

Даћу вам обогаћену листу путева (број путева, падј, гени). Запишите идентитет сваког пута (КЕГГ/ГО ИД) дословно и немојте га измишљати. Филтрирајте резултате са падј < 0,05. Наведите који путеви биолошки подржавају једни друге, али означите сваки идентитет као „мора бити верификован у бази података“.

4) Мулти-омицс провера доследности:

Транскриптомски и протеомски дају конфликтне правце експресије за пар ген/протеин. Наведите могуће биолошке (уређивање после превода) и техничке (шум мерења, подударање узорка) разлоге за ово и реците ми како да тестирам сваки од њих.

Слаби промпт / Јаки промпт

Слабо обавештење:

Наведите важне путеве на овој листи гена.

Без извора, без статистике, висок ризик од фабрикованих путева.

Снажан упит:

Ваша улога: рачунарски биолог. У приложеној табели диференцијалних гена (ген, лог2ФЦ, падј) узмите само гене са падј < 0,05. Реците ми кораке анализе ГО обогаћивања која треба да се изврши са овим генима и алатком (г:Профилер) коју ћу користити. Име путање је ФАКЕ; Ја ћу покренути алат и урадити анализу, ви само опишите исправну методологију и вишеструку корекцију тестирања.

Разлика: јасан филтер, фокус методологије, забрана израде и препуштање верификације кориснику.

Кораци омичне анализе

корак

Сврха

уобичајена грешка

АИ улога

нормализација

Уклоните техничку разлику

Погрешан избор методе

Скрипта + образложење

ПЦА/КЦ

Детекција серије и одступања

прескочи мој корак

Слика + коментар

диференцијални израз

Проналажење гена који се мењају

Неисправљен стр

Нацрт скрипте

обогаћивање

наћи пут

измишљени пут

методологија

интеграција

спајање слојева

Грешка у размери/подударности

Препорука о току рада

Једноћелијска омика: нова скала

Последњих година, једноћелијско секвенцирање - мерење профила експресије сваке од хиљада ћелија засебно - одвело је омику у нову димензију. Сада, уместо „просечне експресије ткива“, можемо видети сваки тип ћелије у том ткиву посебно. Ова моћ уводи нове замке: подаци су изузетно ретки (већина гена има нула читања у већини ћелија – испадање), величина је десетине хиљада ћелија × двадесет хиљада гена, а раздвајање типова ћелија се углавном врши груписањем. АИ је моћна у стварању груписања и обриса означавања типа ћелија на подацима о једној ћелији; али ви проверавате са познатим маркерским генима да ли је сваки кластер прави тип ћелије или технички артефакт (нпр. мртве ћелије, две ћелије ухваћене заједно). Не прихватајте ознаку типа ћелије коју је предложила АИ без потврде маркерских гена тог кластера у стварној литератури.

Савет: У анализи једне ћелије, ако АИ предложи ознаку „Т ћелија“ групи, проверите сами да ли су маркери Т ћелија (нпр. ЦД3) заиста високо изражени у том кластеру. Ако ознака није подржана токеном, то је хипотеза, а не закључак.

Уобичајене грешке

  • Прескакање корекције вишеструког тестирања. Листа је пуна сирове п-вредности; треба користити падј.
  • Грешка серијског ефекта за биологију. То треба прво проверити са ПЦА.
  • Промена пода је једини критеријум. Велика промена нагиба може да доведе у заблуду код гена са ниском експресијом, бучним.
  • Прихватање измишљеног пута/ГО идентитета. Сваки идентитет мора бити верификован у бази података.
  • Потцењивање величине узорка. Статистичка снага је мала у дизајну 2к2; Резултате треба тумачити са опрезом.

Укратко

Омицс анализа ради са високодимензионалним, бучним подацима, а АИ убрзава ове податке скенирањем, писањем скрипти и обележавањем образаца. Али вишеструка корекција теста у диференцијалном изражавању, контрола серије са ПЦА и верификација извора у обогаћивању су неопходни. Мулти-омицс интеграција је моћна, али обмањујућа; Проверите сваки резултат са биолошком доследношћу, узимајући у обзир скалу и разлике у буци слојева.

Задатак апликације

Пронађите јавно доступну матрицу броја РНА-сек (нпр. из ГЕО). Нека АИ напише скрипту за анализу са шаблоном „ДЕСек2 воркфлов“ и провери у коду да ли је корекција вишеструког тестирања заиста примењена. Затим затражите од АИ коментар о обогаћивању и проверите све ИД-ове путања које враћа један по један у бази података КЕГГ или ГО; Обратите пажњу колико их је стварних.

контролна листа

  • [ ] Користио сам падј (исправљен) у диференцијалној анализи, а не сирову п-вредност.
  • [ ] Проверио сам скупни ефекат са ПЦА и додао га у модел ако је потребно.
  • [ ] Са опрезом сам тумачио гене са великом променом набора, али ниском експресијом.
  • [ ] Проверио сам сваки ИД путање/ГО у односу на праву базу података.
  • [ ] Процењивао сам статистичку моћ величине узорка.
  • [ ] Поделио сам мулти-омичне противречности на биолошке и техничке узроке.