Јединице
1. Увод у вештачку интелигенцију у биоинжењерингу: улоге, границе, валидација, етика и биолошка безбедност 2. Биоинформатика и анализа секвенци: разумевање секвенци ДНК, РНК и протеина помоћу вештачке интелигенције 3. Омицс анализа података: транскриптомика, протеомика и мулти-омика интеграција 4. Структура протеина и молекуларно моделирање: АлпхаФолд, Доцкинг и Молецулар Десигн 5. Експериментални дизајн и оптимизација: ДоЕ, активно учење и паметно планирање лабораторије 6. Лабораторијски подаци и анализа слике: микроскопија, проточна цитометрија и подаци на плочи 7. Развој и оптимизација биопроцеса: од ферментације до повећања 8. Преглед литературе и синтеза знања: РАГ, систематска компилација и генерисање хипотеза 9. Етика, биолошка сигурност, двострука употреба и усклађеност са прописима 10. Пројекат од краја до краја: ток рада биоинжењеринга уз помоћ вештачке интелигенције и валидација са Питхон-ом
Јединица 2 / 10

Биоинформатика и анализа секвенци: разумевање секвенци ДНК, РНК и протеина помоћу вештачке интелигенције

Добици:

  • Разумети контролу квалитета, поравнање, позивање варијанти и кораке за означавање секвенци и бити у стању да безбедно користиш вештачку интелигенцију у писању скриптова и сумирању резултата.
  • Способност потврђивања и уклањања лажних гена, протеина и референци повезивањем сваке интерпретације секвенце са метрикама као што су проценат идентитета, покривеност и е-вредност
  • Способност тумачења предвиђања модела језика протеина као вероватноће, валидације критичних кандидата мокрим тестирањем и примене дисциплине одвајања истраживања од клиничке дијагнозе.

Најосновнија сировина биоинжењеринга је секвенца (секвенца - секвенционирана репрезентација ДНК, РНК или протеина написана словима; на пример АТГЦГТ... или МКВ за протеин...). Уређај за секвенционирање производи стотине милиона кратких читања преко ноћи; Посао биоинформатике (дисциплине која анализира биолошке податке помоћу рачунарских метода) је да трансформише ове сирове податке у смислен биолошки одговор. У овој јединици ћете научити где да безбедно користите АИ у анализи секвенце, који стандардни алати ће то убрзати и где је ваша стручна процена неопходна.

Типични кораци у анализи секвенце су: контрола квалитета необрађених очитавања (уклањање лоших очитавања и остатака адаптера), усклађивање са референтним геномом (усклађивање — проналажење одакле очитавања долазе у геному), позивање варијанти (идентификација мутација, тачака у којима се појединац разликује од референтног) и тумачење налаза. АИ помаже на свакој карици у овом ланцу, било писањем скрипте, сумирањем резултата или прављењем нацрта коментара; али критични кораци као што су поравнање и позивање варијанти се и даље обављају помоћу валидираних, стандардних алата.

Усклађивање низа: сличност и значење

Мерење колико су две секвенце сличне је срце биоинформатике. БЛАСТ (Басиц Лоцал Алигнмент Сеарцх Тоол — класична алатка која пореди секвенце са секвенцама у огромним базама података и проналази оне најсличније) је први корак у разумевању шта је протеин или ген. Разликујте два концепта у поравнању секвенци: идентитет (пропорција две секвенце које имају исто слово) и е-вредност (статистика која показује вероватноћу да се пронађена сличност догодила случајно; ако је мала, значајна је). АИ би могао протумачити БЛАСТ излаз и дати нацрт попут „ова секвенца је највероватније ензим киназе“, али ви верификујете ту интерпретацију е-вредношћу, покривеношћу и познатим информацијама о домену.

Савет: Када од АИ тражите низ коментара, увек тражите и необрађене метрике поравнања: проценат идентитета, покривеност, е-вредност. Без ових метрика, дата интерпретација „овај протеин је то“ не може се проверити и може бити халуцинација.

Модели низова засновани на вештачкој интелигенцији

Последњих година, појавили су се модели језика протеина који третирају секвенце као „језик“ (АИ модели који су обучени са милионима протеинских секвенци и предвиђају функционална и структурна својства секвенце; као што је ЕСМ). Они могу предвидети да ли ће мутација пореметити протеин, којој породици припада секвенца или функционалне регионе. То је моћан алат за скрининг: сортира хиљаде варијанти пре тестирања и истиче оне које највише обећавају. Али предвиђање је вероватноћа; Сваки критични кандидат се експериментално тестира.

Опрез: Када модел протеинског језика каже „ова мутација је штетна“, ово је резултат вероватноће, а не дијагноза. Клиничка интерпретација (нпр. извештај о варијанти болести) се даје само уз валидиране, регулисане алате и стручно генетско саветовање.

три мини кофера

Случај 1 — Анотација убрзана. У једном метагеномском пројекту, тим је наишао на 8.400 непознатих протеинских секвенци из узорака животне средине. Прелиминарне напомене уз помоћ вештачке интелигенције (додељивање ознака функција секвенцама) груписале су их у функционалне породице и направиле почетну мапу за 6 сати. Тим је прихватио само високо поверење 30%; ручно верификовао остатак са БЛАСТ и ХММ.

Случај 2 — Ухваћена халуцинација. Студент је питао АИ „из ког организма потиче секвенца и њен извор ДОИ“. АИ је дао тачан назив врсте и референцу на чланак. Ученик је то ставио на БЛАСТ: најближе подударање је био потпуно другачији разред са 41% ИД-а и без референце. АИ је дао течан, али измишљен одговор.

Случај 3 — Филтрирање варијанти. Један генетски пројекат имао је 4,7 милиона сирових варијанти. АИ је написао скрипту за филтрирање која је укључивала квалитет, дубину и прагове учесталости популације; до 120 клинички релевантних варијанти. Тим је оправдао сваки филтер изворним чланком и покренуо скрипту независно; Испоставило се да је резултат поновљив.

Четири шаблона за копирање

1) ФАСТК скрипта за контролу квалитета:

Ваша улога: инжењер биоинформатике. Напишите скрипту у Питхон-у: улаз је ФАСТК датотека, излаз је просечан квалитет читања, ГЦ садржај и резиме заосталог адаптера. Користите Биопитхон као библиотеку. Објасните код и напишите шта значи свака вредност прага (нпр. К30). Постављање функције која не постоји.

2) БЛАСТ излазни коментар (у зависности од извора):

Даћу вам БЛАСТ табеларни излаз (колоне: упит, тема, %идентитет, алигнмент_ленгтх, евалуе, битсцоре). Запишите ИД, обим и е-вредност дословно за сваки погодак. Рачунајте само оне са е-вредношћу < 1е-5 и покривеношћу > 70% као „поуздане“. Засновајте своје тумачење на овим показатељима; Означите нагађање типа/функције као „потребна је верификација“.

3) Логика филтрирања варијанти:

Ваша улога: биоинформатичар за неклиничка истраживања. Предложите кораке филтрирања за ВЦФ: минимална дубина читања, оцена квалитета, праг учесталости популације. Наведите образложење и извор сваког прага. Ово је истраживачки филтер; Напишите на испису да се не може користити за клиничку дијагнозу.

4) Објашњење оптимизације кодона:

Како да оптимизујем употребу кодона када дизајнирам ДНК секвенцу за експресију протеинске секвенце за [циљани организам]? Објасните кораке и ризике које треба размотрити (ГЦ равнотежа, секвенце понављања, рестрикциона места). Реците ми које алате за валидацију треба да користим пре производње бетонског низа.

Слаби промпт / Јаки промпт

Слабо обавештење:

Анализирајте овај низ: АТГЦГТАЦГТ...

Каква врста анализе, који критеријум, који исход је нејасно; АИ производи слободна тумачења која су отворена за измишљање.

Снажан упит:

Ваша улога: инжењер биоинформатике. За следећу ДНК секвенцу са Питхон/Биопитхон-ом: (1) израчунајте дужину и ГЦ садржај, (2) пронађите отворене оквире читања (ОРФ) у шест оквира читања, (3) излазни протеински превод најдужег ОРФ-а. Пријави само резултате из кода; прављење интерпретације биолошке функције.Серија: [серија]

Разлика: јасни подзадаци, стандардни алати, проверљиви излаз на основу кода и ограничење коментара.

Задаци анализе секвенце и улога АИ

Куест

стандардно возило

АИ допринос

верификација

контрола квалитета

ФастКЦ, Триммоматиц

Скрипта + резиме

Метрички праг

поравнање

БВА, кравата лептир2

Препорука параметара

Контрола односа поравнања

Варијанта позива

ГАТК, бцфтоолс

Нацрт тока посла

Потврђено са познатом варијантом

анотација

БЛАСТ, ИнтерПроСцан

Претходно груписање

Е-вредност + домен

Процена утицаја

ЕСМ, СИФТ

Ранг кандидата

мокри експеримент

Уобичајене грешке

  • Прихватање коментара без метрике. Без процента идентитета, покривености и е-вредности, изговарање „овај протеин јесте“ не може се потврдити.
  • Збуњујући референтни/координатни систем. Ако су верзија генома (хг38 против хг19) и координате засноване на 0/1 помешане, локације варијанте ће бити нетачне.
  • Игнорисање ефекта серије. Узорци секвенцирани у различитим серијама доводе до грешке у техничким разликама за биологију.
  • Користећи назив функције коју је АИ измислио. Модел може да генерише непостојећа имена гена/протеина/алата; Проверите свако име у односу на праву базу података.
  • Давање клиничког тумачења кроз истраживачки алат. Повезаност варијанте са болешћу се пријављује само кроз одобрене, регулисане процесе.

Укратко

Анализа секвенце је сирови материјал биоинжењеринга, а АИ убрзава сваки корак овог ланца писањем скрипта, сумирањем резултата и рангирањем кандидата. Али критични кораци као што су усклађивање, позивање варијанти и додељивање функција се обављају помоћу стандардних, проверених алата, а сваки коментар је везан за показатеље као што су проценат ИД-а, е-вредност и порекло. Модели језика протеина су моћни алати за скрининг; Њихов резултат је вероватноћа, а не закључак док се не потврди експериментом.

Задатак апликације

Изаберите јавно доступну секвенцу узорка (нпр. ген из референтног гена). Нека АИ прво изврши основну анализу секвенце (садржај ГЦ-а, ОРФ, превод) са шаблоном „јака промпт“. Затим независно проверите излаз помоћу Биопитхон-а или онлајн алата и забележите све разлике. На крају, поставите АИ питање за коментар тражећи изворе и проверите да ли су све референце које даје тачне тако што ћете их потражити у стварној бази података.

контролна листа

  • [ ] Проверио сам сваки коментар низа са метриком идентитета/покрића/е-вредности.
  • [ ] Појаснио сам верзију генома и координатни систем.
  • [ ] Покренуо сам скрипту за варијанту/анализу независно и репродуковао је.
  • [ ] Предвиђања протеинског модела сам тумачио као вероватноће, а не као резултате.
  • [ ] Проверио сам сва имена гена/протеина/референтних имена која је дала АИ у односу на праву базу података.
  • [ ] Одвојио сам истраживачку анализу од клиничке дијагнозе.