Единици
1. Вовед во вештачката интелигенција во биоинженерството: улоги, граници, валидација, етика и биосигурност 2. Биоинформатика и анализа на секвенци: Разбирање на ДНК, РНК и протеински секвенци со вештачка интелигенција 3. Анализа на податоци на Omics: транскриптомика, протеомика и мулти-омика интеграција 4. Структура на протеини и молекуларно моделирање: AlphaFold, Docking и молекуларен дизајн 5. Експериментален дизајн и оптимизација: DoE, активно учење и паметно лабораториско планирање 6. Лабораториски податоци и анализа на слики: микроскопија, цитометрија на проток и податоци од плоча 7. Развој и оптимизација на биопроцесот: од ферментација до зголемување 8. Преглед на литература и синтеза на знаење: RAG, систематска компилација и генерирање хипотези 9. Етика, биосигурност, двојна употреба и регулаторна усогласеност 10. Проект од крај до крај: Работен тек на биоинженеринг со помош на вештачка интелигенција и валидација со Python
Единица 2 / 10

Биоинформатика и анализа на секвенци: Разбирање на ДНК, РНК и протеински секвенци со вештачка интелигенција

Добивки:

  • Разберете ги чекорите за контрола на квалитетот, усогласување, повикување варијанти и прибелешки за анализа на низата и бидете во можност безбедно да ја користите вештачката интелигенција при скриптирање и сумирање на резултатите.
  • Способност за потврдување и отстранување на лажни гени, протеини и референци со поврзување на секоја интерпретација на секвенцата со метрика како што се проценти идентитет, покриеност и е-вредност
  • Способност да се толкуваат предвидувањата на моделот на протеински јазик како веројатности, да се валидираат критичните кандидати со влажно тестирање и да се примени дисциплината за одвојување на истражувањето од клиничката дијагноза.

Најосновната суровина на биоинженерството е низата (секвенца - секвенционирано претставување на ДНК, РНК или протеин напишано со букви; на пример ATGCGT... или MKV за протеин...). Уредот за секвенционирање произведува стотици милиони кратки читања преку ноќ; Работа на биоинформатиката (дисциплина која ги анализира биолошките податоци со пресметковни методи) е да ги трансформира овие необработени податоци во значаен биолошки одговор. Во оваа единица, ќе научите каде безбедно да ја користите вештачката интелигенција во секвенциската анализа, кои стандардни алатки ќе ја забрзаат и каде е неопходна вашата стручна проценка.

Типични чекори во анализата на секвенцата се: контрола на квалитетот на необработените отчитувања (отстранување на лоши отчитувања и остатоци од адаптер), усогласување со референтниот геном (порамнување - наоѓање од каде доаѓаат отчитувањата на геномот), повикување варијанти (идентификување мутации, точки каде што поединецот се разликува од референцата) и интерпретација на наодите. ВИ помага на секоја алка во овој синџир, или со пишување скрипти, сумирање на резултатите или правење нацрт-коментари; но критичните чекори како усогласување и повикување варијанти сè уште се прават со потврдени, стандардни алатки.

Порамнување на низата: сличност и значење

Мерењето колку се слични две секвенци е срцето на биоинформатиката. BLAST (Basic Local Alignment Search Tool — класична алатка која споредува низа со секвенци во огромни бази на податоци и ги наоѓа најслични) е првиот чекор во разбирањето што е протеин или ген. Разликувајте два концепта во порамнување на низата: идентитет (пропорција на две секвенци со иста буква) и е-вредност (статистички податоци што ја покажува веројатноста дека пронајдената сличност настанала случајно; ако е мала, таа е значајна). Вештачката интелигенција може да го интерпретира излезот BLAST и да даде преглед како „оваа секвенца најверојатно е киназен ензим“, но вие ја потврдувате таа интерпретација со е-вредност, покриеност и познати информации за доменот.

Совет: кога барате од вештачката интелигенција за низа коментари, секогаш барајте ги и необработените метрики за усогласување: процентуален идентитет, покриеност, е-вредност. Без овие метрики, даденото толкување на „овој протеин е тоа“ не може да се потврди и може да биде халуцинација.

Модели со низа базирани на вештачка интелигенција

Во последниве години, се појавија модели на протеински јазици кои ги третираат секвенците како „јазик“ (модели со ВИ кои се обучени со милиони протеински секвенци и ги предвидуваат функционалните и структурните својства на низата; како што е ESM). Тие можат да предвидат дали мутацијата ќе го наруши протеинот, на кое семејство припаѓа низата или функционалните региони. Тоа е моќна алатка за проверка: сортира илјадници варијанти пред тестирање и ги истакнува најперспективните. Но, предвидувањето е веројатност; Секој критичен кандидат се тестира експериментално.

Внимание: Кога моделот на протеински јазик вели „оваа мутација е штетна“, ова е резултат на веројатност, а не дијагноза. Клиничкото толкување (на пр. извештај за варијанта на болеста) се обезбедува само со потврдени, регулирани алатки и стручно генетско советување.

три мини футроли

Случај 1 - Забелешката е забрзана. Во еден проект за метагеномика, тимот наиде на 8.400 непознати протеински секвенци од примероци од животната средина. Прелиминарната прибелешка со помош на вештачка интелигенција (доделување ознаки на функции на секвенци) ги групираше во функционални семејства и произведе почетна карта за 6 часа. Тимот ја прифати само високата самодоверба 30%; рачно го потврди остатокот со BLAST и HMM.

Случај 2 - Фатена халуцинација. Еден студент ја прашал вештачката интелигенција „од кој организам потекнува секвенцата и неговиот извор DOI“. Вештачката интелигенција обезбеди точно име на видот и референца на статијата. Студентот го стави на BLAST: најблискиот натпревар беше сосема поинаков клас со 41% ID и без референца. Вештачката интелигенција даде течен, но измислен одговор.

Случај 3 - Филтрирање на варијанти. Еден генетски проект имаше 4,7 милиони сурови варијанти. Вештачката интелигенција напиша скрипта за филтрирање која вклучува прагови за квалитет, длабочина и фреквенција на населението; до 120 клинички релевантни варијанти. Тимот го оправдуваше секој филтер со изворниот напис и го водеше сценариото независно; Резултатот се покажа како репродуктивен.

Четири шаблони за копирање

1) Скрипта за контрола на квалитет FASTQ:

Вашата улога: инженер по биоинформатика. Напишете скрипта во Python: влезот е датотека FASTQ, излезот е просечен квалитет на читање, содржина на GC и резиме на преостанатиот адаптер. Користете Biopython како библиотека. Објаснете го кодот и напишете што значи секоја прагна вредност (на пр. Q30). Местење на функција што не постои.

2) Излезен коментар BLAST (во зависност од изворот):

Ќе ви дадам табеларен излез BLAST (колони: барање, предмет, %идентитетот, alignment_length, евалуација, битови). Запишете го ID, опсегот и е-вредноста дословно за секој удар. Сметајте ги само оние со е-вредност < 1e-5 и покриеност > 70% како „доверливи“. Засновајте го вашето толкување на овие метрики; Означете го погодувањето за тип/функција како „треба да се потврди“.

3) Логика за филтрирање на варијанти:

Вашата улога: неклинички истражувачки биоинформатичар. Предложете чекори за филтрирање за VCF: минимална длабочина на читање, резултат за квалитет, праг на фреквенција на популација. Наведете го образложението и изворот на секој праг. Ова е истражувачки филтер; Напишете на отпечатокот дека не може да се користи за клиничка дијагноза.

4) Објаснување за оптимизација на кодон:

Како да ја оптимизирам употребата на кодони при дизајнирање на ДНК секвенца за изразување на протеинска секвенца за [целен организам]? Објаснете ги чекорите и ризиците што треба да се земат предвид (рамнотежа на GC, секвенци на повторување, места за ограничување). Кажете ми кои алатки за валидација да ги користам пред да произведувам бетонска низа.

Слаб промпт / Силен промпт

Слаба навестување:

Анализирајте ја оваа низа: ATGCGTACGT...

Каков вид на анализа, кој критериум, кој исход е нејасен; ВИ произведува бесплатни толкувања кои се отворени за изработка.

Моќен потсетник:

Вашата улога: инженер по биоинформатика. За следнава ДНК секвенца со Python/Biopython: (1) пресметајте ја должината и содржината на GC, (2) најдете отворени рамки за читање (ORFs) во шест рамки за читање, (3) излезен протеински превод на најдолгиот ORF. Пријавувајте резултати само од кодот; правење интерпретација на биолошката функција.Серија: [серија]

Разликата: јасни подзадачи, стандардна алатка, проверлив излез заснован на код и ограничување за коментари.

Задачи за анализа на низа и улогата на ВИ

Потрага

стандардно возило

Придонес за вештачка интелигенција

верификација

контрола на квалитетот

FastQC, Trimmomatic

Скрипта + резиме

Метрички праг

усогласување

BWA, Bowtie2

Препорака за параметар

Контрола на односот на порамнување

Повикување на варијанта

GATK, bcftools

Нацрт на работниот тек

Потврдено со позната варијанта

прибелешка

BLAST, InterProScan

Пред-групирање

Е-вредност + домен

Проценка на влијанието

ЕСМ, СИФТ

Рангирање на кандидатите

влажен експеримент

Вообичаени грешки

  • Прифаќање коментари без метрика. Без процентуален идентитет, покриеност и е-вредност, велејќи дека „овој протеин е“ не може да се потврди.
  • Збунување на референтниот/координатен систем. Ако верзијата на геномот (hg38 vs hg19) и координатите засновани на 0/1 се измешаат, локациите на варијантите ќе бидат неточни.
  • Игнорирање на серискиот ефект. Примероците секвенционирани во различни серии доведуваат до грешка на техничките разлики за биологија.
  • Користејќи го името на функцијата што ја направи вештачката интелигенција. Моделот може да генерира непостоечки имиња на гени/протеини/алатки; Потврдете го секое име во однос на вистинската база на податоци.
  • Давање клиничка интерпретација преку алатка за истражување. Поврзаноста на варијантата со болеста се пријавува само преку одобрени, регулирани процеси.

Сумирано

Анализата на секвенците е суровина за биоинженерството, а вештачката интелигенција го забрзува секој чекор од овој синџир со скриптирање, сумирање на резултатите и рангирање на кандидатите. Но, критичните чекори како порамнување, повикување варијанти и доделување функции се прават со стандардни, потврдени алатки и секој коментар е поврзан со метрика како процент на ID, е-вредност и потекло. Моделите на протеински јазик се моќни алатки за скрининг; Нивниот излез е веројатност, а не заклучок додека не се потврди со експеримент.

Задача за апликација

Изберете јавно достапна секвенца примерок (на пр. ген од референтен ген). Оставете ја вештачката интелигенција прво да изврши основна анализа на секвенцата (содржина на GC, ORF, превод) со шаблонот „силно барање“. Потоа независно проверете го излезот со Biopython или онлајн алатка и забележете ги разликите. Конечно, поставете и прашање за коментар на вештачката интелигенција барајќи извори и проверете дали сите референци што ги дава се точни, барајќи ги во вистинската база на податоци.

листа за проверка

  • [ ] Го потврдив секој коментар на низата со метрика за идентитет/покриеност/е-вредност.
  • [ ] Ја разјаснив верзијата на геномот и координатен систем.
  • [ ] Независно ја водев скриптата за варијанта/анализа и ја репродуцирав.
  • [ ] Ги толкував предвидувањата на протеинските модели како веројатности, а не резултати.
  • [ ] Ги потврдив сите имиња на гени/протеини/референтни дадени од вештачката интелигенција наспроти вистинската база на податоци.
  • [ ] Ја одвоив истражувачката анализа од клиничката дијагноза.