Јединица 3 / 11

Анализа секвенци и биоинформатика: ДНК, РНК и протеини

Добици:

  • Могућност штампања кода основних операција анализе секвенце као што су ФАСТА читање, превођење, поравнање и БЛАСТ и тумачење резултата
  • Способност да се избегну погрешни закључци правилним тумачењем појмова као што су е-вредност, стопа покривености и оквир читања
  • Способност разумевања неопходности потврђивања захтева функције секвенце са званичним базама података (НЦБИ, УниПрот, Енсембл).

Најосновнији податак биологије је секвенца: секвенца ДНК која се састоји од слова А, Т, Г, Ц; А, У, Г, Ц секвенца РНК; ланац од 20 аминокиселинских слова протеина. Разумемо шта је ген, колико су две врсте повезане и однос између мутације (промена секвенце) и болести кроз ове секвенце. У овој јединици ћемо научити да користимо вештачку интелигенцију као помоћник кода и тумачења за анализу секвенци: читање ФАСТА датотека, превођење секвенци, поравнање (поравнање: упоређивање две секвенце слово по слово и уочавање њихових сличности) и разумевање алата као што је БЛАСТ.

Критично упозорење од самог почетка: АИ не "зна" стварну функцију секвенце; Ово говоре само званичне базе података (НЦБИ, УниПрот, Енсембл) и емпиријски докази.

Основни појмови и алати

  • ФАСТА: Формат текста који чува низове; Сваки низ се састоји од линије заглавља која почиње са > и линија подниза испод њега.
  • БЛАСТ (Басиц Лоцал Алигнмент Сеарцх Тоол): Алат који пореди секвенцу коју имате са милионима секвенци у огромној бази података и проналази оне најсличније. "Како изгледа ова серија?" стандардни одговор на питање.
  • Поравнање: Распоређивање два или више низова тако да се слични региони постављају један испод другог. То може бити парно или вишеструко поравнање секвенци (МСА).
  • Превод: Претварање ДНК/РНА кодирајуће секвенце у секвенцу аминокиселина преко троструких група слова (кодона).
  • Мотив: Кратак образац који се понавља у низу који има функционално значење (нпр. место везивања).
Савет: Не можете рећи вештачкој интелигенцији да „ПОПУСТИ ту серију“; Модел не може приступити бази података БЛАСТ. Али "Како да протумачим свој БЛАСТ резултат, шта значи е-вредност (Е-вредност)?" Можете питати, па чак и написати код који програмски позива БЛАСТ помоћу Биопитхон-а.

Корак по корак: истраживање идентитета низа

  1. Добијте секвенцу: сачувајте у датотеку као ФАСТА.
  2. Основна провера: дужина, садржај слова (да ли је то само А/Т/Г/Ц или постоји непознато „Н”), ГЦ однос (проценат гванин-цитозина: варира у зависности од врсте и региона).
  3. БЛАСТ: Претражујте у НЦБИ веб интерфејсу или програмски.
  4. Коментар: Погледајте е-вредност најбољег подударања (што је мања, мања је вероватноћа да је случајност) и покривеност упита.
  5. Потврда: Отворите одговарајући ген/протеин у УниПрот или НЦБИ и проверите да ли заиста одговара функцији коју тражите.

АИ вам помаже да кодирате у кораку 2 и коментаришете у кораку 4; али праве податке у корацима 3 и 5 дају сами алати и ви.

Шаблони упита који се могу копирати

Улога: Ви сте асистент за биоинформатику. Задатак: Прочитајте ФАСТА фајл (секуенцес.фаста) помоћу Биопитхон-а. Желим: уписати име, дужину и ГЦ однос за сваку секвенцу у табелу; сачувајте резултат као ЦСВ. Дајте радни Питхон код са коментарима.

Преведите ДНК секвенцу коју имам у секвенцу протеина. Користите Биопитхон Сек.транслате; прикажи стоп кодон (*); означавају оквир за читање. Дајте код, објасните. Секвенца: [ФАСТА]

Протумачите мој БЛАСТ резултат. Испод су вредност-вредност, проценат идентитета и стопа покривености 5 најбољих мечева. Објасните ми које подударање је поуздано и зашто, немојте да тврдите тачне функције, реците ми кораке које морам да проверим. Табела: [подаци]

Поравнајте две секвенце протеина у пару и пронађите процентуалну сличност. Користите Биопитхон паирвисе2 или Био.Алигн; одштампајте читљиво поравнање. Дајте шифру и објасните шему бодовања.

Слаби промпт / Јаки промпт

Слаб: "Који је ген овај низ?"

Снажан: "Имам секвенцу људске ДНК од 1140 парова база (ФАСТА испод). Сам сам БЛАСТирао ову секвенцу; најбоље подударање је ТП53, е-вредност 0,0, идентитет 99,8%, покривеност 100%. Објасните зашто је овај резултат јак доказ; међутим, реците ми које 2 провере треба да извршим пре него што извршим његову функцију."

Разлика: У јаком промпту, стварни подаци (дужина, БЛАСТ резултат) се достављају моделу; Тражите од модела да тумачи доказе које дајете, а не да их "сећате". Он је приморан да измишља модел на слабом позиву.

три мини кофера

Случај 1 — Нетачан оквир читања: Ученик је превео ДНК секвенцу у протеин, али од почетка, без проналажења исправног стартног кодона (АТГ). Резултат је био бесмислен протеин који се рано зауставља. Када је модел испробао сва три оквира читања и написао код који је пронашао најдужи отворени оквир читања (ОРФ) почевши од АТГ, појавио се исправан протеин од 380 аминокиселина.

Случај 2 — Заблуда Е-вредности: Техничар је пријавио БЛАСТ подударање са е-вредношћу 2,0 као „пронађено“. Док е-вредност већа од 1 указује на то да је подударање највероватније случајност. Модел је то објаснио и подсетио да се е < 1е-5 генерално користи као поуздан праг.

Случај 3 — Контаминација: БЛАСТ бактеријске секвенце у лабораторији показао је људски ДНК као најбољи спој. Ово је био знак контаминације узорка. АИ је изазвао праву сумњу наводећи да „неочекивани тип подударања може указивати на контаминацију“; Техничар је поновио пример.

Поређење: улога вештачке интелигенције

Куест

вештачка интелигенција

Алат/база података

људски

ФАСТА читање, ГЦ/дужина

пише код

Контролише излаз

Превод, ОРФ налаз

пише код

Покреће Биопитхон

Потврђује оквир

арраи ид

Коментари

БЛАСТ/НЦБИ налази

потврђује

Захтев за функцију

нуди предлоге

УниПрот даје доказ

одлучује

Уобичајене грешке

  • Тражење од модела да „запамти” ИД стринга: Модел не памти низове; Користите БЛАСТ.
  • Погрешно тумачење е-вредности: мало је добро, велико је лоше; Запамтите праг.
  • Не проверава оквир за читање: Погрешан оквир производи бесмислен протеин.
  • Игнорисање покривености: Висок идентитет, али ниска покривеност значи делимично подударање.
  • Недостаје контаминација: Неочекивано подударање врста је озбиљно упозорење.
Опрез: Само зато што је секвенца "99% слична ТП53" не доказује да та секвенца носи функцију ТП53; То је јака хипотеза. Функција мора бити подржана емпиријским доказима и описима базе података. Није довољно да АИ једноставно каже „ово је супресор тумора“.

Вишеструко поравнање секвенци и основа филогеније

Поравнавање десетина секвенци заједно, а не само две, назива се вишеструко поравнање секвенци (МСА) и основа је многих анализа: проналажење очуваних региона (делова који су остали непромењени у еволуцији и стога функционално важни), изградња филогенетских стабала, идентификација породица протеина. Алати као што су МАФФТ, МУСЦЛЕ и Цлустал раде овај посао. АИ пише код који позива ове алате из Питхон-а (преко Биопитхон-а, на пример) и помаже вам да тумачите излаз; али само поравнање чини алат, а не модел "напамет".

Када тумачите МСА, обратите пажњу на очуване колоне: аминокиселина која остаје иста у свим секвенцама је највероватније критична за функцију протеина (нпр. активно место ензима). Ово даје снажан траг о томе зашто би мутација могла бити штетна. Али „очуван = значајан“ је хипотеза; захтева експерименталну проверу.

Прочитајте мој фајл вишеструког поравнања (алигнед.фаста), који је МАФФТ излаз, са Биопитхон-ом. Израчунајте стопу задржавања за сваку колону; Наведите преко 90% заштићених позиција. Објасните зашто ови положаји могу бити од функционалног значаја, не претендујте на дефинитивну функцију.

Замка мутације и варијантне интерпретације

Када видите промену слова (варијанту) у низу, велики је скок рећи да је „штетно“. Већина варијанти је неутрална (неефикасна). Када се тумачи утицај варијанте, потребно је да погледате наменске базе података варијанти (као што је ЦлинВар) и податке о учесталости популације (као гномАД), а не реч вештачке интелигенције. Ако модел тврди да је варијанта „патогена“, никада то не упишите у клинички или истраживачки закључак, а да то не потврдите овим изворима.

Базе базе података за верификацију

Познавање званичних извора за потврду сваке тврдње у анализи серије је ваш најјачи штит од измишљотина вештачке интелигенције. Најчешће коришћени:

база података

за шта

Типична потврда

НЦБИ ГенБанк/РефСек

ДНК/РНА секвенце, генски записи

ИД низа, дужина

УниПрот

Секвенце и функције протеина

Функција, број аминокиселина

ансамбл

Анотација генома, локације гена

Мапирање гена и хромозома

ЦлинВар

Клинички значај варијанти

Патогена/неутрална одлука

гномАД

Учесталост варијанти у популацији

ретка/честа варијанта

АИ може предложити које од ових база треба да погледате; Али ви постављате упит и читате резултат. „Модел је рекао да је то оно што УниПрот каже“ није потврда; Потврда је отварање УниПрот странице.

Укратко

Анализа секвенци је срце биоинформатике; ФАСТА, БЛАСТ, поравнање и превођење су основне операције. АИ пише код за ове операције и помаже вам да тумачите њихове резултате, али алати (БЛАСТ) и базе података (НЦБИ, УниПрот) пружају стварну идентификацију секвенце. Правилно разумевање концепата као што су е-вредност, покривеност и оквир за читање је кључно за избегавање погрешног закључка. Захтев функције увек захтева независан доказ.

Задатак апликације

Узмите узорак ДНК секвенце (или ген који сте преузели са НЦБИ). Нека АИ израчуна дужину и ГЦ однос помоћу Биопитхон-а, затим га преведе у сва три оквира за читање и одштампа код који пронађе најдужи ОРФ. Покрените резултат. Затим сами потражите ову секвенцу у НЦБИ БЛАСТ-у и нека модел тумачи е-вредност и стопу покривености најбољег подударања. Потврдите функционалну тврдњу модела у УниПроту.

контролна листа

  • [ ] Проверио сам дужину и садржај слова пре обраде стринга.
  • [ ] Користио сам исправан оквир за читање у преводу.
  • [ ] Сам сам покренуо БЛАСТ, нисам "подсетио" модел.
  • [ ] Правилно сам протумачио е-вредност и однос покривености.
  • [ ] Проценио сам да се неочекиване врсте подударају за контаминацију.
  • [ ] Потврдио сам тврдњу функције са званичном базом података.