Добици:
- Схватите концепте поравнања секвенци, претраживања мотива и отвореног оквира за читање (ОРФ) и нека вештачка интелигенција произведе извршни, проверљиви Биопитхон/аналитички код.
- Способност да се провере претпоставке верзије оквира, ланца и генома у секвенци и коду који производи вештачка интелигенција и упореди резултат са познатом референцом
- Способност примене дисциплине да се не користе секвенце које вештачка интелигенција даје из главе и потврђивање сваке секвенце из примарног извора као што је НЦБИ / Енсембл
Анализа секвенце је најосновнији задатак молекуларне биологије: читање ланца ДНК (или У у РНК) који се састоји од слова А, Т, Г, Ц, упоређивање и проналажење значајних региона (гени, мотиви, регулаторне секвенце) унутар њега. У овој јединици ћете научити како да користите вештачку интелигенцију (АИ) као партнера за писање и тумачење кода у овим радовима; али ћете научити зашто увек треба да проверите резултат помоћу извршног кода и примарног извора. Наш основни скуп алата биће Биопитхон (Питхон библиотека написана за рад са биолошким секвенцама) и званични алати за поравнање.
Прво упозорење: ЛЛМ може произвести грешке из меморије, чак и кратак низ. Може да помеша слово када се од њега тражи да израчуна обрнути комплемент секвенце директно. Према томе, никада не изводите операције са стринговима ослањајући се на текстуални одговор АИ, већ са кодом који АИ напише и ви покрећете.
Основни концепти: са чиме радимо?
- Основни пар (бп): словна јединица ДНК. Људски геном је око 3,2 милијарде бп.
- Прамен: ДНК је двострука спирала; Две нити су антикомплемент једна другој. Важно је у којој нити је декларисана варијанта.
- Кодон: Група од три базе; сваки кодон одговара аминокиселини (грађевински блок протеина). На пример, АТГ је обично почетни кодон (метионин).
- Отворени оквир читања (ОРФ): Регион секвенце који може да кодира протеин, протеже се од стартног кодона до стоп кодона (ТАА, ТАГ, ТГА).
- Мотив: Понављајући узорак кратке секвенце који има специфичну функцију; на пример, регион за који се везује транскрипциони фактор.
- Поравнање: Распоређивање две или више секвенци једна испод друге да бисте видели њихове сличности.
Корак по корак: ток рада анализе секвенце
1. Набавите серију из поузданог извора. Немојте терати АИ да каже „подсети“ секвенцу; Преузмите га као ФАСТА (стандардни текстуални формат који чува секвенце) из извора као што је НЦБИ, Енсембл, итд. и дајте ову секвенцу АИ.
2. Обавите трансакцију помоћу кода. Нека операције као што су обрнути комплемент, транскрипција (ДНК→РНА), транслација (РНА→протеин), ГЦ однос обављају Биопитхон код и покрените код сами.
3. Проверите оквир и претпоставке нити. Замолите га/њу да јасно наведе у реду за коментаре која нит и у ком оквиру за читање код се покреће.
4. Упоредите резултат са познатом референцом. Спојите протеин или ОРФ који сте произвели са познатим записом у бази података. Дужина и почетна неусклађеност обухватају најчешће грешке.
5. Потврдите поравнање службеним алатом. Не дозволите АИ да "очне јабучице" сличност две серије; Добијте нумерички резултат помоћу БЛАСТ-а (алатка за претрагу сличности секвенци) или библиотеке поравнања.
Савет: Увек нека вам дужина жице буде прва провера. Број аминокиселина протеина је приближно једна трећина броја база кодирајуће секвенце (искључујући стоп кодон). Ако дужина не одговара, оквир или конац су погрешни.
три мини кофера
Случај 1 — Инверзна грешка комплемента. Студент је питао АИ о обрнутом комплементу секвенце 5'-ГАТТАЦА-3'; АИ је дао "ТГТААТЦ" (тачно). Међутим, у дужем низу од 20 база, АИ је прескочио базу и резултат је био 19 база. Када га је ученик покренуо са Сек("...").реверсе_цомплемент() у Биопитхон-у, требало је 20 база и ухватио грешку. Изгубљено време: 2 минута.
Случај 2 — Померање оквира. Истраживач је имао секвенцу кодирања од 900 база преведену у протеин; АИ је "читао" протеин од 280 аминокиселина по тексту. Очекивано је било 299 аминокиселина (900/3 − 1 стоп). Разлика је била у томе што је АИ почео од другог нуклеотида. Тачна дужина је добијена када је код покренут од првог оквира.
Случај 3 — Потврда добијена. Лабораторијски техничар је испитао секвенце 16С рРНА два бактеријска соја питајући "да ли су исти?" питао је АИ; „Највероватније исто“, рекао је АИ. Када је техничар покренуо БЛАСТ, видео је 97,8% сличности и 12 основних разлика - критичну разлику за дискриминацију на нивоу врсте. Да није било бројчане оцене, у извештај би се унео погрешан „исти“ резултат.
Пример: Биопитхон стреам који се може проверити
из Био.Сек импорт Сек# Увезите секвенцу из ФАСТА који сте преузели са НЦБИ; Немојте терати АИ да каже "подсети ме". дна = Сек("АТГГЦЦАТТГТААТГГГЦЦГЦТГАААГГГТГЦЦЦГАТАГ")принт("Дужина (бп):", лен(дна))принт("ГЦ стопа (%):", роунд(100 * (дна.цоунт("Г") + дна.цоунт("Ц")) / цомплемент(дна):",1 дна.реверсе_цомплемент())# Превод из оквира 1; до стоп кодонпротеин = дна.транслате(то_стоп=Труе)принт("Протеин:", протеин, "| Дужина (мм):", лен(протеин))
Иако АИ пише овај код, видите тачност излаза тако што ћете га покренути. Дужина, ГЦ однос и протеин су упоредиви са познатом референцом.
Четири шаблона за копирање
1) Проверљива операција низа:
Напишите извршни Биопитхон код за следећу ФАСТА секвенцу: [секвенца/задатак]. Израчунајте дужину, ГЦ однос, обрнути комплемент и превод из оквира 1. Прокоментаришите који конац и оквир се претпостављају. Немојте производити секвенцу; Само користи секвенцу коју сам ти дао.
2) ОРФ скрининг:
Напишите Питхон код који проналази све отворене оквире за читање у датом низу (и сва три на опционом обрнутом низу). Пријавите почетну позицију, дужину и преведени протеин за сваки ОРФ. Такође означите најдужи ОРФ.
3) Потврда поравнања:
Желим да упоредим два низа. "Слично?" Не судите по оку; написати код за поравнање у пару и бројчано извести проценат сличности и број разлике. Извор: [серија 1], [серија 2].
4) Претрага мотива:
Потражите следећи мотив (такође као регуларни израз) у датом низу: [мотив]. Наведите локацију (на основу 1) свих подударања. Напишите и наведите подударања која се преклапају.
Слаби промпт / Јаки промпт
Слабо: "Напишите протеин ове секвенце: АТГГЦЦ..."
Проблем: АИ преводи са текстом, може да збуни оквир/нит, не може да провери дужину.
Снажан: "Напишите извршни Биопитхон код који преводи следећу секвенцу из оквира 1, извештава о дужини и стоп кодон; немојте мењати секвенцу, само користите онај који сам дао: АТГГЦЦ..."
Зашто је моћан: Обрада се врши у коду, оквир је јасан, излаз се може верификовати нумерички.
Куест
погрешан приступ
прави приступ
обрнути додатак
Нека АИ пише текстом
Биопитхон реверсе_цомплемент()
превод
Нека АИ преводи из меморије
Код, специфицирајући оквир
сличност
"Слично?" одлука ока
БЛАСТ/резултат поравнања
мотив
Нека АИ броји руком
Шифра, са листом локација
Извор низа
Нека АИ запамти
ФАСТА из НЦБИ/Енсембл
Уобичајене грешке
- Не прецизирајући оквир. Превођење из погрешног оквира даје кратак или неисправан протеин.
- Заплетање предива. Варијанта или мотив може бити у обрнутом нити; претпоставку теме треба написати.
- Натерати АИ да запамти секвенцу. ЛЛМ не може произвести дугачак низ без грешака; Ви увек дајете серију.
- Судећи по оку за сличност. Немојте рећи „исто/слично“ без бројчане оцене.
- РНК/ДНК мешавина. Мешање У са Т омета превод; разјаснити врсту уноса.
Опрез: Чак и висок проценат сличности у БЛАСТ-у и сличним алатима не значи нужно биолошки „идентичан“; Е-вредност (вероватноћа шансе) и дужина усклађеног региона треба да се процене заједно.
Дубина: исправно читање БЛАСТ излаза
АИ интерпретација БЛАСТ резултата штеди време; Али немојте доносити никакве одлуке док сами не прочитате три издања. Прва је е-вредност (очекивана вредност): очекивани број пута да се овај резултат може догодити случајно; Веома мала вредност као што је 1е-50 значи јака, вредност попут 0,1 је скоро шум. Други је покривеност упита: који проценат секвенце упита покрива подударање; 98% сличности, али само 20% покривености значи да је мали део низа сличан и обмањујући. Трећи је проценат идентитета. Без ове три заједно прочитане, сам висок проценат не доказује ништа.
Конкретан пример: истраживач је БЛАСТ-ао фрагмент гена који је управо секвенцирао; „99% подударања са људским БРЦА2, исти ген“, рекао је АИ. Када је истраживач погледао излаз, видео је да је покривеност била само 15% — одговарајући део је био само кратак регион који се понавља од хиљада база БРЦА2. Тачна интерпретација није била „исти ген“ већ „дели заједнички мотив понављања“. Читање опсега спречило је потпуну погрешну идентификацију.
БЛАСТ колона
шта каже
трап
Е-вредност
вероватноћа случајности
Ако је висока, меч може бити бесмислен
Покривеност упита
Покривена стопа упита
Ако је низак, проценат је погрешан
проценат идентитета
Одговарајућа основна стопа
сама није довољна
битсцоре
Нормализована снага поравнања
Тумачено према дужини
5) БЛАСТ шаблон за тумачење излаза:
Протумачите следећу БЛАСТ табелу, али немојте одлучивати: сумирајте е-вредност, покривеност упита и проценат идентитета за сваки ред посебно и назначите које прагове треба испунити пре него што дођете до закључка као што је „исти ген“. Табела: [пасте].
Укратко
- Операције секвенце (обрнути комплемент, превод, ОРФ, ГЦ однос) треба да се раде са кодом који АИ пише и који ви покрећете, а не са текстуалним одговором АИ.
- Претпоставке оквира и нити увек треба да буду експлицитно наведене; провера дужине је најбржи алат за хватање грешака.
- Увек добијајте секвенцу из поузданог извора (НЦБИ, Енсембл); Не терајте АИ да га запамти.
- Сличност и усклађеност се процењују званичним алатима и нумеричким резултатима, а не очима.
Задатак апликације
Преузмите кратку секвенцу кодирања из поузданог извора (нпр. НЦБИ). Са шаблонима 1 и 2 изнад, затражите од АИ Биопитхон код, покрените код; Упоредите дужину и секвенцу протеина који сте произвели са познатим записом у бази података. Ако пронађете неусклађеност, покушајте да је поправите променом оквира/претпоставке нити и забележите процес.
контролна листа
- [ ] Добио сам секвенцу из поузданог извора, нисам имао АИ да је запамти.
- [ ] Извео сам операције низа са извршним кодом.
- [ ] Јасно сам прецизирао оквир и претпоставку нити.
- [ ] Упоредио сам дужину протеина/ОРФ са референцом.
- [ ] Оценио сам сличност са званичним алатом и бројчаним резултатом.
- [ ] Проверио сам РНК/ДНК и У/Т раздвајање.