Vienība 2 / 11

DNS/RNS sekvences analīze: izlīdzināšana, motīvs, atvērtais lasīšanas rāmis un pamata bioinformātika

Ieguvumi:

  • Izprotiet secības saskaņošanas, motīvu meklēšanas un atvērtā lasīšanas rāmja (ORF) jēdzienus un ļaujiet mākslīgajam intelektam radīt izpildāmu, pārbaudāmu Biopython/analīzes kodu.
  • Spēja pārbaudīt rāmja, virknes un genoma versijas pieņēmumus mākslīgā intelekta radītajā secībā un kodā un salīdzināt rezultātu ar zināmu atsauci
  • Spēja pielietot disciplīnu neizmantot nekādas mākslīgā intelekta no galvas dotas sekvences un apstiprināt katru secību no primārā avota, piemēram, NCBI / Ensembl

Sekvenču analīze ir vissvarīgākais molekulārās bioloģijas uzdevums: nolasīt DNS virkni (vai RNS U), kas sastāv no burtiem A, T, G, C, to salīdzināt un atrast tajā nozīmīgus reģionus (gēnus, motīvus, regulējošās sekvences). Šajā nodaļā jūs uzzināsiet, kā šajos darbos izmantot mākslīgo intelektu (AI) kā kodu rakstīšanas un interpretācijas partneri; bet jūs uzzināsit, kāpēc jums vienmēr ir jāpārbauda rezultāts, izmantojot izpildāmo kodu un primāro avotu. Mūsu galvenais rīku komplekts būs Biopython (Python bibliotēka, kas paredzēta darbam ar bioloģiskām sekvencēm) un oficiālie līdzināšanas rīki.

Vispirms brīdinājums: LLM var radīt kļūdas no atmiņas, pat īsu secību. Tas var sajaukt burtu, ja tiek lūgts aprēķināt secības apgriezto papildinājumu. Tāpēc nekad neveiciet virkņu darbības, paļaujoties uz AI teksta atbildi, bet ar kodu, ko AI raksta un jūs palaižat.

Pamatjēdzieni: ar ko mēs strādājam?

  • Bāzes pāris (bp): DNS burtu vienība. Cilvēka genoms ir aptuveni 3,2 miljardi bp.
  • Virkne: DNS ir dubultspirāle; Abi virzieni ir viens otra antikomplements. Ir svarīgi, kurā pavedienā variants ir deklarēts.
  • Kodons: trīs bāzu grupa; katrs kodons atbilst aminoskābei (olbaltumvielu celtniecības blokam). Piemēram, ATG parasti ir sākuma kodons (metionīns).
  • Atvērtais lasīšanas rāmis (ORF): secības reģions, kas var kodēt proteīnu, sākot no sākuma kodona līdz stopkodonam (TAA, TAG, TGA).
  • Motīvs: atkārtojas īsas secības modelis, kam ir noteikta funkcija; piemēram, reģions, ar kuru saistās transkripcijas faktors.
  • Izlīdzināšana: divu vai vairāku secību sakārtošana vienu zem otras, lai redzētu to līdzības.

Soli pa solim: secības analīzes darbplūsma

1. Iegūstiet sēriju no uzticama avota. Nelieciet AI teikt "atgādināt" secību; Lejupielādējiet to kā FASTA (standarta teksta formāts, kas saglabā secības) no avota, piemēram, NCBI, Ensembl utt., un piešķiriet šo secību AI.

2. Veiciet darījumu ar kodu. Veiciet tādas darbības kā apgrieztais komplements, transkripcija (DNS→RNS), translācija (RNS→olbaltumviela), GC attiecība, izmantojot Biopython kodu, un palaidiet kodu pats.

3. Pārbaudiet karkasa un pavedienu pieņēmumus. Lūdziet viņam/viņai komentāra rindā skaidri norādīt, kurš pavediens un kurā lasīšanas rāmī darbojas kods.

4. Salīdziniet rezultātu ar zināmo atsauci. Saskaņojiet iegūto proteīnu vai ORF ar zināmo ierakstu datu bāzē. Garuma un sākotnējās neatbilstības atspoguļo visbiežāk sastopamās kļūdas.

5. Apstipriniet saskaņošanu ar oficiālo rīku. Neļaujiet AI "acs ābolam" būt divu sēriju līdzībai; Iegūstiet skaitlisku rezultātu, izmantojot BLAST (secības līdzības meklēšanas rīku) vai izlīdzināšanas bibliotēku.

Padoms. Vienmēr vispirms pārbaudiet auklas garumu. Proteīna aminoskābju skaits ir aptuveni viena trešdaļa no kodējošās secības bāzu skaita (izņemot stopkodonu). Ja garums neatbilst, rāmis vai vītne ir nepareiza.

trīs mini futrāļi

1. gadījums — apgrieztā komplementa kļūda. Students jautāja AI par sekvences 5'-GATTACA-3' apgriezto komplementu; AI deva "TGTAATC" (pareizi). Tomēr garākā 20 bāzu secībā AI izlaida bāzi, un rezultāts bija 19 bāzes. Kad students to izpildīja ar Seq("...").reverse_complement() programmā Biopython, tas aizņēma 20 bāzes un novērsa kļūdu. Zaudētais laiks: 2 minūtes.

2. gadījums — kadru nobīde. Pētniekam 900 bāzu kodēšanas secība tika pārvērsta proteīnā; AI "nolasa" 280 aminoskābju proteīnu pēc teksta. Paredzētās bija 299 aminoskābes (900/3–1 pietura). Atšķirība bija tāda, ka AI sākās no otrā nukleotīda. Pareizais garums tika iegūts, kad kods tika sākts no pirmā kadra.

3. gadījums — saņemts apstiprinājums. Laboratorijas tehniķis pārbaudīja divu baktēriju celmu 16S rRNS sekvences, jautājot "vai tās ir vienādas?" viņš jautāja AI; "Visticamāk, tas pats," sacīja AI. Kad tehniķis vadīja BLAST, viņš redzēja 97,8% līdzību un 12 bāzes atšķirības — būtiska atšķirība sugu līmeņa diskriminācijai. Ja skaitliskā rezultāta nebūtu, pārskatā tiktu ievadīts nepareizs "tas pats" rezultāts.

Piemērs: pārbaudāma Biopython straume

no Bio.Seq importēt Seq# Importēt secību no FASTA, ko lejupielādējāt no NCBI; Nelieciet AI teikt "atgādināt man". dna = Seq("ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG")print("Length (bp):", len(dna))print("GC rate (%):", round(100 * (dna.count("G") + dna.count("C")) / Reverse1) komplements(dna)," dna.reverse_complement())# Tulkojums no 1. kadra; līdz apturēšanai kodonproteīns = dna.translate(to_stop=True)print("Proteīns:", proteīns, "| Garums (mm):", len(proteīns))

Pat ja AI raksta šo kodu, jūs redzat izvades precizitāti, palaižot to. Garums, GC attiecība un proteīns ir salīdzināmi ar zināmo atsauci.

Četras kopējamas veidnes

1) Pārbaudāma masīva darbība:

Uzrakstiet izpildāmu Biopython kodu šādai FASTA secībai: [secība/uzdevums]. Aprēķiniet garumu, GC attiecību, apgriezto papildinājumu un tulkojumu no 1. rāmja. Komentējiet, kura vītne un rāmis tiek pieņemts. Neveidojiet secību; Vienkārši izmantojiet secību, ko es jums devu.

2) ORF skrīnings:

Uzrakstiet Python kodu, kas atrod visus atvērtos lasīšanas kadrus norādītajā secībā (un visus trīs izvēles reversajā daļā). Norādiet katra ORF sākuma pozīciju, garumu un tulkoto proteīnu. Atzīmējiet arī garāko ORF.

3) Izlīdzināšanas apstiprinājums:

Es gribu salīdzināt divus masīvus. "Līdzīgi?" Nevērtē pēc acs; uzrakstiet pāru izlīdzināšanas kodu un skaitliski ziņojiet līdzības procentuālo daļu un atšķirības skaitli. Avots: [1. sērija], [2. sērija].

4) Motīvu meklēšana:

Dotajā virknē meklējiet šādu motīvu (arī kā regulāru izteiksmi): [motīvs]. Norādiet visu spēļu atrašanās vietu (pamatojoties uz 1). Uzrakstiet un norādiet arī atbilstības, kas pārklājas.

Vāja uzvedne / spēcīga uzvedne

Vāji: "Uzrakstiet šīs secības proteīnu: ATGGCC..."

Problēma: AI tulko ar tekstu, var sajaukt rāmi/pavedienu, nevar pārbaudīt garumu.

Strong: "Uzrakstiet izpildāmu Biopython kodu, kas tulko šādu secību no 1. kadra, ziņo par garumu un stopkodonu; nemainiet secību, vienkārši izmantojiet to, ko es devu: ATGGCC..."

Kāpēc tas ir jaudīgs: apstrāde tiek veikta kodā, ietvars ir skaidrs, izvadi var pārbaudīt skaitliski.

Meklējumi

nepareiza pieeja

pareizā pieeja

apgrieztais papildinājums

Ļaujiet AI rakstīt ar tekstu

Biopython reverse_complement()

tulkojums

Ļaujiet AI tulkot no atmiņas

Kods, norādot ietvaru

līdzība

"Līdzīgi?" acu lēmums

BLAST/līdzināšanas rezultāts

motīvs

Ļaujiet AI skaitīt ar roku

Kods ar atrašanās vietu sarakstu

Masīva avots

Ļaujiet AI atcerēties

FASTA no NCBI/Ensembl

Biežas kļūdas

  • Nenorāda ietvaru. Tulkojumā no nepareizā kadra tiek iegūts īss vai kļūdains proteīns.
  • Dzijas sapīšana. Variants vai motīvs var būt pretējā pavedienā; jāraksta pavediena pieņēmums.
  • Liekot AI iegaumēt secību. LLM nevar izveidot garu virkni bez kļūdām; Jūs vienmēr sniedzat sēriju.
  • Pēc acs spriežot par līdzību. Nesakiet "tāds pats/līdzīgs" bez skaitliskā vērtējuma.
  • RNS/DNS maisījums. Sajaucot U ar T, tiek traucēta tulkošana; precizējiet ievades veidu.
Uzmanību: pat liela procentuālā līdzība BLAST un līdzīgos rīkos ne vienmēr nozīmē bioloģiski "identisku"; E-vērtība (iespējas varbūtība) un izlīdzinātā apgabala garums jānovērtē kopā.

Dziļums: pareizi nolasa BLAST izvadi

Ja AI interpretē BLAST rezultātu, tiek ietaupīts laiks; Bet nepieņemiet nekādus lēmumus, kamēr neesat pats izlasījis trīs numurus. Pirmā ir e-vērtība (paredzamā vērtība): paredzamais reižu skaits, kad šis rādītājs var rasties nejauši; Ļoti maza vērtība, piemēram, 1e-50, nozīmē spēcīgu, tāda vērtība kā 0,1 ir gandrīz troksnis. Otrais ir vaicājuma pārklājums: cik procentu no vaicājuma secības atbilst atbilstība; 98% līdzība, bet tikai 20% pārklājums nozīmē, ka neliela secības daļa ir līdzīga un ir maldinoša. Trešais ir identitātes procents. Bez šiem trīs kopā lasītiem lielais procents vien neko nepierāda.

Konkrēts piemērs: pētnieks BLAST veica gēna fragmentu, ko viņš tikko bija sekvencējis; "99% atbilst cilvēka BRCA2, tas pats gēns," sacīja AI. Kad pētnieks aplūkoja rezultātu, viņš redzēja, ka pārklājums bija tikai 15% — atbilstošā daļa bija tikai īss, atkārtots reģions no tūkstošiem BRCA2 bāzu. Pareizā interpretācija nebija "viens un tas pats gēns", bet gan "kopīgs atkārtojuma motīvs". Tvēruma lasīšana novērsa pilnīgu nepareizu identifikāciju.

BLAST kolonna

ko tas saka

slazds

E-vērtība

sakritības varbūtība

Ja tas ir augsts, sakritība var būt bezjēdzīga

Vaicājuma pārklājums

Aptvertais vaicājumu līmenis

Ja tas ir zems, procents ir maldinošs

identitātes procents

Atbilstoša bāzes likme

vien nepietiek

bitu rezultāts

Normalizēta izlīdzināšanas izturība

Interpretē pēc garuma

5) BLAST izvades interpretācijas veidne:

Interpretējiet šo BLAST tabulu, bet neizlemiet: apkopojiet katras rindas e-vērtību, vaicājuma pārklājumu un procentuālo identitāti atsevišķi un norādiet, kādi sliekšņi ir jāsasniedz, pirms nonākat pie secinājuma, piemēram, "tas pats gēns". Tabula: [ielīmēt].

Rezumējot

  • Secības darbības (apgrieztais papildinājums, tulkošana, ORF, GC attiecība) jāveic ar kodu, ko AI raksta un jūs palaižat, nevis ar AI teksta atbildi.
  • Ietvara un pavedienu pieņēmumi vienmēr ir skaidri jānorāda; garuma pārbaude ir ātrākais kļūdu uztveršanas rīks.
  • Vienmēr iegūstiet secību no uzticama avota (NCBI, Ensembl); Nelieciet AI to iegaumēt.
  • Līdzību un izlīdzināšanu novērtē, izmantojot oficiālus rīkus un skaitliskos punktus, nevis aci.

Lietojumprogrammas uzdevums

Lejupielādējiet īsu kodēšanas secību no uzticama avota (piemēram, NCBI). Izmantojot 1. un 2. veidni, lūdziet AI Biopython kodu, palaidiet kodu; Salīdziniet iegūtā proteīna garumu un secību ar zināmo ierakstu datubāzē. Ja atrodat neatbilstību, mēģiniet to novērst, mainot ietvara/pavediena pieņēmumu, un atzīmējiet procesu.

kontrolsaraksts

  • [ ] Es saņēmu secību no uzticama avota, man nebija AI, kas to iegaumētu.
  • [ ] Es veicu masīva darbības ar izpildāmo kodu.
  • [ ] Esmu skaidri norādījis ietvaru un pavedienu pieņēmumu.
  • [ ] Es salīdzināju proteīna/ORF garumu ar atsauci.
  • [ ] Es novērtēju līdzību ar oficiālo rīku un skaitlisko punktu skaitu.
  • [ ] Es pārbaudīju RNS/DNS un U/T atdalīšanu.