Üksus 2 / 10

Bioinformaatika ja järjestuste analüüs: DNA, RNA ja valgu järjestuste mõistmine tehisintellektiga

Kasu:

  • Mõistma jadaanalüüsi kvaliteedikontrolli, joondamise, variantide kutsumise ja annotatsiooni etappe ning oskama tehisintellekti ohutult kasutada skriptimisel ja tulemuste kokkuvõtete tegemisel.
  • Võimalus kinnitada ja välja rookida võltsitud geene, valke ja viiteid, sidudes iga järjestuste tõlgenduse selliste mõõdikutega nagu identsuse protsent, katvus ja e-väärtus
  • Võimalus tõlgendada valgu keele mudeli ennustusi tõenäosustena, kinnitada kriitilisi kandidaate märgtestidega ja rakendada teadusuuringute ja kliinilise diagnoosi eraldamise distsipliini.

Bioinseneri kõige elementaarsem tooraine on järjestus (järjestus - tähtedega kirjutatud DNA, RNA või valgu järjestatud esitus; näiteks ATGCGT... või valgu jaoks MKV...). Järjestusseade toodab üleöö sadu miljoneid lühikesi lugemisi; Bioinformaatika (teadusharu, mis analüüsib bioloogilisi andmeid arvutusmeetoditega) ülesanne on muuta need algandmed tähendusrikkaks bioloogiliseks vastuseks. Selles üksuses saate teada, kus jadaanalüüsis tehisintellekti ohutult kasutada, millised standardtööriistad seda kiirendavad ja kus on teie eksperthinnang hädavajalik.

Tüüpilised järjestuste analüüsi etapid on järgmised: töötlemata lugemite kvaliteedikontroll (halbade lugemiste ja adapteri jääkide eemaldamine), võrdlusgenoomiga joondamine (joondamine – leidmine, kust lugemid pärinevad genoomist), variantide väljakutsumine (mutatsioonide tuvastamine, punktid, kus indiviid erineb viitest) ja tulemuste tõlgendamine. Tehisintellekt aitab selle ahela igas lülis kas skripte kirjutades, tulemuste kokkuvõtteid tehes või kommentaaride mustandeid koostades; kuid kriitilised sammud, nagu joondus ja variantide väljakutsumine, tehakse ikka valideeritud standardsete tööriistadega.

Järjestuse joondamine: sarnasus ja tähendus

Kahe järjestuse sarnasuse mõõtmine on bioinformaatika süda. BLAST (Basic Local Alignment Search Tool – klassikaline tööriist, mis võrdleb järjestusi tohututes andmebaasides leiduvate järjestustega ja leiab neist kõige sarnasemad) on esimene samm valkude või geenide mõistmisel. Eristage järjestuse joonduses kahte mõistet: identsus (kahe sama tähega jada osakaal) ja e-väärtus (statistika, mis näitab tõenäosust, et leitud sarnasus tekkis juhuslikult; kui see on väike, on see oluline). Tehisintellekt võib tõlgendada BLAST-i väljundit ja anda sellise ülevaate nagu "see järjestus on tõenäoliselt kinaasi ensüüm", kuid te kontrollite seda tõlgendust e-väärtuse, katvuse ja teadaoleva domeeniteabega.

Näpunäide. Kui küsite tehisintellektilt erinevaid kommentaare, küsige alati ka töötlemata joondusmõõdikuid: identiteediprotsent, katvus, e-väärtus. Ilma nende näitajateta ei saa "see valk on see" antud tõlgendust kontrollida ja see võib olla hallutsinatsioon.

AI-põhised massiivimudelid

Viimastel aastatel on tekkinud valgukeele mudelid, mis käsitlevad järjestusi kui "keelt" (AI mudelid, mis on treenitud miljonite valgujärjestustega ja ennustavad järjestuse funktsionaalseid ja struktuurseid omadusi; näiteks ESM). Need võivad ennustada, kas mutatsioon häirib valku, millisesse perekonda järjestus kuulub, või funktsionaalseid piirkondi. See on võimas sõelumistööriist: enne testimist sorteerib see tuhandeid variante ja tõstab esile kõige lootustandvamad. Ent ennustus on tõenäosus; Iga kriitilist kandidaati testitakse eksperimentaalselt.

Ettevaatust: kui valgu keelemudel ütleb "see mutatsioon on kahjulik", on see tõenäosusskoor, mitte diagnoos. Kliinilist tõlgendust (nt haiguse variandi aruannet) pakutakse ainult kinnitatud, reguleeritud vahendite ja ekspertide geneetilise nõustamise abil.

kolm minikarpi

Juhtum 1 – annotatsioon kiirendatud. Ühes metagenoomika projektis kohtas meeskond keskkonnaproovidest 8400 tundmatut valgujärjestust. AI-abiga esialgne annotatsioon (funktsioonide siltide määramine järjestustele) koondas need funktsionaalsetesse perekondadesse ja koostas 6 tunniga esialgse kaardi. Meeskond nõustus ainult kõrge usaldusväärsusega 30%; kontrollis ülejäänud osa käsitsi BLAST-i ja HMM-iga.

Juhtum 2 – tabatud hallutsinatsioonid. Üks õpilane küsis tehisintellektilt, "millisest organismist pärineb järjestus ja selle DOI allikas". AI andis täpse liiginime ja artikli viite. Õpilane pani selle BLASTile: lähim vaste oli täiesti erinev klass 41% ID-ga ja ilma viiteta. AI andis ladusa, kuid väljamõeldud vastuse.

Juhtum 3 – Variantide filtreerimine. Ühel geneetilisel projektil oli 4,7 miljonit töötlemata varianti. AI kirjutas filtreerimisskripti, mis sisaldas kvaliteedi, sügavuse ja populatsiooni sageduse lävesid; kuni 120 kliiniliselt olulist varianti. Meeskond põhjendas iga filtrit lähteartikliga ja käivitas skripti iseseisvalt; Tulemus osutus korratavaks.

Neli kopeeritavat malli

1) FASTQ kvaliteedikontrolli skript:

Sinu roll: bioinformaatika insener. Kirjutage Pythonis skript: sisend on FASTQ-fail, väljund on keskmine lugemiskvaliteet, GC sisu ja adapteri jääkide kokkuvõte. Kasutage Biopythoni raamatukoguna. Selgitage koodi ja kirjutage, mida iga läviväärtus (nt Q30) tähendab. Funktsiooni sobitamine, mida pole olemas.

2) BLAST-väljundi kommentaar (olenevalt allikast):

Annan teile BLAST-i tabeliväljundi (veerud: päring, teema, %identiteet, joonduse_pikkus, väärtus, bitiskoor). Kirjutage iga tabamuse ID, ulatus ja e-väärtus sõna-sõnalt üles. Arvestage "usaldusväärseteks" ainult need, mille e-väärtus on < 1e-5 ja katvus > 70%. Tugine oma tõlgendus nendele mõõdikutele; Märkige tüübi/funktsiooni oletus kui "vajab kinnitamist".

3) Variantide filtreerimise loogika:

Teie roll: mittekliinilise uurimistöö bioinformaatik. Soovitage VCF-i filtreerimise samme: minimaalne lugemissügavus, kvaliteediskoor, populatsiooni sageduse lävi. Märkige iga künnise põhjendus ja allikas. See on uurimistöö filter; Kirjutage väljatrükile, et seda ei saa kasutada kliiniliseks diagnoosimiseks.

4) Koodoni optimeerimise selgitus:

Kuidas optimeerida koodonite kasutamist DNA järjestuse kujundamisel, et ekspresseerida [sihtorganismi] valgujärjestust? Selgitage samme ja riske, mida tuleb arvesse võtta (GC tasakaal, kordusjärjestused, restriktsioonisaidid). Rääkige mulle, milliseid valideerimistööriistu enne betoonimassiivi valmistamist kasutada.

Nõrk viip / Tugev viip

Nõrk viip:

Analüüsige seda järjestust: ATGCGTACGT...

Mis tüüpi analüüs, milline kriteerium, milline tulemus on ebaselge; AI toodab vaba tõlgendusi, mis on väljamõeldud.

Võimas viip:

Sinu roll: bioinformaatika insener. Järgmise Pythoni/Biopythoni DNA järjestuse jaoks: (1) arvutage pikkus ja GC sisaldus, (2) leidke kuuest lugemiskaadrist avatud lugemisraamid (ORF-id), (3) väljutage pikima ORF-i valgu translatsioon. Esitage ainult koodi tulemused; bioloogiliste funktsioonide tõlgendamine. Seeria: [sari]

Erinevus: selged alamülesanded, standardsed tööriistad, koodil põhinev kontrollitav väljund ja kommentaaride limiit.

Järjestuste analüüsi ülesanded ja tehisintellekti roll

Quest

standardne sõiduk

AI panus

kontrollimine

kvaliteedikontroll

FastQC, Trimmomatic

Skript + kokkuvõte

Meetriline lävi

joondus

BWA, Bowtie2

Parameetri soovitus

Joondussuhte juhtimine

Variant helistamine

GATK, bcftools

Töövoo mustand

Kinnitatud teadaoleva variandiga

annotatsioon

BLAST, InterProScan

Eelklastri moodustamine

E-väärtus + domeen

Mõju hinnang

ESM, SIFT

Kandidaatide paremusjärjestus

märg eksperiment

Levinud vead

  • Kommentaaride vastuvõtmine ilma mõõdikuteta. Ilma identiteedi, katvuse ja e-väärtuseta ei saa kinnitada ütlust "see valk on".
  • Viite/koordinaatide süsteemi segamine. Kui genoomi versioon (hg38 vs hg19) ja 0/1-põhised koordinaadid on segatud, on variantide asukohad valed.
  • Partii efekti ignoreerimine. Erinevates partiides järjestatud proovid võivad tehnilisi erinevusi bioloogiaga segi ajada.
  • Kasutades funktsiooni nime, mille AI koostas. Mudel võib genereerida olematuid geenide/valgu/tööriistade nimesid; Kontrollige iga nime tegeliku andmebaasi suhtes.
  • Kliinilise tõlgenduse andmine uurimisvahendi kaudu. Ühe variandi seost haigusega teatatakse ainult heakskiidetud reguleeritud protsesside kaudu.

Kokkuvõttes

Järjestuste analüüs on biotehnoloogia lähtematerjal ja tehisintellekt kiirendab selle ahela iga etappi skriptimise, väljundi kokkuvõtete ja kandidaatide järjestamise teel. Kuid kriitilised sammud, nagu joondamine, variantide väljakutsumine ja funktsioonide määramine, tehakse standardsete kinnitatud tööriistadega ning iga kommentaar on seotud selliste mõõdikutega nagu ID protsent, e-väärtus ja päritolu. Valgukeele mudelid on võimsad sõelumisvahendid; Nende väljund on tõenäosus, mitte järeldus, kuni see pole katsega kinnitatud.

Rakenduse ülesanne

Valige avalikult kättesaadav proovijärjestus (nt geen võrdlusgeenist). Laske tehisintellektil esmalt teha põhijärjestuse analüüs (GC sisu, ORF, tõlge) malliga "tugev viip". Seejärel kontrollige väljundit iseseisvalt Biopythoni või veebitööriistaga ja märkige üles kõik erinevused. Lõpuks esitage tehisintellektile kommentaari küsimus, küsides allikaid, ja kontrollige, kas kõik viited on õiged, otsides neid tegelikust andmebaasist.

kontrollnimekiri

  • [ ] Kontrollisin iga stringi kommentaari identiteedi/katvuse/e-väärtuse mõõdikutega.
  • [ ] Täpsustasin genoomi versiooni ja koordinaatsüsteemi.
  • [ ] Käitsin variandi/analüüsi skripti iseseisvalt ja reprodutseerisin selle.
  • [ ] Valgumudeli ennustusi tõlgendasin tõenäosustena, mitte tulemustena.
  • [ ] Kontrollisin kõiki tehisintellekti antud geenide/valkude/viitenimesid tegeliku andmebaasi suhtes.
  • [ ] Eraldasin uurimistöö analüüsi kliinilisest diagnoosimisest.