Eining 2 / 11

DNA/RNA raðgreining: röðun, mótíf, opinn lestrarrammi og grunn lífupplýsingafræði

Hagnaður:

  • Skilja hugtökin röðun, mótífaleit og opinn lestrarramma (ORF) og láta gervigreindina framleiða keyranlegan, sannanlegan Biopython/greiningarkóða.
  • Geta til að athuga forsendur ramma, strengs og erfðamengisútgáfu í röðinni og kóðanum sem framleiddur er með gervigreind og bera saman niðurstöðuna við þekkta tilvísun
  • Hæfni til að beita þeirri aga að nota engar raðir gefnar með gervigreind frá höfðinu og staðfesta hverja röð frá frumheimild eins og NCBI / Ensembl

Raðagreining er grundvallarverkefni sameindalíffræðinnar: að lesa DNA streng (eða U í RNA) sem samanstendur af bókstöfunum A, T, G, C, bera hann saman og finna merkingarbær svæði (gen, mótíf, stjórnunarraðir) innan hans. Í þessari einingu muntu læra hvernig á að nota gervigreind (AI) sem félaga til að skrifa kóða og túlka í þessum verkum; en þú munt læra hvers vegna þú ættir alltaf að sannreyna niðurstöðuna með keyranlegum kóða og aðaluppsprettu. Kjarnaverkfærasettið okkar verður Biopython (Python bókasafn skrifað til að vinna með líffræðilegar raðir) og opinber samstillingarverkfæri.

Fyrst viðvörun: LLM getur framleitt villur úr minni, jafnvel stutta röð. Það getur blandað saman staf þegar hann er beðinn um að reikna út öfuga fyllingu röðar beint. Framkvæmdu því aldrei strengjaaðgerðir með því að treysta á textasvörun gervigreindarinnar, heldur með kóðanum sem gervigreindin skrifar og þú keyrir.

Grunnhugtök: hvað vinnum við með?

  • Basapör (bp): Bókstafareining DNA. Erfðamengi mannsins er um það bil 3,2 milljarðar bp.
  • Þráður: DNA er tvöfaldur helix; Þræðir tveir eru andviðbót hvors annars. Það skiptir máli í hvaða þræði afbrigði er lýst yfir.
  • Codon: Hópur þriggja basa; hver kódon samsvarar amínósýru (byggingarefni próteins). Til dæmis er ATG venjulega upphafskódon (meþíónín).
  • Opinn lestrarrammi (ORF): Röðsvæðið sem getur kóðað fyrir prótein, sem nær frá upphafskódonnum til stöðvunarkódonsins (TAA, TAG, TGA).
  • Mótíf: Endurtekið stutt röð mynstur sem hefur ákveðna virkni; til dæmis svæðið sem umritunarþáttur binst við.
  • Alignment: Að raða tveimur eða fleiri röðum hverri undir aðra til að sjá líkindi þeirra.

Skref fyrir skref: verkflæði raðgreiningar

1. Fáðu seríuna frá áreiðanlegum heimildum. Ekki láta gervigreindina segja „minna“ á röðina; Sæktu það sem FASTA (venjulegt textasnið sem geymir raðir) frá uppruna eins og NCBI, Ensembl, osfrv. og gefðu gervigreindinni þessa röð.

2. Láttu viðskiptin gera með kóða. Láttu aðgerðir eins og öfugt viðlið, umritun (DNA→RNA), þýðingar (RNA→prótein), GC hlutfall gera með Biopython kóða og keyrðu kóðann sjálfur.

3. Athugaðu ramma- og þráðaforsendur. Biddu hann/hana að tilgreina greinilega í athugasemdarlínunni hvaða þráð og í hvaða lesramma kóðinn er í gangi.

4. Berðu niðurstöðuna saman við þekkta tilvísun. Passaðu próteinið eða ORF sem þú framleiddir við þekkta skráningu í gagnagrunninum. Lengd og upphafsmisræmi fanga algengustu villurnar.

5. Staðfestu röðun með opinberu tóli. Ekki láta gervigreindina „augakast“ líkjast tveimur seríum; Fáðu tölulega einkunn með BLAST (sequence similarity search tool) eða jöfnunarsafni.

Ábending: Láttu alltaf strengjalengd vera fyrsta ávísun þína. Fjöldi amínósýra próteins er um það bil þriðjungur af fjölda basa í kóðaröðinni (að undanskildum stöðvunarkódonnum). Ef lengdin passar ekki er ramminn eða þráðurinn rangur.

þrjú smámál

Tilvik 1 — Öfugt viðbótarvilla. Nemandi spurði gervigreind um öfugt viðlið 5'-GATTACA-3'; AI gaf „TGTAATC“ (rétt). Hins vegar, í lengri röð 20 basa, sleppti gervigreindinni basa og niðurstaðan var 19 basar. Þegar nemandinn keyrði það með Seq("...").reverse_complement() í Biopython tók það 20 basa og náði villunni. Týndur tími: 2 mínútur.

Tilfelli 2 — Rammaskipti. Rannsakandi lét þýða 900 basa kóðaröð yfir í prótein; AI „las“ 280 amínósýruprótein með texta. Búist var við 299 amínósýrum (900/3 − 1 stopp). Munurinn var sá að gervigreind byrjaði frá öðru núkleótíðinu. Rétt lengd fékkst þegar kóðinn var byrjaður frá fyrsta ramma.

Mál 3 - Staðfesting fengin. Rannsóknafræðingur skoðaði 16S rRNA röð tveggja bakteríustofna með því að spyrja "eru þær eins?" hann spurði AI; „Líklegast það sama,“ sagði gervigreindin. Þegar tæknimaðurinn keyrði BLAST sá hann 97,8% líkt og 12 basamun - mikilvægur munur fyrir mismunun á tegundastigi. Ef ekki væri tölulegt stig væri röng „sama“ niðurstaða færð inn í skýrsluna.

Dæmi: sannanlega Biopython straumur

frá Bio.Seq import Seq# Flytja inn röðina úr FASTA sem þú hleður niður frá NCBI; Ekki láta gervigreindina segja "minntu mig". dna = Seq("ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG")print("Lengd (bp):", len(dna))print("GC hlutfall (%):", round(100 * (dna.count("G") + dna.count("C")) / len(dna), 1))print("Þýðing)(compnalement)" rammi 1; upp til að stöðva codonprotein = dna.translate(to_stop=True)print("Prótein:", prótein, "| Lengd (mm):", len(prótein))

Jafnvel þó að gervigreindin skrifi þennan kóða, sérðu nákvæmni úttaksins með því að keyra hann. Lengd, GC hlutfall og prótein eru sambærileg við þekkta tilvísun.

Fjögur afritanleg sniðmát

1) Sannanleg fylkisaðgerð:

Skrifaðu keyranlegan Biopython kóða fyrir eftirfarandi FASTA röð: [röð/verkefni]. Reiknaðu lengdina, GC hlutfallið, öfugt viðlag og þýðingu úr ramma 1. Gerðu athugasemd við hvaða þráð og ramma er gert ráð fyrir. Ekki framleiða röðina; Notaðu bara röðina sem ég gaf þér.

2) ORF skimun:

Skrifaðu Python kóða sem finnur alla opna lestrarramma í tiltekinni röð (og alla þrjá á valfrjálsa öfuga strengnum). Tilkynntu upphafsstöðu, lengd og þýtt prótein fyrir hvern ORF. Merktu einnig við lengsta ORF.

3) Staðfesting á jöfnun:

Mig langar að bera saman tvær fylkingar. "Svipað?" Ekki dæma eftir augum; skrifaðu pöraðan jöfnunarkóða og tilkynntu líktaprósentuna og mismunatöluna tölulega. Heimild: [röð 1], [röð 2].

4) Mótífleit:

Leitaðu að eftirfarandi myndefni (einnig sem reglulegri tjáningu) í tilteknum streng: [mótíf]. Skráðu staðsetningu (miðað við 1) allra leikja. Skrifaðu og tilgreindu líka samsvörun sem skarast.

Veik kvaðning / Sterk kvaðning

Veik: "Skrifaðu próteinið í þessari röð: ATGGCC..."

Vandamál: gervigreind þýðir með texta, getur ruglað ramma/þræði, getur ekki staðfest lengd.

Strong: "Skrifaðu keyranlegan Biopython kóða sem þýðir eftirfarandi röð úr ramma 1, segir frá lengd og stoppkódon; ekki breyta röðinni, notaðu bara þann sem ég gaf: ATGGCC..."

Af hverju það er öflugt: Vinnsla fer fram í kóða, rammi er skýr, hægt er að sannreyna úttak með tölulegum hætti.

Leit

röng nálgun

rétt nálgun

öfug viðbót

Leyfðu gervigreind að skrifa með texta

Biopython reverse_complement()

þýðing

Láttu gervigreind þýða úr minni

Kóði, sem tilgreinir ramma

líkindi

"Svipað?" augnákvörðun

BLAST/alignment stig

mótíf

Láttu gervigreindina telja með höndunum

Kóði, með staðsetningarlista

Fylkisuppspretta

Láttu AI muna

FASTA frá NCBI/Ensembl

Algeng mistök

  • Ekki tilgreint umgjörðina. Þýðing frá röngum ramma gefur stutt eða gallað prótein.
  • Flækja garnið. Afbrigðið eða mótífið getur verið í öfugum þræði; þráður forsenda ætti að vera skrifuð.
  • Að láta gervigreindina leggja röðina á minnið. LLM getur ekki framleitt langan streng án villna; Þú gefur alltaf seríuna.
  • Miðað við auga fyrir líkt. Ekki segja "sama/svipað" án tölulegrar einkunnar.
  • RNA/DNA blanda. Að blanda U við T truflar þýðingu; skýra inntakstegundina.
Varúð: Jafnvel hátt hlutfall líkt í BLAST og svipuðum verkfærum þýðir ekki endilega líffræðilega „samsöm“; E-gildi (líkur líkur) og lengd samræmda svæðisins ætti að meta saman.

Dýpt: að lesa BLAST úttak rétt

Að láta gervigreind túlka BLAST niðurstöðu sparar tíma; En ekki taka neinar ákvarðanir fyrr en þú hefur lesið málin þrjú sjálfur. Hið fyrsta er e-gildið (vænt gildi): áætlaður fjöldi skipta sem þetta stig getur gerst fyrir tilviljun; Mjög lítið gildi eins og 1e-50 þýðir sterkt, gildi eins og 0,1 er næstum hávaði. Annað er umfang fyrirspurna: hvaða prósentu af fyrirspurnaröðinni sem samsvörunin nær yfir; 98% líkindi en aðeins 20% umfang þýðir að lítill hluti röðarinnar er svipaður og villandi. Þriðja er prósent sjálfsmynd. Án þessara þriggja lesna saman sannar hátt hlutfall eitt og sér ekki neitt.

Áþreifanlegt dæmi: Rannsakandi sprengdi brot af geni sem hann var nýbúinn að raðgreina; „99% passa við BRCA2 manna, sama gen,“ sagði gervigreindin. Þegar rannsakandi horfði á úttakið sá hann að þekjan var aðeins 15% - samsvarandi hluti var bara stutt endurtekið svæði af þúsundum basa af BRCA2. Rétt túlkun var ekki „sama gen“ heldur „deilir sameiginlegu endurtekningarmótífi“. Lestur á umfanginu kom í veg fyrir algjöra ranggreiningu.

BLAST dálkur

hvað segir það

gildru

E-gildi

líkur á tilviljun

Ef það er hátt getur samsvörun verið tilgangslaus

Umfjöllun fyrirspurna

Yfirbyggð fyrirspurnarhlutfall

Ef það er lágt er hlutfallið villandi

prósent sjálfsmynd

Samsvarandi grunngengi

eitt og sér er ekki nóg

bitstig

Venjulegur styrkur fyrir jöfnun

Túlkað eftir lengd

5) BLAST úttakstúlkunarsniðmát:

Túlkaðu eftirfarandi BLAST töflu, en ekki ákveða: Taktu saman rafrænt gildi, fyrirspurnarþekju og prósentuauðkenni fyrir hverja línu fyrir sig og tilgreindu hvaða viðmiðunarmörk þarf að uppfylla áður en þú kemst að niðurstöðu eins og "sama gen". Tafla: [líma].

Í stuttu máli

  • Raðaðgerðir (öfug viðbót, þýðing, ORF, GC hlutfall) ætti að gera með kóðanum sem gervigreindin skrifar og þú keyrir, ekki með textasvörun gervigreindarinnar.
  • Forsendur um ramma og þráð ættu alltaf að vera skýrar; Lengdarathugun er fljótlegasta tólið til að grípa villur.
  • Fáðu röðina alltaf frá áreiðanlegum heimildum (NCBI, Ensembl); Ekki láta AI leggja það á minnið.
  • Líkindi og röðun eru metin með opinberum tækjum og tölulegum stigum, ekki með augum.

Umsóknarverkefni

Sæktu stutta kóðaröð frá áreiðanlegum heimildum (t.d. NCBI). Með sniðmátum 1 og 2 hér að ofan, biddu gervigreindina um Biopython kóða, keyrðu kóðann; Berðu saman lengd og röð próteinsins sem þú framleiddir við þekkta skráningu í gagnagrunninum. Ef þú finnur misræmi skaltu reyna að laga það með því að breyta ramma/þráðaforsendu og athugaðu ferlið.

gátlisti

  • [ ] Ég fékk röðina frá áreiðanlegum heimildum, ég hafði ekki gervigreindina til að leggja hana á minnið.
  • [ ] Ég framkvæmdi fylkisaðgerðir með keyranlegum kóða.
  • [ ] Ég hef skýrt tilgreint ramma og þráðarforsendu.
  • [ ] Ég bar saman prótein/ORF lengdina við tilvísunina.
  • [ ] Ég mat líkindin við opinbera tólið og tölulega einkunn.
  • [ ] Ég athugaði RNA/DNA og U/T aðskilnað.