Voitot:
- Kyky suojata arkaluonteisia ihmis-/geneettisiä tietoja KVKK:n, GDPR:n ja eettisten toimikuntien sääntöjen mukaisesti ja välttää niiden luovuttamista avoimeen malliin
- Kyky kyseenalaistaa tulosten oikeellisuus arvioimalla bioturvallisuuden/kaksoiskäytön riskejä ja väestön harhaa
- Ymmärtäminen, että eettistä vastuuta ei voida siirtää ajoneuvolle ja että mielekäs ihmissilmukka on välttämätön
Tekoälyn vahvaa käyttöä biologiassa täydentää sen vastuullinen käyttö. Biologia on herkkä ala, joka koskettaa ihmisten terveyttä, geneettistä yksityisyyttä, ympäristöä ja jopa bioturvallisuutta. Tässä osiossa keskustelemme eettisistä, oikeudellisista ja turvallisuusvastuista, joita kohtaat käyttäessäsi tekoälyä biologisissa tutkimuksissa. Tämä yksikkö on kehys, joka on rakennettu kaikkien aiempien yksiköiden todentamisen ja rehellisyyden periaatteille.
Perusperiaate: AI on työkalu; Eettinen vastuu on aina ihmisellä. "Ehdotettu malli" ei ole tekosyy.
Neljä vastuualuetta
1. Tietosuoja ja ihmistiedot
Ihmisten osallistujien geneettiset, kliiniset tai terveystiedot ovat erittäin arkaluonteisia. Ihmisen DNA-sekvenssi voi paljastaa hänen ja hänen omaistensa sairausriskin ja identiteetin; Jopa anonymisoiduksi ajateltu genominen data voidaan tunnistaa uudelleen. Näiden tietojen liittäminen julkisesti saatavilla olevaan tekoälymalliin saattaa rikkoa tietosuojalakeja (KVKK Turkissa, GDPR Euroopassa) ja eettisen lautakunnan (IRB/eettinen komitea) hyväksyntää.
- Älä anna henkilökohtaisia/kliinisiä tietoja avoimeen malliin.
- Vältä käyttöä suostumuksen puitteissa; Mihin osallistuja suostui?
- Valitse yritys/paikallinen (paikallinen) tai tietojenkäsittelysopimustyökalut.
2. Bioturvallisuus ja kaksoiskäyttö
Jotkut biologiset tiedot ovat "kaksikäyttöisiä": se voi olla sekä hyödyllistä että haitallista; esimerkiksi patogeenien (sairautta aiheuttavat) sekvenssit, toksiinien tuotanto. Tietojen pyytäminen tekoälyltä vaarallisten patogeenien lisäämisestä tai haitallisten biologisten tekijöiden suunnittelusta on epäeettistä ja laitonta useimmissa paikoissa.
- Älä tee vaarallisia kaksikäyttöpyyntöjä.
- Noudata oppilaitoksesi bioturvallisuuslautakunnan (IBC) ohjeita.
3. Tieteellinen rehellisyys
Kaikki, mitä olemme nähneet aiemmissa yksiköissä, yhdistyy tähän: ei harhaanjohtamista, ei tietojen kaunistamista, ei p-hakkerointia, ei valikoivaa raportointia. Tekoäly voi tehdä niistä helpompaa tai vaikeampaa; Ero on rehellisyydessäsi.
- Ilmoita kaikki tulokset (myös negatiiviset).
- Ilmoita tekoälyn käytöstä.
- Tue toistettavuutta jakamalla raakadataa ja koodia (jos mahdollista).
4. Bias ja oikeudenmukaisuus
Tekoälymallit sisältävät harhoja datassa, jonka perusteella ne on koulutettu. Genomitietokannat tulevat pääasiassa eurooppalaisista populaatioista; tämä johtaa huonompiin ennusteisiin muissa populaatioissa. Kuvamalli voi toimia huonosti olosuhteissa, jotka ovat aliedustettuina harjoitustiedoissa.
- Kysy mihin populaatioon/tietoihin mallia koulutettiin.
- Arvioi, pätevätkö tulokset kaikissa ryhmissä.
Vinkki: Kysy itseltäsi: "Jos annan nämä tiedot mallille, kenelle se kuuluu ja onko kyseinen henkilö antanut luvan?" Jos vastaus on epämääräinen, älä anna sitä. Luottamuksellisuuden loukkaus on peruuttamaton.
Askel askeleelta: vastuullinen AI-hallinta
- Luokittele tietolähde: henkilökohtainen/arkaluonteinen vai julkinen?
- Tarkista suostumus ja luvat: Onko tämä käyttö katettu?
- Valitse oikea työkalu: Suojattu/alkuperäinen ympäristö arkaluontoisille tiedoille.
- Harkitse kaksinkertaisen käytön riskiä.
- Kysymysharha: Onko tulos voimassa kaikissa ryhmissä?
- Dokumentoi ja ilmoita käyttö.
Kopioitavat kehotemallit
Tarkista alla oleva analyysisuunnitelmani eettisestä näkökulmasta: luettele tietojen luottamuksellisuutta, osallistujan suostumusta, mahdollista harhaa ja kaksoiskäytön riskiä koskevat varoitukset. Suunnitelma: [teksti] (Huomaa: EN jaa todellisia potilastietoja, vain suunnitelmaa.)
Mihin tietosuoja- ja suostumuskysymyksiin minun pitäisi vastata ennen tämän genomitietojoukon käyttöä? Muistilista on laadittu KVKK/GDPR:n ja eettisen komitean osalta.
Kuinka minun pitäisi ilmoittaa avoimesti käyttämäni tekoälytyökalu artikkelini menetelmäosiossa? Kirjoita esimerkkilause; mitä tietoja (työkalu, versio, käyttöalue) sen tulisi sisältää?
Kuinka arvioin, onko tämän mallin tuloksissa populaatioharha? Listaa kysymykset, jotka minun pitäisi kysyä harjoitustiedoista ja tarkistusvaiheista.
Heikko kehote / Vahva kehote
Heikko: "Analysoi seuraavan potilaan geneettiset tiedot: [todelliset tiedot]."
Güçlü: "Olen tekemässä analyysisuunnitelmaa, joka toimii kliinisen genomitiedon kanssa, mutta en jaa todellista potilasdataa. Vain metodologisesta näkökulmasta: mihin luottamuksellisuustoimenpiteisiin minun tulee ryhtyä, missä ympäristössä tietoja tulee käsitellä, mitkä hyväksyntä- ja eettisen komitean ehdot minun tulee täyttää? Voit näyttää kulkua vale-/näytedatalla."
Ero: Tehokas kehote ei jaa varsinaisia arkaluonteisia tietoja. Vain menetelmää kysytään. Yksityisyys säilyy, malli auttaa silti.
kolme minilaukkua
Tapaus 1 – Yksityisyyden loukkaus: Tutkija liitti hänen mielestään nimettömät potilastiedot avoimeen malliin analysoitavaksi. Kun eettinen komitea sai tietää tästä, tutkimus keskeytettiin; Tietojenkäsittelysopimusta ei ollut. Oppitunti: arkaluonteiset tiedot eivät koskaan pääse avoimeen malliin.
Tapaus 2 – Populaatioharha: Monigeenisen riskin pisteytystyökalu koulutettiin eurooppalaista alkuperää oleviin tietoihin. Toisessa populaatiossa riskiarviot olivat merkittävästi epätarkkoja. Kun malli ehdotti kyseenalaistamaan harjoitustietojen koostumuksen, ryhmä päätti olla käyttämättä työkalua kyseisessä populaatiossa. Oppitunti: puolueettomuus pelastaa tai vahingoittaa ihmishenkiä.
Tapaus 3 – Tietojen paljastaminen ja läpinäkyvyys: Ryhmä kirjoitti tietojen puhdistuskoodin tekoälyllä ja ilmaisi tämän selkeästi menetelmäosiossa; Hän jakoi myös koodin. Arvostelijat pitivät tätä myönteisenä, koska toistettavuus oli vahvaa. Oppitunti: avoimuus lisää luottamusta.
vertailukaavio
alueella
turvallista käytöstä
riskialtista käytöstä
potilastiedot
Paikallinen/turvallinen ympäristö
Liitä avoimeen malliin
suostumus
Käytä soveltamisalan puitteissa
Älä ylitä soveltamisalaa
Bioturvallisuus
Vältä kaksoiskäyttöä
vaarallinen kysyntä
eheys
Ilmoita kaikki tulokset
valikoiva raportointi
harhaa
Kysy väestöstä
Levitä sokeasti
läpinäkyvyys
Ilmoita käyttö
piilossa
Yleisiä virheitä
- Arkaluonteisten tietojen antaminen avoimelle mallille: Peruuttamaton tietosuojaloukkaus.
- Suostumuksen laajuuden ylittäminen: Osallistujan valtuuttamaton käyttö.
- Biasin huomioiminen: Tulosten yleistäminen kaikkiin ryhmiin.
- Käytön piilottaminen: Ei ilmoiteta tekoälyn panosta.
- "Mallista ehdotettu" -puolustus: Vastuun osoittaminen ajoneuvolle.
Varoitus: Vaikuttavassa biologisessa työssä (kliininen päätös, bioturvallisuus, ihmistiedot) AI-tulostus ei korvaa pätevää asiantuntijatarkastusta ja eettistä valvontaa. se vain nopeuttaa sitä. Lopullinen vastuu on aina ihmisellä, samoin kuin päätöksen eettiset ja tieteelliset seuraukset.
Ympäristö, ekologia ja perinteinen tieto
Eettinen vastuu ei rajoitu ihmistietoihin. Varovaisuutta tarvitaan myös käytettäessä tekoälyä ekologiassa ja luonnonsuojelubiologiassa. Esimerkiksi uhanalaisen lajin tarkat sijaintitiedot (kameran ansakoordinaatit) ovat arkaluonteisia salametsästysriskin vuoksi; Näiden tietojen luovuttaminen avoimelle mallille tai yleisölle voi vahingoittaa lajia. Samoin eettisiä ja oikeudellisia kysymyksiä (kuten Nagoyan pöytäkirja) syntyy, kun paikallisten yhteisöjen perinteistä biologista tietoa (esim. kasvin käyttöä) käytetään luvatta. Ennen tietojen käyttöä "kenelle nämä tiedot kuuluvat ja kenelle niiden paljastaminen vahingoittaisi?" Kysy aina kysymys.
Ihmisvalvonta ja lopullinen päätös
Tämän koko moduulin ydin tiivistyy yhteen periaatteeseen: mielekkääseen inhimilliseen valvontaan. AI tuottaa ehdotuksen, kirjoittaa luonnoksen, näyttää mallin; Mutta biologinen, kliininen tai eettinen päätös ei koskaan perustu suoraan mallitulokseen. Varsinkin riskialueilla (diagnoosi, hoito, lajien suojelupäätös, vapauttaminen) mallin tehtävänä ei ole tehdä päätöksiä, vaan nopeuttaa asiantuntijan päätöstä. "Ihminen silmukassa" ei ole iskulause, vaan välttämättömyys.
Jotta tämä valvonta toimisi, esimiehen on oltava pätevä. Sokea suostumus ("malli sanottu, hyväksyminen") ei ole valvontaa. Todellinen valvonta vaatii asiantuntemusta, joka voi kyseenalaistaa tuotoksen, havaita sen virheen ja hylätä sen tarvittaessa. Siksi tekoäly ei korvaa asiantuntijaa; Se tekee asiantuntijasta entistäkin välttämättömämmän. Se, joka käyttää ajoneuvoa parhaiten, hallitsee sitä parhaiten.
Yhteenvetona
Tekoälyn vastuullinen käyttö biologiassa kattaa neljä aluetta: tietosuoja (arkaluonteisten ihmistietojen suojaaminen), bioturvallisuus (kaksinkertaisen käytön välttäminen), tieteellinen eheys (rehellinen ja täydellinen raportointi) ja harhatietoisuus (tulosten pätevyys kaikissa ryhmissä). Älä anna arkaluonteisia tietoja avoimeen malliin, ilmoita käyttö avoimesti, kyseenalaista populaatioharha. Eettistä vastuuta ei voida koskaan siirtää agentille; Se on aina ihmisissä.
Sovellustehtävä
Harkitse skenaariota omasta työtilastasi (esim. käyttämällä ihmisen tietojoukkoa tai kuvamallia). Pyydä tekoälyä laatimaan tämän skenaarion eettinen tarkistuslista (luottamuksellisuus, suostumus, harha, kaksoiskäyttö, läpinäkyvyys) jakamatta todellista dataa. Merkitse jokaisen kohteen kohdalla "sopiva/riskillinen/epävarma" ja kirjoita toimintasuunnitelma riskialttiille/epävarmoille. Laadi artikkelillesi myös tekoälyn käyttöä koskeva lausunto.
tarkistuslista
- [ ] En toimittanut arkaluonteisia/henkilökohtaisia tietoja avoimeen malliin.
- [ ] Tarkistin suostumuksen laajuuden ja eettisen toimikunnan.
- [ ] Olen arvioinut kaksikäyttö-/bioturvallisuusriskin.
- [ ] Raportoin kaikki tulokset rehellisesti.
- [ ] Kyseenalaistan väestön/tietoharhan.
- [ ] Olen avoimesti ilmoittanut tekoälyn käytöstä ja ottanut vastuun.
Moduulin tentti
1. Opiskelija kysyi kielimallilta "kuinka monta merkkijonoa tässä FASTA-tiedostossa on?" hän kysyy ja malli vastaa "48". Mikä on oikea lähestymistapa?
- A) Käytä suoraan mallin antamaa numeroa 48; Malli on luotettava, koska se näkee tiedoston
- B) Kysy numero uudelleen ja hyväksy se oikeaksi, jos molemmat vastaukset ovat samat
- C) Tiedoston lukeminen Biopythonilla, sekvenssien lukumäärän laskeminen koodilla ja tulosteen käyttäminen ✔
- D) Tiedoston avaaminen manuaalisesti ja laskeminen silmäpäätöksellä
Selitys: Deterministiset tehtävät, kuten laskenta ja mittaus, tulee jättää suorittamasi koodin, ei kielimallin, tehtäväksi. Malli ei "muista" numeroa, se tuottaa todennäköisyysarvon ja saattaa erehtyä; Laskeminen Biopythonin kaltaisella työkalulla antaa tarkat ja toistettavat tulokset.
2. Haluat laskea solut mikroskooppikuvassa ja mitata kunkin alueen. Mikä on sopivin lähestymistapa tähän tehtävään?
- A) Käytä asiantuntevaa segmentointityökalua, kuten Cellpose/StarDist, ja tarkista tulos manuaalisesti ✔
- B) Liitä kuva yleiseen kielimalliin ja kysy "kuinka monta solua siellä on"
- C) Kuvaile kuva mallille ja kysy arvioitu määrä
- D) Pikselien lukumäärän hyväksyminen solujen lukumääränä ilman kalibrointia
Selitys: Solujen segmentointi ja mittaus eivät kuulu yleisen kielimallin, vaan tähän tehtävään erityisesti koulutettujen kuvamallien (Cellpose, StarDist) ala. Kielimalli kirjoittaa koodin, joka kutsuu näitä työkaluja; Asiantuntijamalli tekee mittauksen ja biologi tarkistaa tuloksen.
3. Jatko-opiskelija lisää opinnäytetyössään 8 kielimallin tuottamaa lähdettä. Konsultti havaitsee, että kolmea näistä ei ole ollenkaan. Miten tämä tilanne voitaisiin estää?
- A) Pyydä mallia tuottamaan resursseja vielä kerran
- B) Valitsemalla vain lainaukset, joissa on DOI (jos on DOI, se on todellinen)
- C) Listan pyytäminen ohjeistamalla mallia "sopimaan"
- D) Tarkistaa itsenäisesti jokaisen lainauksen PubMed/doi.orgissa ja lainaa vain lukemiaan artikkeleita ✔
Selitys: Yleiset kielimallit eivät ole kirjallisuustietokanta; Sen sijaan, että etsittäisiin oikeita tietueita, se "luo" realistiselta kuulostavia määrityksiä (fabricated attribution). Jokaista sivuriviä ja DOI:ta ei tulisi käyttää ilman riippumatonta vahvistusta lähteissä, kuten PubMed/doi.org, ja vain lainaamalla artikkeleita, jotka on todella luettu.
4. Mikä on tehokkain tapa varmistaa tekoälyn kirjoittaman tiedonpuhdistuskoodin tarkkuus?
- A) Jos koodi toimii ilman virheitä, hyväksy se oikeaksi.
- B) Testaa tulos pienellä tunnetulla näytteellä ja todenna odotus väitteellä ✔
- C) Kysy mallilta "onko koodi oikein?" kysyä ja luottaa vastaukseen "kyllä"
- D) Suorita koodi useita kertoja ja saat sama tulos joka kerta
Huomautus: Se, että koodi toimii ilman virheitä, ei tarkoita, että se on oikea; "Väärä koodi toimii ilman virheitä" on biologian vaarallisin tilanne. Testaus pienellä näytteellä, jonka tuloksen tiedät etukäteen, ja odotuksen upottaminen koodiin assertilla on vahvin suoja hiljaisia vääriä tuloksia vastaan.
5. RNA-seq-analyysissä testataan 20 000 geeniä ja 3 800 geeniä havaitaan "merkittäviksi" p < 0,05 ilman korjausta. Mikä on tämän päätelmän suurin ongelma?
- A) Näytteiden määrä on liian suuri, sitä pitäisi vähentää
- B) p-kynnys on liian korkea, 0,10 olisi pitänyt käyttää
- C) Multiple vertailukorjausta (FDR) ei suoritettu; On monia vääriä positiivisia tuloksia ✔
- D) Näytteet olisi pitänyt testata geenien sijaan
Selitys: Kun testaat tuhansia geenejä samanaikaisesti, monet geenit näyttävät sattumalta "merkittäviltä", vaikka todellista eroa ei olisikaan. Tätä kutsutaan moninkertaisen vertailun ongelmaksi. Ratkaisu on soveltaa FDR-korjausta (false discovery rate) menetelmällä, kuten Benjamini-Hochberg; Korjauksella lista pienenee yleensä kymmeniin tai muutamaan sataan geeniin.
6. BLAST-tuloksen parhaan ottelun E-arvo on 2,0. Mitä tämä tarkoittaa?
- A) Osuma on todennäköisimmin satunnainen; ✔ ei luotettava ottelu
- B) Kytkentä on erittäin vahva; Mitä suurempi e-arvo, sitä parempi
- C) Sarja osui nopeudella 2 %
- D) Näiden kahden sekvenssin välillä on 2 emäksen ero
Selitys: E-arvo ilmaisee, että vastaavuuden odotetaan olevan satunnainen; On parempi olla pieni. Jos e-arvo on suurempi kuin 1, vastaavuus on todennäköisimmin satunnainen. Luotettavia osumia varten etsitään yleensä hyvin pieniä kynnysarvoja, kuten e < 1e-5.
7. AlphaFold-mallissa proteiinin terminaalisella alueella on alhainen pLDDT-pistemäärä (<50). Miten tämä alue pitäisi tulkita?
- A) AlphaFold teki virheen tällä alueella, alue tulisi poistaa analyysistä
- B) Tämä alue on ehdottomasti alfaheliksi
- C) Malli on täysin epäluotettava, rakennetta ei pidä käyttää
- D) Alue on todennäköisesti epäsäännöllinen/elastinen; tulee tulkita "epäselväksi" eikä "epäselväksi" ✔
Kuvaus: pLDDT on kunkin aminohapon paikallinen luottamuspistemäärä; Arvot alle 50 kuvastavat usein todella epäsäännöllisiä (joustavia, ei-kiinteitä) alueita. On väärin poistaa nämä alueet automaattisesti "väärinä arvauksina". Matala pistemäärä tulee lukea "epävarmaksi/joustavaksi" ja sen biologinen merkitys tulee arvioida.
8. Tutkija raportoi solualueet vain pikseleinä ja tulokset ovat ristiriidassa kirjallisuuden kanssa. Mikä puuttuu askel?
- A) Enemmän soluja olisi pitänyt laskea
- B) Asteikkokalibrointia (pikseli-mikrometrimuunnos) ei suoritettu, tuloksia ei muunnettu fyysisiksi yksiköiksi ✔
- C) Segmentointityökalu on valittu väärin
- D) Kuvan resoluutio on liian korkea
Selitys: Asteikkokalibrointi (kuinka monta mikrometriä pikseliä kohden) on välttämätöntä fyysisen koon erottamiseksi kuvasta. Jos tämä vaihe ohitetaan, arvot eivät ole vertailukelpoisia mikroskoopin asetuksista riippuen. Pinta-alat on muutettava fyysisiksi yksiköiksi, kuten neliömikrometreiksi.
9. Opiskelija ottaa 10 kudosnäytettä yhdestä hiirestä ja käyttää 'n=10' tilastoissa. Miksi tämä on väärin?
- A) 10 näytettä on liian vähän tilastoihin, vähintään 30 tarvitaan
- B) Kudosnäytteitä piti ottaa eri elimistä
- C) Nämä 10 esimerkkiä ovat teknisiä toistoja; biologinen n on edelleen 1, tämä on niin sanottu toisto ✔
- D) Näytteet ovat virheellisiä, koska ne on otettu samana päivänä
Selitys: Samasta henkilöstä tehdyt toistuvat mittaukset ovat teknisiä toistoja; jossa tilastollinen n on biologisten yksiköiden lukumäärä (tässä hiiret). Teknisen toiston pitäminen biologisena (pseudoreplikaatio) tuottaa väärän merkityksen. Oikea suunnittelu tarkoittaa työskentelyä useiden ihmisten kanssa.
10. Yhdessä analyysissä havaittiin p = 0,03. Mikä on tämän arvon oikea tulkinta?
- A) On 3% mahdollisuus nähdä tämä tai äärimmäisempi tulos, vaikka todellisuudessa eroa ei ole ✔
- B) Todennäköisyys, että vaikutus on todellinen, on 97%
- C) Nollahypoteesin todennäköisyys on 3 %
- D) Tulos on 97 % toistettava
Selitys: p-arvo ei ole 'todennäköisyys, että hypoteesi on totta' tai 'todennäköisyys, että vaikutus on tosi'. P-arvo on todennäköisyys nähdä ero äärimmäisemmäksi tai äärimmäisemmäksi kuin havaittu, kun eroa ei todellisuudessa ole. Siksi p=0,03 ei tarkoita 'vaikutus on 97 % todellinen'; tulokset tulisi myös arvioida vaikutuksen koon ja luottamusvälin perusteella.
11. Esityksessä 3 % ero kahden ryhmän välillä näkyy valtavana puristamalla y-akseli 95-100 alueelle. Mistä tämä on esimerkki?
- A) hyvä visualisointitekniikka; korostaa eroa
- B) Värisokeaystävällinen palettiongelma
- C) Hyväksyttävä tyylivalinta
- D) Harhaanjohtava ja epärehellinen kaavio, joka liioittelee eroa katkaistun akselin kanssa ✔
Selitys: Jos akselia ei alustata nollasta (katkaistu akseli), se johtaa katsojaa harhaan liioittelemalla visuaalisesti pientä eroa. Tämä rikkoo rehellisyyden periaatetta; Erityisesti pylväskaavioissa akselin tulee alkaa nollasta ja ero tulee näyttää todellisella koolla.
12. Tutkija liittää hänen mielestään anonyymiä potilaan eksomedataa julkiseen kielimalliin analysoitavaksi. Miksi tämä käyttäytyminen on ongelmallista?
- A) Ei ole ongelmaa; tiedot voidaan jakaa, jos ne ovat anonyymejä
- B) Arkaluonteisten potilastietojen antaminen avoimeen malliin rikkoo yksityisyyttä ja eettistä/lakia (KVKK/GDPR), eikä sitä voida peruuttaa ✔
- C) Se on ongelmallista vain siksi, että analyysi tulee olemaan hidasta
- D) Malli on ongelmallinen, koska se ei ymmärrä dataa
Kuvaus: Potilaan geneettiset/kliiniset tiedot ovat erittäin herkkiä; Jopa anonyymeiksi uskotut genomitiedot voidaan tunnistaa uudelleen. Näiden tietojen toimittaminen julkiseen malliin rikkoo KVKK/GDPR:n ja eettisen komitean (IRB) hyväksyntää ja on peruuttamaton yksityisyyden loukkaus. Arkaluonteisia tietoja tulee käsitellä paikallisissa/suojatuissa, sopimusympäristöissä.
13. Yhdessä tutkimuksessa ero, jonka he ajattelivat olevan "potilas vs kontrolli", johtui itse asiassa siitä, että näytteitä käsiteltiin kahtena eri päivänä. Millä nimellä tätä tilannetta kutsutaan ja miten se hoidetaan?
- A) Se on outlier-vaikutus; pisteet tulee poistaa
- B) Se on normalisoinnin puute; vain asteikon korjaus riittää
- C) Se on erävaikutus; tulee tasapainottaa suunnittelussa ja lisätä malliin erämuuttujana ✔
- D) p-hakkerointi; testiä pitäisi muuttaa
Selitys: Näytteenottoerästä/käsittelypäivästä johtuvaa teknistä eroa kutsutaan erävaikutukseksi ja se voidaan sekoittaa biologiseen eroon. Oikea lähestymistapa on tasapainottaa erät suunnittelussa ja lisätä erämuuttuja tilastolliseen malliin (esim. '~erä + kunto'), jolloin tekninen signaali erotetaan biologisesta signaalista.
14. Haluat laskea DNA-sekvenssin GC-suhteen. Mikä on oikea ja toistettava lähestymistapa?
- A) Tulosta koodi, joka laskee GC-nopeuden Biopythonilla, suorita se ja käytä tulostetta ✔
- B) Anna mallille järjestys ja pyydä sitä kertomaan suullisesti GC-nopeus
- C) Mallin antaman suhteen vahvistaminen toisella mallilla
- D) Sarjan 100 ensimmäisen kirjaimen katsominen ja silmän arvaaminen
Selitys: GC-nopeus on deterministinen laskelma; pitäisi perustua koodiin, joka käsittelee taulukon, ei arvoon, jonka kielimalli "muistaa". Sen sijaan, että malli laskee sen, laskentakoodin tulostaminen Biopythonin kaltaisella työkalulla ja sen suorittaminen itse antaa tarkan tulosteen, joka antaa saman tuloksen joka kerta, kun suoritat sen.