Vienetas 11 / 11

Etika, biologinis saugumas, konfidencialumas ir mokslinis sąžiningumas

Pelnas:

  • Galimybė apsaugoti jautrius žmogaus / genetinius duomenis pagal KVKK, GDPR ir etikos komiteto taisykles ir vengti jų perduoti atviram modeliui
  • Gebėjimas suabejoti rezultatų pagrįstumu, įvertinant biologinio saugumo / dvejopo naudojimo riziką ir gyventojų šališkumą
  • Supratimas, kad etinė atsakomybė negali būti perduota transporto priemonei ir kad būtinas prasmingas žmogus.

Stiprų dirbtinio intelekto panaudojimą biologijoje papildo ir atsakingas jo naudojimas. Biologija yra jautri sritis, liečianti žmonių sveikatą, genetinį privatumą, aplinką ir net biologinį saugumą. Šiame skyriuje aptarsime etines, teisines ir saugumo pareigas, su kuriomis susidursite naudodami dirbtinį intelektą biologiniuose tyrimuose. Šis skyrius yra sistema, sukurta remiantis patikrinimo ir sąžiningumo principais visuose ankstesniuose skyriuose.

Pagrindinis principas: AI yra įrankis; Etinė atsakomybė visada tenka žmonėms. „Pasiūlytas modelis“ nėra pasiteisinimas.

Keturios atsakomybės sritys

1. Duomenų privatumas ir žmonių duomenys

Dalyvių genetiniai, klinikiniai ar sveikatos duomenys yra labai jautrūs. Asmens DNR seka gali atskleisti jo ir jo artimųjų ligų riziką ir tapatybę; Netgi anoniminius genominius duomenis galima identifikuoti iš naujo. Įklijuojant šiuos duomenis į viešai prieinamą AI modelį, gali būti pažeisti duomenų apsaugos įstatymai (KVKK Turkijoje, GDPR Europoje) ir etikos tarybos (IRB / etikos komiteto) patvirtinimai.

  • Neteikite asmeninių / klinikinių duomenų atviram modeliui.
  • Venkite naudoti už sutikimo ribų; Su kuo dalyvis sutiko?
  • Pasirinkite įmonės / vietinius (vietinius) arba duomenų apdorojimo sutarties įrankius.

2. Biologinis saugumas ir dvejopas naudojimas

Dalis biologinės informacijos yra „dvejopo naudojimo“: ji gali būti ir naudinga, ir žalinga; pavyzdžiui, patogenų (ligą sukeliančių) sekos, toksinų gamyba. Prašyti dirbtinio intelekto informacijos apie pavojingų patogenų didinimą arba kenksmingų biologinių veiksnių kūrimą yra neetiška ir daugumoje vietų neteisėta.

  • Neteikite pavojingų dvejopo naudojimo užklausų.
  • Laikykitės savo įstaigos biologinės saugos tarybos (IBC) gairių.

3. Mokslinis sąžiningumas

Čia susijungia viskas, ką matėme ankstesniuose skyriuose: jokio klaidingo priskyrimo, jokio duomenų pagražinimo, jokio p-hackavimo, jokių atrankinių ataskaitų teikimo. Dirbtinis intelektas gali tai palengvinti arba apsunkinti; Skirtumas yra jūsų sąžiningumas.

  • Praneškite apie visus rezultatus (įskaitant neigiamus).
  • Deklaruoti dirbtinio intelekto naudojimą.
  • Palaikykite atkuriamumą bendrindami neapdorotus duomenis ir kodą (jei įmanoma).

4. Šališkumas ir teisingumas

AI modeliai turi duomenų, kuriais remdamiesi jie mokomi, šališkumą. Genominės duomenų bazės daugiausia gaunamos iš Europos kilmės populiacijų; tai lemia blogesnes prognozes kitose populiacijose. Vaizdo modelis gali prastai veikti tokiomis sąlygomis, kurios nepakankamai nurodytos treniruočių duomenyse.

  • Paklauskite, kokia populiacija/duomenimis modelis buvo apmokytas.
  • Įvertinkite, ar rezultatai galioja visose grupėse.
Patarimas: paklauskite savęs: „Jei modeliui duodu šiuos duomenis, kam jie priklauso ir ar tas asmuo davė leidimą? Jei atsakymas neaiškus, neduokite jo. Konfidencialumo pažeidimas yra negrįžtamas.

Žingsnis po žingsnio: atsakinga AI kontrolė

  1. Klasifikuokite duomenų šaltinį: asmeninis / neskelbtinas ar viešas?
  2. Patikrinkite sutikimą ir leidimus: ar šis naudojimas taikomas?
  3. Pasirinkite tinkamą įrankį: Saugi / vietinė aplinka jautriems duomenims.
  4. Apsvarstykite dvigubo naudojimo riziką.
  5. Klausimo šališkumas: ar rezultatas galioja visose grupėse?
  6. Dokumentuoti ir deklaruoti naudojimą.

Kopijuojami raginimo šablonai

Peržiūrėkite toliau pateiktą mano analizės planą etikos požiūriu: nurodykite įspėjimus dėl duomenų konfidencialumo, dalyvio sutikimo, galimo šališkumo ir dvejopo naudojimo rizikos. Planas: [tekstas] (Pastaba: NEdalinuosi faktiniais paciento duomenimis, tik planu.)

Į kokius privatumo ir sutikimo klausimus turėčiau atsakyti prieš naudojant šį genomo duomenų rinkinį? Parengiamas KVKK/BDAR ir etikos komiteto kontrolinis sąrašas.

Kaip savo straipsnio metodų skiltyje turėčiau aiškiai deklaruoti naudojamą dirbtinio intelekto įrankį? Parašykite deklaratyvaus sakinio pavyzdį; kokia informacija (įrankis, versija, naudojimo sritis) turėtų būti joje?

Kaip įvertinti, ar šio modelio rezultatai turi populiacijos šališkumo? Išvardykite klausimus, kuriuos turėčiau užduoti apie treniruočių duomenis ir patikrinimo veiksmus.

Silpnas raginimas / Stiprus raginimas

Silpnas: „Analizuokite šiuos paciento genetinius duomenis: [tikrieji duomenys]“.

Güçlü: "Sudarau analizės planą, kuris veiktų su klinikiniais genominiais duomenimis, tačiau tikrais pacientų duomenimis nesidalinu. Tik iš metodologinės perspektyvos: kokių konfidencialumo priemonių turėčiau imtis, kokioje aplinkoje turėčiau apdoroti duomenis, kokias patvirtinimo ir etikos komiteto sąlygas turėčiau atitikti? Srauto srautą galite parodyti fiktyviais/pavyzdiniais duomenimis."

Skirtumas: naudojant galingą raginimą nebendrinami jokie faktiniai neskelbtini duomenys; Klausiama tik metodo. Privatumas išlaikomas, modelis vis tiek padeda.

trys mini dėklai

1 atvejis – privatumo pažeidimas: tyrėjas įklijavo anoniminius paciento egzemos duomenis į atvirą modelį, kad galėtų juos išanalizuoti. Kai apie tai sužinojo etikos komitetas, tyrimas buvo sustabdytas; Duomenų tvarkymo sutarties nebuvo. Pamoka: jautrūs duomenys niekada nepatenka į atvirą modelį.

2 atvejis. Populiacijos šališkumas. Poligeninės rizikos balų įrankis buvo parengtas remiantis Europos kilmės duomenimis; Kitoje populiacijoje rizikos įvertinimai buvo labai netikslūs. Kai modelis pasiūlė suabejoti mokymo duomenų sudėtimi, komanda nusprendė nenaudoti įrankio toje populiacijoje. Pamoka: šališkumas gelbsti arba kenkia gyvybei.

3 atvejis. Atskleidimas ir skaidrumas: komanda parašė duomenų valymo kodą naudodama AI ir tai aiškiai nurodė metodo skyriuje; Jis taip pat pasidalino kodu. Apžvalgininkai tai palankiai įvertino, nes pakartojamumas buvo stiprus. Pamoka: skaidrumas skatina pasitikėjimą.

palyginimo diagrama

plotas

saugus elgesys

rizikingas elgesys

paciento duomenys

Vietinė/saugi aplinka

Įklijuoti į atidarytą modelį

sutikimas

Naudokite pagal taikymo sritį

Neviršykite taikymo srities

Biologinis saugumas

Vengti dvigubo naudojimo

pavojinga paklausa

vientisumas

Pranešti apie visus rezultatus

atrankinės ataskaitos

šališkumas

Paklauskite gyventojų skaičiaus

Taikyti aklai

skaidrumas

Deklaruoti naudojimą

slepiasi

Dažnos klaidos

  • Skelbtinų duomenų suteikimas atviram modeliui: negrįžtamas privatumo pažeidimas.
  • Sutikimo apimties viršijimas: dalyvio neleido naudoti.
  • Šališkumo ignoravimas: rezultatų apibendrinimas visoms grupėms.
  • Naudojimo slėpimas: nedeklaruojamas AI įnašas.
  • „Siūlomas modelis“ gynyba: atsakomybės priskyrimas transporto priemonei.
Atsargiai: atliekant didelių pasekmių biologinį darbą (klinikinis sprendimas, biologinė sauga, žmogaus duomenys) AI išvestis nepakeičia kompetentingo eksperto patikrinimo ir etinės priežiūros; tai tik pagreitina. Didžiausia atsakomybė visada tenka žmogui, taip pat etinės ir mokslinės sprendimo pasekmės.

Aplinka, ekologija ir tradicinės žinios

Etinė atsakomybė neapsiriboja žmonių duomenimis. Taip pat reikia būti atsargiems naudojant dirbtinį intelektą ekologijoje ir gamtosaugos biologijoje. Pavyzdžiui, tikslūs nykstančios rūšies vietos duomenys (kameros spąstų koordinatės) yra jautrūs dėl brakonieriavimo pavojaus; Šių duomenų paskelbimas atviram modeliui arba visuomenei gali pakenkti rūšiai. Panašiai etikos ir teisinės (pvz., Nagojos protokolo) problemos kyla, kai be leidimo naudojamos tradicinės vietinių bendruomenių biologinės žinios (pvz., augalų naudojimas). Prieš naudojant duomenis, „kam ši informacija priklauso ir kam jos atskleidimas nukentėtų? Visada užduokite klausimą.

Žmogaus priežiūra ir galutinis sprendimas

Viso šio modulio esmė susiveda į vieną principą: prasmingą žmogaus priežiūrą. AI pateikia pasiūlymą, rašo juodraštį, parodo modelį; Tačiau biologinis, klinikinis ar etinis sprendimas niekada nėra tiesiogiai pagrįstas modelio rezultatais. Ypač didelės rizikos srityse (diagnozė, gydymas, rūšies išsaugojimo sprendimas, paleidimas) modelio vaidmuo yra ne priimti sprendimus, o paspartinti eksperto apsisprendimą. „Žmogaus kilpoje“ metodas yra ne šūkis, o būtinybė.

Kad ši priežiūra veiktų, vadovas turi būti kompetentingas. Aklas sutikimas („pasakytas modelis, priėmimas“) nėra priežiūra. Tikra priežiūra reikalauja patirties, kuri gali suabejoti rezultatu, pastebėti jos klaidą ir, kai reikia, ją atmesti. Todėl dirbtinis intelektas nepakeičia eksperto; Dėl to ekspertas tampa dar labiau reikalingas. Tas, kuris geriausiai naudojasi transporto priemone, yra tas, kuris geriausiai gali ją valdyti.

Apibendrinant

Atsakingas dirbtinio intelekto naudojimas biologijoje apima keturias sritis: duomenų privatumą (skelbtinų žmonių duomenų apsauga), biologinį saugumą (vengiant dvigubo naudojimo), mokslinį vientisumą (sąžiningas ir išsamus ataskaitų teikimas) ir šališkumo suvokimą (rezultatų galiojimas visose grupėse). Neteikite jautrių duomenų atviram modeliui, skaidriai deklaruokite naudojimą, kvestionuokite gyventojų šališkumą. Etinė atsakomybė niekada negali būti deleguota agentui; Tai visada yra žmonėms.

Taikymo užduotis

Apsvarstykite scenarijų iš savo darbo srities (pvz., naudodami žmogaus duomenų rinkinį arba vaizdo modelį). Leiskite dirbtiniam intelektui sudaryti šio scenarijaus etikos kontrolinį sąrašą (konfidencialumas, sutikimas, šališkumas, dvejopo naudojimo paskirtis, skaidrumas), nesidalijant tikrais duomenimis. Prie kiekvieno elemento pažymėkite jį kaip „tinkamą/rizikingą/neapibrėžtą“ jūsų situacijoje ir parašykite veiksmų planą tiems, kurie rizikingi/neaišku. Taip pat savo straipsniui paruoškite AI naudojimo pareiškimą.

kontrolinis sąrašas

  • [ ] Aš nepateikiau jautrių / asmeninių duomenų atviram modeliui.
  • [ ] Patikrinau sutikimo ir etikos komiteto apimtį.
  • [ ] Įvertinau dvejopo naudojimo / biologinio saugumo riziką.
  • [ ] Sąžiningai pranešiau apie visus rezultatus.
  • [ ] Aš suabejojau gyventojų / duomenų šališkumu.
  • [ ] Skaidriai deklaravau dirbtinio intelekto naudojimą ir prisiėmiau atsakomybę.

Modulio egzaminas

1. Studentas paklausė kalbos modelio „kiek eilučių yra šiame FASTA faile?“. – klausia jis, o modelis atsako „48“. Kuris metodas yra teisingiausias?

  • A) Tiesiogiai naudojant modelio pateiktą skaičių 48; Modelis yra patikimas, nes mato failą
  • B) Dar kartą paklauskite skaičiaus ir priimkite jį kaip teisingą, jei abu atsakymai yra vienodi
  • C) Failo skaitymas naudojant Biopython, sekų su kodu skaičiavimas ir išvesties naudojimas ✔
  • D) Failo atidarymas rankiniu būdu ir skaičiavimas akies sprendimu

Paaiškinimas: Deterministines užduotis, tokias kaip skaičiavimas ir matavimas, reikia palikti paleidžiamam kodui, o ne kalbos modeliui. Modelis „neatsimena“ skaičiaus, jis sukuria tikimybinę reikšmę ir gali būti klaidingas; Skaičiuojant su tokiu įrankiu kaip Biopython gaunami tikslūs ir atkuriami rezultatai.

2. Norite suskaičiuoti ląsteles mikroskopo vaizde ir išmatuoti kiekvienos jų plotą. Koks yra tinkamiausias būdas atlikti šią užduotį?

  • A) Naudodami ekspertų segmentavimo įrankį, pvz., Cellpose / StarDist, ir patikrinkite rezultatą rankiniu būdu ✔
  • B) Įklijuokite vaizdą į bendrosios kalbos modelį ir paklauskite „kiek langelių yra“
  • C) Apibūdinkite vaizdą modeliui ir paprašykite apskaičiuoto skaičiaus
  • D) Pikselių skaičiaus priėmimas kaip langelių skaičius be jokio kalibravimo

Paaiškinimas: Ląstelių segmentavimas ir matavimas yra ne bendrojo kalbos modelio, o specializuotų vaizdo modelių (Cellpose, StarDist), specialiai paruoštų šiai užduočiai, sritis. Kalbos modelis rašo kodą, kuris iškviečia šias priemones; Ekspertinis modelis atlieka matavimus, o biologas patikrina rezultatą.

3. Absolventas prie baigiamojo darbo įvado prideda 8 šaltinius, sudarytus pagal kalbos modelį. Konsultantas nustato, kad 3 iš jų iš viso nėra. Kaip būtų galima išvengti šios situacijos?

  • A) Prašant modelio dar kartą gaminti išteklius
  • B) Pasirinkus tik citatas su DOI (jei yra DOI, tai tikra)
  • C) Sąrašo užklausa nurodant modelį „tinka“
  • D) Nepriklausomai patikrinti kiekvieną citatą PubMed/doi.org ir cituoti tik tuos straipsnius, kuriuos jis perskaitė ✔

Paaiškinimas: bendrosios kalbos modeliai nėra literatūros duomenų bazė; Užuot ieškoję tikrų įrašų, ji „sugeneruoja“ tikroviškai skambančius priskyrimus (išgalvotas priskyrimas). Kiekviena eilutė ir DOI neturėtų būti naudojami be nepriklausomo patikrinimo šaltiniuose, pvz., PubMed/doi.org, ir cituojant tik tuos straipsnius, kurie buvo iš tikrųjų perskaityti.

4. Koks yra galingiausias būdas užtikrinti dirbtinio intelekto surašyto duomenų valymo kodo tikslumą?

  • A) Jei kodas veikia be klaidų, priimkite jį kaip teisingą.
  • B) Rezultato patikrinimas su nedideliu žinomu pavyzdžiu ir lūkesčių patikrinimas su tvirtinimu ✔
  • C) Paklauskite modelio „ar kodas teisingas?“ klausia ir pasitiki atsakymu "taip"
  • D) Paleiskite kodą kelis kartus ir kiekvieną kartą gaukite tą pačią išvestį

Pastaba: vien todėl, kad kodas veikia be klaidų, nereiškia, kad jis teisingas; „Neteisingas kodas veikia be klaidų“ yra pavojingiausia situacija biologijoje. Testavimas su nedideliu mėginiu, kurio rezultatą žinote iš anksto, ir lūkesčių įtraukimas į kodą su tvirtinimu yra stipriausias skydas nuo tylių klaidingų rezultatų.

5. Atliekant RNR-seq analizę, ištirta 20 000 genų ir nustatyta, kad 3 800 genų yra „reikšmingi“, kai p<0,05 be korekcijos. Kokia pagrindinė šios išvados problema?

  • A) Mėginių skaičius yra per didelis, todėl jį reikia sumažinti
  • B) p slenkstis per aukštas, turėjo būti naudojamas 0,10
  • C) nebuvo atlikta daugkartinė palyginimo korekcija (FDR); Yra daug klaidingų teigiamų rezultatų ✔
  • D) Vietoj genų turėjo būti tiriami mėginiai

Paaiškinimas: kai vienu metu tikrinate tūkstančius genų, daugelis genų atrodo „reikšmingi“ atsitiktinai, net jei realaus skirtumo nėra; Tai vadinama daugialypio palyginimo problema. Sprendimas – taikyti FDR (klaidingo aptikimo greičio) korekciją tokiu metodu kaip Benjamini-Hochberg; Pataisius, sąrašas paprastai sumažėja iki dešimčių iki kelių šimtų genų.

6. Geriausias BLAST rezultato atitikmuo E vertė yra 2,0. Ką tai reiškia?

  • A) Sutapimas greičiausiai atsitiktinis; ✔ nėra patikimas atitikmuo
  • B) Sukabinimas yra labai tvirtas; Kuo didesnė el. vertė, tuo geriau
  • C) Seka atitiko 2 %
  • D) Tarp dviejų sekų yra 2 bazių skirtumas

Paaiškinimas: E reikšmė rodo, kad atitikimas bus atsitiktinis; Geriau būti mažam. E-reikšmė, didesnė nei 1, rodo, kad atitikimas greičiausiai yra atsitiktinis. Kad atitiktų patikimumas, paprastai ieškoma labai mažų slenksčių, tokių kaip e < 1e-5.

7. AlphaFold modelyje baltymo galinė sritis rodo žemą pLDDT balą (<50). Kaip reikėtų interpretuoti šį regioną?

  • A) AlphaFold padarė klaidą šiame regione, regionas turėtų būti pašalintas iš analizės
  • B) Ši sritis tikrai yra alfa spiralė
  • C) Modelis yra visiškai nepatikimas, konstrukcija neturėtų būti naudojama
  • D) regionas gali būti netaisyklingas / elastingas; turėtų būti aiškinamas kaip „neaiškus“, o ne „klaidingas“ ✔

Aprašymas: pLDDT yra kiekvienos aminorūgšties vietinis patikimumo balas; Mažesnės nei 50 reikšmės dažnai atspindi tikrai netaisyklingus (lanksčius, nefiksuotus) regionus. Neteisinga automatiškai ištrinti šiuos regionus kaip „klaidingus spėjimus“; Žemas balas turėtų būti suprantamas kaip „neaiškus / lankstus“ ir turi būti įvertinta jo biologinė reikšmė.

8. Tyrėjas praneša ląstelių plotus tik pikseliais, o rezultatai neatitinka literatūros. Kokio žingsnio trūksta?

  • A) Reikėjo suskaičiuoti daugiau ląstelių
  • B) Mastelio kalibravimas (konvertavimas iš pikselių į mikrometrus) nebuvo atliktas, rezultatai nebuvo konvertuoti į fizinius vienetus ✔
  • C) Neteisingai pasirinktas segmentavimo įrankis
  • D) Vaizdo skyra per didelė

Paaiškinimas: skalės kalibravimas (kiek mikrometrų viename pikselyje) yra būtinas norint išgauti fizinį vaizdo dydį. Jei šis veiksmas praleistas, vertės išliks nepalyginamos, priklausomai nuo mikroskopo nustatymo. Plotas turi būti konvertuojamas į fizinius vienetus, pvz., kvadratinius mikrometrus.

9. Mokinys paima 10 audinių mėginių iš vienos pelės ir statistikoje naudoja 'n=10'. Kodėl tai neteisinga?

  • A) 10 pavyzdžių yra per mažai statistikai, reikia mažiausiai 30
  • B) Reikėjo paimti audinių mėginius iš skirtingų organų
  • C) Šie 10 pavyzdžių yra techniniai pakartojimai; biologinis n vis dar yra 1, tai yra vadinamasis pasikartojimas ✔
  • D) Mėginiai negalioja, nes buvo paimti tą pačią dieną

Paaiškinimas: to paties asmens pakartotiniai matavimai yra techniniai pakartojimai; kur statistinis n yra biologinių vienetų skaičius (čia pelės). Techninio pasikartojimo vertinimas kaip biologinis (pseudoreplikacija) suteikia klaidingą reikšmę. Tinkamas dizainas reiškia darbą su keliais asmenimis.

10. Vienos analizės metu nustatyta, kad p=0,03. Kaip teisingai interpretuoti šią vertę?

  • A) Yra 3% tikimybė, kad pamatysite tokį ar daugiau ekstremalių rezultatų, kai iš tikrųjų nėra jokio skirtumo ✔
  • B) Tikimybė, kad poveikis bus tikras, yra 97%
  • C) Tikimybė, kad nulinė hipotezė bus teisinga, yra 3%
  • D) Rezultatas pakartojamas 97 %

Paaiškinimas: p reikšmė nėra „tikimybė, kad hipotezė yra teisinga“ arba „tikimybė, kad poveikis yra teisingas“. P reikšmė yra tikimybė pastebėti skirtumą, didesnį ar didesnį nei pastebėta, kai skirtumo iš tikrųjų nėra. Todėl p=0,03 nereiškia, kad „poveikis yra 97% tikras“; rezultatai taip pat turėtų būti įvertinti pagal poveikio dydį ir pasikliautinąjį intervalą.

11. Pristatyme 3 % skirtumas tarp dviejų grupių parodomas kaip didžiulis, suspaudus y ašį iki 95–100 diapazono. Kas tai yra pavyzdys?

  • A) gera vizualizacijos technika; pabrėžia skirtumą
  • B) Daltonams palankios paletės problema
  • C) priimtinas stiliaus pasirinkimas
  • D) Klaidinanti ir nesąžininga diagrama, kuri padidina skirtumą su nupjauta ašimi ✔

Paaiškinimas: Ašies inicijavimas nuo nulio (sutrumpintos ašies) klaidina žiūrovą, vizualiai padidindamas nedidelį skirtumą. Tai yra sąžiningumo principo pažeidimas; Ypač juostinėse diagramose ašis turėtų prasidėti nuo nulio, o skirtumas turėtų būti rodomas pagal tikrąjį jos dydį.

12. Tyrėjas įklijuoja, jo manymu, anoniminius paciento egzomo duomenis į viešosios kalbos modelį, kad galėtų juos išanalizuoti. Kodėl toks elgesys yra problemiškas?

  • A) nėra problemų; duomenys gali būti bendrinami, jei jie anonimiški
  • B) Skelbtinos paciento duomenų teikimas atviram modeliui yra privatumo ir etikos/teisinės (KVKK/BDAR) pažeidimas ir negali būti atšauktas ✔
  • C) Tai problematiška tik todėl, kad analizė bus lėta
  • D) Modelis yra problemiškas, nes negali suprasti duomenų

Aprašymas: paciento genetiniai/klinikiniai duomenys yra itin jautrūs; Netgi anoniminiais laikomi genominiai duomenys gali būti identifikuoti iš naujo. Šių duomenų pateikimas viešam modeliui pažeidžia KVKK/GDPR ir etikos komiteto (IRB) patvirtinimus ir yra negrįžtamas privatumo pažeidimas. Jautrūs duomenys turėtų būti tvarkomi vietinėje / saugioje, sutartinėje aplinkoje.

13. Viename tyrime skirtumas, kurį jie manė esant „pacientas ir kontrolė“, iš tikrųjų atsirado dėl to, kad mėginiai buvo apdorojami dviem skirtingomis dienomis. Kaip ši situacija vadinama ir kaip ji sprendžiama?

  • A) Tai pašalinis efektas; taškai turėtų būti ištrinti
  • B) Tai normalizacijos trūkumas; pakanka tik mastelio korekcijos
  • C) Tai partijos efektas; turi būti subalansuotas projektuojant ir įtrauktas į modelį kaip partijos kintamasis ✔
  • D) p-hacking; testą reikia pakeisti

Paaiškinimas: Techninis skirtumas dėl mėginių ėmimo partijos / apdorojimo dienos vadinamas partijos efektu ir gali būti supainiotas su biologiniu skirtumu. Tinkamas būdas yra subalansuoti partijas projektuojant ir įtraukti partijos kintamąjį prie statistinio modelio (pvz., „~partija + sąlyga“), taip atskiriant techninį signalą nuo biologinio signalo.

14. Norite apskaičiuoti DNR sekos GC santykį. Kuris metodas yra teisingas ir kartojamas?

  • A) Išspausdinkite kodą, kuris apskaičiuoja GC greitį su Biopython, paleiskite jį ir naudokite išvestį ✔
  • B) Pateikite modeliui seką ir paprašykite jo žodžiu pasakyti GC normą
  • C) modelio pateikto santykio patvirtinimas kitu modeliu
  • D) Pažvelgti į pirmąsias 100 serijos raidžių ir atspėti iš akies

Paaiškinimas: GC rodiklis yra deterministinis skaičiavimas; turėtų būti pagrįsta kodu, apdorojančiu masyvą, o ne reikšme, kurią kalbos modelis „atsimena“. Užuot apskaičiavę modelį, atspausdinę skaičiavimo kodą tokiu įrankiu kaip „Biopython“ ir paleidę jį patys, gausite tikslią išvestį, kuri kiekvieną kartą paleidus tą patį rezultatą.