Vienība 11 / 11

Ētika, bioloģiskā drošība, konfidencialitāte un zinātniskā integritāte

Ieguvumi:

  • Spēja aizsargāt sensitīvus cilvēku/ģenētiskos datus saskaņā ar KVKK, GDPR un ētikas komitejas noteikumiem un izvairīties no to nodošanas atvērtajam modelim
  • Spēja apšaubīt rezultātu derīgumu, novērtējot bioloģiskās drošības/divējāda lietojuma un iedzīvotāju neobjektivitātes riskus
  • Izpratne par to, ka ētisku atbildību nevar deleģēt transportlīdzeklim un ka ir nepieciešams jēgpilns cilvēks.

Mākslīgā intelekta spēcīga izmantošana bioloģijā tiek papildināta ar atbildīgu izmantošanu. Bioloģija ir jutīga joma, kas skar cilvēku veselību, ģenētisko privātumu, vidi un pat bioloģisko drošību. Šajā nodaļā mēs apspriedīsim ētiskos, juridiskos un drošības pienākumus, ar kuriem nāksies saskarties, izmantojot mākslīgo intelektu bioloģiskajos pētījumos. Šī vienība ir sistēma, kas balstīta uz pārbaudes un godīguma principiem visās iepriekšējās vienībās.

Pamatprincips: AI ir instruments; Ētiskā atbildība vienmēr gulstas uz cilvēku. "Ieteiktais modelis" nav attaisnojums.

Četras atbildības jomas

1. Datu privātums un cilvēku dati

Ģenētiskie, klīniskie vai veselības dati no cilvēku dalībniekiem ir ārkārtīgi jutīgi. Cilvēka DNS secība var atklāt viņa un tuvinieku slimības risku un identitāti; Pat genoma datus, kas tiek uzskatīti par anonīmiem, var atkārtoti identificēt. Šo datu ielīmēšana publiski pieejamā AI modelī var pārkāpt datu aizsardzības likumus (KVKK Tirkijā, GDPR Eiropā) un ētikas padomes (IRB/ētikas komitejas) apstiprinājumus.

  • Nesniedziet personiskos/klīniskos datus atvērtajam modelim.
  • Izvairieties no izmantošanas ārpus piekrišanas robežām; Kam dalībnieks piekrita?
  • Izvēlieties uzņēmuma/vietējos (uz vietas) vai datu apstrādes līguma rīkus.

2. Bioloģiskā drošība un divējāda izmantošana

Daļa bioloģiskā informācija ir "divējāda lietošana": tā var būt gan noderīga, gan kaitīga; piemēram, patogēnu (slimību izraisošo) sekvences, toksīnu veidošanās. AI informācijas pieprasīšana par bīstamu patogēnu pastiprināšanu vai kaitīgu bioloģisko aģentu izstrādi ir neētiska un vairumā vietu nelikumīga.

  • Neiesniedziet bīstamus divējāda lietojuma pieprasījumus.
  • Ievērojiet savas iestādes bioloģiskās drošības padomes (IBC) vadlīnijas.

3. Zinātniskā integritāte

Šeit ir apkopots viss, ko esam redzējuši iepriekšējās vienībās: nekādas viltus attiecināšanas, datu uzlabošanas, p-hacking, bez selektīvas atskaites. Mākslīgais intelekts to var padarīt vieglāku vai grūtāku; Atšķirība ir jūsu godīgumā.

  • Ziņojiet par visiem rezultātiem (ieskaitot negatīvos).
  • Deklarē mākslīgā intelekta izmantošanu.
  • Atbalstiet reproducējamību, kopīgojot neapstrādātus datus un kodu (ja iespējams).

4. Neobjektivitāte un godīgums

AI modeļiem ir novirzes datiem, uz kuriem tie tiek apmācīti. Genomikas datu bāzes pārsvarā nāk no Eiropas izcelsmes populācijām; tas noved pie sliktākām prognozēm citās populācijās. Attēla modelis var slikti darboties apstākļos, kas apmācības datos nav atspoguļoti.

  • Pajautājiet, uz kādu populāciju/datiem modelis tika apmācīts.
  • Novērtējiet, vai rezultāti attiecas uz visām grupām.
Padoms. Pajautājiet sev: "Ja es modelim nododu šos datus, kam tie pieder un vai šī persona ir devusi atļauju?" Ja atbilde ir neskaidra, nesniedziet to. Konfidencialitātes pārkāpums ir neatgriezenisks.

Soli pa solim: atbildīga AI kontrole

  1. Klasificēt datu avotu: personisks/sensitīvs vai publisks?
  2. Pārbaudiet piekrišanu un atļaujas: vai šī izmantošana ir ietverta?
  3. Izvēlieties pareizo rīku: droša/vietējā vide sensitīviem datiem.
  4. Apsveriet divējādas lietošanas risku.
  5. Jautājuma novirze: vai rezultāts ir derīgs visās grupās?
  6. Dokumentējiet un deklarējiet izmantošanu.

Kopējamas uzvedņu veidnes

Pārskatiet manu analīzes plānu no ētiskā viedokļa: uzskaitiet brīdinājumus par datu konfidencialitāti, dalībnieka piekrišanu, iespējamo neobjektivitāti un divējādas lietošanas risku. Plāns: [teksts] (Piezīme: ES NEkopīgoju faktiskos pacientu datus, tikai plānu.)

Uz kādiem privātuma un piekrišanas jautājumiem man jāatbild pirms šīs genoma datu kopas? Tiek sagatavots kontrolsaraksts saistībā ar KVKK/GDPR un ētikas komiteju.

Kā mana raksta metožu sadaļā pārredzami deklarēt mākslīgā intelekta rīku, ko izmantoju? Uzrakstiet deklaratīvā teikuma piemēru; kādai informācijai (rīkam, versijai, lietošanas apjomam) tajā jābūt?

Kā novērtēt, vai šī modeļa rezultātos ir iedzīvotāju novirze? Uzskaitiet jautājumus, kas man būtu jāuzdod par apmācības datiem un pārbaudes darbībām.

Vāja uzvedne / spēcīga uzvedne

Vāji: "Analizējiet šādu pacienta ģenētiskos datus: [īstie dati]."

Güçlü: "Es veidoju analīzes plānu, kas darbojas ar klīniskiem genoma datiem, bet es nedalos ar reāliem pacientu datiem. Tikai no metodoloģiskā viedokļa: kādi konfidencialitātes pasākumi man jāveic, kādā vidē man ir jāapstrādā dati, kādi apstiprinājuma un ētikas komitejas nosacījumi man jāievēro? Varat parādīt plūsmu ar fiktīviem / parauga datiem."

Atšķirība: jaudīgajā uzvednē netiek kopīgoti faktiskie sensitīvie dati; Tiek jautāts tikai par metodi. Privātums tiek saglabāts, modelis joprojām palīdz.

trīs mini futrāļi

1. gadījums — privātuma pārkāpums: pētnieks, viņaprāt, anonīmus pacienta eksome datus ielīmēja atvērtā modelī, lai tos analizētu. Kad ētikas komiteja par to uzzināja, pētījums tika apturēts; Līguma par datu apstrādi nebija. Nodarbība: sensitīvi dati nekad neietilpst atvērtajā modelī.

2. gadījums — iedzīvotāju neobjektivitāte: tika apmācīts poligēna riska vērtēšanas rīks par Eiropas izcelsmes datiem; Citā populācijā riska aprēķini bija ievērojami neprecīzi. Kad modelis ierosināja apšaubīt apmācības datu sastāvu, komanda nolēma neizmantot rīku šajā populācijā. Mācība: aizspriedumi glābj vai kaitē dzīvībām.

3. gadījums — izpaušana un pārskatāmība: komanda uzrakstīja datu tīrīšanas kodu ar AI un to skaidri norādīja metodes sadaļā; Viņš arī dalījās ar kodu. Recenzenti to atzinīgi novērtēja, jo atkārtojamība bija spēcīga. Nodarbība: caurspīdīgums vairo uzticību.

salīdzināšanas diagramma

apgabalā

droša uzvedība

riskanta uzvedība

pacienta dati

Vietējā/drošā vide

Ielīmēt atvērtā modelī

piekrišanu

Izmantot darbības jomas ietvaros

Nepārsniedziet darbības jomu

Biodrošība

Izvairīšanās no divkāršas lietošanas

bīstams pieprasījums

integritāte

Ziņojiet par visiem rezultātiem

selektīva ziņošana

neobjektivitāte

Aptaujāt iedzīvotāju skaitu

Piesakies akli

caurspīdīgums

Deklarējiet lietošanu

slēpjas

Biežas kļūdas

  • Sensitīvu datu piešķiršana atvērtajam modelim: neatgriezenisks privātuma pārkāpums.
  • Piekrišanas apjoma pārsniegšana: dalībnieka neatļauta izmantošana.
  • Neobjektivitātes ignorēšana: rezultātu vispārināšana visām grupām.
  • Izmantošanas slēpšana: netiek deklarēts AI ieguldījums.
  • "Ieteiktais modelis" aizstāvība: atbildības attiecināšana uz transportlīdzekli.
Uzmanību! Bioloģiskā darbā ar lielu konsekvenci (klīnisks lēmums, bioloģiskā drošība, dati par cilvēkiem) mākslīgā intelekta izvade neaizstāj kompetentu ekspertu verifikāciju un ētisko uzraudzību; tas to tikai paātrina. Galīgā atbildība vienmēr gulstas uz cilvēku, kā arī lēmuma ētiskās un zinātniskās sekas.

Vide, ekoloģija un tradicionālās zināšanas

Ētiskā atbildība neaprobežojas tikai ar cilvēku datiem. Piesardzība ir nepieciešama arī, izmantojot mākslīgo intelektu ekoloģijā un saglabāšanas bioloģijā. Piemēram, apdraudētas sugas precīzi atrašanās vietas dati (kameras lamatas koordinātas) ir sensitīvi malumedniecības riska dēļ; Šo datu publiskošana atklātam modelim vai sabiedrībai var kaitēt sugai. Tāpat ētiskas un juridiskas problēmas (piemēram, Nagojas protokols) rodas, ja bez atļaujas tiek izmantotas vietējo kopienu tradicionālās bioloģiskās zināšanas (piemēram, auga izmantošana). Pirms datu izmantošanas, "kam pieder šī informācija un kam tās izpaušana nodarītu kaitējumu?" Vienmēr uzdodiet jautājumu.

Cilvēka uzraudzība un galīgais lēmums

Visa šī moduļa būtība ir saistīta ar vienu principu: jēgpilnu cilvēka uzraudzību. AI izstrādā ieteikumu, uzraksta melnrakstu, parāda modeli; Taču bioloģisks, klīnisks vai ētisks lēmums nekad nav tieši balstīts uz modeļa rezultātiem. Īpaši augsta riska zonās (diagnoze, ārstēšana, lēmums par sugu saglabāšanu, atbrīvošana) modeļa loma ir nevis pieņemt lēmumus, bet gan paātrināt eksperta lēmuma pieņemšanu. "Cilvēka cilpā" pieeja nav sauklis, bet gan nepieciešamība.

Lai šī uzraudzība darbotos, vadītājam ir jābūt kompetentam. Aklā piekrišana (“modelis teikts, pieņemšana”) nav pārraudzība. Patiesai uzraudzībai ir vajadzīgas zināšanas, kas var apšaubīt rezultātu, uztvert tās kļūdu un vajadzības gadījumā to noraidīt. Tāpēc mākslīgais intelekts neaizstāj ekspertu; Tas padara ekspertu vēl neaizstājamāku. Tas, kurš vislabāk izmanto transportlīdzekli, ir tas, kurš to vislabāk var kontrolēt.

Rezumējot

Atbildīga mākslīgā intelekta izmantošana bioloģijā aptver četras jomas: datu privātums (sensitīvu cilvēku datu aizsardzība), bioloģiskā drošība (izvairīšanās no dubultas izmantošanas), zinātniskā integritāte (godīga un pilnīga ziņošana) un neobjektivitātes apzināšanās (rezultātu derīgums visās grupās). Nesniedziet atklātajam modelim sensitīvus datus, pārskatāmi deklarējiet lietojumu, apšaubiet iedzīvotāju neobjektivitāti. Ētisko atbildību nekad nevar deleģēt aģentam; Tas vienmēr ir cilvēkos.

Lietojumprogrammas uzdevums

Apsveriet scenāriju no savas darbvietas (piemēram, izmantojot cilvēka datu kopu vai attēla modeli). Lieciet AI izstrādāt šī scenārija ētikas kontrolsarakstu (konfidencialitāte, piekrišana, neobjektivitāte, divējāda izmantošana, pārredzamība), nekoplietojot reālus datus. Katram vienumam atzīmējiet to kā “piemērots/riskants/nenoteikts” jūsu situācijā un uzrakstiet rīcības plānu tiem, kas ir riskanti/nenoteikti. Sagatavojiet savam rakstam arī paziņojumu par mākslīgā intelekta izmantošanu.

kontrolsaraksts

  • [ ] Es nesniedzu sensitīvus/personas datus atvērtajam modelim.
  • [ ] Es pārbaudīju piekrišanas un ētikas komitejas apjomu.
  • [ ] Esmu novērtējis divējāda lietojuma/bioloģiskās drošības risku.
  • [ ] Es godīgi ziņoju par visiem rezultātiem.
  • [ ] Es apšaubīju iedzīvotāju/datu neobjektivitāti.
  • [ ] Esmu pārskatāmi deklarējis mākslīgā intelekta izmantošanu un uzņēmies atbildību.

Moduļa eksāmens

1. Kāds valodas modelim jautāja: "cik virkņu ir šajā FASTA failā?" viņš jautā un modele atbild '48'. Kura ir vispareizākā pieeja?

  • A) Tieši izmantojot modeļa doto skaitli 48; Modelis ir uzticams, jo redz failu
  • B) Pajautājiet skaitli vēlreiz un pieņemiet to kā pareizu, ja abas atbildes ir vienādas
  • C) Faila lasīšana ar Biopython, secību skaita skaitīšana ar kodu un izvades izmantošana ✔
  • D) Faila manuāla atvēršana un skaitīšana ar acu lēmumu

Paskaidrojums. Deterministiski uzdevumi, piemēram, skaitīšana un mērīšana, ir jāatstāj palaist koda, nevis valodas modeļa ziņā. Modelis “neatceras” skaitli, tas rada varbūtības vērtību un var kļūdīties; Skaitīšana ar tādu rīku kā Biopython nodrošina precīzus un reproducējamus rezultātus.

2. Jūs vēlaties saskaitīt šūnas mikroskopa attēlā un izmērīt katras šūnas laukumu. Kāda ir vispiemērotākā pieeja šim uzdevumam?

  • A) Izmantojot ekspertu segmentācijas rīku, piemēram, Cellpose/StarDist, un manuāli pārbaudot rezultātu ✔
  • B) Ielīmējiet attēlu vispārējā valodas modelī un jautājiet "cik šūnu ir"
  • C) Aprakstiet modelim attēlu un pieprasiet aptuveno skaitu
  • D) Pikseļu skaita pieņemšana kā šūnu skaits bez kalibrēšanas

Paskaidrojums: Šūnu segmentēšana un mērīšana nav vispārīgā valodas modeļa, bet gan specializēto attēlu modeļu (Cellpose, StarDist) joma, kas īpaši apmācīti šim uzdevumam. Valodas modelis raksta kodu, kas izsauc šos rīkus; Eksperta modelis veic mērījumus, un biologs pārbauda rezultātu.

3. Maģistrants savam darba ievadam pievieno 8 valodas modeļa radītos avotus. Konsultants atklāj, ka 3 no tiem vispār nepastāv. Kā šo situāciju varētu novērst?

  • A) Pieprasot modelim vēlreiz ražot resursus
  • B) Atlasot tikai citātus ar DOI (ja ir DOI, tas ir reāls)
  • C) saraksta pieprasīšana, norādot modeli, lai tas atbilstu
  • D) Neatkarīgi pārbauda katru citātu vietnē PubMed/doi.org un citē tikai tos rakstus, kurus viņš ir lasījis ✔

Paskaidrojums: Vispārējie valodu modeļi nav literatūras datubāze; Tā vietā, lai meklētu reālus ierakstus, tas “ģenerē” reālistiskus attiecinājumus (fabricated atribution). Katru autorrindu un DOI nedrīkst izmantot bez neatkarīgas pārbaudes tādos avotos kā PubMed/doi.org un citējot tikai tos rakstus, kas ir faktiski lasīti.

4. Kāds ir visspēcīgākais veids, kā nodrošināt mākslīgā intelekta rakstītā datu tīrīšanas koda precizitāti?

  • A) Ja kods darbojas bez kļūdām, akceptējiet to kā pareizu.
  • B) Rezultāta pārbaude ar nelielu zināmu paraugu un cerības pārbaude ar apgalvojumu ✔
  • C) Pajautājiet modelim "vai kods ir pareizs?" jautājot un uzticoties atbildei "jā"
  • D) Palaidiet kodu vairākas reizes un katru reizi iegūstiet to pašu izvadi

Piezīme: tas, ka kods darbojas bez kļūdām, nenozīmē, ka tas ir pareizs; “Nepareizs kods, kas darbojas bez kļūdām” ir visbīstamākā situācija bioloģijā. Pārbaude ar nelielu paraugu, kura rezultāts jums ir zināms iepriekš, un cerības iegulšana kodā ar apgalvojumu ir spēcīgākais vairogs pret klusiem nepareiziem rezultātiem.

5. RNS-seq analīzē tiek pārbaudīti 20 000 gēnu un 3800 gēnu tiek konstatēti kā “nozīmīgi” ar p<0,05 bez korekcijas. Kāda ir šī secinājuma galvenā problēma?

  • A) Paraugu skaits ir pārāk liels, tas ir jāsamazina
  • B) p slieksnis ir pārāk augsts, vajadzēja izmantot 0,10
  • C) netika veikta vairākkārtēja salīdzināšanas korekcija (FDR); Ir daudz viltus pozitīvu rezultātu ✔
  • D) Gēnu vietā vajadzēja pārbaudīt paraugus

Paskaidrojums. Pārbaudot tūkstošiem gēnu vienlaicīgi, daudzi gēni nejauši šķiet “nozīmīgi”, pat ja nav reālas atšķirības; To sauc par vairāku salīdzināšanas problēmu. Risinājums ir piemērot FDR (viltus atklāšanas ātruma) korekciju ar tādu metodi kā Benjamini-Hochberg; Ar korekciju saraksts parasti tiek samazināts līdz desmitiem līdz dažiem simtiem gēnu.

6. Labākās spēles BLAST rezultātā E-vērtība ir 2,0. Ko tas nozīmē?

  • A) Sakritība, visticamāk, ir nejauša; ✔ nav uzticama atbilstība
  • B) savienojums ir ļoti spēcīgs; Jo lielāka e-vērtība, jo labāk
  • C) Secība tika saskaņota ar likmi 2%
  • D) Starp abām sekvencēm ir 2 bāzes atšķirība

Paskaidrojums: E-vērtība norāda, ka sakritība ir nejauša; Labāk ir būt mazam. E-vērtība, kas lielāka par 1, norāda, ka atbilstība, visticamāk, ir nejauša. Uzticamām sakritībām parasti tiek meklēti ļoti mazi sliekšņi, piemēram, e < 1e-5.

7. AlphaFold modelī proteīna gala apgabalam ir zems pLDDT rādītājs (<50). Kā šis reģions būtu interpretējams?

  • A) AlphaFold šajā reģionā pieļāva kļūdu, reģions ir jānoņem no analīzes
  • B) Šis reģions noteikti ir alfa spirāle
  • C) Modelis ir pilnīgi neuzticams, struktūru nevajadzētu izmantot
  • D) reģions, iespējams, ir neregulārs/elastīgs; jāinterpretē kā “neskaidrs”, nevis “nepatiess” ✔

Apraksts: pLDDT ir katras aminoskābes vietējais ticamības rādītājs; Vērtības zem 50 bieži atspoguļo patiesi neregulārus (elastīgus, nefiksētus) reģionus. Ir nepareizi šos reģionus automātiski dzēst kā "nepareizus minējumus"; Zems rezultāts ir jāuzskata par “nenoteiktu/elastīgu”, un ir jānovērtē tā bioloģiskā nozīme.

8. Pētnieks ziņo par šūnu apgabaliem tikai pikseļos, un rezultāti neatbilst literatūrā. Kāds ir trūkstošais solis?

  • A) Vajadzēja saskaitīt vairāk šūnu
  • B) Mēroga kalibrēšana (konvertēšana no pikseļiem uz mikrometru) netika veikta, rezultāti netika konvertēti fiziskajās vienībās ✔
  • C) Segmentācijas rīks tika izvēlēts nepareizi
  • D) Attēla izšķirtspēja ir pārāk augsta

Paskaidrojums: Mēroga kalibrēšana (cik mikrometru uz pikseli) ir būtiska, lai no attēla iegūtu fizisko izmēru. Ja šis solis tiek izlaists, vērtības paliek nesalīdzināmas atkarībā no mikroskopa iestatījuma. Laukumi ir jāpārvērš fiziskās vienībās, piemēram, kvadrātmikrometri.

9. Students no vienas peles ņem 10 audu paraugus un statistikā izmanto 'n=10'. Kāpēc tas ir nepareizi?

  • A) 10 paraugu ir par maz statistikai, ir nepieciešami vismaz 30
  • B) Audu paraugi bija jāņem no dažādiem orgāniem
  • C) šie 10 piemēri ir tehniski atkārtojumi; bioloģiskais n joprojām ir 1, tas ir tā sauktais atkārtojums ✔
  • D) Paraugi nav derīgi, jo tie ņemti tajā pašā dienā

Paskaidrojums: Atkārtoti mērījumi, kas veikti no vienas un tās pašas personas, ir tehniski atkārtojumi; kur statistiskais n ir bioloģisko vienību skaits (šeit peles). Tehniskās atkārtošanās uzskatīšana par bioloģisku (pseidoreplikācija) rada nepatiesu nozīmi. Pareizs dizains nozīmē darbu ar vairākiem cilvēkiem.

10. Viena analīze atklāja, ka p=0,03. Kāda ir šīs vērtības pareizā interpretācija?

  • A) Pastāv 3% iespēja redzēt šo vai vairāk ekstrēmo rezultātu, ja patiesībā nav nekādas atšķirības ✔
  • B) varbūtība, ka efekts būs reāls, ir 97%
  • C) Nulles hipotēzes patiesības varbūtība ir 3%
  • D) Rezultāts ir 97% atkārtojams

Paskaidrojums: p-vērtība nav “varbūtība, ka hipotēze ir patiesa” vai “varbūtība, ka ietekme ir patiesa”. P-vērtība ir varbūtība redzēt atšķirību, kas ir tikpat liela vai ekstrēmāka nekā tā, kas novērota, ja patiesībā atšķirības nav. Tāpēc p=0,03 nenozīmē 'efekts ir 97% reāls'; rezultāti jānovērtē arī pēc efekta lieluma un ticamības intervāla.

11. Prezentācijā 3% atšķirība starp divām grupām tiek parādīta kā milzīga, saspiežot y asi līdz diapazonam 95-100. Kāds ir šis piemērs?

  • A) laba vizualizācijas tehnika; izceļ atšķirību
  • B) Krāsakliem draudzīgas paletes problēma
  • C) Pieņemama stila izvēle
  • D) Maldinoša un negodīga diagramma, kas pārspīlē atšķirību ar atdalīto asi ✔

Paskaidrojums: ass inicializācija no nulles (saīsināta ass) maldina skatītāju, vizuāli pārspīlējot nelielu atšķirību. Tas ir godīguma principa pārkāpums; Jo īpaši joslu diagrammās asij jāsākas no nulles, un atšķirība jāparāda ar tās faktisko izmēru.

12. Pētnieks ielīmē, viņaprāt, anonīmus pacienta eksome datus publiskās valodas modelī, lai tos analizētu. Kāpēc šī uzvedība ir problemātiska?

  • A) Nav problēmu; datus var koplietot, ja tie ir anonīmi
  • B) Sensitīvu pacienta datu sniegšana atvērtam modelim ir privātuma un ētisku/juridisku (KVKK/GDPR) pārkāpums, un to nevar atsaukt ✔
  • C) Tas ir problemātiski tikai tāpēc, ka analīze būs lēna
  • D) Modelis ir problemātisks, jo nevar saprast datus

Apraksts: pacienta ģenētiskie/klīniskie dati ir ārkārtīgi jutīgi; Pat genoma datus, kas tiek uzskatīti par anonīmiem, var atkārtoti identificēt. Šo datu sniegšana publiskam modelim pārkāpj KVKK/GDPR un ētikas komitejas (IRB) apstiprinājumus un ir neatgriezenisks privātuma pārkāpums. Sensitīvie dati ir jāapstrādā vietējā/drošā, līgumā noslēgtā vidē.

13. Vienā pētījumā atšķirība, ko viņi uzskatīja par “pacientu pret kontroli”, patiesībā bija saistīta ar to, ka paraugi tika apstrādāti divās dažādās dienās. Kā sauc šo situāciju un kā tā tiek risināta?

  • A) Tas ir ārējais efekts; punkti ir jāizdzēš
  • B) Tas ir normalizācijas trūkums; pietiek tikai ar mēroga korekciju
  • C) tas ir partijas efekts; jālīdzsvaro dizainā un jāpievieno modelim kā partijas mainīgais ✔
  • D) p-uzlaušana; tests ir jāmaina

Paskaidrojums: Tehniskās atšķirības paraugu ņemšanas partijas/apstrādes dienas dēļ sauc par partijas efektu, un to var sajaukt ar bioloģisko atšķirību. Pareizā pieeja ir līdzsvarot partijas projektā un statistiskajam modelim pievienot partijas mainīgo (piemēram, “~partija + stāvoklis”), tādējādi atdalot tehnisko signālu no bioloģiskā signāla.

14. Jūs vēlaties aprēķināt DNS sekvences GC attiecību. Kura ir pareizā un atkārtojama pieeja?

  • A) Izdrukājiet kodu, kas aprēķina GC ātrumu ar Biopython, palaidiet to un izmantojiet izvadi ✔
  • B) Sniedziet modelim secību un lūdziet to mutiski pateikt GC ātrumu
  • C) modeļa dotās attiecības apstiprināšana ar citu modeli
  • D) Aplūkojot sērijas pirmos 100 burtus un uzminot ar aci

Paskaidrojums: GC ātrums ir deterministisks aprēķins; jābalstās uz kodu, kas apstrādā masīvu, nevis uz vērtību, ko valodas modelis “atceras”. Tā vietā, lai modelis to aprēķinātu, izdrukājot aprēķina kodu ar tādu rīku kā Biopython un palaižot to pats, tiks nodrošināta precīza izvade, kas nodrošina tādu pašu rezultātu katru reizi, kad to palaižat.