Fitimet:
- Aftësia për të mbrojtur të dhënat e ndjeshme njerëzore/gjenetike në përputhje me rregullat e KVKK, GDPR dhe komitetit të etikës dhe për të shmangur dhënien e tyre në modelin e hapur
- Aftësia për të vënë në dyshim vlefshmërinë e rezultateve duke vlerësuar rreziqet e biosigurisë/përdorimit të dyfishtë dhe paragjykimeve të popullsisë
- Të kuptuarit se përgjegjësia etike nuk mund t'i delegohet automjetit dhe se është e nevojshme "njerëzit në lak" kuptimplotë
Përdorimi i fuqishëm i inteligjencës artificiale në biologji plotësohet duke e përdorur atë me përgjegjësi. Biologjia është një fushë e ndjeshme që prek shëndetin e njeriut, privatësinë gjenetike, mjedisin dhe madje edhe biosigurinë. Në këtë njësi, ne do të diskutojmë përgjegjësitë etike, ligjore dhe të sigurisë me të cilat do të përballeni kur përdorni inteligjencën artificiale në studimet biologjike. Kjo njësi është një kornizë e ndërtuar mbi parimet e verifikimit dhe ndershmërisë në të gjitha njësitë e mëparshme.
Parimi bazë: AI është një mjet; Përgjegjësia etike qëndron gjithmonë tek njerëzit. "Modeli i sugjeruar" nuk është një justifikim.
Katër fusha të përgjegjësisë
1. Privatësia e të dhënave dhe të dhënat njerëzore
Të dhënat gjenetike, klinike ose shëndetësore nga pjesëmarrësit njerëzorë janë jashtëzakonisht të ndjeshme. Sekuenca e ADN-së së një personi mund të zbulojë rrezikun dhe identitetin e sëmundjes së tyre dhe të të afërmve të tyre; Edhe të dhënat gjenomike që mendohet se janë anonime mund të riidentifikohen. Ngjitja e këtyre të dhënave në një model AI të disponueshëm publikisht mund të shkel ligjet e mbrojtjes së të dhënave (KVKK në Turqi, GDPR në Evropë) dhe miratimet e bordit të etikës (IRB/komiteti i etikës).
- Mos jepni të dhëna personale/klinike për modelin e hapur.
- Shmangni përdorimin përtej qëllimit të pëlqimit; Për çfarë pranoi pjesëmarrësi?
- Zgjedhni mjetet e kontratës për ndërmarrje/lokale (në premisë) ose për përpunimin e të dhënave.
2. Biosiguria dhe përdorimi i dyfishtë
Disa informacione biologjike janë "përdorim i dyfishtë": ai mund të jetë i dobishëm dhe i dëmshëm; për shembull, sekuencat patogjene (shkaktuese të sëmundjes), prodhimi i toksinave. Kërkimi i AI për informacion mbi rritjen e patogjenëve të rrezikshëm ose projektimin e agjentëve të dëmshëm biologjikë është joetike dhe e paligjshme në shumicën e vendeve.
- Mos bëni kërkesa të rrezikshme për përdorim të dyfishtë.
- Ndiqni udhëzimet e bordit të biosigurisë (IBC) të institucionit tuaj.
3. Integriteti shkencor
Gjithçka që kemi parë në njësitë e mëparshme bashkohet këtu: asnjë atribuim i rremë, asnjë zbukurim i të dhënave, pa hakim p, asnjë raportim selektiv. Inteligjenca artificiale mund t'i bëjë këto më të lehta ose më të vështira; Dallimi është në ndershmërinë tuaj.
- Raportoni të gjitha rezultatet (përfshirë ato negative).
- Deklaroni përdorimin e inteligjencës artificiale.
- Mbështetni riprodhueshmërinë duke ndarë të dhënat e papërpunuara dhe kodin (nëse është e mundur).
4. Paragjykimi dhe drejtësia
Modelet e AI mbartin paragjykime të të dhënave mbi të cilat janë trajnuar. Bazat e të dhënave gjenomike vijnë kryesisht nga popullata me prejardhje evropiane; kjo çon në parashikime më të dobëta në popullatat e tjera. Një model imazhi mund të funksionojë dobët në një gjendje që është e nënpërfaqësuar në të dhënat e trajnimit.
- Pyetni se mbi çfarë popullate/të dhëna është trajnuar modeli.
- Vlerësoni nëse rezultatet qëndrojnë në të gjitha grupet.
Këshillë: Pyesni veten: "Nëse i jap këto të dhëna modelit, kujt i përket dhe a ka dhënë leje ai person?" Nëse përgjigja është e paqartë, mos e jepni. Shkelja e konfidencialitetit është e pakthyeshme.
Hap pas hapi: kontroll i përgjegjshëm i AI
- Klasifikoni burimin e të dhënave: Personal/sensitive apo publik?
- Kontrollo pëlqimin dhe lejet: A mbulohet ky përdorim?
- Zgjidhni mjetin e duhur: Mjedis i sigurt/vendas për të dhëna të ndjeshme.
- Merrni parasysh rrezikun e përdorimit të dyfishtë.
- Paragjykimi i pyetjes: A është rezultati i vlefshëm në të gjitha grupet?
- Dokumentoni dhe deklaroni përdorimin.
Modele të shpejtë të kopjueshëm
Rishikoni planin tim të analizës më poshtë nga një këndvështrim etik: listoni paralajmërimet në lidhje me konfidencialitetin e të dhënave, pëlqimin e pjesëmarrësve, paragjykimet e mundshme dhe rrezikun e përdorimit të dyfishtë. Plani: [tekst] (Shënim: Unë NUK po ndaj të dhënat aktuale të pacientit, vetëm planin.)
Çfarë pyetjesh për privatësinë dhe pëlqimin duhet t'u përgjigjem përpara se të përdor këtë grup të dhënash gjenomike? Është përgatitur një listë kontrolli për sa i përket KVKK/GDPR dhe komitetit të etikës.
Si duhet të deklaroj në mënyrë transparente mjetin e inteligjencës artificiale që përdor në seksionin e metodave të artikullit tim? Shkruani një shembull fjalish deklarative; çfarë informacioni (mjet, versioni, qëllimi i përdorimit) duhet të përmbajë?
Si mund të vlerësoj nëse rezultatet e këtij modeli kanë paragjykim të popullsisë? Rendisni pyetjet që duhet të bëj në lidhje me të dhënat e trajnimit dhe hapat e kontrollit.
Prompt i dobët / Prompt i fortë
E dobët: "Analizo të dhënat gjenetike të pacientit të mëposhtëm: [të dhëna reale]."
Güçlü: "Unë po krijoj një plan analize që funksionon me të dhëna klinike gjenomike, por nuk ndaj të dhëna reale të pacientit. Vetëm nga një këndvështrim metodologjik: çfarë masash konfidencialiteti duhet të marr, në çfarë mjedisi duhet të përpunoj të dhënat, çfarë kushtesh të komitetit të miratimit dhe të etikës duhet të plotësoj? Ju mund ta tregoni rrjedhën me të dhëna dummy/kampion".
Dallimi: Asnjë e dhënë aktuale e ndjeshme nuk ndahet në kërkesën e fuqishme; Kërkohet vetëm metoda. Privatësia ruhet, modeli ende ndihmon.
tre mini kuti
Rasti 1 - Shkelja e privatësisë: Një studiues ngjiti ato që mendonte se ishin të dhëna anonime të ekzomit të pacientit në një model të hapur për t'i analizuar ato. Kur komisioni i etikës mësoi për këtë, studimi u pezullua; Nuk kishte marrëveshje për përpunimin e të dhënave. Mësimi: të dhënat sensitive nuk hyjnë kurrë në modelin e hapur.
Rasti 2 — Paragjykimi i popullsisë: Një mjet për vlerësimin e rrezikut poligjenik u trajnua mbi të dhënat me origjinë evropiane; Në një popullatë tjetër, vlerësimet e rrezikut ishin dukshëm të pasakta. Kur modeli sugjeroi të vinte në dyshim përbërjen e të dhënave të trajnimit, ekipi vendosi të mos përdorte mjetin në atë popullatë. Mësimi: paragjykimi shpëton ose dëmton jetë.
Rasti 3 — Zbulimi dhe transparenca: Një ekip shkroi kodin e pastrimit të të dhënave me AI dhe e deklaroi këtë qartë në seksionin e metodës; Ai gjithashtu ndau kodin. Rishikuesit e mirëpritën këtë sepse përsëritshmëria ishte e fortë. Mësimi: transparenca ushqen besimin.
grafik krahasimi
zonë
sjellje të sigurt
sjellje të rrezikshme
të dhënat e pacientit
Ambient lokal/i sigurt
Ngjit për të hapur modelin
pëlqimin
Përdorni brenda fushës së veprimit
Mos e tejkaloni qëllimin
Biosiguria
Shmangia e përdorimit të dyfishtë
kërkesë e rrezikshme
integriteti
Raportoni të gjitha rezultatet
raportim selektiv
paragjykim
Pyetni popullatën
Aplikoni verbërisht
transparencës
Deklaroni përdorimin
duke u fshehur
Gabimet e zakonshme
- Dhënia e të dhënave të ndjeshme për modelin e hapur: Shkelje e pakthyeshme e privatësisë.
- Tejkalimi i fushës së pëlqimit: Përdorimi i paautorizuar nga pjesëmarrësi.
- Injorimi i paragjykimeve: Përgjithësimi i rezultateve për të gjitha grupet.
- Fshehja e përdorimit: Nuk deklarohet kontributi i AI.
- Mbrojtja "Modeli i sugjeruar": Atribuimi i përgjegjësisë në automjet.
Kujdes: Në punën biologjike me pasoja të larta (vendimi klinik, biosiguria, të dhënat njerëzore) prodhimi i AI nuk është zëvendësues për verifikimin kompetent të ekspertëve dhe mbikëqyrjen etike; vetëm e përshpejton atë. Përgjegjësia përfundimtare qëndron gjithmonë mbi qenien njerëzore, së bashku me pasojat etike dhe shkencore të vendimit.
Mjedisi, ekologjia dhe njohuritë tradicionale
Përgjegjësia etike nuk kufizohet vetëm në të dhënat njerëzore. Kujdes duhet gjithashtu kur përdoret inteligjenca artificiale në ekologji dhe biologjinë e ruajtjes. Për shembull, të dhënat e sakta të vendndodhjes (koordinatat e kurthit të kamerës) të një specie të rrezikuar janë të ndjeshme për shkak të rrezikut të gjuetisë pa leje; Lëshimi i këtyre të dhënave për një model të hapur ose publik mund të dëmtojë speciet. Në mënyrë të ngjashme, çështjet etike dhe ligjore (siç është Protokolli i Nagojës) lindin kur njohuritë tradicionale biologjike të komuniteteve lokale (p.sh. përdorimi i një bime) përdoren pa leje. Përpara përdorimit të të dhënave, "kujt i përket ky informacion dhe kush do të dëmtohej nga zbulimi i tij?" Gjithmonë bëni pyetjen.
Mbikëqyrja njerëzore dhe vendimi përfundimtar
Thelbi i gjithë këtij moduli zbret në një parim: mbikëqyrje kuptimplotë njerëzore. AI prodhon një sugjerim, shkruan një draft, tregon një model; Por një vendim biologjik, klinik ose etik nuk bazohet kurrë drejtpërdrejt në rezultatin e modelit. Sidomos në zonat me rrezik të lartë (diagnoza, trajtimi, vendimi për ruajtjen e specieve, çlirimi), roli i modelit nuk është të marrë vendime, por të përshpejtojë vendimin e ekspertit. Qasja "human-in-the-loop" nuk është një slogan, por një domosdoshmëri.
Që kjo mbikëqyrje të funksionojë, mbikëqyrësi duhet të jetë kompetent. Pëlqimi i verbër (“model i thënë, pranim”) nuk është mbikëqyrje. Mbikëqyrja e vërtetë kërkon ekspertizë që mund të vërë në dyshim rezultatin, të kapë gabimin e tij dhe ta refuzojë atë kur është e nevojshme. Prandaj, inteligjenca artificiale nuk e zëvendëson ekspertin; Kjo e bën ekspertin edhe më të domosdoshëm. Ai që e përdor më së miri automjetin është ai që mund ta kontrollojë atë më së miri.
Në përmbledhje
Përdorimi i përgjegjshëm i AI në biologji mbulon katër fusha: privatësinë e të dhënave (mbrojtja e të dhënave të ndjeshme njerëzore), biosiguria (shmangia e përdorimit të dyfishtë), integriteti shkencor (raportimi i ndershëm dhe i plotë) dhe ndërgjegjësimi i paragjykimit (vlefshmëria e rezultateve në të gjitha grupet). Mos jepni të dhëna sensitive për modelin e hapur, deklaroni përdorimin në mënyrë transparente, vini në dyshim paragjykimet e popullsisë. Përgjegjësia etike nuk mund t'i delegohet kurrë agjentit; Është gjithmonë te njerëzit.
Detyra e aplikimit
Merrni parasysh një skenar nga hapësira juaj e punës (p.sh. duke përdorur një grup të dhënash njerëzore ose një model imazhi). Lërini AI të dalë me listën e kontrollit etik të këtij skenari (konfidencialiteti, pëlqimi, paragjykimi, përdorimi i dyfishtë, transparenca) pa shkëmbyer të dhëna reale. Për çdo artikull, shënojeni atë si "të përshtatshme/të rrezikshme/të pasigurta" në situatën tuaj dhe shkruani një plan veprimi për ata që janë të rrezikshëm/të pasigurt. Gjithashtu keni një deklaratë të përdorimit të AI të hartuar për artikullin tuaj.
listë kontrolli
- [ ] Nuk kam dhënë të dhëna sensitive/personale për modelin e hapur.
- [ ] Kontrollova fushën e pëlqimit dhe komitetin e etikës.
- [ ] Kam vlerësuar rrezikun e përdorimit të dyfishtë/biosigurisë.
- [ ] I raportova të gjitha rezultatet sinqerisht.
- [ ] Kam vënë në dyshim paragjykimet e popullsisë/të dhënave.
- [ ] Unë kam deklaruar në mënyrë transparente përdorimin e inteligjencës artificiale dhe kam marrë përgjegjësinë.
Provimi i Modulit
1. Një student pyeti modelin gjuhësor 'sa vargje ka në këtë skedar FASTA?' pyet ai dhe modelja përgjigjet '48'. Cila është qasja më e saktë?
- A) Duke përdorur drejtpërdrejt numrin 48 të dhënë nga modeli; Modeli është i besueshëm sepse e sheh skedarin
- B) Kërkoni edhe një herë numrin dhe pranojeni si të saktë nëse të dy përgjigjet janë të njëjta
- C) Leximi i skedarit me Biopython, numërimi i numrit të sekuencave me kod dhe përdorimi i daljes ✔
- D) Hapja e dosjes me dorë dhe numërimi me vendim të syrit
Shpjegim: Detyrat përcaktuese si numërimi dhe matja duhet t'i lihen kodit që përdorni, jo modelit të gjuhës. Modeli nuk 'kujton' numrin, ai prodhon një vlerë probabilistike dhe mund të gabohet; Numërimi me një mjet si Biopython jep rezultate të sakta dhe të riprodhueshme.
2. Ju dëshironi të numëroni qelizat në një imazh me mikroskop dhe të matni sipërfaqen e secilës. Cila është qasja më e përshtatshme për këtë detyrë?
- A) Përdorimi i një mjeti eksperti të segmentimit si Cellpose/StarDist dhe verifikimi manual i rezultatit ✔
- B) Ngjitni imazhin në modelin e gjuhës së përgjithshme dhe pyesni 'sa qeliza ka'
- C) Përshkruani imazhin modelit dhe kërkoni një numër të vlerësuar
- D) Pranimi i numrit të pikselave si numër i qelizave pa asnjë kalibrim
Shpjegim: Segmentimi dhe matja e qelizave nuk është fushë e modelit të gjuhës së përgjithshme, por e modeleve të specializuara të imazhit (Cellpose, StarDist) të trajnuara posaçërisht për këtë detyrë. Modeli i gjuhës shkruan kodin që thërret këto mjete; Modeli ekspert bën matjen dhe biologu verifikon rezultatin.
3. Një student i diplomuar shton 8 burime të prodhuara nga modeli gjuhësor në hyrjen e tezës së tij. Konsulenti konstaton se 3 prej tyre nuk ekzistojnë fare. Si mund të parandalohej kjo situatë?
- A) Duke i kërkuar modelit të prodhojë burime edhe një herë
- B) Duke zgjedhur vetëm citimet me DOI (nëse ka DOI, është reale)
- C) Kërkimi i listës duke udhëzuar modelin të 'përshtatet'
- D) Verifikimi në mënyrë të pavarur çdo citim në PubMed/doi.org dhe duke cituar vetëm artikujt që ai ka lexuar ✔
Shpjegim: Modelet e përgjithshme të gjuhës nuk janë bazë e të dhënave të literaturës; Në vend të kërkimit për regjistrime reale, ai 'gjeneron' atribuime me tinguj realistë (atribuim i fabrikuar). Çdo rresht dhe DOI nuk duhet të përdoret pa verifikim të pavarur në burime të tilla si PubMed/doi.org dhe vetëm duke cituar artikuj që janë lexuar në të vërtetë.
4. Cila është mënyra më e fuqishme për të siguruar saktësinë e një kodi të pastrimit të të dhënave të shkruar nga inteligjenca artificiale?
- A) Nëse kodi funksionon pa gabime, pranojeni si të saktë.
- B) Testimi i rezultatit me një kampion të vogël të njohur dhe verifikimi i pritshmërisë me pohimin ✔
- C) Pyete modelin 'a është kodi i saktë?' duke kërkuar dhe besuar përgjigjen 'po'
- D) Ekzekutoni kodin disa herë dhe merrni të njëjtin rezultat çdo herë
Vërejtje: Vetëm për shkak se kodi funksionon pa gabime nuk do të thotë se është i saktë; 'kodi i gabuar që funksionon pa gabime' është situata më e rrezikshme në biologji. Testimi me një mostër të vogël, rezultati i të cilit ju e dini paraprakisht dhe futja e pritshmërisë në kod me pohim është mburoja më e fortë kundër rezultateve të heshtura të gabuara.
5. Në një analizë ARN-seq, 20,000 gjene janë testuar dhe 3,800 gjene janë gjetur të jenë 'të rëndësishme' me p<0.05 pa korrigjim. Cili është problemi kryesor me këtë përfundim?
- A) Numri i mostrave është shumë i lartë, ai duhet të reduktohet
- B) pragu p është shumë i lartë, duhet të ishte përdorur 0.10
- C) Korrigjimi i krahasimit të shumëfishtë (FDR) nuk është kryer; Ka shumë pozitive false ✔
- D) Mostrat duhet të ishin testuar në vend të gjeneve
Shpjegim: Kur testoni mijëra gjene në të njëjtën kohë, shumë gjene duken 'të rëndësishme' rastësisht, edhe nëse nuk ka ndonjë ndryshim të vërtetë; Ky quhet problemi i krahasimit të shumëfishtë. Zgjidhja është aplikimi i korrigjimit FDR (shkalla e zbulimit të rremë) me një metodë të tillë si Benjamini-Hochberg; Me korrigjim, lista zakonisht zvogëlohet në dhjetëra në disa qindra gjene.
6. Ndeshja më e mirë në një rezultat BLAST ka një vlerë E 2.0. Çfarë do të thotë kjo?
- A) Përputhja është me shumë mundësi e rastësishme; ✔ jo një ndeshje e besueshme
- B) Lidhja është shumë e fortë; Sa më e madhe të jetë vlera elektronike, aq më mirë
- C) Sekuenca përputhet në një shkallë prej 2%
- D) Ekziston një ndryshim 2 bazash midis dy sekuencave
Shpjegim: Vlera E tregon pritshmërinë që përputhja të jetë e rastësishme; Është më mirë të jesh i vogël. Një vlerë elektronike më e madhe se 1 tregon se përputhja ka shumë të ngjarë të jetë e rastësishme. Për ndeshje të besueshme, përgjithësisht kërkohen pragje shumë të vogla si e < 1e-5.
7. Në një model AlphaFold, rajoni terminal i proteinës tregon një rezultat të ulët pLDDT (<50). Si duhet interpretuar ky rajon?
- A) AlphaFold bëri një gabim në këtë rajon, rajoni duhet të hiqet nga analiza
- B) Ky rajon është padyshim një spirale alfa
- C) Modeli është plotësisht jo i besueshëm, struktura nuk duhet të përdoret
- D) Rajoni ka të ngjarë të jetë i parregullt/elastik; duhet të interpretohet si 'e paqartë' dhe jo si 'e rreme' ✔
Përshkrimi: pLDDT është rezultati lokal i besimit për çdo aminoacid; Vlerat nën 50 shpesh pasqyrojnë rajone vërtet të parregullta (fleksibile, jo fikse). Është e gabuar të fshihen automatikisht këto rajone si 'supozime të gabuara'; Një rezultat i ulët duhet të lexohet si 'i pasigurt/fleksibël' dhe rëndësia e tij biologjike duhet të vlerësohet.
8. Një studiues raporton zonat e qelizave vetëm në pixel dhe rezultatet nuk janë në përputhje me literaturën. Cili është hapi që mungon?
- A) Duhet të ishin numëruar më shumë qeliza
- B) Kalibrimi i shkallës (konvertimi piksel në mikrometër) nuk u krye, rezultatet nuk u konvertuan në njësi fizike ✔
- C) Mjeti i segmentimit është zgjedhur gabim
- D) Rezolucioni i imazhit është shumë i lartë
Shpjegim: Kalibrimi i shkallës (sa mikrometra për pixel) është thelbësor për të nxjerrë madhësinë fizike nga imazhi. Nëse ky hap anashkalohet, vlerat mbeten të pakrahasueshme, në varësi të cilësimeve të mikroskopit. Zonat duhet të konvertohen në njësi fizike siç janë mikrometrat katrorë.
9. Një nxënës merr 10 mostra indesh nga një mi i vetëm dhe përdor 'n=10' në statistika. Pse është kjo e gabuar?
- A) 10 mostra janë shumë pak për statistika, nevojiten të paktën 30
- B) Duheshin marrë mostra indi nga organe të ndryshme
- C) Këta 10 shembuj janë përsëritje teknike; n biologjike është ende 1, kjo është e ashtuquajtura përsëritje ✔
- D) Mostrat janë të pavlefshme sepse janë marrë në të njëjtën ditë
Shpjegim: Matjet e përsëritura të marra nga i njëjti individ janë përsëritje teknike; ku statistikor n është numri i njësive biologjike (këtu minjtë). Konsiderimi i përsëritjes teknike si biologjike (pseudoreplikimi) prodhon domethënie të rreme. Dizajni i duhur do të thotë të punosh me shumë individë.
10. Një analizë u gjet p=0.03. Cili është interpretimi i saktë i kësaj vlere?
- A) Ka një shans 3% për të parë këtë ose më shumë rezultat ekstrem kur në realitet nuk ka dallim ✔
- B) Probabiliteti që efekti të jetë real është 97%
- C) Probabiliteti që hipoteza zero të jetë e vërtetë është 3%
- D) Rezultati është 97% i përsëritshëm
Shpjegim: vlera p nuk është 'probabilitet që hipoteza të jetë e vërtetë' ose 'probabilitet që efekti të jetë i vërtetë'. Vlera p është probabiliteti për të parë një ndryshim si ose më ekstrem se ai i vërejtur kur në fakt nuk ka dallim. Prandaj p=0.03 nuk do të thotë 'efekti është 97% real'; rezultatet duhet gjithashtu të vlerësohen sipas madhësisë së efektit dhe intervalit të besimit.
11. Në një prezantim, një ndryshim prej 3% midis dy grupeve tregohet si i madh duke kompresuar boshtin y në intervalin 95-100. Për çfarë është ky shembull?
- A) Një teknikë e mirë vizualizimi; nxjerr në pah dallimin
- B) Problemi i paletës miqësore ndaj ngjyrave
- C) Një zgjedhje e pranueshme stili
- D) Një tabelë mashtruese dhe e pandershme që ekzagjeron ndryshimin me boshtin e cunguar ✔
Shpjegim: Mos inicializimi i boshtit nga zero (boshti i cunguar) mashtron shikuesin duke ekzagjeruar vizualisht një ndryshim të vogël. Kjo është shkelje e parimit të ndershmërisë; Sidomos në grafikët me shtylla, boshti duhet të fillojë nga zero dhe diferenca duhet të tregohet me madhësinë e tij aktuale.
12. Një studiues ngjis ato që ai mendon se janë të dhëna anonime të ekzomit të pacientit në një model të gjuhës publike për t'i analizuar ato. Pse është problematike kjo sjellje?
- A) Nuk ka asnjë problem; të dhënat mund të ndahen nëse janë anonime
- B) Sigurimi i të dhënave të ndjeshme të pacientit për një model të hapur është një shkelje e privatësisë dhe etike/ligjore (KVKK/GDPR) dhe nuk mund të anulohet ✔
- C) Është problematike vetëm sepse analiza do të jetë e ngadaltë
- D) Modeli është problematik sepse nuk mund t'i kuptojë të dhënat
Përshkrimi: Të dhënat gjenetike/klinike të pacientit janë jashtëzakonisht të ndjeshme; Edhe të dhënat gjenomike që mendohen të jenë anonime mund të riidentifikohen. Dhënia e këtyre të dhënave në një model publik shkel miratimet e KVKK/GDPR dhe komitetit të etikës (IRB) dhe është një shkelje e pakthyeshme e privatësisë. Të dhënat e ndjeshme duhet të përpunohen në mjedise lokale/të sigurta, të kontraktuara.
13. Në një studim, ndryshimi që ata mendonin se ishte 'pacienti kundër kontrollit' ishte në fakt për shkak të mostrave që po përpunoheshin në dy ditë të ndryshme. Si quhet kjo situatë dhe si trajtohet?
- A) Është efekti i jashtëm; pikat duhet të fshihen
- B) Është mungesë normalizimi; mjafton vetëm korrigjimi i shkallës
- C) Është efekti i grupit; duhet të balancohet në dizajn dhe t'i shtohet modelit si një variabël batch ✔
- D) p-hacking; testi duhet ndryshuar
Shpjegim: Dallimi teknik për shkak të grumbullimit të kampionit/ditës së përpunimit quhet efekt grupi dhe mund të ngatërrohet me diferencën biologjike. Qasja e saktë është të balanconi grupet në dizajn dhe të shtoni variablin e grupit në modelin statistikor (p.sh. '~batch + gjendje'), duke ndarë kështu sinjalin teknik nga sinjali biologjik.
14. Ju dëshironi të llogaritni raportin GC të një sekuence të ADN-së. Cila është qasja e saktë dhe e përsëritshme?
- A) Shtypni kodin që llogarit normën GC me Biopython, ekzekutoni atë dhe përdorni daljen ✔
- B) Jepini modelit sekuencën dhe kërkoni që të tregojë me gojë normën GC
- C) Konfirmimi i raportit të dhënë nga modeli nga një model tjetër
- D) Shikimi i 100 shkronjave të para të serisë dhe hamendja me sy
Shpjegim: Norma e GC është një llogaritje përcaktuese; duhet të bazohet në kodin që përpunon grupin, jo në një vlerë që modeli i gjuhës 'kujton'. Në vend që modeli ta llogarisë atë, printimi i kodit llogaritës me një mjet si Biopython dhe ekzekutimi i tij vetë do të sigurojë një rezultat të saktë që jep të njëjtin rezultat sa herë që e ekzekutoni.