Enota 11 / 11

Etika, biološka varnost, zaupnost in znanstvena integriteta

Dobički:

  • Sposobnost zaščite občutljivih človeških/genskih podatkov v skladu s pravili KVKK, GDPR in etičnih komisij ter izogibanje njihovemu posredovanju odprtemu modelu
  • Sposobnost dvoma o veljavnosti rezultatov z ocenjevanjem tveganj biološke varnosti/dvojne rabe in pristranskosti prebivalstva
  • Razumevanje, da etične odgovornosti ni mogoče prenesti na vozilo in da je potreben smiseln human-in-the-loop

Močno uporabo umetne inteligence v biologiji dopolnjuje odgovorna uporaba. Biologija je občutljivo področje, ki zadeva zdravje ljudi, genetsko zasebnost, okolje in celo biološko varnost. V tej enoti bomo razpravljali o etičnih, pravnih in varnostnih odgovornostih, s katerimi se boste soočili pri uporabi umetne inteligence v bioloških študijah. Ta enota je okvir, ki temelji na načelih preverjanja in poštenosti v vseh prejšnjih enotah.

Osnovno načelo: AI je orodje; Etična odgovornost je vedno na ljudeh. "Predlagani model" ni izgovor.

Štiri področja odgovornosti

1. Zasebnost podatkov in človeški podatki

Genetski, klinični ali zdravstveni podatki človeških udeležencev so izjemno občutljivi. Zaporedje DNK osebe lahko razkrije nevarnost bolezni in identiteto posameznika in njegovih sorodnikov; Celo genomske podatke, za katere se domneva, da so anonimizirani, je mogoče ponovno identificirati. Če prilepite te podatke v javno dostopen model AI, lahko kršite zakone o varstvu podatkov (KVKK v Turčiji, GDPR v Evropi) in odobritve odbora za etiko (IRB/etični odbor).

  • Odprtemu modelu ne posredujte osebnih/kliničnih podatkov.
  • Izogibajte se uporabi, ki presega obseg soglasja; V kaj je udeleženec privolil?
  • Odločite se za podjetniška/lokalna (on-premise) ali pogodbena orodja za obdelavo podatkov.

2. Biološka varnost in dvojna raba

Nekatere biološke informacije so "dvojne uporabe": lahko so koristne in škodljive; na primer zaporedja patogenov (ki povzročajo bolezni), proizvodnja toksinov. Zahtevati od umetne inteligence informacije o krepitvi nevarnih patogenov ali načrtovanju škodljivih bioloških agentov je na večini krajev neetično in nezakonito.

  • Ne postavljajte nevarnih zahtev za dvojno uporabo.
  • Upoštevajte smernice odbora za biološko varnost (IBC) vaše ustanove.

3. Znanstvena neoporečnost

Vse, kar smo videli v prejšnjih enotah, se tukaj združi: brez lažnega pripisovanja, brez olepševanja podatkov, brez p-hekanja, brez selektivnega poročanja. Umetna inteligenca jih lahko olajša ali oteži; Razlika je v vaši poštenosti.

  • Sporoči vse rezultate (tudi negativne).
  • Razglasite uporabo umetne inteligence.
  • Podprite ponovljivost z deljenjem neobdelanih podatkov in kode (če je mogoče).

4. Pristranskost in pravičnost

Modeli umetne inteligence nosijo pristranskosti podatkov, na podlagi katerih so usposobljeni. Genomske zbirke podatkov večinoma izvirajo iz populacij evropskega porekla; to vodi do slabših napovedi pri drugih populacijah. Slikovni model lahko slabo deluje v stanju, ki je premalo zastopano v podatkih o usposabljanju.

  • Vprašajte se, na kateri populaciji/podatkih je bil model usposobljen.
  • Ocenite, ali rezultati veljajo za vse skupine.
Nasvet: vprašajte se: "Če dam te podatke modelu, komu pripadajo in ali je ta oseba dala dovoljenje?" Če je odgovor nejasen, ga ne povejte. Kršitev zaupnosti je nepopravljiva.

Korak za korakom: odgovoren nadzor AI

  1. Razvrstite vir podatkov: osebno/občutljivo ali javno?
  2. Preverite soglasje in dovoljenja: ali je ta uporaba zajeta?
  3. Izberite pravo orodje: Varno/domače okolje za občutljive podatke.
  4. Upoštevajte tveganje dvojne uporabe.
  5. Pristranskost vprašanja: Ali je rezultat veljaven v vseh skupinah?
  6. Dokumentirajte in prijavite uporabo.

Kopirane predloge pozivov

Preglejte moj načrt analize spodaj z etičnega vidika: navedite opozorila glede zaupnosti podatkov, soglasja udeležencev, morebitne pristranskosti in tveganja dvojne uporabe. Načrt: [besedilo] (Opomba: NE delim dejanskih podatkov o pacientu, ampak le načrt.)

Na katera vprašanja glede zasebnosti in soglasja moram odgovoriti, preden uporabim ta nabor genomskih podatkov? Pripravljen je kontrolni seznam glede na KVKK/GDPR in etično komisijo.

Kako naj transparentno prijavim orodje umetne inteligence, ki ga uporabljam, v razdelku o metodah svojega članka? Napišite primer izjavnega stavka; katere informacije (orodje, različica, obseg uporabe) naj vsebuje?

Kako ocenim, ali imajo rezultati tega modela populacijsko pristranskost? Navedite vprašanja, ki naj jih postavim o podatkih o usposabljanju in korakih preverjanja.

Šibek poziv/močan poziv

Šibko: "Analizirajte genetske podatke naslednjega bolnika: [pravi podatki]."

Güçlü: "Vzpostavljam načrt analize, ki deluje s kliničnimi genomskimi podatki, vendar ne delim resničnih podatkov o pacientih. Samo z metodološkega vidika: kakšne ukrepe glede zaupnosti naj sprejmem, v kakšnem okolju naj obdelujem podatke, katere pogoje odobritve in komisije za etiko moram izpolnjevati? Tok lahko prikažete z navideznimi/vzorčnimi podatki."

Razlika: v zmogljivem pozivu ni dejanskih občutljivih podatkov; Vpraša se samo metoda. Zasebnost je ohranjena, model še vedno pomaga.

trije mini kovčki

1. primer – Kršitev zasebnosti: Raziskovalec je prilepil, za kar je mislil, da so anonimni podatki o pacientovem eksomu, v odprt model, da bi ga analizirali. Ko je za to izvedela etična komisija, so študijo prekinili; Ni bilo pogodbe o obdelavi podatkov. Lekcija: občutljivi podatki nikoli ne vstopijo v odprti model.

Primer 2 – Pristranskost populacije: Orodje za poligensko oceno tveganja je bilo usposobljeno na podatkih evropskega izvora; V drugi populaciji so bile ocene tveganja znatno netočne. Ko je model predlagal dvom o sestavi podatkov o usposabljanju, se je ekipa odločila, da orodja ne bo uporabila v tej populaciji. Nauk: pristranskost rešuje ali škoduje življenju.

Primer 3 – Razkritje in preglednost: ekipa je napisala kodo za čiščenje podatkov z umetno inteligenco in to jasno navedla v razdelku o metodah; Delil je tudi kodo. Recenzenti so to pozdravili, ker je bila ponovljivost velika. Nauk: preglednost rodi zaupanje.

primerjalna tabela

območje

varno vedenje

tvegano vedenje

podatke o bolniku

Lokalno/varno okolje

Prilepi, da odpreš model

soglasje

Uporabite v obsegu

Ne prekoračite obsega

Biološka varnost

Izogibanje dvojni uporabi

nevarno povpraševanje

celovitost

Sporoči vse rezultate

selektivno poročanje

pristranskost

Vprašajte prebivalstvo

Nanesite na slepo

preglednost

Navedite uporabo

skrivanje

Pogoste napake

  • Posredovanje občutljivih podatkov odprtemu modelu: nepopravljiva kršitev zasebnosti.
  • Preseganje obsega soglasja: uporaba ni dovoljena s strani udeleženca.
  • Ignoriranje pristranskosti: posploševanje rezultatov na vse skupine.
  • Prikrivanje uporabe: prispevek umetne inteligence ni naveden.
  • Zagovor "predlaganega modela": pripisovanje odgovornosti vozilu.
Pozor: pri biološkem delu z velikimi posledicami (klinična odločitev, biološka varnost, podatki o ljudeh) rezultat umetne inteligence ni nadomestilo za kompetentno strokovno preverjanje in etični nadzor; samo pospeši. Končna odgovornost je vedno na človeku, skupaj z etičnimi in znanstvenimi posledicami odločitve.

Okolje, ekologija in tradicionalna znanja

Etična odgovornost ni omejena na podatke o ljudeh. Previdnost je potrebna tudi pri uporabi umetne inteligence v ekologiji in varstveni biologiji. Na primer, natančni podatki o lokaciji (koordinate kamere) ogrožene vrste so občutljivi zaradi nevarnosti divjega lova; Objava teh podatkov odprtemu modelu ali javnosti bi lahko škodovala vrsti. Podobno se pojavijo etična in pravna (kot je Nagojski protokol) vprašanja, ko se tradicionalno biološko znanje lokalnih skupnosti (npr. uporaba rastline) uporablja brez dovoljenja. Pred uporabo podatkov, "komu pripada ta informacija in komu bi bila škoda z njenim razkritjem?" Vedno postavite vprašanje.

Človeški nadzor in končna odločitev

Bistvo tega celotnega modula se skrči na eno načelo: smiseln človeški nadzor. AI izdela predlog, napiše osnutek, pokaže vzorec; Toda biološka, ​​klinična ali etična odločitev nikoli ne temelji neposredno na rezultatu modela. Predvsem na območjih z visokim tveganjem (diagnoza, zdravljenje, odločitev o ohranitvi vrste, izpust) vloga modela ni sprejemanje odločitev, temveč pospešitev odločitve strokovnjaka. Pristop »človek v zanki« ni slogan, ampak nuja.

Da bi ta nadzor deloval, mora biti nadzornik kompetenten. Slepo soglasje (»model rekel, sprejem«) ni spregled. Pravi nadzor zahteva strokovno znanje, ki lahko dvomi o rezultatu, ujame napako in ga po potrebi zavrne. Zato umetna inteligenca ne nadomesti strokovnjaka; Zaradi tega je strokovnjak še bolj nepogrešljiv. Tisti, ki najbolje uporablja vozilo, ga zna najbolje nadzorovati.

Če povzamem

Odgovorna uporaba umetne inteligence v biologiji zajema štiri področja: zasebnost podatkov (zaščita občutljivih človeških podatkov), biološka varnost (izogibanje dvojni uporabi), znanstvena integriteta (pošteno in popolno poročanje) in zavedanje o pristranskosti (veljavnost rezultatov v vseh skupinah). Odprtemu modelu ne posredujte občutljivih podatkov, uporabo navedite pregledno, dvomite o pristranskosti prebivalstva. Etične odgovornosti nikoli ni mogoče prenesti na agenta; Vedno je v ljudeh.

Aplikacijska naloga

Razmislite o scenariju iz svojega delovnega prostora (npr. z uporabo človeškega nabora podatkov ali slikovnega modela). Naj AI pripravi etični kontrolni seznam tega scenarija (zaupnost, privolitev, pristranskost, dvojna raba, preglednost) brez izmenjave resničnih podatkov. Za vsako postavko označite kot »primerno/tvegano/negotovo« v vaši situaciji in napišite akcijski načrt za tiste, ki so tvegane/negotove. Za svoj članek pripravite tudi izjavo o uporabi umetne inteligence.

kontrolni seznam

  • [ ] Odprtemu modelu nisem posredoval občutljivih/osebnih podatkov.
  • [ ] Preveril sem obseg soglasja in etičnega odbora.
  • [ ] Ocenil sem tveganje dvojne uporabe/biološke varnosti.
  • [ ] Pošteno sem poročal o vseh rezultatih.
  • [ ] Dvomil sem o pristranskosti prebivalstva/podatkov.
  • [ ] Transparentno sem izjavil uporabo umetne inteligence in prevzel odgovornost.

Modulni izpit

1. Študent je vprašal jezikovni model "koliko nizov je v tej datoteki FASTA?" vpraša in manekenka odgovori '48'. Kateri je najbolj pravilen pristop?

  • A) Neposredno z uporabo številke 48, ki jo poda model; Model je zanesljiv, ker vidi datoteko
  • B) Še enkrat vprašajte številko in jo sprejmite kot pravilno, če sta odgovora enaka
  • C) Branje datoteke z Biopythonom, štetje števila zaporedij s kodo in uporaba izhoda ✔
  • D) Ročno odpiranje datoteke in štetje z očesno odločitvijo

Pojasnilo: Deterministične naloge, kot sta štetje in merjenje, je treba prepustiti kodi, ki jo izvajate, in ne jezikovnemu modelu. Model si številke ne 'zapomni', proizvede verjetnostno vrednost in se lahko zmoti; Štetje z orodjem, kot je Biopython, daje natančne in ponovljive rezultate.

2. Želite prešteti celice na mikroskopski sliki in izmeriti površino vsake. Kakšen je najprimernejši pristop za to nalogo?

  • A) Uporaba strokovnega orodja za segmentacijo, kot je Cellpose/StarDist, in ročno preverjanje rezultata ✔
  • B) Prilepite sliko v splošni jezikovni model in vprašajte "koliko celic je tam"
  • C) Opišite sliko modelu in prosite za ocenjeno število
  • D) Sprejemanje števila slikovnih pik kot števila celic brez kalibracije

Pojasnilo: Segmentacija in merjenje celic ni domena splošnega jezikovnega modela, temveč specializiranih slikovnih modelov (Cellpose, StarDist), ki so posebej usposobljeni za to nalogo. Jezikovni model napiše kodo, ki kliče ta orodja; Ekspertni model opravi meritev, biolog pa preveri rezultat.

3. Podiplomski študent uvodu svoje diplomske naloge doda 8 virov, ki jih ustvari jezikovni model. Svetovalec ugotovi, da 3 od teh sploh ne obstajajo. Kako bi to situacijo lahko preprečili?

  • A) Tako, da od modela zahtevate, da ponovno proizvede vire
  • B) Z izbiro samo citatov z DOI (če je DOI, je pravi)
  • C) Zahtevanje seznama z navodilom, da se model "prilega"
  • D) Neodvisno preverjanje vsakega citata na PubMed/doi.org in navajanje samo člankov, ki jih je prebral ✔

Pojasnilo: Splošni jezikovni modeli niso podatkovna zbirka literature; Namesto iskanja resničnih zapisov 'generira' realistično zveneče pripise (izmišljeno pripisovanje). Vsak avtor in DOI se ne sme uporabljati brez neodvisnega preverjanja v virih, kot je PubMed/doi.org, in samo pri citiranju člankov, ki so bili dejansko prebrani.

4. Kateri je najmočnejši način za zagotovitev točnosti kode za čiščenje podatkov, ki jo je napisala umetna inteligenca?

  • A) Če koda deluje brez napak, jo sprejmite kot pravilno.
  • B) Testiranje rezultata z majhnim znanim vzorcem in preverjanje pričakovanja z assert ✔
  • C) Vprašajte model "je koda pravilna?" sprašujem in zaupam odgovoru "da"
  • D) Večkrat zaženite kodo in vsakič dobite enak rezultat

Opomba: samo zato, ker koda deluje brez napak, še ne pomeni, da je pravilna; 'napačna koda deluje brez napak' je najbolj nevarna situacija v biologiji. Testiranje z majhnim vzorcem, katerega rezultat poznate vnaprej, in vdelava pričakovanja v kodo z assert je najmočnejši ščit pred tihimi napačnimi rezultati.

5. V analizi RNA-seq je testiranih 20.000 genov in ugotovljeno je, da je 3.800 genov 'pomembnih' s p<0,05 brez popravka. Kaj je glavna težava pri tem sklepu?

  • A) Število vzorcev je preveliko, zmanjšati ga je treba
  • B) p prag je previsok, uporabiti bi morali 0,10
  • C) Popravek večkratne primerjave (FDR) ni bil izveden; Veliko je lažno pozitivnih rezultatov ✔
  • D) Namesto genov bi morali testirati vzorce

Pojasnilo: Ko testirate na tisoče genov hkrati, se mnogi geni po naključju zdijo 'pomembni', tudi če ni prave razlike; To se imenuje problem večkratne primerjave. Rešitev je uporaba popravka FDR (stopnja napačnega odkrivanja) z metodo, kot je Benjamini-Hochberg; S popravkom se seznam običajno zmanjša na desetine do nekaj sto genov.

6. Najboljše ujemanje v rezultatu BLAST ima E-vrednost 2,0. Kaj to pomeni?

  • A) Ujemanje je najverjetneje naključno; ✔ ni zanesljivo ujemanje
  • B) Sklopka je zelo močna; Večja kot je e-vrednost, tem bolje
  • C) Zaporedje se je ujemalo s stopnjo 2 %
  • D) Med obema zaporedjema sta 2 bazni razliki

Pojasnilo: E-vrednost kaže, da je pričakovano ujemanje naključno; Bolje je biti majhen. E-vrednost, večja od 1, pomeni, da je ujemanje najverjetneje naključno. Za zanesljiva ujemanja se običajno iščejo zelo majhni pragovi, kot je e < 1e-5.

7. V modelu AlphaFold kaže terminalna regija proteina nizko oceno pLDDT (<50). Kako naj si razlagamo to regijo?

  • A) AlphaFold je naredil napako v tej regiji, regijo je treba odstraniti iz analize
  • B) Ta regija je zagotovo alfa vijačnica
  • C) Model je popolnoma nezanesljiv, strukture se ne sme uporabljati
  • D) Področje je verjetno nepravilno/elastično; je treba razlagati kot "nejasno" in ne kot "napačno" ✔

Opis: pLDDT je lokalni rezultat zaupanja za vsako aminokislino; Vrednosti pod 50 pogosto odražajo resnično nepravilne (prilagodljive, nefiksne) regije. Napačno je samodejno brisati te regije kot "napačne ugibanja"; Nizek rezultat je treba brati kot "negotov/prilagodljiv" in ovrednotiti je treba njegov biološki pomen.

8. Raziskovalec poroča o celičnih površinah le v slikovnih pikah in rezultati niso v skladu z literaturo. Kateri korak manjka?

  • A) Prešteti bi morali več celic
  • B) Kalibracija lestvice (pretvorba slikovnih pik v mikrometer) ni bila izvedena, rezultati niso bili pretvorjeni v fizične enote ✔
  • C) Orodje za segmentacijo ni bilo pravilno izbrano
  • D) Ločljivost slike je previsoka

Pojasnilo: Kalibracija merila (koliko mikrometrov na slikovno piko) je bistvena za pridobivanje fizične velikosti iz slike. Če ta korak preskočite, vrednosti ostanejo neprimerljive, odvisno od nastavitve mikroskopa. Površine je treba pretvoriti v fizične enote, kot so kvadratni mikrometri.

9. Študent vzame 10 vzorcev tkiva ene miške in v statistiki uporabi 'n=10'. Zakaj je to napačno?

  • A) 10 vzorcev je premalo za statistiko, potrebnih je vsaj 30
  • B) Vzorce tkiv je bilo treba vzeti iz različnih organov
  • C) Teh 10 primerov so tehnične ponovitve; biološki n je še vedno 1, to je tako imenovano ponavljanje ✔
  • D) Vzorci so neveljavni, ker so bili odvzeti na isti dan

Pojasnilo: Ponavljajoče se meritve pri istem posamezniku so tehnične ponovitve; kjer je statistični n število bioloških enot (tukaj miši). Upoštevanje tehničnega ponavljanja kot biološkega (psevdoreplikacija) ustvarja lažen pomen. Pravilno oblikovanje pomeni delo z več posamezniki.

10. Ena analiza je pokazala p=0,03. Kakšna je pravilna razlaga te vrednosti?

  • A) Obstaja 3 % možnost, da vidimo ta ali bolj ekstremen rezultat, čeprav v resnici ni nobene razlike ✔
  • B) Verjetnost, da je učinek resničen, je 97 %
  • C) Verjetnost, da je ničelna hipoteza resnična, je 3 %
  • D) Rezultat je 97 % ponovljiv

Pojasnilo: p-vrednost ni 'verjetnost, da je hipoteza resnična' ali 'verjetnost, da je učinek resničen'. P-vrednost je verjetnost, da opazimo razliko, ki je enaka ali bolj ekstremna od opažene, ko razlike dejansko ni. Zato p=0,03 ne pomeni, da je "učinek 97 % resničen"; rezultate je treba ovrednotiti tudi glede na velikost učinka in interval zaupanja.

11. V predstavitvi je 3-odstotna razlika med dvema skupinama prikazana kot ogromna s stiskanjem osi y na območje 95-100. Česa je to primer?

  • A) dobra tehnika vizualizacije; poudarja razliko
  • B) Težava z barvno slepoto prijazno paleto
  • C) Sprejemljiva stilska izbira
  • D) Zavajajoč in nepošten grafikon, ki pretirava razliko s prirezano osjo ✔

Pojasnilo: Neinicializacija osi od nič (prirezana os) zavede gledalca z vizualnim pretiravanjem majhne razlike. To je kršitev načela poštenja; Zlasti pri paličnih grafikonih se mora os začeti od nič, razlika pa mora biti prikazana z njeno dejansko velikostjo.

12. Raziskovalec prilepi tisto, za kar misli, da so anonimni podatki o pacientovem eksomu, v javni jezikovni model, da se analizira. Zakaj je to vedenje problematično?

  • A) Ni problema; podatke je mogoče deliti, če so anonimni
  • B) Zagotavljanje občutljivih podatkov o bolnikih v odprtem modelu je kršitev zasebnosti in etike/pravne (KVKK/GDPR) in je ni mogoče razveljaviti ✔
  • C) Problem je samo zato, ker bo analiza počasna
  • D) Model je problematičen, ker ne razume podatkov

Opis: Genetski/klinični podatki pacienta so izjemno občutljivi; Tudi genomske podatke, za katere velja, da so anonimni, je mogoče ponovno identificirati. Zagotavljanje teh podatkov javnemu modelu krši odobritve KVKK/GDPR in odbora za etiko (IRB) ter je nepopravljiva kršitev zasebnosti. Občutljive podatke je treba obdelovati v lokalnih/varnih pogodbenih okoljih.

13. V neki študiji je bila razlika, za katero so mislili, da je "pacient proti kontroli", dejansko posledica obdelave vzorcev na dva različna dneva. Kako se imenuje ta situacija in kako jo obravnavati?

  • A) To je izstopajoči učinek; pike je treba izbrisati
  • B) Gre za pomanjkanje normalizacije; zadostuje le popravek merila
  • C) To je serijski učinek; je treba v načrtu uravnotežiti in dodati modelu kot paketno spremenljivko ✔
  • D) p-hekanje; test je treba spremeniti

Pojasnilo: Tehnična razlika zaradi serije vzorčenja/dneva obdelave se imenuje učinek serije in jo je mogoče zamenjati z biološko razliko. Pravilen pristop je uravnotežiti serije v načrtu in dodati spremenljivko serije v statistični model (npr. '~serija + pogoj'), s čimer ločimo tehnični signal od biološkega signala.

14. Želite izračunati GC razmerje zaporedja DNK. Kateri je pravilen in ponovljiv pristop?

  • A) Natisnite kodo, ki izračuna stopnjo GC z Biopythonom, jo zaženite in uporabite izhod ✔
  • B) Dajte modelu zaporedje in ga prosite, naj ustno pove stopnjo GC
  • C) Potrditev razmerja, podanega z modelom, z drugim modelom
  • D) Pogled na prvih 100 črk serije in ugibanje na oko

Pojasnilo: stopnja GC je deterministični izračun; mora temeljiti na kodi, ki obdeluje matriko, ne na vrednosti, ki si jo jezikovni model 'zapomni'. Namesto da bi jo model izračunal, boste natisnili kodo za izračun z orodjem, kot je Biopython, in jo zagnali sami, zagotovili natančen rezultat, ki daje enak rezultat vsakič, ko jo zaženete.