Dobički:
- Razumevanje, zakaj so genetski podatki posebna kategorija osebnih podatkov in tveganje ponovne identifikacije
- Sposobnost uporabe načel anonimizacije, privolitve in minimizacije podatkov, preden zagotovite podatke o pacientih za odprta orodja umetne inteligence
- Sposobnost sprejemanja meja obdelave genetskih podatkov in poklicne etične odgovornosti znotraj okvirov, kot je KVKK/GDPR
Genetski podatki niso običajni osebni podatki. zaporedje DNK osebe; Edinstveno vas identificira, ni ga mogoče spremeniti (lahko spremenite geslo, ne pa tudi genoma), lahko razkrije prihodnja tveganja bolezni in ne zadeva samo posameznika, temveč vse krvno povezane družinske člane. Zato uporaba umetne inteligence (AI) pri delu z genetskimi podatki zahteva najvišji standard zaupnosti in etike. V tej enoti boste izvedeli, zakaj je treba genetske podatke posebej varovati, katere napake imajo resne posledice pri uporabi orodij AI in varno delovno disciplino.
Ključno načelo: Nikoli ne prilepite določljivih genetskih podatkov bolnikov v javno dostopno orodje AI. Številne storitve umetne inteligence za splošne namene lahko obdelajo podatke, ki jih vnesete, jih shranijo ali uporabijo za izboljšanje modela. Ko se v orodje vnese pacientova kombinacija redke različice, ime, identifikacijska številka ali datum rojstva, lahko pride do nepopravljive kršitve zasebnosti.
Pet lastnosti, zaradi katerih so genetski podatki posebni
- Invariantnost: Genom je enak vse življenje; če je razkrito, ga ni mogoče "preklicati".
- Identiteta: Celo majhno število redkih različic lahko enolično identificira osebo; Podatke, za katere velja, da so "anonimni", je mogoče ponovno identificirati.
- Velikost družine: Človekov genom vsebuje tudi genetske informacije njegovih sorodnikov; informacije se lahko razkrijejo brez njihove privolitve.
- Predvidljivost: Lahko kaže na prihodnje tveganje bolezni; Zavarovanje je lahko razlog za diskriminacijo pri zaposlovanju.
- Tveganje ponovne identifikacije: genomske podatke je mogoče povezati z identiteto s križanjem z drugimi zbirkami podatkov.
Pravni okvir: kratek pregled
Genetski podatki so v zakonodaji o varstvu podatkov v kategoriji posebnih (občutljivih) osebnih podatkov in so strožje varovani. V Turčiji KVKK (Zakon o varstvu osebnih podatkov) obravnava zdravstvene in genetske podatke kot posebne podatke in njihovo obdelavo praviloma veže na izrecno privolitev ali posebne izjeme. V Evropi GDPR podobno varuje genetske podatke kot posebno kategorijo. V ZDA zakon GINA prepoveduje diskriminacijo pri zavarovanju in zaposlovanju na podlagi genetskih informacij. Čeprav se podrobnosti razlikujejo glede na državo, je skupno načelo enako: genetskih podatkov ni mogoče obdelovati brez izrecnega soglasja, omejitve namena in močne zaščite.
Nasvet: Ko od pacienta pridobite soglasje za genetsko testiranje, lahko razkritje vključuje, kako bodo podatki obdelani z orodji AI. "S katerimi orodji in kje obdelujemo vaše podatke za analizo?" Bodite sposobni transparentno odgovoriti na vprašanje.
Korak za korakom: uporaba varne umetne inteligence s tajnimi genetskimi podatki
1. Razvrsti. Ali je mogoče identificirati podatke, ki jih imate? Ali vsebuje kombinacijo imena, ID številke, datuma, redke različice?
2. Anonimiziraj ali sploh ne prenašaj. Odstranite neposredne identifikatorje; Vendar ne pozabite, da "anonimizacija" v genetskih podatkih ne zagotavlja popolnega zagotovila. Najbolj varno je, da osebnih podatkov v odprto vozilo sploh ne vnašate.
3. Preberite politiko podatkov orodja. Izberite orodja, ki so podjetja, imajo pogodbo o obdelavi podatkov (DPA), obljubite, da ne boste uporabljali podatkov v izobraževanju, in po možnosti delajte lokalno/tesno.
4. Ločite konceptualna vprašanja od podatkov. "Kako uporabiti ACMG PM2?" Umetni inteligenci lahko postavite konceptualna vprašanja, kot so; Za to niso potrebni nobeni podatki o bolniku. Podatke uporabljajte le po potrebi in v anonimni obliki.
5. Shranite sled. Dokumentirajte, katere podatke obdelujete, s katerim orodjem in za kakšen namen; Revidabilnost je etična in pravna zahteva.
trije mini kovčki
Primer 1 – Prilepljeno poročilo. Zaradi hitrosti je pomočnik prilepil poročilo, ki je vsebovalo pacientovo polno ime in seznam različic, v splošni klepet z umetno inteligenco in rekel "povzemi". Starejši specialist je to ugotovil: ime in redka različica sta skupaj identificirala pacienta, orodje pa je shranilo podatke. Incident je zahteval obvestilo o kršitvi zasebnosti. Nauk: nobeni identifikacijski podatki se ne prenesejo, niti za povzetek.
Primer 2 – Soglasje družine. Med uporabo pacientovih podatkov je raziskovalec AI povedal, da je bila različica najdena tudi pri njegovem bratu in sestri. Brat pa ni privolil v obdelavo njegovih podatkov. Družinski vidik genetskih podatkov je prav tako postavil pod vprašaj zasebnost tretjih oseb; Preiskovalec je pridobil podatke o bratu.
Primer 3 – Pridobljena potrditev. En laboratorij je pred analizo uvedel "kontrolni seznam anonimizacije". Izluščili so imena, identifikacijske številke in datume, preden so jih dali AI; Poleg tega so ugotovili, da lahko samo zelo redka kombinacija različic določi identiteto in tega vzorca sploh niso prijavili. Brez kontrolnega seznama bi lahko podatke, ki naj bi bili "anonimni", ponovno identificirali.
Štiri predloge za kopiranje
1) Nadzor anonimizacije:
Preden to besedilo vnesete v orodje AI, navedite VSE elemente v njem (ime, ID številka, datum, naslov, redka kombinacija različic, redek fenotip), ki bi lahko identificirali pacienta ali njegove sorodnike. Za vsakega predlagajte "izpusti" ali "sploh ne prenašajte vzorca": [besedilo].
2) Konceptualno vprašanje (brez podatkov):
BREZ izmenjave podatkov o bolnikih, odgovorite na to konceptualno vprašanje: [vprašanje ACMG/methods]. Uporabite običajne primere; Ne želim resničnih informacij o pacientu.
3) Nadzor soglasja in preglednosti:
Pomagajte mi pripraviti besedilo informacij/soglasja za genetsko testiranje. Vključevati mora: za kakšne namene bodo podatki obdelani, s katerimi vrstami orodij bodo analizirani, kako se bodo obravnavali rezultati v zvezi z družinskimi člani, shranjevanje in brisanje. Za pravno odločitev se obrnite na enoto za pravno/etiko.
4) Merila za izbiro vozila:
Katera merila zasebnosti (pogodba o obdelavi podatkov, zaveza, da se ne bo uporabljalo v izobraževanju, lokalno delovanje, nadzor dostopa, brisanje) naj vprašam, ko izbiram AI/orodje za analizo, ki bo obdelovalo občutljive genetske podatke? Ustvari se kontrolni seznam za vrednotenje.
Šibek poziv/močan poziv
Slabo: "Komentirajte rezultat BRCA1 Ahmeta Yılmaza (TC: ...): [celoten seznam različic]."
Težava: neposredni identifikator + genetski podatki gredo v odprto orodje; huda kršitev zaupnosti.
Güçlü: "Ne da bi koga identificirali, na splošnem primeru razložite, kako je različica premika okvirja v BRCA1 ocenjena na ACMG. Ne delim dejanskih podatkov o bolnikih."
Zakaj je zmogljiv: Potreba po učenju/evalvaciji je izpolnjena, vendar se ne prenesejo identifikacijski podatki.
Vrsta podatkov
Ali vstopi v odprto orodje AI?
alternativa
Ime pacienta/identifikacijska številka
nikoli
Brez prenosa
Redka varianta + zgodovina
Nikoli (prepozna)
Prenesite vzorec
konceptualno vprašanje
ja
Splošni primer
Anonimen, pogost primer
previden
Podjetje/lokalno orodje
Zbrane, anonimne statistike
odvisno od situacije
Vozilo z DPA
Pogoste napake
- Lepljenje identifikacijskih podatkov kot »samo za povzetek«. Ne glede na namen, gre za kršitev.
- Zamenjajte "anonimizacijo" za genetske podatke kot popolno varnost. Možna je ponovna identifikacija.
- Pozabite na družinski vidik. Podatki osebe razkrivajo tudi njene sorodnike.
- Ne bere podatkovne politike vozila. Podatki se lahko uporabijo ali shranijo pri usposabljanju.
- Ne vodenje evidence. Če ni obvladljivosti, odgovornosti ni mogoče dokazati.
Pozor: kršitve zasebnosti večinoma ne izhajajo iz zlonamernega namena, ampak iz refleksa "pohitite". Največje tveganje je nespametno lepljenje poročila v okno za klepet v priložnostnem poteku dela. Upočasni; Za genetske podatke ni gumba za razveljavitev.
Globina: prava matematika ponovne identifikacije in varnih arhitektur
Zakaj je napačno misliti "izbrisal sem ime, zdaj je anonimno"? Ker za identifikacijo osebe ni potrebe po imenu; Zadostuje kombinacija redkih lastnosti. Po klasični ugotovitvi lahko trio datum rojstva + spol + poštna številka izpostavi veliko večino prebivalstva ZDA. V genetiki je situacija bolj zaostrena: kombinacija več redkih variant (vsaka se pojavi celo pri enem od tisoč v populaciji, skupaj manj kot ena od milijona) kaže na enega samega posameznika. Še več, genomske podatke je mogoče križati z rodoslovnimi zbirkami podatkov, da posameznika povežemo z identiteto sorodnika, tudi če posameznik nikjer drugje ni posredoval nobenih podatkov – resnična oblika napada, ki je bila prikazana v literaturi.
Ohranjanje torej zahteva arhitekturne odločitve, ki presegajo refleks "brisanja identifikatorjev". Praktične možnosti: uporaba lokalnih/samostujočih modelov, da podatki nikoli ne ostanejo zunaj meja institucije; če se bo uporabljal oblak, izberite ravni podjetja s pogodbo o obdelavi podatkov (DPA) in zavezo, da "vhodnih podatkov ne boste uporabljali pri usposabljanju"; delo z izpeljanimi, združenimi informacijami namesto z neobdelanimi podatki o pacientu, kadar koli je to mogoče; in omejevanje dostopa na načelo najmanjših privilegijev.
Konkreten primer: center je povzel "anonimno" serijo primerov v splošno orodje AI. Nabor podatkov ni vseboval imen, vendar je imel vsak bolnik kombinacijo redke diagnoze + starosti + mesta; Če ga križamo s poročilom lokalnega časopisa, lahko identificiramo bolnika. Odsotnost neobdelanih identifikatorjev ni preprečila ponovne identifikacije.
zaščitni sloj
Kaj zagotavlja
omejitev
Brisanje identifikatorja
Neposredno odstrani ID
Ostajajo redke kombinacije
Lokalni/samostojni model
Podatki ne zapustijo institucije
Breme namestitve/vzdrževanja
DPA+ se ne uporablja v izobraževanju
Pravno/pogodbeno zavarovanje
Treba je prebrati pravilnik
Združevanje/izpeljava
Zmanjša posamezne brazgotine
Omejuje globino analize
Če povzamem
- Genetski podatki so posebni, nespremenljivi, identifikacijski in družinski podatki; zahteva najvišji standard zaščite.
- Določljivi genetski podatki bolnikov se nikoli ne vnesejo v odprta orodja AI; konceptualna vprašanja so ločena od podatkov.
- Ogrodja, kot so KVKK, GDPR, GINA, zahtevajo izrecno privolitev, omejitve namena in močno zaščito.
- Anonimizacija ni popolno zagotovilo; Najbolj varno je, da kritičnih podatkov sploh ne prenašate.
Aplikacijska naloga
Prejmite vzorec (izmišljenega) genetskega poročila. Z uporabo predloge 1 navedite vse identifikacijske elemente v njej in se odločite, ali boste za vsakega »izpustili« ali »brez prenosa«. Nato prepišite isto klinično vprašanje brez identifikacijskih podatkov (z uporabo logike predloge 2). Opišite razliko v zasebnosti med obema različicama v enem stavku.
kontrolni seznam
- [ ] Podatke sem razvrstil glede na identiteto.
- [ ] V odprto orodje nisem vnesel osebno določljivih podatkov.
- [ ] Opazil sem, da je mogoče identificirati kombinacijo redkih variant.
- [ ] Preveril sem politiko podatkov orodja (zadrževanje, usposabljanje, DPA).
- [ ] Upošteval sem družinski vidik in soglasje tretje osebe.
- [ ] Posnel sem sled transakcije in jo po potrebi posredoval etični/pravni enoti.