Dobici:
- Razumijevanje zašto su genetski podaci posebna kategorija ličnih podataka i rizik ponovne identifikacije
- Sposobnost primjene principa anonimizacije, pristanka i minimizacije podataka prije pružanja podataka o pacijentima otvorenim alatima umjetne inteligencije
- Sposobnost da se prihvate granice genetske obrade podataka i profesionalne etičke odgovornosti u okvirima kao što su KVKK/GDPR
Genetski podaci nisu obični lični podaci. DNK sekvenca osobe; On vas jedinstveno identifikuje, ne može se promijeniti (možete promijeniti svoju lozinku, ali ne i genom), može otkriti buduće rizike od bolesti i tiče se ne samo pojedinca već i svih članova porodice koji su povezani s krvlju. Stoga, upotreba umjetne inteligencije (AI) pri radu s genetskim podacima zahtijeva najviši standard povjerljivosti i etike. U ovoj cjelini naučit ćete zašto genetski podaci moraju biti posebno zaštićeni, koje greške imaju ozbiljne posljedice pri korištenju AI alata i bezbednu radnu disciplinu.
Kritični princip: Nikada nemojte lijepiti genetske podatke pacijenata koji se mogu identificirati u javno dostupan AI alat. Mnoge AI usluge opće namjene mogu obraditi podatke koje unesete, pohraniti ih ili koristiti za poboljšanje modela. Kada se pacijentova rijetka kombinacija varijanti, ime, identifikacijski broj ili datum rođenja unesu u alat, može doći do nepovratnog kršenja privatnosti.
Pet karakteristika koje genetske podatke čine posebnim
- Invarijantnost: Genom je isti tokom života; ako se otkrije, ne može se "poništiti".
- Identitet: čak i mali broj rijetkih varijanti može jedinstveno identificirati osobu; Podaci za koje se smatra da su "anonimni" mogu se ponovo identifikovati.
- Veličina porodice: Genom osobe takođe sadrži genetske informacije njenih rođaka; informacije mogu biti otkrivene bez njihovog pristanka.
- Predvidljivost: Može ukazivati na budući rizik od bolesti; Osiguranje može biti osnov za diskriminaciju pri zapošljavanju.
- Rizik ponovne identifikacije: Genomski podaci se mogu povezati sa identitetom ukrštanjem sa drugim bazama podataka.
Pravni okvir: kratak pregled
Genetski podaci spadaju u kategoriju posebnih (osjetljivih) ličnih podataka u zakonodavstvu o zaštiti podataka i strože su zaštićeni. U Turskoj, KVKK (Zakon o zaštiti ličnih podataka) smatra zdravstvene i genetske podatke posebnim podacima i, po pravilu, vezuje njihovu obradu uz izričit pristanak ili posebne izuzetke. U Evropi, GDPR na sličan način štiti genetske podatke kao posebnu kategoriju. U SAD, GINA zakon zabranjuje diskriminaciju u osiguranju i zapošljavanju zasnovanu na genetskim informacijama. Iako se detalji razlikuju od zemlje do zemlje, zajednički princip je isti: genetski podaci ne mogu se obraditi bez izričitog pristanka, ograničenja svrhe i jake zaštite.
Savjet: Prilikom dobivanja pristanka za genetsko testiranje od pacijenta, otkrivanje može uključivati kako će podaci biti obrađeni pomoću AI alata. "Kojim alatima i gdje obrađujemo vaše podatke za analizu?" Budite u poziciji da transparentno odgovorite na pitanje.
Korak po korak: korištenje sigurnog AI s tajnim genetskim podacima
1. Klasifikujte. Da li se podaci koje posjedujete mogu identificirati? Da li sadrži kombinaciju imena, matičnog broja, datuma, rijetke varijante?
2. Anonimizirajte ili ne prenosite uopće. Uklonite direktne identifikatore; Ali zapamtite, "anonimizacija" u genetskim podacima ne daje potpunu sigurnost. Najsigurnije je ne unositi lične podatke u otvoreno vozilo.
3. Pročitajte politiku podataka alata. Odaberite alate koji su korporativni, imaju ugovor o obradi podataka (DPA), obećajte da nećete koristiti podatke u obrazovanju i po mogućnosti raditi lokalno/blisko.
4. Odvojite konceptualna pitanja od podataka. "Kako primijeniti ACMG PM2?" Možete postaviti konceptualna pitanja AI kao što su; Za to nisu potrebni podaci o pacijentu. Koristite podatke samo kada je potrebno i u anonimnom obliku.
5. Sačuvajte trag. Dokumentirajte koje podatke obrađujete, kojim alatom i u koju svrhu; Revizija je etički i pravni zahtjev.
tri mini kofera
Slučaj 1 — Zalijepljen izvještaj. Radi brzine, asistent je zalijepio izvještaj koji sadrži puno ime pacijenta i listu varijanti u opći AI chat i rekao "sažmi". Viši specijalista je to shvatio: ime i rijetka varijanta zajedno su identificirali pacijenta, a alat je pohranio podatke. Incident je zahtijevao obavještenje o povredi privatnosti. Lekcija: nikakvi identifikacioni podaci se ne prenose, čak ni za sažetak.
Slučaj 2 — Pristanak porodice. Dok je koristio podatke o pacijentu, istraživač je rekao AI da je varijanta pronađena i kod njegovog brata i sestre. Međutim, brat nije pristao na obradu njegovih podataka. Porodični aspekt genetskih podataka je takođe doveo u pitanje privatnost trećih strana; Istražitelj je izvukao informacije o bratu.
Slučaj 3 — Potvrda dobijena. Jedna laboratorija je prije analize implementirala „kontrolnu listu anonimizacije“. Izvukli su imena, identifikacione brojeve i datume pre nego što su ih dali AI; Štaviše, shvatili su da vrlo rijetka kombinacija varijanti sama po sebi može odrediti identitet i uopće nisu prijavili taj uzorak. Bez kontrolne liste, podaci za koje se smatralo da su "anonimni" mogli bi biti ponovo identifikovani.
Četiri šablona za kopiranje
1) Kontrola anonimizacije:
Prije nego što unesete ovaj tekst u AI alat, navedite SVE elemente u njemu (ime, ID broj, datum, adresa, rijetka kombinacija varijanti, rijedak fenotip) koji bi mogli identificirati pacijenta ili njegove rođake. Za svaki, predložite "izostavite" ili "nemojte uopće prenositi uzorak": [tekst].
2) Konceptualno pitanje (bez podataka):
BEZ dijeljenja podataka o pacijentu, odgovorite na ovo konceptualno pitanje: [ACMG/pitanje o metodama]. Koristite uobičajene primjere; Ne želim prave informacije o pacijentima.
3) Kontrola saglasnosti i transparentnosti:
Pomozite mi da nacrtam tekst informacije/pristanka za genetsko testiranje. Trebalo bi da sadrži: u koje svrhe će se podaci obrađivati, pomoću kojih vrsta alata će se analizirati, kako će se postupati s rezultatima koji se tiču članova porodice, pohranjivanje i brisanje. Za pravnu odluku obratite se pravnoj/etičkoj jedinici.
4) Kriterijumi za odabir vozila:
Koje kriterijume privatnosti (ugovor o obradi podataka, obaveza da se ne koriste u obrazovanju, lokalni rad, kontrola pristupa, brisanje) treba da pitam kada biram AI/alat za analizu koji će obraditi osetljive genetske podatke? Kreirana je lista za provjeru evaluacije.
Slaba prompt / Jaka prompt
Slabo: "Komentar Ahmeta Yılmaza (TC: ...) BRCA1 rezultat: [cijela lista varijanti]."
Problem: Direktni identifikator + genetski podaci ulaze u otvoreni alat; grubo kršenje povjerljivosti.
Güçlü: "Bez identifikacije bilo koga, objasnite koristeći opći primjer kako se varijanta pomaka okvira u BRCA1 procjenjuje u ACMG-u. Ne dijelim stvarne podatke o pacijentu."
Zašto je moćan: Potreba za učenjem/evaluacijom je zadovoljena, ali se ne prenose podaci za identifikaciju.
Tip podataka
Da li ulazi u otvoreni AI alat?
alternativa
Ime pacijenta/matični broj
nikad
Nema transfera
Rijetka varijanta + istorijat
nikad (identifikuje)
Prenesite uzorak
konceptualno pitanje
Da
Opšti primjer
Anonimno, uobičajen primjer
oprezno
Poslovni/lokalni alat
Zbirna, anonimna statistika
zavisno od situacije
Vozilo sa DPA
Uobičajene greške
- Lijepljenje identifikacijskih podataka kao "samo za sažetak". Bez obzira na svrhu, to je kršenje.
- Greška "anonimizacija" za genetske podatke kao potpunu sigurnost. Ponovna identifikacija je moguća.
- Zaboravljanje porodičnog aspekta. Podaci o osobi otkrivaju i njene rođake.
- Ne čitanje politike podataka o vozilu. Podaci se mogu koristiti ili pohraniti u treningu.
- Ne vodi evidenciju. Ako nema mogućnosti kontrole, odgovornost se ne može dokazati.
Oprez: U većini slučajeva, kršenja privatnosti ne proizlaze iz zle namjere, već iz refleksa "uhvati brzo". Najveći rizik je bezobzirno lijepljenje izvještaja u prozor za ćaskanje u ležernom toku rada. Uspori; Ne postoji dugme za poništavanje genetskih podataka.
Dubina: prava matematika ponovne identifikacije i sigurne arhitekture
Zašto je pogrešno misliti "izbrisao sam ime, sada je anonimno"? Zato što nema potrebe za imenom za identifikaciju osobe; Kombinacija rijetkih karakteristika je dovoljna. Prema klasičnom nalazu, trio datum rođenja + spol + poštanski broj može izdvojiti veliku većinu stanovništva SAD-a. U genetici je situacija oštrija: kombinacija nekoliko rijetkih varijanti (svaka se javlja čak i kod jedne od hiljadu u populaciji, zajedno manje od jedne od milion) ukazuje na jednu jedinku. Štaviše, genomski podaci se mogu ukrstiti s genealoškim bazama podataka kako bi se pojedinac povezao s identitetom rođaka čak i ako pojedinac nije dao nikakve podatke nigdje drugdje - pravi oblik napada koji je demonstriran u literaturi.
Dakle, očuvanje zahtijeva arhitektonske odluke koje idu dalje od refleksa "brisanje identifikatora". Praktične opcije: korištenje lokalnih/samo-hostovanih modela kako se podaci nikada ne ostavljaju izvan granica institucije; ako će se koristiti oblak, odaberite nivoe preduzeća sa ugovorom o obradi podataka (DPA) i obavezom da se "neće koristiti ulaz u obuci"; rad sa izvedenim, agregiranim informacijama, a ne sirovim podacima specifičnim za pacijenta kad god je to moguće; i ograničavanje pristupa principu najmanje privilegija.
Konkretan slučaj: centar je sažeo "anonimnu" seriju slučajeva u opšti AI alat. Skup podataka nije sadržavao imena, ali je svaki pacijent imao kombinaciju rijetke dijagnoze + godine + grad; Kada se ukrsti sa izvještajem lokalnih novina, pacijent se može identificirati. Odsustvo neobrađenih identifikatora nije isključilo ponovnu identifikaciju.
zaštitni sloj
Šta pruža
limit
Brisanje identifikatora
Direktno uklanja ID
Ostale su rijetke kombinacije
Lokalni/samostalni model
Podaci ne napuštaju instituciju
Teret instalacije/održavanja
DPA+ se ne koristi u obrazovanju
Pravno/ugovorno osiguranje
Potrebno je pročitati politiku
Agregacija/derivacija
Smanjuje pojedinačni ožiljak
Ograničava dubinu analize
Ukratko
- Genetski podaci su posebni, nepromjenjivi, identifikacijski i porodični podaci; zahtijeva najviši standard zaštite.
- Genetski podaci pacijenata koji se mogu identifikovati nikada se ne unose u otvorene AI alate; konceptualna pitanja su odvojena od podataka.
- Okviri kao što su KVKK, GDPR, GINA zahtijevaju izričit pristanak, ograničenja svrhe i snažnu zaštitu.
- Anonimizacija nije potpuna garancija; Najsigurnije je uopće ne prenositi kritične podatke.
Zadatak aplikacije
Primite uzorak (izmišljenog) genetskog izvještaja. Koristeći predložak 1, navedite sve identifikacijske elemente u njemu i odlučite da li ćete za svaki "izostaviti" ili "nema prijenosa". Zatim prepišite isto kliničko pitanje bez ikakvih identifikacionih podataka (koristeći logiku šablona 2). Opišite razliku u privatnosti između dvije verzije u jednoj rečenici.
kontrolna lista
- [ ] Klasifikovao sam podatke u smislu identiteta.
- [ ] Nisam uneo lične podatke u otvoreni alat.
- [ ] Primetio sam da se može identifikovati kombinacija retkih varijanti.
- [ ] Provjerio sam politiku podataka alata (zadržavanje, obuka, DPA).
- [ ] Uzeo sam u obzir porodični aspekt i saglasnost treće strane.
- [ ] Snimio sam trag transakcije i proslijedio ga etičkoj/pravnoj jedinici kada je to bilo potrebno.