Jednostka 10 / 11

Etyka, prywatność i ochrona danych: szczególna odpowiedzialność za dane genetyczne

Zyski:

  • Zrozumienie, dlaczego dane genetyczne stanowią szczególną kategorię danych osobowych i ryzyko ponownej identyfikacji
  • Możliwość zastosowania zasad anonimizacji, zgody i minimalizacji danych przed udostępnieniem danych pacjenta do otwartych narzędzi sztucznej inteligencji
  • Umiejętność uwzględnienia ograniczeń przetwarzania danych genetycznych i zawodowej odpowiedzialności etycznej w ramach takich jak KVKK/RODO

Dane genetyczne nie są zwykłymi danymi osobowymi. Sekwencja DNA osoby; Identyfikuje Cię w sposób unikalny, nie można go zmienić (możesz zmienić hasło, ale nie genom), może ujawnić przyszłe ryzyko choroby i dotyczy nie tylko danej osoby, ale wszystkich członków rodziny spokrewnionych krwią. Dlatego wykorzystanie sztucznej inteligencji (AI) podczas pracy z danymi genetycznymi wymaga najwyższych standardów poufności i etyki. Na tym module dowiesz się, dlaczego dane genetyczne muszą być szczególnie chronione, jakie błędy mają poważne konsekwencje przy korzystaniu z narzędzi AI oraz nauczysz się bezpiecznej dyscypliny pracy.

Najważniejsza zasada: nigdy nie wklejaj możliwych do zidentyfikowania danych genetycznych pacjenta do publicznie dostępnego narzędzia AI. Wiele usług AI ogólnego przeznaczenia może przetwarzać wprowadzane dane, przechowywać je lub wykorzystywać do ulepszania modelu. Kiedy do narzędzia zostanie wprowadzona rzadka kombinacja wariantów pacjenta, imię i nazwisko, numer identyfikacyjny lub data urodzenia, może nastąpić nieodwracalne naruszenie prywatności.

Pięć cech, które czynią dane genetyczne wyjątkowymi

  1. Niezmienność: genom jest taki sam przez całe życie; w przypadku ujawnienia nie można go „anulować”.
  2. Tożsamość: nawet niewielka liczba rzadkich wariantów może jednoznacznie zidentyfikować osobę; Dane uważane za „anonimowe” mogą zostać ponownie zidentyfikowane.
  3. Wielkość rodziny: genom danej osoby zawiera również informację genetyczną jej krewnych; informacje mogą zostać ujawnione bez ich zgody.
  4. Przewidywalność: może wskazywać przyszłe ryzyko choroby; Ubezpieczenie może być podstawą dyskryminacji w zatrudnieniu.
  5. Ryzyko ponownej identyfikacji: dane genomowe można powiązać z tożsamością poprzez skrzyżowanie z innymi bazami danych.

Ramy prawne: krótki przegląd

Dane genetyczne należą do kategorii specjalnych (wrażliwych) danych osobowych w przepisach dotyczących ochrony danych i są chronione bardziej rygorystycznie. W Turcji KVKK (ustawa o ochronie danych osobowych) uznaje dane zdrowotne i genetyczne za dane szczególne i co do zasady wiąże ich przetwarzanie z wyraźną zgodą lub specjalnymi wyjątkami. W Europie RODO podobnie chroni dane genetyczne jako kategorię specjalną. W USA prawo GINA zabrania dyskryminacji w zakresie ubezpieczeń i zatrudnienia ze względu na informację genetyczną. Chociaż szczegóły różnią się w zależności od kraju, ogólna zasada jest taka sama: danych genetycznych nie można przetwarzać bez wyraźnej zgody, ograniczenia celu i silnej ochrony.

Wskazówka: w przypadku uzyskiwania zgody pacjenta na badania genetyczne ujawnienie może obejmować sposób przetwarzania danych przez narzędzia AI. „Za pomocą jakich narzędzi i gdzie przetwarzamy Twoje dane do analizy?” Bądź w stanie odpowiedzieć na pytanie w sposób przejrzysty.

Krok po kroku: korzystanie z bezpiecznej sztucznej inteligencji z tajnymi danymi genetycznymi

1. Klasyfikuj. Czy dane, które posiadasz, mogą zostać zidentyfikowane? Czy zawiera kombinację imienia i nazwiska, numeru identyfikacyjnego, daty, rzadkiego wariantu?

2. Anonimizuj lub nie przesyłaj w ogóle. Usuń bezpośrednie identyfikatory; Pamiętaj jednak, że „anonimizacja” danych genetycznych nie daje pełnej pewności. Najbezpieczniej jest w ogóle nie wprowadzać danych osobowych do otwartego pojazdu.

3. Przeczytaj politykę dotyczącą danych narzędzia. Wybierz narzędzia, które są korporacyjne, mają umowę o przetwarzaniu danych (DPA), obiecaj, że nie będziesz wykorzystywać danych w edukacji i najlepiej działają lokalnie/blisko.

4. Oddziel pytania koncepcyjne od danych. „Jak zastosować ACMG PM2?” Możesz zadawać pytania koncepcyjne AI, takie jak: Nie są do tego potrzebne żadne dane pacjenta. Korzystaj z danych tylko wtedy, gdy jest to konieczne i w formie anonimowej.

5. Zapisz ślad. Dokumentuj, jakie dane przetwarzasz, za pomocą jakiego narzędzia i w jakim celu; Audytowalność jest wymogiem etycznym i prawnym.

trzy mini etui

Przypadek 1 — Wklejony raport. Aby przyspieszyć, asystent wkleił raport zawierający imię i nazwisko pacjenta oraz listę wariantów do ogólnego czatu AI i powiedział „podsumuj”. Starszy specjalista zdał sobie z tego sprawę: nazwa i rzadki wariant wspólnie zidentyfikowały pacjenta, a narzędzie zapisało dane. Incydent wymagał powiadomienia o naruszeniu prywatności. Lekcja: żadne dane identyfikacyjne nie są przesyłane, nawet w przypadku podsumowania.

Przypadek 2 – Zgoda rodziny. Korzystając z danych pacjenta, badacz powiedział AI, że wariant ten wykryto również u jego rodzeństwa. Brat nie wyraził jednak zgody na przetwarzanie jego danych. Rodzinny aspekt danych genetycznych również poddał w wątpliwość prywatność osób trzecich; Śledczy wydobył informacje o bracie.

Przypadek 3 – Uzyskane potwierdzenie. Jedno laboratorium wdrożyło „listę kontrolną anonimizacji” przed analizą. Wyodrębniali nazwiska, numery identyfikacyjne i daty, zanim przekazali je sztucznej inteligencji; Co więcej, zdali sobie sprawę, że sama bardzo rzadka kombinacja wariantów może określić tożsamość, i w ogóle nie zgłosili tej próbki. Bez listy kontrolnej dane uważane za „anonimowe” mogłyby zostać ponownie zidentyfikowane.

Cztery szablony do kopiowania

1) Kontrola anonimizacji:

Przed przesłaniem tego tekstu do narzędzia AI wymień WSZYSTKIE elementy (imię i nazwisko, numer identyfikacyjny, datę, adres, rzadką kombinację wariantów, rzadki fenotyp), które mogłyby zidentyfikować pacjenta lub jego krewnych. Dla każdego z nich zasugeruj „pomiń” lub „w ogóle nie przesyłaj próbki”: [tekst].

2) Pytanie koncepcyjne (bez danych):

BEZ udostępniania danych pacjenta, odpowiedz na pytanie koncepcyjne: [pytanie ACMG/metody]. Użyj typowych przykładów; Nie chcę prawdziwych informacji o pacjencie.

3) Kontrola zgody i przejrzystości:

Pomóż mi przygotować tekst informacji/zgody na badania genetyczne. Powinno zawierać: w jakim celu dane będą przetwarzane, za pomocą jakich narzędzi będą analizowane, w jaki sposób będą traktowane wyniki dotyczące członków rodziny, ich przechowywanie i usuwanie. Aby uzyskać decyzję prawną, zwróć się do działu prawnego/etyki.

4) Kryteria wyboru pojazdu:

Jakie kryteria prywatności (umowa o przetwarzaniu danych, zobowiązanie do nieużywania w edukacji, działanie lokalne, kontrola dostępu, usuwanie) powinienem zadać przy wyborze narzędzia AI/narzędzia analitycznego, które będzie przetwarzać wrażliwe dane genetyczne? Tworzona jest lista kontrolna oceny.

Słaba zachęta/silna zachęta

Słabe: „Skomentuj wynik Ahmeta Yılmaza (TC: ...) BRCA1: [pełna lista wariantów]”.

Problem: Identyfikator bezpośredni + dane genetyczne trafiają do otwartego narzędzia; rażące naruszenie poufności.

Güçlü: „Nie identyfikując nikogo, wyjaśnij na ogólnym przykładzie, jak wariant przesunięcia ramki odczytu w BRCA1 jest oceniany w ACMG. Nie udostępniam rzeczywistych danych pacjentów”.

Dlaczego jest potężny: potrzeba uczenia się/ewaluacji jest spełniona, ale nie są przesyłane żadne dane identyfikacyjne.

Typ danych

Czy wchodzi do otwartego narzędzia AI?

alternatywa

Imię i nazwisko pacjenta/numer identyfikacyjny

nigdy

Brak transferu

Rzadki wariant + historia

Nigdy (identyfikuje)

Przenieść próbkę

pytanie koncepcyjne

Tak

Ogólny przykład

Anonimowy, częsty przykład

ostrożny

Narzędzie korporacyjne/lokalne

Zagregowane, anonimowe statystyki

w zależności od sytuacji

Pojazd z DPA

Typowe błędy

  • Wklejenie danych identyfikujących jako „tylko dla podsumowania”. Niezależnie od celu jest to naruszenie.
  • Mylenie „anonimizacji” z danymi genetycznymi z całkowitym bezpieczeństwem. Możliwa jest ponowna identyfikacja.
  • Zapominając o aspekcie rodzinnym. Dane danej osoby ujawniają także jej krewnych.
  • Nieprzeczytanie polityki danych pojazdu. Dane mogą być wykorzystywane lub przechowywane podczas szkoleń.
  • Nie prowadzenie ewidencji osiągnięć. Jeśli nie ma możliwości kontrolowania, nie można wykazać odpowiedzialności.
Uwaga: w większości przypadków naruszenia prywatności nie wynikają ze złych zamiarów, ale z odruchu „zrób to szybko”. Największym ryzykiem jest bezmyślne wklejanie raportu do okna czatu w zwykłym trybie pracy. Kierowco zwolnij; W przypadku danych genetycznych nie ma przycisku cofania.

Głębokość: prawdziwa matematyka ponownej identyfikacji i bezpiecznych architektur

Dlaczego błędne jest myślenie: „Usunąłem to imię, teraz jest anonimowe”? Ponieważ nie ma potrzeby używania imienia, aby zidentyfikować osobę; Wystarczy kombinacja rzadkich funkcji. Według klasycznego badania, trio składające się z daty urodzenia, płci i kodu pocztowego pozwala wyróżnić zdecydowaną większość populacji USA. W genetyce sytuacja jest ostrzejsza: połączenie kilku rzadkich wariantów (każdy występujący nawet u jednego na tysiąc w populacji, razem mniej niż jeden na milion) wskazuje na pojedynczy osobnik. Co więcej, dane genomiczne można krzyżować z genealogicznymi bazami danych, aby powiązać daną osobę z tożsamością krewnego, nawet jeśli dana osoba nie dostarczyła żadnych danych nigdzie indziej – co jest prawdziwą formą ataku wykazano w literaturze.

Zatem zachowanie wymaga decyzji architektonicznych wykraczających poza odruch „usuwania identyfikatorów”. Praktyczne opcje: wykorzystanie modeli lokalnych/samodzielnych, aby nigdy nie pozostawiać danych poza granicami instytucji; jeśli będzie używana chmura, wybierz poziomy korporacyjne z umową o przetwarzaniu danych (DPA) i zobowiązaniem, że „nie będziesz wykorzystywać danych wejściowych podczas szkoleń”; jeśli to możliwe, praca z uzyskanymi, zagregowanymi informacjami, a nie surowymi danymi dotyczącymi konkretnego pacjenta; i ograniczanie dostępu do zasady najmniejszych przywilejów.

Konkretny przypadek: centrum podsumowało serię „anonimowych” przypadków w ogólnym narzędziu sztucznej inteligencji. Zbiór danych nie zawierał nazwisk, ale każdy pacjent miał kombinację rzadkiej diagnozy + wieku + miasta; Po zestawieniu z doniesieniami z lokalnej gazety można było zidentyfikować pacjenta. Brak surowych identyfikatorów nie wykluczał ponownej identyfikacji.

warstwę ochronną

Co zapewnia

ograniczyć

Usunięcie identyfikatora

Bezpośrednio usuwa identyfikator

Pozostają rzadkie kombinacje

Model lokalny/samoobsługowy

Dane nie opuszczają instytucji

Obciążenie związane z instalacją/konserwacją

DPA+ nie stosować w edukacji

Gwarancja prawna/kontraktowa

Konieczne jest zapoznanie się z polityką

Agregacja/wyprowadzenie

Redukuje pojedyncze blizny

Ogranicza głębokość analizy

Podsumowując

  • Dane genetyczne to dane szczególne, niezmienne, identyfikujące i związane z rodziną; wymaga najwyższego standardu ochrony.
  • Możliwe do zidentyfikowania dane genetyczne pacjenta nigdy nie są wprowadzane do otwartych narzędzi sztucznej inteligencji; pytania koncepcyjne są oddzielone od danych.
  • Ramy takie jak KVKK, RODO, GINA wymagają wyraźnej zgody, ograniczeń celu i silnej ochrony.
  • Anonimizacja nie zapewnia całkowitej pewności; Najbezpieczniej jest w ogóle nie przesyłać krytycznych danych.

Zadanie aplikacji

Otrzymaj przykładowy (fikcyjny) raport genetyczny. Korzystając z szablonu 1, wypisz wszystkie znajdujące się w nim elementy identyfikujące i zdecyduj, czy dla każdego z nich „pominąć”, czy też „nie przenieść”. Następnie przepisz to samo pytanie kliniczne bez żadnych danych identyfikujących (używając logiki szablonu 2). Opisz różnicę w zakresie prywatności między obiema wersjami w jednym zdaniu.

lista kontrolna

  • [ ] Sklasyfikowałem dane pod kątem tożsamości.
  • [ ] Nie wprowadziłem do otwartego narzędzia danych osobowych.
  • [ ] Zauważyłem, że można zidentyfikować kombinację rzadkich wariantów.
  • [ ] Sprawdziłem politykę dotyczącą danych narzędzia (przechowywanie, szkolenia, DPA).
  • [ ] Brałem pod uwagę aspekt rodzinny i zgodę osób trzecich.
  • [ ] Zarejestrowałem ślad transakcji i w razie potrzeby przekazałem go do działu etyki/prawnego.