Печалби:
- Разбиране защо генетичните данни са специална категория лични данни и риска от повторна идентификация
- Възможност за прилагане на принципи за анонимизиране, съгласие и минимизиране на данните, преди да предоставите данни на пациента за отваряне на инструменти за изкуствен интелект
- Способност за прегръщане на ограниченията на обработката на генетични данни и професионална етична отговорност в рамки като KVKK/GDPR
Генетичните данни не са обикновени лични данни. ДНК последователност на човек; Той ви идентифицира уникално, не може да бъде променен (можете да промените паролата си, но не и генома си), може да разкрие бъдещи рискове от заболяване и засяга не само индивида, но и всички членове на семейството, свързани с кръвна връзка. Следователно използването на изкуствен интелект (AI) при работа с генетични данни изисква най-висок стандарт на поверителност и етика. В тази част ще научите защо генетичните данни трябва да бъдат специално защитени, кои грешки имат сериозни последствия при използване на инструменти с изкуствен интелект и безопасна работна дисциплина.
Критичен принцип: Никога не поставяйте идентифицируеми генетични данни на пациенти в публично достъпен AI инструмент. Много AI услуги с общо предназначение могат да обработват данните, които въвеждате, да ги съхраняват или да ги използват за подобряване на модела. Когато комбинация от редки варианти на пациент, име, идентификационен номер или дата на раждане се въведе в инструмент, може да възникне необратимо нарушение на поверителността.
Пет функции, които правят генетичните данни специални
- Инвариантност: Геномът е един и същ през целия живот; ако бъде разкрито, не може да бъде "отменено".
- Идентичност: Дори малък брой редки варианти могат уникално да идентифицират човек; Данните, смятани за „анонимни“, могат да бъдат повторно идентифицирани.
- Размер на семейството: Геномът на човек също съдържа генетичната информация на неговите роднини; информация може да бъде разкрита без тяхното съгласие.
- Предсказуемост: Може да показва бъдещ риск от заболяване; Осигуряването може да бъде основание за дискриминация при наемане на работа.
- Риск от повторна идентификация: Геномните данни могат да бъдат свързани с идентичността чрез кръстосване с други бази данни.
Правна рамка: кратък преглед
Генетичните данни са в категорията на специалните (чувствителни) лични данни в законодателството за защита на данните и са защитени по-строго. В Турция KVKK (Закон за защита на личните данни) разглежда здравните и генетичните данни като специални данни и като правило обвързва обработката им с изрично съгласие или специални изключения. В Европа GDPR по подобен начин защитава генетичните данни като специална категория. В САЩ законът GINA забранява дискриминацията при застраховане и наемане на работа въз основа на генетична информация. Въпреки че подробностите варират според държавата, общият принцип е един и същ: генетичните данни не могат да бъдат обработвани без изрично съгласие, ограничение на целта и силна защита.
Съвет: Когато получавате съгласие за генетично изследване от пациент, разкриването може да включва как данните ще бъдат обработени от AI инструменти. „С какви инструменти и къде обработваме вашите данни за анализ?“ Бъдете в състояние да отговорите прозрачно на въпроса.
Стъпка по стъпка: използване на безопасен AI със секретни генетични данни
1. Класифицирайте. Могат ли данните, които притежавате, да бъдат идентифицирани? Съдържа ли комбинация от име, личен номер, дата, рядък вариант?
2. Анонимизирайте или изобщо не прехвърляйте. Премахнете директните идентификатори; Но не забравяйте, че „анонимизирането“ на генетичните данни не дава пълна сигурност. Най-безопасно е изобщо да не въвеждате лични данни в отвореното превозно средство.
3. Прочетете политиката за данни на инструмента. Изберете инструменти, които са корпоративни, имат споразумение за обработка на данни (DPA), обещават да не използват данните в образованието и за предпочитане работят на местно ниво/отблизо.
4. Отделете концептуалните въпроси от данните. „Как да прилагам ACMG PM2?“ Можете да задавате концептуални въпроси на AI като; За това не са необходими данни за пациента. Използвайте данни само когато е необходимо и в анонимна форма.
5. Запазете следата. Документирайте кои данни обработвате, с кой инструмент и за каква цел; Одитността е етично и законово изискване.
три мини калъфа
Случай 1 — Поставен отчет. За бързина един асистент постави доклада, съдържащ пълното име на пациента и списък с варианти, в общ AI чат и каза „обобщи“. Старшият специалист разбра това: името и редкият вариант заедно идентифицираха пациента и инструментът запази данните. Инцидентът изисква известие за нарушение на поверителността. Поука: не се прехвърлят никакви идентифициращи данни, дори за резюмето.
Случай 2 — Съгласие на семейството. Докато използва данни на пациент, изследовател каза на AI, че вариантът е открит и в неговия брат или сестра. Братът обаче не е дал съгласие за обработка на данните му. Семейният аспект на генетичните данни също постави под въпрос поверителността на трети страни; Следователят извадил информация за брата.
Случай 3 — Получено потвърждение. Една лаборатория въведе „контролен списък за анонимизиране“ преди анализа. Те извличат имена, лични номера и дати, преди да ги дадат на AI; Нещо повече, те разбраха, че само една много рядка комбинация от варианти може да определи самоличността и изобщо не докладваха тази проба. Без контролния списък данните, смятани за „анонимни“, биха могли да бъдат повторно идентифицирани.
Четири копируеми шаблона
1) Контрол на анонимизирането:
Преди да подадете този текст към инструмент с изкуствен интелект, избройте ВСИЧКИ елементи в него (име, идентификационен номер, дата, адрес, комбинация от редки варианти, рядък фенотип), които биха могли да идентифицират пациента или неговите роднини. За всеки предложете „пропуснете“ или „изобщо не прехвърляйте извадката“: [текст].
2) Концептуален въпрос (без данни):
БЕЗ споделяне на данни за пациентите, отговорете на този концептуален въпрос: [ACMG/methods question]. Използвайте общи примери; Не искам истинска информация за пациента.
3) Съгласие и контрол на прозрачността:
Помогнете ми да съставя текст за информация/съгласие за генетично изследване. То трябва да включва: за какви цели ще се обработват данните, с какви видове инструменти ще се анализират, как ще се обработват резултатите относно членовете на семейството, съхранение и изтриване. Обърнете се към отдела по правни/етични въпроси за правно решение.
4) Критерии за избор на превозно средство:
Какви критерии за поверителност (споразумение за обработка на данни, ангажимент да не се използва в образованието, локална работа, контрол на достъпа, изтриване) трябва да попитам, когато избирам AI/инструмент за анализ, който ще обработва чувствителни генетични данни? Създава се контролен списък за оценка.
Слаба подкана / Силна подкана
Слаб: „Коментирайте резултата BRCA1 на Ахмет Йълмаз (TC: ...): [пълен списък с варианти].“
Проблем: Директен идентификатор + генетични данни влизат в отворен инструмент; грубо нарушаване на поверителността.
Güçlü: „Без да идентифицирате никого, обяснете с помощта на общ пример как се оценява вариантът на изместване на рамката в BRCA1 в ACMG. Не споделям действителни данни за пациентите.“
Защо е мощен: Необходимостта от обучение/оценка е удовлетворена, но не се прехвърлят идентифициращи данни.
Тип данни
Влиза ли в отворения AI инструмент?
алтернатива
Име на пациента/идентификационен номер
никога
Няма трансфер
Рядък вариант + история
Никога (идентифицира)
Прехвърлете пробата
концептуален въпрос
да
Общ пример
Анонимен, често срещан пример
внимателен
Корпоративен/местен инструмент
Обобщена, анонимна статистика
в зависимост от ситуацията
Превозно средство с DPA
Често срещани грешки
- Поставяне на идентифициращи данни като „само за обобщение“. Каквато и да е целта, това е нарушение.
- Погрешно приемане на „анонимизация“ за генетични данни като пълна сигурност. Възможна е повторна идентификация.
- Забравяйки семейния аспект. Данните на човек разкриват и неговите роднини.
- Не чете политиката за данни на превозното средство. Данните могат да се използват или съхраняват в обучение.
- Не водене на записи. Ако няма контролируемост, не може да се демонстрира отговорност.
Внимание: През повечето време нарушенията на поверителността не възникват от злонамерени намерения, а от рефлекс „побързай“. Най-големият риск е безсмисленото поставяне на отчет в прозорец за чат в случаен работен процес. Забавете се; Няма бутон за отмяна на генетични данни.
Дълбочина: истинската математика на повторното идентифициране и защитените архитектури
Защо е погрешно да мислите „Изтрих името, сега е анонимно“? Защото няма нужда от име, за да идентифицира човек; Достатъчна е комбинация от редки характеристики. Според едно класическо откритие, триото от дата на раждане + пол + пощенски код може да открои огромното мнозинство от населението на САЩ. В генетиката ситуацията е по-остра: комбинацията от няколко редки варианта (всеки се среща дори при един на хиляда в популацията, заедно по-малко от един на милион) сочи към един индивид. Освен това геномните данни могат да бъдат кръстосани с генеалогични бази данни, за да се свърже дадено лице със самоличността на роднина, дори ако лицето не е предоставило никакви данни никъде другаде - истинска форма на атака, която е демонстрирана в литературата.
Така че запазването изисква архитектурни решения, които надхвърлят рефлекса „изтриване на идентификатори“. Практически опции: използване на локални/самостоятелно хоствани модели, за да не оставяте никога данните извън границите на институцията; ако ще се използва облакът, изберете корпоративни нива със споразумение за обработка на данни (DPA) и ангажимент „да не използвате въведените данни в обучение“; работа с извлечена, обобщена информация, а не със специфични за пациента сурови данни, когато е възможно; и ограничаване на достъпа до принципа на най-малките привилегии.
Конкретен случай: център обобщи „анонимна“ поредица от случаи в общ инструмент за изкуствен интелект. Наборът от данни не съдържаше имена, но всеки пациент имаше комбинация от рядка диагноза + възраст + град; Когато се пресече с репортаж от местен вестник, пациентът може да бъде идентифициран. Липсата на необработени идентификатори не изключва повторната идентификация.
защитен слой
Какво осигурява
лимит
Изтриване на идентификатор
Директно премахва ID
Остават редки комбинации
Локален/самостоятелен модел
Данните не напускат институцията
Тежест при инсталиране/поддръжка
DPA+ не се използва в образованието
Правна/договорна гаранция
Необходимо е да прочетете политиката
Агрегиране/извеждане
Намалява индивидуалния белег
Ограничава дълбочината на анализа
В обобщение
- Генетичните данни са специални, неизменни, идентифициращи и свързани със семейството данни; изисква най-висок стандарт на защита.
- Идентифицируемите генетични данни на пациента никога не се въвеждат в отворени инструменти за ИИ; концептуалните въпроси са отделени от данните.
- Рамки като KVKK, GDPR, GINA изискват изрично съгласие, ограничения за целта и силна защита.
- Анонимизирането не е пълна гаранция; Най-безопасното нещо е изобщо да не прехвърляте критични данни.
Задача за приложение
Получете примерен (измислен) генетичен доклад. Използвайки шаблон 1, избройте всички идентифициращи елементи в него и решете дали да „пропуснете“ или „без трансфер“ за всеки. След това пренапишете същия клиничен въпрос без никакви идентифициращи данни (използвайки логиката на шаблон 2). Опишете разликата в поверителността между двете версии в едно изречение.
контролен списък
- [ ] Класифицирах данните по отношение на идентичността.
- [ ] Не съм въвел лични данни в отворения инструмент.
- [ ] Забелязах, че може да се идентифицира комбинация от редки варианти.
- [ ] Проверих правилата за данни на инструмента (задържане, обучение, DPA).
- [ ] Обмислих семейния аспект и съгласието на трета страна.
- [ ] Записах следите на транзакцията и ги препратих на отдела по етика/правни въпроси, когато е необходимо.