Прибуток:
- Розуміння того, чому генетичні дані є особливою категорією персональних даних і ризик повторної ідентифікації
- Можливість застосовувати принципи анонімізації, згоди та мінімізації даних перед наданням даних пацієнтів відкритим інструментам штучного інтелекту
- Здатність охопити обмеження обробки генетичних даних і професійної етичної відповідальності в таких рамках, як KVKK/GDPR
Генетичні дані – це не звичайні особисті дані. послідовність ДНК людини; Він унікально ідентифікує вас, не може бути змінений (ви можете змінити свій пароль, але не свій геном), може виявити майбутні ризики захворювання та стосується не лише окремої особи, але й усіх членів родини, пов’язаних кровним спорідненням. Тому використання штучного інтелекту (ШІ) під час роботи з генетичними даними вимагає найвищих стандартів конфіденційності та етики. У цьому розділі ви дізнаєтесь, чому генетичні дані мають бути особливо захищені, які помилки мають серйозні наслідки під час використання інструментів штучного інтелекту та безпечну робочу дисципліну.
Важливий принцип: ніколи не вставляйте генетичні дані пацієнта, які можна ідентифікувати, у загальнодоступний інструмент ШІ. Багато служб штучного інтелекту загального призначення можуть обробляти введені вами дані, зберігати їх або використовувати для вдосконалення моделі. Коли в інструмент вводиться комбінація рідкісних варіантів, ім’я, ідентифікаційний номер або дата народження пацієнта, може статися незворотне порушення конфіденційності.
П'ять особливостей, які роблять генетичні дані особливими
- Інваріантність: геном однаковий протягом усього життя; якщо воно розкрите, його не можна «скасувати».
- Ідентичність: навіть невелика кількість рідкісних варіантів може однозначно ідентифікувати людину; Дані, які вважаються «анонімними», можуть бути повторно ідентифіковані.
- Розмір сім'ї: геном людини також містить генетичну інформацію її родичів; інформація може бути розголошена без їх згоди.
- Передбачуваність: може вказувати на майбутній ризик захворювання; Страхування може бути підставою для дискримінації при працевлаштуванні.
- Ризик повторної ідентифікації: геномні дані можна пов’язати з ідентичністю шляхом перетину з іншими базами даних.
Правова база: короткий огляд
Генетичні дані входять до категорії спеціальних (чутливих) персональних даних у законодавстві про захист даних і захищаються суворіше. У Туреччині KVKK (Закон про захист персональних даних) розглядає дані про здоров’я та генетичні дані як спеціальні дані та, як правило, пов’язує їх обробку з явною згодою або особливими винятками. У Європі GDPR так само захищає генетичні дані як особливу категорію. У США закон GINA забороняє дискримінацію при страхуванні та працевлаштуванні на основі генетичної інформації. Хоча деталі відрізняються залежно від країни, загальний принцип однаковий: генетичні дані не можна обробляти без чіткої згоди, обмеження мети та надійного захисту.
Порада. Під час отримання згоди на генетичне тестування від пацієнта розкриття може включати інформацію про те, як дані будуть оброблені інструментами ШІ. «За допомогою яких інструментів і де ми обробляємо ваші дані для аналізу?» Будьте в змозі відповісти на запитання прозоро.
Крок за кроком: використання безпечного ШІ з секретними генетичними даними
1. Класифікувати. Чи можна ідентифікувати наявні у вас дані? Чи містить він комбінацію імені, ідентифікаційного номера, дати, рідкісного варіанту?
2. Анонімізувати або взагалі не передавати. Видалити прямі ідентифікатори; Але пам’ятайте, що «анонімізація» генетичних даних не дає повної гарантії. Найбезпечніше взагалі не вводити ідентифікаційні дані у відкритий автомобіль.
3. Прочитайте політику даних інструменту. Вибирайте інструменти, які є корпоративними, мають угоду про обробку даних (DPA), обіцяють не використовувати дані в освіті та, бажано, працюють локально/впритул.
4. Відокремте концептуальні питання від даних. «Як застосовувати ACMG PM2?» Ви можете задавати концептуальні питання ШІ, такі як; Для цього не потрібні дані пацієнта. Використовуйте дані лише за необхідності та в анонімній формі.
5. Збережіть слід. Документуйте, які дані ви обробляєте, за допомогою якого інструменту та з якою метою; Можливість перевірки є етичною та юридичною вимогою.
три міні-чохла
Випадок 1 — Вставлений звіт. Для швидкості асистент вставив звіт із повним іменем пацієнта та списком варіантів у загальний чат AI та сказав «підсумувати». Старший спеціаліст це зрозумів: ім’я та рідкісний варіант разом ідентифікували пацієнта, а інструмент зберігав дані. Інцидент вимагав повідомлення про порушення конфіденційності. Урок: жодні ідентифікаційні дані не передаються, навіть для резюме.
Випадок 2 — Згода сім’ї. Використовуючи дані пацієнта, дослідник повідомив AI, що варіант також був виявлений у його брата. Однак брат не дав згоди на обробку своїх даних. Сімейний аспект генетичних даних також поставив під сумнів конфіденційність третіх осіб; Слідчий видобув інформацію про брата.
Випадок 3 — Отримано підтвердження. Одна лабораторія запровадила «контрольний список анонімізації» перед аналізом. Вони витягли імена, ідентифікаційні номери та дати, перш ніж передати їх ШІ; Крім того, вони зрозуміли, що лише дуже рідкісна комбінація варіантів може визначити особу, і взагалі не повідомляли про цей зразок. Без контрольного списку дані, які вважалися «анонімними», могли бути повторно ідентифіковані.
Чотири шаблони, які можна копіювати
1) Контроль анонімізації:
Перш ніж передати цей текст в інструмент штучного інтелекту, перелічіть у ньому ВСІ елементи (ім’я, ідентифікаційний номер, дата, адреса, комбінація рідкісних варіантів, рідкісний фенотип), за якими можна ідентифікувати пацієнта чи його родичів. Для кожного запропонуйте «пропустити» або «не передавати зразок взагалі»: [текст].
2) Концептуальне питання (без даних):
НЕ передаючи дані пацієнтів, дайте відповідь на це концептуальне запитання: [питання ACMG/methods]. Використовуйте типові приклади; Мені не потрібна справжня інформація про пацієнта.
3) Згода та контроль прозорості:
Допоможіть мені написати текст інформації/згоди на генетичне тестування. Він повинен містити: для яких цілей дані будуть оброблятися, за допомогою яких типів інструментів вони аналізуватимуться, як оброблятимуться результати щодо членів родини, зберігання та видалення. Зверніться до юридичного/етичного відділу для отримання правового рішення.
4) Критерії відбору автомобіля:
Які критерії конфіденційності (угода про обробку даних, зобов’язання не використовувати в освіті, локальна робота, контроль доступу, видалення) слід запитати, вибираючи інструмент ШІ/аналізу, який оброблятиме конфіденційні генетичні дані? Створюється контрольний список оцінювання.
Слабка підказка / Сильна підказка
Слабкий: «Прокоментуйте результат BRCA1 Ахмета Їлмаза (TC: ...): [повний список варіантів]».
Проблема: прямий ідентифікатор + генетичні дані надходять у відкритий інструмент; грубе порушення конфіденційності.
Гючлю: «Не вказуючи нікого, поясніть на загальному прикладі, як варіант зсуву кадрів у BRCA1 оцінюється в ACMG. Я не надаю фактичних даних пацієнтів».
Чому це потужно: потреба в навчанні/оцінці задовольняється, але ідентифікаційні дані не передаються.
Тип даних
Чи входить він у відкритий інструмент AI?
альтернатива
Ім'я/ідентифікаційний номер пацієнта
ніколи
Без трансферу
Рідкісний варіант + історія
Ніколи (вказує)
Перенести зразок
концептуальне питання
так
Загальний приклад
Анонім, типовий приклад
обережний
Корпоративний/локальний інструмент
Зведена анонімна статистика
в залежності від ситуації
Автомобіль з ДПА
Поширені помилки
- Вставлення ідентифікаційних даних як "лише для підсумку". Якою б не була мета, це порушення.
- Помилково приймаючи «анонімізацію» за генетичні дані як повну безпеку. Можлива повторна ідентифікація.
- Забувши про сімейний аспект. Дані людини також розкривають її родичів.
- Не читає політику даних автомобіля. Дані можна використовувати або зберігати під час навчання.
- Не ведення послужного обліку. Якщо немає керованості, неможливо продемонструвати відповідальність.
Застереження: у більшості випадків порушення конфіденційності виникають не через злий намір, а через рефлекс «швидше». Найбільший ризик – це бездумне вставлення звіту у вікно чату під час звичайного робочого процесу. сповільнити; Для генетичних даних немає кнопки скасування.
Глибина: справжня математика повторної ідентифікації та безпечних архітектур
Чому неправильно думати: «Я видалив ім’я, тепер воно анонімне»? Тому що немає потреби в імені, щоб ідентифікувати людину; Достатньо поєднання рідкісних ознак. Згідно з класичним висновком, тріо дата народження + стать + поштовий індекс може виділити переважну більшість населення США. У генетиці ситуація гостріша: поєднання кількох рідкісних варіантів (кожен зустрічається навіть у одного з тисячі в популяції, разом менше ніж у одного з мільйона) вказує на одну особину. Крім того, геномні дані можуть бути схрещені з генеалогічними базами даних, щоб пов’язати особу з ідентичністю родича, навіть якщо особа не надала жодних даних ніде більше — справжня форма атаки, яка була продемонстрована в літературі.
Отже, збереження вимагає архітектурних рішень, які виходять за рамки рефлексу «видалити ідентифікатори». Практичні варіанти: використання локальних/власних моделей, щоб ніколи не залишати дані за межами установи; якщо використовуватиметься хмара, виберіть корпоративні рівні з угодою про обробку даних (DPA) і зобов’язанням «не використовувати вхідні дані в навчанні»; працювати з похідною, узагальненою інформацією, а не з необробленими даними про пацієнта, коли це можливо; та обмеження доступу за принципом найменших привілеїв.
Конкретний випадок: центр узагальнив «анонімну» серію випадків у загальний інструмент ШІ. Набір даних не містив імен, але кожен пацієнт мав комбінацію рідкісний діагноз + вік + місто; Якщо зіткнутися зі звітом місцевої газети, пацієнта можна було ідентифікувати. Відсутність необроблених ідентифікаторів не перешкоджає повторній ідентифікації.
захисний шар
Що забезпечує
обмеження
Видалення ідентифікатора
Безпосередньо видаляє ID
Залишаються рідкісні комбінації
Локальна/власна модель
Дані не виходять із закладу
Тягар встановлення/обслуговування
DPA+ не використовується в освіті
Юридичне/договірне забезпечення
Треба читати політику
Агрегування/виведення
Зменшує індивідуальний шрам
Обмежує глибину аналізу
Підсумовуючи
- Генетичні дані - це особливі, незмінні, ідентифікаційні та сімейні дані; вимагає найвищого рівня захисту.
- Генетичні дані пацієнта, які можна ідентифікувати, ніколи не вводяться у відкриті інструменти ШІ; концептуальні питання відокремлені від даних.
- Такі фреймворки, як KVKK, GDPR, GINA, вимагають чіткої згоди, обмежень цілей і надійного захисту.
- Анонімізація не є повною гарантією; Найбезпечніше взагалі не передавати критичні дані.
Аплікаційне завдання
Отримайте зразок (вигаданого) генетичного звіту. Використовуючи шаблон 1, перерахуйте всі ідентифікаційні елементи в ньому та вирішіть, «пропустити» чи «не передавати» для кожного. Потім перепишіть те саме клінічне питання без будь-яких ідентифікаційних даних (використовуючи логіку шаблону 2). Опишіть різницю в конфіденційності між двома версіями одним реченням.
контрольний список
- [ ] Я класифікував дані з точки зору ідентичності.
- [ ] Я не вводив особисті дані у відкритий інструмент.
- [ ] Я помітив, що можна виявити комбінацію рідкісних варіантів.
- [ ] Я перевірив політику даних інструменту (збереження, навчання, DPA).
- [ ] Я врахував сімейний аспект і згоду третьої сторони.
- [ ] Я записав слід транзакцій і за потреби переслав його до відділу етики/юридичних питань.