Прибыль:
- Понимание того, почему генетические данные являются особой категорией персональных данных и риска повторной идентификации
- Возможность применять принципы анонимности, согласия и минимизации данных перед предоставлением данных пациента для открытия инструментов искусственного интеллекта.
- Способность учитывать ограничения обработки генетических данных и профессиональную этическую ответственность в рамках таких рамок, как KVKK/GDPR.
Генетические данные — это не обычные персональные данные. Последовательность ДНК человека; Он однозначно идентифицирует вас, не может быть изменен (вы можете изменить свой пароль, но не свой геном), может выявить будущие риски заболеваний и касается не только человека, но и всех членов семьи, связанных с кровью. Поэтому использование искусственного интеллекта (ИИ) при работе с генетическими данными требует высочайших стандартов конфиденциальности и этики. В этом модуле вы узнаете, почему генетические данные должны быть особенно защищены, какие ошибки имеют серьезные последствия при использовании инструментов искусственного интеллекта, а также о безопасной трудовой дисциплине.
Важный принцип: никогда не вставляйте идентифицируемые генетические данные пациента в общедоступный инструмент искусственного интеллекта. Многие ИИ-сервисы общего назначения могут обрабатывать вводимые вами данные, сохранять их или использовать для улучшения модели. Когда в инструмент вводится редкая комбинация вариантов пациента, имя, идентификационный номер или дата рождения, может произойти необратимое нарушение конфиденциальности.
Пять особенностей, которые делают генетические данные особенными
- Инвариантность: геном одинаков на протяжении всей жизни; в случае раскрытия его нельзя «отменить».
- Идентичность: даже небольшое количество редких вариантов может однозначно идентифицировать человека; Данные, считающиеся «анонимными», могут быть повторно идентифицированы.
- Размер семьи. Геном человека также содержит генетическую информацию его родственников; информация может быть раскрыта без их согласия.
- Предсказуемость: может указывать на будущий риск заболевания; Страхование может быть основанием для дискриминации при приеме на работу.
- Риск повторной идентификации: геномные данные могут быть связаны с идентичностью путем скрещивания с другими базами данных.
Законодательная база: краткий обзор
Генетические данные относятся к категории особых (конфиденциальных) персональных данных в законодательстве о защите данных и охраняются более строго. В Турции KVKK (Закон о защите персональных данных) рассматривает данные о здоровье и генетические данные как особые данные и, как правило, обязывает их обработку явным согласием или особыми исключениями. В Европе GDPR аналогичным образом защищает генетические данные как особую категорию. В США закон GINA запрещает дискриминацию в сфере страхования и трудоустройства на основе генетической информации. Хотя детали различаются в зависимости от страны, общий принцип один и тот же: генетические данные не могут обрабатываться без явного согласия, ограничения целей и строгой защиты.
Совет: при получении согласия на генетическое тестирование от пациента раскрытие может включать информацию о том, как данные будут обрабатываться инструментами искусственного интеллекта. «С помощью каких инструментов и где мы обрабатываем ваши данные для анализа?» Будьте в состоянии открыто ответить на вопрос.
Шаг за шагом: использование безопасного ИИ с секретными генетическими данными
1. Классифицируйте. Можно ли идентифицировать имеющиеся у вас данные? Содержит ли он комбинацию имени, идентификационного номера, даты и редкого варианта?
2. Анонимизируйте или не переводите вообще. Удалить прямые идентификаторы; Но помните, что «анонимизация» генетических данных не дает полной уверенности. Безопаснее всего вообще не вносить личные данные в открытый автомобиль.
3. Прочтите политику использования данных инструмента. Выбирайте корпоративные инструменты, имеющие соглашение об обработке данных (DPA), обещайте не использовать данные в образовании и желательно работать локально/тесно.
4. Отделите концептуальные вопросы от данных. «Как применять ACMG PM2?» Вы можете задавать концептуальные вопросы ИИ, такие как; Для этого не требуются данные пациента. Используйте данные только при необходимости и в анонимной форме.
5. Сохраните трассировку. Документируйте, какие данные вы обрабатываете, с помощью какого инструмента и с какой целью; Проверяемость является этическим и юридическим требованием.
три мини-кейса
Случай 1 — Вставленный отчет. Для ускорения ассистент вставил отчет, содержащий полное имя пациента и список вариантов, в общий чат ИИ и сказал «подвести итог». Старший специалист это понял: имя и редкий вариант вместе идентифицировали пациента, а инструмент сохранил данные. Инцидент потребовал уведомления о нарушении конфиденциальности. Урок: никакие идентифицирующие данные не передаются, даже для резюме.
Случай 2 — Согласие семьи. Используя данные пациента, исследователь сообщил AI, что этот вариант также был обнаружен у его брата или сестры. Однако брат не дал согласия на обработку своих данных. Семейный аспект генетических данных также поставил под сомнение конфиденциальность третьих лиц; Следователь добыл информацию о брате.
Случай 3 — Получено подтверждение. Одна лаборатория внедрила «контрольный список анонимизации» перед анализом. Они извлекли имена, идентификационные номера и даты, прежде чем передать их ИИ; Более того, они поняли, что только очень редкая комбинация вариантов может определить идентичность, и вообще не сообщили об этом образце. Без контрольного списка данные, которые считались «анонимными», могли бы быть повторно идентифицированы.
Четыре копируемых шаблона
1) Контроль анонимизации:
Прежде чем передать этот текст в инструмент искусственного интеллекта, перечислите в нем ВСЕ элементы (имя, идентификационный номер, дату, адрес, редкую комбинацию вариантов, редкий фенотип), которые могут идентифицировать пациента или его родственников. По каждому предложите «опустить» или «вообще не передавать образец»: [текст].
2) Концептуальный вопрос (без данных):
БЕЗ обмена данными о пациентах, ответьте на следующий концептуальный вопрос: [ACMG/вопрос о методах]. Используйте общие примеры; Мне не нужна реальная информация о пациенте.
3) Согласие и контроль прозрачности:
Помогите мне составить текст информации/согласия на генетическое тестирование. В нем должно быть указано: для каких целей будут обрабатываться данные, с помощью каких инструментов они будут анализироваться, как будут обрабатываться результаты, касающиеся членов семьи, их хранение и удаление. Обратитесь в отдел по правовым/этическим вопросам для принятия юридического решения.
4) Критерии выбора автомобиля:
Какие критерии конфиденциальности (соглашение об обработке данных, обязательство не использовать в образовании, локальное использование, контроль доступа, удаление) мне следует учитывать при выборе инструмента искусственного интеллекта/анализа, который будет обрабатывать конфиденциальные генетические данные? Создается контрольный список оценки.
Слабая подсказка / Сильная подсказка
Слабое: «Комментарий Ахмета Йылмаза (TC: ...) Результат BRCA1: [полный список вариантов]».
Проблема: прямой идентификатор + генетические данные попадают в открытый инструмент; грубое нарушение конфиденциальности.
Гючлю: «Не называя никого, объясните на общем примере, как вариант со сдвигом рамки в BRCA1 оценивается в ACMG. Я не делюсь реальными данными о пациентах».
Почему это эффективно: Потребность в обучении/оценке удовлетворяется, но идентифицирующие данные не передаются.
Тип данных
Входит ли он в открытый инструмент искусственного интеллекта?
альтернатива
Имя пациента/идентификационный номер
никогда
Нет передачи
Редкий вариант + история
Никогда (указывает)
Передача образца
концептуальный вопрос
Да
Общий пример
Анонимный, распространенный пример
осторожный
Корпоративный/локальный инструмент
Агрегированная анонимная статистика
в зависимости от ситуации
Автомобиль с DPA
Распространенные ошибки
- Вставка идентифицирующих данных как «только для сводки». Какой бы ни была цель, это нарушение.
- Принятие «анонимизации» генетических данных за полную безопасность. Возможна повторная идентификация.
- Забываем семейный аспект. Данные человека также раскрывают его родственников.
- Не читать политику данных автомобиля. Данные могут использоваться или храниться при обучении.
- Не ведение учета. Если нет управляемости, невозможно продемонстрировать ответственность.
Внимание: в большинстве случаев нарушения конфиденциальности возникают не из-за злого умысла, а из-за рефлекса «сделай это быстро». Самый большой риск — это бездумная вставка отчета в окно чата в обычном рабочем процессе. Замедлять; Для генетических данных нет кнопки отмены.
Глубина: настоящая математика повторной идентификации и безопасных архитектур
Почему неправильно думать: «Я удалил имя, теперь оно анонимно»? Потому что нет необходимости в имени, чтобы идентифицировать человека; Достаточно сочетания редких особенностей. Согласно классическому выводу, трио дата рождения + пол + почтовый индекс позволяет выделить подавляющее большинство населения США. В генетике ситуация более острая: сочетание нескольких редких вариантов (каждый встречается даже у одного из тысячи в популяции, а вместе — менее одного на миллион) указывает на одну особь. Более того, геномные данные могут быть сопоставлены с базами данных генеалогии, чтобы связать человека с личностью родственника, даже если человек больше нигде не предоставил никаких данных — настоящая форма атаки, которая была продемонстрирована в литературе.
Таким образом, сохранение требует архитектурных решений, выходящих за рамки рефлекса «удаления идентификаторов». Практические варианты: использование локальных/автономных моделей, чтобы никогда не оставлять данные за пределами учреждения; если будет использоваться облако, выберите корпоративные уровни с соглашением об обработке данных (DPA) и обязательством «не использовать входные данные в обучении»; работа с производной, агрегированной информацией, а не с необработанными данными, касающимися конкретного пациента, когда это возможно; и ограничение доступа по принципу наименьших привилегий.
Конкретный случай: центр объединил серию «анонимных» случаев в общий инструмент искусственного интеллекта. Набор данных не содержал имен, но у каждого пациента было сочетание редкого диагноза + возраста + города; Если скрестить его с сообщением в местной газете, можно было идентифицировать пациента. Отсутствие необработанных идентификаторов не препятствовало повторной идентификации.
защитный слой
Что обеспечивает
предел
Удаление идентификатора
Непосредственно удаляет идентификатор
Остаются редкие комбинации
Локальная/автономная модель
Данные не покидают учреждение
Затраты на установку/обслуживание
DPA+ не используется в образовании
Юридическое/договорное обеспечение
Необходимо прочитать политику
Агрегация/деривация
Уменьшает отдельные шрамы
Ограничивает глубину анализа
В заключение
- Генетические данные — это особые, неизменяемые, идентифицирующие и семейные данные; требует высочайшего уровня защиты.
- Идентифицируемые генетические данные пациентов никогда не вводятся в открытые инструменты искусственного интеллекта; концептуальные вопросы отделены от данных.
- Такие структуры, как KVKK, GDPR, GINA, требуют явного согласия, ограничений целей и надежной защиты.
- Анонимизация не является полной гарантией; Самое безопасное — вообще не передавать критически важные данные.
Задача приложения
Получите образец (вымышленного) генетического отчета. Используя шаблон 1, перечислите в нем все идентифицирующие элементы и решите, «опустить» или «не передавать» для каждого. Затем перепишите тот же клинический вопрос без каких-либо идентифицирующих данных (используя логику шаблона 2). Опишите разницу в конфиденциальности между двумя версиями в одном предложении.
контрольный список
- [ ] Я классифицировал данные с точки зрения идентичности.
- [ ] Я не вводил личные данные в открытый инструмент.
- [ ] Я заметил, что можно идентифицировать комбинацию редких вариантов.
- [ ] Я проверил политику данных инструмента (хранение, обучение, DPA).
- [ ] Я учел семейный аспект и согласие третьей стороны.
- [ ] Я записал историю транзакций и при необходимости отправил их в отдел этики и права.