Единицы
1. Введение в искусственный интеллект в молекулярной биологии и генетике: роли, границы, проверка, этика и конфиденциальность 2. Анализ последовательностей ДНК/РНК: выравнивание, мотив, открытая рамка считывания и основы биоинформатики 3. Вариант интерпретации: патогенность по VCF, обозначению HGVS и критериям ACMG. 4. Структура белка и AlphaFold: прогнозирование структуры чтения, оценки уверенности и проверка 5. Поддержка дизайна CRISPR: выбор гРНК, нецелевой эффект и экспериментальная проверка 6. Анализ данных Omics: секвенирование РНК, экспрессия, статистика и обогащение путей 7. Обзор литературы и научные статьи: проверка источников и риск ложного цитирования 8. Клиническая интерпретация: отчетность, экспертное одобрение, валидация и ограничения 9. Дисциплина галлюцинаций и аутентификации: вымышленные гены, последовательности, варианты и атрибуции 10. Этика, конфиденциальность и защита данных: особая ответственность за генетические данные 11. Комплексный случай: путь варианта от открытия к клиническому отчету
Единица 10 / 11

Этика, конфиденциальность и защита данных: особая ответственность за генетические данные

Прибыль:

  • Понимание того, почему генетические данные являются особой категорией персональных данных и риска повторной идентификации
  • Возможность применять принципы анонимности, согласия и минимизации данных перед предоставлением данных пациента для открытия инструментов искусственного интеллекта.
  • Способность учитывать ограничения обработки генетических данных и профессиональную этическую ответственность в рамках таких рамок, как KVKK/GDPR.

Генетические данные — это не обычные персональные данные. Последовательность ДНК человека; Он однозначно идентифицирует вас, не может быть изменен (вы можете изменить свой пароль, но не свой геном), может выявить будущие риски заболеваний и касается не только человека, но и всех членов семьи, связанных с кровью. Поэтому использование искусственного интеллекта (ИИ) при работе с генетическими данными требует высочайших стандартов конфиденциальности и этики. В этом модуле вы узнаете, почему генетические данные должны быть особенно защищены, какие ошибки имеют серьезные последствия при использовании инструментов искусственного интеллекта, а также о безопасной трудовой дисциплине.

Важный принцип: никогда не вставляйте идентифицируемые генетические данные пациента в общедоступный инструмент искусственного интеллекта. Многие ИИ-сервисы общего назначения могут обрабатывать вводимые вами данные, сохранять их или использовать для улучшения модели. Когда в инструмент вводится редкая комбинация вариантов пациента, имя, идентификационный номер или дата рождения, может произойти необратимое нарушение конфиденциальности.

Пять особенностей, которые делают генетические данные особенными

  1. Инвариантность: геном одинаков на протяжении всей жизни; в случае раскрытия его нельзя «отменить».
  2. Идентичность: даже небольшое количество редких вариантов может однозначно идентифицировать человека; Данные, считающиеся «анонимными», могут быть повторно идентифицированы.
  3. Размер семьи. Геном человека также содержит генетическую информацию его родственников; информация может быть раскрыта без их согласия.
  4. Предсказуемость: может указывать на будущий риск заболевания; Страхование может быть основанием для дискриминации при приеме на работу.
  5. Риск повторной идентификации: геномные данные могут быть связаны с идентичностью путем скрещивания с другими базами данных.

Законодательная база: краткий обзор

Генетические данные относятся к категории особых (конфиденциальных) персональных данных в законодательстве о защите данных и охраняются более строго. В Турции KVKK (Закон о защите персональных данных) рассматривает данные о здоровье и генетические данные как особые данные и, как правило, обязывает их обработку явным согласием или особыми исключениями. В Европе GDPR аналогичным образом защищает генетические данные как особую категорию. В США закон GINA запрещает дискриминацию в сфере страхования и трудоустройства на основе генетической информации. Хотя детали различаются в зависимости от страны, общий принцип один и тот же: генетические данные не могут обрабатываться без явного согласия, ограничения целей и строгой защиты.

Совет: при получении согласия на генетическое тестирование от пациента раскрытие может включать информацию о том, как данные будут обрабатываться инструментами искусственного интеллекта. «С помощью каких инструментов и где мы обрабатываем ваши данные для анализа?» Будьте в состоянии открыто ответить на вопрос.

Шаг за шагом: использование безопасного ИИ с секретными генетическими данными

1. Классифицируйте. Можно ли идентифицировать имеющиеся у вас данные? Содержит ли он комбинацию имени, идентификационного номера, даты и редкого варианта?

2. Анонимизируйте или не переводите вообще. Удалить прямые идентификаторы; Но помните, что «анонимизация» генетических данных не дает полной уверенности. Безопаснее всего вообще не вносить личные данные в открытый автомобиль.

3. Прочтите политику использования данных инструмента. Выбирайте корпоративные инструменты, имеющие соглашение об обработке данных (DPA), обещайте не использовать данные в образовании и желательно работать локально/тесно.

4. Отделите концептуальные вопросы от данных. «Как применять ACMG PM2?» Вы можете задавать концептуальные вопросы ИИ, такие как; Для этого не требуются данные пациента. Используйте данные только при необходимости и в анонимной форме.

5. Сохраните трассировку. Документируйте, какие данные вы обрабатываете, с помощью какого инструмента и с какой целью; Проверяемость является этическим и юридическим требованием.

три мини-кейса

Случай 1 — Вставленный отчет. Для ускорения ассистент вставил отчет, содержащий полное имя пациента и список вариантов, в общий чат ИИ и сказал «подвести итог». Старший специалист это понял: имя и редкий вариант вместе идентифицировали пациента, а инструмент сохранил данные. Инцидент потребовал уведомления о нарушении конфиденциальности. Урок: никакие идентифицирующие данные не передаются, даже для резюме.

Случай 2 — Согласие семьи. Используя данные пациента, исследователь сообщил AI, что этот вариант также был обнаружен у его брата или сестры. Однако брат не дал согласия на обработку своих данных. Семейный аспект генетических данных также поставил под сомнение конфиденциальность третьих лиц; Следователь добыл информацию о брате.

Случай 3 — Получено подтверждение. Одна лаборатория внедрила «контрольный список анонимизации» перед анализом. Они извлекли имена, идентификационные номера и даты, прежде чем передать их ИИ; Более того, они поняли, что только очень редкая комбинация вариантов может определить идентичность, и вообще не сообщили об этом образце. Без контрольного списка данные, которые считались «анонимными», могли бы быть повторно идентифицированы.

Четыре копируемых шаблона

1) Контроль анонимизации:

Прежде чем передать этот текст в инструмент искусственного интеллекта, перечислите в нем ВСЕ элементы (имя, идентификационный номер, дату, адрес, редкую комбинацию вариантов, редкий фенотип), которые могут идентифицировать пациента или его родственников. По каждому предложите «опустить» или «вообще не передавать образец»: [текст].

2) Концептуальный вопрос (без данных):

БЕЗ обмена данными о пациентах, ответьте на следующий концептуальный вопрос: [ACMG/вопрос о методах]. Используйте общие примеры; Мне не нужна реальная информация о пациенте.

3) Согласие и контроль прозрачности:

Помогите мне составить текст информации/согласия на генетическое тестирование. В нем должно быть указано: для каких целей будут обрабатываться данные, с помощью каких инструментов они будут анализироваться, как будут обрабатываться результаты, касающиеся членов семьи, их хранение и удаление. Обратитесь в отдел по правовым/этическим вопросам для принятия юридического решения.

4) Критерии выбора автомобиля:

Какие критерии конфиденциальности (соглашение об обработке данных, обязательство не использовать в образовании, локальное использование, контроль доступа, удаление) мне следует учитывать при выборе инструмента искусственного интеллекта/анализа, который будет обрабатывать конфиденциальные генетические данные? Создается контрольный список оценки.

Слабая подсказка / Сильная подсказка

Слабое: «Комментарий Ахмета Йылмаза (TC: ...) Результат BRCA1: [полный список вариантов]».

Проблема: прямой идентификатор + генетические данные попадают в открытый инструмент; грубое нарушение конфиденциальности.

Гючлю: «Не называя никого, объясните на общем примере, как вариант со сдвигом рамки в BRCA1 оценивается в ACMG. Я не делюсь реальными данными о пациентах».

Почему это эффективно: Потребность в обучении/оценке удовлетворяется, но идентифицирующие данные не передаются.

Тип данных

Входит ли он в открытый инструмент искусственного интеллекта?

альтернатива

Имя пациента/идентификационный номер

никогда

Нет передачи

Редкий вариант + история

Никогда (указывает)

Передача образца

концептуальный вопрос

Да

Общий пример

Анонимный, распространенный пример

осторожный

Корпоративный/локальный инструмент

Агрегированная анонимная статистика

в зависимости от ситуации

Автомобиль с DPA

Распространенные ошибки

  • Вставка идентифицирующих данных как «только для сводки». Какой бы ни была цель, это нарушение.
  • Принятие «анонимизации» генетических данных за полную безопасность. Возможна повторная идентификация.
  • Забываем семейный аспект. Данные человека также раскрывают его родственников.
  • Не читать политику данных автомобиля. Данные могут использоваться или храниться при обучении.
  • Не ведение учета. Если нет управляемости, невозможно продемонстрировать ответственность.
Внимание: в большинстве случаев нарушения конфиденциальности возникают не из-за злого умысла, а из-за рефлекса «сделай это быстро». Самый большой риск — это бездумная вставка отчета в окно чата в обычном рабочем процессе. Замедлять; Для генетических данных нет кнопки отмены.

Глубина: настоящая математика повторной идентификации и безопасных архитектур

Почему неправильно думать: «Я удалил имя, теперь оно анонимно»? Потому что нет необходимости в имени, чтобы идентифицировать человека; Достаточно сочетания редких особенностей. Согласно классическому выводу, трио дата рождения + пол + почтовый индекс позволяет выделить подавляющее большинство населения США. В генетике ситуация более острая: сочетание нескольких редких вариантов (каждый встречается даже у одного из тысячи в популяции, а вместе — менее одного на миллион) указывает на одну особь. Более того, геномные данные могут быть сопоставлены с базами данных генеалогии, чтобы связать человека с личностью родственника, даже если человек больше нигде не предоставил никаких данных — настоящая форма атаки, которая была продемонстрирована в литературе.

Таким образом, сохранение требует архитектурных решений, выходящих за рамки рефлекса «удаления идентификаторов». Практические варианты: использование локальных/автономных моделей, чтобы никогда не оставлять данные за пределами учреждения; если будет использоваться облако, выберите корпоративные уровни с соглашением об обработке данных (DPA) и обязательством «не использовать входные данные в обучении»; работа с производной, агрегированной информацией, а не с необработанными данными, касающимися конкретного пациента, когда это возможно; и ограничение доступа по принципу наименьших привилегий.

Конкретный случай: центр объединил серию «анонимных» случаев в общий инструмент искусственного интеллекта. Набор данных не содержал имен, но у каждого пациента было сочетание редкого диагноза + возраста + города; Если скрестить его с сообщением в местной газете, можно было идентифицировать пациента. Отсутствие необработанных идентификаторов не препятствовало повторной идентификации.

защитный слой

Что обеспечивает

предел

Удаление идентификатора

Непосредственно удаляет идентификатор

Остаются редкие комбинации

Локальная/автономная модель

Данные не покидают учреждение

Затраты на установку/обслуживание

DPA+ не используется в образовании

Юридическое/договорное обеспечение

Необходимо прочитать политику

Агрегация/деривация

Уменьшает отдельные шрамы

Ограничивает глубину анализа

В заключение

  • Генетические данные — это особые, неизменяемые, идентифицирующие и семейные данные; требует высочайшего уровня защиты.
  • Идентифицируемые генетические данные пациентов никогда не вводятся в открытые инструменты искусственного интеллекта; концептуальные вопросы отделены от данных.
  • Такие структуры, как KVKK, GDPR, GINA, требуют явного согласия, ограничений целей и надежной защиты.
  • Анонимизация не является полной гарантией; Самое безопасное — вообще не передавать критически важные данные.

Задача приложения

Получите образец (вымышленного) генетического отчета. Используя шаблон 1, перечислите в нем все идентифицирующие элементы и решите, «опустить» или «не передавать» для каждого. Затем перепишите тот же клинический вопрос без каких-либо идентифицирующих данных (используя логику шаблона 2). Опишите разницу в конфиденциальности между двумя версиями в одном предложении.

контрольный список

  • [ ] Я классифицировал данные с точки зрения идентичности.
  • [ ] Я не вводил личные данные в открытый инструмент.
  • [ ] Я заметил, что можно идентифицировать комбинацию редких вариантов.
  • [ ] Я проверил политику данных инструмента (хранение, обучение, DPA).
  • [ ] Я учел семейный аспект и согласие третьей стороны.
  • [ ] Я записал историю транзакций и при необходимости отправил их в отдел этики и права.