Единицы
1. Почему корпоративная политика в области ИИ? Фонд управления и теневого искусственного интеллекта 2. Как написать корпоративную политику использования ИИ 3. Основы KVKK, общие принципы и VERBIS 4. Правовая основа, обязательство информировать и явное согласие 5. Законодательство ЕС об искусственном интеллекте и классы риска 6. GDPR, автоматизированные решения и трансграничная передача данных 7. Обработка, хранение, минимизация и анонимизация данных 8. Авторское право, интеллектуальная собственность и результаты искусственного интеллекта 9. Оценка поставщиков и инструментов: утвержденный список инструментов ИИ 10. Оценка воздействия на защиту данных (DPIA) и управление рисками 11. Человеческий контроль, прозрачность, предвзятость и этика 12. Структура управления ИИ: роли, утверждение, аудит и реагирование на инциденты
Единица 7 / 12

Обработка, хранение, минимизация и анонимизация данных

Прибыль:

  • Применяйте соображения ИИ на каждом этапе жизненного цикла данных
  • Установите периоды хранения и включите историю чатов ИИ в политику уничтожения.
  • Применение разницы между анонимизацией и псевдонимизацией

Часть данных «после» — это то, что офицер по защите данных часто упускает из виду. Как только текст введен в ИИ, кажется, что работа выполнена; Однако эти данные где-то хранятся, возможно, используются при обучении модели, возможно, они накапливаются в истории чата месяцами. В этом разделе мы шаг за шагом обсудим жизненный цикл персональных данных; Мы узнаем о сроках хранения, уничтожении истории чатов ИИ и различении двух важнейших методов — анонимизации и псевдонимизации. Цель состоит в том, чтобы управлять данными на протяжении всей их жизни, а не только при их вводе.

Жизненный цикл данных и искусственный интеллект

Персональные данные проходят жизненный цикл; На каждом этапе есть точки внимания, специфичные для ИИ.

Этап

Что происходит?

Точка внимания ИИ

коллекция

Данные получены

Ясны ли цель и основа? Было ли оно сведено к минимуму?

Использование/обработка

Введено в ИИ, обработано

Маскировка произведена? Одобренный автомобиль?

хранение

Данные сохраняются

Как долго хранится история чата?

трансфер

идет к кому-то другому

Международный сервер? Есть ли соответствующая гарантия?

Разрушение

Удаление/анонимизация

Было ли оно удалено после того, как цель была достигнута? В комплект входят запасные части?

Двумя наиболее игнорируемыми этапами являются хранение и утилизация. Данные «забываются» и продолжают накапливаться в системе, что не только нарушает принцип КВКК, но и увеличивает ущерб в случае взлома.

Срок хранения: как долго можно хранить?

Принцип хранения KVKK ясен: персональные данные не могут храниться дольше, чем это необходимо для цели, для которой они обрабатываются. Когда цель больше не доступна, данные следует удалить, уничтожить или обезличить. Учреждение готовит политику хранения и утилизации; определяет, сколько следует хранить для каждой категории данных.

Критическая точка, характерная для ИИ: истории чатов ИИ также являются хранимыми данными. Если сотрудник в течение нескольких месяцев вводил данные о клиентах в один и тот же чат, эта история становится хранилищем данных. Для этого:

  • Настройте параметры хранения данных в корпоративных инструментах искусственного интеллекта (если возможно, автоматически удалите историю или отключите использование при обучении модели).
  • Включите историю чата в свой график уничтожения.
  • Обеспечьте в корпоративном договоре опцию «Не использовать в обучении модели» (отказ).
Внимание: Удаление данных – это не просто их удаление с экрана. Также следует учитывать резервные копии, журналы и копии на сервере провайдера. Когда вы говорите «удалено», убедитесь, что то, что вы удалили, действительно безвозвратно.

Анонимизация или псевдонимизация?

Эти два термина часто путают, однако их правовые последствия диаметрально противоположны.

  • Анонимизация: создание данных таким образом, чтобы их нельзя было каким-либо образом связать с человеком. Если все сделано правильно, результат больше не является персональными данными и выходит за рамки КВКК. Пример. Удаление отдельных строк из набора данных по 10 000 человек и оставление только совокупной статистики, например «Средние расходы в возрастной группе 25–34 лет в Стамбуле».
  • Псевдонимизация: идентификационная информация заменяется кодом/тегом, но может быть возвращена человеку с помощью «ключа». Пример: написать «Клиент-4471» вместо «Ахмет Йылмаз», но сохранить таблицу, показывающую, какой код кому принадлежит. Это по-прежнему персональные данные, подпадающие под действие KVKK.

особенность

Анонимизация

Псевдонимизация

Можно ли вернуть человека?

Нет (если все сделано правильно)

Да, с ключом

Это все еще личные данные?

нет

Да

Объем КВКК

снаружи

в

Чтобы попасть в ИИ

Самый безопасный способ

Опять же, требуется основа/правило.

Совет: «Это обратимо?» перед вводом данных в ИИ. просить. Если в нем есть ключ/совпадение, это псевдонимизированные и по-прежнему персональные данные. Настоящая анонимизация заключается в совместном использовании агрегированного результата, а не отдельных строк.

три мини-кейса

Случай 1 — Фальшивая анонимность. Медицинская компания предоставляет ИИ набор данных, которые, по ее словам, были «анонимизированы» для анализа. Но в наборе есть дата рождения, округ и редкий диагноз; это трио может обозначать одного человека в небольшом округе. Это не анонимизация; данные по-прежнему являются личными. Правильный путь: преобразовать дату рождения в возрастной диапазон, обобщить по округам, сгруппировать редкие диагнозы — то есть истинное агрегирование.

Случай 2. Разговор набирает обороты. В колл-центре 6 агентов вводят данные о клиентах в один корпоративный AI-аккаунт на протяжении 4 месяцев. Никто не очищает прошлое; в конечном итоге более 12 000 взаимодействий с клиентами собрались в одном месте. В ходе аудита такое накопление отмечается как основной риск. Решение: настройка автоматического удаления истории каждые 30 дней, правило выхода из системы после завершения задания и пункт, открытый для политики хранения.

Случай 3 — Правильная псевдонимизация. При анализе эффективности работы сотрудников с помощью искусственного интеллекта отдел кадров кодирует имена, например «Сотрудник-001», и сохраняет таблицу соответствия в отдельном файле с ограниченным доступом. Это псевдонимизация; Данные по-прежнему личные, но риск снижается. Команда осознает, что это не является анонимизацией, и соответствующим образом определяет ее правовую основу и срок хранения.

Копируемые шаблоны

ШАБЛОН 1 — Строка политики хранения и уничтожения: «Предложите строку политики хранения-уничтожения для следующей категории данных: [категория]. Поля: период хранения (обоснованный целью), метод уничтожения (удаление/уничтожение/анонимизация), включена ли история чата AI, ответственная роль. Напомните, существует ли юридическое обязательство по хранению».

ШАБЛОН 2 — Проверка анонимности: «Оцените, является ли следующий набор данных действительно анонимным: [поля списка]. Какие комбинации полей могут сделать человека поддающимся повторной идентификации (например, дата рождения + почтовый индекс + редкая особенность)? Предложите обобщение для каждого поля риска (например, возрастной диапазон, уровень провинции) для усиления анонимности».

ШАБЛОН 3 — Маскирование + разделение ключа возврата: «Псевдоним следующего текста: закодируйте личные данные (например, [ИМЯ]->K001), но дайте мне таблицу соответствия ОТДЕЛЬНО. Не оставляйте реальной идентичности в самом тексте. Обратите внимание, что таблица соответствия — это «личные данные» и ее следует хранить отдельно».

ШАБЛОН 4 — Аудит хранения данных инструмента ИИ: «Подготовьте список вопросов для проверки поведения хранения данных инструмента ИИ, который мы используем: как долго хранится история, можно ли ее удалить, используется ли она при обучении модели, есть ли отказ, где обрабатываются данные, какие резервные копии? Напишите ожидаемый «безопасный» ответ на каждый вопрос».

Слабая подсказка / Сильная подсказка

СЛАБОСТЬ: «Анонимизировать эти данные». (кодирует и оставляет имена) -> Просто ники; Сохраняются риски повторной идентификации, такие как дата рождения, редкая черта; Это создает иллюзию «анонимности». ГЮЧЛЮ: "Найдите в этом наборе комбинации полей, позволяющие повторно идентифицировать человека; обобщите каждое из них (возрастной диапазон, уровень провинции). Моя цель - не единая запись, а агрегированная статистика. В результате никого нельзя выделить как отдельного человека и проверить это". -> Модель стремится к истинной анонимности, снижая риск повторной идентификации.

Распространенные ошибки

  • Принятие псевдонимизации за анонимизацию; забывая, что это остаются персональные данные.
  • Удаление имен и оставление описательных комбинаций, таких как дата рождения + местоположение + редкая черта.
  • Не подвергать историю чата ИИ правилам хранения/уничтожения; накапливаться бесконечно.
  • Несоблюдение пункта «Не использовать в обучении модели» (отказ от участия) в контракте.
  • Когда я говорю об удалении, я имею в виду просто очистить экран и забыть о резервных копиях и журналах.
  • Продление срока хранения «на всякий случай», а не по назначению.
  • Игнорируя, что передача и хранение также происходит на сервере провайдера.

В заключение

  • Персональные данные проходят жизненный цикл; Самыми игнорируемыми этапами являются хранение и утилизация.
  • Данные не могут храниться дольше, чем это необходимо для этой цели; Учреждение должно разработать политику хранения и уничтожения.
  • Истории чатов ИИ также являются сохраненными данными; должны быть включены в график утилизации и настройки хранения.
  • Анонимизация удаляет данные из КВКК; Псевдонимизация по-прежнему оставляет данные личными.
  • Удаление имени не является анонимизацией; Все комбинации, подверженные риску повторной идентификации, должны быть обобщены.

Задача приложения

Выберите категорию данных, которые ваша организация обрабатывает с помощью ИИ (например, записи службы поддержки клиентов). Напишите строку политики хранения и уничтожения для этой категории: срок хранения (обоснованный), метод уничтожения, включена ли история чата AI и ответственная роль. Затем возьмите образец записи из тех же данных и сначала псевдонимизируйте ее (таблицу соответствия держите отдельно), затем напишите, какие поля вы будете обобщать и как эту запись довести до истинной анонимности. Наконец, подготовьте пять вопросов, которые контролируют поведение используемого вами инструмента искусственного интеллекта при хранении данных, и добавьте к каждому «безопасный» ответ, который вы ожидаете.

контрольный список

  • [ ] Я определил срок хранения и метод уничтожения для категории данных.
  • [ ] Я включил историю чата ИИ в график уничтожения.
  • [ ] Я отметил пункт отказа «Не использовать в обучении модели».
  • [ ] Я реализовал разницу между псевдонимизацией и анонимизацией.
  • [ ] У меня есть обобщенные комбинации полей, которые могут быть повторно идентифицированы.
  • [ ] Я также включил в объем удаления резервные копии и журналы.
  • [ ] Я проверил поведение инструмента искусственного интеллекта при хранении данных.