Прибуток:
- Застосовуйте міркування ШІ на кожному етапі життєвого циклу даних
- Встановіть періоди зберігання та включіть історії чатів ШІ в політику знищення
- Застосування різниці між анонімізацією та псевдонімізацією
Частина даних «після» — це те, на що спеціаліст із захисту даних часто не звертає уваги. Після введення тексту в ШІ здається, що роботу виконано; Однак ці дані десь зберігаються, можливо, використовуються під час навчання моделі, можливо, вони накопичуються в історії чату місяцями. У цьому розділі ми крок за кроком обговоримо життєвий цикл персональних даних; Ми дізнаємося про періоди зберігання, знищення історії чатів штучного інтелекту та розрізнення двох критичних технік — анонімізації та псевдонімізації. Мета полягає в тому, щоб керувати даними протягом усього терміну служби, а не лише під час їх введення.
Життєвий цикл даних і ШІ
Персональні дані проходять життєвий цикл; Кожен етап має точки уваги, характерні для ШІ.
етап
що відбувається
ШІ точка уваги
колекція
Дані отримані
Чи зрозумілі мета і основа? Чи зведено до мінімуму?
Використання/обробка
Введено в ШІ, оброблено
Чи зроблено маскування? Схвалений автомобіль?
зберігання
Дані зберігаються
Як довго зберігається історія чату?
передача
переходить до когось іншого
Міжнародний сервер? Чи є відповідна гарантія?
руйнування
Видалення/анонімізація
Чи було його видалено після досягнення мети? Чи включені запчастини?
Двома найбільш занедбаними етапами є зберігання та утилізація. Дані «забуваються» і продовжують накопичуватися в системі — це водночас порушує принцип КВКК і збільшує збитки у разі злому.
Термін зберігання: скільки можна зберігати?
Принцип зберігання KVKK чіткий: персональні дані не можуть зберігатися довше, ніж це необхідно для мети, для якої вони обробляються. Коли мета більше не доступна, дані повинні бути видалені, знищені або анонімні. Установа готує політику зберігання та утилізації; визначає, скільки зберігати для кожної категорії даних.
Критична точка, специфічна для ШІ: історії чатів ШІ також зберігаються. Якщо співробітник вводив дані клієнта в один чат протягом місяців, ця історія стає сховищем даних. Для цього:
- Налаштуйте параметри збереження даних у корпоративних інструментах штучного інтелекту (автоматично видаліть історію, якщо можливо, або вимкніть використання в навчанні моделі).
- Включіть історію чатів у свій графік знищення.
- Забезпечити в корпоративному договорі опцію «Не використовувати в навчанні моделей» (відмова).
Увага: видалення даних — це не просто їх видалення з екрана. Також слід враховувати резервні копії, журнали та копії на сервері постачальника. Коли ви говорите «видалено», переконайтеся, що те, що ви видалили, справді неможливо відновити.
Анонімізація чи псевдонімізація?
Ці два терміни часто плутають, але їхні правові наслідки діаметрально протилежні.
- Анонімізація: створення даних таким чином, щоб їх жодним чином не можна було пов’язати з особою. Якщо все зроблено правильно, результат більше не є персональними даними та виходить за межі KVKK. Приклад: видалення окремих рядків у наборі даних із 10 000 осіб і залишення лише сукупної статистики, як-от «Середні витрати у віковій групі 25–34 у Стамбулі».
- Псевдонімізація: інформація про особу замінюється кодом/тегом, але може бути повернута людині за допомогою «ключа». Приклад: написати «Клієнт-4471» замість «Ahmet Yılmaz», але зберегти таблицю, яка показує, який код кому належить. Це все ще особисті дані, і вони підпадають під дію KVKK.
функція
Анонімізація
Псевдонімізація
Чи можна повернути людину?
Ні (якщо зроблено правильно)
Так, з ключем
Це все ще особисті дані?
немає
так
Область застосування КВКК
назовні
в
Щоб потрапити в ШІ
Найбезпечніший спосіб
Знову ж таки, потрібна основа/правило
Порада: "Це оборотно?" перед введенням даних в ШІ. запитати. Якщо в ньому є ключ/збіг, це псевдонім і все ще особисті дані. Справжня анонімність — це спільний доступ до зведеного результату, а не до окремих рядків.
три міні-чохла
Випадок 1 — Підроблена анонімність. Медична компанія надає штучному інтелекту набір даних, які, як вона каже, «анонімізувала» для аналізу. Але в наборі є дата народження, округ і рідкісний діагноз; це тріо може вказувати на одну особу в невеликому повіті. Це не анонімізація; дані все ще особисті. Правильний шлях: конвертація дати народження у віковий діапазон, узагальнення по округах, групування рідкісних діагнозів — тобто справжнє агрегування.
Випадок 2 — Розмова накопичується. У кол-центрі 6 агентів протягом 4 місяців вводять дані клієнтів в один корпоративний обліковий запис AI. Ніхто не очищає минуле; зрештою більше 12 000 взаємодій з клієнтами накопичилися в одному місці. Під час аудиту це накопичення позначається як великий ризик. Рішення: налаштування автоматичного видалення історії кожні 30 днів, правило виходу з системи після завершення завдання та пункт, відкритий для політики збереження.
Випадок 3 — Правильна псевдонімізація. Під час аналізу продуктивності співробітників за допомогою штучного інтелекту команда відділу кадрів кодує імена на зразок «Співробітник-001» і зберігає відповідну таблицю в окремому файлі з обмеженим доступом. Це псевдонімізація; Дані залишаються особистими, але ризик зменшується. Команда усвідомлює, що це не анонімізація, і відповідно визначає правову основу та термін зберігання.
Шаблони, які можна копіювати
ШАБЛОН 1 — Рядок політики збереження та знищення: «Запропонуйте рядок політики збереження-знищення для такої категорії даних: [категорія]. Поля: період зберігання (обґрунтований метою), метод знищення (видалення/знищення/анонімізація), чи включена історія чату AI, відповідальна роль. Нагадайте, чи існує юридичне зобов’язання щодо зберігання».
ШАБЛОН 2 — Перевірка анонімності: «Оцініть, чи є наступний набір даних справді анонімним: [поля списку]. Які комбінації полів можуть зробити особу ідентифікованою (наприклад, дата народження + поштовий індекс + рідкісна характеристика)? Запропонуйте узагальнення для кожного поля ризику (наприклад, віковий діапазон, рівень провінції), щоб посилити анонімність».
ШАБЛОН 3 — Маскування + розділення ключів повернення: «Псевдонім наступного тексту: закодуйте особисті дані (наприклад, [NAME]->K001), але дайте мені відповідну таблицю ОКРЕМО. Не залишайте справжньої ідентичності в самому тексті. Зверніть увагу, що відповідна таблиця є «особистими даними» і повинна зберігатися окремо».
ШАБЛОН 4 — Аудит зберігання даних інструменту штучного інтелекту: «Підготуйте список запитань для аудиту поведінки зберігання даних інструменту штучного інтелекту, який ми використовуємо: як довго зберігається історія, чи можна її видалити, чи використовується вона в навчанні моделі, чи існує відмова, де обробляються дані, які резервні копії? Напишіть очікувану «безпечну» відповідь на кожне запитання».
Слабка підказка / Сильна підказка
СЛАБКИЙ: «Анонімізувати ці дані». (кодує та залишає імена)-> Просто ники; Зберігаються ризики повторної ідентифікації, такі як дата народження, рідкісна ознака; Це створює ілюзію «анонімності». GÜÇLÜ: «Знайдіть у цьому наборі комбінації полів, за якими можна повторно ідентифікувати особу; узагальніть кожне з них (віковий діапазон, рівень провінції). Моєю метою є не окремий запис, а сукупна статистика. У результаті нікого не можна виділити як одну особу та перевірити це». -> Модель прагне до справжньої анонімізації, зменшуючи ризик повторної ідентифікації.
Поширені помилки
- Помилково приймаючи псевдонімізацію за анонімізацію; забуваючи, що це особисті дані.
- Видалення імен і залишення описових комбінацій, таких як дата народження + місцезнаходження + рідкісна риса.
- Не підпорядковувати історію чату AI правилу збереження/знищення; накопичувати нескінченно.
- Недотримання в контракті пункту «Не використовувати під час навчання моделі» (відмова).
- Коли я кажу про видалення, я маю на увазі просто очистити екран і забути про резервні копії та журнали.
- Тривалість терміну зберігання «про всяк випадок», а не за призначенням.
- Ігноруючи, що передача та зберігання також відбувається на сервері провайдера.
Підсумовуючи
- Персональні дані проходять життєвий цикл; Найбільш занедбані етапи – зберігання та утилізація.
- Дані не можуть зберігатися довше, ніж це необхідно для цієї мети; Установа повинна встановити політику зберігання та знищення.
- Історії чатів AI також зберігаються; повинні бути включені до графіка утилізації та параметрів зберігання.
- Анонімізація виводить дані з КВКК; Псевдонімізація все одно залишає дані персональними.
- Видалення імені не є анонімізацією; Усі комбінації з ризиком повторної ідентифікації слід узагальнити.
Аплікаційне завдання
Виберіть категорію даних, які ваша організація обробляє за допомогою ШІ (наприклад, записи служби підтримки клієнтів). Напишіть рядок політики зберігання та знищення для цієї категорії: період зберігання (обґрунтований), метод знищення, чи включена історія чату ШІ та відповідальна роль. Потім візьміть зразок запису з тих самих даних і спочатку псевдонімізуйте його (зберігайте відповідну таблицю окремо), потім напишіть, які поля ви будете узагальнювати та як привести цей запис до справжньої анонімності. Нарешті, підготуйте п’ять запитань, які контролюють поведінку зберігання даних інструменту штучного інтелекту, який ви використовуєте, і додайте «безпечну» відповідь на кожне з них.
контрольний список
- [ ] Я визначив термін зберігання та метод знищення для категорії даних.
- [ ] Я включив історію чатів AI у графік знищення.
- [ ] Я позначив пункт відмови "Не використовувати під час навчання моделі".
- [ ] Я реалізував різницю між псевдонімізацією та анонімізацією.
- [ ] У мене є узагальнені комбінації полів, які піддаються ризику повторної ідентифікації.
- [ ] Я також включив резервні копії та журнали до сфери видалення.
- [ ] Я перевірив поведінку інструмента ШІ для зберігання даних.