одиниця 10 / 11

Конфіденційність даних, безпечний вибір інструментів і анонімізація

Прибуток:

  • Анонімізація та оцінка необхідності перед наданням конфіденційних і фінансових даних клієнта інструментам штучного інтелекту
  • Здатність розрізняти корпоративні та публічні інструменти штучного інтелекту щодо конфіденційності, збереження даних і використання в освіті
  • Здатність керувати ризиками, пов’язаними з порушенням даних, періодом зберігання та обміном третіми сторонами в рамках KVKK

Страхувальник — одна з професій, яка працює з найбільш конфіденційними даними. Страховий файл; Це може містити інформацію про особу, адресу, дохід, банківський рахунок, історію здоров’я, записи про пошкодження, номерний знак, документ про право власності та навіть інформацію про сім’ю. Деякі з цих даних підлягають найвищому захисту як «персональні дані особливого характеру» в KVKK (Закон про захист персональних даних); Типовими прикладами цього є дані про здоров’я, біометричні дані тощо. Неконтрольований обмін цими даними під час використання інструментів штучного інтелекту (особливо хмарних) є серйозним ризиком порушення та втрати довіри. Після витоку дані неможливо відновити. У цьому розділі ви дізнаєтеся, як анонімізувати дані клієнтів (видаляючи особисту інформацію) перед тим, як передати їх штучному інтелекту, про відмінності конфіденційності між корпоративними та загальнодоступними інструментами, а також про те, як керувати ризиками порушення даних, їх зберігання та передачі третіми сторонами в рамках KVKK. Цей розділ не є юридичною консультацією; Пояснює загальні принципи, консультується з комплаєнс/юридичного відділу в конкретному випадку.

Чому конфіденційність є критичною: типи даних

У страхуванні необхідно розділяти дані за рівнем захисту:

  • Ідентифікаційні дані: Прізвище, ім'я, по батькові, ІПН, дата народження, контакт. Це безпосередньо ідентифікує особу.
  • Фінансові дані: дохід, банківський рахунок, історія платежів. Особистий і чутливий.
  • Особливі дані про якість: стан здоров'я, біометричні дані. Найвищий захист; Для обробки потрібні суворіші умови (явна згода чи встановлений законом виняток).
  • Дані файлу: номер полісу, номерний знак, документ про право власності, відомості про пошкодження. У поєднанні з іншими він може виявити ідентичність.

Найбільша небезпека полягає в ідентифікації, яка виникає, коли ви зводите ці дані разом. Хоча «45-річна жінка» є анонімною, «45-річна жінка + певний номерний знак + певна адреса» може розкрити особу.

Увага: якщо сказати «видалити» після надання даних інструменту штучного інтелекту, вони насправді не видаляються. Деякі інструменти зберігають вхідні дані та навіть використовують їх для навчання моделі. Правило: ніколи не надсилайте конфіденційні дані; Анонімізація відбувається перед відправкою.

Анонімізація: як це зробити

Анонімізація — це видалення ідентифікаційної інформації та заміна її фактичним еквівалентом; Мета полягає в тому, щоб зробити людину невпізнанною, зберігаючи при цьому якість результату. Хороша анонімізація:

  • Видаляє ім’я, ідентифікатор транспортного засобу, номер телефону, адресу, номер полісу, номерний знак і інформацію про право власності.
  • Він замінює їх аналітично значущим еквівалентом: «45 років, чоловік, страховий поліс, Центральна Анатолія, одностороннє зіткнення».
  • Він уникає рідкісних/виразних комбінацій: дуже специфічна професія + дуже маленьке місце, яке лише може відкрити ідентичність.
  • Зберігає медичне/технічне значення: наприклад, «додаткове лікування, планова ортопедична операція».
Порада: після анонімізації запитайте себе: «Якби незнайомець прочитав цей текст, чи міг би він знайти цю людину?» Якщо відповідь ствердна, узагальнюйте далі. Особливо рідкісні комбінації (невеликий район + конкретна подія) небезпечні.

Підприємство проти публічних інструментів

Не всі інструменти ШІ мають однаковий рівень конфіденційності. Вони відрізняються за трьома параметрами:

  1. Зберігання даних: чи зберігаються введені дані та як довго?
  2. Використання в навчанні: чи використовуються дані для навчання моделі?
  3. Місцезнаходження та договір: Де обробляються дані, чи є корпоративна угода про обробку даних?

Інституційні інструменти (контракт закладу, гарантії обробки даних) часто пропонують обмеження на невикористання та зберігання даних в освіті. Загальнодоступні безкоштовні інструменти можуть зберігати дані та використовувати їх у навчанні. Правило: конфіденційні дані обробляються лише схваленими установами за договором засобами та в максимально анонімній формі. Введення даних клієнта в несхвалений інструмент робить процесор даних недоступним для перевірки.

Крок за кроком: безпечна робота з конфіденційними даними

  1. Класифікуйте дані. Ідентифікаційні/фінансові/спеціальна якість/файлові дані.
  2. Тест на необхідність. Чи справді ці дані потрібні для цього завдання? Якщо ні, не використовуйте його.
  3. Знеособити. Видалити ідентифікатори, замінити фактичними еквівалентами, узагальнити рідкісні комбінації.
  4. Виберіть транспортний засіб. Лише схвалені агентством транспортні засоби за контрактом; Немає конфіденційних даних, доступних для публічного інструменту.
  5. Працюйте з мінімумом даних. Поділіться мінімальною інформацією, необхідною для виконання завдання.
  6. Керуйте зберіганням і спільним доступом. Де ви зберігаєте результати, з ким ви ними ділитеся; Дотримуватися терміну зберігання КВКК і правил третіх осіб. Залиште свій слід.

три міні-чохла

Випадок 1 — захист конфіденційних даних. Спеціаліст із претензій хотів запитати ШІ про складний файл медичного страхування. Замість написання імені, ідентифікаційного номера та діагнозу застрахованої особи він створив анонімний контекст на кшталт «52 роки, жінка, додаткова поліса охорони здоров’я, запланована операція на клапані серця, спірна сума». Якість виходу не знизилася; Приватні дані не потрапили ні в одну хмару. Дані про здоров'я підлягають найвищому захисту; ця звичка перешкоджала порушенню.

Випадок 2 — рідкісна комбінована пастка. «38 років, жінка, єдиний фармацевт у [дуже маленькому окрузі], політика професійної відповідальності», — написав один експерт. Хоча це технічно не містило імені, це прямо розкривало його особу, оскільки він був єдиним фармацевтом у тому районі. Експерт це помітив і узагальнив як «невелике поселення, професія охорони здоров’я». Анонімізація – це не просто видалення імені, це знищення впізнаваності.

Випадок 3 — Неправильний вибір інструменту. Для швидкості працівник завантажує розбивку претензій клієнтів у безкоштовний публічний інструмент. Політика команди вступає в силу: дані клієнтів обробляються лише в схваленому установою інструменті за контрактом. Співробітник спочатку анонімізував дані, а потім запустив їх у затвердженому інструменті. Якщо використовувався несхвалений інструмент, ризик зберігання та використання даних в освіті буде неконтрольованим.

Чотири підказки, які можна копіювати

1) Помічник з анонімізації:

Видаліть усі особисті та ідентифікаційні дані з такого тексту: ім’я, прізвище, ідентифікаційний номер, дата народження, телефон, адреса, номер полісу, номерний знак, документ про право власності, IBAN. Замініть їх фактичним еквівалентом з аналітичним значенням (наприклад, «45 років, чоловік, страховий поліс, одностороннє зіткнення»). Узагальніть рідкісні/відмітні комбінації (невелике місце + спеціальна професія). Зберігає медичне/технічне значення. Текст: [вставити]

2) Перевірка впізнаваності:

Перевірте наступний анонімний текст на розпізнавання: [текст]Запитайте: чи може незнайомець знайти людину за цим текстом? Чи є рідкісна комбінація (невелике поселення + певна професія/подія), унікальна дата або сума? Виділіть кожну ризиковану точку та запропонуйте, як більш безпечно узагальнювати.

3) Вимоги до даних і класифікація:

Класифікуйте та перевірте вимоги до даних, необхідних для наступного завдання: Завдання: [опис] Дані, які я маю: [список]Для кожного даних: тип (ідентифікаційні/фінансові/спеціальні/файл), чи потрібні вони для цього завдання (так/ні), якщо необхідно, як використовувати їх анонімно. Позначте непотрібні дані як "не використовувати".

4) Контрольний список для вибору автомобіля:

Створіть контрольний список перед використанням інструменту ШІ з даними страхування. Включіть запитання: чи схвалено транспортний засіб установою? Чи є угода про обробку даних? Чи зберігає/використовує введення в навчанні? Де обробляються дані? Для якого типу даних він підходить/не підходить? Чи достатньо анонімізації?

Слабка підказка / Сильна підказка

Слабко: «Оцініть файл клієнта Ахмета Йилмаза (TC 123..., медичний висновок додається)».
Проблема: особисті дані та конфіденційні дані (про стан здоров’я) надаються напряму; великий ризик порушення КВКК.
Сильно: «Розглянемо такий анонімний контекст: вік 52 роки, жінка, політика додаткового медичного обслуговування, запланована операція, оскаржувана сума. Без ідентифікаційної інформації».
Чому це добре: зберігається аналітичний сенс, особисті дані та конфіденційні дані не розкриваються.

порівняльна таблиця

Тип даних

Рівень захисту

Використання в штучному інтелекті

Ім'я/TC/контакт

висока

Зняти, поставити еквівалент

Фінансовий (дохід/IBAN)

висока

Видалити/узагальнити

Стан здоров'я/спеціальна кваліфікація

найвищий

Ніколи не сирий; анонім + затверджений автомобіль

Номер полісу/номер/номер права власності

середньо-високий

видалити; поодинці ризиковано

Агрегат/статистика

низький

Доступно (якщо немає контакту)

Поширені помилки

  • Вставлення необроблених особистих даних/даних про здоров’я. Найчастіше і найгрубіше порушення.
  • Думаючи, що просто видалити ім’я достатньо. Рідкісні комбінації все ще можуть виявити особу.
  • Покладаючись на «видалити пізніше». Інструмент може зберігати/використовувати дані під час навчання.
  • Недозволене/громадське водіння. Неконтрольована обробка даних.
  • Не керує сховищем і спільним доступом. Необмежене зберігання вихідних даних, неконтрольований обмін із третіми сторонами.

Підсумовуючи

Страхові дані дуже конфіденційні; Особливі дані, такі як здоров'я, підлягають найвищому захисту за КВКК. Класифікуйте, оскаржуйте та анонімізуйте дані, перш ніж передати їх ШІ: видаліть ідентифікатори, введіть фактичні еквіваленти, узагальніть рідкісні комбінації. Обробляйте конфіденційні дані лише в мінімальному обсязі за допомогою інструментів, схвалених установами. Керуйте періодом зберігання та спільним доступом до третіх сторін у рамках KVKK і залишайте слід. Проконсультуйтеся з комплаєнс/юридичним відділом у конкретному випадку; Витік даних неможливо відновити.

Аплікаційне завдання

Отримайте справжні пошкодження/довідковий текст (для тестування). Зробіть анонімним за допомогою підказки №1, а потім перевірте розпізнавання за допомогою підказки №2: чи є в тексті ще рідкісні комбінації, які можуть розкрити особу? Узагальніть кожен виявлений ризик. Також оцініть інструмент штучного інтелекту, який ви використовуєте, за контрольним списком № 4: чи підходить він для конфіденційних даних?

контрольний список

  • [ ] Я класифікував дані відповідно до їх типів.
  • [ ] Я застосував тест на необхідність; Я не використовував непотрібних даних.
  • [ ] Я видалив ідентифікатори та замінив їх фактичним еквівалентом.
  • [ ] Я узагальнив рідкісні/виразні комбінації.
  • [ ] Я зробив перевірку на впізнаваність.
  • [ ] Я користувався лише схваленими компанією транспортними засобами за контрактом.
  • [ ] Я керував зберіганням та спільним використанням третіми особами відповідно до КВКК; Я залишив слід.