единица 7 / 12

Обработка на данни, съхранение, минимизиране и анонимизиране

Печалби:

  • Прилагайте съображения за AI на всеки етап от жизнения цикъл на данните
  • Задайте периоди на задържане и включете историите на AI чата в политиката за унищожаване
  • Прилагане на разликата между анонимизация и псевдонимизация

Частта „след“ от данните е мястото, където длъжностното лице по защита на данните често пренебрегва. След като текстът бъде въведен в AI, изглежда, че работата е свършена; Тези данни обаче се съхраняват някъде, може би се използват при обучение на модели, може би се натрупват в историята на чата с месеци. В тази част ще обсъдим жизнения цикъл на личните данни стъпка по стъпка; Ще научим за периодите на задържане, унищожаването на историята на чатовете с изкуствен интелект и разграничаването между две критични техники — анонимизиране и псевдонимизиране. Целта е данните да се управляват през целия им живот, а не само когато бъдат въведени.

Жизнен цикъл на данните и AI

Личните данни преминават през жизнен цикъл; Всеки етап има точки за внимание, специфични за AI.

Етап

какво става

AI точка на внимание

колекция

Получават се данни

Ясни ли са целта и основата? Минимизиран ли е?

Използване/обработка

Въведено в AI, обработено

Направено ли е маскиране? Одобрено превозно средство?

съхранение

Данните се запазват

Колко време трае историята на чатовете?

трансфер

отива при някой друг

Международен сървър? Има ли подходяща гаранция?

Унищожаване

Изтриване/анонимизиране

Беше ли изтрит, след като целта беше изпълнена? Включени ли са резервни части?

Двата най-пренебрегвани етапа са съхранението и изхвърлянето. Данните се „забравят“ и продължават да се натрупват в системата — което едновременно нарушава принципа на KVKK и увеличава щетите в случай на пробив.

Време за съхранение: колко дълго можете да го съхранявате?

Принципът на съхранение на KVKK е ясен: личните данни не могат да се съхраняват по-дълго от необходимото за целта, за която се обработват. Когато целта вече не е налична, данните трябва да бъдат изтрити, унищожени или анонимизирани. Институцията изготвя политика за съхранение и обезвреждане; определя колко да се запази за всяка категория данни.

Критична точка, специфична за AI: историите на чат с AI също са съхранени данни. Ако служител е въвел клиентски данни в един и същ чат в продължение на месеци, тази история се превръща в хранилище на данни. За това:

  • Конфигурирайте настройките за запазване на данни в корпоративни инструменти за AI (автоматично изтриване на хронологията, ако е възможно, или изключване на използването в обучението на модели).
  • Включете историята на чата в графика си за унищожаване.
  • Осигурете опцията „Да не се използва в обучението на модели“ (отказ) в корпоративния договор.
Внимание: Изтриването на данни не означава просто премахването им от екрана. Резервни копия, регистрационни файлове и копия на сървъра на доставчика също трябва да се имат предвид. Когато кажете „изтрито“, уверете се, че това, което сте изтрили, е наистина безвъзвратно.

Анонимизация или псевдонимизация?

Тези два термина често се бъркат, но техните правни последици са диаметрално противоположни.

  • Анонимизиране: Създаване на данни, така че да не могат да бъдат свързани с дадено лице по никакъв начин. Ако е направено правилно, резултатът вече не е лични данни и попада извън обхвата на KVKK. Пример: Изтриване на отделни редове в набор от данни от 10 000 души и оставяне само на обобщена статистика като „Средни разходи във възрастовата група 25-34 в Истанбул“.
  • Псевдонимизация: Информацията за самоличност се заменя с код/таг, но може да бъде върната на лицето с „ключ“. Пример: Писане на „Клиент-4471“ вместо „Ахмет Йълмаз“, но запазване на таблица, показваща кой код на кого принадлежи. Това все още са лични данни и попадат в обхвата на KVKK.

функция

Анонимизиране

Псевдонимизация

Може ли лицето да бъде върнато?

Не (ако е направено правилно)

Да, с ключа

Все още ли са лични данни?

не

да

KVKK обхват

навън

в

Да вляза в AI

Най-сигурният начин

Отново се изисква база/правило

Съвет: "Обратимо ли е?" преди да въведете данни в AI. попитайте. Ако в него има ключ/съвпадение, това е псевдонимизирано и все още лични данни. Истинската анонимност е споделяне на обобщения резултат, а не на отделни редове.

три мини калъфа

Случай 1 — Фалшива анонимност. Здравна компания предоставя на AI набор от данни, които казва, че е „анонимизирала“ за анализ. Но комплектът включва дата на раждане, окръг и рядка диагноза; това трио може да означава един човек в малък окръг. Това не е анонимизация; данните все още са лични. Правилният начин: преобразуване на дата на раждане във възрастов диапазон, обобщаване по окръг, групиране на редки диагнози - тоест истинско обобщаване.

Случай 2 — Натрупване на разговори. В кол център 6 агента въвеждат клиентски данни в един и същ корпоративен AI акаунт в продължение на 4 месеца. Никой не изчиства миналото; в крайна сметка повече от 12 000 взаимодействия с клиенти, натрупани на едно място. При одит това натрупване се отбелязва като основен риск. Решение: настройка за автоматично изтриване на хронологията на всеки 30 дни, правило за излизане, когато заданието приключи, и клауза, отворена за политиката за запазване.

Случай 3 — Правилно псевдонимизиране. Когато анализира представянето на служителите с AI, екипът по човешки ресурси кодира имена като „Служител-001“ и съхранява съответстващата таблица в отделен файл с ограничен достъп. Това е псевдонимизация; Данните все още са лични, но рискът е намален. Екипът е наясно, че това не е анонимизиране и съответно определя правното си основание и периода на съхранение.

Копируеми шаблони

ШАБЛОН 1 — Ред на политика за запазване и унищожаване: „Предложете ред на политика за запазване-унищожаване за следната категория данни: [категория]. Полета: период на задържане (обосновано от целта), метод на унищожаване (изтриване/унищожаване/анонимизиране), дали е включена хронология на чата на AI, отговорна роля. Напомняне дали има законово задължение за задържане.“

ШАБЛОН 2 — Проверка за анонимизиране: „Оценете дали следният набор от данни е наистина анонимен: [списъчни полета]. Какви комбинации от полета биха могли да направят дадено лице повторно идентифицирано (напр. дата на раждане + пощенски код + рядка характеристика)? Предложете обобщение за всяко рисково поле (като възрастова група, ниво на провинция), за да засилите анонимността.“

ШАБЛОН 3 — Маскиране + разделяне на ключ за връщане: "Псевдоним на следния текст: кодирайте лични данни (като [ИМЕ]->K001), но ми дайте съответстваща таблица ОТДЕЛНО. Не оставяйте истинска идентичност в самия текст. Имайте предвид, че съответстващата таблица е "лични данни" и трябва да се съхранява отделно."

ШАБЛОН 4 — Одит за съхранение на данни на AI инструмент: „Подгответе списък с въпроси за одит на поведението на съхранение на данни на AI инструмента, който използваме: колко дълго се съхранява историята, може ли да бъде изтрита, използва ли се в обучението на модели, има ли отказ, къде се обработват данните, какви са резервните копия? Напишете очаквания „сигурен“ отговор на всеки въпрос.“

Слаба подкана / Силна подкана

СЛАБО: „Анонимизиране на тези данни.“ (кодира и оставя имената)-> Само прякори; Остават рисковете при повторно идентифициране, като дата на раждане, рядка черта; Създава се илюзията за "анонимен". GÜÇLÜ: „Намерете комбинации от полета в този набор, които могат да идентифицират повторно лицето; обобщете всяко от тях (възрастова група, ниво на провинция). Моята цел не е единичен запис, а обобщена статистика. В резултат на това никой не може да бъде разграничен като отделен човек и проверете това.“ -> Моделът има тенденция към истинска анонимност, намалявайки риска от повторна идентификация.

Често срещани грешки

  • Грешка при псевдонимизиране с анонимизиране; забравяйки, че остават лични данни.
  • Изтриване на имена и оставяне на описателни комбинации като дата на раждане + местоположение + рядка черта.
  • Не подчинява AI чат историята на правило за задържане/унищожаване; натрупват се за неопределено време.
  • Не е гарантирана клаузата „Да не се използва в обучението на модели“ (отказ) в договора.
  • Когато казвам изтриване, имам предвид просто да изчистите екрана и да забравите за архивирането и регистрационните файлове.
  • Удължаване на срока на съхранение за „за всеки случай“, а не за целта.
  • Пренебрегвайки, че прехвърлянето и съхранението също се извършва на сървъра на доставчика.

В обобщение

  • Личните данни преминават през жизнен цикъл; Най-пренебрегваните етапи са съхранението и изхвърлянето.
  • Данните не могат да се съхраняват по-дълго от необходимото за целта; Институцията трябва да установи политика за съхранение и унищожаване.
  • Хронологията на AI чатовете също са съхранени данни; трябва да бъдат включени в графика за изхвърляне и настройките за съхранение.
  • Анонимизирането извежда данните от KVKK; Псевдонимизацията все още оставя данните лични.
  • Изтриването на име не е анонимизиране; Всички комбинации с риск от повторна идентификация трябва да бъдат обобщени.

Задача за приложение

Изберете категория данни, които вашата организация обработва с AI (например записи за поддръжка на клиенти). Напишете линия за политика за запазване и унищожаване за тази категория: период на задържане (обоснован), метод на унищожаване, дали е включена хронология на AI чата и отговорна роля. След това вземете примерен запис от същите данни и първо го псевдонимизирайте (запазете съвпадащата таблица отделно), след това напишете кои полета ще обобщите и как да доведете този запис до истинска анонимност. И накрая, подгответе пет въпроса, които контролират поведението за съхранение на данни на инструмента с изкуствен интелект, който използвате, и добавете „сигурния“ отговор, който очаквате към всеки от тях.

контролен списък

  • [ ] Определих периода на съхранение и метода на унищожаване за категорията данни.
  • [ ] Включих историята на чата на AI в графика за унищожаване.
  • [ ] Отметнах елемента за отказване „Да не се използва в обучението на модели“.
  • [ ] Приложих разликата между псевдонимизиране и анонимизиране.
  • [ ] Имам генерализирани комбинации от полета, които са изложени на риск от повторна идентификация.
  • [ ] Също така включих резервни копия и регистрационни файлове в обхвата на изтриването.
  • [ ] Проверих поведението при съхранение на данни на инструмента AI.