Печалби:
- Прилагайте съображения за AI на всеки етап от жизнения цикъл на данните
- Задайте периоди на задържане и включете историите на AI чата в политиката за унищожаване
- Прилагане на разликата между анонимизация и псевдонимизация
Частта „след“ от данните е мястото, където длъжностното лице по защита на данните често пренебрегва. След като текстът бъде въведен в AI, изглежда, че работата е свършена; Тези данни обаче се съхраняват някъде, може би се използват при обучение на модели, може би се натрупват в историята на чата с месеци. В тази част ще обсъдим жизнения цикъл на личните данни стъпка по стъпка; Ще научим за периодите на задържане, унищожаването на историята на чатовете с изкуствен интелект и разграничаването между две критични техники — анонимизиране и псевдонимизиране. Целта е данните да се управляват през целия им живот, а не само когато бъдат въведени.
Жизнен цикъл на данните и AI
Личните данни преминават през жизнен цикъл; Всеки етап има точки за внимание, специфични за AI.
Етап
какво става
AI точка на внимание
колекция
Получават се данни
Ясни ли са целта и основата? Минимизиран ли е?
Използване/обработка
Въведено в AI, обработено
Направено ли е маскиране? Одобрено превозно средство?
съхранение
Данните се запазват
Колко време трае историята на чатовете?
трансфер
отива при някой друг
Международен сървър? Има ли подходяща гаранция?
Унищожаване
Изтриване/анонимизиране
Беше ли изтрит, след като целта беше изпълнена? Включени ли са резервни части?
Двата най-пренебрегвани етапа са съхранението и изхвърлянето. Данните се „забравят“ и продължават да се натрупват в системата — което едновременно нарушава принципа на KVKK и увеличава щетите в случай на пробив.
Време за съхранение: колко дълго можете да го съхранявате?
Принципът на съхранение на KVKK е ясен: личните данни не могат да се съхраняват по-дълго от необходимото за целта, за която се обработват. Когато целта вече не е налична, данните трябва да бъдат изтрити, унищожени или анонимизирани. Институцията изготвя политика за съхранение и обезвреждане; определя колко да се запази за всяка категория данни.
Критична точка, специфична за AI: историите на чат с AI също са съхранени данни. Ако служител е въвел клиентски данни в един и същ чат в продължение на месеци, тази история се превръща в хранилище на данни. За това:
- Конфигурирайте настройките за запазване на данни в корпоративни инструменти за AI (автоматично изтриване на хронологията, ако е възможно, или изключване на използването в обучението на модели).
- Включете историята на чата в графика си за унищожаване.
- Осигурете опцията „Да не се използва в обучението на модели“ (отказ) в корпоративния договор.
Внимание: Изтриването на данни не означава просто премахването им от екрана. Резервни копия, регистрационни файлове и копия на сървъра на доставчика също трябва да се имат предвид. Когато кажете „изтрито“, уверете се, че това, което сте изтрили, е наистина безвъзвратно.
Анонимизация или псевдонимизация?
Тези два термина често се бъркат, но техните правни последици са диаметрално противоположни.
- Анонимизиране: Създаване на данни, така че да не могат да бъдат свързани с дадено лице по никакъв начин. Ако е направено правилно, резултатът вече не е лични данни и попада извън обхвата на KVKK. Пример: Изтриване на отделни редове в набор от данни от 10 000 души и оставяне само на обобщена статистика като „Средни разходи във възрастовата група 25-34 в Истанбул“.
- Псевдонимизация: Информацията за самоличност се заменя с код/таг, но може да бъде върната на лицето с „ключ“. Пример: Писане на „Клиент-4471“ вместо „Ахмет Йълмаз“, но запазване на таблица, показваща кой код на кого принадлежи. Това все още са лични данни и попадат в обхвата на KVKK.
функция
Анонимизиране
Псевдонимизация
Може ли лицето да бъде върнато?
Не (ако е направено правилно)
Да, с ключа
Все още ли са лични данни?
не
да
KVKK обхват
навън
в
Да вляза в AI
Най-сигурният начин
Отново се изисква база/правило
Съвет: "Обратимо ли е?" преди да въведете данни в AI. попитайте. Ако в него има ключ/съвпадение, това е псевдонимизирано и все още лични данни. Истинската анонимност е споделяне на обобщения резултат, а не на отделни редове.
три мини калъфа
Случай 1 — Фалшива анонимност. Здравна компания предоставя на AI набор от данни, които казва, че е „анонимизирала“ за анализ. Но комплектът включва дата на раждане, окръг и рядка диагноза; това трио може да означава един човек в малък окръг. Това не е анонимизация; данните все още са лични. Правилният начин: преобразуване на дата на раждане във възрастов диапазон, обобщаване по окръг, групиране на редки диагнози - тоест истинско обобщаване.
Случай 2 — Натрупване на разговори. В кол център 6 агента въвеждат клиентски данни в един и същ корпоративен AI акаунт в продължение на 4 месеца. Никой не изчиства миналото; в крайна сметка повече от 12 000 взаимодействия с клиенти, натрупани на едно място. При одит това натрупване се отбелязва като основен риск. Решение: настройка за автоматично изтриване на хронологията на всеки 30 дни, правило за излизане, когато заданието приключи, и клауза, отворена за политиката за запазване.
Случай 3 — Правилно псевдонимизиране. Когато анализира представянето на служителите с AI, екипът по човешки ресурси кодира имена като „Служител-001“ и съхранява съответстващата таблица в отделен файл с ограничен достъп. Това е псевдонимизация; Данните все още са лични, но рискът е намален. Екипът е наясно, че това не е анонимизиране и съответно определя правното си основание и периода на съхранение.
Копируеми шаблони
ШАБЛОН 1 — Ред на политика за запазване и унищожаване: „Предложете ред на политика за запазване-унищожаване за следната категория данни: [категория]. Полета: период на задържане (обосновано от целта), метод на унищожаване (изтриване/унищожаване/анонимизиране), дали е включена хронология на чата на AI, отговорна роля. Напомняне дали има законово задължение за задържане.“
ШАБЛОН 2 — Проверка за анонимизиране: „Оценете дали следният набор от данни е наистина анонимен: [списъчни полета]. Какви комбинации от полета биха могли да направят дадено лице повторно идентифицирано (напр. дата на раждане + пощенски код + рядка характеристика)? Предложете обобщение за всяко рисково поле (като възрастова група, ниво на провинция), за да засилите анонимността.“
ШАБЛОН 3 — Маскиране + разделяне на ключ за връщане: "Псевдоним на следния текст: кодирайте лични данни (като [ИМЕ]->K001), но ми дайте съответстваща таблица ОТДЕЛНО. Не оставяйте истинска идентичност в самия текст. Имайте предвид, че съответстващата таблица е "лични данни" и трябва да се съхранява отделно."
ШАБЛОН 4 — Одит за съхранение на данни на AI инструмент: „Подгответе списък с въпроси за одит на поведението на съхранение на данни на AI инструмента, който използваме: колко дълго се съхранява историята, може ли да бъде изтрита, използва ли се в обучението на модели, има ли отказ, къде се обработват данните, какви са резервните копия? Напишете очаквания „сигурен“ отговор на всеки въпрос.“
Слаба подкана / Силна подкана
СЛАБО: „Анонимизиране на тези данни.“ (кодира и оставя имената)-> Само прякори; Остават рисковете при повторно идентифициране, като дата на раждане, рядка черта; Създава се илюзията за "анонимен". GÜÇLÜ: „Намерете комбинации от полета в този набор, които могат да идентифицират повторно лицето; обобщете всяко от тях (възрастова група, ниво на провинция). Моята цел не е единичен запис, а обобщена статистика. В резултат на това никой не може да бъде разграничен като отделен човек и проверете това.“ -> Моделът има тенденция към истинска анонимност, намалявайки риска от повторна идентификация.
Често срещани грешки
- Грешка при псевдонимизиране с анонимизиране; забравяйки, че остават лични данни.
- Изтриване на имена и оставяне на описателни комбинации като дата на раждане + местоположение + рядка черта.
- Не подчинява AI чат историята на правило за задържане/унищожаване; натрупват се за неопределено време.
- Не е гарантирана клаузата „Да не се използва в обучението на модели“ (отказ) в договора.
- Когато казвам изтриване, имам предвид просто да изчистите екрана и да забравите за архивирането и регистрационните файлове.
- Удължаване на срока на съхранение за „за всеки случай“, а не за целта.
- Пренебрегвайки, че прехвърлянето и съхранението също се извършва на сървъра на доставчика.
В обобщение
- Личните данни преминават през жизнен цикъл; Най-пренебрегваните етапи са съхранението и изхвърлянето.
- Данните не могат да се съхраняват по-дълго от необходимото за целта; Институцията трябва да установи политика за съхранение и унищожаване.
- Хронологията на AI чатовете също са съхранени данни; трябва да бъдат включени в графика за изхвърляне и настройките за съхранение.
- Анонимизирането извежда данните от KVKK; Псевдонимизацията все още оставя данните лични.
- Изтриването на име не е анонимизиране; Всички комбинации с риск от повторна идентификация трябва да бъдат обобщени.
Задача за приложение
Изберете категория данни, които вашата организация обработва с AI (например записи за поддръжка на клиенти). Напишете линия за политика за запазване и унищожаване за тази категория: период на задържане (обоснован), метод на унищожаване, дали е включена хронология на AI чата и отговорна роля. След това вземете примерен запис от същите данни и първо го псевдонимизирайте (запазете съвпадащата таблица отделно), след това напишете кои полета ще обобщите и как да доведете този запис до истинска анонимност. И накрая, подгответе пет въпроса, които контролират поведението за съхранение на данни на инструмента с изкуствен интелект, който използвате, и добавете „сигурния“ отговор, който очаквате към всеки от тях.
контролен списък
- [ ] Определих периода на съхранение и метода на унищожаване за категорията данни.
- [ ] Включих историята на чата на AI в графика за унищожаване.
- [ ] Отметнах елемента за отказване „Да не се използва в обучението на модели“.
- [ ] Приложих разликата между псевдонимизиране и анонимизиране.
- [ ] Имам генерализирани комбинации от полета, които са изложени на риск от повторна идентификация.
- [ ] Също така включих резервни копия и регистрационни файлове в обхвата на изтриването.
- [ ] Проверих поведението при съхранение на данни на инструмента AI.