Прибуток:
- Розпізнайте прямі та непрямі ідентифікатори, метадані та цифрові сліди, які можуть виявити джерело, і запитайте, скільки людей підійде цьому опису? Можливість застосування анонімізації з тестом
- Навчіться вибирати лише інструменти, перевірені безпекою, для конфіденційної роботи, застосовуючи принцип найменшої кількості даних і видаляючи сліди
- Здатність розуміти, що KVKK і професійна конфіденційність вимагають цієї дисципліни як з юридичної, так і з моральної точки зору, і що після витоку особистих даних неможливо повернути
У журналістиці джерело – це особа, яка говорить, часто ризикуючи: державний службовець, який викриває корупцію, працівник, який описує неправомірні дії, хтось, хто може втратити роботу, свободу чи навіть безпеку, якщо його особу розкриють. Захист джерела — принцип збереження конфіденційності особи інформатора — є одним із найсвятіших обов’язків професіонала та захищений у більшості правових систем. Епоха штучного інтелекту (ШІ) одночасно спрощує це завдання та створює нові ризики: інструмент, який ви використовуєте для розуміння документа, може приховати цей документ; Якщо ви не зробите анонімним, сліди, які ви залишите в ШІ, можуть виявити джерело. Принцип цього блоку зрозумілий: жодні дані, які могли б виявити джерело, не надходять у незахищений інструмент ШІ; Анонімізація та цифрова гігієна виконуються до використання ШІ, а не після. Після витоку особу неможливо відновити.
Які сліди видають джерело?
Захист ресурсів – це не просто «no name». Наступні сліди також можуть виявити особу:
- Прямі ідентифікатори: ПІБ, телефон, e-mail, TR ID, адреса, одиниця роботи.
- Непрямі дескриптори: такі описи, як «єдина жінка-інженер, яка працює в колі трьох»; Це відноситься до однієї людини в невеликій групі.
- Метадані документа: ім’я автора, історія редагування, дата створення, місцезнаходження GPS, трек принтера, вбудований у файл.
- Контекстуальні підказки: хто має доступ до документа; час витоку; конкретна подія в оповіданні.
- Цифрова траса: з якого пристрою, з якої мережі, з яким обліковим записом здійснювався контакт.
Критичний ризик для штучного інтелекту: вставлення будь-якої з цих трас в інструмент позбавляє даних вашого контролю. Більшість безкоштовних/загальнодоступних інструментів ШІ зберігають вхідні дані або можуть використовувати їх для вдосконалення моделі.
Крок за кроком: використання ШІ з економією ресурсів
Крок 1 — Класифікуйте транспортний засіб. Для конфіденційної роботи використовуються лише інструменти з перевіреними умовами безпеки та обробки даних (бажано корпоративні, без зберігання даних або офлайн). Конфіденційні дані не вводяться в публічні/безкоштовні інструменти.
Крок 2 — Очистіть метадані. Видалити метадані перед експортом документа в інструмент; Якщо можливо, перетворіть документ на звичайний текст або вручну узагальніть вміст і зробіть його анонімним замість знімка екрана.
Крок 3 — Анонімізація. Узагальніть усі прямі та непрямі ідентифікатори: «Джерело А», «державний службовець», розмийте дати та місця. Змініть рецепти, які стосуються одиноких людей у невеликих групах.
Крок 4 — Мінімальна політика даних. Дайте штучному інтелекту лише те, що вимагає робота. Замість того, щоб підсумовувати весь документ, укажіть відповідний розділ, що не ідентифікує особу.
Крок 5 — Перевірте та збережіть. Перевірте адекватність анонімізації за допомогою кроку перевірки (шаблон нижче). Підтримуйте зв’язок із джерелом по окремих захищених каналах.
Крок 6 — Очистіть доріжки. Після завершення роботи очистіть історію/сесію в інструменті; Безпечно зберігайте та видаляйте конфіденційні файли.
Увага: сказати «я анонімізував» недостатньо; У невеликій групі навіть один непрямий опис розкриває ідентичність. Ви можете використовувати анонімізацію, щоб запитати «скількох людей підійде цей рецепт?» Перевір це за допомогою запитання. Якщо відповідь «один», то ресурс не захищений.
КВКК та професійна таємниця
У Туреччині KVKK (Закон про захист персональних даних) регулює персональні дані; Така інформація, як здоров’я та політичні погляди, є спеціальними даними та потребує більш високого захисту. Передача даних джерела довільному інструменту може призвести до етичної та юридичної відповідальності. Професійна конфіденційність є обов’язком честі, який не залежить від закону.
три міні-чохла
Випадок 1 — попереджено витік метаданих. Репортер збирався підсумувати витік звіту; В останній момент він зрозумів, що ім’я організатора було вбудовано в метадані файлу. Він використав його після перетворення документа на звичайний текст і видалення імені. Якби необроблений файл було завантажено, метадані безпосередньо передавали б джерело.
Випадок 2 — Небезпека непрямого ідентифікатора. Журналіст використав фразу під час консультації з YZ, описуючи джерело як «єдиного працівника-інваліда в штаб-квартирі». Незалежно від того, зберіг ШІ текст десь чи ні, цей опис вказував на одну людину. Редакція помітила, змінила характеристику на «співробітник агентства». У маленькій групі непрямий опис був таким же небезпечним, як і назва.
Випадок 3 — Вибір безпечного транспортного засобу. Під час аналізу дуже конфіденційної групи документів дослідницька група вирішила використовувати рішення без даних/офлайн, а не загальний інструмент ШІ; додатково анонімізував документи. Аналіз відбувався трохи повільніше, але безпека ресурсу не була порушена.
Шаблони, які можна копіювати
1) Перевірка кваліфікації анонімізації:
Позначте кожен елемент у тексті нижче, який може виявити особу джерела: прямі ідентифікатори (ім’я, назва, підрозділ) і непрямі ідентифікатори (описи, які вказують на одну особу в малій групі, конкретні події, дату/місце). Для кожного знака «Скільком людям підійде цей опис?» Поставте запитання та запропонуйте безпечніші узагальнення. Змінити текст. Текст: [тут]
2) Перевірка перед спільним використанням документів:
Створіть контрольний список безпеки, який я маю виконати перед подачею документа в інструмент штучного інтелекту: очищення метаданих, пряме/непряме сканування ідентифікатора, мінімальна політика даних, клас безпеки інструменту, очищення історії. Додайте одне речення «як» для кожного пункту.
3) Оцінка ризику зв’язку джерела:
Я зв'яжуся з делікатним джерелом. Створіть контрольний список заходів цифрової безпеки, які захистять вашу особистість і комунікації (вибір каналу, не залишати слідів, метадані, гігієна пристрою). Дайте конкретні та дієві пропозиції; не обіцяють абсолютної безпеки.
4) Контроль захисту джерела перед публікацією:
Включіть у наступні готові до публікації новини будь-які деталі, які можуть ідентифікувати джерело: непрямі описи, час авторства, кількість людей, які мали доступ до документа, деталі конкретної події. Виділіть кожне ризиковане місце та запропонуйте, як його розмити. Новини: [тут]
Слабка підказка / Сильна підказка
Слабка підказка: «Узагальніть цей документ». (шляхом завантаження конфіденційного документа джерела метаданих як є)
Результат: метадані та непрямі ідентифікатори поза вашим контролем; Джерело може бути скомпрометовано без вашого відома про це.
Сувора підказка: спочатку перетворіть документ на звичайний текст і видаліть метадані, узагальніть прямі/непрямі ідентифікатори, надайте лише відповідну частину: «Підведіть підсумок наступного анонімного тексту; також позначте в ньому будь-які підказки щодо ідентифікації, що залишилися».
Відмінність: потужний підхід очищає дані, не передаючи їх транспортному засобу, ділиться мінімальною кількістю даних і використовує ШІ як додатковий рівень контролю; ресурс охороняється.
порівняльна таблиця
тип доріжки
приклад
Ризик
запобіжний захід
Прямий ідентифікатор
ПІБ, телефон, од
висока
Видалити/узагальнити
непрямий ідентифікатор
«Єдина жінка-інженер»
Високий (прихований)
«Скільки людей це вміщає?» тест
метадані
Автор файлу/дата/GPS
висока
Перетворити на звичайний текст, чітко
Контекстуальна підказка
Час витоку
середній
Розмиття час/місце
цифровий слід
Пристрій, мережа, обліковий запис
Середньо-високий
Безпечний канал, гігієна
Поширені помилки
- Забуття метаданих. Завантаження файлу як є та витік вбудованої інформації про автора/дату/місцезнаходження.
- Просто видаліть назву. Ігнорування того, що непрямі ідентифікатори також розкривають ідентичність.
- Експорт конфіденційних даних у публічний інструмент. Введення вихідних даних в інструменти, які зберігають дані/використовують їх у навчанні моделі.
- Обмін занадто великою кількістю даних. Збільшення рівня ризику шляхом надання більшої кількості документів/подробиць, ніж вимагає робота.
- Не прибирання доріжок. Залишення історії сеансу та конфіденційних файлів після завершення роботи.
Безпечний вибір автомобіля: на що звернути увагу?
Рішення про те, чи є інструмент штучного інтелекту «безпечним» для делікатної роботи, є технічною грамотністю, яку журналіст повинен отримати. Основні питання, на які слід звернути увагу: чи зберігає інструмент дані, які ви вводите, як довго та де? Чи використовуються ваші вхідні дані під час навчання моделі (так у більшості безкоштовних споживчих інструментів, часто ні в корпоративних версіях)? У якій країні обробляються дані та згідно з яким законом? Чи може інструмент працювати в автономному режимі (на вашому власному пристрої, без надсилання даних в Інтернет)? Чи має ваша організація угоду про обробку даних із цим інструментом? Введення конфіденційних даних ресурсу в інструмент, не знаючи відповідей на ці запитання, піддає ресурс ризику через сліпу довіру.
Загальна ієрархія є корисною: для найбільш конфіденційних документів перевагу надають рішенням, які працюють офлайн або на вашій власній інфраструктурі; контрактні корпоративні інструменти, які не зберігають дані середньої точності; Загальні споживчі інструменти можна використовувати лише для неідентифікованого, загальнодоступного або анонімного вмісту. Виконання цієї класифікації на початку запобігає помилці «поспішного введення неправильних даних у неправильний інструмент». Крім того, у корпоративній редакції це рішення не слід залишати за окремими репортерами, а має стандартизуватися за допомогою письмового списку затвердження інструментів; адже одна помилка однієї людини може знищити джерело цілого розслідування. Безпека транспортних засобів є технічною основою захисту ресурсів, і до неї слід ставитися так само серйозно, як до анонімізації.
Підсумовуючи
Захист ресурсів створює нові ризики в епоху штучного інтелекту: інструменти можуть приховувати дані, метадані та непрямі ідентифікатори можуть розкривати особу. Безпечний шлях; вибір інструменту відповідно до класу безпеки, очищення метаданих, анонімізація всіх прямих і непрямих ідентифікаторів (тест «скільки людей відповідає цьому опису?»), застосування принципу найменших даних і очищення слідів. КВКК і професійна конфіденційність вимагають цієї дисципліни як юридично, так і морально. Після витоку особу неможливо відновити.
Аплікаційне завдання
Візьміть справжній або вигаданий вихідний документ/нотатку. Спочатку виконайте підказку «Тест на анонімізацію»; Позначте кожен прямий і непрямий дескриптор, який з’являється, і запитайте: «скільки людей це підійде?» Оцініть за допомогою запитання. Потім безпечно анонімізуйте документ і один раз вручну застосуйте список «Перевірка попереднього спільного доступу до документів».
контрольний список
- [ ] Я використовую лише перевірені інструменти для конфіденційної роботи.
- [ ] Я очищаю метадані перед експортом документа.
- [ ] Використовує всі прямі та непрямі дескриптори як "скільки людей це вміщує?" Я анонімізую це за допомогою тесту.
- [ ] Дотримується принципу найменшої кількості даних; Ділюся лише необхідною частиною.
- [ ] Я очищаю історію сеансів і конфіденційні файли після роботи; Дотримуюсь КВКК та професійної таємниці.