единица 10 / 11

Защита на ресурсите, поверителност и цифрова сигурност

Печалби:

  • Разпознайте директни и непреки идентификатори, метаданни и цифрови следи, които биха могли да разкрият източника, и попитайте „колко души би паснало това описание?“ Възможност за прилагане на анонимизация с тест
  • Придобийте дисциплината да избирате само проверени за сигурност инструменти за чувствителна работа, като прилагате принципа на най-малко данни и почиствате следи
  • Способност да се разбере, че KVKK и професионалната поверителност налагат тази дисциплина както законово, така и морално и че веднъж изтекла самоличност не може да бъде върната

В журналистиката източник е човек, който говори, често изложен на голям риск: държавен служител, който разкрива корупцията, работник, който описва неправомерни действия, някой, който може да загуби работата си, свободата си или дори безопасността си, ако самоличността му бъде разкрита. Защитата на източника — принципът за запазване на самоличността на информатора в тайна — е едно от най-свещените задължения на професията и е защитено в повечето правни системи. Епохата на изкуствения интелект (AI) едновременно опростява тази задача и въвежда нови рискове: инструментът, който използвате, за да разберете документ, може да скрие този документ; Ако не успеете да анонимизирате, следите, които оставяте в AI може да разкрият източника. Принципът на това устройство е ясен: никакви данни, които биха могли да разкрият източника, не влизат в незащитен AI инструмент; Анонимизирането и цифровата хигиена се извършват преди използването на AI, а не след това. Веднъж изтекла, самоличността не може да бъде възстановена.

Какви са следите, които издават източника?

Защитата на ресурсите не е просто „без име“. Следните следи също могат да разкрият самоличността:

  • Директни идентификатори: име, телефон, имейл, TR ID, адрес, работна единица.
  • Непреки дескриптори: описания като „единствената жена инженер, работеща в кръг от трима“; Отнася се за един човек в малка група.
  • Метаданни на документа: име на автор, хронология на редакциите, дата на създаване, GPS местоположение, следа на принтера, вградена във файл.
  • Контекстуални улики: кой има достъп до документа; време на изтичане; конкретно събитие в повествованието.
  • Цифрово проследяване: от кое устройство, от коя мрежа, с кой акаунт е осъществен контакт.

Критичен риск за AI: поставянето на някоя от тези следи в инструмент отнема данните извън вашия контрол. Повечето безплатни/публични AI инструменти съхраняват входни данни или могат да ги използват при усъвършенстване на модела.

Стъпка по стъпка: Използване на AI при спестяване на ресурси

Стъпка 1 — Класифициране на автомобила. Само инструменти с проверени условия за сигурност и обработка на данни (за предпочитане корпоративни, без съхранение на данни или офлайн) се използват за чувствителна работа. Чувствителните данни не се въвеждат в публични/безплатни инструменти.

Стъпка 2 — Почистете метаданните. Изтрийте метаданните, преди да експортирате документа в инструмента; Ако е възможно, конвертирайте документа в обикновен текст или ръчно обобщете съдържанието и го анонимизирайте вместо екранна снимка.

Стъпка 3 — Анонимизиране. Генерализирайте всички преки и непреки идентификатори: „Източник A“, „държавен служител“, замъглете датите и местоположенията. Променете рецепти, които се отнасят за отделни хора в малки групи.

Стъпка 4 — Политика за минимални данни. Дайте на AI само това, което изисква работата. Вместо да обобщавате целия документ, дайте съответния неидентифициращ раздел.

Стъпка 5 — Проверете и запазете. Тествайте адекватността на анонимизирането със стъпка за проверка (шаблон по-долу). Поддържайте комуникация с източника по отделни, защитени канали.

Стъпка 6 — Почистете следите. След като работата е свършена, изчистете хронологията/сесията в инструмента; Сигурно съхранявайте или изтривайте чувствителни файлове.

Внимание: Не е достатъчно да кажете „анонимизирах“; В малка група дори едно непряко описание разкрива идентичността. Можете да използвате анонимизация, за да попитате „На колко души ще се побере тази рецепта?“ Тествайте го с въпроса. Ако отговорът е "един", ресурсът не е защитен.

КВКК и професионална поверителност

В Турция KVKK (Закон за защита на личните данни) регулира личните данни; Информация като здравословни и политически мнения са специални данни и изискват по-висока защита. Предоставянето на данни от източника на произволен инструмент може да доведе както до етична, така и до правна отговорност. Професионалната поверителност е задължение на честта, независимо от закона.

три мини калъфа

Случай 1 — Предотвратено изтичане на метаданни. Репортер се канеше да обобщи изтекъл доклад; В последния момент той осъзна, че името на организатора е вградено в метаданните на файла. Той го използва, след като преобразува документа в обикновен текст и премахва името. Ако необработеният файл беше качен, метаданните директно ще разкрият източника.

Случай 2 — Опасност от непряк идентификатор. Репортер използва фраза, когато се консултира с YZ, описвайки източника като „единствения служител с увреждания в централата“. Независимо дали AI е съхранил текста някъде, това описание сочи към един човек. Редакторът забеляза, промени описанието на „служител на агенцията“. В малката група непрякото описание беше толкова опасно, колкото и името.

Случай 3 — Избор на безопасно превозно средство. Когато анализира изключително чувствителна партида от документи, разследващ екип избра да използва решение без данни/офлайн, а не генеричен AI инструмент; допълнително анонимизира документите. Анализът беше малко по-бавен, но в нито един момент сигурността на ресурса не беше компрометирана.

Копируеми шаблони

1) Тест за умения за анонимизиране:

Маркирайте всеки елемент в текста по-долу, който може да разкрие самоличността на източника: директни идентификатори (име, заглавие, единица) и косвени идентификатори (описания, които сочат към един човек в малката група, конкретни събития, дата/местоположение). За всеки знак, „на колко души би паснало това описание?“ Задайте въпроса и предложете по-безопасни обобщения. Промяна на текста. Текст: [тук]

2) Проверка преди споделяне на документи:

Направете списък за проверка на сигурността, който трябва да направя, преди да подам документ към инструмент с изкуствен интелект: почистване на метаданни, директно/непряко сканиране на идентификатор, политика за минимални данни, клас на сигурност на инструмента, почистване на хронологията. Добавете едно изречение „как да“ за всеки елемент.

3) Оценка на риска при комуникация на източника:

Ще се свържа с чувствителен източник. Създайте контролен списък с мерки за цифрова сигурност, които ще защитят вашата самоличност и комуникации (избор на канал, не оставяйте следа, метаданни, хигиена на устройството). Дайте конкретни и приложими предложения; не обещават абсолютна сигурност.

4) Контрол на защитата на източника преди публикуване:

Включете в следните готови за публикуване новини всякакви подробности, които биха могли да идентифицират източника: косвени описания, време на приписване, брой хора, които са имали достъп до документа, конкретни подробности за събитието. Маркирайте всяко рисково място и предложете как да го замъглите. Новини: [тук]

Слаба подкана / Силна подкана

Слаба подкана: „Резюмирайте този документ.“ (чрез качване на чувствителен документ с източник на метаданни такъв, какъвто е)

Резултат: Метаданните и непреките идентификатори са извън вашия контрол; Източникът може да бъде компрометиран, без да знаете за това.

Силна подкана: Първо конвертирайте документа в обикновен текст и изтрийте метаданните, обобщете преките/непреките идентификатори, дайте само съответната част: „Обобщете следния анонимен текст; също така маркирайте всички останали улики за самоличност в него.“

Разлика: Силният подход почиства данните, без да ги предава на превозното средство, споделя минимални данни и използва AI като допълнителен слой на контрол; ресурсът е защитен.

сравнителна диаграма

тип писта

пример

Риск

предпазна мярка

Директен идентификатор

Име, телефон, единица

високо

Изтриване/генерализиране

индиректен идентификатор

„Единствената жена инженер“

Висок (скрит)

"Колко души се побира?" тест

метаданни

Автор на файла/дата/GPS

високо

Конвертиране в обикновен текст, ясно

Контекстуална следа

Време на изтичане

среден

Замъгляване на време/място

цифрова следа

Устройство, мрежа, акаунт

Средно-високо

Сигурен канал, хигиена

Често срещани грешки

  • Забравяне на метаданни. Качване на файла такъв, какъвто е и изтичане на вградена информация за автор/дата/местоположение.
  • Просто изтрийте името. Игнорирането на това, че косвените идентификатори също разкриват идентичност.
  • Експортиране на чувствителни данни към публичния инструмент. Въвеждане на изходни данни в инструменти, които съхраняват данни/използват ги при обучение на модели.
  • Споделяне на твърде много данни. Увеличаване на рисковата повърхност чрез предоставяне на повече документи/подробности, отколкото изисква работата.
  • Без почистване на пистите. Оставяне на хронология на сесиите и чувствителни файлове, когато работата е свършена.

Безопасен избор на превозно средство: какво да търсите?

Решаването дали даден инструмент за изкуствен интелект е „безопасен“ за чувствителна работа е техническа грамотност, която журналистът трябва да придобие. Основните въпроси, които трябва да разгледате, са: Инструментът съхранява ли данните, които въвеждате, за колко време и къде? Вашите данни използвани ли са в обучението на модели (да в повечето безплатни потребителски инструменти, често не в корпоративните версии)? В коя държава се обработват данните и съгласно какъв закон? Може ли инструментът да работи офлайн (на вашето собствено устройство, без да изпраща данни към интернет)? Вашата организация има ли споразумение за обработка на данни с този инструмент? Въвеждането на чувствителни данни за ресурси в инструмент, без да знаете отговорите на тези въпроси, излага ресурса на риск със сляпо доверие.

Общата йерархия е полезна: за най-чувствителните документи се предпочитат решения, които работят офлайн или във вашата собствена инфраструктура; договорени корпоративни инструменти, които не съхраняват данни за средна точност; Генеричните потребителски инструменти могат да се използват само за неидентифицирано, публично достъпно или анонимизирано съдържание. Извършването на тази класификация в началото предотвратява грешката „въвеждане на грешни данни в грешен инструмент набързо“. Освен това, в корпоративен нюзрум това решение не трябва да се оставя на отделни репортери, а трябва да се стандартизира с писмен списък за одобрение на инструменти; защото една грешка на един човек може да унищожи източника на цялото разследване. Сигурността на превозните средства е техническият стълб на защитата на ресурсите и трябва да се приема толкова сериозно, колкото и анонимността.

В обобщение

Защитата на ресурсите създава нови рискове в ерата на ИИ: инструментите могат да скрият данни, метаданните и непреките идентификатори могат да разкрият самоличността. Безопасен начин; избор на инструмента според неговия клас на сигурност, почистване на метаданни, анонимизиране на всички преки и косвени идентификатори (тестът „колко души отговарят на това описание?“), прилагане на принципа на най-малко данни и почистване на следи. KVKK и професионалната поверителност изискват тази дисциплина както законово, така и морално. Веднъж изтекла, самоличността не може да бъде възстановена.

Задача за приложение

Вземете истински или измислен изходен документ/бележка. Първо следвайте подканата „Тест за компетентност на анонимизирането“; Маркирайте всеки директен и непряк дескриптор, който се появява, и попитайте "колко души ще се поберат?" Оценете с въпроса. След това сигурно анонимизирайте документа и ръчно приложете веднъж списъка „Проверка за предварително споделяне на документи“.

контролен списък

  • [ ] Използвам само проверени за сигурност инструменти за чувствителна работа.
  • [ ] Изчиствам метаданните, преди да експортирам документа.
  • [ ] Използва всички преки и непреки дескриптори като "колко души се побира?" Аз го анонимизирам с теста.
  • [ ] Следва принципа за най-малко данни; Споделям само необходимата част.
  • [ ] Изчиствам историята на сесиите и чувствителните файлове след работа; Спазвам КВКК и професионална конфиденциалност.