Единица 10 / 11

Заштита на ресурси, приватност и дигитална безбедност

Добивки:

  • Препознајте директни и индиректни идентификатори, метаподатоци и дигитални траги што би можеле да го дадат изворот и прашајте „колку луѓе би одговарал овој опис?“ Способност за примена на анонимизација со тест
  • Стекнете ја дисциплината да избирате само алатки проверени со безбедност за чувствителна работа, примена на принципот на најмалку податоци и чистење на траги
  • Способност да се разбере дека KVKK и професионалната доверливост ја наложуваат оваа дисциплина и правно и морално и дека откако протечениот идентитет не може да се врати назад

Во новинарството, извор е лице кое зборува, честопати изложено на голем ризик: јавен вработен кој разоткрива корупција, работник кој опишува неправилности, некој што би можел да ја изгуби работата, својата слобода или дури и безбедноста доколку се открие неговиот идентитет. Заштитата на изворот - принципот на чување во тајност на идентитетот на информаторот - е една од најсветите обврски на професијата и е заштитена во повеќето правни системи. Ерата на вештачката интелигенција (ВИ) и ја поедноставува оваа задача и воведува нови ризици: алатката што ја користите за да разберете документ може да го скрие тој документ; Ако не успеете да анонимизирате, трагите што ги оставате на вештачката интелигенција може да го откријат изворот. Принципот на оваа единица е јасен: Ниту еден податок што може да го даде изворот не влегува во необезбедена алатка за вештачка интелигенција; Анонимизацијата и дигиталната хигиена се прават пред да се користи вештачката интелигенција, а не после. Откако ќе протече, идентитетот не може да се врати.

Кои се трагите што го даваат изворот?

Заштитата на ресурсите не е само „без име“. Следниве траги исто така може да го откријат идентитетот:

  • Директни идентификатори: име, телефон, е-пошта, TR ID, адреса, единица за вработување.
  • Индиректни дескриптори: описи како „единствената жена инженер која работи во круг од тројца“; Се однесува на едно лице во мала група.
  • Метаподатоци на документот: име на авторот, историја на уредување, датум на создавање, локација GPS, трака на печатачот вградена во датотека.
  • Контекстуални индиции: кој има пристап до документот; времето на истекување; конкретен настан во наративот.
  • Дигитална трага: од кој уред, од која мрежа, со која сметка е контактиран.

Критичен ризик за вештачката интелигенција: залепувањето на која било од овие траги во алатка ги отстранува податоците надвор од вашата контрола. Повеќето бесплатни/јавни алатки за вештачка интелигенција складираат влезови или можат да ги користат во доработка на моделот.

Чекор по чекор: Користење вештачка интелигенција додека заштедувате ресурси

Чекор 1 - Класифицирајте го возилото. За чувствителна работа се користат само алатки со потврдена безбедност и услови за обработка на податоци (по можност корпоративно, не складирање податоци или офлајн). Чувствителните податоци не се внесуваат во јавни/бесплатни алатки.

Чекор 2 - Исчистете ги метаподатоците. Избришете ги метаподатоците пред да го извезете документот во алатката; Ако е можно, претворете го документот во обичен текст или рачно сумирајте ја содржината и анонимизирајте ја наместо слика од екранот.

Чекор 3 - Анонимизирајте. Генерализирајте ги сите директни и индиректни идентификатори: „Извор А“, „јавен службеник“, заматете ги датумите и локациите. Променете ги рецептите што се однесуваат на самци во мали групи.

Чекор 4 - Политика за минимални податоци. Дајте ѝ на вештачката интелигенција само она што го бара работата. Наместо да го сумирате целиот документ, дајте го релевантниот дел што не го идентификува.

Чекор 5 - Потврдете и зачувајте. Тестирајте ја адекватноста на анонимизацијата со чекор за проверка (шаблон подолу). Одржувајте комуникација со изворот на посебни, безбедни канали.

Чекор 6 - Исчистете ги патеките. Откако ќе заврши работата, исчистете ја историјата/сесијата во алатката; Безбедно складирајте или бришете чувствителни датотеки.

Внимание: да се каже „Јас анонимизирав“ не е доволно; Во мала група, дури и еден индиректен опис го открива идентитетот. Можете да користите анонимизација за да прашате „на колку луѓе би одговарал овој рецепт? Тестирајте го со прашањето. Ако одговорот е „еден“, ресурсот не е заштитен.

KVKK и професионална доверливост

Во Турција, KVKK (Закон за заштита на лични податоци) ги регулира личните податоци; Информациите како што се здравствените и политичките мислења се посебни податоци и бараат повисока заштита. Давањето на податоците од изворот на произволна алатка може да резултира и со етичка и правна одговорност. Професионалната доверливост е должност на честа независна од законот.

три мини футроли

Случај 1 - Спречено истекување на метаподатоци. Еден репортер требаше да резимира извештај што беше објавен; Во последен момент, тој сфатил дека името на организаторот е вградено во метаподатоците на датотеката. Го користел откако го конвертирал документот во обичен текст и го отстранил името. Ако необработената датотека беше поставена, метаподатоците директно ќе го дадат изворот.

Случај 2 - опасност од индиректен идентификатор. Еден репортер употребил фраза кога се консултирал со YZ, опишувајќи извор како „единствениот вработен со посебни потреби во централата“. Без разлика дали вештачката интелигенција го складирала текстот некаде или не, овој опис укажа на една личност. Уредникот забележал, го сменил описот во „вработен во агенцијата“. Во малата група, индиректниот опис беше исто толку опасен како и името.

Случај 3 - Избор на безбедно возило. При анализа на многу чувствителна серија документи, истражниот тим избра да користи решение без податоци/офлајн наместо генеричка алатка за вештачка интелигенција; дополнително ги анонимизирал документите. Анализата беше малку побавна, но во ниту еден момент безбедноста на ресурсот не беше загрозена.

Шаблони за копирање

1) Тест за познавање на анонимизација:

Обележете го секој елемент во текстот подолу што може да го открие идентитетот на изворот: директни идентификатори (име, наслов, единица) и индиректни идентификатори (описи што укажуваат на едно лице во малата група, конкретни настани, датум/локација). За секој знак, „колку луѓе би одговарал овој опис?“ Поставете го прашањето и предложете побезбедни генерализации. Променете го текстот. Текст: [тука]

2) Проверка пред споделување документи:

Направете безбедносна проверка што треба да ја направам пред да внесам документ во алатка за вештачка интелигенција: чистење на метаподатоци, директно/индиректно скенирање на идентификатор, минимална политика за податоци, класа за безбедност на алатката, чистење историја. Додадете по една реченица „како да“ за секоја ставка.

3) Изворна проценка на ризикот за комуникација:

Ќе контактирам со чувствителен извор. Направете листа за проверка на мерки за дигитална безбедност кои ќе ги заштитат вашиот идентитет и комуникации (избор на канал, не оставајте трага, метаподатоци, хигиена на уредот). Давајте конкретни и ефективни предлози; не ветувајте апсолутна безбедност.

4) Контрола на заштита на изворот пред објавување:

Вклучете ги во следните спремни за објавување вести сите детали што би можеле да го идентификуваат изворот: индиректни описи, време на атрибуција, број на луѓе кои имале пристап до документот, детали за конкретни настани. Означете го секое ризично место и предложете како да го заматите. Вести: [тука]

Слаб промпт / Силен промпт

Слаб промпт: „Сумирај го овој документ“. (со поставување на чувствителен, изворен документ на метаподатоци каков што е)

Резултат: Метаподатоците и индиректните идентификатори се надвор од ваша контрола; Изворот може да биде компромитиран без да знаете за тоа.

Силен поттик: Прво претворете го документот во обичен текст и избришете ги метаподатоците, генерализирајте ги директните/индиректните идентификатори, дајте го само релевантниот дел: „Сумирајте го следниов анонимизиран текст; исто така означете ги сите преостанати идентитетски индиции во него“.

Разлика: Силниот пристап ги чисти податоците без да му ги дава на возилото, споделува минимални податоци и користи вештачка интелигенција како дополнителен слој на контрола; ресурсот е заштитен.

споредбена табела

тип на патека

пример

Ризик

претпазливост

Директен идентификатор

Име, телефон, единица

високо

Бришење/генерализирање

индиректен идентификатор

„Единствената жена инженер“

Високо (скриено)

„Колку луѓе одговара? тест

метаподатоци

Автор/датум/ГПС на датотека

високо

Претворете во обичен текст, јасен

Контекстуален поим

Време на истекување

средно

Заматете го времето/местото

дигитална трага

Уред, мрежа, сметка

Средно-Висок

Безбеден канал, хигиена

Вообичаени грешки

  • Заборавајќи ги метаподатоците. Поставување на датотеката како што е и протекување на вградени информации за автор/датум/локација.
  • Само избришете го името. Игнорирањето дека индиректните идентификатори го откриваат и идентитетот.
  • Извезување чувствителни податоци во јавната алатка. Внесување изворни податоци во алатки кои складираат податоци/ги користат при обука на модели.
  • Споделување премногу податоци. Зголемување на површината на ризик со обезбедување повеќе документи/детали отколку што бара работата.
  • Не чистење на патеките. Оставање историја на сесии и чувствителни датотеки кога работата е завршена.

Безбеден избор на возило: што да барате?

Одлуката дали алатката за вештачка интелигенција е „безбедна“ за чувствителна работа е техничка писменост што новинарот мора да ја стекне. Главните прашања што треба да се разгледаат се: Дали алатката ги складира податоците што ги внесувате, колку долго и каде? Дали вашите податоци се користат за обука за модели (да во повеќето бесплатни алатки за потрошувачи, често не во верзии на претпријатијата)? Во која земја се обработуваат податоците и според кој закон? Дали алатката може да работи офлајн (на вашиот сопствен уред, без да испраќа податоци на интернет)? Дали вашата организација има договор за обработка на податоци со оваа алатка? Внесувањето чувствителни податоци за ресурсите во алатка без да се знаат одговорите на овие прашања го ставаат ресурсот во ризик со слепа доверба.

Општата хиерархија е корисна: за најчувствителните документи, се претпочитаат решенија што работат офлајн или на вашата сопствена инфраструктура; договорени алатки за претпријатие кои не складираат податоци со средна прецизност; Генеричките алатки за потрошувачи може да се користат само за неидентификувани, јавно достапни или анонимизирани содржини. Правењето на оваа класификација на почетокот ја спречува грешката „набрзина да внесете погрешни податоци во погрешна алатка“. Дополнително, во корпоративна редакција, оваа одлука не треба да се остави на поединечни известувачи, туку треба да се стандардизира со писмена листа за одобрување на алатки; бидејќи една грешка на една личност може да го уништи изворот на целата истрага. Безбедноста на возилата е техничкиот столб на заштитата на ресурсите и треба да се сфати сериозно како и анонимизацијата.

Сумирано

Заштитата на ресурсите носи нови ризици во ерата на вештачката интелигенција: алатките можат да сокријат податоци, метаподатоците и индиректните идентификатори можат да го оддадат идентитетот. Безбеден начин; избирање на алатката според нејзината безбедносна класа, чистење на метаподатоци, анонимизирање на сите директни и индиректни идентификатори (тестот „колку луѓе одговараат на овој опис?“), примена на принципот на најмалку податоци и чистење на трагите. КВКК и професионалната доверливост ја бараат оваа дисциплина и законски и морално. Откако ќе протече, идентитетот не може да се врати.

Задача за апликација

Земете вистински или измислен изворен документ/белешка. Најпрво следете го известувањето „Тест за познавање на анонимизација“; Обележете го секој директен и индиректен дескриптор што се појавува и прашајте "колку луѓе би одговарал?" Оценете со прашањето. Потоа безбедно анонимизирајте го документот и рачно применете го списокот „Проверка за претходно споделување документи“ еднаш.

листа за проверка

  • [ ] Користам само алатки проверени со безбедност за чувствителна работа.
  • [ ] Ги бришам метаподатоците пред да го извезам документот.
  • [ ] Ги користи сите директни и индиректни дескриптори како "колку луѓе одговара?" Го анонимизирам со тестот.
  • [ ] Го следи принципот на најмалку податоци; Го споделувам само потребниот дел.
  • [ ] Ја чистам историјата на сесиите и чувствителните датотеки по работа; Ја почитувам КВКК и професионалната доверливост.