Единица 10 / 12

Безбедно користење: Без протекување и доверливост

Добивки:

  • Способност за класификација на податоци кои содржат тајни, лични податоци и доверливи деловни средства и препознавање црвени линии
  • Маскирање, анонимизирање и обезбедување со синтетички податоци пред внесување податоци
  • Одобрен избор на алатка, минимизирање на контекстот и можност за примена на рефлекс на вртење на копчињата во случај на истекување

Сè што ќе залепите во асистент за кодирање е потенцијално надвор од ваша контрола. АПИ клуч, депонија од базата на податоци на клиенти, изворен код кој допрва треба да се објави или евиденција за пациент - тие можат да станат неповратно истекување откако ќе влезат во неодобрена алатка. Најголемиот ризик од вештачката интелигенција за софтверските тимови не доаѓа од грешка во линијата, туку од невнимателно copy-paste. Оваа единица има за цел да го направи тоа copy-paste безбедно.

Овде разликуваме три работи: кои податоци никогаш не треба да се внесуваат, кои алатки може да се користат со какви заштитни мерки и како да се обезбедат податоците пред да се внесат (маскирање, синтетички податоци, работа локално). Ова не е опционално „би било убаво“; Тоа е договорна и законска обврска во повеќето институции.

Зошто е толку критично?

Податоци што ги испраќате до алатка за вештачка интелигенција; обработени на серверите на добавувачот, понекогаш складирани за одреден временски период, може да се користат за подобрување на моделот во некои поставки на производот. Честопати не е доволно да се каже „го избришав разговорот“; Во моментот кога податоците ќе ја напуштат мрежата, се појавува ризик. Покрај тоа, цената на истекувањето е висока: протечениот клуч во облак може да се злоупотреби за неколку минути, протечените податоци за клиентите може да резултираат со известување и казни според прописите како што се KVKK/GDPR, а протечениот приватен изворен код може да ја уништи конкурентската предност.

Така правилото е едноставно: не внесувајте ништо во неодобрено возило што не можете да си дозволите да го изгубите. Ако се сомневате, не влегувајте.

Внимание: Менталитетот „само еднаш, брзо“ е најчеста причина за протекување. Вметнувањето дневник за производство или конфигурациска датотека како што е при решавање на итна грешка е токму она што се случува со таквите одлуки донесени под притисок. Итноста не го суспендира правилото за доверливост.

Што никогаш не треба да се внесува (црвена линија)

  • Тајни: API клучеви, лозинки, клучеви за пристап во облак, приватни сертификати, токени, низи за поврзување.
  • Лични податоци (ПИИ): Име-презиме, TR ID број, е-пошта, телефон, адреса, здравствена/финансиска евиденција, податоци за клиентите.
  • Доверливи деловни средства: Неоткриен изворен код, сопственички алгоритми, тајни за внатрешна архитектура, детали за договорот.
  • Регулирани податоци: Посебни заштитени категории како што се здравствена заштита, платежна картичка (PCI), лични финансии.

Чекор по чекор: Тек на безбедно користење

  1. Класифицирајте ги податоците. Која категорија е она што го имате - јавно, внатрешно, доверливо, регулирано?
  2. Изберете возило по класа. Доверливите/регулираните податоци се обработуваат само во институционално одобрени алатки кои обезбедуваат гаранција на податоците (некористење во образованието, ограничување на задржување, регионална обработка).
  3. Обезбедете пред да влезете. Отстранете ги тајните, маскирајте/анонимизирајте PII, користете синтетички (фабрикувани, но реални) податоци наместо вистински ако е можно.
  4. Минимизирајте го контекстот. Намалете го вашиот проблем на најмал примерок што може да се репродуцира што не вклучува чувствителни делови.
  5. Проверете го и излезот. Проверете дали нема тврдокодирана тајна или остаток од вашите податоци во кодот генериран од вештачката интелигенција.

Три мини футроли

Случај 1 - Залепениот клуч е откажан. Програмер ја залепи целата конфигурациска датотека во вештачката интелигенција додека поправа грешка; Датотеката содржеше клуч API од трета страна во живо. Кога тимот забележал, тие веднаш го откажале (ротирале) клучот и произвеле нов; Немаше злоупотреба, но тоа беше „евтин“ инцидент. Поука: отстранете ја глазурата пред да ја залепите - и веднаш свртете го клучот ако истече.

Случај 2 - Синтетичките податоци го спасија бизнисот. Еден тим доживеа грешка при парсирање со реалните записи на клиентите. Наместо да внесуваат вистински податоци, тие произведоа 20 линии синтетички податоци со иста структура, но целосно лажни, ја репродуцираа грешката со нив и ја решија со вештачка интелигенција. Ниту PII протече, ниту дијагнозата се забави; синтетичките податоци беа и безбедни и доволни.

Случај 3 - Скриена тајна во отпечатокот. При генерирање на конфигурација на примерок, вештачката интелигенција вгради клуч „примерок“ со реален изглед во неа и го внесе во кодот без да забележи развивачот; Скенирањето на базата на кодови (таен скенер) го фати ова и предупреди. Непроменливата тајна никогаш не требаше да влезе во кодот; Точниот начин беше да се користи променлива на околината или менаџер на тајни. Лекција: скенирајте го и излезот за тајни.

Четири шаблони за копирање

Список за проверка за маскирање пред да влезете (само):

Пред да го дадете овој текст на вештачката интелигенција, погрижете се да го отстранам следново и да го заменам она што ќе го најдете со [МАСКИРАНО]: API клуч, лозинка, токен, низа за поврзување, име-презиме, е-пошта, телефон, ID број, податоци за клиентот. Текст:{{текст}}

Генерирање на податоци од синтетички тест:

Генерирајте ЦЕЛОСНО фабрикувани (неповрзани со вистинско лице/институција) {{N}}податоци од тестот на редот во согласност со шемата подолу. Направете да изгледа реално, но не користете вистински PII. Шема: {{полиња и типови}}Вклучува рабови (празни, граници, лош формат).

Поправен таен лов (во код):

Побарајте хардкодирана тајна во овој код/конфигурација: клуч, лозинка, токен, прилагодена URL-адреса. Ако го најдете, наведете ја неговата локација и предложете го точниот метод (променлива на животната средина / таен менаџер). Код:{{шифра}}

Оцена на сообразност на возилото (по класа на податоци):

Го имам следниов тип на податоци: {{класа: јавна / внатрешна / доверлива / регулирана }}. Алатката што имам намера да ја користам е: {{алатка}}. Кои заштитни мерки (складирање, некористење во образованието, регион, пристап) треба да ги потврдам пред да ги обработам овие податоци во оваа алатка? Дајте листа за проверка. Одлуката е моја; Појасни ги критериумите.

Слаб промпт / Силен промпт

Слаб: (залепување 200 редови од реални корисници извадени од базата на податоци за производство) "Зошто има грешка при парсирање во овие податоци?"
Strong: "Подолу има 15 редови со иста структура како реалните податоци, но целосно синтетички (без PII). parse_user() фрла ValueError на 3, 8 и 12 од овие редови. Која би можела да биде вообичаената шема, како да ја поправам?"

Силната верзија не содржи вистински лични податоци додека ја зачувува структурата потребна за репродукција на бубачката. Дијагнозата останува иста, ризикот е ресетиран.

Класа на податоци

Дали може да се обработи во вештачка интелигенција?

Предуслов

јавен

Да

-

Внатрешна употреба (непрецизно)

Општо земено

Почитувајте ја корпоративната политика

Доверливо (изворен код, деловна тајна)

Само одобрено возило

Корпоративно осигурување + минимизирање

PII / регулирани

По правило бр

Маскирајте/анонимизирајте или користете синтетички

Усогласеност со политиките и следење

Безбедното користење е повеќе од само лична навика, тоа е корпоративен систем: кои алатки се одобрени, која класа на податоци може да оди и што да се прави во случај на прекршување треба да се дефинира во писмена политика. Ако се открие некоја тајна, најважниот прв чекор не е да се паничи, туку веднаш да се врати (откажи и генерира нова) протечената акредитација и да се пријави инцидентот. Ако не ја знаете листата на одобрени алатки на вашата организација и правилата за класификација на податоците, вашата прва задача е да ги научите.

Совет: Дефинирајте специфичен список за „игнорирања“ за проектот (на пр. .env, скриени папки, датотеки со идентитет) во вашата алатка Editor/CLI за да не се случајно вклучени овие датотеки во контекстот на помошникот. Превенцијата е секогаш поевтина од чистењето.

Вообичаени грешки

  • Вметнување чувствителни податоци „само еднаш“. Итноста не ја суспендира црвената линија; Овде се случува најчесто истекување.
  • Размислувајќи „Ќе го избришам разговорот“. Во моментот кога податоците ја напуштаат мрежата, се јавува ризик; Бришењето не го поништува.
  • Избор на возило без да се гледа во неговата класа. Обработката на доверливи корпоративни податоци со лична сметка е сериозно прекршување.
  • Не скенирање на излезот. ВИ може да вгради непроменлива тајна во код; Исто така, проверете го производството со тајниот скенер.
  • Не вртење кога ќе протече тајната. Неотповикувањето на протечениот клуч го претвора истекувањето во жив експлоат.

Сумирано

Најголемиот ризик од вештачката интелигенција во софтверот е истекувањето на приватноста, а најголемиот дел од тоа произлегува од одлуката за copy-paste донесена под принуда. Правилото е јасно: тајните, личните податоци, доверливите деловни средства и регулираните податоци не се внесуваат во неодобрени алатки. Класифицирајте ги податоците пред внесување, изберете агент по класа, извлечете тајни, маскирајте PII или користете синтетички податоци, минимизирајте го контекстот и скенирајте го излезот за тајни исто така. Ако има протекување, прво нешто: вратете го акредитивот и пријавете го.

Задача за апликација

Земете парче код/дневник/податоци што неодамна сте ги дале (или размислувате да ги дадете) на вештачката интелигенција. Прво, идентификувајте ги тајните и кандидатите за ПИИ во шаблонот „листа за проверка за маскирање“. Потоа, ако содржи вистински податоци, произведете верзија идентична на шаблонот „генерирање податоци за синтетички тестови“, но целосно измислена, и направете го вашиот проблем репродуктивен со него. Конечно, пронајдете и прочитајте го одобрениот список на алатки и политиката за класификација на податоците од вашата институција; Во спротивно, забележете го овој пропуст.

листа за проверка

  • [ ] Ги класифицирам податоците пред да ги внесам (отворен/внатрешен/доверлив/предмет на регулатива).
  • [ ] Никогаш не внесувам тајни, PII и доверливи деловни средства во неодобрени алатки.
  • [ ] Користам маскирање или синтетички податоци секогаш кога е можно наместо вистински податоци.
  • [ ] Контекстот го сведувам на најмал пример кој не вклучува чувствителни делови.
  • [ ] Го скенирам излезот на вештачката интелигенција за тешко закопана тајна.
  • [ ] Знам дека ако се открие тајната, веднаш ќе ги вратам информациите за идентификација и ќе го пријавам инцидентот.