единица 10 / 12

Безопасна употреба: без течове и поверителност

Печалби:

  • Възможност за класифициране на данни, съдържащи тайни, лични данни и поверителни бизнес активи и разпознаване на червени линии
  • Маскиране, анонимизиране и защита със синтетични данни преди въвеждане на данни
  • Одобрен избор на инструмент, минимизиране на контекста и възможност за прилагане на рефлекс за завъртане на ключ в случай на изтичане

Всичко, което поставите в асистент за кодиране, е потенциално извън вашия контрол. API ключ, дъмп на клиентска база данни, патентован изходен код, който все още не е обявен, или досие на пациент — те могат да се превърнат в необратимо изтичане, след като попаднат в неодобрен инструмент. Най-големият риск от AI за софтуерните екипи не идва от грешка в реда, а от небрежно копиране и поставяне. Този модул има за цел да направи това копиране и поставяне безопасно.

Тук разграничаваме три неща: кои данни никога не трябва да се въвеждат, кои инструменти могат да се използват с какви предпазни мерки и как да защитите данните, преди да ги въведете (маскиране, синтетични данни, работа локално). Това не е незадължително „би било хубаво“; Това е договорно и законово задължение в повечето институции.

Защо е толкова критично?

Данни, които изпращате към AI инструмент; обработени на сървърите на доставчика, понякога съхранявани за определен период от време, могат да се използват за подобряване на модела в някои настройки на продукта. Да кажете „Изтрих чата“ често не е достатъчно; В момента, в който данните напуснат мрежата, възниква риск. Освен това цената на изтичане е висока: изтекъл облачен ключ може да бъде злоупотребен в рамките на минути, изтекли клиентски данни могат да доведат до уведомяване и санкции съгласно разпоредби като KVKK/GDPR, а изтеклия частен изходен код може да унищожи конкурентното предимство.

Така че основното правило е просто: Не въвеждайте нищо в неодобрено превозно средство, което не можете да си позволите да загубите. Ако се съмнявате, не влизайте.

Внимание: Манталитетът „само веднъж, бързо“ е най-честата причина за изтичане на информация. Поставянето на производствен дневник или конфигурационен файл така, както е, когато се разрешава спешна грешка, е точно това, което се случва с такива решения, взети под напрежение. Спешността не прекратява правилото за поверителност.

Какво никога не трябва да се въвежда (червена линия)

  • Тайни: API ключове, пароли, ключове за достъп до облак, частни сертификати, токени, низове за връзка.
  • Лични данни (PII): Име-фамилия, TR ID номер, имейл, телефон, адрес, здравни/финансови досиета, клиентски данни.
  • Поверителни бизнес активи: неразкрит изходен код, патентовани алгоритми, тайни на вътрешната архитектура, подробности за договора.
  • Регулирани данни: Специални защитени категории като здравеопазване, разплащателна карта (PCI), лични финанси.

Стъпка по стъпка: Безопасен поток на използване

  1. Класифицирайте данните. Каква категория имате – публична, вътрешна, поверителна, регулирана?
  2. Изберете превозно средство по клас. Поверителните/регулирани данни се обработват само в институционално одобрени инструменти, които осигуряват сигурност на данните (неизползване в образованието, лимит на задържане, регионална обработка).
  3. Обезопасете преди влизане. Премахнете тайните, маскирайте/анонимизирайте PII, използвайте синтетични (измислени, но реалистични) данни вместо реални, ако е възможно.
  4. Минимизиране на контекста. Намалете проблема си до най-малкия възпроизводим пример, който не включва чувствителни части.
  5. Също така проверете изхода. Проверете дали няма твърдо кодирана тайна или остатък от вашите данни в кода, генериран от AI.

Три мини калъфа

Случай 1 — Поставеният ключ беше отменен. Разработчик постави целия конфигурационен файл в AI, докато коригира грешка; Файлът съдържа активен API ключ на трета страна. Когато екипът забеляза, те незабавно отмениха (завъртяха) ключа и създадоха нов; Нямаше злоупотреба, но беше „евтин“ инцидент. Урок: отстранете глазурата преди залепване - и завъртете незабавно ключа, ако е протекъл.

Случай 2 — Синтетичните данни спасиха бизнеса. Екип имаше грешка при синтактичния анализ с действителни клиентски записи. Вместо да въвеждат реални данни, те произвеждат 20 реда синтетични данни със същата структура, но напълно фалшиви, възпроизвеждат грешката с тях и я разрешават с AI. Нито PII изтече, нито диагнозата се забави; синтетичните данни бяха едновременно безопасни и достатъчни.

Случай 3 — Скрита тайна в разпечатката. Когато генерира примерна конфигурация, AI вгради реалистично изглеждащ "пробен" ключ в нея и го постави в кода, без разработчикът да забележи; Базовото сканиране на кода (таен скенер) улови това и предупреди. Неизменната тайна никога не би трябвало да влезе в кода; Правилният начин беше да се използва променлива на средата или мениджър на тайни. Урок: сканирайте изхода и за тайни.

Четири копируеми шаблона

Контролен списък за маскиране преди влизане (самостоятелно):

Преди да дам този текст на AI, уверете се, че премахвам следното и замествам това, което намирате с [MASKED]: API ключ, парола, токен, низ за връзка, име-фамилия, имейл, телефон, идентификационен номер, клиентски данни. Текст:{{текст}}

Генериране на синтетични тестови данни:

Генерирайте НАПЪЛНО изфабрикувани (несвързани с реално лице/институция) {{N}}редови тестови данни в съответствие със схемата по-долу. Направете така, че да изглежда реалистично, но не използвайте реални PII. Схема: {{полета и типове}}Включва крайни случаи (празно, граница, лош формат).

Фиксиран таен лов (в код):

Потърсете твърдо кодирана тайна в този код/конфигурация: ключ, парола, токен, потребителски URL. Ако го намерите, посочете местоположението му и предложете правилния метод (променлива на средата / таен мениджър). Код:{{code}}

Оценка на съответствието на превозното средство (по клас данни):

Имам следния тип данни: {{клас: публичен / вътрешен / поверителен / регулиран}}. Инструментът, който възнамерявам да използвам е: {{tool}}. Какви предпазни мерки (съхранение, неизползване в образованието, регион, достъп) трябва да потвърдя, преди да обработя тези данни в този инструмент? Дайте контролен списък. Решението е мое; Вие изяснявате критериите.

Слаба подкана / Силна подкана

Слабо: (Поставяне на 200 реални потребителски реда, извлечени от производствената база данни) „Защо има грешка при синтактичния анализ на тези данни?“
Силно: "По-долу има 15 реда със същата структура като реалните данни, но напълно синтетични (без PII). parse_user() хвърля ValueError на 3, 8 и 12 от тези редове. Какъв може да е общият модел, как да го поправя?"

Силната версия не съдържа реални лични данни, като същевременно запазва структурата, необходима за възпроизвеждане на грешката. Диагнозата остава същата, рискът се нулира.

Клас данни

Може ли да се обработва в AI?

Предпоставка

публичен

да

Вътрешна употреба (непрецизност)

Общо взето

Спазвайте корпоративната политика

Поверително (изходен код, бизнес тайна)

Само одобрено превозно средство

Корпоративна гаранция + минимизиране

ЗИД / уч

По правило не

Маскирайте/анонимизирайте или използвайте синтетика

Съответствие с правилата и проследяване

Сигурното използване е нещо повече от личен навик, това е корпоративна система: кои инструменти са одобрени, кой клас данни къде може да отиде и какво да се прави в случай на пробив трябва да бъдат определени в писмена политика. Ако изтече тайна, най-важната първа стъпка е да не се паникьосвате, а незабавно да върнете (анулирате и генерирате нова) изтеклата идентификационна информация и да докладвате за инцидента. Ако не знаете списъка на вашата организация с одобрени инструменти и правила за класифициране на данни, първата ви задача е да ги научите.

Съвет: Дефинирайте специфичен за проекта списък с „игнориране“ (напр. .env, скрити папки, файлове за самоличност) във вашия редактор/CLI инструмент, така че тези файлове да не бъдат случайно включени в контекста на асистента. Превенцията винаги е по-евтина от почистването.

Често срещани грешки

  • Поставяне на чувствителни данни "само веднъж". Спешността не спира червената линия; Тук възниква най-честият теч.
  • Мислейки си „Ще изтрия разговора“. В момента, в който данните напуснат мрежата, възниква риск; Изтриването не го отменя.
  • Избор на превозно средство без гледане на класа му. Обработването на поверителни корпоративни данни с личен акаунт е сериозно нарушение.
  • Изходът не се сканира. AI може да вгради неизменна тайна в код; Също така проверете производството със секретния скенер.
  • Не го обръща, когато тайната изтече. Неотмяната на изтеклия ключ превръща изтичането в експлойт на живо.

В обобщение

Най-големият риск от AI в софтуера е изтичането на поверителност и повечето от тях произтичат от решение за копиране и поставяне, взето под принуда. Правилото е ясно: тайни, лични данни, поверителни бизнес активи и регулирани данни не се въвеждат в неодобрени инструменти. Класифицирайте данните преди въвеждане, изберете агент по клас, извлечете тайни, маскирайте PII или използвайте синтетични данни, минимизирайте контекста и също сканирайте изхода за тайни. Ако има изтичане на информация, първото нещо: върнете идентификационните данни и докладвайте за това.

Задача за приложение

Вземете част от код/дневник/данни, които наскоро сте дали (или обмисляте да дадете) на AI. Първо, идентифицирайте тайни и PII кандидати в рамките на шаблона „контролен списък за маскиране“. След това, ако съдържа реални данни, създайте версия, идентична на шаблона за „генериране на синтетични тестови данни“, но напълно измислена, и направете проблема си възпроизводим с него. И накрая, намерете и прочетете одобрения списък с инструменти на вашата институция и политиката за класифициране на данни; В противен случай обърнете внимание на този пропуск.

контролен списък

  • [ ] Класифицирам данните преди въвеждането им (отворени/вътрешни/поверителни/подлежат на регулиране).
  • [ ] Никога не въвеждам тайни, лична информация и поверителни бизнес активи в неодобрени инструменти.
  • [ ] Използвам маскиращи или синтетични данни, когато е възможно, вместо реални данни.
  • [ ] Намалявам контекста до най-малкия пример, който не включва чувствителни части.
  • [ ] Сканирам изхода на AI за трудно заровена тайна.
  • [ ] Знам, че ако тайната изтече, незабавно ще върна идентификационната информация и ще докладвам за инцидента.