Dobički:
- Sposobnost razvrščanja podatkov, ki vsebujejo skrivnosti, osebnih podatkov in zaupnih poslovnih sredstev ter prepoznavanja rdečih črt
- Maskiranje, anonimizacija in zavarovanje s sintetičnimi podatki pred vnosom podatkov
- Odobrena izbira orodja, minimizacija konteksta in možnost uporabe refleksa vrtenja ključa v primeru puščanja
Vse, kar prilepite v pomočnika za kodiranje, je potencialno izven vašega nadzora. Ključ API-ja, izpis baze podatkov o strankah, lastniška izvorna koda, ki še ni bila objavljena, ali zapis o pacientu – ti lahko postanejo nepopravljivo uhajanje, ko pridejo v neodobreno orodje. Največje tveganje umetne inteligence za ekipe programske opreme ne izvira iz napake v vrstici, temveč zaradi neprevidnega kopiranja in lepljenja. Ta enota je namenjena varnemu kopiranju in lepljenju.
Tu ločimo tri stvari: katerih podatkov nikoli ne vnašamo, katera orodja se lahko uporabljajo s kakšnimi zaščitnimi ukrepi in kako zavarovati podatke pred vnosom (maskiranje, sintetični podatki, lokalno delovanje). To ni izbirni "bilo bi lepo"; V večini ustanov je to pogodbena in zakonska obveznost.
Zakaj je tako kritično?
Podatki, ki jih pošljete orodju AI; obdelani na strežnikih ponudnika, včasih shranjeni za določen čas, se lahko uporabijo za izboljšanje modela v nekaterih nastavitvah izdelka. Reči "Izbrisal sem klepet" pogosto ni dovolj; V trenutku, ko podatki zapustijo omrežje, nastopi tveganje. Poleg tega so stroški uhajanja visoki: razkriti ključ v oblaku je mogoče zlorabiti v nekaj minutah, uhajajoči podatki o strankah lahko povzročijo obvestilo in kazni v skladu s predpisi, kot je KVKK/GDPR, uhajajoča zasebna izvorna koda pa lahko uniči konkurenčno prednost.
Osnovno pravilo je torej preprosto: v neodobreno vozilo ne vnašajte ničesar, česar si ne morete privoščiti izgube. Če ste v dvomih, ne vstopajte.
Pozor: Miselnost "samo enkrat, hitro" je najpogostejši vzrok za uhajanje informacij. Lepljenje produkcijskega dnevnika ali konfiguracijske datoteke, kakršna je, ko odpravljamo nujno napako, je točno to, kar se zgodi pri takšnih odločitvah, sprejetih pod pritiskom. Nujnost ne prekine pravila zaupnosti.
Česa se nikoli ne sme vpisati (rdeča črta)
- Skrivnosti: API ključi, gesla, ključi za dostop do oblaka, zasebni certifikati, žetoni, povezovalni nizi.
- Osebni podatki (PII): Ime-priimek, ID številka, e-pošta, telefon, naslov, zdravstvena/finančna evidenca, podatki o strankah.
- Zaupna poslovna sredstva: Nerazkrita izvorna koda, lastniški algoritmi, notranje arhitekturne skrivnosti, podrobnosti pogodbe.
- Regulirani podatki: Posebne zaščitene kategorije, kot so zdravstvo, plačilne kartice (PCI), osebne finance.
Korak za korakom: varen tok uporabe
- Razvrstite podatke. Kakšno kategorijo imate – javno, interno, zaupno, regulirano?
- Izberite vozilo po razredu. Zaupni/regulirani podatki se obdelujejo samo v institucionalno odobrenih orodjih, ki zagotavljajo zagotovilo podatkov (neuporaba v izobraževanju, omejitev hrambe, regionalna obdelava).
- Zavarujte pred vstopom. Odstranite skrivnosti, maskirajte/anonimizirajte PII, uporabite sintetične (izmišljene, a realistične) podatke namesto resničnih, če je mogoče.
- Zmanjšajte kontekst. Zmanjšajte svojo težavo na najmanjši ponovljivi primer, ki ne vključuje občutljivih delov.
- Preverite tudi izhod. Preverite, da v kodi, ki jo je ustvaril AI, ni nobene trdo kodirane skrivnosti ali ostankov vaših podatkov.
Trije mini kovčki
1. primer — prilepljeni ključ je bil preklican. Razvijalec je med odpravljanjem napake prilepil celotno konfiguracijsko datoteko v AI; Datoteka je vsebovala aktivni ključ API-ja tretje osebe. Ko je ekipa opazila, je takoj preklicala (rotirala) ključ in izdelala novega; Zlorabe ni bilo, je pa bil "poceni" incident. Nauk: pred lepljenjem odstranite glazuro - in takoj obrnite ključ, če je puščala.
2. primer – Sintetični podatki so rešili podjetje. Ekipa je imela napako pri razčlenjevanju dejanskih zapisov strank. Namesto da bi vnesli resnične podatke, so izdelali 20 vrstic sintetičnih podatkov z enako strukturo, a popolnoma lažnimi, z njimi reproducirali napako in jo rešili z AI. Niti PII ni ušel niti se je diagnoza upočasnila; sintetični podatki so bili varni in zadostni.
Primer 3 — Skrita skrivnost v izpisu. Pri ustvarjanju vzorčne konfiguracije je AI vanj vdelal realističen "vzorčni" ključ in ga vnesel v kodo, ne da bi razvijalec opazil; Skeniranje osnovne kode (skrivni skener) je to ujelo in opozorilo. Nespremenljiva skrivnost nikoli ne bi smela priti v kodo; Pravilen način je bil uporaba spremenljivke okolja ali upravitelja skrivnosti. Lekcija: preglejte tudi izpis za skrivnosti.
Štiri kopirane predloge
Kontrolni seznam mask pred vstopom (samo):
Preden dam to besedilo AI, se prepričajte, da sem odstranil naslednje in zamenjal tisto, kar boste našli z [MASKED]: API ključ, geslo, žeton, povezovalni niz, ime-priimek, e-pošta, telefon, ID številka, podatki o stranki. Besedilo:{{besedilo}}
Generiranje sintetičnih testnih podatkov:
Ustvarite POPOLNOMA izmišljene (nepovezane z resnično osebo/institucijo) {{N}}vrstne testne podatke v skladu s spodnjo shemo. Naj bo videti realistično, vendar ne uporabljajte resničnih osebnih podatkov. Shema: {{polja in tipi}}Vključuje robne primere (prazno, meja, slaba oblika).
Popravljen skrivni lov (v kodi):
V tej kodi/konfiguraciji poiščite trdo kodirano skrivnost: ključ, geslo, žeton, URL po meri. Če ga najdete, navedite njegovo lokacijo in predlagajte pravilno metodo (spremenljivka okolja / tajni upravitelj). Koda:{{code}}
Ugotavljanje skladnosti vozila (po podatkovnem razredu):
Imam naslednjo vrsto podatkov: {{razred: javno / interno / zaupno / regulirano}}. Orodje, ki ga nameravam uporabiti, je: {{tool}}. Katere zaščitne ukrepe (shranjevanje, neuporaba v izobraževanju, regija, dostop) moram potrditi pred obdelavo teh podatkov v tem orodju? Podajte kontrolni seznam. Odločitev je moja; Vi razjasnite kriterije.
Šibek poziv/močan poziv
Slabo: (Lepljenje 200 vrstic dejanskega uporabnika, pridobljenih iz produkcijske baze podatkov) "Zakaj je v teh podatkih prišlo do napake pri razčlenjevanju?"
Močno: "Spodaj je 15 vrstic z enako strukturo kot resnični podatki, vendar popolnoma sintetične (brez PII). parse_user() vrže ValueError v 3, 8 in 12 od teh vrstic. Kaj bi lahko bil skupni vzorec, kako ga popravim?"
Močna različica ne vsebuje resničnih osebnih podatkov, medtem ko ohranja strukturo, potrebno za reprodukcijo hrošča. Diagnoza ostaja enaka, tveganje se ponastavi.
Razred podatkov
Ali ga je mogoče obdelati v AI?
Predpogoj
javnosti
ja
—
Notranja uporaba (nenatančnost)
Na splošno
Upoštevajte politiko podjetja
Zaupno (izvorna koda, poslovna skrivnost)
Samo odobreno vozilo
Korporativno zavarovanje + minimizacija
PII / urejeno
Praviloma št
Zamaskirajte/anonimizirajte ali uporabite sintetiko
Skladnost s pravilnikom in sledenje
Varna uporaba je več kot le osebna navada, je sistem podjetja: katera orodja so odobrena, kateri razred podatkov se lahko kam prenese in kaj storiti v primeru kršitve, je treba opredeliti v pisni politiki. Če pride do razkritja skrivnosti, najpomembnejši prvi korak ni panika, ampak takoj razveljavite (prekličete in ustvarite novo) razkrito poverilnico in prijavite incident. Če ne poznate seznama odobrenih orodij in pravil za razvrščanje podatkov vaše organizacije, je vaša prva naloga, da se jih naučite.
Namig: v orodju Editor/CLI definirajte seznam »prezrtih« za določen projekt (npr. .env, skrite mape, datoteke identitete), da te datoteke ne bodo pomotoma vključene v kontekst pomočnika. Preventiva je vedno cenejša od čiščenja.
Pogoste napake
- Lepljenje občutljivih podatkov "samo enkrat". Nujnost ne prekine rdeče črte; Tu pride do najpogostejšega puščanja.
- Razmišljate "Izbrisal bom pogovor". V trenutku, ko podatki zapustijo omrežje, nastane tveganje; Brisanje tega ne razveljavi.
- Izbira vozila brez gledanja na razred. Obdelava zaupnih podatkov podjetja z osebnim računom je resna kršitev.
- Ne skenira izhoda. AI lahko v kodo vdela nespremenljivo skrivnost; Preglejte tudi proizvodnjo s tajnim skenerjem.
- Ne obračaj, ko skrivnost uhaja. Če razkritega ključa ne prekličete, uhajanje spremeni v izkoriščanje v živo.
Če povzamem
Največje tveganje umetne inteligence v programski opremi je uhajanje zasebnosti, večina pa izhaja iz odločitve o kopiranju in lepljenju, sprejete pod prisilo. Pravilo je jasno: skrivnosti, osebni podatki, zaupna poslovna sredstva in nadzorovani podatki se ne vnašajo v neodobrena orodja. Razvrstite podatke pred vnosom, izberite agenta po razredu, izvlecite skrivnosti, maskirajte PII ali uporabite sintetične podatke, minimizirajte kontekst in skenirajte tudi izhod za skrivnosti. Če pride do uhajanja, prva stvar: vrnite poverilnico in jo prijavite.
Aplikacijska naloga
Vzemite del kode/dnevnika/podatkov, ki ste jih nedavno dali (ali razmišljate o dajanju) AI. Najprej identificirajte skrivne kandidate in kandidate, ki omogočajo osebno prepoznavo, s predlogo »kontrolnega seznama za maskiranje«. Nato, če vsebuje resnične podatke, izdelajte različico, ki je enaka predlogi za "generiranje sintetičnih preskusnih podatkov", vendar popolnoma izdelana, in naredite svojo težavo ponovljivo z njo. Končno poiščite in preberite odobren seznam orodij vaše ustanove in politiko razvrščanja podatkov; V nasprotnem primeru upoštevajte to opustitev.
kontrolni seznam
- [ ] Podatke pred vnosom razvrščam (odprto/interno/zaupno/predpisano).
- [ ] Nikoli ne vnašam skrivnosti, PII in zaupnih poslovnih sredstev v neodobrena orodja.
- [ ] Kadar koli je to mogoče, uporabljam maskirne ali sintetične podatke namesto resničnih podatkov.
- [ ] Kontekst zmanjšam na najmanjši primer, ki ne vključuje občutljivih delov.
- [ ] Pregledam izhod AI za težko zakopano skrivnost.
- [ ] Vem, da bom, če bo skrivnost razkrita, takoj vrnil identifikacijske podatke in prijavil incident.