Üksus 10 / 12

Ohutu kasutamine: lekkevaba ja konfidentsiaalsus

Kasu:

  • Võimalus klassifitseerida saladusi, isikuandmeid ja konfidentsiaalseid ärivarasid sisaldavaid andmeid ning ära tunda punaseid jooni
  • Enne andmete sisestamist varjamine, anonüümseks muutmine ja sünteetiliste andmetega turvamine
  • Heakskiidetud tööriistavalik, konteksti minimeerimine ja lekke korral klahvi pööramise refleksi rakendamine

Kõik, mille kleepite kodeerimisassistendisse, on potentsiaalselt teie kontrolli alt väljas. API-võti, kliendiandmebaasi tõmmis, veel teatamata varaline lähtekood või patsiendikirje – need võivad muutuda pöördumatuks lekkeks, kui need sattuvad heakskiitmata tööriista. Tarkvarameeskondade suurim tehisintellekti risk ei tulene mitte reaveast, vaid hooletust kopeerimisest-kleebimisest. Selle seadme eesmärk on muuta kopeerimine ja kleepimine turvaliseks.

Siin eristatakse kolme asja: milliseid andmeid ei tohi kunagi sisestada, milliseid tööriistu milliste kaitsemeetmetega kasutada ja kuidas andmeid enne sisestamist turvata (maskimine, sünteetilised andmed, lokaalne töötamine). See ei ole valikuline "oleks tore"; See on enamikus asutustes lepinguline ja juriidiline kohustus.

Miks see nii kriitiline on?

Andmed, mille saadate tehisintellekti tööriistale; teenusepakkuja serverites töödeldud, mõnikord teatud aja jooksul salvestatud andmeid saab kasutada mõne toote seadete mudeli täiustamiseks. Sageli ei piisa sellest, kui öelda "kustutasin vestluse ära"; Kui andmed võrgust lahkuvad, tekib risk. Pealegi on lekke hind kõrge: lekkinud pilvevõtit saab mõne minuti jooksul kuritarvitada, lekkinud kliendiandmed võivad kaasa tuua teavitamise ja trahvid selliste määruste alusel nagu KVKK/GDPR ning lekkinud privaatne lähtekood võib hävitada konkurentsieelise.

Seega on rusikareegel lihtne: ärge sisestage heakskiitmata sõidukisse midagi, mille kaotamist te ei saa endale lubada. Kui kahtlete, ärge sisenege.

Ettevaatust: "ainult üks kord, kiiresti" mentaliteet on kõige levinum lekete põhjus. Tootmislogi või konfiguratsioonifaili kleepimine kiireloomulise vea lahendamisel on täpselt see, mis juhtub selliste surve all tehtud otsustega. Kiireloomulisus ei peata konfidentsiaalsusreeglit.

Mida ei tohi kunagi sisestada (punane joon)

  • Saladused: API võtmed, paroolid, pilvepääsu võtmed, privaatsed sertifikaadid, märgid, ühendusstringid.
  • Isikuandmed (PII): Ees-perekonnanimi, TR ID number, e-post, telefon, aadress, tervise-/majanduslikud andmed, kliendiandmed.
  • Konfidentsiaalsed ärivarad: avalikustamata lähtekood, patenteeritud algoritmid, sisearhitektuuri saladused, lepingu üksikasjad.
  • Reguleeritud andmed: kaitstud erikategooriad, nagu tervishoid, maksekaart (PCI), isiklikud rahandused.

Samm-sammult: ohutu kasutamise voog

  1. Klassifitseerige andmed. Mis kategooria teil on – avalik, sisemine, konfidentsiaalne, reguleeritud?
  2. Valige sõiduk klassi järgi. Konfidentsiaalseid/reguleeritud andmeid töödeldakse ainult institutsionaalselt heaks kiidetud tööriistades, mis tagavad andmete kindlustunde (mittekasutamine hariduses, säilituspiirang, piirkondlik töötlemine).
  3. Kinnitage enne sisenemist. Eemaldage saladused, maskeerige/anonüümseks muutke PII, kasutage võimaluse korral sünteetilisi (väljatöötatud, kuid realistlikke) andmeid tegelike andmete asemel.
  4. Minimeeri kontekst. Vähendage oma probleemi väikseima reprodutseeritava näiteni, mis ei sisalda tundlikke osi.
  5. Kontrollige ka väljundit. Kontrollige, et tehisintellekti loodud koodis poleks kõvakodeeritud saladust või teie andmete jäänuseid.

Kolm miniümbrist

Juhtum 1 – kleebitud võti tühistati. Arendaja kleepis vea parandamise ajal kogu konfiguratsioonifaili AI-sse; Fail sisaldas aktiivset kolmanda osapoole API-võtit. Kui meeskond seda märkas, tühistas (pööras) kohe võtme ja valmistas uue; Kuritarvitamist ei olnud, kuid see oli "odav" juhtum. Õppetund: eemaldage glasuur enne liimimist ja keerake võtit kohe, kui see on lekkinud.

Juhtum 2 – sünteetilised andmed päästsid ettevõtte. Meeskonnal ilmnes tegelike kliendikirjete sõelumisel viga. Reaalsete andmete sisestamise asemel valmistasid nad 20 rida sama struktuuriga, kuid täiesti võltsitud sünteetilisi andmeid, reprodutseerisid sellega vea ja lahendasid selle AI-ga. PII ei lekkinud ega diagnoosi aeglustunud; sünteetilised andmed olid nii ohutud kui ka piisavad.

Juhtum 3 – peidetud saladus väljatrükis. Näidiskonfiguratsiooni loomisel manustas AI sellesse realistliku välimusega näidisvõtme ja sisestas selle koodi ilma, et arendaja oleks seda märganud; Koodibaaskontroll (salajane skanner) püüdis selle kinni ja hoiatas. Muutumatu saladus ei oleks kunagi tohtinud koodi sisse sattuda; Õige viis oli kasutada keskkonnamuutujat või saladuste haldurit. Õppetund: kontrollige ka väljundit saladuste leidmiseks.

Neli kopeeritavat malli

Maskeerimise kontroll-loend enne sisestamist (ise):

Enne selle teksti AI-le edastamist eemaldage kindlasti järgmine teave ja asendan selle tekstiga [MASKED]: API-võti, parool, luba, ühenduse string, nimi-perekonnanimi, e-posti aadress, telefon, ID-number, kliendiandmed. Tekst:{{text}}

Sünteetilise testi andmete genereerimine:

Looge TÄIELIKULT väljamõeldud (reaalse isiku/asutusega mitteseotud) {{N}}rea testiandmed vastavalt allolevale skeemile. Muutke see realistlik, kuid ärge kasutage tõelist isikut tuvastavat teavet. Skeem: {{väljad ja tüübid}}Sisaldab äärejuhtumeid (tühi, piir, halb vorming).

Parandatud salajaht (koodis):

Otsige sellest koodist/konfiguratsioonist kõvakodeeritud saladust: võti, parool, luba, kohandatud URL. Kui leiate selle, täpsustage selle asukoht ja soovitage õiget meetodit (keskkonnamuutuja / salahaldur). Kood:{{code}}

Sõiduki vastavushindamine (andmeklassi järgi):

Mul on järgmist tüüpi andmed: {{klass: avalik / sisemine / konfidentsiaalne / reguleeritud}}. Tööriist, mida kavatsen kasutada, on: {{tööriist}}. Milliseid kaitsemeetmeid (salvestus, hariduses mittekasutamine, piirkond, juurdepääs) peaksin enne nende andmete töötlemist selles tööriistas kinnitama? Andke kontrollnimekiri. Otsus on minu; Teete kriteeriumid selgeks.

Nõrk viip / Tugev viip

Nõrk: (Tootmisandmebaasist tõmmatud 200 tegeliku kasutajarea kleepimine) "Miks on nendes andmetes sõelumisviga?"
Tugev: "Allpool on 15 rida, millel on sama struktuur kui pärisandmetel, kuid täiesti sünteetilised (ilma isikuandmeteta). parse_user() viskab ValueErrori nendest ridadest 3, 8 ja 12. Mis võiks olla levinud muster, kuidas seda parandada?"

Tugev versioon ei sisalda tegelikke isikuandmeid, säilitades samas vea reprodutseerimiseks vajaliku struktuuri. Diagnoos jääb samaks, risk lähtestatakse.

Andmeklass

Kas seda saab AI-s töödelda?

Eeltingimus

avalik

Jah

Sisekasutus (mittetäpne)

Üldiselt

Järgige ettevõtte poliitikat

Konfidentsiaalne (lähtekood, ärisaladus)

Ainult heakskiidetud sõiduk

Ettevõtte tagatis + minimeerimine

PII / reguleeritud

Üldjuhul nr

Mask/anonüümseks muutmine või sünteetiliste materjalide kasutamine

Eeskirjade järgimine ja jälgimine

Turvaline kasutamine on midagi enamat kui lihtsalt isiklik harjumus, see on ettevõtte süsteem: millised tööriistad on heaks kiidetud, milline andmeklass kuhu võib minna ja mida rikkumise korral teha, tuleks määratleda kirjalikus poliitikas. Kui saladus lekib, on kõige olulisem esimene samm mitte paanikasse sattuda, vaid viivitamatult taastada (tühistada ja genereerida uus) lekkinud mandaat ja teatada juhtunust. Kui te ei tea oma organisatsiooni heakskiidetud tööriistade loendit ja andmete klassifitseerimise reegleid, on teie esimene ülesanne need selgeks õppida.

Näpunäide. Määratlege oma redaktoris/CLI-tööriistas projektipõhine ignoreerimisloend (nt env, peidetud kaustad, identiteedifailid), et neid faile kogemata assistendi konteksti ei kaasataks. Ennetamine on alati odavam kui koristamine.

Levinud vead

  • Tundlike andmete kleepimine "ainult üks kord". Kiireloomulisus ei peata punast joont; Kõige tavalisem leke esineb siin.
  • Mõeldes "Kustutan vestluse". Hetkel, kui andmed võrgust lahkuvad, tekib risk; Kustutamine seda tagasi ei võta.
  • Sõiduki valimine selle klassi vaatamata. Ettevõtte konfidentsiaalsete andmete töötlemine isikliku kontoga on tõsine rikkumine.
  • Väljundit ei skannita. AI võib koodi manustada muutumatu saladuse; Kontrollige toodangut ka salaskanneriga.
  • Ei keera seda, kui saladus lekib. Lekkinud võtme tühistamata jätmine muudab lekke reaalajas ärakasutamiseks.

Kokkuvõttes

Suurim tehisintellekti risk tarkvaras on privaatsuse leke ja suurem osa sellest tuleneb sunniviisiliselt tehtud kopeerimis-kleebi otsusest. Reegel on selge: saladusi, isikuandmeid, konfidentsiaalseid ärivarasid ja reguleeritud andmeid ei sisestata heakskiitmata tööriistadesse. Klassifitseerige andmed enne sisestamist, valige agent klasside kaupa, eraldage saladused, maskeerige PII või kasutage sünteetilisi andmeid, minimeerige konteksti ja kontrollige ka saladusi. Kui esineb leke, siis esimene asi: tagastage mandaat ja teatage sellest.

Rakenduse ülesanne

Võtke osa koodist/logist/andmetest, mille olete hiljuti tehisintellektile andnud (või kavatsete anda). Esmalt tuvastage maskeerimise kontrollnimekirja malli abil salajased ja isikuandmete tuvastamise kandidaadid. Seejärel, kui see sisaldab tõelisi andmeid, looge versioon, mis on identne "sünteetiliste testandmete genereerimise" malliga, kuid on täielikult välja mõeldud, ja tehke oma probleem sellega reprodutseeritavaks. Lõpuks otsige üles ja lugege läbi oma asutuse heakskiidetud tööriistade loend ja andmete klassifitseerimise poliitika; Vastasel juhul pange see väljajätmine tähele.

kontrollnimekiri

  • [ ] Salastan andmed enne nende sisestamist (avatud/sisemine/konfidentsiaalne/regulatsioon).
  • [ ] Ma ei sisesta kunagi saladusi, isikuandmeid ega konfidentsiaalseid ärivarasid heakskiitmata tööriistadesse.
  • [ ] Kasutan reaalsete andmete asemel võimalusel maskeerimis- või sünteetilisi andmeid.
  • [ ] Ma taandan konteksti kõige väiksemale näitele, mis ei sisalda tundlikke osi.
  • [ ] Skaneerin tehisintellekti väljundist kõvasti maetud saladusi.
  • [ ] Tean, et kui saladus lekib, tagastan viivitamatult identifitseerimisandmed ja teatan juhtunust.