Ieguvumi:
- Spēja klasificēt datus, kas satur noslēpumus, personas datus un konfidenciālus biznesa aktīvus, un atpazīt sarkanās līnijas
- Maskēšana, anonimizācija un aizsardzība ar sintētiskiem datiem pirms datu ievadīšanas
- Apstiprināta instrumenta izvēle, konteksta minimizēšana un iespēja izmantot taustiņu rotācijas refleksu noplūdes gadījumā
Viss, ko ielīmējat kodēšanas palīgā, iespējams, ir ārpus jūsu kontroles. API atslēga, klientu datu bāzes izgāztuve, vēl nepaziņots patentētais avota kods vai pacienta ieraksts — tie var kļūt par neatgriezenisku noplūdi, tiklīdz tie nonāk neapstiprinātā rīkā. Lielākais AI risks programmatūras komandām rodas nevis no līnijas kļūdas, bet gan no neuzmanīgas kopēšanas-ielīmēšanas. Šīs vienības mērķis ir nodrošināt kopēšanas un ielīmēšanas drošību.
Šeit mēs izšķiram trīs lietas: kādus datus nekad nevajadzētu ievadīt, kādus rīkus var izmantot ar kādiem drošības pasākumiem un kā aizsargāt datus pirms to ievadīšanas (maskēšana, sintētiskie dati, darbs lokāli). Tas nav obligāts "būtu jauki"; Lielākajā daļā iestāžu tas ir līgumisks un juridisks pienākums.
Kāpēc tas ir tik kritiski?
Dati, kurus nosūtāt uz AI rīku; kas apstrādāti pakalpojumu sniedzēja serveros un dažkārt tiek glabāti noteiktu laika periodu, var tikt izmantoti modeļa uzlabošanai dažos produkta iestatījumos. Bieži vien nepietiek, sakot: "Es izdzēsu tērzēšanu"; Brīdī, kad dati iziet no tīkla, rodas risks. Turklāt noplūdes izmaksas ir augstas: nopludinātu mākoņa atslēgu var ļaunprātīgi izmantot dažu minūšu laikā, nopludināti klienta dati var izraisīt paziņojumus un sodus saskaņā ar tādiem noteikumiem kā KVKK/GDPR, un privātais pirmkods var iznīcināt konkurences priekšrocības.
Tāpēc īkšķis ir vienkāršs: neievietojiet neapstiprinātā transportlīdzeklī neko, ko nevarat atļauties pazaudēt. Ja šaubāties, neienāciet.
Uzmanību: mentalitāte "tikai vienreiz, ātri" ir visizplatītākais noplūžu cēlonis. Ražošanas žurnāla vai konfigurācijas faila ielīmēšana tādā veidā, kā tas ir, novēršot steidzamu kļūdu, ir tieši tas, kas notiek ar šādiem lēmumiem, kas pieņemti zem spiediena. Steidzamība neaptur konfidencialitātes noteikumu.
Ko nekad nevajadzētu ievadīt (sarkanā līnija)
- Noslēpumi: API atslēgas, paroles, mākoņa piekļuves atslēgas, privātie sertifikāti, marķieri, savienojuma virknes.
- Personas dati (PII): Vārds-uzvārds, TR ID numurs, e-pasts, tālrunis, adrese, veselības/finanšu uzskaite, klienta dati.
- Konfidenciāli biznesa līdzekļi: neizpaužams pirmkods, patentēti algoritmi, iekšējās arhitektūras noslēpumi, līguma informācija.
- Regulētie dati: īpaši aizsargātas kategorijas, piemēram, veselības aprūpe, maksājumu karte (PCI), personīgās finanses.
Soli pa solim: droša lietošanas plūsma
- Klasificējiet datus. Kāda ir jūsu kategorija — publiska, iekšēja, konfidenciāla, reglamentēta?
- Izvēlieties transportlīdzekli pēc klases. Konfidenciāli/regulēti dati tiek apstrādāti tikai institucionāli apstiprinātos rīkos, kas nodrošina datu pārliecību (neizmantošana izglītībā, saglabāšanas limits, reģionālā apstrāde).
- Nodrošiniet pirms ieiešanas. Noņemiet noslēpumus, maskējiet/anonimizējiet PII, izmantojiet sintētiskus (sagatavotus, bet reālus) datus, nevis reālus, ja iespējams.
- Samaziniet kontekstu. Samaziniet problēmu līdz mazākajam atkārtojamam piemēram, kas neietver jutīgas daļas.
- Pārbaudiet arī izvadi. Pārbaudiet, vai AI ģenerētajā kodā nav šifrēta noslēpuma vai jūsu datu palieku.
Trīs mini futrāļi
1. gadījums — ielīmētā atslēga tika atcelta. Izstrādātājs ielīmēja visu konfigurācijas failu AI, vienlaikus labojot kļūdu; Failā bija trešās puses API atslēga. Kad komanda to pamanīja, viņi nekavējoties atcēla (pagrieza) atslēgu un izveidoja jaunu; Nebija ļaunprātīgas izmantošanas, taču tas bija "lēts" incidents. Nodarbība: pirms līmēšanas noņemiet glazūru un nekavējoties pagrieziet atslēgu, ja tā ir noplūdusi.
2. gadījums — sintētiskie dati saglabāja uzņēmumu. Komandai radās faktisko klientu ierakstu parsēšanas kļūda. Tā vietā, lai ievadītu reālus datus, viņi izveidoja 20 rindiņas sintētisko datu ar tādu pašu struktūru, bet pilnīgi viltus, ar to atveidoja kļūdu un atrisināja to ar AI. Ne PII noplūda, ne diagnoze palēninājās; sintētiskie dati bija gan droši, gan pietiekami.
3. gadījums — slēptais noslēpums izdrukā. Ģenerējot parauga konfigurāciju, mākslīgais intelekts tajā ievietoja reālistiska izskata "parauga" atslēgu un iekļāva to kodā, izstrādātājam nemanot; Kodu bāzes skenēšana (slepenais skeneris) to uztvēra un brīdināja. Nemainīgajam noslēpumam nekad nevajadzētu iekļūt kodā; Pareizais veids bija izmantot vides mainīgo vai noslēpumu pārvaldnieku. Nodarbība: skenējiet arī izvadi, lai atrastu noslēpumus.
Četras kopējamas veidnes
Maskēšanas kontrolsaraksts pirms ievadīšanas (pats):
Pirms nododat šo tekstu AI, noteikti noņemiet tālāk norādīto un aizvietoju to ar [MASKED]: API atslēga, parole, marķieris, savienojuma virkne, vārds-uzvārds, e-pasts, tālrunis, ID numurs, klienta dati. Teksts:{{text}}
Sintētisko testu datu ģenerēšana:
Ģenerējiet PILNĪGI izdomātus (ar reālu personu/iestādi nesaistītus) {{N}}rindu testa datus saskaņā ar tālāk norādīto shēmu. Padariet to izskatu reālistisku, taču neizmantojiet īstu PII. Shēma: {{lauki un veidi}}Ietver malas gadījumus (tukšs, robeža, slikts formāts).
Fiksētas slepenās medības (kodā):
Meklējiet kodētu noslēpumu šajā kodā/konfigurācijā: atslēga, parole, marķieris, pielāgots URL. Ja atrodat, norādiet tā atrašanās vietu un iesakiet pareizo metodi (vides mainīgais / slepenais pārvaldnieks). Kods:{{code}}
Transportlīdzekļa atbilstības novērtējums (pēc datu klases):
Man ir šāda veida dati: {{klase: publiska / iekšēja / konfidenciāla / reglamentēta}}. Rīks, ko plānoju izmantot, ir: {{rīks}}. Kādi drošības pasākumi (uzglabāšana, neizmantošana izglītībā, reģions, piekļuve) man ir jāapstiprina pirms šo datu apstrādes šajā rīkā? Sniedziet kontrolsarakstu. Lēmums ir mans; Jūs precizējat kritērijus.
Vāja uzvedne / spēcīga uzvedne
Vāji: (no ražošanas datu bāzes izvilktas 200 reālu lietotāju rindas) "Kāpēc šajos datos ir parsēšanas kļūda?"
Strong: "Zemāk ir 15 rindas ar tādu pašu struktūru kā reāliem datiem, bet pilnībā sintētiskām (bez PII). Parse_user() izmet ValueError 3., 8. un 12. no šīm rindām. Kāds varētu būt kopīgs modelis, kā to labot?"
Spēcīgā versija nesatur reālus personas datus, vienlaikus saglabājot struktūru, kas nepieciešama kļūdas reproducēšanai. Diagnoze paliek nemainīga, risks tiek atiestatīts.
Datu klase
Vai to var apstrādāt AI?
Priekšnoteikums
publiski
Jā
—
Iekšējai lietošanai (neprecīza)
Vispārīgi
Ievērojiet korporatīvo politiku
Konfidenciāli (avota kods, biznesa noslēpums)
Tikai apstiprināts transportlīdzeklis
Korporatīvā garantija + minimizēšana
PII / regulēta
Kā likums Nr
Maskējiet/anonimizējiet vai izmantojiet sintētisko
Politikas atbilstība un izsekošana
Droša lietošana ir vairāk nekā tikai personisks ieradums, tā ir korporatīva sistēma: kuri rīki ir apstiprināti, kura datu klase kurp var nonākt un kā rīkoties pārkāpuma gadījumā, ir jādefinē rakstiskā politikā. Ja noslēpums tiek nopludināts, vissvarīgākais pirmais solis ir nekrist panikā, bet nekavējoties atsaukt (atcelt un ģenerēt jaunu) noplūdušos akreditācijas datus un ziņot par incidentu. Ja nezināt savas organizācijas apstiprināto rīku sarakstu un datu klasifikācijas noteikumus, pirmais uzdevums ir tos apgūt.
Padoms. Redaktora/CLI rīkā definējiet projektam specifisku "ignorēšanas" sarakstu (piemēram, .env, slēptās mapes, identitātes faili), lai šie faili nejauši netiktu iekļauti palīga kontekstā. Profilakse vienmēr ir lētāka nekā tīrīšana.
Biežas kļūdas
- Sensitīvu datu ielīmēšana "tikai vienu reizi". Steidzamība neaptur sarkano līniju; Šeit notiek visizplatītākā noplūde.
- Domājot "izdzēsīšu sarunu". Brīdī, kad dati iziet no tīkla, rodas risks; Dzēšana to neatsauc.
- Transportlīdzekļa izvēle, neapskatot tā klasi. Konfidenciālu uzņēmuma datu apstrāde ar personīgo kontu ir nopietns pārkāpums.
- Netiek skenēta izvade. AI var iegult kodā nemainīgu noslēpumu; Pārbaudiet arī produkciju ar slepeno skeneri.
- Nepagriežot to, kad noslēpums noplūst. Neatsaucot noplūdušo atslēgu, noplūde tiek pārvērsta par dzīvu izmantošanu.
Rezumējot
Lielākais AI risks programmatūrā ir privātuma noplūde, un lielākā daļa no tā rodas no kopēšanas un ielīmēšanas lēmuma, kas pieņemts piespiedu kārtā. Noteikums ir skaidrs: noslēpumi, personas dati, konfidenciāli biznesa aktīvi un regulētie dati netiek ievadīti neapstiprinātos rīkos. Klasificējiet datus pirms ievades, atlasiet aģentu pēc klases, izņemiet noslēpumus, maskējiet PII vai izmantojiet sintētiskos datus, minimizējiet kontekstu un skenējiet arī noslēpumus. Ja ir noplūde, vispirms atdodiet akreditācijas datus un ziņojiet par to.
Lietojumprogrammas uzdevums
Paņemiet koda/žurnāla/datu daļu, ko nesen esat nodevis (vai apsverat to nodot) AI. Vispirms identificējiet slepenos un PII kandidātus, izmantojot veidni “maskēšanas kontrolsaraksts”. Pēc tam, ja tajā ir ietverti reāli dati, izveidojiet versiju, kas ir identiska "sintētisko testa datu ģenerēšanas" veidnei, bet pilnībā izdomātu, un padariet savu problēmu ar to reproducējamu. Visbeidzot atrodiet un izlasiet savas iestādes apstiprināto rīku sarakstu un datu klasifikācijas politiku; Pretējā gadījumā ņemiet vērā šo izlaidumu.
kontrolsaraksts
- [ ] Es klasificēju datus pirms to ievadīšanas (atvērts/iekšējs/konfidenciāls/atbilst regulējumam).
- [ ] Es nekad neievadu noslēpumus, PII un konfidenciālus uzņēmējdarbības līdzekļus neapstiprinātos rīkos.
- [ ] Es izmantoju maskēšanas vai sintētiskos datus, kad vien iespējams, nevis reālus datus.
- [ ] Es samazinu kontekstu līdz mazākajam piemēram, kas neietver jutīgas daļas.
- [ ] Es skenēju mākslīgā intelekta izvadi, lai atrastu grūti apglabātu noslēpumu.
- [ ] Es zinu, ka, ja noslēpums tiks nopludināts, es nekavējoties atgriezīšu identifikācijas informāciju un ziņošu par notikušo.