Njësia 10 / 12

Përdorimi i sigurt: pa rrjedhje dhe konfidencialitet

Fitimet:

  • Aftësia për të klasifikuar të dhënat që përmbajnë sekrete, të dhëna personale dhe asete konfidenciale të biznesit dhe njohjen e vijave të kuqe
  • Maskimi, anonimizimi dhe sigurimi me të dhëna sintetike përpara futjes së të dhënave
  • Zgjedhja e miratuar e mjeteve, minimizimi i kontekstit dhe aftësia për të aplikuar refleksin e rrotullimit të çelësit në rast rrjedhjeje

Çdo gjë që ngjisni në një asistent kodimi është potencialisht jashtë kontrollit tuaj. Një çelës API, një depo e bazës së të dhënave të klientit, kodi burimor i pronarit që ende nuk është shpallur, ose një dosje pacienti - këto mund të bëhen një rrjedhje e pakthyeshme sapo të futen në një mjet të pamiratuar. Rreziku më i madh i AI për ekipet e softuerit nuk vjen nga një gabim në linjë, por nga një copy-paste e pakujdesshme. Kjo njësi ka të bëjë me sigurimin e kopjimit-ngjitjes.

Këtu dallojmë tre gjëra: cilat të dhëna nuk duhet të futen kurrë, cilat mjete mund të përdoren me çfarë masash mbrojtëse dhe si të sigurohen të dhënat para futjes së tyre (maskimi, të dhënat sintetike, puna në nivel lokal). Ky nuk është opsional "do të ishte mirë"; Është një detyrim kontraktual dhe ligjor në shumicën e institucioneve.

Pse është kaq kritike?

Të dhënat që dërgoni në një mjet AI; të përpunuara në serverët e ofruesit, ndonjëherë të ruajtura për një periudhë kohore, mund të përdoren për të përmirësuar modelin në disa cilësime produkti. Të thuash "e fshiva bisedën" shpesh nuk mjafton; Në momentin që të dhënat largohen nga rrjeti, lind rreziku. Për më tepër, kostoja e rrjedhjes është e lartë: një çelës cloud i zbuluar mund të keqpërdoret brenda pak minutash, të dhënat e rrjedhura të klientit mund të rezultojnë në njoftime dhe ndëshkime sipas rregulloreve të tilla si KVKK/GDPR, dhe kodi burimor privat i rrjedhur mund të shkatërrojë avantazhin konkurrues.

Pra, rregulli i përgjithshëm është i thjeshtë: Mos futni asgjë në një automjet të pamiratuar që nuk mund ta përballoni ta humbni. Nëse keni dyshime, mos hyni.

Kujdes: Mentaliteti "vetëm një herë, shpejt" është shkaku më i zakonshëm i rrjedhjeve. Ngjitja e një regjistri prodhimi ose një skedari konfigurimi siç është kur zgjidh një problem urgjent është pikërisht ajo që ndodh me vendime të tilla të marra nën presion. Urgjenca nuk e pezullon rregullin e konfidencialitetit.

Çfarë nuk duhet të futet kurrë (vija e kuqe)

  • Sekretet: çelësat API, fjalëkalimet, çelësat e aksesit në renë kompjuterike, certifikatat private, shenjat, vargjet e lidhjes.
  • Të dhënat personale (PII): Emër-mbiemër, numri TR ID, e-mail, telefoni, adresa, të dhënat shëndetësore/financiare, të dhënat e klientit.
  • Asetet konfidenciale të biznesit: kodi burim i pazbuluar, algoritme të pronarit, sekretet e brendshme të arkitekturës, detajet e kontratës.
  • Të dhënat e rregulluara: Kategori të veçanta të mbrojtura si kujdesi shëndetësor, karta pagese (PCI), financat personale.

Hap pas hapi: Rrjedha e përdorimit të sigurt

  1. Klasifikoni të dhënat. Çfarë kategorie është ajo që keni - publike, e brendshme, konfidenciale, e rregulluar?
  2. Zgjidhni automjetin sipas klasës. Të dhënat konfidenciale/të rregulluara përpunohen vetëm në mjete të miratuara institucionalisht që ofrojnë sigurimin e të dhënave (mospërdorimi në arsim, kufiri i ruajtjes, përpunimi rajonal).
  3. Sigurohuni përpara se të hyni. Hiqni sekretet, maskoni/anonimizoni PII, përdorni të dhëna sintetike (të fabrikuara por realiste) në vend të të vërtetave nëse është e mundur.
  4. Minimizo kontekstin. Reduktojeni problemin tuaj në shembullin më të vogël të riprodhueshëm që nuk përfshin pjesë të ndjeshme.
  5. Kontrolloni gjithashtu daljen. Kontrolloni që nuk ka asnjë sekret të koduar ose mbetje të të dhënave tuaja në kodin e krijuar nga AI.

Tre Mini Rastet

Rasti 1 - Çelësi i ngjitur u anulua. Një zhvillues ngjiti të gjithë skedarin e konfigurimit në AI ndërsa rregullonte një gabim; Skedari përmbante një çelës të drejtpërdrejtë API të palës së tretë. Kur ekipi e vuri re, ata menjëherë anuluan (rrotulluan) çelësin dhe prodhuan një të ri; Nuk kishte abuzim, por ishte një incident 'i lirë'. Mësimi: hiqni glazurën përpara se ta ngjitni - dhe kthejeni çelësin menjëherë nëse ka rrjedhur.

Rasti 2 - Të dhënat sintetike e ruajtën biznesin. Një ekip po përjetonte një gabim analizimi me të dhënat aktuale të klientit. Në vend që të futnin të dhëna reale, ata prodhuan 20 rreshta të dhënash sintetike me të njëjtën strukturë, por krejtësisht false, e riprodhuan gabimin me të dhe e zgjidhën me AI. As PII nuk ka rrjedhur dhe as diagnoza nuk është ngadalësuar; të dhënat sintetike ishin të sigurta dhe të mjaftueshme.

Rasti 3 - Sekreti i fshehur në printim. Kur krijonte një konfigurim të mostrës, AI nguliti një çelës "kampion" me pamje realiste në të dhe e futi atë në kod pa e vënë re zhvilluesi; Skanimi i bazës së kodit (skaneri sekret) e kapi këtë dhe paralajmëroi. Sekreti i pandryshueshëm nuk duhet të kishte hyrë kurrë në kod; Mënyra e duhur ishte përdorimi i një ndryshoreje mjedisi ose një menaxher sekretesh. Mësimi: skanoni gjithashtu rezultatet për sekrete.

Katër modele të kopjueshme

Lista kontrolluese maskimi para hyrjes (vetë):

Përpara se t'i jepni këtë tekst AI, sigurohuni që të heq sa më poshtë dhe të zëvendësoj atë që gjeni me [MASKED]: çelësin API, fjalëkalimin, tokenin, vargun e lidhjes, emër-mbiemër, email, telefon, numrin e ID-së, të dhënat e klientit. Teksti:{{tekst}}

Gjenerimi i të dhënave të testit sintetik:

Gjeneroni të dhëna testimi të rreshtit {{N}} të fabrikuara PLOTËSISHT (të palidhura me personin/institucionin real) në përputhje me skemën e mëposhtme. Bëjeni të duket realist, por mos përdorni asnjë PII të vërtetë. Skema: {{fushat dhe llojet}}Përfshin rastet e skajeve (bosh, kufi, format i keq).

Gjuetia sekrete e fiksuar (në kod):

Kërkoni sekret të koduar në këtë kod/konfigurim: çelësi, fjalëkalimi, token, URL e personalizuar. Nëse e gjeni, specifikoni vendndodhjen e tij dhe sugjeroni metodën e duhur (ndryshore e mjedisit / menaxher sekret). Kodi:{{kodi}}

Vlerësimi i konformitetit të automjetit (sipas klasës së të dhënave):

Kam këto lloj të dhënash: {{klasa: publike / e brendshme / konfidenciale / e rregulluar}}. Mjeti që kam ndërmend të përdor është: {{mjet }}. Cilat masa mbrojtëse (ruajtje, mospërdorim në arsim, rajon, akses) duhet të konfirmoj përpara se të përpunoj këto të dhëna në këtë mjet? Jepni një listë kontrolli. Vendimi është i imi; Ju sqaroni kriteret.

Prompt i dobët / Prompt i fortë

E dobët: (Ngjitja e 200 rreshtave të përdoruesve realë të nxjerrë nga baza e të dhënave të prodhimit) "Pse ka një gabim analizimi në këto të dhëna?"
Strong: "Më poshtë janë 15 rreshta me të njëjtën strukturë si të dhënat reale, por plotësisht sintetike (pa PII). parse_user() hedh ValueError në 3, 8 dhe 12 nga këto rreshta. Cili mund të jetë modeli i zakonshëm, si ta rregulloj?"

Versioni i fortë nuk përmban të dhëna të vërteta personale duke ruajtur strukturën e nevojshme për të riprodhuar gabimin. Diagnoza mbetet e njëjtë, rreziku rivendoset.

Klasa e të dhënave

A mund të përpunohet në AI?

Kusht paraprak

publike

po

-

Përdorimi i brendshëm (jo preciz)

Në përgjithësi

Pajtohuni me politikën e korporatës

Konfidencial (kodi burimor, sekret biznesi)

Vetëm automjet i miratuar

Sigurimi i korporatës + minimizimi

PII / e rregulluar

Si rregull nr

Maskojeni/anonimizoni ose përdorni sintetikë

Pajtueshmëria dhe gjurmimi i politikave

Përdorimi i sigurt është më shumë se thjesht një zakon personal, ai është një sistem i korporatës: cilat mjete miratohen, cila klasë e të dhënave mund të shkojë dhe çfarë duhet bërë në rast të një shkeljeje duhet të përcaktohet në një politikë të shkruar. Nëse zbulohet një sekret, hapi i parë më i rëndësishëm nuk është të bëni panik, por të ktheni menjëherë (anuloni dhe gjeneroni një të re) kredencialin e rrjedhur dhe të raportoni incidentin. Nëse nuk e dini listën e mjeteve të miratuara të organizatës suaj dhe rregullat e klasifikimit të të dhënave, detyra juaj e parë është t'i mësoni ato.

Këshillë: Përcaktoni një listë "injorimi" specifike të projektit (p.sh. .env, dosje të fshehura, skedarë identiteti) në veglën tuaj Editor/CLI, në mënyrë që këta skedarë të mos përfshihen aksidentalisht në kontekstin e asistentit. Parandalimi është gjithmonë më i lirë se pastrimi.

Gabimet e zakonshme

  • Ngjitja e të dhënave të ndjeshme "vetëm një herë". Urgjenca nuk e pezullon vijën e kuqe; Rrjedhja më e zakonshme ndodh këtu.
  • Duke menduar "Unë do ta fshij bisedën". Në momentin që të dhënat largohen nga rrjeti, lind rreziku; Fshirja nuk e zhbë.
  • Zgjedhja e automjetit pa parë klasën e tij. Përpunimi i të dhënave konfidenciale të korporatës me një llogari personale është një shkelje serioze.
  • Mos skanimi i daljes. AI mund të fusë një sekret të pandryshueshëm në kod; Gjithashtu inspektoni prodhimin me skanerin sekret.
  • Nuk e kthen kur zbulon sekreti. Mos revokimi i çelësit të rrjedhur e kthen rrjedhjen në një shfrytëzim të drejtpërdrejtë.

Në përmbledhje

Rreziku më i madh i AI në softuer është rrjedhja e privatësisë dhe shumica e tij lind nga një vendim copy-paste i marrë me detyrim. Rregulli është i qartë: sekretet, të dhënat personale, asetet konfidenciale të biznesit dhe të dhënat e rregulluara nuk futen në mjete të pamiratuara. Klasifikoni të dhënat përpara hyrjes, zgjidhni agjentin sipas klasës, nxirrni sekretet, maskoni PII ose përdorni të dhëna sintetike, minimizoni kontekstin dhe skanoni gjithashtu daljen për sekrete. Nëse ka rrjedhje, gjëja e parë: ktheni kredencialin dhe raportoni atë.

Detyra e aplikimit

Merrni një pjesë të kodit/log/të dhënave që keni dhënë së fundi (ose po mendoni t’i jepni) AI. Së pari, identifikoni kandidatët sekret dhe PII brenda me shabllonin e "listës së kontrollit maskues". Më pas, nëse përmban të dhëna reale, prodhoni një version identik me shabllonin e "gjenerimit të të dhënave të testit sintetik", por plotësisht të krijuar dhe bëjeni problemin tuaj të riprodhueshëm me të. Së fundi, gjeni dhe lexoni listën e mjeteve të miratuara të institucionit tuaj dhe politikën e klasifikimit të të dhënave; Përndryshe, vini re këtë lëshim.

listë kontrolli

  • [ ] I klasifikoj të dhënat përpara se t'i fus ato (të hapura/të brendshme/konfidenciale/në varësi të rregullores).
  • [ ] Unë kurrë nuk i fut sekretet, PII dhe asetet konfidenciale të biznesit në mjete të pamiratuara.
  • [ ] Unë përdor të dhëna maskuese ose sintetike kurdoherë që është e mundur në vend të të dhënave reale.
  • [ ] Unë e reduktoj kontekstin në shembullin më të vogël që nuk përfshin pjesë të ndjeshme.
  • [ ] Unë skanoj daljen e AI për sekrete të ngulitura.
  • [ ] E di që nëse zbulohet sekreti, do t'i kthej menjëherë informacionet e identifikimit dhe do të raportoj incidentin.