Üksus 1 / 11

Tehisintellekt ML-tehnoloogias: roll, piirid, valideerimine ja vastutus

Kasu:

  • Oskus teha vahet, kus ML-i töövoos (kood, andmed, dokument) säästab tehisintellekt madala riskiga aega ja kus jäetakse sellised otsused nagu mõõdik/andmed/tootmine inimese teha, vastavalt ülesande riskitasemele.
  • Võimalus rakendada distsipliini, mis kontrollib iga tehisintellekti väljundit, ühendades selle allikaga, käivitades selle uuesti, mõõtes seda ja juhtides selle läbi insenerifiltri.
  • Võimalus omandada harjumus mitte saata toores konfidentsiaalseid ja isikuandmeid välistele tööriistadele, kasutada ettevõtte heakskiidetud tööriistu ja käsitleda turvaprobleeme ainult kaitseotstarbel.

Tehisintellekt masinõppetehnikas: roll, piirid, valideerimine ja vastutus

Masinõppeinsener (ML-insener: tarkvaraprofessionaal, kes projekteerib, koolitab ja toob andmetest õppivaid mudeleid tootmisse) töötab tänapäeval igal oma tööetapil teise tehisintellekti tööriistaga. Kodeerimisassistent on kasutusel koodi kirjutamisel, vestlusmudel andmete uurimisel ja suur keelemudel (LLM: miljardite parameetritega närvivõrk, mis mõistab ja toodab teksti) dokumentatsiooni koostamisel. See moodul käsitleb tehisintellekti nii arendatud tootena kui ka ML-inseneri igapäevase töövahendina. See toimib selgelt piiritledes vastutuse piirid, segamata kahte rolli.

Selles esimeses tükis vastame põhiküsimusele: kus ML-tehnikas säästab tehisintellekt reaalaega ja kus me peame jätma selle otsustamise inimeste hooleks? Vastus on inseneridistsipliini keskmes: see, kes teeb, on kiire, see, kes kontrollib, vastutab.

Kus tuleb tehisintellekt ML-tehnoloogias kasuks?

ML-projekt läbib laias laastus järgmisi ridu: andmete kogumine, andmete puhastamine, funktsioonide projekteerimine (toorandmete tõlkimine digitaalseteks signaalideks, mida mudel suudab mõista), mudeli koolitus, hindamine, juurutamine (juurutamine: mudeli avamine tegelikule kasutajale) ja jälgimine. AI aitab sellel liinil igas peatuses, kuid selle volituste tase on erinev.

Suure tasuga ja madala riskitasemega valdkonnad: koodiskeleti koostamine, andmete teisendusfunktsiooni koostamine, logiteadete tõlgendamine, virnajälje kirjeldamine, eksperimendi märkmete kokkuvõtte tegemine, dokumentatsiooni ja README kirjutamine, testjuhtumi pakkumine. Siin on tehisintellekti vead odavad; sest väljund läbib juba testimise ja ülevaatuse.

Kõrge riskiga valdkonnad: otsustamine, millised andmed koolitusse lähevad, kinnitamine, kas mudel peaks tootmisse minema, mõõdiku hindamine "piisavalt hea", otsus töödelda isikuandmeid, turvaaukude sulgemine kui "rämps". Need mõjutavad raha, privaatsust, juriidilist vastutust ja kasutajate usaldust. Tehisintellekt annab siin ettepanekuid; Otsuse teevad pädev insener ja vastutav meeskond.

Näpunäide. Enne ülesande allhanke tegemist tehisintellektile küsige: "Mis maksab, kui see väljund on vale, ja kui kergesti keegi veast aru saab?" Kui hind on madal ja püüdmine on lihtne, anna see edasi. Kui hind on kõrge või jäädvustamine keeruline, kasutage tehisintellekti ainult mustandi jaoks ja otsustate.

Kontrollimise distsipliin: kolm sammu

ML-tehnikas ei ole AI väljund kunagi "valmis töö"; See on mustand. Käivitage iga väljund kolme sammu kaudu:

  1. Ühendage see allikaga. Kui mudel ütles arvu, läve või „parimat tava”, põhine see ametlikul dokumentatsioonil, koodibaasi tegelikul väärtusel või mõõdetud mõõdikul. Siin tabatakse kõige sagedamini “mudeli sobitamist” (hallutsinatsioon: mittereaalse teabe enesekindel tootmine keelemudeli abil).
  2. Taaskäivitage ja mõõtke. Käivitage loodud kood, arvutage uuesti selle loodud mõõdik teie enda testikomplektis, kinnitage pakutud SQL-päring väikese valimi puhul. Kood, mis ei tööta, on väärtusetu, isegi kui see näeb kena välja.
  3. Laske see läbi insenerifiltri. Kas väljund peab skaalal vastu? Kas äärejuhtumeid (tühjad andmed, väga suur sisend, puuduvad väljad) on arvesse võetud? Kas on turvalisuse ja privaatsuse rikkumine? Selle sammuga saab hakkama vaid valdkonda tundev inimene.

Nõrk viip / Tugev viip

Nõrk viip: "Kirjutage mulle modellikoolituse kood."

Võimas viip: "Kirjutage scikit-learni abil binaarseks klassifikatsiooniks treeningskript. Sisend: data/train.parquet, sihtveerg is_churn. Klassi tasakaalustamatus (positiivne määr ~8%), käsitlege seda väärtusega class_weight. Kasutage PR-AUC-d (täpsus-meelekutsumise kõvera alune pindala), kuna accurading andmetricy on. juhuslik seeme 42-ni. Testige kooditrükikomplekti PR-AUC lõpus."

Erinevus: teine ​​viipülesanne sisaldab andmete tõesust, õiget mõõdikut, tasakaalustamatust ja korratavuse nõuet. Sellest kontekstist lähtudes on väljund kontrollitav ja kasutatav.

Privaatsus ja andmete turvalisus: inseneri esimene vastutus

ML-i insener puudutab sageli ettevõtte kõige tundlikumaid andmeid: kliendikirjeid, tehingute ajalugu, tervise- või finantsandmeid, tootmissüsteemide logisid. Kolm reeglit tehisintellekti tööriistadele andmete esitamisel:

  • Ärge saatke tooreid isiku- ja konfidentsiaalseid andmeid välistele tööriistadele. Näiteks kliendi meilide viipale kleepimise asemel saatke skeem ja näidised (sünteetilised). Kasutage tegelike andmete asemel maskeeritud näidet, näiteks "ex: ahmet@example.com".
  • Kasutage ettevõtte heakskiidetud sõidukeid. Valige tööriistad, millel on lepinguliselt selge, kus andmeid töödeldakse, kas neid hoitakse, kas neid kasutatakse hariduses või mitte. Ettevõtte andmete töötlemine isikliku kontoga on enamikus ettevõtetes rikkumine.
  • Minimaalne andmepoliitika. Andke ülesande lahendamiseks vajalik minimaalne kontekst. Mitte kogu tabel, vaid vastavad 5 veergu ja skeem.
Ettevaatust. Oletagem, et keelemudelile antud teksti ei saa tagasi võtta. Ärge saatke tooreid isikuandmeid, mõeldes "hiljem kustutan"; Risk tekkis selle saatmise hetkel.

Kaitsekasutus turvalisuse valdkonnas

ML-i insenerid paigaldavad sageli turvasüsteeme: pettuste tuvastamine, pahatahtliku liikluse klassifitseerimine, autentimine. Kogu selle mooduli jooksul käsitleme turbeprobleeme ainult kaitseotstarbel: rünnaku tuvastamine, süsteemi tugevdamine, haavatavuse sulgemine. Tehisintellekti kasutamine volitamata juurdepääsuks, andmete lekkimiseks või volitamata sekkumiseks kellegi teise süsteemi on nii ebaseaduslik kui ka kutse-eetikaga vastuolus. Kui leiate haavatavuse, on õige viis sellest vastutustundlikult teatada ja see parandada; mitte ära kasutama.

kolm minikarpi

Juhtum 1 – Aega säästetud. ML-insener veedab tavaliselt pool päeva 40-veerulise andmekogumi uurimusliku andmeanalüüsi (EDA) tegemisel. Ta andis tehisintellektile skeemi ja df.describe() väljundi ning küsis: "Millistel veergudel on kõrge kõrvalekalle ja puudujääk, milliseid teisendusi te soovitate?" 20 minuti pärast sai ta prioriteetse nimekirja, kontrollides iga üksust oma koodiga. Säästa: ~3 tundi, väike vearisk, kuna iga kahjunõue mõõdetud.

Juhtum 2 – ilmnes viga. "Treeningu täpsus on 99%, suurepärane," ütles modell vestlusassistendile. Insener rakendas kolmanda sammu (insenerifilter) ja mõistis: sihtveerus olid kogemata atribuudid lekkinud (andmete leke: mudel näeb teavet, mida ta koolitusel nägema ei peaks). Tegelik jõudlus oli palju madalam. Töö päästis inseneri skeptitsism, mitte AI "suurepärane" tõlgendus.

3. juhtum – privaatsuse rikkumise ennetamine. Meeskond kleepis tootmistõrke logid välisesse mudelisse ja ütles "paranda see viga". Logides olid klientide identifitseerimisnumbrid. Meeskond kehtestas reegli kirjutada väike skript, mis esmalt varjab logid (teeb nende ID-numbrid ***) ja saadab need sel viisil. Rikkumise oht on kadunud, abistamise kiirus pole muutunud.

Kopeeritavad mallid

Ülesanne: [mida teha, üks lause]Kontekst: [andmeskeem, suurus, piirangud; TEGELIKUID isikuandmeid EI PUUDUV

Vaadake seda koodi. Hinnake mitte ainult selle toimimist, vaid ka järgmistes aspektides: 1) servajuhtumid (tühi sisend, puuduv veerg, väga suured andmed) 2) andmete lekke oht3) reprodutseeritavus (seeme, versioon) Soovitage iga leitud probleemi jaoks lahendusi. Märkige "kinnita", kui te pole kindel. Kood: [kood]

Tõlgendage selle mõõdiku tulemust, kuid küsige esmalt: kas see mõõdik on selle probleemi jaoks õige?Probleem: [tasakaalustatud/tasakaalustamata klassifikatsioon, regressioon, järjestus...]Aruandes esitatud mõõdik ja väärtus: [nt. täpsus 0,99]Millist mõõdikut soovitaksite ja miks ning milliseid märke peaksin otsima, et ma praeguses tulemuses kahtleksin?

Kontrollige, kas andmetes on isiklikku/konfidentsiaalset teavet, mille annan järgmisele viipale. Loetlege allolevas tekstis väljad (nimi, e-post, ID number, telefon, aadress), mida tuleb maskeerida. Tekst: [tekst]

Rollide ja volituste tabel

Quest

Tehisintellekti roll

Otsuse omanik

Koodi skelett / teisendusfunktsioon

tõmbegeneraator

Insener (arvustused)

EDA / andmete kokkuvõte

kiirendi

Insener (kontrollib mõõtmisega)

Meetriline tõlgendus

Soovitus

insener

Millised andmed lähevad koolitusse?

Soovitus

Meeskond + andmete omanik

Pange mudel tootmisse

Kontrollnimekirja meeldetuletus

Vastutav insener + meeskond

Isikuandmete töötlemine

Puudub (pole kasutatud)

Juriidiline + andmetöötleja

Levinud vead

  • Väljundi kasutamine ilma seda kinnitamata. Kõige tavalisem ja kallim viga. Kood või mõõdik, mis näeb hea välja, ei tähenda, et see on õige.
  • Konfidentsiaalsete töötlemata andmete kleepimine tööriista. Pärast saatmist ei saa seda tagasi võtta.
  • Tuginedes valele mõõdikule. Ühildumatud mõõdikud, nagu tasakaalustamata andmete täpsus ja järjestamisprobleemide RMSE, on eksitavad.
  • Tehisintellekti eksitus otsustajana. Ta annab soovitusi; Vastutus lasub allkirjastajal.
  • Kontekstita viip. Mitmetähenduslikud taotlused, nagu "mudel kirjutamine", annavad kontrollimatu väljundi.

Kokkuvõttes

Tehisintellekt on nii ML-i inseneri välja töötatud toode kui ka selle igapäevane replikaator. Selle väärtus on kõrgeim madala riskitasemega, kergesti kontrollitavate ülesannete puhul, nagu kood-andmed-dokument; Raha, privaatsust ja turvalisust mõjutavad otsused jäävad inimese enda teha. Ühendage iga väljund allikaga, mõõtke uuesti, laske läbi insenerifiltri. Kaitske konfidentsiaalseid andmeid, kasutage heakskiidetud sõidukeid, töötage turvalisuses ainult kaitseotstarbel. See distsipliin on kõigi järgnevate üksuste aluseks.

Rakenduse ülesanne

Valige oma projektist ülesanne (nt andmete puhastamise funktsiooni kirjutamine). Esmalt kirjutage nõrk viip, seejärel kirjutage tugev viip, kasutades selles üksuses olevat malli. Võtke mõlemad väljundid, rakendage kolmeastmeline kinnitamine (link allikale, korduskäivitamine, insenerifilter). Pange tähele, milline viip salvestab mitu minutit ja kui palju parandusi.

kontrollnimekiri

  • [ ] Olen määranud oma ülesande riskitaseme (madal/kõrge).
  • [ ] Ma ei lisanud viipale tegelikke isikuandmeid/konfidentsiaalseid andmeid; Ma maskeerisin selle või kasutasin sünteetilist proovi.
  • [ ] Ühendasin väljundi allikaga, käivitasin selle uuesti, filtreerisin selle inseneri vaatenurgast.
  • [ ] Kontrollisin, kas valisin õige mõõdiku.
  • [ ] Kriitilise otsuse (tootmisse laskmine, andmetöötlus) tegin ise/koos meeskonnaga, tehisintellekti hooleks ei jätnud.
  • [ ] Kasutasin ettevõtte heakskiidetud sõidukit.