Fitimet:
- Të jesh në gjendje të dallosh se ku në rrjedhën e punës ML (kodi, të dhëna, dokument) inteligjenca artificiale kursen kohë me rrezik të ulët dhe ku vendimet si metrika / të dhënat / vënia në prodhim i lihen njeriut, sipas nivelit të rrezikut të detyrës.
- Aftësia për të aplikuar një disiplinë që verifikon çdo dalje të AI duke e lidhur atë me burimin, duke e ridrejtuar, duke e matur dhe duke e kaluar përmes një filtri inxhinierik.
- Aftësia për të fituar zakonin për të mos dërguar të dhëna të papërpunuara konfidenciale dhe personale në mjete të jashtme, duke përdorur mjete të miratuara nga korporata dhe për të trajtuar çështjet e sigurisë vetëm për qëllime mbrojtëse.
Inteligjenca Artificiale në Inxhinierinë e Mësimit të Makinerisë: Roli, Kufijtë, Validimi dhe Përgjegjësia
Një inxhinier i mësimit të makinerive (inxhinier ML: një profesionist softuerësh që dizajnon, trajnon dhe sjell modele që mësojnë nga të dhënat në prodhim) sot punon me një mjet tjetër të inteligjencës artificiale në çdo hap të punës së tij. Një asistent kodimi është në fuqi kur shkruan kod, një model bisede kur eksploron të dhëna dhe një model i madh gjuhësor (LLM: një rrjet nervor me miliarda parametra që kupton dhe prodhon tekst) kur prodhon dokumentacion. Ky modul e konsideron inteligjencën artificiale si produktin e zhvilluar dhe mjetin e punës së përditshme të një inxhinieri ML. Ajo funksionon duke përcaktuar qartë kufijtë e përgjegjësisë pa i përzier dy rolet.
Në këtë njësi të parë, ne i përgjigjemi pyetjes themelore: Ku në inxhinierinë ML kursen inteligjenca artificiale kohë reale dhe ku duhet t'ia lëmë vendimin njerëzve? Përgjigja është në qendër të disiplinës inxhinierike: ai që bën është i shpejtë, ai që verifikon është përgjegjës.
Ku vjen në ndihmë inteligjenca artificiale në inxhinierinë ML?
Një projekt ML kalon afërsisht në linjat e mëposhtme: mbledhja e të dhënave, pastrimi i të dhënave, inxhinieria e veçorive (përkthimi i të dhënave të papërpunuara në sinjale dixhitale që modeli mund t'i kuptojë), trajnimi i modelit, vlerësimi, vendosja (shpërndarja: hapja e modelit tek përdoruesi i vërtetë) dhe monitorimi. AI ndihmon në çdo ndalesë në këtë linjë, por niveli i autoritetit të saj ndryshon.
Fushat me shpërblim të lartë dhe me rrezik të ulët: prodhimi i një skeleti kodi, hartimi i një funksioni të transformimit të të dhënave, interpretimi i mesazheve të regjistrit, përshkrimi i një gjurme të pirgut, përmbledhja e shënimeve të eksperimentit, shkrimi i dokumentacionit dhe READMEs, propozimi i një rasti testimi. Këtu, gabimet e inteligjencës artificiale janë të lira; sepse rezultati tashmë do të kalojë përmes testimit dhe rishikimit.
Fushat me rrezik të lartë: vendosja se cilat të dhëna shkojnë në trajnim, konfirmimi nëse një model duhet të hyjë në prodhim, gjykimi i një metrike është "mjaft i mirë", vendimi për të përpunuar të dhënat personale, mbyllja e një cenueshmërie sigurie si "junk". Këto ndikojnë paratë, privatësinë, përgjegjësinë ligjore dhe besimin e përdoruesit. Inteligjenca artificiale jep sugjerime këtu; Vendimi merret nga inxhinieri kompetent dhe ekipi përgjegjës.
Këshillë: Përpara se të transferoni një detyrë tek AI, pyesni: "Sa është kostoja nëse ky rezultat është i gabuar dhe sa lehtë do ta kapë dikush gabimin?" Nëse çmimi është i ulët dhe kapja është e lehtë, kaloni atë. Nëse çmimi është i lartë ose kapja është e vështirë, përdorni AI vetëm për draftin dhe ju vendosni.
Disiplina e verifikimit: tre hapa
Në inxhinierinë ML, prodhimi i AI nuk është kurrë një "punë e përfunduar"; Është një draft. Kryeni çdo dalje përmes këtyre tre hapave:
- Lidheni atë me burimin. Nëse modeli tha një numër, një prag ose një "praktikë më të mirë", bazoje atë në dokumentacionin zyrtar, vlerën aktuale në bazën e kodit ose një metrikë të matur. "Përshtatja e modelit" (halucination: prodhimi i sigurt i informacionit jo-real nga modeli gjuhësor) më së shpeshti kapet këtu.
- Rinisni dhe matni. Ekzekutoni kodin e krijuar, rillogaritni metrikën që prodhon në grupin tuaj të provës, vërtetoni pyetjen e propozuar SQL në një mostër të vogël. Kodi që nuk funksionon është i pavlefshëm, edhe nëse duket bukur.
- Kaloni atë përmes një filtri inxhinierik. A qëndron prodhimi në shkallë? A janë marrë parasysh rastet e skajeve (të dhëna boshe, hyrje shumë e madhe, fusha që mungojnë)? A ka shkelje të sigurisë dhe privatësisë? Vetëm një person që e njeh fushën mund ta bëjë këtë hap.
Prompt i dobët / Prompt i fortë
Prompt i dobët: "Më shkruaj një kod model trajnimi."
Prompt i fuqishëm: "Shkruani një skript trajnimi për klasifikimin binar me scikit-learn. Hyrja: data/train.parquet, kolona e synuar is_churn. Ka një çekuilibër të klasës (norma pozitive ~8%), trajtojeni atë me class_weight. Përdor PR-AUC (zona nën kurbën e saktësisë. kujtesa), sepse fiksimi i saktësisë është i pabalancuar për vlerësimin e saktësisë. fara e rastësishme në 42. Provoni në fund të setit të printimit të kodit PR-AUC."
Dallimi: detyra e dytë e shpejtë përmban të vërtetën e të dhënave, metrikën e saktë, informacionin e çekuilibrit dhe kërkesën e përsëritshmërisë. Nga ky kontekst, produkti është i verifikueshëm dhe i përdorshëm.
Privatësia dhe siguria e të dhënave: përgjegjësia e parë e inxhinierit
Inxhinieri ML shpesh prek të dhënat më të ndjeshme të kompanisë: të dhënat e klientëve, historia e transaksioneve, të dhënat shëndetësore ose financiare, regjistrat e sistemeve të prodhimit. Tre rregulla kur jepni të dhëna për mjetet e inteligjencës artificiale:
- Mos dërgoni të dhëna të papërpunuara personale dhe konfidenciale në mjete të jashtme. Për shembull, në vend që të ngjitni emailet e klientëve në kërkesë, dërgoni skemën dhe mostrat e rreme (sintetike). Përdorni shembull të maskuar si "psh: ahmet@example.com" në vend të të dhënave reale.
- Përdorni automjete të miratuara nga korporata. Zgjidhni mjete që janë të qarta kontraktualisht se ku përpunohen të dhënat, nëse ruhen, nëse përdoren për edukim apo jo. Përpunimi i të dhënave të korporatës me një llogari personale është një shkelje në shumicën e kompanive.
- Politika minimale e të dhënave. Jepni kontekstin minimal të nevojshëm për të zgjidhur detyrën. Jo e gjithë tabela, por 5 kolonat dhe skema përkatëse.
Kujdes: Supozoni se teksti që i jepni një modeli gjuhësor nuk mund të zhbëhet. Mos dërgoni të dhëna personale të papërpunuara me mendimin "do t'i fshij më vonë"; Rreziku ka ndodhur në momentin e dërgimit.
Përdorimi mbrojtës në fushën e sigurisë
Inxhinierët ML shpesh instalojnë sisteme sigurie: zbulimin e mashtrimit, klasifikimin e trafikut me qëllim të keq, vërtetimin. Gjatë gjithë këtij moduli, ne mbulojmë çështjet e sigurisë vetëm për qëllime mbrojtëse: zbulimin e sulmit, forcimin e sistemit, mbylljen e cenueshmërisë. Përdorimi i inteligjencës artificiale për akses të paautorizuar, rrjedhje të dhënash ose ndërhyrje të paautorizuar në sistemin e dikujt tjetër është i paligjshëm dhe kundër etikës profesionale. Kur gjeni një cenueshmëri, mënyra e duhur është ta raportoni atë me përgjegjësi dhe ta rregulloni; të mos shfrytëzojë.
tre mini kuti
Rasti 1 - Koha e kursyer. Një inxhinier ML normalisht do të kalonte gjysmë dite duke bërë analizën e të dhënave eksploruese (EDA) të një grupi të dhënash me 40 kolona. Ai i dha skemën dhe daljen df.describe() për inteligjencën artificiale dhe pyeti: "Cilat kolona kanë një shkallë të lartë të jashtme dhe të humbur, cilat transformime rekomandoni?" Në 20 minuta, ai mori një listë me prioritet, duke verifikuar çdo artikull me kodin e tij. Kurseni: ~ 3 orë, rrezik i ulët gabimi sepse matet çdo pretendim.
Rasti 2 - Gabim i kapur. "Saktësia e trajnimit është 99%, e shkëlqyeshme," tha modelja një asistent chat. Inxhinieri aplikoi hapin e tretë (filtri inxhinierik) dhe kuptoi: kolona e synuar kishte rrjedhur aksidentalisht atribute (rrjedhja e të dhënave: modeli sheh informacionin që nuk duhet të shohë në trajnim). Performanca aktuale ishte shumë më e ulët. Skepticizmi i inxhinierit, jo interpretimi "i mrekullueshëm" i AI, e shpëtuan punën.
Rasti 3 - Parandalimi i shkeljes së privatësisë. Një ekip po ngjitte regjistrat e gabimit të prodhimit në një model të jashtëm dhe po thoshte "rregullo këtë gabim". Në regjistra kishte numra identifikimi të klientit. Ekipi vendosi një rregull për të shkruar një skrip të vogël që maskon fillimisht regjistrat (duke i bërë numrat e tyre ID ***) dhe i dërgon në atë mënyrë. Rreziku i shkeljes është zhdukur, shpejtësia e ndihmës nuk ka ndryshuar.
Modele të kopjueshme
Detyra: [çfarë duhet bërë, fjali e vetme] Konteksti: [skema e të dhënave, madhësia, kufizimet; JO TË DHËNA AKTUALE personale] Kufizimet: [gjuha/biblioteka, performanca, riprodhueshmëria] Metrikat: [si të matet suksesi] Prodhimi i dëshiruar: [kodi/përshkrimi/lista] dhe pse në këtë format
Shikoni këtë kod. Vlerësoni jo vetëm që funksionon, por edhe për sa i përket: 1) rasteve të skajeve (hyrje bosh, kolonë që mungon, të dhëna shumë të mëdha) 2) Rreziku i rrjedhjes së të dhënave3) Riprodhueshmëria (seed, version) Sugjeroni rregullime për çdo problem që gjeni. Shënoni "verifikoni" aty ku nuk jeni të sigurt. Kodi: [kodi]
Interpretoni rezultatin e kësaj metrike, por fillimisht pyesni: a është kjo metrikë e saktë për këtë problem? Problemi: [klasifikimi i balancuar/i pabalancuar, regresioni, renditja...]Metrika dhe vlera e raportuar: [p.sh. saktësia 0.99]Cilën metrikë do të rekomandonit dhe pse, dhe cilat shenja duhet të kërkoj që të më bëjnë të dyshoj për rezultatin aktual?
Kontrolloni nëse ka informacion personal/konfidencial në të dhënat që do t'i jap urdhrit të mëposhtëm. Rendisni fushat (emri, e-mail, numri ID, telefoni, adresa) që duhet të maskohen në tekstin e mëposhtëm. Teksti: [tekst]
Tabela e rolit dhe autoritetit
Kërkimi
Roli i inteligjencës artificiale
Pronari i vendimit
Skeleti i kodit / funksioni i transformimit
gjenerator drafti
Inxhinier (vlerësime)
EDA / përmbledhje e të dhënave
përshpejtues
Inxhinier (verifikon duke matur)
Interpretimi metrikë
Sugjerim
inxhinier
Cilat të dhëna do të futen në trajnim?
Sugjerim
Ekipi + zotëruesi i të dhënave
Vëreni modelin në prodhim
Përkujtues i listës së kontrollit
Inxhinier përgjegjës + ekip
Përpunimi i të dhënave personale
Asnjë (nuk përdoret)
Legal + kontrollues i të dhënave
Gabimet e zakonshme
- Përdorimi i daljes pa e vërtetuar atë. Gabimi më i zakonshëm dhe më i shtrenjtë. Kodi ose metrika që duket bukur nuk do të thotë se është e saktë.
- Ngjitja e të dhënave të papërpunuara konfidenciale në mjet. Pasi të dërgohet, nuk mund të merret përsëri.
- Duke u mbështetur në metrikën e gabuar. Metrikat e papajtueshme si saktësia në të dhënat e pabalancuara dhe RMSE në problemet e renditjes janë mashtruese.
- Gabimi i inteligjencës artificiale si vendimmarrës. Ai jep sugjerime; Përgjegjësia i takon nënshkruesit.
- Prompt pa kontekst. Kërkesat e paqarta të tilla si "shkruani një model" prodhojnë rezultate të paverifikueshme.
Në përmbledhje
Inteligjenca artificiale është edhe produkti i zhvilluar nga inxhinieri ML dhe replikuesi i tij ditor. Vlera e tij është më e larta në detyrat me rrezik të ulët dhe lehtësisht të verifikueshme si kodi-data-dokumenti; Vendimet që prekin paratë, privatësinë dhe sigurinë mbeten me personin. Lidhni çdo dalje me burimin, matni përsëri, kaloni përmes filtrit inxhinierik. Mbroni të dhënat konfidenciale, përdorni automjete të miratuara, punoni në siguri vetëm për qëllime mbrojtëse. Kjo disiplinë është baza për të gjitha njësitë pasuese.
Detyra e aplikimit
Zgjidhni një detyrë nga projekti juaj (p.sh. shkrimi i një funksioni të pastrimit të të dhënave). Fillimisht shkruani një kërkesë të dobët, më pas shkruani një kërkesë të fortë duke përdorur shabllonin në këtë njësi. Merrni të dy rezultatet, aplikoni verifikimin me tre hapa (lidhja me burimin, riprodhimi, filtri inxhinierik). Vini re se cila kërkesë kursen sa minuta dhe sa korrigjime.
listë kontrolli
- [ ] Unë kam përcaktuar nivelin e rrezikut (të ulët/të lartë) të detyrës sime.
- [ ] Nuk kam vendosur asnjë të dhënë reale personale/konfidenciale në kërkesë; E maskova ose përdora një mostër sintetike.
- [ ] E lidha daljen me burimin, e drejtova përsëri, e filtrova nga një këndvështrim inxhinierik.
- [ ] Kontrollova që zgjodha metrikën e saktë.
- [ ] Vendimin kritik (vënia në prodhim, përpunimi i të dhënave) e mora vetë/me ekipin, nuk ia lashë inteligjencës artificiale.
- [ ] Kam përdorur një automjet të miratuar nga korporata.