Kasu:
- Võimalus tuvastada varjatud diskrimineerimist, mõistes, et eelarvamus tuleneb andmetest (ajalooline, esinduslik, mõõtmine, koondamine) ja hinnates mudelit alarühmade alusel
- Võimalus pakkuda näidiskaardiga selgitatavust, inimlikku järelevalvet ja vastutust mõjuvate otsuste tegemisel ning dokumenteerida läbipaistvust
- Võimalus hallata finants- ja keskkonnakulusid, ilma et see kahjustaks kvaliteeti väikseima sobiva mudeli, kiire lühendamise, vahemälu ja partii abil
Mudel võib tehniliselt ideaalselt töötada, kuid siiski olla vale – kui see on mõne inimese suhtes ebaõiglane, seletamatu või tekitab jätkusuutmatuid kulusid. Selles üksuses käsitleme kolme "nähtamatut", kuid otsustavat ML-tehnoloogia mõõdet: erapoolikus ja õiglus, eetika ja läbipaistvus, kulud ja jätkusuutlikkus. Need ei ole hiljem lisatud kaunistused, vaid insenerikvaliteedi lahutamatud osad.
Kust tulevad eelarvamused?
Mudeli eelarvamus (mudeli süstemaatiline kohtlemine teatud rühmade erinevalt/ebaõiglaselt) tuleneb tavaliselt andmetest, mitte mudelist. Allikad:
- Ajalooline eelarvamus: andmed peegeldavad mineviku ebaõiglust. Kui teatud rühmale on varem antud vähem krediiti, õpib nende andmete põhjal koolitatud mudel seda diskrimineerimist ja põlistab seda.
- Representation bias: mõned rühmad on andmetes alaesindatud; mudel toimib nende jaoks halvasti (nt väikese demograafilise valimi madal täpsus).
- Mõõtmise kallutatus: sildid ise on kallutatud (nt kui "hea töötaja" määratlus põhineb varasematel edutamisotsustel).
- Koondandmed: kuna andmed pärinevad kindlast kanalist, ei esinda need universumit.
Mudel ei õpi ainult neid eelarvamusi; suurendatakse seda automatiseerides. Ühe inimese erapoolik otsus mõjutab teist inimest; Erapooliku mudeli kohtuotsus on miljoneid.
Ettevaatust: ärge langege sellesse viga, et "mudel on neutraalne, sest see on lihtsalt matemaatika". Mudel õpib ja automatiseerib inimeste eelarvamusi andmetes. Neutraalsus ei ole vaikimisi, vaid tulemus, mida tuleb mõõta ja tagada.
õigluse mõõtmine
Õigluse korraldamiseks on vaja seda kõigepealt mõõta. Selleks hinnake mudelit alarühmapõhiselt: kas mõõdikud nagu täpsus, meeldetuletus, valepositiivsuse määr on erinevates demograafilistes rühmades võrdsed? Mõned õigluse mõisted:
- Grupi õiglus: kas mudel kohtleb erinevaid rühmi õigesti/valesti ja samade määradega?
- Võimaluste võrdsus: kas mudel haarab tõeliselt positiivsed kõigis rühmades võrdselt (võrdne meeldetuletus)?
Oluline fakt: erinevad õigluse definitsioonid ei pruugi samaaegselt rahuldatud olla (see on matemaatiline tagajärg). See, milline õigluse määratlus on selles kontekstis prioriteetne, on eetiline ja äriline, mitte tehniline otsus, ning tehakse koos sidusrühmadega.
Nõrk lähenemine / tugev lähenemine
Kehv: "Mudeli üldine täpsus on 88%, mis on õiglane."
Güçlü: "Üldine täpsus oli 88%, kuid kui jagasime selle alarühmadesse, oli tagasikutsumine ühes grupis 91% ja teises rühmas 67% - mudelist puudus see rühm süstemaatiliselt. Dokumenteerisime põhjuse (esindatuse puudumine), kogusime selle rühma kohta andmeid ja hindasime seda uuesti, võttes arvesse võrdse tagasikutsumise eesmärki. Otsustasime, milline õigluse definitsioon eelistab."
Erinevus: jõuline lähenemine ei peitu üldmõõdiku taha, see eraldab alarühmad ja käsitleb õiglust kui avatud otsust.
Eetika ja läbipaistvus
Vastutustundliku AI põhiprintsiibid on järgmised:
- Seletatavus: kas on võimalik selgitada, miks mudel sellise otsuse tegi? Suure mõjuga otsuste puhul (krediit, töölevõtmine, tervishoid) on õigus selgitusele. Seletamatut mudelit ei tohiks nendes valdkondades kasutada või seda tuleks toetada seletatava meetodiga.
- Inimjärelevalve: suure mõjuga otsuseid ei tohiks teha automaatselt; Mudel soovitab, inimene kinnitab.
- Vastutus: peaks olema selge, kes vastutab, kui mudel teeb vea. "Modell otsustas" ei ole vabandus.
- Läbipaistvus: kasutaja peaks teadma, et ta suhtleb tehisintellektiga ja kuidas nende andmeid kasutatakse.
Paljudes riikides ja sektorites on need põhimõtted juurutatud ka õigusaktidesse (läbipaistvus, auditeerimine ja inimjärelevalve kohustused kõrge riskiga tehisintellektisüsteemide puhul). Insener vastutab oma valdkonna eeskirjade tundmise eest.
Näpunäide: hoidke iga suure mõjuga mudeli jaoks "mudelikaarti": mida mudel teeb, milliste andmete põhjal seda koolitati, kui hästi/halvasti see millistes rühmades töötab, millised on selle teadaolevad piirangud. See dokument on nii läbipaistvuse kui ka vastutuse vahend.
Kulud ja jätkusuutlikkus
AI pole odav. Kulusid juhitakse kahes mõõtmes:
Finantskulud:
- Token kulu (LLM): iga päring ja vastus maksab märgid; Kui maht kasvab, kasvab arve. Tarbetult pikad viibad, liiga suur mudelivalik ja kontrollimatud agenditsüklid (üksus 5) suurendavad kulusid.
- Koolitus ja hostimine: peenhäälestus ja mudeliesitlus põhjustavad riistvarakulusid.
- Optimeerimine: ärge kasutage suurt mudelit, kui väikesest mudelist piisab; vahemällu korduma kippuvad küsimused; lühendage viipa; Partii, mida saab töödelda.
Keskkonnakulud: suur mudelikoolitus ja järeldused kulutavad märkimisväärselt energiat. Jätkusuutlikkus muudab tarbetute arvutuste vältimise (õige suurusega mudel, tõhus arhitektuur) professionaalseks kohustuseks.
Näpunäide: kulude optimeerimise esimene reegel: "Milline on selle töö jaoks väikseim piisav mudel?" Kõige võimsama mudeli panemine kõikjale on nagu naela löömine haamriga — kallis ja mittevajalik.
kolm minikarpi
1. juhtum – varjatud diskrimineerimine. Värbamiskontrolli mudel nägi üldiselt hea välja. Alarühma analüüs näitas, et mudel rõhutas süstemaatiliselt naiskandidaate, kuna ajaloolistes andmetes domineerisid mehed - see oli õppinud ajaloolist eelarvamust. Mudel peatati, andmed tasakaalustati ja õigluse mõõdikuid jälgiti. Üldine õiglus varjas varjatud diskrimineerimist.
2. juhtum – seletamatu tagasilükkamine. Krediidimudel lükkas taotlusi tagasi, kuid keegi ei osanud selgitada, miks. Kui klient taotles juriidilist selgitust, ei saanud meeskond vastata. Mudel eemaldati suure mõjuga otsuste tegemisel seni, kuni lisati seletatav meetod ja iga tagasilükkamise kohta tehti põhjendus. Õppetund: selgitatavus on suure mõjuga otsuste tegemisel hädavajalik.
Juhtum 3 – arve šokk. Üks meeskond kasutas suurimat LLM-i ja iga päringu jaoks väga pikki viipasid. Igakuine arve on ootamatult kasvanud. Postituste analüüs: enamikku päringuid sai lahendada väikese mudeliga, pooled viipadest olid üleliigsed ja sagedased küsimused sai vahemällu salvestada. Need kolm optimeerimist vähendasid oluliselt kulusid, ilma et see kahjustaks kvaliteeti. Õppetund: kõige võimsam mudel pole kõikjal vajalik.
Kopeeritavad mallid
Aidake mul hinnata selle mudeli erapoolikust/õiglust. Milliseid alarühmi (demograafiline/segment) peaksin jagama ja mõõtma? Milliseid mõõdikuid (täpsus, meeldetuletus, valepositiivsuse määr rühmade kaupa) peaksin võrdlema? Kas erinevad õigluse määratlused võivad olla vastuolus, mida peaksin selles kontekstis eelistama ja miks? Mudeli/otsuse kontekst: [selgitus]
Koostage selle võimsa mudeli jaoks mudelikaardi mustand. Peaks sisaldama: eesmärki, koolituse andmeid ja kuupäeva, jõudlust alarühmades, teadaolevaid piiranguid, asjakohast/sobimatut kasutamist, seletatavust, inimese järelevalvet. Mudel: [kirjeldus]
Aidake mul selle LLM-i juurutamise kulusid vähendada kvaliteeti kahjustamata.Saadaval: mudeli suurus, keskmine viiba pikkus, päringu maht, kas vahemälu on olemas?Hinda:1) Kas väiksemast mudelist piisab (milliste ülesannete jaoks)?2) Kas viipa saab lühendada?3) Kas sagedasi päringuid saab vahemällu salvestada?4) Kas partii jaoks on tööd saadaval? Kirjutage üles iga soovituse hinnanguline mõju.
Koostage selle suure mõjuga otsustussüsteemi jaoks eetika/vastutuse kontrollnimekiri.- Seletatavus: kas otsust saab põhjendada?- Inimjärelevalve: kas suure mõjuga otsus tuleb kinnitada?- Vastutus: kes vastutab vea korral?- Läbipaistvus: kas kasutaja teab, et AI-d kasutatakse?- Regulatsioon: millised on sellega kaasnevad juriidilised kohustused: [kirjeldus]
Eelarvamuste lähtetabel
Allikas
sümptom
ettevaatusabinõu
ajalooline eelarvamus
Mineviku diskrimineerimine jätkub
Andmete audit + õigluse mõõdik
esinduse eelarvamus
Madal täpsus väikeses proovirühmas
Alagrupi analüüs + tasakaalustamine
mõõtmise eelarvamus
kallutatud sildid
Märgistusprotsessi ülevaatus
Agregatsiooni eelarvamus
Universum ei ole esindatud
Ressursside mitmekesistamine
Levinud vead
- Toetudes üldisele mõõdikule. Varjatud diskrimineerimist ei saa näha ilma alarühmade analüüsita.
- Eeldusel "mudel neutraalne". Mudel õpib ja võimendab andmete kallutatust.
- Suure mõjuga otsuse jätmine seletamatu mudeli hooleks. Juriidiline ja eetiline risk.
- Inimese järelevalvest möödahiilimine. "Modell otsustas" ei ole vabandus.
- Pannes kõikjale suurima mudeli. Tarbetud kulud ja energia.
- Ei jälgi kulusid. Arve paisub vaikselt.
Kokkuvõttes
Tehniliselt korrektne mudel on ikkagi läbikukkumine, kui see pole õiglane, seletatav ja jätkusuutlik. Eelarvamus tuleneb enamasti andmetest ja mudel suurendab seda skaalal; Mõõtke õiglust alarühmade kaupa ja leppige sidusrühmadega kokku, millist õigluse määratlust eelistada. Suure mõjuga otsuste puhul on oluline seletatavus, inimlik järelevalve ja vastutus; Dokumendi läbipaistvus mudelikaardiga. Kulude ja energia haldamine: valige väikseim sobiv mudel, lühendage viipa, kasutage vahemälu ja partii. Need mõõtmed on insenerikvaliteedi lahutamatud osad, mitte hiljem lisatavad satsid.
Rakenduse ülesanne
Jagage mudel vähemalt kahte alarühma ja võrrelge tagasikutsumise ja valepositiivsuse määra rühmade kaupa; Kui on oluline erinevus, kirjutage põhjus ja ettevaatusabinõu. Koostage suure mõjuga mudeli jaoks lühike mudelikaart (eesmärk, andmed, alarühma jõudlus, piirid, seletatavus). Tehke kindlaks vähemalt kaks konkreetset optimeerimist (minimaalne / kiire kärpimine / vahemälu / partii), et vähendada LLM-i juurutamise kulusid, ja kirjutage üles nende hinnanguline mõju.
kontrollnimekiri
- [ ] Hindasin mudelit alarühmade alusel, üldmeetriale ma ei tuginenud.
- [ ] Otsustasin koos huvirühmadega, millist õigluse määratlust eelistan.
- [ ] Suure mõjuga otsus on seletatav ja vajab inimeste heakskiitu.
- [ ] Läbipaistvuse ja piirid dokumenteerisin mustrikaardiga.
- [ ] Valisin väikseima adekvaatse mudeli; Optimeerisin viipa / vahemälu / partii.
- [ ] Jälgin kulusid ja energiamõju.