Enota 10 / 11

Pristranskost, etika in stroški: odgovorno in trajnostno inženirstvo umetne inteligence

Dobički:

  • Sposobnost odkrivanja prikrite diskriminacije z razumevanjem, da pristranskost izvira iz podatkov (zgodovinskih, reprezentativnih, meritev, združevanja) in vrednotenja modela na podlagi podskupin
  • Sposobnost zagotavljanja razložljivosti, človeškega nadzora in odgovornosti pri odločitvah z velikim vplivom ter preglednosti dokumentov z modelno kartico
  • Sposobnost obvladovanja finančnih in okoljskih stroškov brez ogrožanja kakovosti z najmanjšim ustreznim modelom, takojšnjim skrajšanjem, predpomnilnikom in serijo

Model lahko tehnično deluje popolno, vendar je še vedno napačen - če je nepravičen do nekaterih ljudi, nerazložljiv ali povzroča nevzdržne stroške. V tej enoti pokrivamo tri "nevidne", a odločilne razsežnosti inženiringa ML: pristranskost in poštenost, etičnost in preglednost, stroške in trajnost. To niso kasneje dodani okraski, ampak sestavni deli inženirske kakovosti.

Od kod prihajajo predsodki?

Pristranskost modela (sistematično obravnavanje določenih skupin s strani modela drugače/nepravično) običajno izhaja iz podatkov, ne iz modela. Viri:

  • Zgodovinska pristranskost: podatki odražajo preteklo nepravičnost. Če je bila določena skupina v preteklosti deležna manj zaslug, se bo model, usposobljen na teh podatkih, naučil in ohranil to diskriminacijo.
  • Pristranskost zastopanosti: nekatere skupine so premalo zastopane v podatkih; model zanje deluje slabo (npr. nizka natančnost pri majhnem demografskem vzorcu).
  • Pristranskost merjenja: Etikete same so pristranske (npr. če definicija "dobrega zaposlenega" temelji na preteklih odločitvah o napredovanju).
  • Pristranskost združevanja: ker podatki prihajajo iz določenega kanala, niso reprezentativni za vesolje.

Model se ne le nauči teh pristranskosti; poveča z avtomatizacijo. Pristranska odločitev ene osebe vpliva na drugo osebo; Sodba pristranskega modela je milijone.

Pozor: Ne delajte napak in trdite, da je "model nevtralen, ker je samo matematika." Model se uči in avtomatizira človeško pristranskost podatkov. Nevtralnost ni privzetek, ampak rezultat, ki ga je treba izmeriti in zagotoviti.

merjenje pravičnosti

Da bi upravljali s pravičnostjo, jo je treba najprej izmeriti. Če želite to narediti, ocenite model na podlagi podskupine: ali so meritve, kot so natančnost, priklic, lažno pozitivna stopnja, enake v različnih demografskih skupinah? Nekaj konceptov pravičnosti:

  • Pravičnost skupine: ali model obravnava različne skupine pravilno/nepravilno pri podobnih stopnjah?
  • Enakost možnosti: Ali model zajame resnično pozitivne enako v vseh skupinah (enak priklic)?

Pomembno dejstvo: različne definicije pravičnosti morda ne bodo zadoščene hkrati (to je matematična posledica). Katera definicija pravičnosti ima v tem kontekstu prednost, je etična in poslovna odločitev, ne tehnična, in se sprejme skupaj z deležniki.

Šibek pristop / Močan pristop

Slabo: "Skupna natančnost modela je 88 %, kar je pošteno."

Güçlü: "Skupna natančnost je bila 88-odstotna, ko pa smo jo razdelili na podskupine, je bil priklic 91-odstoten v eni skupini in 67-odstoten v drugi skupini – model je sistematično pogrešal to skupino. Dokumentirali smo razlog (pomanjkanje zastopanosti), zbrali podatke za to skupino in jih ponovno ovrednotili s ciljem enakega priklica. Z zainteresiranimi stranmi smo se odločili, kateri definiciji pravičnosti bomo dali prednost."

Razlika: močan pristop se ne skriva za splošno metriko, ločuje podskupine in pravičnost obravnava kot odprto odločitev.

Etika in transparentnost

Temeljna načela odgovorne umetne inteligence so:

  • Razložljivost: Ali je mogoče pojasniti, zakaj se je model tako odločil? Pri odločitvah z velikim vplivom (posojilo, najem, zdravstveno varstvo) imamo pravico do razlage. Nepojasnjeni model se na teh področjih ne bi smel uporabljati ali pa bi moral biti podprt z razložljivo metodo.
  • Človeški nadzor: odločitve z velikim vplivom se ne smejo sprejemati samodejno; Model predlaga, človek potrdi.
  • Odgovornost: Jasno mora biti, kdo je odgovoren, ko model naredi napako. "Manekenka se je odločila" ni izgovor.
  • Transparentnost: uporabnik mora vedeti, da je v interakciji z AI in kako se uporabljajo njegovi podatki.

V mnogih državah in sektorjih so ta načela vključena tudi v zakonodajo (obveznosti preglednosti, revizije in človeškega nadzora za sisteme umetne inteligence z visokim tveganjem). Inženir je odgovoren za poznavanje predpisov svojega področja.

Namig: Za vsak model z velikim vplivom imejte "karto modela": kaj model počne, na katerih podatkih se je usposabljal, kako dobro/slabo deluje v katerih skupinah, kakšne so njegove znane omejitve. Ta dokument je hkrati orodje za preglednost in odgovornost.

Stroški in trajnost

AI ni poceni. Stroški se upravljajo v dveh dimenzijah:

Finančni stroški:

  • Stroški žetonov (LLM): Vsaka zahteva in odgovor stanejo žetone; Z večanjem obsega raste tudi račun. Nepotrebno dolgi pozivi, prevelika izbira modelov in nenadzorovane zanke agentov (enota 5) povečajo stroške.
  • Usposabljanje in gostovanje: Natančna nastavitev in predstavitev modela povzročata stroške strojne opreme.
  • Optimizacija: ne uporabljajte velikega modela, če zadostuje majhen; predpomnilnik pogosto zastavljenih vprašanj; skrajšajte poziv; Serija, kar je mogoče obdelati.

Okoljski stroški: usposabljanje in sklepanje velikega modela porabita veliko energije. Zaradi trajnosti je izogibanje nepotrebnim izračunom (model pravilne velikosti, učinkovita arhitektura) poklicna odgovornost.

Nasvet: Prvo pravilo optimizacije stroškov: "Kateri je najmanjši ustrezen model za to delo?" Postaviti najmočnejši model povsod je kot zabiti žebelj s kladivom – drago in nepotrebno.

trije mini kovčki

1. primer - Skrita diskriminacija. Model preverjanja zaposlovanja je bil na splošno videti dober. Analiza podskupin je pokazala, da je model sistematično poudarjal kandidatke, ker so v zgodovinskih podatkih prevladovali moški – naučil se je zgodovinske pristranskosti. Model je bil ustavljen, podatki uravnoteženi in spremljane metrike pravičnosti. Splošna pravičnost je prikrila skrito diskriminacijo.

2. primer - Nepojasnjena zavrnitev. Kreditni model je zavračal vloge, vendar nihče ni znal pojasniti, zakaj. Ko je stranka zahtevala pravno pojasnilo, ekipa ni mogla odgovoriti. Model je bil umaknjen iz uporabe pri odločitvah z velikim vplivom, dokler ni bila dodana razložljiva metoda in utemeljitev za vsako zavrnitev. Nauk: razložljivost je bistvenega pomena pri odločanju z velikim učinkom.

Primer 3 - Bill šok. Ena ekipa je uporabljala največji LLM in zelo dolge pozive za vsako zahtevo. Mesečni račun se je nepričakovano povečal. Post analiza: večino zahtev je bilo mogoče rešiti z majhnim modelom, polovica pozivov je bila odveč, pogosta vprašanja pa je bilo mogoče shraniti v predpomnilnik. Te tri optimizacije so znatno znižale stroške, ne da bi ogrozili kakovost. Nauk: najmočnejši model ni potreben povsod.

Kopirane predloge

Pomagaj mi oceniti pristranskost/pravičnost tega modela. Katere podskupine (demografsko/segment) naj razdelim in izmerim? Katere meritve (natančnost, priklic, stopnja lažno pozitivnih rezultatov po skupini) naj primerjam? Ali si lahko različne definicije pravičnosti nasprotujejo, čemu naj v tem kontekstu dam prednost in zakaj? Kontekst modela/odločitve: [razlaga]

Izdelajte osnutek kartice modela za ta zelo vpliven model. Vključuje: namen, podatke in datum usposabljanja, uspešnost v podskupinah, znane omejitve, primerno/neustrezno uporabo, status razložljivosti, točko človeškega nadzora. Model: [opis]

Pomagajte mi znižati stroške te implementacije LLM, ne da bi pri tem ogrozili kakovost. Na voljo: velikost modela, povprečna dolžina poziva, obseg zahteve, ali obstaja predpomnilnik? Ocenite: 1) Ali je manjši model dovolj (za katere naloge)? 2) Ali je poziv mogoče skrajšati? 3) Ali je mogoče pogoste zahteve shraniti v predpomnilnik? 4) Ali je na voljo delo za paket? Zapišite ocenjeni učinek vsakega predloga.

Izdelajte kontrolni seznam etike/odgovornosti za ta sistem odločanja z velikim vplivom. – Razložljivost: ali je mogoče pripraviti utemeljitev odločitve? – Človeški nadzor: ali je treba odločitev z velikim vplivom odobriti? – Odgovornost: kdo je odgovoren v primeru napake? – Preglednost: ali uporabnik ve, da se uporablja umetna inteligenca? – Uredba: kakšne so pravne obveznosti, ki so vključene? Sistem: [opis]

Tabela vira pristranskosti

Vir

simptom

previdnost

zgodovinska pristranskost

Pretekla diskriminacija se nadaljuje

Revizija podatkov + metrika poštenosti

reprezentančna pristranskost

Nizka natančnost v majhni vzorčni skupini

Analiza podskupin + izravnava

pristranskost merjenja

pristranske oznake

Pregled procesa etiketiranja

Pristranskost združevanja

Vesolje ni predstavljeno

Diverzifikacija virov

Pogoste napake

  • Zanašanje na splošno meritev. Skrite diskriminacije ni mogoče videti brez analize podskupin.
  • Ob predpostavki "model nevtralen". Model se uči in poveča pristranskost v podatkih.
  • Odločitev z velikim vplivom prepustimo nepojasnjenemu modelu. Pravno in etično tveganje.
  • Mimo človeškega nadzora. "Manekenka se je odločila" ni opravičilo.
  • Povsod postavlja največji model. Nepotrebni stroški in energija.
  • Brez sledenja stroškom. Račun tiho nabrekne.

Če povzamem

Tehnično pravilen model je še vedno neuspeh, če ni pošten, razložljiv in trajnosten. Pristranskost večinoma izhaja iz podatkov in model jih poveča v obsegu; Izmerite pravičnost po podskupinah in se z zainteresiranimi stranmi dogovorite, kateri definiciji pravičnosti dati prednost. Razložljivost, človeški nadzor in odgovornost so bistvenega pomena pri odločitvah z velikim vplivom; Preglednost dokumenta z modelno kartico. Upravljajte stroške in energijo: izberite najmanjši ustrezen model, skrajšajte poziv, uporabite predpomnilnik in serijo. Te dimenzije so sestavni deli tehnične kakovosti, ne dodatki, dodani pozneje.

Aplikacijska naloga

Razdelite model v vsaj dve podskupini in primerjajte priklic in lažno pozitivno stopnjo na podlagi skupine; Če je velika razlika, napišite razlog in previdnostni ukrep. Pripravite kratko kartico modela za model z velikim vplivom (namen, podatki, uspešnost podskupine, meje, razložljivost). Določite vsaj dve konkretni optimizaciji (minimalno/hitro obrezovanje/predpomnilnik/serija), da zmanjšate stroške izvajanja LLM, in zapišite njun ocenjen učinek.

kontrolni seznam

  • [ ] Model sem ocenil na podlagi podskupin, nisem se zanašal na splošno metriko.
  • [ ] Z deležniki sem se odločil, kateri definiciji pravičnosti bom dal prednost.
  • [ ] Odločitev z velikim vplivom je razložljiva in predmet odobritve ljudi.
  • [ ] Preglednost in meje sem dokumentiral s kartico vzorca.
  • [ ] Izbral sem najmanjši ustrezen model; Optimiziral sem poziv/predpomnilnik/paket.
  • [ ] Spremljam stroške in vpliv energije.