Fitimet:
- Aftësia për të zbuluar diskriminimin e fshehur duke kuptuar se paragjykimi vjen nga të dhënat (historike, përfaqësuese, matje, grumbullim) dhe duke vlerësuar modelin në bazë të nëngrupeve
- Aftësia për të ofruar shpjegueshmëri, mbikëqyrje njerëzore dhe llogaridhënie në vendimet me ndikim të lartë dhe transparencë të dokumenteve me një kartë model
- Aftësia për të menaxhuar kostot financiare dhe mjedisore pa kompromentuar cilësinë me modelin më të vogël adekuat, shkurtimin e menjëhershëm, cache dhe batch
Një model teknikisht mund të funksionojë në mënyrë të përsosur, por gjithsesi është i gabuar - nëse është i padrejtë për disa njerëz, i pashpjegueshëm ose prodhon kosto të paqëndrueshme. Në këtë njësi, ne mbulojmë tre dimensione "të padukshme" por vendimtare të inxhinierisë ML: paragjykimet dhe drejtësia, etika dhe transparenca, kostoja dhe qëndrueshmëria. Këto nuk janë zbukurime të shtuara më vonë, por pjesë përbërëse të cilësisë inxhinierike.
Nga vjen paragjykimi?
Paragjykimi i modelit (trajtimi sistematik i modelit ndaj grupeve të caktuara në mënyrë të ndryshme/të padrejtë) zakonisht vjen nga të dhënat, jo nga modeli. Burimet:
- Paragjykimi historik: Të dhënat pasqyrojnë padrejtësinë e kaluar. Nëse një grupi të caktuar i është dhënë më pak kredi në të kaluarën, modeli i trajnuar mbi ato të dhëna do të mësojë dhe përjetësojë këtë diskriminim.
- Paragjykimi i përfaqësimit: Disa grupe janë të nënpërfaqësuara në të dhëna; modeli funksionon dobët për ta (p.sh. saktësi e ulët në një mostër të vogël demografike).
- Paragjykimi i matjes: Vetë etiketat janë të njëanshme (p.sh., nëse përkufizimi i një "punonjësi të mirë" bazohet në vendimet e kaluara të promovimit).
- Paragjykimi i grumbullimit: Për shkak se të dhënat vijnë nga një kanal specifik, ato nuk janë përfaqësuese të universit.
Modeli nuk i mëson vetëm këto paragjykime; shkallëzohet duke e automatizuar atë. Vendimi i njëanshëm i një personi prek një person tjetër; Verdikti i një modeli të njëanshëm është miliona.
Kujdes: Mos bini në gabim duke thënë "modeli është neutral sepse është thjesht matematikë". Modeli mëson dhe automatizon paragjykimet njerëzore në të dhëna. Neutraliteti nuk është një parazgjedhje, por një rezultat që duhet të matet dhe të sigurohet.
duke matur drejtësinë
Për të menaxhuar drejtësinë, është e nevojshme të matet së pari. Për ta bërë këtë, vlerësoni modelin në bazë nëngrupi: a janë metrikë të tillë si saktësia, rikujtimi, norma false pozitive në grupe të ndryshme demografike? Disa koncepte të drejtësisë:
- Drejtësia e grupit: A i trajton modeli grupet e ndryshme në mënyrë korrekte/gabimisht me ritme të ngjashme?
- Barazia e mundësive: A i kap modeli ato vërtet pozitive në mënyrë të barabartë në të gjitha grupet (kujtim i barabartë)?
Fakt i rëndësishëm: përkufizime të ndryshme të drejtësisë mund të mos plotësohen në të njëjtën kohë (kjo është një pasojë matematikore). Cili përkufizim i drejtësisë ka përparësi në këtë kontekst është një vendim etik dhe biznesi, jo teknik dhe merret së bashku me palët e interesuara.
Qasje e dobët / Qasje e fortë
Dobët: "Saktësia e përgjithshme e modelit është 88%, që është e drejtë."
Güçlü: "Saktësia e përgjithshme ishte 88%, por kur e ndamë atë në nëngrupe, tërheqja ishte 91% në një grup dhe 67% në një grup tjetër — modelit i mungonte sistematikisht atij grupi. Ne dokumentuam arsyen (mungesa e përfaqësimit), mblodhëm të dhëna për atë grup dhe e rivlerësuam atë me objektivin e barabartë të tërheqjes.
Dallimi: qasja e fortë nuk fshihet pas metrikës së përgjithshme, ajo ndan nëngrupet dhe e trajton drejtësinë si një vendim të hapur.
Etika dhe transparenca
Parimet thelbësore të AI përgjegjëse janë:
- Shpjegueshmëria: A mund të shpjegohet pse modelja e mori këtë vendim? Në vendimet me ndikim të lartë (kredi, punësim, kujdes shëndetësor) njeriu ka të drejtën e një shpjegimi. Modeli i pashpjeguar nuk duhet të përdoret në këto fusha ose duhet të mbështetet nga një metodë e shpjegueshme.
- Mbikëqyrja njerëzore: Vendimet me ndikim të lartë nuk duhet të merren automatikisht; Modeli sugjeron, njeriu konfirmon.
- Përgjegjësia: Duhet të jetë e qartë se kush është përgjegjës kur modeli bën një gabim. "Modeli vendosi" nuk është një justifikim.
- Transparenca: Përdoruesi duhet të dijë se po ndërvepron me një AI dhe se si përdoren të dhënat e tij.
Në shumë vende dhe sektorë, këto parime janë të përfshira edhe në legjislacion (detyrimet e transparencës, auditimit dhe mbikëqyrjes njerëzore për sistemet e AI me rrezik të lartë). Inxhinieri është përgjegjës për njohjen e rregulloreve të fushës së tij.
Këshillë: Mbani një "kartë model" për çdo model me ndikim të lartë: çfarë bën modeli, për cilat të dhëna është trajnuar, sa mirë/dobët funksionon në cilat grupe, cilat janë kufijtë e tij të njohur. Ky dokument është një mjet transparence dhe llogaridhënieje.
Kosto dhe qëndrueshmëri
AI nuk është i lirë. Kostoja menaxhohet në dy dimensione:
Kostoja financiare:
- Kostoja e Tokenit (LLM): Çdo kërkesë dhe përgjigje kushton argumentet; Ndërsa vëllimi rritet, fatura rritet. Kërkesat e panevojshme të gjata, përzgjedhja tepër e madhe e modeleve dhe unazat e pakontrolluara të agjentëve (njësia 5) rrisin koston.
- Trajnimi dhe pritja: Rregullimi i imët dhe prezantimi i modelit shkaktojnë kosto harduerike.
- Optimizimi: Mos përdorni një model të madh nëse mjafton një model i vogël; cache pyetjet e bëra shpesh; shkurtoni kërkesën; Grumbulloni ato që mund të përpunohen.
Kostoja mjedisore: Trajnimi dhe përfundimi i modeleve të mëdha konsumojnë energji të konsiderueshme. Qëndrueshmëria e bën shmangien e llogaritjeve të panevojshme (modeli i saktë i madhësisë, arkitektura efikase) një përgjegjësi profesionale.
Këshillë: Rregulli i parë i optimizimit të kostos: "Cili është modeli më i vogël adekuat për këtë punë?" Të vendosësh modelin më të fuqishëm kudo është si të godasësh me çekan një gozhdë me çekiç - e shtrenjtë dhe e panevojshme.
tre mini kuti
Rasti 1 - Diskriminimi i fshehur. Një model i shqyrtimit të rekrutimit dukej i mirë në përgjithësi. Analiza e nëngrupit zbuloi se modeli në mënyrë sistematike nënvizonte kandidatet femra sepse të dhënat historike ishin të dominuara nga meshkujt – kishte mësuar paragjykimet historike. Modeli u ndal, të dhënat u balancuan dhe metrikat e drejtësisë u monitoruan. Drejtësia e përgjithshme mbuloi diskriminimin e fshehur.
Rasti 2 - Refuzim i pashpjegueshëm. Një model kredie po refuzonte aplikimet, por askush nuk mund të shpjegonte pse. Kur një klient kërkoi sqarime ligjore, ekipi nuk ishte në gjendje të përgjigjej. Modeli u tërhoq nga përdorimi në vendimet me ndikim të lartë derisa u shtua një metodë e shpjegueshme dhe u krijua justifikimi për çdo refuzim. Mësimi: shpjegueshmëria është thelbësore në marrjen e vendimeve me ndikim të lartë.
Rasti 3 - Shoku i faturës. Një ekip po përdorte LLM-në më të madhe dhe kërkesa shumë të gjata për secilën kërkesë. Fatura mujore është rritur në mënyrë të papritur. Analiza e postimit: shumica e kërkesave mund të zgjidheshin me një model të vogël, gjysma e kërkesave ishin të tepërta dhe pyetjet e shpeshta mund të ruheshin në memorie. Këto tre optimizime ulën ndjeshëm koston, pa kompromentuar cilësinë. Mësimi: modeli më i fuqishëm nuk është i nevojshëm kudo.
Modele të kopjueshme
Më ndihmo ta vlerësoj këtë model për paragjykim/drejtësi. Cilat nëngrupe (demografike/segmenti) duhet të ndaj dhe të masë? Çfarë metrike (saktësia, rikujtimi, norma false pozitive sipas grupit) duhet të krahasoj? A mund të bien ndesh përkufizime të ndryshme të drejtësisë, cilat duhet t'i jap prioritet në këtë kontekst dhe pse? Konteksti i modelit/vendimit: [shpjegim]
Prodhoni një kartë modeli draft për këtë model me ndikim të lartë. Duhet të përfshijë: qëllimin, të dhënat dhe datën e trajnimit, performancën në nëngrupe, kufijtë e njohur, përdorimin e duhur/të papërshtatshëm, statusin e shpjegueshmërisë, pikën e mbikëqyrjes njerëzore. Modeli: [përshkrim]
Më ndihmo të zvogëloj koston e këtij zbatimi LLM, pa kompromentuar cilësinë. E disponueshme: madhësia e modelit, gjatësia mesatare e kërkesës, vëllimi i kërkesës, a ka cache? Vlerëso:1) A mjafton modeli më i vogël (për cilat detyra)? 2) A mund të shkurtohet kërkesa?3) A mund të ruhen kërkesat e shpeshta?4) A ka punë të disponueshme për secilin sugjerim të ndikimit të vlerësuar?
Krijoni një listë kontrolli të etikës/përgjegjësisë për këtë sistem vendimesh me ndikim të lartë.- Shpjegueshmëria: a mund të krijohet justifikimi i vendimit?- Mbikëqyrja njerëzore: a i nënshtrohet miratimit vendimi me ndikim të lartë?- Përgjegjshmëria: kush është përgjegjës në rast gabimi?- Transparenca: a e di përdoruesi që AI është duke u përdorur?- Rregullorja: cilat janë detyrimet ligjore të përfshira?
Tabela e burimit të paragjykimit
Burimi
simptomë
masë paraprake
paragjykim historik
Diskriminimi i së kaluarës vazhdon
Auditimi i të dhënave + metrika e drejtësisë
paragjykim i përfaqësimit
Saktësia e ulët në grupin e vogël të mostrave
Analiza e nëngrupit + balancimi
paragjykim i matjes
etiketa të njëanshme
Rishikimi i procesit të etiketës
Paragjykimi i grumbullimit
Universi nuk përfaqësohet
Diversifikimi i burimeve
Gabimet e zakonshme
- Duke u mbështetur në metrikën e përgjithshme. Diskriminimi i fshehur nuk mund të shihet pa analizën e nëngrupeve.
- Duke supozuar "model neutral". Modeli mëson dhe përforcon paragjykimet në të dhëna.
- Duke ia lënë vendimin me ndikim të lartë modelit të pashpjeguar. Rreziku ligjor dhe etik.
- Anashkalimi i mbikëqyrjes njerëzore. “Modelja vendosi” nuk është justifikim.
- Duke vendosur modelin më të madh kudo. Kosto dhe energji e panevojshme.
- Jo ndjekja e kostos. Fatura fryhet në heshtje.
Në përmbledhje
Një model teknikisht i saktë është ende një dështim nëse nuk është i drejtë, i shpjegueshëm dhe i qëndrueshëm. Paragjykimi vjen kryesisht nga të dhënat dhe modeli e zmadhon atë në shkallë; Matni drejtësinë sipas nëngrupeve dhe bini dakord me palët e interesuara se cilin përkufizim të drejtësisë duhet t'i jepet përparësi. Shpjegueshmëria, mbikëqyrja njerëzore dhe llogaridhënia janë thelbësore në vendimet me ndikim të lartë; Transparenca e dokumentit me kartën e modelit. Menaxhoni koston dhe energjinë: zgjidhni modelin më të vogël adekuat, shkurtoni kërkesën, përdorni cache dhe grup. Këto dimensione janë pjesë integrale e cilësisë inxhinierike, jo frills shtuar më vonë.
Detyra e aplikimit
Ndani një model në të paktën dy nëngrupe dhe krahasoni shkallën e rikujtimit dhe false pozitive në baza grupore; Nëse ka një ndryshim domethënës, shkruani arsyen dhe një masë paraprake. Hartoni një kartë modeli të shkurtër për një model me ndikim të lartë (qëllimi, të dhënat, performanca e nëngrupit, kufijtë, shpjegueshmëria). Identifikoni të paktën dy optimizime konkrete (minimumi / shkurtimi i shpejtë / cache / grupi) për të ulur koston e zbatimit të një LLM dhe shkruani ndikimin e tyre të vlerësuar.
listë kontrolli
- [ ] Unë e vlerësova modelin bazuar në nëngrupe, nuk u mbështeta në metrikën e përgjithshme.
- [ ] Unë vendosa me palët e interesuara se cilin përkufizim të drejtësisë do t'i jepja përparësi.
- [ ] Vendimi me ndikim të lartë është i shpjegueshëm dhe i nënshtrohet miratimit njerëzor.
- [ ] Kam dokumentuar transparencën dhe kufijtë me kartën e modelit.
- [ ] Zgjodha modelin adekuat më të vogël; Kam optimizuar prompt/cache/batch.
- [ ] Unë monitoroj koston dhe ndikimin e energjisë.