Enhed 9 / 11

Fordomme, retfærdighed og diskrimination: modellens blinde pletter

Gevinster:

  • At forstå, hvordan bias i kunstig intelligens-modeller opstår fra data og design, og hvorfor det skaber juridiske og etiske risici i bankvirksomhed
  • Evne til at genkende beskyttede funktioner, proxyvariabler og indirekte diskrimination og stille spørgsmålstegn ved modelbeslutninger med hensyn til retfærdighed
  • Evne til at forstå, hvordan retfærdighedsmålinger, udelukkede grupper og retten til at gøre indsigelse vævet ind i modelstyringen og opretholder den røde linje for diskrimination

En AI-model er ikke neutral; Det er et spejl af de lærte data. Hvis dataene bærer tidligere uligheder, lærer modellen dem og fører dem ind i fremtiden. I banksektoren er dette ikke en abstrakt etisk debat: Hvis en kreditmodel systematisk skader en bestemt gruppe, er dette både ulovligt (forbud mod diskrimination) og et etisk brud, hvilket medfører risici for bankens omdømme og sanktioner. Formålet med denne enhed er at vise, hvordan modellen bliver partisk, direkte og indirekte former for diskrimination, proxy-variabelfælden og måder at flette retfærdighed ind i modelstyring. Én rød streg må siges fra starten: diskrimination, uanset hvor "statistisk" den kan virke, er uacceptabel.

Hvor kommer fordommene fra?

  • Databias: Hvis tidligere beslutninger var uretfærdige (f.eks. en bestemt gruppe blev givet mindre kredit i fortiden), antager modellen, at dette er "normalt" og fortsætter. Dette kaldes historisk skævhed.
  • Sampling bias: Hvis nogle grupper er underrepræsenteret i dataene, lærer modellen dårligt og unøjagtigt om dem.
  • Etiketbias: Hvis definitionen af ​​"god kunde" i sig selv er biased, optimerer modellen for bias.
  • Design bias: Menneskelige valg om, hvilke variabler der skal bruges, kan også have bias.
Tip: "Modellen er baseret på data, så den er objektiv" er en misforståelse. Data er et øjebliksbillede af fortiden; Hvis fortiden var uretfærdig, retfærdiggør den "objektive" model uretfærdigheden med matematik. Objektivitet er ikke en garanti for upartiskhed.

Direkte og indirekte forskelsbehandling

  • Direkte diskrimination: Modellens direkte brug af en beskyttet egenskab (køn, etnicitet, religion, alder). Dette er udtrykkeligt forbudt.
  • Indirekte diskrimination (surrogatvariabel / proxy): Selvom modellen ikke bruger den beskyttede funktion direkte, producerer den det samme resultat ved at bruge en anden variabel, der er stærkt relateret til den (postnummer, navn, indkøbskategori, arbejdsområde). Postnummer er ofte en proxy for etnicitet eller indkomstniveau. Modellen siger "naboskab", men resultatet er "oprindelses"-diskrimination.

Variabel

tilsyneladende

kan være en proxy

Postnummer / distrikt

geografi

Etnicitet, indkomstniveau

Navn

ID

oprindelse, køn

Shopping kategori

adfærd

livsstil, tro

dimitterede skole

Uddannelse

Socioøkonomisk oprindelse

Derfor bør alarmen lyde, når du ser et udsagn som "naboskab er risikabelt" i en begrundelse: det kan se ud til at være et legitimt kriterium, men medføre indirekte diskrimination.

Forsigtig: Fjernelse af den beskyttede funktion fra dataene afslutter ikke diskriminationen. Surrogatvariabler kan returnere det. Retfærdighed opnås ikke ved "Jeg slettede den følsomme kolonne"; Dette opnås ved at teste resultaterne af modelbeslutninger mellem grupper.

At væve retfærdighed ind i regeringsførelse

  1. Retfærdighedsmålinger. Sammenlign modellens godkendelses-/afvisningsprocenter og fejlprocenter mellem grupper. Oplever én gruppe systematisk højere afvisninger?
  2. Proxy kontrol. Undersøg forholdet mellem de anvendte variable og de beskyttede ejendomme.
  3. Forklarlighed. Enhver beslutning skal begrundes; En "black box" benægtelse er uholdbar.
  4. Ret til at gøre indsigelse. Kunden bør have ret til at lære begrundelsen for beslutningen og anmode om en menneskelig gennemgang.
  5. Udelukkede grupper. Det bør også kontrolleres, at grupper, der er underrepræsenteret i dataene, ikke bliver mishandlet.

Fire kopierbare skabeloner

1) Screening for diskrimination som begrundelse:

Tjek følgende begrundelse for kreditbeslutning: Er der en direkte/indirekte reference til en beskyttet egenskab (alder, køn, oprindelse, religion) eller en proxyvariabel (postnummer, kvarter, navn, indkøbstype)? Markér risikable udsagn og forklar, hvorfor de udgør en risiko for diskrimination. Årsag: [tekst]

2) Variabel liste proxykontrol:

Undersøg denne liste over variabler, der bruges i en kreditmodel. Hvilke kan være en proxy for en beskyttet egenskab og udgøre en risiko for indirekte forskelsbehandling? Skriv din begrundelse for hver risikabel variant. Liste: [variabler]

3) Sammenfatning af beslutningen med hensyn til retfærdighed (neutral, forklarlig):

Din rolle: assistent, der udarbejder et forklarligt beslutningsgrundlag. Stol kun på legitime, ikke-diskriminerende kriterier (gæld i forhold til indkomst, betalingshistorik, sikkerhedsstillelse). Henvis IKKE til beskyttet ejendom og surrogatvariabel. Skriv begrundelsen i et klart sprog, som kunden vil forstå. Jeg vil give godkendelsen.

4) Udkast til indsigelsessvar:

En kunde appellerede kreditafvisningen og ønsker en begrundelse. Udarbejde et respektfuldt og beskrivende svar baseret på legitime kriterier; Mind kunden om hans eller hendes ret til menneskelig gennemgang og rettelse. Brug ikke nogen diskriminerende implikationer. Bekræftet afvisningsårsag: [årsag]

Svag prompt / Stærk prompt

Svag prompt:

Applikationer i denne region er meget risikable, lad os bruge distriktsoplysninger mere tungt i modellen, så nøjagtigheden kan øges.

Denne tilgang styrker indirekte diskrimination baseret på distrikt; Det legitimerer et ulovligt resultat i navnet på "hit".

Kraftig prompt:

Din rolle: Revisionsassistent for retsvæsenet. Markér de anvendte variabler, der udgør risikoen for surrogatvariabler. Foreslå, hvilke målinger jeg skal følge for at sammenligne beslutninger mellem grupper med hensyn til godkendelse/afvisningsprocent. Forstærk aldrig et diskriminerende kriterium; omdirigere til legitime og forklarlige kriterier.

Stærk vilje leder efter proxy-risiko, introducerer retfærdighedsmålinger og afviser diskrimination.

tre minisager

Case 1 — Historisk skævhed. En model giver en bestemt erhvervsgruppe en systematisk lav score, fordi den tidligere har fået mindre kredit. En retfærdighedsrevision viser, at afvisningsprocenten for denne gruppe er 30 % højere end andre med tilsvarende indkomstniveauer. Modellen er rebalanceret med legitime indkomst- og betalingskriterier.

Tilfælde 2 — Surrogatvariabel. Postnummer er en stærk variabel i en model. Revisionen viser, at postnummeret overlapper med visse etnisk koncentrerede kvarterer, hvilket medfører indirekte oprindelsesdiskrimination. Variablen fjernes og erstattes af legitime finansielle benchmarks; ydeevne forbliver på et acceptabelt niveau, diskrimination er elimineret.

Sag 3 — Ret til at gøre indsigelse. En afvist klient beder om begrundelse. Banken giver den forklarlige begrundelse (høj gæld i forhold til indkomst) og accepterer anmodningen om menneskelig gennemgang. Gennemgang afslører en fejllæsning af et dokument; Beslutningen rettes. Forklarlighed og ret til at gøre indsigelse kompenserer for en fejl med retfærdighed.

Retfærdighedsmålinger: hvad og hvordan vi måler

"Er modellen fair?" Der er ikke noget entydigt svar på spørgsmålet; Der er flere definitioner af retfærdighed, og de er nogle gange i konflikt med hinanden. Her er et par tilgange, der praktisk taget følges i bankvirksomhed:

  • Sammenligning af godkendelses-/afvisningsprocenter: Er godkendelsesprocenten systematisk forskellig mellem forskellige grupper med ens økonomiske profiler (f.eks. kønsgrupper)? En stor og uforklarlig forskel er et tegn på bias.
  • Fejlratelighed: Er modellens falske afvisning (afvisning af en legitim ansøgning) afbalanceret på tværs af grupper? Hvis en gruppe uretfærdigt bliver afvist oftere end en anden, er der et problem.
  • Kalibrering: Misligholder de kunder, som modellen kalder "høj risiko", virkelig til samme rater i hver gruppe? Betydningen af ​​partituret bør ikke skifte fra gruppe til gruppe.

Disse målinger kan nogle gange ikke leveres på samme tid; Hvilken definition af retfærdighed, der skal prioriteres, er ikke en teknisk, men en etisk og juridisk beslutning og kræver menneskelig styring.

Tip: Mål fairness-metrikken med jævne mellemrum, ikke kun når du bygger modellen. En model kan gå live retfærdigt og blive forudindtaget over tid på grund af datadrift. Retfærdighed er ikke et spørgsmål om "etablering", men et spørgsmål om "overvågning".

Almindelige fejl

  • Den "objektive data" fejlslutning. Forudsat at modellen er neutral; data bærer historisk skævhed.
  • Bare slet den følsomme kolonne. Fjernelse af den beskyttede ejendom og overse proxyvariabler.
  • Sporer ikke retfærdighedsmålinger. Sammenligner slet ikke afvisnings-/fejlraten mellem grupper.
  • Forsvar af den sorte boks beslutning. Overvejer en beslutning, der ikke kan begrundes som legitim.
  • Fjernelse af retten til at gøre indsigelse. Deaktiverer menneskelig gennemgang, fordi "det sænker processen."
Opmærksomhed: Diskrimination opstår ofte ikke af ondskab, men fra skødesløshed. En variabel tilføjet, fordi den "øger nøjagtigheden", kan ubevidst ekskludere en gruppe. Derfor er retfærdighed ikke baseret på god tro, men på regelmæssige prøver.

Sammenfattende

AI-modeller bærer skævhederne i de data, de lærer af, og diskrimination i bankvirksomhed er en juridisk, etisk og omdømmemæssig risiko. Direkte diskrimination er at bruge en beskyttet funktion; Indirekte diskrimination, på den anden side, producerer det samme resultat med proxy-variabler (postnummer, navn). Retfærdighed handler ikke om at slette den følsomme spalte; Sikret af retfærdighedsmålinger, proxy-kontrol, forklarlighed og ret til at gøre indsigelse. I én sætning: Mønsteret gentager fortiden; Det er menneskets ansvar at opretholde retfærdighed og afvise diskrimination.

Ansøgningsopgave

Skriv en liste med 8-10 variabler for en kreditmodel (nogle med bevidst proxyrisiko: postnummer, navn, indkøbskategori). 2. Udfør et proxy-tjek med skabelonen og marker de risikable med deres årsager. Skriv derefter en diskriminerende begrundelsestekst og scan den med skabelon 1. Planlæg til sidst i et afsnit, hvilke retfærdighedsmetrikker du vil spore for at sammenligne modellens afvisningsprocent mellem grupper.

tjekliste

  • [ ] Jeg har kontrolleret, at modellen/rationalet ikke bruger beskyttede egenskaber.
  • [ ] Jeg screenede også risikoen for proxy-variabler.
  • [ ] Jeg planlagde at sammenligne godkendelse/afvisning og fejlrate mellem grupper.
  • [ ] Jeg sikrede, at hver beslutning havde en forklarlig begrundelse.
  • [ ] Jeg gav kunden ret til indsigelse og menneskelig gennemgang.
  • [ ] Jeg krydsede ikke engang den røde diskriminationslinje på grund af "hit".