Unitate 9 / 11

Prejudecăți, corectitudine și discriminare: punctele moarte ale modelului

Câștiguri:

  • Înțelegerea modului în care părtinirea modelelor de inteligență artificială apare din date și design și de ce creează riscuri legale și etice în domeniul bancar
  • Abilitatea de a recunoaște caracteristicile protejate, variabilele proxy și discriminarea indirectă și de a pune în discuție deciziile modelului în termeni de corectitudine
  • Capacitatea de a înțelege modul în care valorile justiției, grupurile excluse și dreptul de a obiecta sunt țesute în modelul de guvernare și de a menține linia roșie a discriminării

Un model AI nu este neutru; Este o oglindă a datelor învățate. Dacă datele poartă inegalități din trecut, modelul le învață și le duce în viitor. În domeniul bancar, aceasta nu este o dezbatere etică abstractă: dacă un model de credit dezavantajează sistematic un anumit grup, aceasta este atât ilegală (interzicerea discriminării), cât și o încălcare etică, aducând riscuri de reputație și sancțiuni băncii. Scopul acestei unități este de a arăta modul în care modelul devine părtinitor, forme directe și indirecte de discriminare, capcana variabilelor proxy și modalități de a integra corectitudinea în guvernarea modelului. O linie roșie trebuie spusă de la bun început: discriminarea, oricât de „statistică” ar părea, este inacceptabilă.

De unde vine prejudecata?

  • Prejudicierea datelor: dacă deciziile anterioare au fost nedrepte (de exemplu, unui anumit grup i s-a acordat mai puțin credit în trecut), modelul presupune că acest lucru este „normal” și continuă. Aceasta se numește părtinire istorică.
  • Prejudecăți de eșantionare: dacă unele grupuri sunt subreprezentate în date, modelul învață slab și inexact despre ele.
  • Prejudecăți de etichetă: dacă definiția „client bun” în sine este părtinitoare, modelul se optimizează pentru părtinire.
  • Prejudecăți de proiectare: opțiunile umane cu privire la variabilele de utilizat pot avea, de asemenea, părtiniri.
Sfat: „Modelul se bazează pe date, deci este obiectiv” este o concepție greșită. Datele sunt un instantaneu al trecutului; Dacă trecutul a fost nedrept, modelul „obiectiv” justifică nedreptatea cu matematica. Obiectivitatea nu este o garanție a imparțialității.

Discriminare directă și indirectă

  • Discriminare directă: utilizarea directă de către model a unei caracteristici protejate (sex, etnie, religie, vârstă). Acest lucru este interzis în mod expres.
  • Discriminare indirectă (variabilă surogat/proxy): Chiar dacă modelul nu utilizează în mod direct caracteristica protejată, produce același rezultat prin utilizarea unei alte variabile care este strâns legată de aceasta (cod poștal, nume, categorie de cumpărături, cartier de lucru). Codul poștal este adesea un proxy pentru etnie sau nivelul de venit. Modelul spune „cartier”, dar rezultatul este discriminarea „de origine”.

Variabilă

aparent

poate fi un proxy

Cod poștal/sector

geografie

Etnie, nivelul veniturilor

Nume

ID

origine, gen

Categoria de cumpărături

comportament

stil de viață, credință

scoala absolvita

Educație

Origine socioeconomică

De aceea, alarma ar trebui să sune atunci când vezi o afirmație precum „vecinația este riscantă” într-o justificare: poate părea a fi un criteriu legitim, dar implică o discriminare indirectă.

Atenție: Eliminarea caracteristicii protejate din date nu pune capăt discriminării. Variabilele surogat îl pot returna. Dreptatea nu se realizează prin „Am șters rubrica sensibilă”; Acest lucru se realizează prin testarea rezultatelor deciziilor model între grupuri.

Tesând justiția în guvernare

  1. Măsuri de corectitudine. Comparați ratele de aprobare/respingere ale modelului și ratele de eroare între grupuri. Un grup experimentează în mod sistematic respingeri mai mari?
  2. Control proxy. Examinați relația dintre variabilele utilizate și proprietățile protejate.
  3. Explicabilitate. Pentru fiecare decizie trebuie prezentată o justificare; O negare „cutie neagră” este insuportabilă.
  4. Dreptul de a obiecta. Clientului ar trebui să i se acorde dreptul de a afla motivele deciziei și de a solicita o revizuire umană.
  5. Grupuri excluse. De asemenea, trebuie verificat ca grupurile care sunt subreprezentate în date să nu fie maltratate.

Patru șabloane copiabile

1) Screening pentru discriminare în justificare:

Verificați următorul motiv al deciziei de credit: există o referire directă/indirectă la o caracteristică protejată (vârstă, sex, origine, religie) sau o variabilă proxy (cod poștal, cartier, nume, tip de cumpărături)? Semnalați declarațiile riscante și explicați de ce prezintă un risc de discriminare. Motiv: [text]

2) Controlul proxy al listei de variabile:

Examinați această listă de variabile utilizate într-un model de credit. Care dintre acestea ar putea fi un proxy pentru o caracteristică protejată și prezintă un risc de discriminare indirectă? Scrieți justificarea pentru fiecare variantă riscantă. Lista: [variabile]

3) Rezumatul deciziei în termeni de corectitudine (neutru, explicabil):

Rolul dumneavoastră: asistent care redactează o rațiune explicabilă a deciziei. Bazați-vă doar pe criterii legitime, nediscriminatorii (raportul datorie-venit, istoricul plăților, garanția). NU faceți referire la proprietatea protejată și la variabila surogat. Scrieți argumentul într-un limbaj simplu pe care clientul îl va înțelege. Voi da aprobarea.

4) Proiect de răspuns la obiecție:

Un client a contestat refuzul creditului și dorește o justificare. Redactarea unui răspuns respectuos și descriptiv bazat pe criterii legitime; Amintiți-i clientului dreptul său la revizuire și corectare umană. Nu utilizați implicații discriminatorii. Motivul respingerii verificat: [motiv]

Prompt slab / Prompt puternic

Prompt slab:

Aplicațiile din această regiune sunt foarte riscante, să folosim mai mult informațiile districtuale în model, astfel încât precizia să poată fi mărită.

Această abordare întărește discriminarea indirectă bazată pe district; Ea legitimează un rezultat ilegal în numele „lovirii”.

Solicitare puternică:

Rolul dumneavoastră: asistent de audit al justiției. Semnalați variabilele utilizate care prezintă riscul variabilelor surogat. Sugerați ce valori ar trebui să urmez pentru a compara deciziile între grupuri în ceea ce privește rata de aprobare/respingere. Nu consolidați niciodată un criteriu discriminatoriu; redirecționează către criterii legitime și explicabile.

Voința puternică caută riscul de proxy, introduce valori de corectitudine și respinge discriminarea.

trei mini cutii

Cazul 1 — Prejudecăți istorice. Un model acordă unui anumit grup ocupațional un scor sistematic scăzut, deoarece i s-a acordat mai puțin credit în trecut. Un audit de corectitudine arată că rata de respingere pentru acest grup este cu 30% mai mare decât altele la niveluri similare de venit. Modelul este reechilibrat cu criterii legitime de venit și de plată.

Cazul 2 — Variabila surogat. Codul poștal este o variabilă puternică într-un model. Auditul arată că codul poștal se suprapune cu anumite cartiere concentrate etnic, producând discriminare indirectă de origine. Variabila este eliminată și înlocuită cu repere financiare legitime; performanța rămâne la un nivel acceptabil, discriminarea este eliminată.

Cazul 3 – Dreptul la opoziție. Un client respins cere o justificare. Banca furnizează justificarea explicabilă (raportul mare datorie-venit) și acceptă cererea de revizuire umană. Examinarea dezvăluie o citire greșită a unui document; Decizia este corectată. Explicabilitatea și dreptul la opoziție compensează o greșeală cu justiția.

Măsuri de corectitudine: ce și cum măsurăm

„Este modelul corect?” Nu există un singur răspuns la întrebare; Există mai multe definiții ale dreptății și, uneori, ele sunt în conflict între ele. Iată câteva abordări care sunt practic urmate în domeniul bancar:

  • Comparația ratei de aprobare/respingere: este rata de aprobare diferită în mod sistematic între diferite grupuri cu profiluri financiare similare (de exemplu, grupuri de gen)? O diferență mare și inexplicabilă este un semn de părtinire.
  • Egalitatea ratei de eroare: este rata de respingere falsă a modelului (respingerea unei cereri legitime) echilibrată între grupuri? Dacă un grup este respins pe nedrept mai des decât altul, există o problemă.
  • Calibrare: Clienții pe care modelul îi numesc „risc ridicat” implicit implicit la rate similare în fiecare grup? Semnificația punctajului nu trebuie să se schimbe de la grup la grup.

Aceste valori nu pot fi furnizate uneori în același timp; Definiția justiției pe care să o acordăm prioritate nu este o decizie tehnică, ci o decizie etică și juridică și necesită guvernare umană.

Sfat: Măsurați valoarea corectitudinii la intervale regulate, nu doar atunci când construiți modelul. Un model poate intra în mod echitabil și poate deveni părtinitor în timp din cauza derivării datelor. Justiția nu este o chestiune de „înființare”, ci o chestiune de „monitorizare”.

Greșeli comune

  • Eșecul „datelor obiective”. Presupunând că modelul este neutru; datele poartă părtinire istorică.
  • Doar ștergeți coloana sensibilă. Eliminarea proprietății protejate și trecerea cu vederea variabilelor proxy.
  • Nu urmăresc valorile de corectitudine. Nu se compară deloc rata de respingere/eroare între grupuri.
  • Apărarea deciziei cutiei negre. Considerând o decizie care nu poate fi justificată ca fiind legitimă.
  • Înlăturarea dreptului de opoziție. Dezactivarea revizuirii umane deoarece „încetinește procesul”.
Atenție: Discriminarea apare adesea nu din răutate, ci din nepăsare. O variabilă adăugată deoarece „mărește acuratețea” poate exclude, fără să știe, un grup. Prin urmare, dreptatea nu se bazează pe bună credință, ci pe teste regulate.

În concluzie

Modelele de inteligență artificială poartă părtinirea datelor din care învață, iar discriminarea în domeniul bancar este un risc legal, etic și reputațional. Discriminarea directă folosește o caracteristică protejată; Discriminarea indirectă, pe de altă parte, produce același rezultat cu variabilele proxy (cod poștal, nume). Justiția nu înseamnă ștergerea rubricii sensibile; Asigurat de metrici de corectitudine, control proxy, explicabilitate și dreptul de a obiecta. Într-o singură propoziție: Modelul repetă trecutul; Este responsabilitatea omului să susțină justiția și să respingă discriminarea.

Sarcina de aplicare

Scrieți o listă de 8-10 variabile pentru un model de credit (unele cu risc de proxy intenționat: cod poștal, nume, categorie de cumpărături). 2. Efectuați o verificare proxy cu șablonul și marcați-le pe cele riscante cu motivele lor. Apoi scrieți un text de justificare discriminatorie și scanați-l cu șablonul 1. În cele din urmă, planificați într-un paragraf ce măsurători de corectitudine veți urmări pentru a compara rata de respingere a modelului între grupuri.

lista de verificare

  • [ ] Am verificat că modelul/rațiunea nu utilizează proprietăți protejate.
  • [ ] Am analizat, de asemenea, riscul variabilelor proxy.
  • [ ] Am plănuit să comparu rata de aprobare/respingere și rata de eroare între grupuri.
  • [ ] M-am asigurat că fiecare decizie are un argument explicabil.
  • [ ] Am acordat clientului dreptul de a obiecta și de a revizui uman.
  • [ ] Nici măcar nu am trecut de linia roșie a discriminării pe motiv de „lovitură”.