одиниця 9 / 11

Упередження, справедливість і дискримінація: сліпі плями моделі

Прибуток:

  • Розуміння того, як упередженість у моделях штучного інтелекту виникає через дані та дизайн і чому це створює правові та етичні ризики в банківській справі
  • Здатність розпізнавати захищені функції, проксі-змінні та непряму дискримінацію та ставити під сумнів рішення моделі з точки зору справедливості
  • Здатність зрозуміти, як показники справедливості, виключені групи та право на заперечення вплетені в модель управління та підтримувати червону лінію дискримінації

Модель ШІ не є нейтральною; Це дзеркало вивчених даних. Якщо дані містять минулі нерівності, модель вивчає їх і переносить у майбутнє. У банківській справі це не абстрактні етичні дебати: якщо кредитна модель систематично ставить у невигідне становище певну групу, це є як незаконним (заборона дискримінації), так і етичним порушенням, що створює репутаційні ризики та ризики для банку. Мета цього розділу — показати, як модель перетворюється на упереджену, пряму та непряму форми дискримінації, пастку проксі-змінної та способи вплетення справедливості в модель управління. З самого початку треба сказати одну червону лінію: дискримінація, якою б «статистичною» вона не здавалася, неприпустима.

Звідки береться упередження?

  • Упередженість даних: якщо минулі рішення були несправедливими (наприклад, певній групі було присвоєно менше кредиту в минулому), модель припускає, що це «нормально», і продовжується. Це називається історичною упередженістю.
  • Зміщення вибірки: якщо деякі групи недостатньо представлені в даних, модель погано та неточно вивчає їх.
  • Упередженість мітки: якщо саме визначення «хорошого клієнта» є упередженим, модель оптимізується для упередження.
  • Упередженість дизайну: людський вибір щодо того, які змінні використовувати, також може мати упередженість.
Порада: «Модель базується на даних, тому вона є об’єктивною» — помилкова думка. Дані – це моментальний знімок минулого; Якщо минуле було несправедливим, «об’єктивна» модель виправдовує несправедливість математикою. Об'єктивність не є гарантією неупередженості.

Пряма та непряма дискримінація

  • Пряма дискримінація: пряме використання моделлю захищеної характеристики (стать, етнічна приналежність, релігія, вік). Це категорично заборонено.
  • Непряма дискримінація (сурогатна змінна/проксі): навіть якщо модель не використовує захищену функцію безпосередньо, вона дає той самий результат, використовуючи іншу змінну, яка з нею тісно пов’язана (поштовий індекс, назва, категорія покупок, робочий район). Поштовий індекс часто є проксі для етнічної приналежності або рівня доходу. Модель говорить про «сусідство», але результатом є дискримінація «походження».

змінна

мабуть

може бути проксі

Поштовий індекс / район

географія

Етнічна приналежність, рівень доходів

Ім'я

ID

походження, пол

Категорія покупок

поведінка

спосіб життя, переконання

закінчив школу

Освіта

Соціально-економічне походження

Тому варто насторожити, коли ви бачите в обґрунтуванні твердження на кшталт «сусідство ризиковане»: це може здаватися законним критерієм, але несе в собі непряму дискримінацію.

Застереження: видалення захищеної функції з даних не припиняє дискримінацію. Сурогатні змінні можуть повернути його. Справедливість не досягається тим, що "я видалив конфіденційну колонку"; Це досягається тестуванням результатів модельних рішень між групами.

Вплетення справедливості в управління

  1. Показники справедливості. Порівняйте показники схвалення/відмовлення моделі та частоти помилок між групами. Чи одна група систематично відчуває більше відмов?
  2. Керування проксі. Вивчіть зв'язок між змінними, які використовуються, із захищеними властивостями.
  3. Пояснюваність. Для кожного рішення необхідно надати обґрунтування; Відмова «чорної каси» є невиправданою.
  4. Право на заперечення. Клієнту слід надати право дізнатися обґрунтування рішення та подати запит на перевірку персоналом.
  5. Виключені групи. Слід також перевірити, чи не неправильно обробляються групи, які недостатньо представлені в даних.

Чотири шаблони, які можна копіювати

1) Перевірка дискримінації в обґрунтуванні:

Перевірте наступне обґрунтування кредитного рішення: чи є пряме/опосередковане посилання на захищену характеристику (вік, стать, походження, релігія) чи проксі-змінну (поштовий індекс, район, ім’я, тип покупки)? Позначте ризиковані заяви та поясніть, чому вони становлять ризик дискримінації. Причина: [текст]

2) Проксі-контроль списку змінних:

Перегляньте цей список змінних, які використовуються в кредитній моделі. Які з них можуть бути замінником захищеної характеристики та становити ризик непрямої дискримінації? Напишіть своє обґрунтування для кожного ризикованого варіанту. Список: [змінні]

3) Резюме рішення з точки зору справедливості (нейтральне, зрозуміле):

Ваша роль: помічник, який складає зрозуміле обґрунтування рішення. Покладайтеся лише на законні, недискримінаційні критерії (співвідношення боргу до доходу, історія платежів, застава). НЕ посилайтеся на захищену властивість і сурогатну змінну. Напишіть обґрунтування простою мовою, яку зрозуміє клієнт. Я дам схвалення.

4) Проект відповіді на заперечення:

Клієнт подав апеляцію на відмову в кредиті та вимагає обґрунтування. Складіть шанобливу та описову відповідь на основі законних критеріїв; Нагадайте клієнту про його або її право на перевірку та виправлення людьми. Не використовуйте жодних дискримінаційних наслідків. Перевірена причина відмови: [причина]

Слабка підказка / Сильна підказка

Слабка підказка:

Додатки в цьому регіоні є дуже ризикованими, давайте більше використовувати інформацію про район у моделі, щоб можна було підвищити точність.

Такий підхід посилює непряму дискримінацію за округом; Воно узаконює протиправний результат під назвою «наїзд».

Потужна підказка:

Ваша роль: помічник судового аудиту. Позначте використані змінні, які створюють ризик сурогатних змінних. Запропонуйте, яких показників мені слід дотримуватися, щоб порівнювати рішення між групами з точки зору рівня схвалення/відмови. Ніколи не посилюйте дискримінаційний критерій; перенаправлення до законних і зрозумілих критеріїв.

Strong will шукає проксі-ризик, запроваджує показники справедливості та відкидає дискримінацію.

три міні-чохла

Випадок 1 — Історичне упередження. Одна модель дає певній професійній групі систематично низький бал, оскільки в минулому їй надавали менше кредитів. Аудит справедливості показує, що відсоток відмов для цієї групи на 30% вищий, ніж для інших із подібним рівнем доходу. Модель перебалансована з критеріями законного доходу та оплати.

Випадок 2 — Сурогатна змінна. Поштовий індекс є важливою змінною в моделі. Аудит показує, що поштові індекси збігаються з певними етнічно концентрованими районами, створюючи непряму дискримінацію за походженням. Змінну видаляють і замінюють законними фінансовими контрольними показниками; продуктивність залишається на прийнятному рівні, дискримінація усунена.

Випадок 3 — Право на заперечення. Відмовлений клієнт просить виправдання. Банк надає зрозуміле обґрунтування (високе співвідношення боргу до доходу) і приймає запит на перевірку персоналом. Огляд виявляє неправильне прочитання документа; Рішення виправлено. Зрозумілість і право на заперечення компенсують помилку справедливістю.

Показники справедливості: що і як ми вимірюємо

«Чи чесна модель?» Однозначної відповіді на запитання немає; Існує кілька визначень справедливості, і вони іноді суперечать одне одному. Ось кілька підходів, які практично дотримуються в банківській справі:

  • Порівняння рівня схвалення/відмови: Чи систематично відрізняється рівень схвалення між різними групами з подібними фінансовими профілями (наприклад, гендерними групами)? Велика і непояснена різниця є ознакою упередженості.
  • Рівність частоти помилок: чи рівень хибних відхилень моделі (відхилення законної заявки) збалансований між групами? Якщо одній групі несправедливо відмовляють частіше, ніж іншій, виникає проблема.
  • Калібрування: чи клієнти, яких модель називає «високим ризиком», справді дефолтують за однаковими ставками в кожній групі? Значення оцінки не повинно переходити від групи до групи.

Ці показники іноді не можуть бути надані одночасно; Яке визначення справедливості віддати пріоритет – це не технічне, а етичне та юридичне рішення, яке потребує людського управління.

Порада. Вимірюйте показник справедливості через регулярні проміжки часу, а не лише під час створення моделі. Модель може працювати справедливо та з часом стати упередженою через дрейф даних. Справедливість – це не питання «встановлення», а питання «моніторингу».

Поширені помилки

  • Помилка «об’єктивних даних». Припускаючи, що модель нейтральна; дані несуть історичну упередженість.
  • Просто видаліть конфіденційний стовпець. Видалення захищеної властивості та пропуск проксі-змінних.
  • Не відстежуються показники справедливості. Взагалі не порівнюючи рівень відхилень/помилок між групами.
  • Захист рішення чорної скриньки. Вважаючи рішення, яке не може бути виправдане як законне.
  • Позбавлення права на заперечення. Вимкнення перевірки руками, оскільки «це сповільнює процес».
Увага: дискримінація часто виникає не зі злого наміру, а з необережності. Змінна, додана тому, що вона «підвищує точність», може несвідомо виключити групу. Тому справедливість ґрунтується не на добросовісності, а на регулярній перевірці.

Підсумовуючи

Моделі штучного інтелекту несуть упередження даних, з яких вони навчаються, а дискримінація в банківській справі є юридичним, етичним і репутаційним ризиком. Пряма дискримінація полягає у використанні захищеної функції; Непряма дискримінація, з іншого боку, дає той самий результат із проксі-змінними (поштовий індекс, ім’я). Справедливість полягає не в стиранні чутливої ​​колонки; Забезпечується показниками справедливості, проксі-контролем, пояснюваністю та правом на заперечення. Одним реченням: Шаблон повторює минуле; Людина зобов’язана відстоювати справедливість і відкидати дискримінацію.

Аплікаційне завдання

Напишіть список із 8–10 змінних для кредитної моделі (деякі з навмисним проксі-ризиком: поштовий індекс, ім’я, категорія покупок). 2. Виконайте перевірку проксі-сервера за допомогою шаблону та позначте ризиковані з їх причинами. Потім напишіть дискримінаційний текст обґрунтування та відскануйте його за допомогою шаблону 1. Нарешті, сплануйте в абзаці, які показники справедливості ви будете відстежувати, щоб порівняти рівень відхилення моделі між групами.

контрольний список

  • [ ] Я перевірив, що модель/обґрунтування не використовує захищені властивості.
  • [ ] Я також перевірив ризик проксі-змінних.
  • [ ] Я планував порівняти схвалення/відмову та рівень помилок між групами.
  • [ ] Я переконався, що кожне рішення мало зрозуміле обґрунтування.
  • [ ] Я надав клієнту право на заперечення та перевірку персоналом.
  • [ ] Я навіть не перетнув червону лінію дискримінації за ознакою «попадання».