одиниця 7 / 11

Рішення на основі даних і аналіз відкритих даних

Прибуток:

  • Визнає ризики якості, конфіденційності та інтерпретації роботи з даними та встановлює безпечний потік аналізу.
  • Він вибирає правильний індикатор для певної мети, розрізняючи одиничні індикатори, що вводять в оману, і вимірювання, які відкриті для маніпуляцій.
  • Він розпізнає оманливі методи діаграм (вісь не починається з нуля, обраний діапазон) і спостерігає чесну візуалізацію.

Громадськість щодня створює дані: кількість заявок, час вирішення, статті бюджету, рух населення, запити на послуги, результати аудиту, опитування про задоволеність. Більшість цих даних зберігається в електронних таблицях Excel, формах і системах запису, але не перетворюється на рішення, оскільки їх аналіз потребує досвіду та часу. Прийняття рішень на основі даних (підхід до розподілу ресурсів і встановлення політики на основі вимірюваних даних, а не на думці чи звичці) підвищує як ефективність, так і справедливість у державному секторі: ресурси спрямовуються туди, де вони найбільше потрібні, виходячи з цифр. Тут штучний інтелект є потужним помічником у розумінні таблиці, пошуку закономірностей і аномалій, вилученні підсумкової статистики та перекладі результатів у прості речення. У цьому розділі ви побачите, як скоротити шлях від необроблених загальнодоступних даних до виправданого рішення за допомогою штучного інтелекту та залишатися дисциплінованими в найважливішому аспекті — правильній інтерпретації числа.

Три небезпеки роботи з даними

Дані потужні, але вони мають три пастки, і ШІ може як пом’якшити, так і посилити ці пастки:

  1. Кореляція ≠ причинно-наслідковий зв’язок. Те, що дві речі змінюються разом, не означає, що одна викликає іншу. Продажі морозива та випадки утоплення зростають, оскільки вони обидва пов’язані з літньою спекою, а не одне викликає інше. ШІ вільно створює речення «тому що»; Ставте під сумнів кожне твердження про причинність.
  2. Упереджені/відсутні дані. Від кого і як збиралися дані? Дані про скарги відображають лише тих, хто може поскаржитися; дані цифрових програм, які мають доступ до Інтернету. Якщо ви не бачите відсутню групу, рішення буде необ’єктивним.
  3. Номер без контексту. Одне лише «збільшено на 30%» безглузде: за чим, за який період, яка абсолютна цифра? Попросіть ШІ надати контекст.
Увага: поки AI аналізує надану вами таблицю, він іноді додає «розумні», але фіктивні числа ззовні таблиці або мовчки заповнює відсутні клітинки. Порівняйте кожне вихідне число з вихідною таблицею; Дайте ШІ правило «використовуйте лише значення в таблиці, яку я вам надаю, якщо відсутні, скажіть «немає даних».

Покроковий аналіз даних

  1. Уточніть питання. На яке питання ми шукаємо відповідь для прийняття рішення? («У якому районі вирішення займає найдовше?»)
  2. Знати дані. Що таке стовпці, яка одиниця вимірювання, який період, чи є відсутні/неправильні значення?
  3. Витягти особисті дані. Анонімізувати/агрегувати, якщо індивідуальна ідентифікація не потрібна для аналізу (див. Розділ 11).
  4. Виникає підсумок і закономірність. Нехай ШІ виконує базову статистику, групує та позначає аномалії.
  5. Поставте під сумнів коментар. Кореляція чи причинно-наслідковий зв’язок? Альтернативне пояснення? Відсутня група?
  6. Візуалізуйте та спростіть. Просте резюме та графіка, які може зрозуміти особа, яка приймає рішення.
  7. Документально оформити рішення та його обґрунтування. На основі яких даних було прийнято рішення? аудиторський слід.

три міні-чохла

Випадок 1 — Джерело потрапило в потрібне місце. У минулому муніципалітет розподіляв свій бюджет на утримання парку «порівну для кожного району». Коли дані про попит і використання за 18 місяців були проаналізовані за допомогою штучного інтелекту, попит на душу населення в трьох районах був у 2,4 рази вищий за середній. Бюджет перерозподілено відповідно до потреб; загальне задоволення підвищилося без додаткових витрат.

Випадок 2 — помічено необ’єктивні дані. Агентство перегляне дані цифрових додатків і зробить висновок, що «громадяни більше не приходять до пунктів оплати». Але коли під час аналізу запитали розбивку за віком, виявилося, що заявки віком понад 65 років все ще переважно надходять з каси. Якби розглядалися лише цифрові дані, ця група була б проігнорована; збереглося касове обслуговування.

Випадок 3 — Надуманий причинно-наслідковий зв’язок припинено. Інтерпретуючи таблицю, YZ сказав: «ДТП зменшилося, тому що кількість перевірок збільшилася». Аналітик нагадав, що за цей же період також змінилася погода і зменшився трафік; Приписувати це одній причині було оманою. Доповідь було виправлено, щоб сказати, що "існує зв'язок, але причинно-наслідковий зв'язок не доведений".

Чотири шаблони, які можна копіювати

1) Знайомство з таблицею:

Ваша роль: аналітик даних. Перегляньте наведену нижче таблицю та, базуючись ЛИШЕ на значеннях у цій таблиці: (1) узагальніть, що таке кожен стовпець, його одиницю вимірювання та період, (2) будь-які клітинки, які здаються відсутніми/неправильними, (3) узагальніть 3 основні шаблони, які виділяються. Додавання чисел поза таблицею; якщо відсутні, скажіть "немає даних".TABLE: [вставити дані]

2) Зведена статистика з контекстом:

Дайте відповідь на наступне запитання з таблиці нижче: [питання]. ПОВИНЕН надати результат із контекстом: абсолютне число + ставка + період порівняння. Коли ви говорите «збільшено на X%», уточніть, якою мірою і в який період. Просто використовуйте надані дані. ТАБЛИЦЯ: [дані] ПИТАННЯ: [питання]

3) запитувач причинності:

Інтерпретуйте наступний висновок, але УВАГА: не плутайте кореляцію з причинно-наслідковим зв’язком. Згенеруйте принаймні 3 альтернативні пояснення цього зв’язку (третя змінна, зворотний напрямок, збіг). Скажіть мені, які додаткові дані потрібні для підтвердження причинності. ЗНАХОДКА: [стосунки]

4) Просте резюме для рішення:

Спростіть наступний аналіз для особи, яка приймає рішення, яка не є експертом з даних: не більше 5 пунктів, кожен елемент є висновком і поясненням «що це означає». Також чітко запишіть невизначеності та обмеження даних. Додавання нової інформації.АНАЛІЗ: [текст]

Слабка підказка / Сильна підказка

Слабкий: «Проаналізуйте цю діаграму та скажіть нам, що нам робити».

Сильно: «Ваша роль — аналітик даних. Використовуйте ЛИШЕ наведену нижче таблицю; не додавайте числа ззовні, не кажіть «немає даних» у відсутню комірку. Спочатку ознайомтеся зі стовпцями, одиницями вимірювання та періодом. Потім дайте відповідь на запитання «яка околиця має найдовший час вирішення» за допомогою абсолютного числа + відношення + періоду порівняння. Якщо ви знайшли закономірність, придумайте 3 альтернативні пояснення, перш ніж пояснювати її причинно-наслідковими зв’язками. Нарешті, перелічіть точки та межі даних (відсутня група, короткий період), які залишають рішення за нами."

Відмінність: сильна підказка разом встановлює точність даних, контекст, дисципліну причинно-наслідкового зв’язку та межу прийняття рішень; Результатом є обґрунтований аналіз.

Де ШІ можна довіряти в бізнесі даних?

бізнес

ШІ довіра

правило

Зведення таблиці, групування

висока

Лише дані

Позначення аномалії/шаблону

середній

людське підтвердження

Інтерпретація причинності

низький

Потрібне альтернативне пояснення

Заповнення відсутніх даних

занадто низький

Не робіть цього можливим; "немає даних"

Спрощення/візуальне резюме

висока

Сенс треба зберегти

Дизайн індикатора та оманлива діаграма

Найважливішим кроком у прийнятті рішень на основі даних є вибір правильного показника (числовий вираз, який робить явище вимірним, наприклад, «середній час обробки» або «вартість за заявку»). Неправильний показник призводить до неправильного рішення навіть за точних даних: хоча «загальна кількість вирішених претензій» здається зростаючою, «час очікування на одного громадянина» може погіршуватися. ШІ може перерахувати потенційні індикатори для теми та те, що кожен вимірює та приховує; але ви вирішуєте, який показник справді представляє суспільний інтерес. Також пам’ятайте про ризик оманливої ​​візуалізації (викривлення сприйняття за допомогою таких методів, як вісь, що не починається з нуля, непропорційний масштаб, вибраний часовий інтервал) на графіках, які пропонує або описує AI; чесне візуальне зображення в публічних даних є частиною управління.

Міні футляр — неправильний знак, неправильна похвала. Один підрозділ бив рекорди за показником «кількість закритих справ за місяць»; але скарги громадян зросли. Дивлячись на точний показник, «коефіцієнт розв’язання першого контакту», показник впав з 58 відсотків до 44 відсотків — файли швидко закривалися та знову відкривалися. При зміні показника змінився і пріоритет управління.

Mini case — вісь, яка не починається з нуля. На графіку штучного інтелекту, описаному в презентації, вертикальна вісь починається з 40, збільшення на 2 відсотки здається різким стрибком. При переміщенні осі на нуль вимальовувалась реальна картина і рішення виключалося з перебільшеного сприйняття.

Шаблон, який підтримує вибір індикатора:

Завдання: Запропонуйте 5 індикаторів-кандидатів для наступної мети. Мета: [напр. покращення якості обслуговування громадян] Для кожного показника: що він вимірює | що це може приховувати | відкритість до маніпуляцій | рекомендована частота читання. Далі: напишіть 3 попередження (ті, які самі по собі вводять в оману), щоб прочитати ці показники разом. Правило: не виводьте цифри; просто запропонуйте дизайн індикатора.

Застереження: не впадайте в помилкову думку, що «число є об’єктивним». Яке число ви вимірюєте, як ви його відображаєте та який діапазон ви обираєте – все це питання інтерпретації. Прозоре та чесне публічне тлумачення є таким же важливим, як і наявність точних даних.

Поширені помилки

  • Помилково приймаючи кореляцію за причинно-наслідковий зв’язок. «Збільшення разом» не є причиною; Шукайте альтернативні пояснення.
  • ШІ заповнює відсутні дані. Аналіз згортається з придуманим значенням; залишити відсутнім.
  • Узагальнення необ’єктивних даних. Скарга/цифрові дані не представляють усіх; Зробіть запит про відсутню групу.
  • Подання номера без контексту. Поруч із коефіцієнтом має бути абсолютне число та період порівняння.
  • Невиправданий аналіз персональних даних. Не використовуйте індивідуальну ідентифікацію, якщо сукупних даних достатньо.
  • Не документальне оформлення рішення. Яке рішення було прийнято, на основі яких даних необхідно записати для аудиту.

Підсумовуючи

Прийняття рішень на основі даних є найпотужнішим способом справедливого й ефективного розподілу ресурсів у державному секторі; ШІ — швидкий помічник у цьому бізнесі, який розбирає картинку, знаходить закономірності та спрощує пошук. Але не змушуйте ШІ складати цифри, не змушуйте його заповнювати відсутні дані, не дозволяйте йому плутати кореляцію з причинно-наслідковим зв’язком і уникайте узагальнення необ’єктивних/неповних даних. Сила в кількості; Людина, яка правильно його інтерпретує і документує рішення, є сильнішою.

Аплікаційне завдання

Отримайте справжню (без особистих даних) таблицю зі свого пристрою. Введіть дані за допомогою шаблону «Знайомство з таблицею», а потім дайте відповідь на важливе питання для прийняття рішення за допомогою шаблону «Зведена контекстна статистика». Застосуйте шаблон «Запитувач причинно-наслідкових зв’язків» до зв’язку, що виникає, і знайдіть принаймні одне альтернативне пояснення. Перевірте, чи ШІ додає числа поза таблицею.

контрольний список

  • [ ] ШІ використовував лише задану таблицю; Чисел ззовні він не додавав.
  • [ ] Я не заповнив відсутні дані; Я залишив це як "немає даних".
  • [ ] Я представив кожен результат із контекстом (абсолютне число + ставка + період).
  • [ ] Я надав альтернативне пояснення до тверджень про причинність.
  • [ ] Я оцінив ризик необ’єктивних/відсутніх даних і відсутню групу.
  • [ ] Я задокументував рішення та дані, на яких воно базувалося.