Прибуток:
- Визнає ризики якості, конфіденційності та інтерпретації роботи з даними та встановлює безпечний потік аналізу.
- Він вибирає правильний індикатор для певної мети, розрізняючи одиничні індикатори, що вводять в оману, і вимірювання, які відкриті для маніпуляцій.
- Він розпізнає оманливі методи діаграм (вісь не починається з нуля, обраний діапазон) і спостерігає чесну візуалізацію.
Громадськість щодня створює дані: кількість заявок, час вирішення, статті бюджету, рух населення, запити на послуги, результати аудиту, опитування про задоволеність. Більшість цих даних зберігається в електронних таблицях Excel, формах і системах запису, але не перетворюється на рішення, оскільки їх аналіз потребує досвіду та часу. Прийняття рішень на основі даних (підхід до розподілу ресурсів і встановлення політики на основі вимірюваних даних, а не на думці чи звичці) підвищує як ефективність, так і справедливість у державному секторі: ресурси спрямовуються туди, де вони найбільше потрібні, виходячи з цифр. Тут штучний інтелект є потужним помічником у розумінні таблиці, пошуку закономірностей і аномалій, вилученні підсумкової статистики та перекладі результатів у прості речення. У цьому розділі ви побачите, як скоротити шлях від необроблених загальнодоступних даних до виправданого рішення за допомогою штучного інтелекту та залишатися дисциплінованими в найважливішому аспекті — правильній інтерпретації числа.
Три небезпеки роботи з даними
Дані потужні, але вони мають три пастки, і ШІ може як пом’якшити, так і посилити ці пастки:
- Кореляція ≠ причинно-наслідковий зв’язок. Те, що дві речі змінюються разом, не означає, що одна викликає іншу. Продажі морозива та випадки утоплення зростають, оскільки вони обидва пов’язані з літньою спекою, а не одне викликає інше. ШІ вільно створює речення «тому що»; Ставте під сумнів кожне твердження про причинність.
- Упереджені/відсутні дані. Від кого і як збиралися дані? Дані про скарги відображають лише тих, хто може поскаржитися; дані цифрових програм, які мають доступ до Інтернету. Якщо ви не бачите відсутню групу, рішення буде необ’єктивним.
- Номер без контексту. Одне лише «збільшено на 30%» безглузде: за чим, за який період, яка абсолютна цифра? Попросіть ШІ надати контекст.
Увага: поки AI аналізує надану вами таблицю, він іноді додає «розумні», але фіктивні числа ззовні таблиці або мовчки заповнює відсутні клітинки. Порівняйте кожне вихідне число з вихідною таблицею; Дайте ШІ правило «використовуйте лише значення в таблиці, яку я вам надаю, якщо відсутні, скажіть «немає даних».
Покроковий аналіз даних
- Уточніть питання. На яке питання ми шукаємо відповідь для прийняття рішення? («У якому районі вирішення займає найдовше?»)
- Знати дані. Що таке стовпці, яка одиниця вимірювання, який період, чи є відсутні/неправильні значення?
- Витягти особисті дані. Анонімізувати/агрегувати, якщо індивідуальна ідентифікація не потрібна для аналізу (див. Розділ 11).
- Виникає підсумок і закономірність. Нехай ШІ виконує базову статистику, групує та позначає аномалії.
- Поставте під сумнів коментар. Кореляція чи причинно-наслідковий зв’язок? Альтернативне пояснення? Відсутня група?
- Візуалізуйте та спростіть. Просте резюме та графіка, які може зрозуміти особа, яка приймає рішення.
- Документально оформити рішення та його обґрунтування. На основі яких даних було прийнято рішення? аудиторський слід.
три міні-чохла
Випадок 1 — Джерело потрапило в потрібне місце. У минулому муніципалітет розподіляв свій бюджет на утримання парку «порівну для кожного району». Коли дані про попит і використання за 18 місяців були проаналізовані за допомогою штучного інтелекту, попит на душу населення в трьох районах був у 2,4 рази вищий за середній. Бюджет перерозподілено відповідно до потреб; загальне задоволення підвищилося без додаткових витрат.
Випадок 2 — помічено необ’єктивні дані. Агентство перегляне дані цифрових додатків і зробить висновок, що «громадяни більше не приходять до пунктів оплати». Але коли під час аналізу запитали розбивку за віком, виявилося, що заявки віком понад 65 років все ще переважно надходять з каси. Якби розглядалися лише цифрові дані, ця група була б проігнорована; збереглося касове обслуговування.
Випадок 3 — Надуманий причинно-наслідковий зв’язок припинено. Інтерпретуючи таблицю, YZ сказав: «ДТП зменшилося, тому що кількість перевірок збільшилася». Аналітик нагадав, що за цей же період також змінилася погода і зменшився трафік; Приписувати це одній причині було оманою. Доповідь було виправлено, щоб сказати, що "існує зв'язок, але причинно-наслідковий зв'язок не доведений".
Чотири шаблони, які можна копіювати
1) Знайомство з таблицею:
Ваша роль: аналітик даних. Перегляньте наведену нижче таблицю та, базуючись ЛИШЕ на значеннях у цій таблиці: (1) узагальніть, що таке кожен стовпець, його одиницю вимірювання та період, (2) будь-які клітинки, які здаються відсутніми/неправильними, (3) узагальніть 3 основні шаблони, які виділяються. Додавання чисел поза таблицею; якщо відсутні, скажіть "немає даних".TABLE: [вставити дані]
2) Зведена статистика з контекстом:
Дайте відповідь на наступне запитання з таблиці нижче: [питання]. ПОВИНЕН надати результат із контекстом: абсолютне число + ставка + період порівняння. Коли ви говорите «збільшено на X%», уточніть, якою мірою і в який період. Просто використовуйте надані дані. ТАБЛИЦЯ: [дані] ПИТАННЯ: [питання]
3) запитувач причинності:
Інтерпретуйте наступний висновок, але УВАГА: не плутайте кореляцію з причинно-наслідковим зв’язком. Згенеруйте принаймні 3 альтернативні пояснення цього зв’язку (третя змінна, зворотний напрямок, збіг). Скажіть мені, які додаткові дані потрібні для підтвердження причинності. ЗНАХОДКА: [стосунки]
4) Просте резюме для рішення:
Спростіть наступний аналіз для особи, яка приймає рішення, яка не є експертом з даних: не більше 5 пунктів, кожен елемент є висновком і поясненням «що це означає». Також чітко запишіть невизначеності та обмеження даних. Додавання нової інформації.АНАЛІЗ: [текст]
Слабка підказка / Сильна підказка
Слабкий: «Проаналізуйте цю діаграму та скажіть нам, що нам робити».
Сильно: «Ваша роль — аналітик даних. Використовуйте ЛИШЕ наведену нижче таблицю; не додавайте числа ззовні, не кажіть «немає даних» у відсутню комірку. Спочатку ознайомтеся зі стовпцями, одиницями вимірювання та періодом. Потім дайте відповідь на запитання «яка околиця має найдовший час вирішення» за допомогою абсолютного числа + відношення + періоду порівняння. Якщо ви знайшли закономірність, придумайте 3 альтернативні пояснення, перш ніж пояснювати її причинно-наслідковими зв’язками. Нарешті, перелічіть точки та межі даних (відсутня група, короткий період), які залишають рішення за нами."
Відмінність: сильна підказка разом встановлює точність даних, контекст, дисципліну причинно-наслідкового зв’язку та межу прийняття рішень; Результатом є обґрунтований аналіз.
Де ШІ можна довіряти в бізнесі даних?
бізнес
ШІ довіра
правило
Зведення таблиці, групування
висока
Лише дані
Позначення аномалії/шаблону
середній
людське підтвердження
Інтерпретація причинності
низький
Потрібне альтернативне пояснення
Заповнення відсутніх даних
занадто низький
Не робіть цього можливим; "немає даних"
Спрощення/візуальне резюме
висока
Сенс треба зберегти
Дизайн індикатора та оманлива діаграма
Найважливішим кроком у прийнятті рішень на основі даних є вибір правильного показника (числовий вираз, який робить явище вимірним, наприклад, «середній час обробки» або «вартість за заявку»). Неправильний показник призводить до неправильного рішення навіть за точних даних: хоча «загальна кількість вирішених претензій» здається зростаючою, «час очікування на одного громадянина» може погіршуватися. ШІ може перерахувати потенційні індикатори для теми та те, що кожен вимірює та приховує; але ви вирішуєте, який показник справді представляє суспільний інтерес. Також пам’ятайте про ризик оманливої візуалізації (викривлення сприйняття за допомогою таких методів, як вісь, що не починається з нуля, непропорційний масштаб, вибраний часовий інтервал) на графіках, які пропонує або описує AI; чесне візуальне зображення в публічних даних є частиною управління.
Міні футляр — неправильний знак, неправильна похвала. Один підрозділ бив рекорди за показником «кількість закритих справ за місяць»; але скарги громадян зросли. Дивлячись на точний показник, «коефіцієнт розв’язання першого контакту», показник впав з 58 відсотків до 44 відсотків — файли швидко закривалися та знову відкривалися. При зміні показника змінився і пріоритет управління.
Mini case — вісь, яка не починається з нуля. На графіку штучного інтелекту, описаному в презентації, вертикальна вісь починається з 40, збільшення на 2 відсотки здається різким стрибком. При переміщенні осі на нуль вимальовувалась реальна картина і рішення виключалося з перебільшеного сприйняття.
Шаблон, який підтримує вибір індикатора:
Завдання: Запропонуйте 5 індикаторів-кандидатів для наступної мети. Мета: [напр. покращення якості обслуговування громадян] Для кожного показника: що він вимірює | що це може приховувати | відкритість до маніпуляцій | рекомендована частота читання. Далі: напишіть 3 попередження (ті, які самі по собі вводять в оману), щоб прочитати ці показники разом. Правило: не виводьте цифри; просто запропонуйте дизайн індикатора.
Застереження: не впадайте в помилкову думку, що «число є об’єктивним». Яке число ви вимірюєте, як ви його відображаєте та який діапазон ви обираєте – все це питання інтерпретації. Прозоре та чесне публічне тлумачення є таким же важливим, як і наявність точних даних.
Поширені помилки
- Помилково приймаючи кореляцію за причинно-наслідковий зв’язок. «Збільшення разом» не є причиною; Шукайте альтернативні пояснення.
- ШІ заповнює відсутні дані. Аналіз згортається з придуманим значенням; залишити відсутнім.
- Узагальнення необ’єктивних даних. Скарга/цифрові дані не представляють усіх; Зробіть запит про відсутню групу.
- Подання номера без контексту. Поруч із коефіцієнтом має бути абсолютне число та період порівняння.
- Невиправданий аналіз персональних даних. Не використовуйте індивідуальну ідентифікацію, якщо сукупних даних достатньо.
- Не документальне оформлення рішення. Яке рішення було прийнято, на основі яких даних необхідно записати для аудиту.
Підсумовуючи
Прийняття рішень на основі даних є найпотужнішим способом справедливого й ефективного розподілу ресурсів у державному секторі; ШІ — швидкий помічник у цьому бізнесі, який розбирає картинку, знаходить закономірності та спрощує пошук. Але не змушуйте ШІ складати цифри, не змушуйте його заповнювати відсутні дані, не дозволяйте йому плутати кореляцію з причинно-наслідковим зв’язком і уникайте узагальнення необ’єктивних/неповних даних. Сила в кількості; Людина, яка правильно його інтерпретує і документує рішення, є сильнішою.
Аплікаційне завдання
Отримайте справжню (без особистих даних) таблицю зі свого пристрою. Введіть дані за допомогою шаблону «Знайомство з таблицею», а потім дайте відповідь на важливе питання для прийняття рішення за допомогою шаблону «Зведена контекстна статистика». Застосуйте шаблон «Запитувач причинно-наслідкових зв’язків» до зв’язку, що виникає, і знайдіть принаймні одне альтернативне пояснення. Перевірте, чи ШІ додає числа поза таблицею.
контрольний список
- [ ] ШІ використовував лише задану таблицю; Чисел ззовні він не додавав.
- [ ] Я не заповнив відсутні дані; Я залишив це як "немає даних".
- [ ] Я представив кожен результат із контекстом (абсолютне число + ставка + період).
- [ ] Я надав альтернативне пояснення до тверджень про причинність.
- [ ] Я оцінив ризик необ’єктивних/відсутніх даних і відсутню групу.
- [ ] Я задокументував рішення та дані, на яких воно базувалося.