Печалби:
- Разпознава опасностите за качеството, поверителността и интерпретацията при работа с данни и установява сигурен поток на анализ.
- Той избира правилния индикатор за цел, като прави разлика между подвеждащи единични индикатори и измервания, които са отворени за манипулиране.
- Той разпознава подвеждащи техники на диаграма (ос не започва от нула, избран диапазон) и наблюдава честна визуализация.
Обществеността произвежда данни всеки ден: брой заявки, срокове за решаване, бюджетни позиции, движения на населението, заявки за услуги, резултати от одит, проучвания на удовлетвореността. Повечето от тези данни се намират в електронни таблици, формуляри и системи за запис на Excel, но не се превръщат в решения - защото анализирането им изисква опит и време. Вземането на решения въз основа на данни (подход за разпределяне на ресурси и определяне на политика въз основа на измерени доказателства, а не на мнение или навик) повишава както ефективността, така и справедливостта в публичния сектор: ресурсите отиват там, където са най-необходими въз основа на числа. Тук изкуственият интелект е мощен помощник при осмисляне на таблица, намиране на модели и аномалии, извличане на обобщена статистика и превеждане на констатациите в прости изречения. В този модул ще видите как да съкратите пътя от необработени публични данни до защитимо решение с AI и да останете дисциплинирани в най-критичния аспект – правилното тълкуване на числото.
Три опасности при работа с данни
Данните са мощни, но имат три капана и AI може както да смекчи, така и да увеличи тези капани:
- Корелация ≠ причинно-следствена връзка. Само защото две неща се променят заедно, не означава, че едното причинява другото. Продажбите на сладолед и удавянията се увеличават — защото и двете са свързани с летните горещини, а не едното причинява другото. AI плавно конструира изречения „защото“; Подлагайте на съмнение всяко твърдение за причинно-следствена връзка.
- Пристрастни/липсващи данни. От кого и как са събрани данните? Данните за жалби отразяват само онези, които могат да се оплачат; данни за цифрови приложения, които имат достъп до интернет. Ако не виждате липсващата група, решението ще бъде предубедено.
- Номер без контекст. Само "увеличени с 30%" е безсмислено: според какво, в кой период, колко е абсолютната цифра? Попитайте AI за контекст.
Внимание: Докато AI анализира предоставената от вас таблица, той понякога добавя „разумни“, но фиктивни числа извън таблицата или безшумно попълва липсващите клетки. Сравнете всяко изходно число с изходната таблица; Дайте на AI правилото „използвайте само стойностите в таблицата, която ви давам, ако липсват, кажете „няма данни““.
Стъпка по стъпка поток от анализ на данни
- Изяснете въпроса. На какъв въпрос търсим отговор за решението? („В кой квартал времето за решение отнема най-дълго?“)
- Познайте данните. Какви са колоните, каква е мерната единица, какъв е периодът, има ли липсващи/неправилни стойности?
- Извличане на лични данни. Анонимизиране/обединяване, ако индивидуалната идентификация не е необходима за анализ (вижте Раздел 11).
- Появяват се обобщение и модел. Накарайте изкуствения интелект да извършва основна статистика, групиране и маркиране на аномалии.
- Поставете под въпрос коментара. Корелация или причинно-следствена връзка? Алтернативно обяснение? Липсваща група?
- Визуализирайте и опростете. Просто резюме и графика, които вземащият решение могат да разберат.
- Документирайте решението и мотивите му. Какво решение е взето въз основа на какви данни? одитна пътека.
три мини калъфа
Случай 1 — Източникът отиде на правилното място. В миналото една община разпределяше бюджета си за поддръжка на парка „поравно за всеки квартал“. Когато данните за търсенето и употребата за 18 месеца бяха анализирани с AI, търсенето на глава от населението в трите квартала беше 2,4 пъти по-високо от средното. Бюджетът беше преразпределен според нуждите; цялостното удовлетворение се повишава, без допълнителни разходи.
Случай 2 — Забелязани са пристрастни данни. Агенция ще разгледа данните от цифровите приложения и ще заключи, че „гражданите вече не идват на пунктовете за плащане на пътни такси“. Но когато в анализа беше поискана разбивка по възраст, се видя, че молбите на възраст над 65 години все още идват предимно от гишето. Ако се разглеждат само цифрови данни, тази група ще бъде игнорирана; се запази касовото обслужване.
Случай 3 — Спряна измислена причинно-следствена връзка. Докато тълкуваше таблица, YZ каза: „Произшествията намаляха, защото броят на проверките се увеличи.“ Анализаторът припомни, че времето също се промени и трафикът намаля през същия период; Приписването му на една единствена причина беше подвеждащо. Докладът беше коригиран, за да се каже, че „има връзка, но причинно-следствената връзка не е доказана“.
Четири копируеми шаблона
1) Запознаване с таблицата:
Вашата роля: анализатор на данни. Разгледайте таблицата по-долу и въз основа САМО на стойностите в тази таблица: (1) обобщете какво представлява всяка колона, нейната единица и период, (2) всички клетки, които изглеждат липсващи/неправилни, (3) обобщете първите 3 модела, които се открояват. Събиране на числа извън таблицата; ако липсва, кажете „няма данни“. ТАБЛИЦА: [поставяне на данни]
2) Обобщена статистика с контекст:
Отговорете на следния въпрос от таблицата по-долу: [въпрос]. ТРЯБВА да даде резултата с контекст: абсолютно число + курс + период на сравнение. Когато казвате "увеличени с X%", уточнете до каква степен и в какъв период. Просто използвайте дадените данни. ТАБЛИЦА: [данни] ВЪПРОС: [въпрос]
3) Въпросник за причинно-следствената връзка:
Тълкувайте следното откритие, но ВНИМАНИЕ: не бъркайте корелацията с причинно-следствената връзка. Генерирайте поне 3 алтернативни обяснения за тази връзка (трета променлива, обратна посока, съвпадение). Кажете ми какви допълнителни данни са необходими за доказване на причинно-следствената връзка. НАХОДКА: [връзка]
4) Просто резюме за решението:
Опростете следния анализ за човек, който взема решения, който не е експерт по данни: не повече от 5 елемента, всеки елемент е констатация и обяснение „какво означава това“. Също така запишете ясно несигурностите и ограниченията на данните. Добавяне на нова информация.АНАЛИЗ: [текст]
Слаба подкана / Силна подкана
Слаб: „Анализирайте тази диаграма и ни кажете какво трябва да направим.“
Силно: „Вашата роля е анализатор на данни. Използвайте САМО таблицата по-долу; не добавяйте числа отвън, казвайте „няма данни“ на липсващата клетка. Първо се запознайте с колоните, единиците и периода. След това отговорете на въпроса „кой квартал има най-дълго време за решение“ с абсолютно число + съотношение + период на сравнение. Ако намерите модел, измислете 3 алтернативни обяснения, преди да го обясните с причинно-следствена връзка. Накрая избройте точките и граници на данните (липсваща група, кратък период), които оставят решението на нас."
Разлика: силната подкана установява заедно верността на данните, контекста, причинно-следствената връзка и границата на вземане на решения; Резултатът е защитим анализ.
Къде може да се разчита на AI в бизнеса с данни?
бизнес
AI доверие
правило
Обобщение на таблица, групиране
високо
Дадени са само данни
Маркиране на аномалия/модел
среден
човешко потвърждение
Тълкуване на причинно-следствената връзка
ниско
Необходимо е алтернативно обяснение
Попълване на липсващи данни
твърде ниско
Не го карайте да се случва; "няма данни"
Опростяване/визуално обобщение
високо
Смисълът трябва да се запази
Дизайн на индикатора и капан за подвеждаща диаграма
Най-критичната стъпка при вземането на решения с данни е изборът на правилния индикатор (числовият израз, който прави дадено явление измеримо – например „средно време за обработка“ или „цена на приложение“). Грешният индикатор води до грешно решение, дори и при точни данни: докато „общият брой решени искове“ изглежда нараства, „времето за изчакване на гражданин“ може да се влошава. AI може да изброява кандидат-индикатори за дадена тема и какво всеки измерва и крие; но вие решавате кой индикатор наистина представлява обществения интерес. Също така имайте предвид риска от подвеждаща визуализация (изкривяване на възприятието с техники като оста, която не започва от нула, непропорционален мащаб, избран интервал от време) в графиките, които AI предлага или описва; честното визуализиране на публичните данни е част от управлението.
Мини калъф — грешен знак, грешно хвалене. Едно звено чупи рекорди по показателя „брой затворени файлове на месец“; но оплакванията на гражданите се увеличиха. Ако погледнем точния индикатор, „процентът на разрешаване при първи контакт“, процентът спадна от 58 процента на 44 процента – файловете се затваряха и отваряха отново бързо. Когато индикаторът се промени, приоритетът на управление също се промени.
Мини случай — ос, която не започва от нула. На графиката AI, описана в презентация, вертикалната ос започва от 40, увеличение от 2 процента изглеждаше като драматичен скок. Когато оста беше преместена на нула, се появи реалната картина и решението беше елиминирано от преувеличеното възприятие.
Шаблон, който поддържа избор на индикатор:
Задача: Предложете 5 кандидат-индикатора за следната цел. Цел: [напр. подобряване на качеството на услугата за гражданите]За всеки показател: какво измерва | какво може да крие | отвореност към манипулация | препоръчителна честота на четене. Следва: напишете 3 предупреждения (тези, които са подвеждащи сами по себе си), за да прочетете тези индикатори заедно. Правило: Не произвеждайте числа; просто предложете дизайн на индикатора.
Внимание: Не изпадайте в погрешното схващане, че „числото е обективно“. Какво число измервате, как го показвате и какъв диапазон избирате, всичко това е въпрос на тълкуване. Прозрачното и честно публично тълкуване е толкова важно, колкото и наличието на точни данни.
Често срещани грешки
- Грешна корелация за причинно-следствена връзка. „Увеличени заедно“ не е причината; Потърсете алтернативни обяснения.
- Като AI попълва липсващите данни. Анализът се срива с измислена стойност; оставям липсващото липсващо.
- Обобщаване на пристрастни данни. Жалбите/цифровите данни не представляват всички; Запитване за липсващата група.
- Представяне на номера без контекст. До съотношението трябва да има абсолютно число и период на сравнение.
- Ненужно анализиране на лични данни. Не използвайте индивидуална идентификация, ако обобщените данни са достатъчни.
- Без документиране на решението. Какво решение е взето въз основа на това кои данни трябва да бъдат записани за одит.
В обобщение
Вземането на решения, базирано на данни, е най-мощният начин за справедливо и ефективно разпределение на ресурсите в публичния сектор; AI е бърз помощник в този бизнес, който осмисля картината, намира модели и опростява намирането. Но не карайте AI да измисля числа, не го карайте да попълва липсващи данни, не му позволявайте да бърка корелацията с причинно-следствената връзка и избягвайте обобщаването на пристрастни/непълни данни. Има сила в числата; Човекът, който го тълкува правилно и документира решението, е по-силен.
Задача за приложение
Вземете истинска (без лични данни) таблица от вашето устройство. Въведете данните с шаблона „Запознаване с таблицата“, след което отговорете на важен въпрос за решението с шаблона „Контекстуална обобщена статистика“. Приложете шаблона „Въпросник за причинно-следствената връзка“ към възникваща връзка и намерете поне едно алтернативно обяснение. Проверете дали AI добавя числа извън таблицата.
контролен списък
- [ ] AI използва само дадената таблица; Не е добавял номера отвън.
- [ ] Не съм попълнил липсващите данни; Оставих го като "няма данни".
- [ ] Представих всеки резултат с контекст (абсолютно число + процент + период).
- [ ] Дадох алтернативно обяснение на твърденията за причинно-следствена връзка.
- [ ] Оцених риска от пристрастни/липсващи данни и липсващата група.
- [ ] Документирах решението и данните, на които се основаваше.