zisky:
- Rozpoznává rizika spojená s kvalitou, důvěrností a interpretací práce s daty a zavádí bezpečný tok analýzy.
- Vybírá správný indikátor pro daný účel, přičemž rozlišuje mezi zavádějícími jednotlivými indikátory a měřeními, která jsou přístupná manipulaci.
- Rozpoznává zavádějící techniky grafů (osa nezačíná od nuly, zvolený rozsah) a dodržuje poctivou vizualizaci.
Veřejnost vytváří data každý den: čísla aplikací, časy řešení, rozpočtové položky, pohyby obyvatelstva, požadavky na služby, výsledky auditů, průzkumy spokojenosti. Většina těchto dat je uložena v excelových tabulkách, formulářích a záznamových systémech, ale nepromítá se do rozhodnutí – protože jejich analýza vyžaduje odborné znalosti a čas. Rozhodování založené na datech (přístup k alokaci zdrojů a stanovování politiky na základě změřených důkazů, spíše než názoru nebo zvyku) zvyšuje efektivitu i spravedlnost ve veřejném sektoru: zdroje jdou tam, kde jsou nejvíce potřeba, na základě čísel. Umělá inteligence je zde výkonným pomocníkem při vytváření smyslu tabulky, hledání vzorů a anomálií, získávání souhrnných statistik a převádění zjištění do jednoduchých vět. V této jednotce uvidíte, jak zkrátit cestu od nezpracovaných veřejných dat k obhajitelnému rozhodnutí pomocí AI a zachovat si disciplínu v tom nejkritičtějším aspektu – správné interpretaci čísla.
Tři nebezpečí práce s daty
Data jsou výkonná, ale mají tři pasti a umělá inteligence může tyto pasti zmírnit i zvětšit:
- Korelace ≠ příčinná souvislost. To, že se dvě věci mění společně, neznamená, že jedna způsobuje druhou. Prodej zmrzliny a utonutí jsou na vzestupu – protože obojí je spojeno s letními horky, ne jedno způsobuje druhé. AI plynule konstruuje věty „protože“; Zpochybňujte každé tvrzení o kauzalitě.
- Zkreslená/chybějící data. Od koho a jak byla data sbírána? Údaje o stížnostech odrážejí pouze ty, kteří si mohou stěžovat; digitální aplikační data s přístupem k internetu. Pokud chybějící skupinu nevidíte, rozhodnutí bude neobjektivní.
- Číslo bez kontextu. Samotné „zvýšeno o 30 %“ je nesmyslné: podle čeho, v jakém období, jaké je absolutní číslo? Zeptejte se AI na kontext.
Pozor: Zatímco AI analyzuje vámi poskytnutou tabulku, někdy přidá „rozumná“, ale fiktivní čísla z vnějšku tabulky nebo tiše doplní chybějící buňky. Porovnejte každé výstupní číslo se zdrojovou tabulkou; Dejte AI pravidlo „použijte pouze hodnoty v tabulce, kterou vám dám, pokud chybí, řekněte „žádná data“.
Tok analýzy dat krok za krokem
- Vyjasněte otázku. Na jakou otázku hledáme odpovědi pro rozhodnutí? ("Ve které čtvrti trvá řešení nejdéle?")
- Znát data. Jaké jsou sloupce, jaká je jednotka, jaké je období, chybí nějaké/nesprávné hodnoty?
- Extrahujte osobní údaje. Anonymizovat/agregovat, pokud pro analýzu není vyžadována individuální identifikace (viz jednotka 11).
- Objeví se souhrn a vzorec. Nechte AI provádět základní statistiky, seskupování a označování anomálií.
- Zeptejte se na komentář. Korelace nebo kauzalita? Alternativní vysvětlení? Chybějící skupina?
- Vizualizujte a zjednodušte. Jednoduché shrnutí a grafické znázornění, kterému porozumí osoba s rozhodovací pravomocí.
- Zdokumentujte rozhodnutí a jeho odůvodnění. Jaké rozhodnutí bylo učiněno na základě jakých údajů? auditní stopa.
tři mini pouzdra
Případ 1 — Zdroj šel na správné místo. V minulosti obec rozdělovala svůj rozpočet na údržbu parku „stejně do každé čtvrti“. Když byly údaje o poptávce a využití za 18 měsíců analyzovány pomocí AI, byla poptávka na hlavu ve třech čtvrtích 2,4krát vyšší než průměr. Rozpočet byl přerozdělován podle potřeby; celková spokojenost vzrostla bez dalších nákladů.
Případ 2 – Byla zaznamenána neobjektivní data. Agentura by se podívala na data z digitálních aplikací a došla by k závěru, že „občané již nepřicházejí k mýtné budce“. Ale když bylo v analýze požadováno rozdělení podle věku, bylo vidět, že žádosti starší 65 let stále většinou přicházely z přepážky. Pokud by se sledovala pouze digitální data, tato skupina by byla ignorována; pokladní služba byla zachována.
Případ 3 – Vymyšlená příčinná souvislost zastavena. Při interpretaci tabulky YZ řekl: "Nehod se snížil, protože se zvýšil počet kontrol." Analytik připomněl, že se ve stejném období změnilo i počasí a poklesl provoz; Připisovat to jedné příčině bylo zavádějící. Zpráva byla opravena, že „existuje vztah, ale příčinná souvislost nebyla prokázána“.
Čtyři kopírovatelné šablony
1) Seznámení s tabulkou:
Vaše role: datový analytik. Prohlédněte si níže uvedenou tabulku a na základě POUZE hodnot v této tabulce: (1) shrňte, co je každý sloupec, jeho jednotku a období, (2) všechny buňky, které se zdají chybějící/nesprávné, (3) shrňte 3 nejlepší vzory, které vyčnívají. Přidávání čísel mimo tabulku; pokud chybí, řekněte "no data".TABLE: [paste data]
2) Souhrnná statistika s kontextem:
Odpovězte na následující otázku z tabulky níže: [otázka]. MUSÍ dát výsledek s kontextem: absolutní číslo + sazba + období porovnání. Když řeknete „zvýšeno o X %“, uveďte v jakém rozsahu a v jakém období. Stačí použít daná data.TABULKA: [data] OTÁZKA: [dotaz]
3) Tazatel na kauzalitu:
Interpretujte následující zjištění, ale POZOR: nezaměňujte korelaci s kauzalitou. Vygenerujte alespoň 3 alternativní vysvětlení tohoto vztahu (třetí proměnná, obrácený směr, náhoda). Řekněte mi, jaké další údaje jsou potřeba k prokázání kauzality. NALEZENÍ: [vztah]
4) Jednoduché shrnutí pro rozhodnutí:
Zjednodušte následující analýzu pro osobu s rozhodovací pravomocí, která není odborníkem na data: ne více než 5 položek, každá položka je nález a vysvětlení „co to znamená“. Jasně také zapište nejistoty a limity dat. Přidávání nových informací.ANALÝZA: [text]
Slabá výzva / Silná výzva
Slabý: "Analyzujte tuto tabulku a řekněte nám, co bychom měli dělat."
Strong: "Vaše role je analytik dat. Používejte POUZE níže uvedenou tabulku; nepřidávejte čísla zvenčí, neříkejte 'žádná data' do chybějící buňky. Nejprve se seznamte se sloupci, jednotkami a obdobím. Poté odpovězte na otázku 'která čtvrť má nejdelší dobu řešení' absolutním číslem + poměr + období srovnání. Pokud najdete vzor, vymyslete 3 alternativní vysvětlení, než jej vysvětlíte a vypište hranice skupin, zkrácení období.) které nechají rozhodnutí na nás."
Rozdíl: silná pobídka vytváří věrnost dat, kontext, disciplínu kauzality a hranici rozhodování; Výstupem je obhajitelná analýza.
Kde lze AI věřit v datovém byznysu?
podnikání
AI důvěra
pravidlo
Souhrn tabulky, seskupování
vysoká
Pouze údaje
Značení anomálie/vzoru
střední
lidské potvrzení
Interpretace kauzality
nízká
Je vyžadováno alternativní vysvětlení
Doplnění chybějících údajů
příliš nízké
Nedělejte to; "žádná data"
Zjednodušení/vizuální shrnutí
vysoká
Smysl musí být zachován
Design indikátoru a zavádějící graf past
Nejdůležitějším krokem při rozhodování s daty je výběr správného indikátoru (číselné vyjádření, které činí jev měřitelný – například „průměrná doba zpracování“ nebo „cena na aplikaci“). Nesprávný ukazatel vede k nesprávnému rozhodnutí, a to i s přesnými údaji: zatímco se zdá, že „celkový počet vyřešených nároků“ roste, „čekací doba na občana“ se může zhoršovat. Umělá inteligence může uvést kandidátské indikátory pro téma a to, co každý měří a skrývá; ale vy rozhodnete, který ukazatel skutečně reprezentuje veřejný zájem. Uvědomte si také riziko zavádějící vizualizace (zkreslení vnímání technikami, jako je osa nezačínající od nuly, nepřiměřené měřítko, zvolený časový interval) v grafech, které AI navrhuje nebo popisuje; poctivý obraz ve veřejných datech je součástí řízení.
Mini případ — špatné znamení, špatné vychloubání. Jedna jednotka lámala rekordy v ukazateli „počet uzavřených spisů za měsíc“; ale stížností občanů přibývalo. Podíváme-li se na přesný ukazatel, „míru vyřešení prvního kontaktu“, míra klesla z 58 procent na 44 procent – soubory byly rychle zavírány a znovu otevírány. Když se indikátor změnil, změnila se také priorita řízení.
Mini case — osa, která nezačíná od nuly. Na grafu AI popsaném v prezentaci začíná vertikální osa na 40, nárůst o 2 procenta vypadal jako dramatický skok. Když byla osa posunuta na nulu, vynořil se skutečný obraz a rozhodnutí bylo vyloučeno z přehnaného vnímání.
Šablona, která podporuje výběr indikátoru:
Úkol: Navrhněte 5 kandidátních indikátorů pro následující účel. Účel: [např. zlepšení kvality služeb občanům]Pro každý ukazatel: co měří | co může skrývat | otevřenost k manipulaci | doporučená četnost čtení. Dále: napište 3 varování (ta, která jsou sama o sobě zavádějící), abyste tyto indikátory četli společně. Pravidlo: Nevytvářejte čísla; stačí navrhnout návrh indikátoru.
Pozor: Nepodléhejte mylné představě, že „číslo je objektivní“. Jaké číslo měříte, jak je zobrazujete a jaký rozsah zvolíte, to vše je věcí interpretace. Transparentní a poctivý veřejný výklad je stejně důležitý jako mít přesná data.
Časté chyby
- Záměna korelace za příčinnou souvislost. "Zvýšené dohromady" není příčinou; Hledejte alternativní vysvětlení.
- Nechat AI doplnit chybějící data. Analýza se zhroutí s vytvořenou hodnotou; chybějící nechat chybět.
- Zobecnění zkreslených dat. Stížnost/digitální data nereprezentují každého; Dotaz na chybějící skupinu.
- Prezentace čísla bez kontextu. Vedle poměru by mělo být absolutní číslo a období porovnání.
- Zbytečná analýza osobních údajů. Nepoužívejte individuální identifikaci, pokud jsou dostatečná agregovaná data.
- Nedoložení rozhodnutí. Jaké rozhodnutí bylo učiněno na základě toho, která data by měla být zaznamenána pro audit.
V souhrnu
Rozhodování založené na datech je nejúčinnějším způsobem, jak spravedlivě a efektivně rozdělovat zdroje ve veřejném sektoru; Umělá inteligence je v tomto oboru rychlým pomocníkem, který dává obrázku smysl, nachází vzory a zjednodušuje hledání. Ale nevytvářejte si z AI čísla, nenuťte je doplňovat chybějící data, nenechte ji zaměňovat korelaci s kauzalitou a vyvarujte se zobecňování zkreslených/neúplných dat. V číslech je síla; Silnější je ten, kdo si to správně vyloží a zdokumentuje rozhodnutí.
Aplikační úkol
Získejte ze své jednotky skutečnou tabulku (odstraněná z osobních údajů). Zaveďte data pomocí šablony "Seznámení s tabulkou" a poté si nechte zodpovědět důležitou otázku pro rozhodnutí pomocí šablony "Kontextové souhrnné statistiky". Použijte šablonu „tazatel příčinné souvislosti“ na vznikající vztah a najděte alespoň jedno alternativní vysvětlení. Zkontrolujte, zda AI přidává čísla mimo tabulku.
kontrolní seznam
- [ ] AI použila pouze danou tabulku; Čísla zvenčí nedodal.
- [ ] Nedoplnil jsem chybějící údaje; Nechal jsem to jako "žádná data".
- [ ] Každý výsledek jsem uvedl s kontextem (absolutní číslo + sazba + tečka).
- [ ] Předložil jsem alternativní vysvětlení k tvrzením o kauzalitě.
- [ ] Vyhodnotil jsem riziko zkreslení/chybějících dat a chybějící skupiny.
- [ ] Doložil jsem rozhodnutí a údaje, na kterých bylo založeno.