Jednotka 7 / 11

Rozhodnutí na základě dat a analýza veřejných dat

zisky:

  • Rozpoznává rizika spojená s kvalitou, důvěrností a interpretací práce s daty a zavádí bezpečný tok analýzy.
  • Vybírá správný indikátor pro daný účel, přičemž rozlišuje mezi zavádějícími jednotlivými indikátory a měřeními, která jsou přístupná manipulaci.
  • Rozpoznává zavádějící techniky grafů (osa nezačíná od nuly, zvolený rozsah) a dodržuje poctivou vizualizaci.

Veřejnost vytváří data každý den: čísla aplikací, časy řešení, rozpočtové položky, pohyby obyvatelstva, požadavky na služby, výsledky auditů, průzkumy spokojenosti. Většina těchto dat je uložena v excelových tabulkách, formulářích a záznamových systémech, ale nepromítá se do rozhodnutí – protože jejich analýza vyžaduje odborné znalosti a čas. Rozhodování založené na datech (přístup k alokaci zdrojů a stanovování politiky na základě změřených důkazů, spíše než názoru nebo zvyku) zvyšuje efektivitu i spravedlnost ve veřejném sektoru: zdroje jdou tam, kde jsou nejvíce potřeba, na základě čísel. Umělá inteligence je zde výkonným pomocníkem při vytváření smyslu tabulky, hledání vzorů a anomálií, získávání souhrnných statistik a převádění zjištění do jednoduchých vět. V této jednotce uvidíte, jak zkrátit cestu od nezpracovaných veřejných dat k obhajitelnému rozhodnutí pomocí AI a zachovat si disciplínu v tom nejkritičtějším aspektu – správné interpretaci čísla.

Tři nebezpečí práce s daty

Data jsou výkonná, ale mají tři pasti a umělá inteligence může tyto pasti zmírnit i zvětšit:

  1. Korelace ≠ příčinná souvislost. To, že se dvě věci mění společně, neznamená, že jedna způsobuje druhou. Prodej zmrzliny a utonutí jsou na vzestupu – protože obojí je spojeno s letními horky, ne jedno způsobuje druhé. AI plynule konstruuje věty „protože“; Zpochybňujte každé tvrzení o kauzalitě.
  2. Zkreslená/chybějící data. Od koho a jak byla data sbírána? Údaje o stížnostech odrážejí pouze ty, kteří si mohou stěžovat; digitální aplikační data s přístupem k internetu. Pokud chybějící skupinu nevidíte, rozhodnutí bude neobjektivní.
  3. Číslo bez kontextu. Samotné „zvýšeno o 30 %“ je nesmyslné: podle čeho, v jakém období, jaké je absolutní číslo? Zeptejte se AI na kontext.
Pozor: Zatímco AI analyzuje vámi poskytnutou tabulku, někdy přidá „rozumná“, ale fiktivní čísla z vnějšku tabulky nebo tiše doplní chybějící buňky. Porovnejte každé výstupní číslo se zdrojovou tabulkou; Dejte AI pravidlo „použijte pouze hodnoty v tabulce, kterou vám dám, pokud chybí, řekněte „žádná data“.

Tok analýzy dat krok za krokem

  1. Vyjasněte otázku. Na jakou otázku hledáme odpovědi pro rozhodnutí? ("Ve které čtvrti trvá řešení nejdéle?")
  2. Znát data. Jaké jsou sloupce, jaká je jednotka, jaké je období, chybí nějaké/nesprávné hodnoty?
  3. Extrahujte osobní údaje. Anonymizovat/agregovat, pokud pro analýzu není vyžadována individuální identifikace (viz jednotka 11).
  4. Objeví se souhrn a vzorec. Nechte AI provádět základní statistiky, seskupování a označování anomálií.
  5. Zeptejte se na komentář. Korelace nebo kauzalita? Alternativní vysvětlení? Chybějící skupina?
  6. Vizualizujte a zjednodušte. Jednoduché shrnutí a grafické znázornění, kterému porozumí osoba s rozhodovací pravomocí.
  7. Zdokumentujte rozhodnutí a jeho odůvodnění. Jaké rozhodnutí bylo učiněno na základě jakých údajů? auditní stopa.

tři mini pouzdra

Případ 1 — Zdroj šel na správné místo. V minulosti obec rozdělovala svůj rozpočet na údržbu parku „stejně do každé čtvrti“. Když byly údaje o poptávce a využití za 18 měsíců analyzovány pomocí AI, byla poptávka na hlavu ve třech čtvrtích 2,4krát vyšší než průměr. Rozpočet byl přerozdělován podle potřeby; celková spokojenost vzrostla bez dalších nákladů.

Případ 2 – Byla zaznamenána neobjektivní data. Agentura by se podívala na data z digitálních aplikací a došla by k závěru, že „občané již nepřicházejí k mýtné budce“. Ale když bylo v analýze požadováno rozdělení podle věku, bylo vidět, že žádosti starší 65 let stále většinou přicházely z přepážky. Pokud by se sledovala pouze digitální data, tato skupina by byla ignorována; pokladní služba byla zachována.

Případ 3 – Vymyšlená příčinná souvislost zastavena. Při interpretaci tabulky YZ řekl: "Nehod se snížil, protože se zvýšil počet kontrol." Analytik připomněl, že se ve stejném období změnilo i počasí a poklesl provoz; Připisovat to jedné příčině bylo zavádějící. Zpráva byla opravena, že „existuje vztah, ale příčinná souvislost nebyla prokázána“.

Čtyři kopírovatelné šablony

1) Seznámení s tabulkou:

Vaše role: datový analytik. Prohlédněte si níže uvedenou tabulku a na základě POUZE hodnot v této tabulce: (1) shrňte, co je každý sloupec, jeho jednotku a období, (2) všechny buňky, které se zdají chybějící/nesprávné, (3) shrňte 3 nejlepší vzory, které vyčnívají. Přidávání čísel mimo tabulku; pokud chybí, řekněte "no data".TABLE: [paste data]

2) Souhrnná statistika s kontextem:

Odpovězte na následující otázku z tabulky níže: [otázka]. MUSÍ dát výsledek s kontextem: absolutní číslo + sazba + období porovnání. Když řeknete „zvýšeno o X %“, uveďte v jakém rozsahu a v jakém období. Stačí použít daná data.TABULKA: [data] OTÁZKA: [dotaz]

3) Tazatel na kauzalitu:

Interpretujte následující zjištění, ale POZOR: nezaměňujte korelaci s kauzalitou. Vygenerujte alespoň 3 alternativní vysvětlení tohoto vztahu (třetí proměnná, obrácený směr, náhoda). Řekněte mi, jaké další údaje jsou potřeba k prokázání kauzality. NALEZENÍ: [vztah]

4) Jednoduché shrnutí pro rozhodnutí:

Zjednodušte následující analýzu pro osobu s rozhodovací pravomocí, která není odborníkem na data: ne více než 5 položek, každá položka je nález a vysvětlení „co to znamená“. Jasně také zapište nejistoty a limity dat. Přidávání nových informací.ANALÝZA: [text]

Slabá výzva / Silná výzva

Slabý: "Analyzujte tuto tabulku a řekněte nám, co bychom měli dělat."

Strong: "Vaše role je analytik dat. Používejte POUZE níže uvedenou tabulku; nepřidávejte čísla zvenčí, neříkejte 'žádná data' do chybějící buňky. Nejprve se seznamte se sloupci, jednotkami a obdobím. Poté odpovězte na otázku 'která čtvrť má nejdelší dobu řešení' absolutním číslem + poměr + období srovnání. Pokud najdete vzor, vymyslete 3 alternativní vysvětlení, než jej vysvětlíte a vypište hranice skupin, zkrácení období.) které nechají rozhodnutí na nás."

Rozdíl: silná pobídka vytváří věrnost dat, kontext, disciplínu kauzality a hranici rozhodování; Výstupem je obhajitelná analýza.

Kde lze AI věřit v datovém byznysu?

podnikání

AI důvěra

pravidlo

Souhrn tabulky, seskupování

vysoká

Pouze údaje

Značení anomálie/vzoru

střední

lidské potvrzení

Interpretace kauzality

nízká

Je vyžadováno alternativní vysvětlení

Doplnění chybějících údajů

příliš nízké

Nedělejte to; "žádná data"

Zjednodušení/vizuální shrnutí

vysoká

Smysl musí být zachován

Design indikátoru a zavádějící graf past

Nejdůležitějším krokem při rozhodování s daty je výběr správného indikátoru (číselné vyjádření, které činí jev měřitelný – například „průměrná doba zpracování“ nebo „cena na aplikaci“). Nesprávný ukazatel vede k nesprávnému rozhodnutí, a to i s přesnými údaji: zatímco se zdá, že „celkový počet vyřešených nároků“ roste, „čekací doba na občana“ se může zhoršovat. Umělá inteligence může uvést kandidátské indikátory pro téma a to, co každý měří a skrývá; ale vy rozhodnete, který ukazatel skutečně reprezentuje veřejný zájem. Uvědomte si také riziko zavádějící vizualizace (zkreslení vnímání technikami, jako je osa nezačínající od nuly, nepřiměřené měřítko, zvolený časový interval) v grafech, které AI navrhuje nebo popisuje; poctivý obraz ve veřejných datech je součástí řízení.

Mini případ — špatné znamení, špatné vychloubání. Jedna jednotka lámala rekordy v ukazateli „počet uzavřených spisů za měsíc“; ale stížností občanů přibývalo. Podíváme-li se na přesný ukazatel, „míru vyřešení prvního kontaktu“, míra klesla z 58 procent na 44 procent – ​​soubory byly rychle zavírány a znovu otevírány. Když se indikátor změnil, změnila se také priorita řízení.

Mini case — osa, která nezačíná od nuly. Na grafu AI popsaném v prezentaci začíná vertikální osa na 40, nárůst o 2 procenta vypadal jako dramatický skok. Když byla osa posunuta na nulu, vynořil se skutečný obraz a rozhodnutí bylo vyloučeno z přehnaného vnímání.

Šablona, která podporuje výběr indikátoru:

Úkol: Navrhněte 5 kandidátních indikátorů pro následující účel. Účel: [např. zlepšení kvality služeb občanům]Pro každý ukazatel: co měří | co může skrývat | otevřenost k manipulaci | doporučená četnost čtení. Dále: napište 3 varování (ta, která jsou sama o sobě zavádějící), abyste tyto indikátory četli společně. Pravidlo: Nevytvářejte čísla; stačí navrhnout návrh indikátoru.

Pozor: Nepodléhejte mylné představě, že „číslo je objektivní“. Jaké číslo měříte, jak je zobrazujete a jaký rozsah zvolíte, to vše je věcí interpretace. Transparentní a poctivý veřejný výklad je stejně důležitý jako mít přesná data.

Časté chyby

  • Záměna korelace za příčinnou souvislost. "Zvýšené dohromady" není příčinou; Hledejte alternativní vysvětlení.
  • Nechat AI doplnit chybějící data. Analýza se zhroutí s vytvořenou hodnotou; chybějící nechat chybět.
  • Zobecnění zkreslených dat. Stížnost/digitální data nereprezentují každého; Dotaz na chybějící skupinu.
  • Prezentace čísla bez kontextu. Vedle poměru by mělo být absolutní číslo a období porovnání.
  • Zbytečná analýza osobních údajů. Nepoužívejte individuální identifikaci, pokud jsou dostatečná agregovaná data.
  • Nedoložení rozhodnutí. Jaké rozhodnutí bylo učiněno na základě toho, která data by měla být zaznamenána pro audit.

V souhrnu

Rozhodování založené na datech je nejúčinnějším způsobem, jak spravedlivě a efektivně rozdělovat zdroje ve veřejném sektoru; Umělá inteligence je v tomto oboru rychlým pomocníkem, který dává obrázku smysl, nachází vzory a zjednodušuje hledání. Ale nevytvářejte si z AI čísla, nenuťte je doplňovat chybějící data, nenechte ji zaměňovat korelaci s kauzalitou a vyvarujte se zobecňování zkreslených/neúplných dat. V číslech je síla; Silnější je ten, kdo si to správně vyloží a zdokumentuje rozhodnutí.

Aplikační úkol

Získejte ze své jednotky skutečnou tabulku (odstraněná z osobních údajů). Zaveďte data pomocí šablony "Seznámení s tabulkou" a poté si nechte zodpovědět důležitou otázku pro rozhodnutí pomocí šablony "Kontextové souhrnné statistiky". Použijte šablonu „tazatel příčinné souvislosti“ na vznikající vztah a najděte alespoň jedno alternativní vysvětlení. Zkontrolujte, zda AI přidává čísla mimo tabulku.

kontrolní seznam

  • [ ] AI použila pouze danou tabulku; Čísla zvenčí nedodal.
  • [ ] Nedoplnil jsem chybějící údaje; Nechal jsem to jako "žádná data".
  • [ ] Každý výsledek jsem uvedl s kontextem (absolutní číslo + sazba + tečka).
  • [ ] Předložil jsem alternativní vysvětlení k tvrzením o kauzalitě.
  • [ ] Vyhodnotil jsem riziko zkreslení/chybějících dat a chybějící skupiny.
  • [ ] Doložil jsem rozhodnutí a údaje, na kterých bylo založeno.