Dobički:
- Prepoznava nevarnosti kakovosti, zaupnosti in interpretacije pri delu s podatki ter vzpostavi varen tok analize.
- Izbere pravi indikator za namen, pri čemer razlikuje med zavajajočimi posameznimi kazalniki in meritvami, ki so odprte za manipulacijo.
- Prepozna zavajajoče tehnike grafikonov (os se ne začne od nič, izbrano območje) in opazuje pošteno vizualizacijo.
Javnost vsak dan proizvaja podatke: številke vlog, čase rešitev, proračunske postavke, gibanje prebivalstva, zahteve po storitvah, rezultate revizije, ankete o zadovoljstvu. Večina teh podatkov je shranjenih v Excelovih preglednicah, obrazcih in zapisovalnih sistemih, vendar se ne prevedejo v odločitve – ker njihova analiza zahteva strokovno znanje in čas. Odločanje na podlagi podatkov (pristop k dodeljevanju sredstev in določanju politike, ki temelji na izmerjenih dokazih, namesto na mnenju ali navadah) povečuje učinkovitost in pravičnost v javnem sektorju: viri gredo tja, kjer so najbolj potrebni na podlagi številk. Tu je umetna inteligenca močan pomočnik pri razumevanju tabele, iskanju vzorcev in nepravilnosti, pridobivanju povzetkov statističnih podatkov in prevajanju ugotovitev v preproste stavke. V tej enoti boste videli, kako skrajšati pot od neobdelanih javnih podatkov do upravičljive odločitve z umetno inteligenco in ostati discipliniran pri najbolj kritičnem vidiku – pravilni razlagi števila.
Tri nevarnosti dela s podatki
Podatki so zmogljivi, vendar imajo tri pasti, umetna inteligenca pa lahko te pasti ublaži in poveča:
- Korelacija ≠ vzročna zveza. Samo zato, ker se dve stvari spreminjata skupaj, še ne pomeni, da ena povzroča drugo. Prodaja sladoleda in utopitev sta v porastu, ker sta oba povezana s poletno vročino in ne ena povzroča druge. AI tekoče sestavlja stavke »ker«; Podvomite v vsako trditev o vzročnosti.
- Pristranski/manjkajoči podatki. Od koga in kako so bili zbrani podatki? Podatki o pritožbah odražajo samo tiste, ki se lahko pritožijo; podatkov digitalnih aplikacij, ki imajo dostop do interneta. Če manjkajoče skupine ne vidite, bo odločitev pristranska.
- Številka brez konteksta. Samo "30 % povečano" je nesmiselno: glede na kaj, v katerem obdobju, kakšna je absolutna številka? Vprašajte AI za kontekst.
Pozor: medtem ko AI analizira tabelo, ki jo posredujete, včasih doda "razumne", a izmišljene številke zunaj tabele ali tiho zapolni manjkajoče celice. Primerjajte vsako izhodno številko z izvorno tabelo; Dajte AI pravilo "uporabite samo vrednosti v tabeli, ki vam jo dam, če manjkajo, recite 'ni podatkov'".
Potek analize podatkov korak za korakom
- Pojasnite vprašanje. Na katero vprašanje iščemo odgovore za odločitev? ("V kateri soseski rešitev traja najdlje?")
- Spoznajte podatke. Kakšni so stolpci, kakšna je enota, kakšna je doba, ali obstajajo kakšne manjkajoče/nepravilne vrednosti?
- Izvlecite osebne podatke. Anonimiziraj/združi, če identifikacija posameznika ni potrebna za analizo (glej 11. enoto).
- Pojavi se povzetek in vzorec. Naj AI izvaja osnovne statistike, združevanje in označevanje anomalij.
- Vprašajte komentar. Korelacija ali vzročna zveza? Alternativna razlaga? Manjkajoča skupina?
- Vizualizirajte in poenostavite. Preprost povzetek in grafika, ki ju razume odločevalec.
- Dokumentirajte odločitev in njeno utemeljitev. Kakšna odločitev je bila sprejeta na podlagi katerih podatkov? revizijska sled.
trije mini kovčki
1. primer – Vir je šel na pravo mesto. V preteklosti je občina svoj proračun za vzdrževanje parka razdelila "enakomerno vsem soseskam". Ko so bili 18-mesečni podatki o povpraševanju in uporabi analizirani z umetno inteligenco, je bilo povpraševanje na prebivalca v treh soseskah 2,4-krat večje od povprečja. Proračun je bil prerazporejen glede na potrebe; splošno zadovoljstvo se je povečalo, brez dodatnih stroškov.
Primer 2 – Opaženi so bili pristranski podatki. Agencija bi pregledala podatke digitalnih aplikacij in ugotovila, da "državljani ne prihajajo več na cestninsko postajo." Ko pa je bila v analizi zahtevana starostna razčlenitev, se je izkazalo, da vloge nad 65 let še vedno večinoma prihajajo z okenca. Če bi gledali le digitalne podatke, bi to skupino prezrli; blagajniška služba se je ohranila.
Primer 3 – Izmišljena vzročna zveza ustavljena. Med razlago tabele je YZ dejal: "Nesreče so se zmanjšale, ker se je povečalo število pregledov." Analitik je spomnil, da se je v istem obdobju spremenilo tudi vreme in zmanjšal promet; Pripisovanje le enemu vzroku je bilo zavajajoče. Poročilo je bilo popravljeno tako, da je pisalo, da "obstaja povezava, vendar vzročna zveza ni bila dokazana."
Štiri predloge za kopiranje
1) Spoznavanje mize:
Vaša vloga: podatkovni analitik. Preglejte spodnjo tabelo in na podlagi SAMO vrednosti v tej tabeli: (1) povzemite, kaj je vsak stolpec, njegovo enoto in obdobje, (2) vse celice, ki se zdijo manjkajoče/nepravilne, (3) povzemite 3 glavne vzorce, ki izstopajo. Seštevanje števil zunaj tabele; če manjka, recite "ni podatkov".TABLE: [prilepite podatke]
2) Povzetek statistike s kontekstom:
Odgovorite na naslednje vprašanje iz spodnje tabele: [vprašanje]. MORA podati rezultat s kontekstom: absolutno število + stopnja + primerjalno obdobje. Ko rečete "povečano za X%", navedite, v kakšnem obsegu in v katerem obdobju. Samo uporabite dane podatke.TABELA: [podatki] VPRAŠANJE: [vprašanje]
3) Spraševalec vzročnosti:
Interpretirajte naslednjo ugotovitev, vendar POZOR: ne mešajte korelacije z vzročno zvezo. Ustvarite vsaj 3 alternativne razlage za to razmerje (tretja spremenljivka, obratna smer, naključje). Povejte mi, kateri dodatni podatki so potrebni za dokazovanje vzročnosti. UGODITEV: [razmerje]
4) Preprost povzetek odločitve:
Poenostavite naslednjo analizo za odločevalca, ki ni strokovnjak za podatke: ne več kot 5 postavk, vsaka točka je ugotovitev in razlaga »kaj to pomeni«. Jasno zapišite tudi negotovosti in omejitve podatkov. Dodajanje novih informacij. ANALIZA: [besedilo]
Šibek poziv/močan poziv
Slab: "Analiziraj ta grafikon in nam povej, kaj naj storimo."
Strong: "Vaša vloga je analitik podatkov. Uporabite SAMO spodnjo tabelo; ne dodajajte števil od zunaj, manjkajoči celici recite 'ni podatkov'. Najprej se seznanite s stolpci, enotami in obdobjem. Nato odgovorite na vprašanje 'katera soseska ima najdaljši čas rešitve' z absolutnim številom + razmerjem + obdobjem primerjave. Če najdete vzorec, si omislite 3 alternativne razlage, preden ga razložite z vzročnostjo. Na koncu naštejte točke in meje podatkov (manjkajoča skupina, kratko obdobje), ki odločitev prepuščajo nam."
Razlika: močan poziv vzpostavlja zvestobo podatkov, kontekst, disciplino vzročnosti in mejo odločanja skupaj; Rezultat je zagovorljiva analiza.
Kje lahko v podatkovnem poslu zaupamo umetni inteligenci?
posel
AI zaupanje
pravilo
Povzetek tabele, združevanje
visoka
Samo podani podatki
Označevanje anomalije/vzorca
srednje
človeška potrditev
Razlaga vzročnosti
nizka
Potrebna je alternativna razlaga
Dopolnjevanje manjkajočih podatkov
prenizka
Naj se to ne zgodi; "ni podatkov"
Poenostavitev/vizualni povzetek
visoka
Pomen je treba ohraniti
Zasnova kazalnika in zavajajoča past grafikona
Najbolj kritičen korak pri sprejemanju odločitev s podatki je izbira pravega indikatorja (številski izraz, zaradi katerega je pojav mogoče izmeriti – na primer »povprečni čas obdelave« ali »cena na aplikacijo«). Napačen indikator vodi do napačne odločitve, tudi ob točnih podatkih: medtem ko se zdi, da »skupno število rešenih zahtevkov« narašča, se lahko »čakalna doba na občana« podaljšuje. AI lahko navede indikatorje kandidatov za temo in kaj vsak meri in prikriva; vi pa se odločite, kateri indikator resnično predstavlja javni interes. Zavedajte se tudi tveganja zavajajoče vizualizacije (izkrivljanje zaznave s tehnikami, kot je os, ki se ne začne od nič, nesorazmerno merilo, izbrani časovni interval) v grafih, ki jih predlaga ali opisuje AI; poštena slika v javnih podatkih je del upravljanja.
Mini etui — napačen znak, napačno hvalisanje. Ena enota je podirala rekorde pri kazalniku »mesečno zaprtih datotek«; vendar so se pritožbe državljanov povečale. Če pogledamo natančen indikator, »stopnjo reševanja prvega stika«, je stopnja padla z 58 odstotkov na 44 odstotkov - datoteke so se hitro zapirale in znova odpirale. S spremembo indikatorja se je spremenila tudi prioriteta upravljanja.
Mini primer — os, ki se ne začne od nič. Na grafu AI, opisanem v predstavitvi, se navpična os začne pri 40, 2-odstotno povečanje se je zdelo kot dramatičen skok. Ko je bila os premaknjena na nič, se je pokazala realna slika in odločitev je bila izločena iz pretirane percepcije.
Predloga, ki podpira izbiro indikatorja:
Naloga: Predlagajte 5 kandidatov za naslednji namen. Namen: [npr. izboljšanje kakovosti storitev za državljane]Za vsak kazalnik: kaj meri | kaj lahko skriva | odprtost za manipulacijo | priporočena pogostost branja. Naslednje: napišite 3 opozorila (tista, ki so sama po sebi zavajajoča), da te indikatorje preberete skupaj. Pravilo: Ne ustvarjajte številk; samo predlagajte načrt indikatorja.
Pozor: ne zadajte se napačnemu prepričanju, da je "številka objektivna". Katero število izmerite, kako ga prikažete in kakšen razpon izberete, je vse stvar interpretacije. Transparentna in poštena javna razlaga je enako pomembna kot točni podatki.
Pogoste napake
- Napačna korelacija za vzročno zvezo. "Povečana skupaj" ni vzrok; Poiščite alternativne razlage.
- Z AI zapolni manjkajoče podatke. Analiza se zruši z izmišljeno vrednostjo; pustite manjkajoče manjkajoče.
- Posploševanje pristranskih podatkov. Pritožba/digitalni podatki ne predstavljajo vseh; Poizvedite manjkajočo skupino.
- Predstavitev številke brez konteksta. Poleg razmerja naj bo absolutno število in primerjalno obdobje.
- Nepotrebno analiziranje osebnih podatkov. Ne uporabljajte individualne identifikacije, če zadostujejo zbirni podatki.
- Brez dokumentiranja odločitve. Kakšna odločitev je bila sprejeta, na podlagi katerih podatkov je treba zabeležiti za revizijo.
Če povzamem
Odločanje na podlagi podatkov je najmočnejši način za pravično in učinkovito razdeljevanje virov v javnem sektorju; AI je v tem poslu hiter pomočnik, ki osmišlja sliko, najde vzorce in poenostavi iskanje. Toda ne prisilite umetno inteligenco, da si izmisli številke, ne prisilite je, da zapolni manjkajoče podatke, ne dovolite, da zamenja korelacijo z vzročnostjo in se izogibajte posploševanju pristranskih/nepopolnih podatkov. V številu je moč; Tisti, ki jo pravilno interpretira in dokumentira odločitev, je močnejši.
Aplikacijska naloga
Pridobite resnično (brez osebnih podatkov) tabelo iz vaše enote. Podatke predstavite s predlogo »Spoznavanje tabele«, nato pa na pomembno vprašanje za odločitev odgovorite s predlogo »Kontekstualna sumarna statistika«. Uporabite predlogo »Vpraševalec vzročnosti« za nastajajoče razmerje in poiščite vsaj eno alternativno razlago. Preverite, ali umetna inteligenca dodaja številke zunaj tabele.
kontrolni seznam
- [] AI je uporabil samo dano tabelo; Številk od zunaj ni dodajal.
- [ ] Manjkajočih podatkov nisem vpisal; Pustil sem kot "brez podatkov".
- [ ] Vsak rezultat sem predstavil s kontekstom (absolutno število + stopnja + točka).
- [ ] Podal sem alternativno razlago trditev o vzročnosti.
- [ ] Ocenil sem tveganje za pristranske/manjkajoče podatke in manjkajočo skupino.
- [ ] Odločitev in podatke, na katerih je temeljila, sem dokumentiral.