Eenheid 7 / 11

Op data gebaseerde besluitvorming en analyse van publieke gegevens

Winst:

  • Onderkent de kwaliteits-, vertrouwelijkheids- en interpretatierisico's van het werken met gegevens en brengt een veilige analysestroom tot stand.
  • Het selecteert de juiste indicator voor een bepaald doel, waarbij onderscheid wordt gemaakt tussen misleidende afzonderlijke indicatoren en metingen die vatbaar zijn voor manipulatie.
  • Het herkent misleidende kaarttechnieken (as begint niet bij nul, gekozen bereik) en observeert eerlijke visualisatie.

Het publiek produceert dagelijks data: aanvraagnummers, oplossingstijden, budgetposten, bevolkingsbewegingen, serviceaanvragen, auditresultaten, tevredenheidsonderzoeken. De meeste van deze gegevens bevinden zich in Excel-spreadsheets, -formulieren en -registratiesystemen, maar worden niet omgezet in beslissingen, omdat het analyseren ervan expertise en tijd vereist. Op data gebaseerde besluitvorming (een aanpak voor het toewijzen van middelen en het bepalen van beleid op basis van gemeten bewijsmateriaal, in plaats van op meningen of gewoontes) verhoogt zowel de efficiëntie als de eerlijkheid in de publieke sector: middelen gaan daar waar ze het meest nodig zijn op basis van cijfers. Hier is AI een krachtige assistent bij het begrijpen van een tabel, het vinden van patronen en afwijkingen, het extraheren van samenvattende statistieken en het vertalen van de bevindingen in eenvoudige zinnen. In dit onderdeel zul je zien hoe je met AI het pad van ruwe openbare gegevens naar een verdedigbare beslissing kunt verkorten en gedisciplineerd kunt blijven op het meest cruciale aspect: de juiste interpretatie van het getal.

Drie gevaren van het werken met data

Data zijn krachtig, maar hebben drie valkuilen, en AI kan deze valkuilen zowel verzachten als vergroten:

  1. Correlatie ≠ causaliteit. Het feit dat twee dingen samen veranderen, betekent niet dat het een het ander veroorzaakt. De verkoop van ijs en het aantal verdrinkingen nemen toe – omdat ze beide verband houden met de zomerhitte en niet het een het ander veroorzaakt. AI construeert vloeiend ‘omdat’-zinnen; Trek elke claim van causaliteit in twijfel.
  2. Vertekende/ontbrekende gegevens. Van wie en hoe zijn de gegevens verzameld? Klachtengegevens weerspiegelen alleen degenen die kunnen klagen; digitale applicatiegegevens van mensen met toegang tot internet. Als u de ontbrekende groep niet ziet, zal de beslissing bevooroordeeld zijn.
  3. Nummer zonder context. Alleen ‘met 30% verhoogd’ is zinloos: volgens wat, in welke periode, wat is het absolute aantal? Vraag de AI om context.
Let op: Terwijl de AI de door u aangeleverde tabel analyseert, voegt hij soms "redelijke" maar fictieve getallen van buiten de tabel toe of vult hij stilletjes de ontbrekende cellen in. Vergelijk elk uitvoernummer met de brontabel; Geef de AI de regel ‘gebruik alleen de waarden in de tabel die ik je geef, als die ontbreken, zeg dan ‘geen gegevens’’.

Stap voor stap gegevensanalysestroom

  1. Verduidelijk de vraag. Op welke vraag zoeken we antwoorden voor het besluit? ("In welke buurt duurt de oplossingstijd het langst?")
  2. Ken de gegevens. Wat zijn de kolommen, wat is de eenheid, wat is de periode, zijn er ontbrekende/onjuiste waarden?
  3. Persoonlijke gegevens extraheren. Anonimiseren/aggregeren als individuele identificatie niet vereist is voor analyse (zie Unit 11).
  4. Samenvatting en patroon komen naar voren. Laat de AI basisstatistieken, groepering en anomaliemarkering uitvoeren.
  5. Vraag de opmerking. Correlatie of causaliteit? Alternatieve verklaring? Ontbrekende groep?
  6. Visualiseer en vereenvoudig. Een eenvoudige samenvatting en grafiek die de beslisser kan begrijpen.
  7. Documenteer het besluit en de motivering ervan. Welke beslissing is genomen op basis van welke gegevens? audittraject.

drie minikoffers

Geval 1 — De bron ging naar de juiste plaats. Vroeger verdeelde een gemeente haar budget voor parkonderhoud ‘gelijkelijk over elke buurt’. Toen 18 maanden aan vraag- en gebruiksgegevens met AI werden geanalyseerd, was de vraag per hoofd van de bevolking in de drie buurten 2,4 maal het gemiddelde. Het budget werd naar behoefte herverdeeld; de algehele tevredenheid nam toe, zonder extra kosten.

Geval 2 – Er werden vertekende gegevens opgemerkt. Een bureau zou de digitale aanvraaggegevens bekijken en concluderen dat “burgers niet langer naar het tolhuisje komen.” Maar toen in de analyse om de leeftijdsopbouw werd gevraagd, bleek dat de aanvragen boven de 65 jaar nog steeds grotendeels uit het loket kwamen. Als er alleen naar digitale data gekeken zou worden, zou deze groep genegeerd worden; box office service bleef behouden.

Geval 3 – Het gekunstelde oorzakelijk verband is gestopt. Terwijl hij een tabel interpreteerde, zei YZ: "Het aantal ongevallen nam af omdat het aantal inspecties toenam." De analist herinnerde eraan dat het weer in dezelfde periode ook veranderde en het verkeer afnam; Het was misleidend om dit aan één enkele oorzaak toe te schrijven. Het rapport werd gecorrigeerd en zei: "Er is een verband, maar het oorzakelijk verband is niet bewezen."

Vier kopieerbare sjablonen

1) Kennismaken met de tafel:

Jouw rol: data-analist. Bestudeer de onderstaande tabel en, ALLEEN op basis van de waarden in deze tabel: (1) vat samen wat elke kolom is, de eenheid en periode ervan, (2) eventuele cellen die ontbreken/onjuist lijken, (3) vat de top 3 patronen samen die opvallen. Getallen van buiten de tabel toevoegen; als deze ontbreken, zeg dan "geen gegevens". TABEL: [gegevens plakken]

2) Samenvattende statistieken met context:

Beantwoord de volgende vraag uit onderstaande tabel: [vraag]. MOET het resultaat met context geven: absoluut aantal + tarief + vergelijkingsperiode. Wanneer u zegt "verhoogd met X%", specificeer dan in welke mate en in welke periode. Gebruik gewoon de gegeven gegevens. TABEL: [gegevens] VRAAG: [vraag]

3) Vraagsteller over de causaliteit:

Interpreteer de volgende bevinding, maar LET OP: verwar correlatie niet met causaliteit. Genereer minimaal 3 alternatieve verklaringen voor dit verband (derde variabele, omgekeerde richting, toeval). Vertel me welke aanvullende gegevens nodig zijn om de causaliteit te bewijzen. VINDEN: [relatie]

4) Eenvoudige samenvatting van de beslissing:

Vereenvoudig de volgende analyse voor een beslisser die geen data-expert is: niet meer dan 5 items, elk item een bevinding en een uitleg ‘wat betekent dit’. Schrijf ook duidelijk de onzekerheden en grenzen van de data op. Nieuwe informatie toevoegen.ANALYSE: [tekst]

Zwakke prompt/sterke prompt

Zwak: "Analyseer dit diagram en vertel ons wat we moeten doen."

Sterk: "Jouw rol is data-analist. Gebruik ALLEEN de onderstaande tabel; voeg geen getallen van buitenaf toe, zeg 'geen gegevens' in de ontbrekende cel. Leer eerst de kolommen, eenheden en periode kennen. Beantwoord vervolgens de vraag 'welke buurt heeft de langste oplossingstijd' met absoluut getal + verhouding + vergelijkingsperiode. Als je een patroon vindt, bedenk dan 3 alternatieve verklaringen voordat je het met causaliteit uitlegt. Geef ten slotte de punten en grenzen van de gegevens (ontbrekende groep, korte periode) op die de beslissing aan ons overlaten."

Verschil: sterke prompt brengt datagetrouwheid, context, causaliteitsdiscipline en beslissingsgrens samen; Het resultaat is een verdedigbare analyse.

Waar kan AI worden vertrouwd in de databusiness?

zaken

AI-vertrouwen

regel

Tabeloverzicht, groepering

hoog

Alleen gegevens gegeven

Anomalie/patroonmarkering

middelmatig

menselijke bevestiging

Causaliteit interpretatie

laag

Er is een alternatieve verklaring nodig

Het invullen van ontbrekende gegevens

te laag

Laat het niet gebeuren; "geen gegevens"

Vereenvoudiging/visuele samenvatting

hoog

De betekenis moet behouden blijven

Indicatorontwerp en misleidende kaartval

De meest cruciale stap bij het nemen van beslissingen op basis van data is het kiezen van de juiste indicator (de numerieke uitdrukking die een fenomeen meetbaar maakt, bijvoorbeeld ‘gemiddelde verwerkingstijd’ of ‘kosten per applicatie’). De verkeerde indicator leidt tot de verkeerde beslissing, zelfs met nauwkeurige gegevens: terwijl het “totale aantal afgehandelde claims” lijkt toe te nemen, kan de “wachttijd per burger” verslechteren. AI kan kandidaat-indicatoren voor een onderwerp op een rij zetten en aangeven wat elk onderwerp meet en verbergt; maar jij bepaalt welke indicator werkelijk het publieke belang vertegenwoordigt. Wees je ook bewust van het risico op misleidende visualisatie (waarneming vertekenen met technieken als de as die niet vanaf nul begint, onevenredige schaal, geselecteerd tijdsinterval) in de grafieken die de AI suggereert of beschrijft; Eerlijk beeld in publieke data is onderdeel van governance.

Mini-hoesje – verkeerd teken, verkeerde opschepperij. Eén eenheid brak records in de indicator "aantal gesloten dossiers per maand"; maar de klachten van burgers namen toe. Kijkend naar de nauwkeurige indicator, het ‘oplossingspercentage bij het eerste contact’, daalde het percentage van 58 procent naar 44 procent: bestanden werden snel gesloten en opnieuw geopend. Toen de indicator veranderde, veranderde ook de managementprioriteit.

Minibehuizing: as die niet vanaf nul begint. Op de grafiek die AI in een presentatie beschrijft, begint de verticale as bij 40, een stijging van 2 procent leek een dramatische sprong. Toen de as naar nul werd verplaatst, kwam het echte beeld naar voren en werd de beslissing uit de overdreven perceptie geëlimineerd.

Sjabloon die indicatorselectie ondersteunt:

Taak: Stel 5 kandidaat-indicatoren voor voor het volgende doel. Doel: [bijv. verbetering van de kwaliteit van de dienstverlening aan burgers]Voor elke indicator: wat deze meet | wat kan het verbergen | openheid voor manipulatie | aanbevolen leesfrequentie. Vervolgens: schrijf 3 waarschuwingen (die op zichzelf misleidend zijn) om deze indicatoren samen te lezen. Regel: produceer geen cijfers; stel gewoon een indicatorontwerp voor.

Let op: Val niet in de misvatting dat “getallen objectief zijn”. Welk getal u meet, hoe u het weergeeft en welk bereik u kiest, het is allemaal een kwestie van interpretatie. Transparante en eerlijke publieke interpretatie is net zo belangrijk als het beschikken over nauwkeurige gegevens.

Veel voorkomende fouten

  • Correlatie verwarren met causaliteit. “Samen verhoogd” is niet de oorzaak; Zoek naar alternatieve verklaringen.
  • Ontbrekende gegevens laten invullen door AI. De analyse stort in met een verzonnen waarde; laat de ontbrekende vermist.
  • Het generaliseren van bevooroordeelde gegevens. Klacht/digitale gegevens vertegenwoordigen niet iedereen; Onderzoek de ontbrekende groep.
  • Het nummer presenteren zonder context. Naast de verhouding moet er een absoluut aantal en een vergelijkingsperiode staan.
  • Het onnodig analyseren van persoonsgegevens. Gebruik geen individuele identificatie als geaggregeerde gegevens voldoende zijn.
  • Het besluit niet documenteren. Welke beslissing is genomen op basis van welke gegevens moeten worden vastgelegd voor audits?

Samengevat

Op data gebaseerde besluitvorming is de krachtigste manier om middelen eerlijk en efficiënt te verdelen in de publieke sector; AI is een snelle assistent in deze branche die het beeld begrijpt, patronen vindt en het vinden ervan vereenvoudigt. Maar laat de AI geen cijfers verzinnen, laat haar geen ontbrekende gegevens invullen, laat haar correlatie niet verwarren met causaliteit, en vermijd het generaliseren van bevooroordeelde/onvolledige gegevens. Er schuilt kracht in cijfers; De persoon die de beslissing correct interpreteert en documenteert, is sterker.

Applicatie taak

Haal een echte (persoonlijke gegevens gestripte) tabel van uw eenheid. Introduceer de gegevens met het sjabloon 'De tabel leren kennen' en laat vervolgens een belangrijke vraag voor de beslissing beantwoorden met het sjabloon 'Contextuele samenvattende statistieken'. Pas het sjabloon 'Oorzaakvraagstuk' toe op een opkomende relatie en zoek ten minste één alternatieve verklaring. Controleer of de AI getallen van buiten de tabel toevoegt.

controlelijst

  • [ ] De AI gebruikte alleen de gegeven tabel; Hij voegde geen nummers van buitenaf toe.
  • [ ] Ik heb de ontbrekende gegevens niet ingevuld; Ik liet het staan ​​als "geen gegevens".
  • [ ] Ik presenteerde elk resultaat met context (absoluut aantal + tarief + periode).
  • [ ] Ik heb een alternatieve verklaring voor de causaliteitsclaims bedacht.
  • [ ] Ik evalueerde het risico van vertekende/ontbrekende gegevens en de ontbrekende groep.
  • [ ] Ik heb het besluit en de gegevens waarop het was gebaseerd gedocumenteerd.