Winst:
- Mogelijkheid om een dataset te verkennen met kunstmatige intelligentie, nieuwswaardige vragen te genereren en gevoelige gegevens te extraheren
- In plaats van kunstmatige intelligentie de berekeningen te laten doen, de methode te laten beschrijven en uitvoeren in een controleerbare tool en de gewoonte te verwerven om elke bevinding te verifiëren op basis van ruwe gegevens.
- Begrijpen dat het de verantwoordelijkheid van de journalist is om uitschieters op te stellen, archiefrelaties te documenteren en deze in de oorspronkelijke bron te bevestigen.
Onderzoeksjournalistiek begint vaak met een stapel: een tedere spreadsheet van duizenden regels, een balans van honderden pagina's, een uitgelekt e-mailarchief, een open-source set overheidsuitgaven. Datajournalistiek – de praktijk van het vinden van patronen, anomalieën en relaties in numerieke en documentaire gegevens en deze om te zetten in nieuws – is precies de taak om deze massa te begrijpen. In deze stapels, die een mensenleven zouden kosten om handmatig door te bladeren, is kunstmatige intelligentie (AI) een krachtig hulpmiddel voor de eerste screening en het genereren van ideeën: het kan een tabel samenvatten, dubbele namen uit een tekstarchief extraheren, voorstellen welke vragen er moeten worden gesteld voor een analyse en zelfs stappen voor het opschonen van gegevens beschrijven. Maar laten we vanaf het begin één zin zeggen: AI is een partner bij het analyseren van gegevens; Het is de journalist die de nauwkeurigheid en nieuwswaarde van het resultaat bepaalt en het getal opnieuw onderzoekt op basis van de ruwe gegevens. Het risico op hallucinaties is hier in aantallen het gevaarlijkst.
Stap voor stap: een dataset verkennen met AI
Stap 1 — Leer de gegevens kennen. Begrijp eerst de kolommen, het aantal rijen, het datumbereik en de eenheden. Weet zelf wat het is voordat je het raw-bestand in de AI laadt; Anders blijven de ‘bevindingen’ van AI in de lucht hangen.
Stap 2 — Extraheer gevoelige gegevens. Als het persoonlijke gegevens bevat (naam, TR ID, adres, gezondheid), anonimiseer het dan zonder deze aan de openbare AI-tool te geven of stuur alleen de kolommen die moeten worden geanalyseerd. Sporen van gelekte documenten die de bron onthullen, worden ook gewist (eenheden 1 en 10).
Stap 3 — Genereer ontdekkingsvragen met AI. “Welk nieuws zou deze dataset kunnen verbergen?” Begin met te zeggen. De AI komt met een lijst met vragen die je kunt stellen: top 10 items, terugkerende leveranciers, ongebruikelijke sprongen, gebieden die leeg zijn gelaten.
Stap 4 – LAAT AI DE ANALYSE NIET DOEN, BESCHRIJV HET. Dit is het kritische punt. Het gemiddelde of percentage dat de AI in het hoofd berekent klopt vaak niet. Vraag de AI in plaats daarvan om stappen die je zou uitvoeren in een betrouwbare tool (spreadsheetformule, query, script). Door calculus tot een controleerbaar hulpmiddel te maken, geeft AI alleen de methode.
Stap 5 — Controleer de bevinding. Bekijk elke anomalie waar de AI op wijst door terug te gaan naar de ruwe lijn. Filter de tabel en tel de claim "Dit bedrijf heeft 31 van de 40 aanbestedingen gewonnen". Niet-geverifieerde nummers zullen niet in het nieuws komen.
Stap 6 — Breng de context tot stand. Het aantal alleen is geen nieuws. Vergelijking (vorig jaar soortgelijke instellingen, verhouding tot bevolking), context en deskundigenoordeel zijn de taak van de journalist.
Let op: de AI laten zeggen ‘bereken het gemiddelde van deze tabel’ en het resultaat direct in het nieuws brengen is de meest voorkomende fout in de datajournalistiek die disclaimers veroorzaakt. AI is een taalmodel, geen rekenmachine. Laat de tool het rekenwerk doen, vraag de AI gewoon om de methode en interpretatie.
Metadata en documentanalyse
Naast numerieke tabellen houdt de onderzoeksjournalistiek zich ook bezig met grote tekstarchieven: e-mails, notulen, contracten. Hier kan AI relatiekaarten opstellen zoals ‘wie heeft met wie wanneer gesproken’, ‘welk onderwerp wordt herhaald’, ‘welke namen worden samen genoemd’. Nogmaals, de regel is hetzelfde: AI geeft een eerste kaart; Elke link wordt bevestigd in het originele document, omdat AI een link die er niet is, op overtuigende wijze kan verklaren.
drie minikoffers
Geval 1 — Verborgen condensatie. Een verslaggever beschikte over een spreadsheet voor overheidsopdrachten met 2.400 rijen. Hij liet de AI verkennende vragen stellen; De vraag "hoeveel offertes heeft dezelfde leverancier ontvangen?" kwam naar voren. De verslaggever liet de AI dit niet berekenen; Hij voerde de door YZ zelf voorgestelde spreadsheetformule uit en ontdekte dat één bedrijf 380 (15,8%) van de 2.400 items ontving. Hij controleerde het handmatig en het nummer klopte. De aanvankelijke ‘schatting’ van de AI bedroeg 22% – dus als de AI te vertrouwen was, zou het nieuws verkeerd zijn.
Geval 2 — Tijdbesparing, e-mailarchief. Het zou dagen duren om handmatig te zoeken naar "welke onderwerpen er aan de hand zijn" in een archief van 6.000 e-mails. De AI produceerde in 15 minuten een overzicht van onderwerpclusters; Hieruit selecteerde de verslaggever drie veelbelovende clusters en las de originele e-mails. De totale ontdekkingstijd werd teruggebracht tot ~3 dagen, maar elke offerte die live ging, werd woordelijk geverifieerd vanuit de originele e-mail.
Geval 3 – Hallucinatie betrapt. Een economisch verslaggever ontving van een balans een samenvatting van YZ dat "de personeelskosten in één jaar tijd met 60% zijn gestegen". Toen hij terugkeerde naar de ruwe tabel, zag hij dat de stijging 6% bedroeg en dat de AI één cijfer verkeerd had gelezen. Eén enkele factcheck blokkeerde een valse en pretentieuze kop als ‘60% explosie’.
Kopieerbare sjablonen
1) Vragen over herkenning en ontdekking van datasets:
Ik zal je de kolomkoppen en de eerste twintig rijen van een dataset geven. Genereer 10 journalistieke vragen die met deze data KUNNEN worden gedaan: in termen van concentratie, uitschieter, sprong in de tijd, ontbrekende/lege gebieden, terugkerende actoren. Geen getalberekening; schrijf gewoon op welke vragen de moeite waard zijn om te stellen en waarom ze nieuws zouden kunnen opleveren. Gegevens: [koppen + voorbeeldregels]
2) Geen berekeningen maken, maar ze laten beschrijven:
Ik wil de volgende analyse uitvoeren: [bijv. vind het totale inschrijvingsbedrag en het aandeelpercentage van elke leverancier]. Ik wil dit zelf in een spreadsheet uitvoeren. Schrijf mij stap voor stap welke formules/draai-instellingen ik moet installeren. Resultaat van SEN-berekening; geef gewoon de methode. Mijn kolommen: [kolomnamen]
3) Uitbijterjacht:
Ik zal hieronder samenvattende statistieken (min, max, gemiddelde, mediaan) geven. Leg uit welke waarden ongebruikelijk/verdacht zijn en waarom ik ze moet controleren op nieuws. Maak geen definitieve oordelen; Er verschijnt een checklist in het formaat "de volgende regels moeten handmatig worden gecontroleerd". Samenvattingen: [hier]
4) Documentarchiefrelatiekaart (concept):
Ik zal je een set documenttekst geven. Voer het volgende uit als DRAFT: namen die vaak samen voorkomen, terugkerende onderwerpen, opmerkelijke data. Markeer het document waaruit elke link komt, bijvoorbeeld [B12]. Voeg geen relaties toe die niet expliciet in het document zijn geschreven. Documentatie: [hier]
Zwakke prompt/sterke prompt
Zwakke prompt: "Analyseer dit diagram en vermeld eventuele significante bevindingen."
Resultaat: AI verzint percentages en gemiddelden, verbeeldt afwijkingen, het is onduidelijk op welke lijn het is gebaseerd. Het kan niet worden geverifieerd.
Krachtige prompt: "Ik geef de kolommen en de eerste twintig rijen van deze tabel. (1) Maak een lijst van welke analyses nieuwswaarde kunnen hebben. (2) Stel een spreadsheetformule voor elke analyse voor, zodat ik deze kan uitvoeren. (3) Bereken geen resultaten. (4) Markeer de rijen die moeten worden gecontroleerd, zoals [S45]."
Verschil: sterke aanwijzingen laten de berekening over aan het beheersbare hulpmiddel, waardoor AI wordt gereduceerd tot de rol van methode en richting; voorkomt dat hallucinaties in het nummer lekken.
vergelijkingstabel
Stadium
AI wel
Journalist wel
verificatie
Gegevens herkennen
Kolom-/patroonoverzicht
Kent de eenheid en context
Brongegevenswoordenboek
ontdekkingsvragen
Genereert een lijst met vragen
Selecteert nieuwswaarde
—
berekening
Beschrijft de werkwijze
Voert de formule uit in het voertuig
Handmatige inrichting
uitschieter
markeert de kandidaten
Kijkt naar de ruwe lijn
Filter en tel
Commentaar/context
diepgangsframe
Vergelijking, deskundige
tweede bron
Veel voorkomende fouten
- AI laten berekenen. AI het gemiddelde, percentage, totaal etc. laten berekenen en het resultaat gebruiken; AI maakt vaak fouten, laat het voertuig het rekenwerk doen.
- De bevinding niet verbinden met de ruwe lijn. De claim schrijven "Dit bedrijf heeft de meeste aanbestedingen gewonnen" zonder de tabel te filteren en te tellen.
- Cijfers publiceren zonder context. Het rapporteren van naakte cijfers zonder vergelijking en ratio is misleidend.
- Gevoelige gegevens uploaden zoals ze zijn. Persoonlijke gegevens of een document waaruit de bron blijkt, aan het voertuig doorgeven zonder het schoon te maken.
- Denken dat de neprelatie waar is. Het verwerken van de link die de AI in het archief ‘ziet’ naar de kaart zonder deze in het originele document te bevestigen.
Samengevat
In de datajournalistiek is AI een ontdekkings- en inzichtpartner: het scant de stapel, genereert vragen om te stellen, beschrijft de analysemethode en markeert kandidaten voor uitschieters. Maar de AI het getal zelf laten berekenen is de meest risicovolle fout; Besteed de berekening uit aan een controleerbaar hulpmiddel, verifieer elke bevinding door terug te gaan naar de onbewerkte gegevens en voeg context en vergelijking toe aan de cijfers. In documentarchieven geeft AI een startkaart; Elke link wordt bevestigd in het originele document.
Applicatie taak
Neem een dataset die u heeft (of openbaar beschikbaar is). Laat ze eerst tien vragen genereren met de prompt 'Verkenningsvragen'. Selecteer een vraag, haal de formule op van de AI met de prompt 'Beschrijf de berekening' en voer deze zelf uit. Vraag de AI dan direct om dezelfde berekening en vergelijk de twee resultaten; Let op het verschil en de les ervan.
controlelijst
- [ ] Ik begreep de kolommen, eenheden en gevoelige velden voordat ik de gegevens aan de tool gaf.
- [ ] Ik laat de AI de berekeningen niet doen; Ik beschrijf de methode en voer deze uit in de auditeerbare tool.
- [ ] Ik verifieer elke bevinding handmatig door terug te gaan naar de onbewerkte rij.
- [ ] Ik voeg vergelijking en context toe aan het getal; Ik rapporteer niet de naakte cijfers.
- [ ] Ik bevestig elke relatie in het archief in het originele document.