Eenheid 3 / 11

Verkennende gegevensanalyse en visualisatie: grafieken en interpretatie met kunstmatige intelligentie

Winst:

  • Mogelijkheid om beschrijvende statistieken en distributie-/relatiegrafieken te produceren met ondersteuning voor kunstmatige intelligentie en het juiste grafiektype te kiezen op basis van de gegevens en de vraag
  • Vermogen om misleidende keuzes (onderbroken as, ongepaste schaal, overmatige afvlakking) te herkennen in beelden geproduceerd door kunstmatige intelligentie en eerlijke visualisatieprincipes toe te passen
  • In staat zijn om te onderscheiden dat verkennende analyse bedoeld is om hypothesen te genereren en de valkuil van het doen van ontdekkingen en bevestigingen met dezelfde gegevens (wat de deur opent voor p-hacking).

Na het opschonen van de gegevens is het de eerste taak van de empirisch onderzoeker om deze te leren kennen. Deze fase wordt verkennende data-analyse (EDA - Exploratory Data Analysis) genoemd: het is het proces waarbij de gegevens worden onderzocht met grafieken en samenvattende statistieken en de structuur, patronen en verrassingen ervan worden gezien. Het doel is nog niet om een ​​hypothese te testen, maar om kennis te maken met de data, vragen te genereren en de basis te leggen voor het model dat je in de toekomst gaat bouwen. In deze unit zullen we zien hoe kunstmatige intelligentie (AI) EDA en visualisatie versnelt, maar waarom de grafische afbeeldingen die het produceert zorgvuldig moeten worden gecontroleerd.

Laten we eerst twee fundamentele onderscheidingen maken. Ten eerste vullen beschrijvende statistieken (getallen die gegevens samenvatten zoals gemiddelde, mediaan, standaarddeviatie, kwartielen) en visualisatie (die dezelfde informatie grafisch weergeven) elkaar aan; Samen beschrijven ze de gegevens. Ten tweede, en het meest cruciaal: er moet onderscheid worden gemaakt tussen ontdekking en bevestiging. Verkennende analyse is bedoeld voor het genereren van hypothesen; Het onderzoeken van de hypothese met dezelfde gegevens en zeggen: "Ik heb het getest en vond het significant" opent de deur naar p-hacking, wat we in het volgende hoofdstuk zullen zien. Het is gratis om naar de gegevens te kijken en een patroon te zien; Maar het is misleidend om dat patroon in dezelfde gegevens als een ‘bewezen bevinding’ te bestempelen.

Stap voor stap verkennende analyse

1. Univariate weergave. Onderzoek elke variabele afzonderlijk: is de verdeling ervan symmetrisch of scheef; hoeveel heuvels zijn er; Waar zitten de uitschieters? Voor numerieke variabelen, histogram (plot die de frequentie toont door waarden in bereiken te verdelen) en boxplot (boxplot - grafiek met mediaan-, kwartiel- en extreme waarden); Gebruik voor categorische variabelen frequentietabellen en staafdiagrammen.

2. Bivariate weergave. Bekijk de relatie tussen twee variabelen: spreidingsdiagram voor twee numerieke variabelen (toont elke waarneming als een punt op het x-y-vlak), gegroepeerde boxplot voor numeriek-categorisch, kruistabel voor twee categorisch. Voordat u naar de correlatiecoëfficiënt kijkt, moet u eerst naar de spreidingsdiagram kijken: dezelfde correlatie kan zeer verschillende patronen vertonen (het beroemde Anscombe-kwartet demonstreert dit; vier datasets hebben vrijwel identieke statistieken, maar wanneer ze worden uitgezet, blijken ze totaal verschillend te zijn).

3. Kies het juiste diagramtype. Het diagramtype is afhankelijk van uw vraag en gegevenstype. Histogram voor distributie; verstrooiing voor relatie; lijndiagram voor verandering in de tijd; staafdiagram voor categorievergelijking; (zorgvuldig) gestapelde staaf voor de verhouding van delen tot geheel. AI genereert snel code voor u, maar de beslissing "welke grafiek voor welke vraag" is aan u.

4. Let op het patroon, declareer geen resultaten. Noteer elk interessant patroon dat u ziet als een ‘ontdekkingsnotitie’, maar beschouw het niet als een bevestigde bevinding. Bevestiging gebeurt in een aparte stap, bij voorkeur met aparte gegevens of een vooraf bepaald schema.

Eerlijke visualisatieprincipes

De graphic overtuigt; Daarom is de misleidende kracht ervan ook groot. AI kan esthetische maar soms misleidende keuzes maken. Controleer dit beleid:

  • In staafdiagrammen moet de y-as bij nul beginnen. Op de gestippelde as zijn kleine verschillen net zo groot.
  • De schaal moet consistent zijn. Als twee diagrammen worden vergeleken, gebruik dan hetzelfde asbereik.
  • Overmatig gladmaken kan het ware patroon verbergen. Een trendlijn ziet er mooi uit, maar als deze de gegevens te veel 'verzacht', kan deze misleidend zijn.
  • Kleur en 3D-decoratie vervormen de aandacht, niet de data. Kies voor eenvoud.
  • Ontbrekende gegevens en steekproefomvang moeten zichtbaar zijn. "n=12" en "n=12.000" mogen er niet hetzelfde uitzien.
Let op: alleen omdat de door AI geproduceerde graphics mooi zijn, zijn ze niet waar. De meest voorkomende fout die hij maakt, is dat hij de as niet vanaf nul in het staafdiagram begint en het verschil tussen de twee groepen overdrijft. Controleer altijd de as.

Vergelijkingsschema: vraag → diagram

Vraag

juiste grafiek

Veel voorkomende fout

Hoe wordt deze variabele verdeeld?

Histogram/boxplot

gebruik cirkeldiagram

Zijn twee numerieke variabelen gerelateerd?

Spreidingsplot

Kijk alleen maar naar het aantal correlaties

Hoe is het in de loop van de tijd veranderd?

lijndiagram

Een trend vertellen met een staafdiagram

Wat is het verschil tussen groepen?

Gegroepeerde box/bar (vanaf nul)

Afgeknotte as staaf

Deel/geheel verhouding?

Gestapelde staaf (voorzichtig)

Cirkeldiagram met meerdere segmenten

Vier kopieerbare aanwijzingen

1. Automatische detectiecode:

Jouw rol: EDA-assistent. Ik deel de gegevens niet, ik wil de R-code (ggplot2). Er zijn numerieke (inkomen, leeftijd, uitgaven) en categorische (regio, opleiding) variabelen in het dataframe 'data'. Taak: schrijf code die voor elk getal een histogram produceert, een staafdiagram voor elk categorisch getal en een spreidingsdiagram voor inkomen~leeftijd. Laat in staafdiagrammen de y-as beginnen vanaf NUL. Voeg commentaarregel toe.

2. Correlatiebeoordeling (correlatie + visueel samen):

Schrijf code die zowel de Pearson-correlatie voor inkomsten en uitgaven berekent als een spreidingsdiagram + lineaire trend plot. Voeg een commentaarregel toe die mij eraan herinnert de grafiek te onderzoeken voordat ik de correlatietelling VERTROUW (Anscombe-waarschuwing). Maak de trendlijn niet te glad.

3. Integriteitsaudit:

Controleer de volgende ggplot-code voor een eerlijke visualisatie: [code]. Controleer en corrigeer het volgende: begint de y-as vanaf nul, is de schaal consistent, is de steekproefgrootte zichtbaar, is er sprake van excessieve afvlakking? Leg de rechtvaardiging uit voor elke correctie die u heeft aangebracht.

4. Een ontdekkingsnotitie maken (geen bevinding):

Op basis van de grafieken die ik maak, vermeld je OBSERVATIES als een 'ontdekkingsnotitie'; schrijf elk item in de taal van 'te testen hypothese', niet van 'conclusieve bevinding'. Voorbeeld: 'Inkomen in het hoger onderwijs LIJKT meer gespreid; moeten met aparte data getest worden.' Vermijd causale en definitieve uitspraken.

Zwakke prompt/sterke prompt

Zwakke prompt:

Maak mooie grafieken van de opbrengst en vertel me wat ze betekenen.

Deze prompt nodigt uit tot misleidende resultaten: ‘mooi’ richt zich op esthetiek, terwijl ‘wat het betekent’ AI ertoe aanzet om van ontdekking naar definitieve conclusie te springen. Causale, overdreven opmerkingen volgen.

Krachtige prompt:

Jouw rol: eerlijke EDA-assistent. Taak: (1) kies het type diagram dat bij mijn vraag past en schrijf de rechtvaardiging, (2) start de as vanaf nul in staafdiagrammen, (3) interpreteer de uitvoer in DISCOVERY NOTE-taal: geen definitieve / causale claim suggereert hypothese in "moet worden getest" -taal, (4) waarschuw mij als de steekproef klein is (n <30). Ik zal de grafiek in mijn eigen omgeving uitvoeren en verifiëren.

Verschil: een sterke wil rechtvaardigt het kaarttype, legt regels voor eerlijkheid op en verwart ontdekking niet met bevestiging.

drie minikoffers

Geval 1 — Discrete as-overdrijving. Een analist liet de tevredenheidsscores van twee vestigingen (7,8 en 8,0; op 10) zien in een staafdiagram. Bij het starten van de YZ-as vanaf 7,5 leek de tweede tak bijna twee keer zo hoog als de eerste; terwijl het verschil slechts 2,5% bedroeg. Het management stond op het punt een filiaal onder de verkeerde indruk te belonen. Toen ik de as helemaal opnieuw begon, was het verschil bijna onzichtbaar. Les: alleen de askeuze verandert de perceptie.

Geval 2 – Vertrouwen op de correlatie en het overslaan van de grafiek. Een onderzoeker zag r = 0,81 tussen twee variabelen en schreef "sterk lineair verband". Toen zijn adviseur om het spreidingsdiagram vroeg, bleek dat het verband feitelijk te wijten was aan één enkele extreme waarneming, en toen dat punt werd verwijderd, daalde de correlatie naar 0,12. Les: correlatietelling is geen vervanging voor een grafiek; kijk altijd naar de spreiding.

Geval 3 — Verwarrende ontdekking met bevestiging. Eén student bekeek alle paarsgewijze correlaties in een dataset met 40 variabelen, selecteerde de hoogste (r=0,52) en schreef: "we vonden een significante relatie tussen opleiding en besparingen (p=0,004)." Er waren echter honderden paren in 40 variabelen; het kiezen van de hoogste was een valse bevinding vanwege toeval. Les: het ontdekte patroon kan niet in dezelfde gegevens worden ‘getest en significant verklaard’; Er is een aparte bevestiging vereist.

Veel voorkomende fouten

  • De as begint niet vanaf nul in het staafdiagram. Het overdrijft het kleine verschil; De meest voorkomende visuele leugen. Controleer altijd.
  • Kijken naar de correlatie en het diagram overslaan. Dezelfde correlatie komt voort uit zeer verschillende patronen; kan passen in een uitbijterrelatie. Ten eerste: verstrooiing.
  • Het in de ontdekking gevonden patroon beschouwen als "bewijs" in dezelfde gegevens. Dit is de toegangspoort tot p-hacking; Bevestiging gebeurt afzonderlijk.
  • Verkeerd diagramtype. Matches zoals staaf voor trend en taart voor distributie zijn misleidend. Kies een genre op basis van de vraag.
  • De steekproefomvang verbergen. n=8 en n=8.000 mogen er in dezelfde grafiek niet hetzelfde uitzien; onzekerheid moet worden aangetoond.
Tip: Voordat u een diagram publiceert, moet u zich afvragen: "Zou het verhaal veranderen als ik de as zou veranderen?" Als het antwoord ja is, ben je waarschijnlijk op oneerlijke wijze met de spil begonnen.

Samengevat

Verkennende data-analyse is de fase van het ontmoeten van de gegevens, het zien van patronen en het genereren van hypothesen; Het is geen bevestiging. De AI genereert snel beschrijvende statistieken en grafiekcode, maar u kiest het grafiektype op basis van uw vraag en beheert de principes van eerlijkheid (nul-as, consistente schaal, schijnbare onzekerheid). Kijk naar de spreiding voordat u het correlatienummer vertrouwt; Verklaar het patroon dat u tijdens de ontdekking hebt gevonden niet als 'bewijs' in dezelfde gegevens. Een mooie grafiek van AI betekent niet een correcte grafiek.

Applicatie taak

Selecteer ten minste drie variabelen in een gegevensset. Vraag de AI om code en voer deze uit die verkennende grafieken produceert (histogram, spreiding, boxed) met een prompt die eerlijkheidsregels afdwingt. Voor elk diagram: controleer (1) de geschiktheid van het diagramtype voor de vraag, (2) de eerlijkheid van de as, (3) de zichtbaarheid van de steekproefomvang. Schrijf ten minste één ‘ontdekkingsnotitie’ in hypothesetaal (“…lijkt afzonderlijk te worden getest”). Onderzoek een correlatie met zowel het aantal als de spreiding en rapporteer of er een discrepantie tussen beide bestaat.

controlelijst

  • [ ] Ik heb het diagramtype gekozen op basis van mijn vraag en gegevenstype.
  • [ ] In staafdiagrammen begin ik de y-as vanaf nul; Ik controleerde de eerlijkheid van de as.
  • [ ] Ik keek naar het spreidingsdiagram voordat ik op de correlatie vertrouwde.
  • [ ] Ik heb de steekproefomvang en onzekerheid weergegeven in de grafiek.
  • [ ] Ik schreef de patronen die ik tijdens mijn verkenningen ontdekte als 'te testen hypothese' in plaats van als 'bewijs'.
  • [ ] Ik merkte op dat ik niet dezelfde gegevens zou gebruiken ter bevestiging en dat een aparte stap nodig was.