Gevinster:
- Evne til at producere beskrivende statistikker og distributions-/relationsdiagrammer med støtte til kunstig intelligens og vælge den rigtige diagramtype i henhold til data og spørgsmål
- Evne til at genkende vildledende valg (stiplet akse, upassende skala, overdreven udjævning) i billeder produceret af kunstig intelligens og anvende ærlige visualiseringsprincipper
- At kunne skelne den eksplorative analyse er til at generere hypoteser og fælden med at finde og bekræfte med de samme data (hvilket åbner døren til p-hacking).
Efter at have renset dataene er empiriforskerens første opgave at lære dem at kende. Denne fase kaldes eksplorativ dataanalyse (EDA - Exploratory Data Analysis): det er processen med at undersøge dataene med grafer og opsummerende statistikker og se dens struktur, mønstre og overraskelser. Målet er ikke at teste en hypotese endnu, men at sætte sig ind i dataene, generere spørgsmål og lægge grunden til den model, du vil bygge i fremtiden. I denne enhed vil vi se, hvordan kunstig intelligens (AI) accelererer EDA og visualisering, men hvorfor den grafik, den producerer, skal revideres omhyggeligt.
Lad os først lave to grundlæggende sondringer. For det første supplerer deskriptiv statistik (tal, der opsummerer data såsom middelværdi, median, standardafvigelse, kvartiler) og visualisering (der viser den samme information grafisk) hinanden; Sammen beskriver de dataene. For det andet og mest kritisk: opdagelse og bekræftelse skal skelnes. Udforskende analyse er til at generere hypoteser; At udforske hypotesen med de samme data og sige "Jeg testede det og fandt det signifikant" åbner døren til p-hacking, som vi vil se i næste enhed. Det er gratis at se på dataene og se et mønster; Men at erklære dette mønster for et "bevist fund" i de samme data er vildledende.
Trin for trin eksplorativ analyse
1. Univariabel visning. Undersøg hver variabel individuelt: er dens fordeling symmetrisk eller skæv; hvor mange bakker er der; Hvor er afvigelserne? For numeriske variabler, histogram (plot, der viser frekvens ved at dividere værdier i intervaller) og boxplot (boxplot - diagram, der viser median-, kvartil- og ekstremværdier); Til kategoriske variable skal du bruge frekvenstabeller og søjlediagrammer.
2. Bivariat visning. Se sammenhængen mellem to variable: spredningsplot for to numeriske variable (viser hver observation som et punkt på x-y-planet), grupperet boksplot for numerisk-kategoriske, krydstabel for to kategoriske. Før du ser på korrelationskoefficienten, skal du sørge for at se på spredningsplottet: den samme korrelation kan vise meget forskellige mønstre (den berømte Anscombe-kvartet demonstrerer dette; fire datasæt har næsten identiske statistikker, men når de plottes viser de sig at være helt forskellige).
3. Vælg den korrekte diagramtype. Diagramtypen afhænger af dit spørgsmål og datatype. Histogram til distribution; spredning for forhold; linjediagram for ændringer over tid; søjlediagram til kategorisammenligning; (omhyggeligt) stablet stang for forholdet mellem dele og helheden. AI genererer hurtigt kode til dig, men beslutningen om "hvilken graf for hvilket spørgsmål" er din.
4. Bemærk mønsteret, angiv ikke resultater. Optag ethvert interessant mønster, du ser som en "opdagelsesnote", men betragte det ikke som et bekræftet fund. Bekræftelsen udføres i et separat trin, helst med separate data eller en forudbestemt tidsplan.
Ærlige visualiseringsprincipper
Grafikken overbeviser; Derfor er dens vildledende kraft også høj. AI kan træffe æstetiske, men nogle gange vildledende valg. Tjek disse politikker:
- I søjlediagrammer skal y-aksen starte ved nul. Den stiplede akse viser små forskelle som store.
- Skalaen skal være konsistent. Hvis to diagrammer sammenlignes, skal du bruge det samme akseområde.
- Overdreven udjævning kan skjule det sande mønster. En trendlinje ser pæn ud, men hvis den "udjævner" dataene for meget, kan den være vildledende.
- Farve og 3D-dekoration forvrænger opmærksomheden, ikke data. Vælg enkelhed.
- Manglende data og stikprøvestørrelse skal være synlige. "n=12" og "n=12.000" bør ikke se ens ud.
Bemærk: Bare fordi grafikken produceret af AI er smuk, er den ikke sand. Den mest almindelige fejl, han laver, er ikke at starte aksen fra nul i søjlediagrammet og overdrive forskellen mellem de to grupper. Kontroller altid aksen.
Sammenligningsskema: spørgsmål → diagram
Spørg
korrekte diagram
Almindelig fejl
Hvordan er denne variabel fordelt?
Histogram/boksplot
brug cirkeldiagram
Er to numeriske variable relaterede?
Spredningsplot
Bare se på antallet af sammenhænge
Hvordan har det ændret sig over tid?
linjediagram
Fortælle en tendens med et søjlediagram
Hvad er forskellen mellem grupperne?
Grupperet kasse/bar (fra bunden)
Afskåret aksestang
Del-til-hel-forhold?
Stablet bar (med forsigtighed)
Cirkeldiagram i flere skiver
Fire kopierbare prompter
1. Autofindingskode:
Din rolle: EDA-assistent. Jeg deler ikke dataene, jeg vil have R (ggplot2)-koden. Der er numeriske (indkomst, alder, udgifter) og kategoriske (region, uddannelse) variabler i 'data'-datarammen. Opgave: skriv kode, der producerer et histogram for hver numerisk, et søjlediagram for hver kategori og et scatter plot for indkomst~alder. Lad y-aksen starte fra NUL i søjlediagrammer. Tilføj kommentarlinje.
2. Korrelationsgennemgang (korrelation + visuel sammen):
Skriv kode, der både beregner Pearson-korrelation for indkomst og forbrug og plotter et scatterplot + lineær tendens. Tilføj en kommentarlinje, der minder mig om at undersøge diagrammet, før jeg STOLER på korrelationstællingen (Anscombe-advarsel). Udglat ikke trendlinjen for meget.
3. Integritetsrevision:
Tjek følgende ggplot-kode for ærlig visualisering:[kode]. Kontroller og ret følgende: starter y-aksen fra nul, er skalaen konsistent, er stikprøvestørrelsen synlig, er der for stor udjævning? Forklar begrundelsen for hver rettelse, du har foretaget.
4. Fremstilling af en opdagelsesnotat (ikke et fund):
Baseret på de grafer, jeg producerer, angiv OBSERVATIONER som en 'opdagelsesnote'; skriv hvert punkt på sproget 'hypotese, der skal testes', ikke 'afsluttende konstatering'. Eksempel: 'Indkomst på videregående uddannelser SYNES mere spredt; skal testes med separate data.' Undgå kausale og definitive udsagn.
Svag prompt / Stærk prompt
Svag prompt:
Lav flotte grafer af udbyttet og fortæl mig, hvad de betyder.
Denne prompt inviterer til misvisende output: "smuk" fokuserer på æstetik, mens "hvad det betyder" presser AI til at springe fra opdagelse til endelig konklusion. Kausale, overdrevne kommentarer følger.
Kraftig prompt:
Din rolle: ærlig EDA-assistent.Opgave: (1) vælg den type diagram, der passer til mit spørgsmål, og skriv begrundelsen,(2) start aksen fra nul i søjlediagrammer,(3) fortolk outputtet i DISCOVERY NOTE-sprog: ingen definitive/årsagsmæssige påstande foreslår hypotese i "skal testes"-sprog,(4) vil advare mig, hvis prøven <30 er i mit skema. det.
Forskel: stærk vilje retfærdiggør diagramtypen, pålægger regler for ærlighed og forveksler ikke opdagelse med bekræftelse.
tre minisager
Tilfælde 1 — Diskret akseoverdrivelse. En analytiker viste tilfredshedsscore for to grene (7,8 og 8,0; ud af 10) i et søjlediagram. Når man startede YZ-aksen fra 7,5, så den anden gren næsten dobbelt så høj ud som den første; hvorimod forskellen kun var 2,5 %. Ledelsen var ved at belønne en filial under det forkerte indtryk. Da jeg startede aksen fra bunden var forskellen næsten usynlig. Lektion: Alene aksevalg ændrer opfattelse.
Case 2 — At stole på sammenhængen og springe diagrammet over. En forsker så r = 0,81 mellem to variable og skrev "stærk lineær sammenhæng". Da hans konsulent bad om spredningsplottet, så man, at forholdet faktisk skyldtes en enkelt ekstrem observation, og da det punkt blev fjernet, faldt korrelationen til 0,12. Lektion: korrelationsantal er ikke en erstatning for en graf; se altid på spredningen.
Case 3 — Forvirrende opdagelse med bekræftelse. En elev så på alle parvise korrelationer i et 40-variable datasæt, valgte den højeste (r=0,52) og skrev: "vi fandt en signifikant sammenhæng mellem uddannelse og besparelser (p=0,004)." Der var dog hundredvis af par i 40 variable; at vælge den højeste var et falsk fund på grund af tilfældigheder. Lektion: det opdagede mønster kan ikke "testes og erklæres signifikant" i de samme data; Separat bekræftelse er påkrævet.
Almindelige fejl
- Starter ikke aksen fra nul i søjlediagrammet. Det overdriver den lille forskel; Den mest almindelige visuelle løgn. Tjek altid.
- Ser på sammenhængen og springer diagrammet over. Den samme sammenhæng kommer fra meget forskellige mønstre; kan passe til et afvigende forhold. Først spredning.
- I betragtning af mønsteret fundet i opdagelsen som "bevis" i de samme data. Dette er porten til p-hacking; Bekræftelse sker separat.
- Forkert diagramtype. Matcher som bar for trend og tærte til distribution er vildledende. Vælg en genre ud fra spørgsmålet.
- Skjuler prøvestørrelsen. n=8 og n=8.000 bør ikke se ens ud på den samme graf; usikkerhed skal vises.
Tip: Inden du udgiver et diagram, så spørg dig selv: "Ville historien ændre sig, hvis jeg ændrede aksen?" Hvis svaret er ja, har du sandsynligvis startet omdrejningspunktet fra et uærligt sted.
Sammenfattende
Udforskende dataanalyse er fasen med at møde dataene, se mønstre og generere hypoteser; Det er ikke en bekræftelse. AI'en genererer hurtigt beskrivende statistik og grafkode, men du vælger graftypen baseret på dit spørgsmål og kontrollerer principperne for retfærdighed (nulakse, konsekvent skala, tilsyneladende usikkerhed). Se på spredningen, før du stoler på korrelationstallet; Erklær ikke det mønster, du fandt i opdagelsen, som "bevis" i de samme data. En smuk graf over AI betyder ikke en korrekt graf.
Ansøgningsopgave
Vælg mindst tre variabler i et datasæt. Spørg AI for og kør kode, der producerer sonderende grafer (histogram, scatter, indrammet) med en prompt, der håndhæver ærlighedsregler. For hvert diagram: Kontroller (1) om diagramtypen er egnet til spørgsmålet, (2) aksens ærlighed, (3) synligheden af stikprøvestørrelsen. Skriv mindst én "opdagelsesnotat" på hypotesesprog ("... ser ud til at blive testet separat"). Undersøg en sammenhæng med både optælling og spredning og rapporter, hvis der er uoverensstemmelse mellem dem.
tjekliste
- [ ] Jeg valgte diagramtypen baseret på mit spørgsmål og datatype.
- [ ] I søjlediagrammer starter jeg y-aksen fra nul; Jeg tjekkede aksen ærlighed.
- [ ] Jeg så på scatterplotten, før jeg stolede på korrelationen.
- [ ] Jeg afspejlede stikprøvestørrelsen og usikkerheden på grafen.
- [ ] Jeg skrev de mønstre, jeg fandt i udforskningen, som "hypotese, der skal testes" snarere end "bevis".
- [ ] Jeg bemærkede, at jeg ikke ville bruge de samme data til bekræftelse, og at et separat trin var påkrævet.