Vinster:
- Förmåga att producera beskrivande statistik och distributions-/relationsdiagram med stöd för artificiell intelligens och välja rätt diagramtyp enligt data och fråga
- Förmåga att känna igen vilseledande val (streckad axel, olämplig skala, överdriven utjämning) i bilder producerade av artificiell intelligens och tillämpa ärliga visualiseringsprinciper
- Att kunna urskilja den explorativa analysen är till för att generera hypoteser och fällan att göra upptäckt och bekräftelse med samma data (vilket öppnar dörren till p-hacking).
Efter att ha rensat datan är empiriforskarens första uppgift att lära känna den. Detta steg kallas exploratory data analysis (EDA – Exploratory Data Analysis): det är processen att undersöka data med grafer och sammanfattande statistik och se dess struktur, mönster och överraskningar. Syftet är inte att testa en hypotes ännu, utan att sätta sig in i data, generera frågor och lägga grunden för den modell du kommer att bygga i framtiden. I den här enheten kommer vi att se hur artificiell intelligens (AI) accelererar EDA och visualisering, men varför grafiken den producerar måste granskas noggrant.
Låt oss först göra två grundläggande distinktioner. För det första kompletterar deskriptiv statistik (tal som sammanfattar data som medelvärde, median, standardavvikelse, kvartiler) och visualisering (som visar samma information grafiskt) varandra; Tillsammans beskriver de uppgifterna. För det andra och mest kritiska: upptäckt och bekräftelse måste särskiljas. Explorativ analys är till för att generera hypoteser; Att utforska hypotesen med samma data och säga "Jag testade det och fann det signifikant" öppnar dörren till p-hacking, vilket vi kommer att se i nästa enhet. Det är gratis att titta på datan och se ett mönster; Men att förklara att mönstret är ett "bevisat fynd" i samma data är missvisande.
Steg för steg explorativ analys
1. Univariabel vy. Undersök varje variabel individuellt: är dess fördelning symmetrisk eller skev; hur många kullar finns det; Var finns extremvärdena? För numeriska variabler, histogram (plot som visar frekvens genom att dela upp värden i intervall) och boxplot (boxplot - diagram som visar median-, kvartil- och extremvärden); För kategoriska variabler, använd frekvenstabeller och stapeldiagram.
2. Bivariat vy. Se sambandet mellan två variabler: spridningsdiagram för två numeriska variabler (visar varje observation som en punkt på x-y-planet), grupperad ruta för numerisk-kategoriska, korstabell för två kategoriska. Innan du tittar på korrelationskoefficienten, se till att titta på spridningsdiagrammet: samma korrelation kan visa väldigt olika mönster (den berömda Anscombe-kvartetten visar detta; fyra datamängder har nästan identisk statistik, men när de plottas visar de sig vara helt olika).
3. Välj rätt diagramtyp. Diagramtypen beror på din fråga och datatyp. Histogram för distribution; spridning för relation; linjediagram för förändring över tid; stapeldiagram för kategorijämförelse; (försiktigt) staplade stång för förhållandet mellan delar och helheten. AI genererar snabbt kod åt dig, men beslutet om "vilken graf för vilken fråga" är ditt.
4. Notera mönstret, deklarera inte resultat. Spela in alla intressanta mönster du ser som en "upptäcktsanteckning", men betrakta det inte som ett bekräftat fynd. Bekräftelse görs i ett separat steg, helst med separata data eller ett förutbestämt schema.
Ärliga visualiseringsprinciper
Grafiken övertygar; Därför är dess vilseledande kraft också hög. AI kan göra estetiska men ibland missvisande val. Kontrollera dessa policyer:
- I stapeldiagram måste y-axeln börja på noll. Den streckade axeln visar små skillnader som stora.
- Skalan ska vara konsekvent. Om två diagram jämförs, använd samma axelområde.
- Överdriven utjämning kan dölja det sanna mönstret. En trendlinje ser snygg ut, men om den "jämnar ut" data för mycket kan den vara missvisande.
- Färg och 3D-dekoration förvränger uppmärksamheten, inte data. Välj enkelhet.
- Saknade data och urvalsstorlek ska vara synliga. "n=12" och "n=12 000" bör inte se likadana ut.
Observera: Bara för att grafiken som produceras av AI är vacker är den inte sann. Det vanligaste misstaget han gör är att inte starta axeln från noll i stapeldiagrammet och överdriva skillnaden mellan de två grupperna. Kontrollera alltid axeln.
Jämförelsediagram: fråga → diagram
Fråga
rätt diagram
Vanligt misstag
Hur är denna variabel fördelad?
Histogram/boxplot
använd cirkeldiagram
Är två numeriska variabler relaterade?
Scatter plot
Titta bara på antalet korrelationer
Hur har det förändrats över tid?
linjediagram
Att berätta en trend med ett stapeldiagram
Vad är skillnaden mellan grupperna?
Grupperad låda/bar (från grunden)
Stympad axelstång
Del-till-hel-förhållande?
Staplad stång (med försiktighet)
Cirkeldiagram i flera skivor
Fyra kopierbara uppmaningar
1. Kod för automatisk upptäckt:
Din roll: EDA-assistent. Jag delar inte data, jag vill ha R (ggplot2)-koden. Det finns numeriska (inkomster, ålder, utgifter) och kategoriska (region, utbildning) variabler i "data"-dataramen. Uppgift: skriv kod som producerar ett histogram för varje numerisk, ett stapeldiagram för varje kategori och ett spridningsdiagram för inkomst~ålder. I stapeldiagram, låt y-axeln börja från NOLL. Lägg till kommentarsrad.
2. Korrelationsgranskning (korrelation + visuellt tillsammans):
Skriv kod som både beräknar Pearson-korrelation för inkomster och utgifter och plottar en scatterplot + linjär trend. Lägg till en kommentarsrad som påminner mig om att undersöka diagrammet innan jag litar på korrelationsantalet (Anscombe-varning). Släta inte ut trendlinjen för mycket.
3. Integritetsrevision:
Kontrollera följande ggplot-kod för ärlig visualisering:[kod]. Kontrollera och korrigera följande: börjar y-axeln från noll, är skalan konsekvent, är provstorleken synlig, är det överdriven utjämning? Förklara motiveringen för varje korrigering du gjort.
4. Skapa en upptäcktsnotis (inte ett fynd):
Baserat på de grafer jag producerar, lista OBSERVATIONER som en "upptäcktsnotis"; skriv varje punkt på språket "hypotes som ska testas", inte "avslutande resultat". Exempel: ”Inkomsten inom högre utbildning VERKAR mer spridd; bör testas med separata data.' Undvik orsakssamband och definitiva uttalanden.
Svag prompt / Stark prompt
Svag uppmaning:
Gör fina grafer av avkastningen och berätta vad de betyder.
Den här uppmaningen uppmanar till missvisande resultat: "vacker" fokuserar på estetik, medan "vad det betyder" driver AI att hoppa från upptäckt till definitiv slutsats. Kausala, överdrivna kommentarer följer.
Kraftfull uppmaning:
Din roll: ärlig EDA-assistent.Uppgift: (1) välj den typ av diagram som passar min fråga och skriv motiveringen,(2) starta axeln från noll i stapeldiagram,(3) tolka resultatet i DISCOVERY NOTE-språk: inga definitiva/kausala påståenden tyder på hypoteser i "måste testas"-miljön,(4) kommer att varna mig om min <30 är liten (varna mig om provet är 30). det.
Skillnad: stark vilja motiverar diagramtypen, inför ärlighetsregler och blandar inte ihop upptäckt med bekräftelse.
tre minifodral
Fall 1 — Diskret axelöverdrift. En analytiker visade nöjdhetspoängen för två grenar (7,8 och 8,0; av 10) i ett stapeldiagram. När man startade YZ-axeln från 7,5, verkade den andra grenen nästan dubbelt så hög som den första; medan skillnaden bara var 2,5 %. Ledningen var på väg att belöna en filial under fel intryck. När jag startade axeln från början var skillnaden nästan osynlig. Lärdom: enbart axelval förändrar uppfattning.
Fall 2 — Lita på korrelationen och hoppa över diagrammet. En forskare såg r = 0,81 mellan två variabler och skrev "starkt linjärt samband". När hans konsult frågade efter spridningsdiagrammet sågs det att förhållandet faktiskt berodde på en enda extrem observation, och när den punkten togs bort sjönk korrelationen till 0,12. Lektion: korrelationsantal ersätter inte en graf; titta alltid på spridningen.
Fall 3 — Förvirrande upptäckt med bekräftelse. En elev tittade på alla parvisa korrelationer i en datauppsättning med 40 variabler, valde den högsta (r=0,52) och skrev, "vi hittade ett signifikant samband mellan utbildning och besparingar (p=0,004)." Det fanns dock hundratals par i 40 variabler; att välja den högsta var ett falskt fynd på grund av slumpen. Lärdom: det upptäckta mönstret kan inte "testas och förklaras signifikant" i samma data; Separat bekräftelse krävs.
Vanliga misstag
- Startar inte axeln från noll i stapeldiagrammet. Det överdriver den lilla skillnaden; Den vanligaste visuella lögnen. Kolla alltid.
- Tittar på korrelationen och hoppar över diagrammet. Samma korrelation kommer från väldigt olika mönster; kan passa ett avvikande förhållande. Först spridning.
- Med tanke på mönstret som hittades i upptäckten som "bevis" i samma data. Detta är porten till p-hacking; Bekräftelse görs separat.
- Fel diagramtyp. Matchningar som bar för trend och paj för distribution är missvisande. Välj en genre utifrån frågan.
- Döljer provstorleken. n=8 och n=8 000 ska inte se likadana ut på samma graf; osäkerhet måste visas.
Tips: Innan du publicerar ett diagram, fråga dig själv: "Skulle historien förändras om jag ändrade axeln?" Om svaret är ja, startade du förmodligen pivoten från ett oärligt ställe.
Sammanfattningsvis
Undersökande dataanalys är fasen för att möta data, se mönster och generera hypoteser; Det är ingen bekräftelse. AI:n genererar snabbt beskrivande statistik och grafkod, men du väljer graftyp baserat på din fråga och kontrollerar principerna för rättvisa (nollaxel, konsekvent skala, uppenbar osäkerhet). Titta på spridningen innan du litar på korrelationsnumret; Deklarera inte mönstret du hittade i upptäckten som "bevis" i samma data. En vacker graf över AI betyder inte en korrekt graf.
Applikationsuppgift
Välj minst tre variabler i en datamängd. Be AI-en om och kör kod som producerar utforskande grafer (histogram, scatter, boxas) med en prompt som upprätthåller ärlighetsregler. För varje diagram: kontrollera (1) att diagramtypen är lämplig för frågan, (2) axelns ärlighet, (3) synligheten av urvalsstorleken. Skriv minst en "upptäcktsnotis" på hypotesspråk ("... verkar testas separat"). Undersök en korrelation med både räkning och spridning och rapportera om det finns en diskrepans mellan dem.
checklista
- [ ] Jag valde diagramtypen baserat på min fråga och datatyp.
- [ ] I stapeldiagram börjar jag y-axeln från noll; Jag kollade axelns ärlighet.
- [ ] Jag tittade på scatterplotten innan jag litade på korrelationen.
- [ ] Jag återspeglade urvalets storlek och osäkerhet på grafen.
- [ ] Jag skrev mönstren jag hittade i utforskningen som "hypotes som ska testas" snarare än "bevis".
- [ ] Jag noterade att jag inte skulle använda samma data för bekräftelse och att ett separat steg krävdes.