Gevinster:
- Evne til at genkende manglende datatyper (MCAR/MAR/MNAR), outliers og kodningsfejl og bruge AI med de korrekte data til at producere oprydningskode og diagnostik
- Mulighed for at se, hvordan hvert rengøringstrin (sletning, tildeling, transformation) foreslået af kunstig intelligens vil påvirke analyseresultatet og etablere en reversibel og dokumenteret arbejdsgang
- Fastholdelse af, at oprydningsbeslutninger er baseret på viden om den proces, der genererer data, og at kunstig intelligens er en overvåget assistent, ikke en blind automat
Enhver erfaren analytiker kender én sandhed: Det meste af tiden i et empirisk projekt er ikke modellering, men datarensning (arbejdet med at rette fejl, udeladelser og uoverensstemmelser i dataene og gøre dem klar til analyse). Som en grov tommelfingerregel går omkring 70-80% af tiden til at forstå, rense og transformere data; der er kun 20-30% tilbage til selve analysen. I denne enhed vil vi trin for trin se, hvordan kunstig intelligens (AI) letter denne tunge byrde, men hvilke beslutninger der stadig skal forblive hos dig og hvorfor.
Lad os sætte to grundlæggende fakta først. For det første er rengøringsbeslutninger baseret på din viden om processen, der producerer dataene: kun du ved, hvorfor en værdi mangler, hvorfor et tal er for stort. AI ser ikke dataene, kender ikke sammenhængen; Skriver kode, tager ikke beslutninger. For det andet kan hvert rengøringstrin ændre analyseresultatet. Sletning af en outlier kan invertere koefficienten; At udfylde det manglende med middelværdien kan kunstigt reducere variansen. Så oprydning bør være reversibel og dokumenteret: Rør aldrig ved rådata, udfør hvert trin i kode, registrer virkningen af hvert trin.
Trin-for-trin rengøringsarbejdsgang
1. Kend dataene. Se først strukturen: antal rækker (observationer) og kolonner (variabler), type af hver variabel (numerisk, kategorisk, dato), opsummerende statistik, antal manglende. Du kan bede AI om denne "dataprofil"-kode; Men du læser outputtet og stiller spørgsmål som "hvorfor kom denne variabel som tekst?"
2. Forstå og klassificere manglende data. Manglende data er opdelt i tre typer. MCAR (Missing Completely At Random): den manglende skyldes ikke noget, for eksempel fejlede en sensor tilfældigt. MAR (Mangler tilfældigt): mangler afhænger af andre observerede variabler, for eksempel lader ældre et spørgsmål oftere stå tomt, men du kender alder. MNAR (Missing Not At Random): savnet afhænger af selve den uobserverede værdi, for eksempel rapporterer højtlønnede ikke deres indkomst. Denne sondring er kritisk, fordi den bestemmer løsningsmetoden, og AI'en kan ikke bestemme dette for dig.
3. Håndter manglen. Muligheder: listevis sletning, middel-/medianimputation, modelbaseret multiple imputation. Sletning i MCAR er relativt sikker, men reducerer stikprøvestørrelsen. Flere opgave er mere passende i MAR. Ingen enkel metode garanterer upartiskhed i MNAR; Mangelmekanismen bør modelleres, eller der bør i det mindste udføres en følsomhedsanalyse. Middeludfyldning er let, men farligt: det reducerer varians, svækker relationer og skjuler usikkerhed.
4. Undersøg outliers. En outlier er en observation, der står meget langt væk fra de andre. Adskil de to spørgsmål: Er dette en fejl (alder 999 blev skrevet i dataindtastningen), eller er det en reel, men afvigende værdi (en milliardærs indkomst)? Rette fejl; Slet ikke sande outliers, fordi de repræsenterer data. Sletning af outlieren "fordi det generer" du skævvrider dataene mod resultatet.
5. Kodning og konsistens. Standardiser kategorier ("Mand", "mandlig", "E" alt sammen i én kode), bring datoer i ét format, enheder i én skala, opdag duplikerede rækker. Dette er den mindst risikable fase, hvor AI hjælper bedst.
6. Dokumenter og frys. Optag hvert trin med kode og en kommentarlinje, og hold rå og rensede data adskilt. Så når en dommer spørger "hvorfor blev disse observationer droppet?" du har dit svar klar.
Forsigtig: Træf ikke rengøringsbeslutninger baseret på resultater. At slette en linje, der siger "Når du sletter denne linje, bliver koefficienten signifikant" er den mest lumske form for p-hacking, som vi vil se i næste enhed.
Sammenligningstabel: manglende datametoder
Metode
Hvornår er det passende?
risiko
AI's rolle
Slet en række
MCAR, lav manglende rate
Prøven bliver mindre, bias i MAR/MNAR
Skriver koden; du bestemmer
Middel/median tildeling
Hurtig foreløbig analyse
Reducerer varians, skjuler forhold
Det er nemt, men anbefaler det ikke; bør advare
Multiple assignment (MI)
MAR, vigtige variabler
Hvis det ikke installeres korrekt, vil det være vildledende
Anbefaler kode og pakke (mus)
Modellering af mekanismer
MNAR
Kompleks, antagelseskrævende
Kun udkast; ekspert er påkrævet
Fire kopierbare prompter
1. Dataprofilering:
Din rolle: assistent til datarensning. Jeg deler ikke dataene, jeg vil have R-koden. Jeg har en data.frame kaldet 'digit'; variabler: id, alder (numerisk), indkomst (numerisk), uddannelse (kategorisk), region (kategorisk), dato (dato). Opgave: skriv kode, der producerer type, manglende tal og hastighed for hver variabel, opsummerende statistik for numeriske og frekvenstabel for kategoriske. Tilføj kommentarlinje.
2. Manglende datadiagnose:
Skriv kode, der undersøger det manglende mønster for 'ciffer'-dataene ovenfor: - den manglende hastighed for hver variabel, - en simpel tabel/graf, der viser forholdet mellem mangler og andre variable. Jeg vil se på outputtet af koden og foretage MCAR/MAR/MNAR skelnen; Du producerer bare det diagnostiske værktøj, bestemmer IKKE tildelingsmetoden.
3. Outlier-inspektion (ikke sletning):
Skriv kode for variabel 'indkomst', der undersøger outliers UDEN AT SLETTE: boxplot, IQR-baserede grænser og tabel med outlier-observationer + værdier. Jeg vil se, om disse er fejl eller reelle. Tilføj automatisk sletning.
4. Kodningsstandardisering:
I 'uddannelse'-variablen skrives værdierne blandet: "Primary school","primary school","PRIMARY","High school","gymnasium","University","univ". Skriv R-kode, der omkoder disse til konsistente kategorier; Vis kortlægningstabellen tydeligt, så jeg kan bekræfte hver konvertering. Indstil den værdi, du ikke genkender, til "UNKNOWN".
Svag prompt / Stærk prompt
Svag prompt:
Ryd op i data, udfyld hullerne, kassér afvigelserne.
Dette krav er farligt: Det giver blind autoritet til AI. Hvilken type mangler, hvilken slags fyld, hvilken modstridende sandhed - intet af det er klart. Resultatet kan være et hemmeligt partisk datasæt.
Kraftig prompt:
Din rolle: rengøringsassistent, du er ikke beslutningstageren. Gå trin for trin og skriv kode, der rapporterer virkningen af HVERT trin: 1) vis det manglende mønster (Slet IKKE/udfyld IKKE), 2) angiv outlier-kandidater (Slet IKKE), 3) ret kategoriuoverensstemmelser med kortlægningstabellen. Udskriv rækkeantallet og oversigtsstatistikken efter hvert trin, så jeg kan se og bekræfte ændringen. Automatisk tildeling/sletningsindsættelse.
Forskellen er klar: stærk vilje placerer AI som en overvåget assistent, der producerer reversible og dokumenterede trin.
tre minisager
Case 1 — Gennemsnitlig opgavefælde. En analytikers indkomstdata for 5.000 personer manglede 18 %. Han fortalte AI at "udfylde hullerne"; AI var gennemsnittet for dem alle. Resultat: indkomstvariansen faldt med 22 %, og koefficienten for uddannelse-indkomstforholdet viste sig at være svagere, end den var. Korrekt måde: manglen var MAR (på grund af uddannelse), skulle udfyldes af flere opgave (mus). Lektion: påfyldningsmetoden afhænger af mekanismen.
Tilfælde 2 — Outlier-rensning vender resultatet om. Der var 3 meget store virksomheder (0,6 % af den samlede observation) i en virksomhedsdata. Disse blev slettet af AI's "rengørings"-forslag; Stordriftskoefficienten vendte fra positiv til negativ. Imidlertid var disse 3 virksomheder reelle og en vigtig del af branchen. Den korrekte måde var at rapportere med både fuld og robust estimat i stedet for at slette. Lektion: reelle outliers er data, ikke støj.
Tilfælde 3 — Tavs kodefejl. I et panel kom datovariablen i to forskellige formater ("2020-03-01" og "01/03/2020"). Da kombinationskoden produceret af AI forvekslede dem med forskellige værdier, var 1.400 observationer mismatchede, og vækstraterne blev latterlige. Det ville være ligegyldigt, hvis analytikeren ikke tjekkede rækkeantallet. Lektion: Observationstællinger og sundhedstjek efter hvert trin er et must.
Almindelige fejl
- Blindt udfylde hullet med gennemsnittet. Det reducerer varians, skjuler usikkerhed og skaber bias i MAR/MNAR. Klassificer først mekanismen.
- Sletning af outlieren "fordi det generer". Sande outliers repræsenterer dataene; sletning bøjer resultatet. Ret hvad der er galt, behold hvad der er ægte.
- Tap på rådata. Rediger aldrig rådata; Lav al oprydningen med koden i en separat kopi, så den kan vendes tilbage til.
- Måler ikke virkningen af trin. Hvis rækkeantallet og oversigtsstatistikken ikke kontrolleres efter hvert trin, vil tavse fejl akkumuleres.
- Oprydning som følge heraf. Logikken i "Når du tilføjer denne linje, bliver resultatet bedre" er p-hacking; Rengøring bør planlægges før og uafhængigt af analyseresultatet.
Tip: Hold en "før/efter"-tabel, der sætter den samme grundlæggende statistik (middelværdi, median, antal observationer, nogle få sammenhænge) side om side før og efter oprydningen. Et uventet spring er den bedste varsel om en skjult fejl.
Sammenfattende
Datarensning er den mest tidskrævende og beslutningskrævende fase af empirisk arbejde. AI er en kraftfuld kodegenerator på dette område, men den kan ikke kalde skud: du klassificerer den manglende datatype (MCAR/MAR/MNAR), afgør, om udliggeren er en fejl eller reel, holder hvert trin reversibelt og dokumenteret. I stedet for at give AI-blinde "klar" autoritet, skal du etablere en trin-for-trin arbejdsgang, hvis effekt måles og valideres. Kontrol af antallet af observationer og oversigtsstatistikker efter hvert trin er den bedste modgift mod tavse fejl.
Ansøgningsopgave
Vælg mindst to variabler, der indeholder manglende og afvigende værdier i et datasæt (dine egne data eller et eksempelsæt). Anmod om en diagnostisk kode fra AI'en via prompten "trin for trin, slet/udfyld ikke" ovenfor, og kør den. Klassificer manglen som MCAR/MAR/MNAR og skriv din begrundelse i én sætning. Undersøg de modstridende kandidater en efter en og afgør, hvilken der er en fejl, og hvilken der er reel. Fremstil til sidst en "før-efter"-tabel før/efter rengøring og rapporter, hvis der er uventede ændringer.
tjekliste
- [ ] Jeg rensede de rå data i en separat kopi uden at ændre den.
- [ ] Jeg klassificerede manglen som MCAR/MAR/MNAR og valgte metoden i overensstemmelse hermed.
- [ ] Jeg undersøgte outlierne en efter en, om de var fejl eller reelle; Jeg slettede det ikke blindt.
- [ ] Jeg tjekkede antallet af observationer og opsummerende statistikker efter hvert rengøringstrin.
- [ ] Jeg dokumenterede alle trinene med kode og en kommentarlinje; reversibel.
- [ ] Jeg baserede rengøringen på viden om den proces, der producerer dataene, ikke på analyseresultatet.