Enhed 6 / 12

Dataanalyse og fortolkning: Kunstig intelligens med tabeldata

Gevinster:

  • Evne til at analysere salgs-, omkostnings- og driftstabeller med kunstig intelligens og opdage trends, brud og outliers
  • Evne til at verificere mod aritmetiske fejl og hallucinationer ved at gentage eller manuelt kontrollere hver beregning
  • Evne til at skelne korrelation fra årsagssammenhæng og stille spørgsmålstegn ved datakvalitet og stikprøvegrænser før fortolkning

En af de mest gentagne sætninger inden for ledelsesrådgivning er: "Hvad siger tallene?" En kundes salgsdata, omkostningstabel, kundesegmenter eller operationelle målinger; de fortæller alle en historie. Konsulentens opgave er at finde den historie, bevise den og vise den tydeligt til beslutningstageren. Kunstig intelligens fortolker et diagram på få sekunder, påpeger tendenser, laver beregninger og genererer endda kode (Python, Excel-formel) til analyse. Men der er en særlig fare her: AI kan stille og roligt lave fejl i aritmetikken og præsentere det forkerte tal med korrekt sikkerhed. Derfor er den gyldne regel i dataanalyse at gentage eller manuelt kontrollere hver beregning.

To måder at arbejde med data på

Der er to primære metoder til dataanalyse med AI, og at kende forskellen er afgørende for nøjagtigheden.

  1. Tekstfortolkning af modellen: Du indsætter dataene direkte i chatten og siger "kommenter". Modellen læser mønstrene, men laver beregningerne "mentalt"; Dette er stien med den højeste risiko for fejl. Velegnet til små tabeller og kvalitativ fortolkning, ikke til præcist regnskab.
  2. Kode/værktøjsgenerering: Du udskriver analysekode (Python/pandas) eller Excel-formel til modellen; Koden udfører beregningen, ikke modellen. Denne måde er meget mere pålidelig, fordi aritmetikken fungerer i et deterministisk værktøj. Foretrækker det til big data og præcise tal.
Tip: Hvis du har brug for et nøjagtigt tal (total omsætning, gennemsnit, vækstrate) så bed modellen om at "skrive Excel-formlen/Python-koden, der beregner dette", kør resultatet selv. Betragt aldrig tallet givet af modellen som endeligt.

Sådan opsætter du analyseprompt

En god analyseprompt inkluderer dataene, det stillede spørgsmål og valideringsreglen.

Din rolle: dataanalytiker. Nedenfor er et 24-måneders salgsdiagram (måned, region, produkt, mængde, omsætning). Opgave: 1) Opsummer den samlede og månedlige omsætningstendens. 2) Find de 3 hurtigst voksende og hurtigst krympende region-produktopdeling. 3) Marker, om der er nogen afvigelser (uventet hop/fald). Regler:- Skriv Excel-formlen, der laver hver beregning ved siden af ​​den; Jeg vil verificere.- Adskil fortolkningen fra dataene: først "siger dataene", derefter "mulig betydning".- Påstår ikke kausalitet; vis kun mønster.

Denne anmodning har tre kritiske elementer: at kræve formlen (verificerbarhed), at adskille data fra fortolkning (integritet) og at forbyde påstanden om kausalitet (emnet for næste afsnit).

Korrelation er ikke årsagssammenhæng

Den mest almindelige og dyre logiske fejl i analyse er at antage, at en af to ting, der virker sammen, forårsager den anden. Bare fordi to variable øges sammen (korrelation), beviser det ikke, at den ene forårsager den anden (årsagssammenhæng); Der kan være en tredje faktor eller tilfældighed. Klassisk eksempel: i takt med at salget af is stiger, stiger drukningerne også; Årsagen er ikke is, varmt vejr rejser begge dele.

AI kan nemt skrive en korrelation, da "X øger Y." Når konsulenten ser denne sætning, bør han stoppe op og spørge: "Er dette virkelig årsagen, eller er der en skjult faktor?" Påstand om kausalitet; kontrolleret sammenligning kræver viden om tidsrækkefølge og domæne.

Din rolle: kritisk dataanalytiker.Den følgende analyse indeholder en "X øger Y"-påstanden.Opgave:- Vurder, om denne sammenhæng er sammenhæng eller begrundet årsagssammenhæng.- Nævn 3 mulige latente (tredje) faktorer, der kan have indflydelse på begge.- Sig, hvilken yderligere evidens (sammenligningsgruppe, tidssekvens), der er nødvendig for at understøtte kausalitet.Brug strengt kausalt sprog; Skriv "mulig" og "bør testes."

At stille spørgsmålstegn ved datakvalitet før fortolkning

God analyse kommer ikke fra dårlige data. Stil hvert diagram disse spørgsmål, før du kommenterer:

kontrol

Hvorfor er det vigtigt?

Hvordan man plejer

manglende data

Tomme celler forvrænger middelværdien

Tæl blank/nul-forhold

afvigere

En enkelt outlier forvrænger tendensen

Se på min-max og fordeling

Definition konsistens

Er "omsætningen" den samme hver måned?

Bekræft kolonnedefinition

tidsinterval

Vildleder sæsonudsving?

Sammenlign år for år

prøve

Repræsenterer dataene hele universet?

Spørg efter dækningsgrad

Inden du fortolker denne tabel, skal du foretage et datakvalitetstjek:- Hvad er forholdet mellem manglende/nul celle?- I hvilke rækker er de ekstreme (outlier) værdier?- Er kolonnedefinitionerne konsistente, er der nogen mistænkelige? Bare giv en revisionsrapport; Kommenter ikke endnu.

tre minisager

Tilfælde 1 — Tavs regnefejl. En konsulent får modellen til at indsamle 12 måneders omsætning; modellen siger "142,6 mio." Konsulenten tjekker i Excel: faktisk samlet 128,4 mio. Modellen tilføjede to måneder forkert. Hvis der var blevet anmodet om en formel i stedet for en hovedberegning, havde der ikke været nogen fejl. Hvis det forkerte tal var blevet indtastet i præsentationen, ville kundernes tillid være blevet rystet.

Tilfælde 2 — Uforfalsket årsagssammenhæng. Hos en forhandler siger modellen: "Omsætningen steg i de måneder, hvor rabatten blev tilbudt, så rabatten øger omsætningen." Konsulenten stopper: Der gives allerede rabatter i ferien; Den vigtigste drivkraft er ferieefterspørgslen. For at måle rabateffekten kræves en sammenligning med ferie uden rabat. Falsk slutning forhindrer et margin-brændende forslag som "lad os rabat hver måned."

Tilfælde 3 - Outlier fælde. En zonegennemsnitlig ordreværdi forekommer unormalt høj. Modellen tolker dette som en "præmiezone". Konsulenten åbner linjen: en enkelt virksomhedsordre på 4,2 millioner pustede gennemsnittet op; Når den linje fjernes, er regionen almindelig. Brug af median ville undgå denne fælde i første omgang.

Svag prompt / Stærk prompt

Svag prompt:

Analyser dette salgsdiagram og angiv de vigtigste resultater.

Modellen beregner frontalt, hævder kausalitet og giver uverificerbare resultater.

Kraftig prompt:

Din rolle: minutiøs dataanalytiker. Foretag først en datakvalitetsaudit (manglende, afvigende, definitionskonsistens). Derefter: månedlig trend, top 3 opdelinger, outliers.- Skriv Excel-formlen for hver konto; Jeg vil verificere.- Giv også median i stedet for middelværdi (for at se afvigende effekt).- Adskil "data siger" fra "mulig betydning"; KRÆV IKKE kausalitet. - Marker "uklart", hvor du ikke er sikker.

Segmentering: den sandhed gennemsnittet skjuler

Et af de mest kraftfulde træk inden for konsulentanalyse er segmentering: opdeling af et samlet antal i meningsfulde undergrupper. Den "gennemsnitlige kunde" er ofte en ikke-eksisterende konstruktion; Sandheden er gemt i undergrupperne. For eksempel, mens den gennemsnitlige fortjenstmargen ser ud til at være 8 %, kan 20 % af kunderne give en margin på 25 % og 30 % tabe; gennemsnit skjuler fuldstændig denne kendsgerning. Kunstig intelligens hjælper dig med hurtigt at nedbryde et diagram på tværs af forskellige akser (kundetype, region, produkt, kanal) og finde ud af, hvilken opdeling der viser den mest slående forskel.

Din rolle: dataanalytiker. Tabellen er nedenfor.Opgave: Bryd disse data på følgende akse: [kundetype / region / produkt].For hver gruppe: total, andel (%), middel OG median, gruppestørrelse (n).Regler:- Hvis gruppe n<30, marker "lille prøve - opmærksomhed".- Skriv formlen for hver konto; Jeg vil verificere.- Vis højeste og laveste gruppe; Vurder, om forskellen er reel eller skyldes en enkelt afviger. Lad mig først fortælle dig, hvilken sammenbrud jeg forventer: [hypotese].

Almindelige fejl

  • Stoler på modellens hovedberegning. Outsource aritmetikken til det deterministiske værktøj (Excel/Python); Tjek resultatet uafhængigt.
  • Forkert sammenhæng med årsagssammenhæng. Skriv ikke sætningen "X øger Y" uden beviser; Spørg om den skjulte faktor.
  • Ser blindt på gennemsnittet. Den enkelte udligger puster middelværdien op; Se også median og fordeling.
  • Omgå datakvalitet. Fortolkninger som følge af ufuldstændige, duplikerede eller inkonsistente data er vildledende; tjek først.
  • Glemte eksemplet. Generalisering fra en lille eller partisk stikprøve til hele populationen vil give fejlagtige resultater.
  • Forvirrer data med fortolkning. Vis separat, hvad der er måling, og hvad der er inferens.
Bemærk: Hvis resultatet af analysen af ​​økonomiske, sundhedsmæssige eller operationelle sikkerhedsdata vil være grundlaget for en beslutning, skal beregningerne og fortolkningen bekræftes af den relevante ekspert (finansiel rådgiver, aktuar, feltekspert). Kunstig intelligens producerer foreløbig analyse; Den endelige evaluering og ansvaret tilhører mennesker.

Sammenfattende

Kunstig intelligens er en stærk hjælp til at fortolke tabeldata, finde tendenser og nedbrud og generere analysekode. Men da den stille kan lave fejl i regnestykket, er det nødvendigt at få hver udregning gentaget med et deterministisk værktøj og kontrolleret manuelt. Adskillelse af korrelation fra kausalitet, se på medianen ved siden af ​​middelværdien, kontrol af datakvalitet før fortolkning og observation af stikprøvegrænser er de grundlæggende discipliner inden for rådgivning. Model viser mønster; Mennesker skaber mening og ansvar.

Ansøgningsopgave

Vælg en faktisk eller repræsentativ salgs-/omkostningsopgørelse. Kør først prompten til datakvalitetstjek, og find mindst ét ​​problem (manglende, afvigende, definitionsinkonsistens). Udtræk derefter trends og breakouts med kraftfuld analyseprompt; Kontroller også manuelt formlen for hver konto. Sammenlign middelværdien med medianen og opdag en afvigende effekt. Find endelig en kausalitetspåstand, som modellen skriver, og omformuler den som "korrelation".

tjekliste

  • [ ] Jeg kørte hver eksakte beregning igen med det deterministiske værktøj (Excel/Python).
  • [ ] Jeg udførte et datakvalitetstjek, før jeg kommenterede.
  • [ ] Udover middelværdien så jeg på medianen og fordelingen.
  • [ ] Jeg bevarede sondringen mellem korrelation og årsagssammenhæng.
  • [ ] Jeg satte spørgsmålstegn ved prøven og tidsperiodegrænserne.
  • [ ] Jeg adskilte "data siger" og "mulig betydning".
  • [ ] Jeg planlagde ekspertgodkendelse i beslutningskritisk analyse.