Nyereség:
- Leíró statisztikák és eloszlási/kapcsolati diagramok készítésének képessége mesterséges intelligencia támogatásával, valamint az adatoknak és a kérdésnek megfelelő diagramtípus kiválasztásával
- Képes a mesterséges intelligencia által készített képeken a félrevezető választások (szaggatott tengely, nem megfelelő lépték, túlzott simítás) felismerésére és az őszinte vizualizációs elvek alkalmazására
- Az a képesség, hogy meg tudjuk különböztetni, hogy a feltáró elemzés hipotézisek generálására szolgál, és az azonos adatokkal való felfedezés és megerősítés csapdája (ami megnyitja a kaput a p-hackelés előtt).
Az adatok tisztítása után az empirikus kutató első dolga a megismerés. Ezt a szakaszt feltáró adatelemzésnek (EDA – Exploratory Data Analysis) nevezzük: ez az a folyamat, amikor az adatokat grafikonokkal és összefoglaló statisztikákkal vizsgáljuk, és meglátjuk azok szerkezetét, mintázatait és meglepetéseit. A cél még nem egy hipotézis tesztelése, hanem az adatok megismerése, kérdések generálása és a jövőben felépítendő modell megalapozása. Ebben az egységben látni fogjuk, hogy a mesterséges intelligencia (AI) hogyan gyorsítja fel az EDA-t és a vizualizációt, de miért kell gondosan ellenőrizni az általa előállított grafikákat.
Először tegyünk két alapvető különbséget. Először is, a leíró statisztika (számok, amelyek olyan adatokat foglalnak össze, mint az átlag, medián, szórás, kvartilisek) és a vizualizáció (ugyanazt az információt grafikusan mutatja) kiegészítik egymást; Együtt írják le az adatokat. A második és legkritikusabb: a felfedezést és a megerősítést meg kell különböztetni. A feltáró elemzés hipotézisek generálására szolgál; A hipotézis ugyanazokkal az adatokkal való feltárása és a „teszteltem, és jelentősnek találtam” kimondása megnyitja a kaput a p-hackelés előtt, amit a következő részben látni fogunk. Ingyenes az adatok megtekintése és egy minta megtekintése; De félrevezető, ha ezt a mintát „bizonyított megállapításnak” nyilvánítják ugyanazon adatok között.
Lépésről lépésre feltáró elemzés
1. Egyváltozós nézet. Vizsgáljunk meg minden változót egyenként: szimmetrikus vagy ferde az eloszlása; hány domb van ott; Hol vannak a kiugró értékek? Numerikus változók esetén hisztogram (diagram, amely a gyakoriságot mutatja az értékek tartományokra való felosztásával) és boxplot (boxplot – a medián, kvartilis és szélső értékeket mutató diagram); Kategorikus változókhoz használjon gyakorisági táblázatokat és oszlopdiagramokat.
2. Kétváltozós nézet. Tekintse meg a két változó közötti kapcsolatot: két numerikus változó esetén szórványdiagram (mindegyik megfigyelés egy pontként jelenik meg az x-y síkon), csoportos dobozdiagram a numerikus-kategorikushoz, kereszttábla két kategorikushoz. Mielőtt megnéznénk a korrelációs együtthatót, mindenképpen nézzük meg a szórásdiagramot: ugyanaz a korreláció nagyon eltérő mintákat mutathat (ezt a híres Anscombe-kvartett is bizonyítja; négy adathalmaz majdnem azonos statisztikával rendelkezik, de ábrázolva teljesen eltérőnek bizonyul).
3. Válassza ki a megfelelő diagramtípust. A diagram típusa a kérdéstől és az adattípustól függ. Elosztási hisztogram; szórvány kapcsolatra; vonaldiagram az időbeli változáshoz; oszlopdiagram kategória-összehasonlításhoz; (óvatosan) egymásra rakott rúd a részek és az egész arányához. A mesterséges intelligencia gyorsan generál kódot az Ön számára, de a „melyik kérdéshez melyik grafikon” döntése a tiéd.
4. Jegyezze fel a mintát, ne deklarálja az eredményeket. Minden érdekes mintát jegyezzen fel „felfedezési jegyzetként”, de ne tekintse megerősített leletnek. A visszaigazolás külön lépésben történik, lehetőleg külön adatokkal vagy előre meghatározott ütemezéssel.
Őszinte vizualizációs elvek
A grafika meggyőz; Ezért a félrevezető ereje is nagy. A mesterséges intelligencia esztétikus, de néha félrevezető döntéseket hozhat. Ellenőrizze ezeket az irányelveket:
- Az oszlopdiagramokban az y tengelynek nulláról kell kezdődnie. A szaggatott tengely kis eltéréseket mutat nagynak.
- A skálának következetesnek kell lennie. Ha két diagramot hasonlít össze, használja ugyanazt a tengelytartományt.
- A túlzott simítás elrejtheti a valódi mintát. Egy trendvonal jól néz ki, de ha túlságosan "kisimítja" az adatokat, félrevezető lehet.
- A színek és a 3D dekoráció a figyelmet torzítja, nem az adatokat. Válassza az egyszerűséget.
- A hiányzó adatoknak és a mintaméretnek láthatónak kell lennie. Az „n=12” és az „n=12 000” nem ugyanúgy néz ki.
Figyelem: Csak azért, mert az AI által készített grafika gyönyörű, nem igaz. A leggyakoribb hiba, amit elkövet, hogy az oszlopdiagramban nem nulláról indul a tengely, és eltúlozza a két csoport közötti különbséget. Mindig ellenőrizze a tengelyt.
Összehasonlító táblázat: kérdés → diagram
Kérdezz
helyes diagram
Gyakori hiba
Hogyan oszlik el ez a változó?
Hisztogram/doboz diagram
kördiagram használata
Összefügg két numerikus változó?
Szórványrajz
Csak nézzük az összefüggések számát
Hogyan változott az idők során?
vonaldiagram
Trend elmondása oszlopdiagrammal
Mi a különbség a csoportok között?
Csoportosított doboz/sáv (a semmiből)
Csonkatengelyű rúd
Rész-egész arány?
Halmozott rúd (óvatossággal)
Többszeletes kördiagram
Négy másolható felszólítás
1. Automatikus felderítési kód:
Az Ön szerepe: EDA asszisztens. Nem osztom meg az adatokat, az R (ggplot2) kódot szeretném. Az 'data' data.frame-ben számszerű (jövedelem, életkor, kiadás) és kategorikus (régió, iskolai végzettség) változók találhatók. Feladat: írjon olyan kódot, amely minden egyes számhoz hisztogramot, minden kategóriához oszlopdiagramot, valamint jövedelem-életkor szóródási diagramot készít. Az oszlopdiagramokban az y tengely NULLA-ból induljon. Megjegyzéssor hozzáadása.
2. Korreláció áttekintése (korreláció + vizuális együtt):
Írjon olyan kódot, amely kiszámítja a Pearson-korrelációt a bevételekre és a kiadásokra, és ábrázol egy szóródiagramot + lineáris trendet. Adjon hozzá egy megjegyzéssort, amely emlékeztet arra, hogy vizsgáljam meg a diagramot, mielőtt BÍZNAK a korrelációs számban (Anscombe figyelmeztetés). Ne simítsa túl a trendvonalat.
3. Integritás audit:
Ellenőrizze a következő ggplot kódot az őszinte megjelenítéshez: [kód]. Ellenőrizze és javítsa ki a következőket: az y tengely nulláról indul, konzisztens-e a skála, látható-e a minta mérete, nincs-e túlzott simítás? Magyarázza el minden elvégzett javítás indoklását.
4. Felfedezési jegyzet (nem lelet) készítése:
Az általam készített grafikonok alapján „felfedezési jegyzetként” sorolja fel az ÉSZREVÉTELEKET; minden tételt a „tesztelendő hipotézis” nyelvén írjon, ne a „végső megállapítás” nyelvén. Példa: „A felsőoktatásban elért jövedelem szétszórtabbnak tűnik; külön adatokkal kell tesztelni.' Kerülje az ok-okozati és végleges kijelentéseket.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Készíts szép grafikonokat a hozamból, és mondd el, mit jelentenek.
Ez a felszólítás félrevezető eredményre hív: a „szép” az esztétikára összpontosít, míg a „mit jelent” arra készteti az AI-t, hogy a felfedezéstől a végleges következtetésig ugorjon. Ok-okozati, túlzó megjegyzések következnek.
Erőteljes felszólítás:
Az Ön szerepe: becsületes EDA asszisztens.Feladat: (1) válassza ki a kérdésemnek megfelelő diagramtípust, és írja meg az indoklást, (2) indítsa el a tengelyt nulláról az oszlopdiagramokban, (3) értelmezze a kimenetet a DISCOVERY NOTE nyelven: nincs végleges/ok-okozati állítás hipotézisre utal a "tesztelni kell" nyelven, (4) figyelmeztetni fogok, ha a diagram a saját környezetében fut<3, és a minta kicsi. azt.
Különbség: az erős akarat igazolja a diagram típusát, megköveteli az őszinteség szabályait, és nem keveri össze a felfedezést a megerősítéssel.
három mini tok
1. eset – Diszkrét tengelyű túlzás. Egy elemző oszlopdiagramon mutatta meg két ág elégedettségi pontszámát (7,8 és 8,0; 10-ből). Amikor az YZ tengelyt 7,5-ről indítottuk, a második ág majdnem kétszer olyan magasnak tűnt, mint az első; míg a különbség csak 2,5% volt. A vezetőség a rossz benyomás alapján meg akart jutalmazni egy fiókot. Amikor a tengelyt a nulláról indítottam, szinte láthatatlan volt a különbség. Tanulság: a tengelyválasztás önmagában megváltoztatja az észlelést.
2. eset – Bízunk a korrelációban és kihagyjuk a diagramot. Egy kutató r = 0,81-et látott két változó között, és azt írta, hogy "erős lineáris kapcsolat". Amikor tanácsadója kérte a szórásdiagramot, látható volt, hogy a kapcsolat valójában egyetlen szélsőséges megfigyelésnek köszönhető, és amikor ezt a pontot eltávolították, a korreláció 0,12-re csökkent. Tanulság: a korrelációszám nem helyettesíti a grafikont; mindig a szóródást nézd.
3. eset – Zavaros felfedezés a megerősítéssel. Egy diák megvizsgálta az összes páronkénti összefüggést egy 40 változós adathalmazban, kiválasztotta a legmagasabbat (r=0,52), és ezt írta: „szignifikáns kapcsolatot találtunk az iskolai végzettség és a megtakarítások között (p=0,004). Azonban 40 változóban több száz pár volt; a legmagasabb választása a véletlenből fakadó hamis megállapítás volt. Tanulság: a feltárt mintát nem lehet ugyanazokban az adatokban „tesztelni és jelentősnek nyilvánítani”; Külön visszaigazolás szükséges.
Gyakori hibák
- Nem nulláról indul a tengely az oszlopdiagramban. Eltúlozza a kis különbséget; A leggyakoribb vizuális hazugság. Mindig ellenőrizze.
- Nézzük a korrelációt és kihagyjuk a diagramot. Ugyanaz a korreláció nagyon különböző mintákból ered; belefér egy kiugró kapcsolat. Először is, szóródás.
- A felfedezésben talált mintát ugyanazon adatok "bizonyítékának" tekintve. Ez a p-hackelés kapuja; A megerősítés külön történik.
- Hibás diagramtípus. Az olyan egyezések, mint a sáv a trendért és a torta a terjesztésért, félrevezetőek. Válasszon műfajt a kérdés alapján.
- A minta méretének elrejtése. n=8 és n=8000 nem nézhet ki egyformán ugyanazon a grafikonon; bizonytalanságot kell mutatni.
Tipp: Mielőtt közzétennél egy diagramot, tedd fel magadnak a kérdést: "Megváltozna a történet, ha megváltoztatnám a tengelyt?" Ha a válasz igen, akkor valószínűleg tisztességtelen helyről indította el a forgatást.
Összefoglalva
A feltáró adatelemzés az adatok teljesítésének, a minták meglátásának és a hipotézisek generálásának fázisa; Ez nem megerősítés. Az AI gyorsan leíró statisztikákat és grafikonkódot generál, de Ön választja ki a grafikon típusát a kérdése alapján, és szabályozza a méltányosság elveit (nulla tengely, konzisztens skála, látszólagos bizonytalanság). Nézze meg a szórást, mielőtt megbízik a korrelációs számban; Ne nyilvánítsa a felfedezés során talált mintát „bizonyítéknak” ugyanabban az adatban. Az AI gyönyörű grafikonja nem jelent helyes grafikont.
Pályázati feladat
Válasszon ki legalább három változót egy adatkészletben. Kérje meg az AI-t, és futtasson olyan kódot, amely felfedező grafikonokat (hisztogram, szórt, bekeretezett) készít az őszinteségi szabályokat érvényesítő prompttal. Minden diagramnál ellenőrizze (1) a diagram típusának megfelelőségét a kérdésnek, (2) a tengely őszinteségét, (3) a minta méretének láthatóságát. Írjon legalább egy „felfedezési megjegyzést” a hipotézis nyelvén („...úgy tűnik, hogy külön kell tesztelni”). Vizsgálja meg a korrelációt mind a számlálással, mind a szórással, és jelentse, ha eltérés van közöttük.
ellenőrző lista
- [ ] A diagramtípust kérdésem és adattípusom alapján választottam.
- [ ] Az oszlopdiagramokban az y tengelyt nulláról indítom; Megnéztem a tengely őszinteségét.
- [ ] Megnéztem a szórást, mielőtt megbíztam volna a korrelációban.
- [ ] A minta nagyságát és a bizonytalanságot tükröztem a grafikonon.
- [ ] A feltárás során talált mintákat inkább "ellenőrzendő hipotézisnek" írtam, mint "bizonyítéknak".
- [ ] Megjegyeztem, hogy nem használom ugyanazokat az adatokat a megerősítéshez, és külön lépésre van szükség.