Nyereség:
- Képes megkülönböztetni az adattudomány hat szakaszból álló munkafolyamatait (problémameghatározás, -gyűjtés, -tisztítás, -felderítés, -modellezés, -kommunikáció) és azt, hogy a mesterséges intelligencia az egyes szakaszokban milyen hatáskörrel működik, a feladat kockázati szintje szerint.
- Képes olyan diszciplínát alkalmazni, amely minden mesterséges intelligencia-kimenetet a forráshoz való csatlakoztatásával, futtatásával és összehasonlításával, valamint szakértői szűrésen való átadásával ellenőrzi.
- Képes a reprodukálhatóság és az adatvédelmi elvek (kódba írás, anonimizálás) elemzési szokásokká alakítani az első naptól kezdve
Nyers, rendetlen és gyakran „hazug” adatok kerülnek nap mint nap az adatkutató asztalára. Az értékesítési táblázatban a dátum oszlop három különböző formátumban van írva; az ügyfélszámok néhány sorban üresek; Egy oszlop neve „bevétel”, de TL és USD értékeket is tartalmaz. Az adattudomány feladata, hogy ebből a káoszból megbízható döntést hozzon: összegyűjti az adatokat, megtisztítja, feltárja, modellt épít, az eredményt validálja és történetté alakítja. A mesterséges intelligencia (az AI vagy röviden AI – olyan számítógépes rendszerek, amelyek képesek szöveget és kódot generálni, mintákat felismerni, összegezni és előrejelzéseket készíteni) ennek a láncnak minden láncszemét megérinthetik: percek alatt leírhat tisztítókódot, grafikonokat ajánlhat feltáró elemzéshez, modell metrikáját értelmezheti, SQL-lekérdezést javíthat. De ugyanaz a mesterséges intelligencia olyan magabiztos kitalációt is tud adni, mint például a „0,72-es korreláció” az általa soha nem látott adatokhoz.
Ez az első rész nem a könyvtár bemutatása. Célja annak tisztázása, hogy az AI-t hova helyezzük az adattudományi munkafolyamatban, és hová soha ne. Fogalmazzuk meg az alapelvet az elejétől fogva: az AI asszisztens, nem adattudós. Az illetékes szakértő dönti el, hogy milyen adatokat gyűjtsön, milyen mérőszám mellett döntsön, gyártásba kerüljön-e egy modell, hol húzzuk meg az etikai határokat. A nem ellenőrzött AI-kimenet kockázatos, akárcsak az aláíratlan elemzési jelentés.
Adattudományi munkafolyamat: végpontok közötti térkép
Egy adatprojekt megértéséhez hasznos hat fázisra bontani. Ez a teljes modul ezt a térképet követi.
1. Probléma definíció: Mit mérünk, miért, melyik döntés alátámasztására? Ez a fázis nincs delegálva az MI-re; Az a személy, aki meghatározza a munkát.
2. Adatgyűjtés: Források azonosítása, adatok kinyerése, mintavétel. (2. egység)
3. Adattisztítás és előfeldolgozás: Hiányzó érték, kiugró érték, típuskonverzió. (3. egység)
4. Feltáró adatelemzés (EDA - Exploratory Data Analysis, az adatok eloszlásának és kapcsolatainak "szemmel" felismerésének szakasza): (4. fejezet)
5. Funkciótervezés és modellezés: Változógenerálás, algoritmus kiválasztása, betanítás, értékelés. (5., 6., 7. egység)
6. Kommunikáció és gyártás: Vizualizáció, történet, MLOps (a modell élőbevételének és monitorozásának tudománya). (8., 11. egység)
A mesterséges intelligencia e hat szakasz mindegyikében más-más jogosultsággal működik. Az alábbi táblázat összefoglalja a jogosultságok megoszlását; Ez a modul egyetlen legfontosabb táblázata.
Színpad
Az AI szerepe
Kockázati szint
Aki jóváhagyja
Probléma meghatározása
ötletbörze partner
alacsony
Adattudós + érintett
Írjon egy tisztító kódot
Kódvázlat generátor
közepes
Adattudós (kódot olvas)
EDA megjegyzés
minta javaslattevő
közepes
adattudós
Funkciógenerálás
Ötlet- és kódgenerátor
középmagas
A szivárgás ellenőrzése kötelező
Modellválasztás/metrika
tanácsadó
magas
adattudós
Döntés a gyártásba helyezésről
segéd bemenet
nagyon magas
Csapat + cégtulajdonos
Etikai/adatvédelmi jóváhagyás
stimuláns
nagyon magas
emberi, mindig
Ne feledje a táblázat egyetlen mondatát: ahogy a tét nő, az AI szerepe csökken, és az emberi jóváhagyás nő.
Miért az igazolás ennek a vállalkozásnak a lényege?
Az AI nyelvi modellek biztosnak tűnnek, de lehet, hogy nem. A szaknyelven ezt hallucinációnak nevezik: ez a modell nem létező információ alkotása egy gördülékeny mondatban, mintha igaz lenne. Az adattudományban ennek három formája van. Az első egy hamis szám: ha adat megadása nélkül megkérdezi a modellt, hogy "mennyi az átlagos rendelési összeg", magabiztosan mond egy számot, annak ellenére, hogy soha nem látta az Ön adatait. A második egy nem létező függvény: a modell javasolhat olyan függvényt, amely egyáltalán nem létezik, például pandas.read_excel_fast(). Harmadszor, helytelen statisztikai értelmezés: a modell simán megismételhet egy olyan klasszikus statisztikai hibát, mint például a „p-érték 0,04, tehát a hipotézis 96%-ban helyes”.
Az ellenőrzési fegyelem három lépésből áll:
- Hivatkozás a forráshoz: Minden számnak, aránynak és trendnek az Ön adataiból kell származnia, nem az AI memóriájából. Használja az AI-t olyan kódhoz, amely adatokon működik, nem arra, hogy megjegyezze az adatokat.
- Futtassa és hasonlítsa össze: Futtassa saját maga az egyes kódrészleteket, amelyeket az AI adott; Hasonlítsa össze az általa létrehozott mérőszámokat egy független alapvonallal.
- Szakértői szűrő: Tesztelje saját maga, hogy a kimenet ellentmond-e a statisztikáknak és a tartományismeretnek.
Vigyázat: Az AI által írt elemzést prezentációba helyezni anélkül, hogy futtatná és elolvasná, olyan, mintha aláíratlan jelentést mutatna be. Csak azért, mert a kód működik, nem jelenti azt, hogy helyes; A rossz oszlopot összegző kód is hiba nélkül működik.
Reprodukálhatóság: képes kétszer ugyanazt az eredményt produkálni
Az adattudomány csendes, de kritikus elve a reprodukálhatóság: ha hat hónappal később újra lefuttat egy elemzést vagy egy másik számítógépen, ugyanazt az eredményt kapja. Ez a kockázat növekszik, ha mesterséges intelligenciával dolgozik, mert ha azt mondja az AI-nak, hogy „készítse el ezt a grafikont”, és játssza le manuálisan, a lépések eltűnnek. Szabály: minden lépést regisztrálni kell a kódban és a verzióvezérlésben (mint a Git); A véletlenszerűséggel járó lépésekben a véletlen magot (a véletlenszám-generátor kezdőértékét; ha rögzített, az eredmény megismételhető) rögzíteni kell. Ezt a témát elmélyítjük a 10. fejezetben; Egyelőre alakítsd át ezt a szokást: "Ne kézzel kattints, írj kódot."
három mini tok
1. eset – Biztonságos gyorsítás. Egy e-kereskedelmi elemző normál esetben fél napot töltene egy 240 ezer soros rendelési táblázat kitisztításával. Megadta az oszlopneveket és az első 5 sort (személyes adatok nélkül) az MI-nek, és elkérte a pandatisztító kódot. Az AI 8 másodperc alatt készített huzatot; Az elemző soronként elolvasta a kódot, kijavított egy hibát a dátumelemzés során, és lefuttatta. Időtartam: 4 óra helyett 35 perc. A mesterséges intelligencia kódot adott, az ellenőrzés az embernél maradt.
2. eset – A kitalált metrikus csapda. Egy gyakornok megkérdezte az MI-től: "Mennyire pontos a véletlenszerű erdő ezeken az adatokon?" a modell képzése nélkül. „Körülbelül 89%” – mondta az AI. A gyakornok ezt beletette az előadásba; Amikor a valódi modellt betanították, a pontosság 71% volt. Hiba: Várakozás a mérőszámokra anélkül, hogy adatokat és modelleket adna át az AI-nak.
3. eset – Csendes szivárgás. Az egyik csapat megkérdőjelezés nélkül megvalósította az AI által javasolt ötletet, miszerint „adjuk hozzá a célváltozó átlagát jellemzőként”. A modell 98%-ot teljesített a tesztkészleten, de a gyártás során összeomlott, mert a funkció jövőbeli információkat szivárgott ki (adatszivárgás, 10. egység). Hiba: nem szűri statisztikailag az AI-ajánlást.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Elemezze ezeket az értékesítési adatokat, és mondja meg az átlagos bevételt.
Ez az állítás hibás: az AI nem kapott adatokat, így az „átlagjövedelem” csak pótolható. Sem az oszlopok, sem az időszak, sem a pénznem nem egyértelmű.
Erőteljes felszólítás:
Az Ön szerepe: asszisztens, aki segít egy adattudósnak. Van egy pandas DataFrame-em: df. Oszlopok:- order_date (szöveg, "2024-03-01" formátumban)- mennyiség_tl (tizedes, NaN egyes sorokban)- ügyfél_azonosítója (egész szám) Feladat: (1) írjon panda kódot, amely kiszámítja az átlagos összeget, (2) magyarázza el, hogyan kezeli a NaN értékeket, (3) sorolja fel a kód feltételezéseit. Ne alakítsa ki az adattartalmat; csak generáljon kódot, és lefuttatom, és ellenőrizni fogom az eredményt.
Ebben a kérésben egyértelmű a séma, az elvárás és a "gyártás tilalma". Ön továbbra is futtatja és ellenőrzi a kimenetet.
Az etika és a magánélet kezdetei
Az adattudomány gyakran dolgozik személyes adatokkal: ügyfél-, beteg-, alkalmazotti nyilvántartásokkal. A Türkiye-ban a KVKK (személyes adatvédelmi törvény) és Európában a GDPR védi ezeket az adatokat. Valódi nevének, azonosítójának, e-mail címének vagy címének beillesztése nyilvános mesterségesintelligencia-eszközbe szabálysértésnek minősül. Szabály: anonimizálja az adatokat a megosztás előtt, csak szükség esetén adjon meg sémát (oszlopnevek, típusok) és üres példasort. A 11. fejezetben elmélyítjük az etika témakörét; Fogalmazzuk meg az elvet a kezdetektől: Az adatok megértéséhez gyakran elég megosztani a szerkezetét, nem pedig a tartalmát.
Gyakori hibák
- Várakozás a számokra/mutatókra anélkül, hogy adatokat adna az AI-nak. A modell nem fér hozzá az adatokhoz; Az általa megadott szám hamis. Mindig számítsa ki az eredményt és futtassa.
- Azt gondolva, hogy a működő kód helyes. A rossz oszlopot manipuláló kód is hiba nélkül fut; Ne bízz a logika elolvasása nélkül.
- Valódi személyes adatok beillesztése a nyílt eszközbe. A név, az azonosító szám, az e-mail cím soha nem kerül megosztásra; Elég a diagram.
- A lépéseket manuálisan hajtsa végre, és ne írja be őket a kódba. Az analízis, amely nem reprodukálható, megbízhatatlan.
- Kérdés nélkül elfogadjuk az AI statisztikai értelmezését. A mesterséges intelligencia meg tudja ismételni a klasszikus hibákat olyan fogalmakban, mint a p-érték és a korreláció.
Tipp: Minden mesterséges intelligencia-munkamenetbe írjon be egy rövid „szabálysort”: „Ne alakítsa ki az adattartalmat; csak generáljon kódot/elemzést, és lefuttatom, és ellenőrizni fogom az eredményt; ahol bizonytalan, jelezze a „nem biztos” szót. Ez az egyetlen mondat jelentősen csökkenti a hallucinációk kockázatát.
Összefoglalva
Az AI hatékony asszisztens az adattudományban: felgyorsítja a tisztítási kódot, az EDA-értelmezést, a modellajánlást és a megjelenítést. De a probléma meghatározása, a mérőszám kiválasztása, a termelési döntés és az etikai határok az embereké. A munkafolyamat hat szakaszból áll, és az AI szerepe a kockázat növekedésével csökken. Három szokás mindennek az alapja: a forrásösszekapcsolás (validáció), a reprodukálhatóság (kódolás) és az anonimizálás (bizalmasság). Miután ezt a hármat beépítette, a modul többi részében minden eszköz biztonságos gyorsítóvá válik az Ön számára.
Pályázati feladat
Csak készítsen egy sémát egy kis tábláról (vagy egy hipotetikusról): oszlopnevek, típusok és 2-3 ál példasor (valódi személyes adatok nélkül). Kérjen az AI-tól egy összefoglaló statisztikai kódot a fenti „Powerful prompt” sablon segítségével. Futtassa le a kódot, hasonlítsa össze a kimenetet egy manuális értékkel, ellenőrizze, hogy nincsenek-e téves feltételezések, és jegyezze fel az eredményeket 5 pontban.
ellenőrző lista
- [ ] Valódi személyes adatok helyett csak egy sémát és egy hamis mintát adtam meg az AI-nak?
- [ ] Elolvastam és lefuttattam az általa generált kódot soronként?
- [ ] Függetlenül ellenőriztem az egyes számokat a kimenetben?
- [ ] Beírtam az elemzés minden lépését a kódba, és megismételhetővé tettem?
- [ ] Meghatároztam a küldetés kockázati szintjét, és a végső döntést emberhez rendeltem?