Egység 2 / 11

Adatgyűjtés és forrásmegértés: séma, mintavétel, minőség és szivárgásfigyelés

Nyereség:

  • Képes felismerni a különböző adatforrásokat (adatbázis, API, fájl, webkaparás) és mindegyik buktatóit, és helyesen megérteni a sémát
  • Képes ismételhető mintavétel végrehajtására annak értékelésével, hogy a minta reprezentálja-e a sokaságot és a szelekciós torzítást
  • Az adatszivárgás kiküszöbölése a gyűjtési szakaszban és a jogi/etikai határok betartása azáltal, hogy minden oszlopban felteszem a „Meglesz az előrejelzés időpontjában” kérdést?

Minden elemzés olyan jó, mint az Ön által gyűjtött adatok minősége. Még a világ legfejlettebb modellje is megbízhatatlan eredményeket produkál, ha helytelenül gyűjtött, elfogultan mintavételezett vagy a jövőre vonatkozó információkat tartalmaz. A számítástechnikában ezt az elvet úgy foglalják össze, hogy "szemet be, szemét ki" (garbage in, garage out). Ebben a részben az adatgyűjtési szakaszt ismertetjük: a forrás megértését, a mintavételt, a minőségi kérdések feltevését és az adatszivárgás kockázatára való figyelést az első naptól kezdve. A mesterséges intelligencia hatékony segítség ebben a szakaszban; SQL lekérdezést ír, API dokumentumot összesít, adatszerződést készít. De az emberi lény dönti el, hogy milyen adatokat gyűjt, és hogy ezek az adatok képviselik-e Önt.

Adatforrások megismerése

Az adatok különböző helyekről származnak, és minden forrásnak megvannak a maga buktatói. Az adatbázis (táblákban tárolt, rendszerint SQL-lel lekérdezett strukturált adatok) a leggyakoribb forrás; Megbízható, de jól meg kell érteni a rendszerét. Az API (Application Programming Interface) élő adatokat biztosít, de magában hordozza a sebességkorlátozások és a formátumváltozások kockázatát. A fájlok (CSV, Excel, JSON) rugalmasak, de hajlamosak a formázási inkonzisztenciára. A webkaparás erőteljes, de vannak jogi és etikai korlátai; Nem minden webhelyet lehet lekaparni.

Figyelem: A webkaparáshoz és az automatikus adatgyűjtéshez tartsa be az oldal használati feltételeit, a robots.txt fájlt és a KVKK/GDPR-t. A jogosulatlan adatgyűjtés jogi felelősséget von maga után. Az információbiztonsággal összefüggésben csak olyan rendszereken használjon adatgyűjtő eszközöket, amelyekre jogosult, és védekezési/elemzési célokra; Tilos az illetéktelen hozzáférés vagy kaparás.

A séma megértése: az adatok megismerése

Az adathalmaz összegyűjtése előtt meg kell értenie annak sémáját (az oszlopok nevét, adattípusait, jelentését és egymáshoz való viszonyát). Az AI nagyon hasznos itt egy „adatszótár” létrehozásában – egy táblázat, amely elmagyarázza az egyes oszlopok jelentését. De a mesterséges intelligencia magyarázatai előrejelzések; Erősítse meg az egyes oszlopok valódi jelentését az adatokat előállító csapattal. Például egy "status" nevű oszlop tartalmazhat 0/1/2; Csak a kezdeményező csapat tudja, hogy ezek „függőben/jóváhagyva/törölve” vannak-e vagy valami más.

Az alábbi táblázat összefoglalja az alapvető erőforrástípusokat és figyelmeztetéseket:

Forrás

erős pontja

csapda

Hogyan segít az AI

SQL adatbázis

Szerkezetes, megbízható

Komplex JOIN-ok

Lekérdezési vázlatot ír

API

élő adatok

Sebességkorlátozás, alakváltás

Dokumentum-összefoglalók, lehívási kód

CSV/Excel

Rugalmas, gyors

Formátum inkonzisztencia

Kód olvasása/elemzése

webkaparás

Széles hatótávolság

Jogi/etikai korlát

Vázlat elemzése (hatóságon belül)

Napló/eseményadatok

részletes

hatalmas kötet

Lekérdezés szűrése

Illusztráció: a rész az egészet reprezentálja?

Legtöbbször egy mintával (a sokaságból kiválasztott részhalmazzal) dolgozik, nem pedig a teljes adatokkal. A kritikus kérdés: reprezentálja-e ez a minta a sokaságot? A szelekciós torzítás a leggyakoribb csapda. Például, ha csak mintát vesz a mobilalkalmazás felhasználóiról, akkor nem fog megjelenni a webes felhasználók, és az eredmények félrevezetőek lesznek. A véletlenszerű mintavételezés (minden rekord egyenlő eséllyel kerül kiválasztásra) a legtöbb esetben a legbiztonságosabb; de az idősoros adatokban a felosztás nem véletlenszerűen, hanem kronologikusan történik (ezt látni fogjuk a 7. és 10. egységben).

Tudatosság az első naptól kezdve

Az adatszivárgás a legtöbb katasztrófa forrása, és általában az adatgyűjtési szakaszban merül fel. Példa: a "törölve" előrejelzésekor, ha hozzáadja az adatokhoz a "lemondás dátuma" oszlopot, a modell a jövőbe tekint. Az összegyűjtési szakaszban minden oszlophoz tegyél fel egy kérdést: „Valóban rendelkezem ezzel az információval, amikor a jóslatot elkészítem?” Ha a válasz nem, akkor az oszlop szivárog. Ezzel a témával a 10. fejezetben részletesen foglalkozunk; De a tudatosításnak az első naptól kell kezdődnie.

három mini tok

1. eset – A reprezentáció problémája. Egy bank csak a hitelkockázati modelljéhez jóváhagyott hitelekről gyűjtött adatokat (18 500 rekord). Elutasítások nem szerepeltek az adatokban. A modell tévedett a való világban, mert soha nem látta, hogyan viselkednek az elutasítottak. Tanulság: a mintának reprezentatívnak kell lennie a teljes sokaságra, amelyből a döntést meghozza.

2. eset – Néma formaváltás. Egy csapat minden nap áradatokat gyűjtött egy API-ból. Egy napon az API szolgáltató a pénznemet USD-ről EUR-ra változtatta, de a domain név változatlan maradt. Az adatgyűjtés 12 napig nem megfelelő egységben történt; 3200 sor sérült. Lecke: Rendszeresen ellenőrizze a kötet és a formátum konzisztenciáját az API-adatokban.

3. eset – Korai szivárgás. Egy elemző belefoglalta a "számlazárás oka" oszlopot, amikor a "lemorzsolódás" becsléséhez adatokat gyűjtött. Ez az oszlop csak az ügyfél távozása után lett kitöltve. A modell 97%-os pontosságot adott a tesztkészleten; Élesben nem működött, mert az oszlop üres volt az előrejelzés időpontjában. Tanulság: tedd fel minden oszlopban azt a kérdést, hogy "megvan a jóslat idején?"

Négy másolható sablon

1) Adatszótár kinyerése:

Az Ön szerepe: adattudós asszisztens. Az alábbiakban egy táblázat oszlopnevei és minta (névtelen) értékei láthatók. Minden oszlophoz sorolja fel a becsült jelentését, az adattípust és a lehetséges minőségi kockázatokat egy táblázatban. Jelölje meg azokat az oszlopokat, amelyekben nem biztos, hogy "megerősítés szükséges"; jelentése készítés.Oszlopok: [illessze be ide]

2) Mintavételi kód (véletlenszerű, megismételhető):

Pandáim vannak df. Írjon olyan kódot, amely reprezentatív 5%-os véletlenszerű mintát vesz ki 200 000 sorból. Használja a random_state=42-t (a reprodukálhatóság érdekében). Adjon hozzá kódot annak ellenőrzésére, hogy a minta osztályeloszlása ​​hasonló-e a sokasághoz.

3) Szivárgásvizsgálati kérdés:

Megadom neked ezt az oszloplistát. A célom az, hogy megjósoljam, hogy "törölve van-e" (0/1). Minden oszlopnál értékelje, hogy az előrejelzés időpontjában valóban meglesz-e, és jelölje meg "biztonságos / gyanús / szivárgás"-ként. Írd le az indoklásodat egy mondatban! Oszlopok: [lista]

4) SQL lekérési lekérdezés vázlat:

Vannak "rendelések" és "ügyfelek" tábláim a PostgreSQL-ben. Írjon egy JOIN lekérdezést, amely egyesíti az elmúlt 90 nap rendeléseit a vevő városával, és visszaadja a rendelések teljes összegét és számát városonként. Magyarázza el a dátumszűrőt és a NULL városok kezelését. Lefuttatom a lekérdezést és ellenőrizni fogom.

Gyenge felszólítás / Erős felszólítás

Gyenge felszólítás:

Hozz egy jó mintaadatot ebből az adatbázisból.

A "jó" kétértelmű; Hogy melyik festmény, melyik korszak, milyen méret, milyen cél, nem derül ki. Az AI csak általános, esetleg rossz lekérdezést fog készíteni.

Erőteljes felszólítás:

Az Ön szerepe: SQL asszisztens. Van egy "tranzakciók" táblázatom: oszlopok azonosítója, ügyfél_azonosítója, dátum (időbélyeg), összeg (numerikus), csatorna (szöveg: 'web'/'mobile'). Feladat: Írjon megismételhető (determinisztikus ORDER BY-vel) lekérdezést, amely 10 000 reprezentatív sort ad vissza minden csatornából a 2024-es évre vonatkozóan. Cél: csatorna-összehasonlító elemzés. Sorolja fel a lekérdezés feltételezéseit.

Itt egyértelmű a táblázat, a cél, a méret és az ismételhetőség.

Gyakori hibák

  • Nem kérdőjelezi meg a minta reprezentativitását. A könnyen hozzáférhető adatok nem pontosak; a kiválasztás torzítása torzítja az eredményt.
  • Az oszlopok jelentésének hozzáigazítása az AI-hoz. A forráscsoport ismeri a jelentését; Ne használja az AI előrejelzést annak megerősítése nélkül.
  • Nem követi nyomon az API formátum/egység változását. A csendes változás napokig gyűjti a sérült adatokat.
  • A szivárgás figyelmen kívül hagyása a gyűjtés szakaszában. Ha a „Megvan-e az előrejelzés időpontjában” kérdést, nem teszik fel korán, a modell hamis sikert ad.
  • Jogosulatlan vagy illegális adatok gyűjtése. A robots.txt, a használati feltételek és a KVKK megsértése komoly kockázatot jelent.
Tipp: Tartson egy egyoldalas „adatkártyát” minden új adatforráshoz: forrás, lehívás dátuma, sorok száma, ismert határvonalak és szivárgásveszélyes oszlopok. Ez a kártya hónapokkal később elmenti a „mi volt ez az adat” kérdést és a reprodukálhatóságot.

Összefoglalva

Az elemzés minőségét az összegyűjtött adatok minősége korlátozza. Ismerje jól a forrást (adatbázis, API, fájl, scrape) és a sémát; győződjön meg arról, hogy a minta reprezentatív a sokaságra nézve; Szüntesse meg a szivárgást az első naptól úgy, hogy minden oszlopban megkérdezi, hogy „megvan az előrejelzés időpontjában?” A mesterséges intelligencia nagyszerű gyorsító a lekérdezésekhez és a dokumentumokhoz, de az emberek döntik el, hogy milyen adatokat gyűjtsenek és milyen reprezentatívak. A tekintély, a törvény és a titoktartás korlátai mindig az elsők.

Pályázati feladat

Válasszon adatforrást (saját üzleti vagy hipotetikus). Szerezzen be egy adatszótár vázlatot az AI-tól a fenti „adatszótár-kivonás” sablon segítségével; Ezután manuálisan értékelje ki az egyes oszlopokat, és ellenőrizze, hogy nem szivárogtak-e ki. Próbálj meg találni legalább egy gyanús/kiszivárgott rovatot, és egy mondatban írd le, hogy miért kockázatos.

ellenőrző lista

  • [ ] Megerősítettem az adatforrást és a sémát a forráscsapattal?
  • [ ] Ellenőriztem, hogy a minta reprezentatív-e a sokaságra?
  • [ ] Feltettem-e minden oszlopnak azt a kérdést, hogy "meglesz-e a becslés időpontjában?"
  • [ ] Megismételhetővé tettem a mintavételt (fix mag)?
  • [ ] Ellenőriztem a gyűjtés jogi/etikai (hatósági, robots.txt, KVKK) határait?