zisky:
- Schopnost rozpoznat různé zdroje dat (databáze, API, soubor, web scraping) a úskalí každého z nich a správně porozumět schématu
- Schopnost provádět opakovatelné vzorkování vyhodnocením, zda vzorek představuje populaci a výběrové zkreslení
- Schopnost eliminovat únik dat ve fázi sběru a dodržovat právní/etické hranice tím, že v každém sloupci položíte otázku „Budu je mít v době predikce“?
Každá analýza je tak dobrá, jak dobrá je kvalita dat, která shromažďujete. I ten nejpokročilejší model na světě přinese nespolehlivé výsledky, pokud bude pracovat s daty, která jsou sbírána nesprávně, vzorkovaná neobjektivně nebo obsahují informace o budoucnosti. V informatice je tento princip shrnut jako „garbage in, garbage out“ (garbage in, garbage out). V této části se budeme zabývat fází sběru dat: pochopením zdroje, vzorkováním, kladením otázek týkajících se kvality a upozorněním na riziko úniku dat od prvního dne. Umělá inteligence je v této fázi mocným pomocníkem; Píše SQL dotaz, sumarizuje API dokument, navrhuje datovou smlouvu. Ale je to člověk, kdo rozhoduje o tom, jaké údaje shromažďujete a zda vás tato data reprezentují.
Seznámení se zdroji dat
Data pocházejí z různých míst a každý zdroj má svá úskalí. Databáze (strukturovaná data uložená v tabulkách, obvykle dotazovaná pomocí SQL) je nejběžnějším zdrojem; Je spolehlivý, ale je potřeba dobře rozumět jeho schématu. API (Application Programming Interface) poskytuje živá data, ale nese riziko omezení rychlosti a změn formátu. Soubory (CSV, Excel, JSON) jsou flexibilní, ale náchylné k nekonzistenci formátu. Web scraping je mocný, ale má právní a etické limity; Ne každý web lze oškrábat.
Upozornění: Pro web scraping a automatický sběr dat dodržujte podmínky používání webu, soubor robots.txt a KVKK/GDPR. Neoprávněný sběr dat zakládá právní odpovědnost. V souvislosti s bezpečností informací používejte nástroje pro sběr dat pouze na systémech, pro které máte oprávnění, a pro účely obrany/analýzy; Neoprávněný přístup nebo škrábání je zakázáno.
Pochopení schématu: seznámení se s daty
Před shromážděním datové sady musíte porozumět jejímu schématu (názvům sloupců, jejich datovým typům, jejich významům a jejich vzájemným vztahům). AI je zde velmi užitečná při vytváření „datového slovníku“ – tabulky vysvětlující, co jednotlivé sloupce znamenají. Ale vysvětlení, která AI produkuje, jsou předpovědi; Ověřte si skutečný význam každého sloupce s týmem, který vytvořil data. Například sloupec s názvem "stav" může obsahovat 0/1/2; Pouze původní tým ví, zda jsou „nevyřízené/schválené/zrušené“ nebo něco jiného.
Následující tabulka shrnuje základní typy zdrojů a upozornění:
Zdroj
silná stránka
past
Jak pomáhá AI
SQL databáze
Strukturální, spolehlivý
Komplexní JOINy
Napíše koncept dotazu
API
živá data
Rychlostní limit, změna tvaru
Shrnutí dokumentů, vytažení kódu
CSV/Excel
Pružné, rychlé
Nekonzistence formátu
Číst/analyzovat kód
škrábání webu
Široký dosah
Právní/etický limit
Analýza konceptu (v rámci úřadu)
Data protokolu/události
podrobné
obrovský objem
Filtrovací dotaz
Ilustrace: představuje část celek?
Většinu času pracujete se vzorkem (podmnožinou vybranou z populace) spíše než s celými daty. Kritická otázka zní: představuje tento vzorek populaci? Selekční zkreslení je nejběžnější pastí. Pokud například odebíráte vzorky uživatelů pouze z mobilní aplikace, neuvidíte uživatele webu a vaše výsledky budou zavádějící. Náhodné vzorkování (každý záznam má stejnou šanci, že bude vybrán) je ve většině případů nejbezpečnější; ale v datech časových řad se rozdělení provádí chronologicky spíše než náhodně (to uvidíme v jednotkách 7 a 10).
Únik povědomí od prvního dne
Únik dat je zdrojem většiny katastrof a obvykle k němu dochází během fáze sběru dat. Příklad: při predikci „bylo zrušeno“, pokud k datům přidáte sloupec „datum zrušení“, model se dívá do budoucnosti. Během fáze shromažďování položte pro každý sloupec jednu otázku: „Budu skutečně mít tyto informace v době, kdy dělám předpověď?“ Pokud je odpověď ne, sloupec je netěsný. Tomuto tématu se budeme do hloubky věnovat v Unit 10; Ale uvědomění by mělo začít od prvního dne.
tři mini pouzdra
Případ 1 – Problém zastoupení. Jedna banka sbírala údaje pouze o schválených úvěrech pro svůj model úvěrového rizika (18 500 záznamů). Odmítnutí v datech nebyla. Model se ve skutečném světě mýlil, protože nikdy neviděl, jak by se chovali odmítnutí. Poučení: vzorek by měl být reprezentativní pro celou populaci, ze které se rozhodujete.
Případ 2 – Tichá změna formy. Tým získával data o ceně z API každý den. Jednoho dne poskytovatel API změnil měnu z USD na EUR, ale název domény zůstal stejný. Data byla shromažďována ve špatné jednotce po dobu 12 dnů; Bylo poškozeno 3 200 řádků. Lekce: Pravidelně kontrolujte konzistenci objemu a formátu v datech API.
Případ 3 – Předčasný únik. Analytik zahrnul sloupec „důvod pro uzavření účtu“ při shromažďování údajů pro odhad „odlivu“. Tento sloupec byl vyplněn až po odchodu zákazníka. Model poskytl 97% přesnost na testovací sadě; V produkci to nefungovalo, protože tento sloupec byl v době predikce prázdný. Lekce: položte každému sloupci otázku „mám to v době predikce?“
Čtyři kopírovatelné šablony
1) Extrakce datového slovníku:
Vaše role: asistent datového vědce. Níže jsou uvedeny názvy sloupců a ukázkové (anonymní) hodnoty tabulky. U každého sloupce uveďte jeho odhadovaný význam, datový typ a potenciální rizika kvality v tabulce. Označte sloupce, u kterých si nejste jisti, jako „potřebné potvrzení“; vytváření významu. Sloupce: [vložte sem]
2) Vzorkovací kód (náhodný, opakovatelný):
Mám pandy df. Napište kód, který extrahuje reprezentativní 5% náhodný vzorek z 200 000 řádků. Použijte random_state=42 (kvůli reprodukovatelnosti). Přidejte kód a zkontrolujte, zda je distribuce tříd vzorku podobná základnímu souboru.
3) Otázka skenování netěsností:
Dám vám tento seznam sloupců. Mým cílem je předpovědět „je to zrušeno“ (0/1). U každého sloupce vyhodnotit, zda ho v době predikce skutečně budu mít a označit jako „bezpečný / podezřelý / únik“. Napište své zdůvodnění jednou větou. Sloupce: [seznam]
4) Návrh dotazu SQL Pull:
V PostgreSQL mám tabulky "objednávky" a "zákazníci". Napište dotaz JOIN, který spojí objednávky za posledních 90 dní s městem zákazníka a vrátí celkovou částku a počet objednávek za město. Vysvětlete filtr data a způsob, jakým se zachází s městy NULL. Spustím dotaz a ověřím jej.
Slabá výzva / Silná výzva
Slabá výzva:
Vytáhněte mi dobrý vzorek dat z této databáze.
"Dobrý" je nejednoznačný; Jaký obraz, jaké období, jaká velikost, jaký účel není jasné. AI vytvoří pouze obecný, možná nesprávný dotaz.
Výkonná výzva:
Vaše role: SQL asistent. Mám tabulku „transakce“: sloupce id, customer_id, datum (časové razítko), částka (číselná), kanál (text: 'web'/'mobile'). Úkol: Napište opakovatelný (deterministický s ORDER BY) dotaz, který vrátí 10 000 reprezentativních řádků z každého kanálu pro rok 2024. Účel: srovnávací analýza kanálů. Uveďte předpoklady vašeho dotazu.
Zde je přehledná tabulka, účel, velikost a opakovatelnost.
Časté chyby
- Nezpochybňovat reprezentativnost vzorku. Snadno dostupná data nejsou přesná data; výběrové zkreslení výsledek zkresluje.
- Přizpůsobení významů sloupců AI. Zdrojový tým zná význam; Nepoužívejte předpověď AI, aniž byste ji potvrdili.
- Nesleduje změnu formátu/jednotky rozhraní API. Tichá změna shromažďuje poškozená data několik dní.
- Ignorování úniku ve fázi sběru. Pokud otázka „Mám to v době predikce“ není položena brzy, model poskytne falešný úspěch.
- Shromažďování neoprávněných nebo nezákonných údajů. Porušení robots.txt, podmínek použití a KVKK je vážným rizikem.
Tip: Uschovejte si jednostránkovou „datovou kartu“ pro každý nový zdroj dat: zdroj, datum načtení, počet řádků, známé hranice a sloupce s rizikem úniku. Tato karta ukládá otázku „co to bylo za data“ a reprodukovatelnost měsíců později.
V souhrnu
Kvalita analýzy je omezena kvalitou shromážděných dat. Dobře znát zdroj (databázi, API, soubor, scrape) a schéma; ujistěte se, že vzorek je reprezentativní pro populaci; Eliminujte únik od prvního dne tím, že se každého sloupce zeptáte: „Mám to v době předpovědi?“ Umělá inteligence je skvělým akcelerátorem pro práci s dotazy a dokumenty, ale lidé rozhodují o tom, jaká data shromáždit, a jejich reprezentativnost. Hranice pravomoci, zákon a důvěrnost jsou vždy na prvním místě.
Aplikační úkol
Vyberte zdroj dat (z vaší vlastní firmy nebo hypotetický). Získejte návrh datového slovníku od AI pomocí šablony „extrakce datového slovníku“ výše; Poté ručně vyhodnoťte každý sloupec a zjistěte, zda nedošlo k jeho úniku. Zkuste najít alespoň jeden podezřelý/únikový sloupek a jednou větou napište, proč je to riskantní.
kontrolní seznam
- [ ] Potvrdil jsem zdroj dat a schéma se zdrojovým týmem?
- [ ] Ověřil jsem, že vzorek je reprezentativní pro populaci?
- [ ] Položil jsem každému sloupci otázku "budu to mít v době odhadu?"
- [ ] Udělal jsem vzorkování opakovatelné (pevné semeno)?
- [ ] Zkontroloval jsem právní/etické (autorita, robots.txt, KVKK) limity shromažďování?