Voitot:
- Kyky tunnistaa erilaiset tietolähteet (tietokanta, API, tiedosto, verkkokaappaus) ja niiden sudenkuopat ja ymmärtää skeema oikein
- Kyky suorittaa toistettavissa oleva näytteenotto arvioimalla, edustaako otos populaatiota ja valintaharhaa
- Kyky eliminoida tietovuodot keräysvaiheessa ja noudattaa oikeudellisia/eettisiä rajoja esittämällä jokaisessa sarakkeessa kysymys "Onko minulla se ennustehetkellä"?
Jokainen analyysi on yhtä hyvä kuin keräämäsi tiedon laatu. Jopa maailman edistyksellisin malli tuottaa epäluotettavia tuloksia, jos se toimii virheellisesti kerättyjen, puolueellisesti otettujen tai tulevaisuutta koskevien tietojen kanssa. Tietojenkäsittelytieteessä tämä periaate tiivistetään nimellä "roskat sisään, roskat ulos" (roskat sisään, roskat ulos). Tässä osiossa käsittelemme tiedonkeruuvaihetta: lähteen ymmärtämistä, näytteenottoa, laatukysymysten esittämistä ja tietovuodon riskin huomioimista heti ensimmäisestä päivästä lähtien. Tekoäly on tehokas apu tässä vaiheessa; Kirjoittaa SQL-kyselyn, tiivistää API-asiakirjan, laatii tietosopimuksen. Mutta se on ihminen, joka päättää, mitä tietoja keräät ja edustavatko ne sinua.
Tietolähteisiin tutustuminen
Data tulee eri paikoista, ja jokaisessa lähteessä on omat sudenkuopat. Tietokanta (taulukoihin tallennettu jäsennelty data, joka yleensä kysytään SQL:llä) on yleisin lähde; Se on luotettava, mutta sen järjestelmä on ymmärrettävä hyvin. API (Application Programming Interface) tarjoaa live-dataa, mutta sisältää nopeusrajoitusten ja muotomuutosten riskin. Tiedostot (CSV, Excel, JSON) ovat joustavia, mutta alttiita muotojen epäjohdonmukaisuuksille. Web-kaappaus on tehokasta, mutta sillä on lailliset ja eettiset rajat; Kaikkia sivustoja ei voi raavita.
Huomio: Noudata web-kaappausta ja automaattista tiedonkeruuta varten sivuston käyttöehtoja, robots.txt-tiedostoa ja KVKK/GDPR:ää. Luvaton tiedonkeruu aiheuttaa juridisen vastuun. Käytä tietoturvan yhteydessä tiedonkeruutyökaluja vain sellaisissa järjestelmissä, joihin olet valtuutettu, ja puolustus-/analyysitarkoituksiin; Luvaton pääsy tai kaapiminen on kielletty.
Kaavan ymmärtäminen: tutustuminen tietoihin
Ennen kuin keräät tietojoukon, sinun on ymmärrettävä sen skeema (sarakkeiden nimet, tietotyypit, merkitykset ja niiden suhteet toisiinsa). AI on erittäin hyödyllinen tässä luotaessa "tietosanakirjaa" - taulukkoa, joka selittää kunkin sarakkeen merkityksen. Mutta tekoälyn selitykset ovat ennusteita; Vahvista kunkin sarakkeen todellinen merkitys tiedot tuottaneelle tiimille. Esimerkiksi sarake nimeltä "status" voi sisältää 0/1/2; Vain aloittava tiimi tietää, ovatko nämä "odottaa/hyväksytty/peruttu" vai jotain muuta.
Seuraavassa taulukossa on yhteenveto perusresurssityypeistä ja varoituksista:
lähde
vahva kohta
ansa
Kuinka tekoäly auttaa
SQL-tietokanta
Rakenteellinen, luotettava
Monimutkaiset JOINit
Kirjoittaa kyselyluonnoksen
API
live-dataa
Nopeusrajoitus, muodonmuutos
Asiakirjan yhteenvedot, vedä koodi
CSV/Excel
Joustava, nopea
Muodin epäjohdonmukaisuus
Lue/jäsennys koodi
verkon raapiminen
Laaja ulottuvuus
Laki/eettinen raja
Jäsennysluonnos (valtuutetun sisällä)
Loki-/tapahtumatiedot
yksityiskohtainen
valtava volyymi
Suodatuskysely
Kuva: edustaako osa kokonaisuutta?
Useimmiten työskentelet otoksen (populaatiosta valitun osajoukon) kanssa koko datan sijaan. Kriittinen kysymys on: edustaako tämä otos populaatiota? Valintaharha on yleisin ansa. Jos esimerkiksi otat vain näytteitä mobiilisovelluksen käyttäjistä, et näe verkon käyttäjiä ja tulokset ovat harhaanjohtavia. Satunnaisotos (jokaisella tietueella on yhtä suuri mahdollisuus tulla valituksi) on turvallisin useimmissa tapauksissa; mutta aikasarjatiedoissa jakaminen tapahtuu kronologisesti eikä satunnaisesti (näemme tämän yksiköissä 7 ja 10).
Tietovuoto ensimmäisestä päivästä lähtien
Tietovuoto on useimpien katastrofien lähde, ja se tapahtuu yleensä tiedonkeruuvaiheessa. Esimerkki: kun ennustetaan "peruttiinko se", jos lisäät tietoihin sarakkeen "peruutuspäivä", malli katsoo tulevaisuuteen. Esitä keräilyvaiheen aikana yksi kysymys jokaiselle sarakkeelle: "Onko minulla todella nämä tiedot, kun teen ennusteen?" Jos vastaus on ei, sarake vuotaa. Käsittelemme tätä aihetta perusteellisesti luvussa 10; Mutta tietoisuuden pitäisi alkaa ensimmäisestä päivästä.
kolme minilaukkua
Tapaus 1 — Edustuksen ongelma. Yksi pankki keräsi luottoriskimallissaan tietoja vain hyväksytyistä lainoista (18 500 tietuetta). Hylätyksiä ei tiedoissa ollut. Malli oli väärässä todellisessa maailmassa, koska se ei koskaan nähnyt, kuinka hylätyt käyttäytyisivät. Oppitunti: otoksen tulee edustaa koko populaatiota, josta teet päätöksen.
Tapaus 2 – Äänetön muodonmuutos. Tiimi otti hintatietoja API:sta joka päivä. Eräänä päivänä API-palveluntarjoaja vaihtoi valuutan USD:stä euroiksi, mutta verkkotunnuksen nimi pysyi samana. Tietoja kerättiin väärään yksikköön 12 päivän ajan; 3 200 linjaa oli vioittunut. Oppitunti: Tarkista säännöllisesti äänenvoimakkuuden ja muodon johdonmukaisuus API-tiedoissa.
Tapaus 3 – Varhainen vuoto. Analyytikko sisällytti "tilin sulkemisen syy" -sarakkeen kerätessään tietoja "vaihtuvuus" -arviota varten. Tämä sarake täytettiin vasta asiakkaan poistuttua. Malli tuotti 97 %:n tarkkuuden testisarjassa; Se ei toiminut tuotannossa, koska sarake oli tyhjä ennustehetkellä. Oppitunti: kysy jokaiselta sarakkeelta kysymys "onko minulla se ennustuksen aikaan?"
Neljä kopioitavaa mallia
1) Tietosanakirjan poiminta:
Tehtäväsi: datatieteilijäassistentti. Alla on taulukon sarakkeiden nimet ja näyte (anonyymit) arvot. Listaa kunkin sarakkeen arvioitu merkitys, tietotyyppi ja mahdolliset laaturiskit taulukkoon. Merkitse sarakkeet, joista et ole varma, "vahvistus vaaditaan"; tarkoittaa tekemistä. Sarakkeet: [liitä tähän]
2) Näytteenottokoodi (satunnainen, toistettava):
Minulla on pandat df. Kirjoita koodi, joka poimii edustavan 5 %:n satunnaisotoksen 200 000 rivistä. Käytä random_state=42 (toistettavuuden vuoksi). Lisää koodi tarkistaaksesi, että otoksen luokkajakauma on samanlainen kuin perusjoukon.
3) Vuotoskannauskysymys:
Annan sinulle tämän sarakkeiden luettelon. Tavoitteeni on ennustaa "onko se peruutettu" (0/1). Arvioi jokaisen sarakkeen kohdalla, onko minulla se todella ennusteen aikaan ja merkitse se "turvalliseksi / epäilyttäväksi / vuodatuksi". Kirjoita perustelut yhdellä lauseella. Sarakkeet: [luettelo]
4) SQL-hakukyselyluonnos:
Minulla on PostgreSQL:ssä "tilaukset" ja "asiakkaat" -taulukot. Kirjoita JOIN-kysely, joka yhdistää viimeisten 90 päivän tilaukset asiakkaan kaupungin kanssa ja palauttaa tilausten kokonaismäärän ja lukumäärän kaupunkia kohti. Selitä päivämääräsuodatin ja kuinka NULL-kaupunkeja käsitellään. Suoritan kyselyn ja tarkistan sen.
Heikko kehote / Vahva kehote
Heikko kehote:
Ota tästä tietokannasta hyvä esimerkkidata.
"Hyvä" on moniselitteinen; Mikä maalaus, mikä aikakausi, mikä koko, mikä tarkoitus on epäselvä. Tekoäly tuottaa vain yleisen, mahdollisesti väärän kyselyn.
Tehokas kehotus:
Tehtäväsi: SQL-assistentti. Minulla on tapahtumataulukko: sarakkeiden tunnus, asiakastunnus, päivämäärä (aikaleima), summa (numeerinen), kanava (teksti: 'web'/'mobiili'). Tehtävä: Kirjoita toistettava (deterministinen ja ORDER BY) kysely, joka palauttaa 10 000 edustavaa riviä kustakin kanavasta vuodelle 2024. Tarkoitus: kanavien vertaileva analyysi. Listaa kyselysi oletukset.
Tässä taulukko, tarkoitus, koko ja toistettavuus ovat selvät.
Yleisiä virheitä
- Ei kyseenalaistaa otoksen edustavuutta. Helposti saatavilla olevat tiedot eivät ole tarkkoja tietoja; valintaharha vääristää tulosta.
- Sarakkeiden merkityksen mukauttaminen tekoälyyn. Lähderyhmä tietää merkityksen; Älä käytä AI-ennustetta vahvistamatta sitä.
- Ei seuraa API-muodon/yksikön muutosta. Hiljainen muutos kerää korruptoitunutta dataa päivien ajan.
- Vuodon huomioimatta jättäminen keräysvaiheessa. Jos kysymystä "Onko minulla se ennustushetkellä" ei kysytä aikaisin, malli antaa väärän menestyksen.
- Luvattomien tai laittomien tietojen kerääminen. Robots.txt-tiedoston, käyttöehtojen ja KVKK:n rikkominen on vakava riski.
Vinkki: Säilytä yksisivuinen "tietokortti" jokaista uutta tietolähdettä varten: lähde, vetopäivämäärä, rivien määrä, tunnetut rajat ja sarakkeet, joissa on vuotovaara. Tämä kortti tallentaa "mitä tämä data oli" -kysymyksen ja toistettavuuden kuukausia myöhemmin.
Yhteenvetona
Analyysin laatua rajoittaa kerättyjen tietojen laatu. Tunne lähde (tietokanta, API, tiedosto, scrape) ja skeema hyvin; varmista, että otos edustaa väestöä; Eliminoi vuoto ensimmäisestä päivästä alkaen kysymällä jokaiselta sarakkeelta "Onko minulla se ennustehetkellä?" Tekoäly on loistava kiihdytin kyselyihin ja dokumentointiin, mutta ihmiset päättävät kerättävän tiedon ja sen edustavuuden. Valtuutuksen, lain ja luottamuksellisuuden rajat ovat aina etusijalla.
Sovellustehtävä
Valitse tietolähde (omasta yrityksestäsi tai hypoteettisesta). Hanki luonnos tietosanakirjasta tekoälyltä yllä olevan "datasanastojen purku" -mallin avulla; Arvioi sitten jokainen sarake manuaalisesti nähdäksesi, onko se vuotanut. Yritä löytää ainakin yksi epäilyttävä/vuoto-sarake ja kirjoita yhdellä lauseella, miksi se on riskialtista.
tarkistuslista
- [ ] Olenko vahvistanut tietolähteen ja skeeman lähdetiimin kanssa?
- [ ] Olenko tarkistanut, että otos edustaa populaatiota?
- [ ] Olenko esittänyt jokaiselle sarakkeelle kysymyksen "Saanko sen arvion aikaan?"
- [ ] Olenko tehnyt näytteenotosta toistettavan (kiinteä siemen)?
- [ ] Olenko tarkistanut keräämisen lailliset/eettiset (viranomainen, robots.txt, KVKK) rajat?