Yksikkö 2 / 11

Tiedonkeruu ja lähteiden ymmärtäminen: Kaavio, näytteenotto, laatu ja vuototietoisuus

Voitot:

  • Kyky tunnistaa erilaiset tietolähteet (tietokanta, API, tiedosto, verkkokaappaus) ja niiden sudenkuopat ja ymmärtää skeema oikein
  • Kyky suorittaa toistettavissa oleva näytteenotto arvioimalla, edustaako otos populaatiota ja valintaharhaa
  • Kyky eliminoida tietovuodot keräysvaiheessa ja noudattaa oikeudellisia/eettisiä rajoja esittämällä jokaisessa sarakkeessa kysymys "Onko minulla se ennustehetkellä"?

Jokainen analyysi on yhtä hyvä kuin keräämäsi tiedon laatu. Jopa maailman edistyksellisin malli tuottaa epäluotettavia tuloksia, jos se toimii virheellisesti kerättyjen, puolueellisesti otettujen tai tulevaisuutta koskevien tietojen kanssa. Tietojenkäsittelytieteessä tämä periaate tiivistetään nimellä "roskat sisään, roskat ulos" (roskat sisään, roskat ulos). Tässä osiossa käsittelemme tiedonkeruuvaihetta: lähteen ymmärtämistä, näytteenottoa, laatukysymysten esittämistä ja tietovuodon riskin huomioimista heti ensimmäisestä päivästä lähtien. Tekoäly on tehokas apu tässä vaiheessa; Kirjoittaa SQL-kyselyn, tiivistää API-asiakirjan, laatii tietosopimuksen. Mutta se on ihminen, joka päättää, mitä tietoja keräät ja edustavatko ne sinua.

Tietolähteisiin tutustuminen

Data tulee eri paikoista, ja jokaisessa lähteessä on omat sudenkuopat. Tietokanta (taulukoihin tallennettu jäsennelty data, joka yleensä kysytään SQL:llä) on yleisin lähde; Se on luotettava, mutta sen järjestelmä on ymmärrettävä hyvin. API (Application Programming Interface) tarjoaa live-dataa, mutta sisältää nopeusrajoitusten ja muotomuutosten riskin. Tiedostot (CSV, Excel, JSON) ovat joustavia, mutta alttiita muotojen epäjohdonmukaisuuksille. Web-kaappaus on tehokasta, mutta sillä on lailliset ja eettiset rajat; Kaikkia sivustoja ei voi raavita.

Huomio: Noudata web-kaappausta ja automaattista tiedonkeruuta varten sivuston käyttöehtoja, robots.txt-tiedostoa ja KVKK/GDPR:ää. Luvaton tiedonkeruu aiheuttaa juridisen vastuun. Käytä tietoturvan yhteydessä tiedonkeruutyökaluja vain sellaisissa järjestelmissä, joihin olet valtuutettu, ja puolustus-/analyysitarkoituksiin; Luvaton pääsy tai kaapiminen on kielletty.

Kaavan ymmärtäminen: tutustuminen tietoihin

Ennen kuin keräät tietojoukon, sinun on ymmärrettävä sen skeema (sarakkeiden nimet, tietotyypit, merkitykset ja niiden suhteet toisiinsa). AI on erittäin hyödyllinen tässä luotaessa "tietosanakirjaa" - taulukkoa, joka selittää kunkin sarakkeen merkityksen. Mutta tekoälyn selitykset ovat ennusteita; Vahvista kunkin sarakkeen todellinen merkitys tiedot tuottaneelle tiimille. Esimerkiksi sarake nimeltä "status" voi sisältää 0/1/2; Vain aloittava tiimi tietää, ovatko nämä "odottaa/hyväksytty/peruttu" vai jotain muuta.

Seuraavassa taulukossa on yhteenveto perusresurssityypeistä ja varoituksista:

lähde

vahva kohta

ansa

Kuinka tekoäly auttaa

SQL-tietokanta

Rakenteellinen, luotettava

Monimutkaiset JOINit

Kirjoittaa kyselyluonnoksen

API

live-dataa

Nopeusrajoitus, muodonmuutos

Asiakirjan yhteenvedot, vedä koodi

CSV/Excel

Joustava, nopea

Muodin epäjohdonmukaisuus

Lue/jäsennys koodi

verkon raapiminen

Laaja ulottuvuus

Laki/eettinen raja

Jäsennysluonnos (valtuutetun sisällä)

Loki-/tapahtumatiedot

yksityiskohtainen

valtava volyymi

Suodatuskysely

Kuva: edustaako osa kokonaisuutta?

Useimmiten työskentelet otoksen (populaatiosta valitun osajoukon) kanssa koko datan sijaan. Kriittinen kysymys on: edustaako tämä otos populaatiota? Valintaharha on yleisin ansa. Jos esimerkiksi otat vain näytteitä mobiilisovelluksen käyttäjistä, et näe verkon käyttäjiä ja tulokset ovat harhaanjohtavia. Satunnaisotos (jokaisella tietueella on yhtä suuri mahdollisuus tulla valituksi) on turvallisin useimmissa tapauksissa; mutta aikasarjatiedoissa jakaminen tapahtuu kronologisesti eikä satunnaisesti (näemme tämän yksiköissä 7 ja 10).

Tietovuoto ensimmäisestä päivästä lähtien

Tietovuoto on useimpien katastrofien lähde, ja se tapahtuu yleensä tiedonkeruuvaiheessa. Esimerkki: kun ennustetaan "peruttiinko se", jos lisäät tietoihin sarakkeen "peruutuspäivä", malli katsoo tulevaisuuteen. Esitä keräilyvaiheen aikana yksi kysymys jokaiselle sarakkeelle: "Onko minulla todella nämä tiedot, kun teen ennusteen?" Jos vastaus on ei, sarake vuotaa. Käsittelemme tätä aihetta perusteellisesti luvussa 10; Mutta tietoisuuden pitäisi alkaa ensimmäisestä päivästä.

kolme minilaukkua

Tapaus 1 — Edustuksen ongelma. Yksi pankki keräsi luottoriskimallissaan tietoja vain hyväksytyistä lainoista (18 500 tietuetta). Hylätyksiä ei tiedoissa ollut. Malli oli väärässä todellisessa maailmassa, koska se ei koskaan nähnyt, kuinka hylätyt käyttäytyisivät. Oppitunti: otoksen tulee edustaa koko populaatiota, josta teet päätöksen.

Tapaus 2 – Äänetön muodonmuutos. Tiimi otti hintatietoja API:sta joka päivä. Eräänä päivänä API-palveluntarjoaja vaihtoi valuutan USD:stä euroiksi, mutta verkkotunnuksen nimi pysyi samana. Tietoja kerättiin väärään yksikköön 12 päivän ajan; 3 200 linjaa oli vioittunut. Oppitunti: Tarkista säännöllisesti äänenvoimakkuuden ja muodon johdonmukaisuus API-tiedoissa.

Tapaus 3 – Varhainen vuoto. Analyytikko sisällytti "tilin sulkemisen syy" -sarakkeen kerätessään tietoja "vaihtuvuus" -arviota varten. Tämä sarake täytettiin vasta asiakkaan poistuttua. Malli tuotti 97 %:n tarkkuuden testisarjassa; Se ei toiminut tuotannossa, koska sarake oli tyhjä ennustehetkellä. Oppitunti: kysy jokaiselta sarakkeelta kysymys "onko minulla se ennustuksen aikaan?"

Neljä kopioitavaa mallia

1) Tietosanakirjan poiminta:

Tehtäväsi: datatieteilijäassistentti. Alla on taulukon sarakkeiden nimet ja näyte (anonyymit) arvot. Listaa kunkin sarakkeen arvioitu merkitys, tietotyyppi ja mahdolliset laaturiskit taulukkoon. Merkitse sarakkeet, joista et ole varma, "vahvistus vaaditaan"; tarkoittaa tekemistä. Sarakkeet: [liitä tähän]

2) Näytteenottokoodi (satunnainen, toistettava):

Minulla on pandat df. Kirjoita koodi, joka poimii edustavan 5 %:n satunnaisotoksen 200 000 rivistä. Käytä random_state=42 (toistettavuuden vuoksi). Lisää koodi tarkistaaksesi, että otoksen luokkajakauma on samanlainen kuin perusjoukon.

3) Vuotoskannauskysymys:

Annan sinulle tämän sarakkeiden luettelon. Tavoitteeni on ennustaa "onko se peruutettu" (0/1). Arvioi jokaisen sarakkeen kohdalla, onko minulla se todella ennusteen aikaan ja merkitse se "turvalliseksi / epäilyttäväksi / vuodatuksi". Kirjoita perustelut yhdellä lauseella. Sarakkeet: [luettelo]

4) SQL-hakukyselyluonnos:

Minulla on PostgreSQL:ssä "tilaukset" ja "asiakkaat" -taulukot. Kirjoita JOIN-kysely, joka yhdistää viimeisten 90 päivän tilaukset asiakkaan kaupungin kanssa ja palauttaa tilausten kokonaismäärän ja lukumäärän kaupunkia kohti. Selitä päivämääräsuodatin ja kuinka NULL-kaupunkeja käsitellään. Suoritan kyselyn ja tarkistan sen.

Heikko kehote / Vahva kehote

Heikko kehote:

Ota tästä tietokannasta hyvä esimerkkidata.

"Hyvä" on moniselitteinen; Mikä maalaus, mikä aikakausi, mikä koko, mikä tarkoitus on epäselvä. Tekoäly tuottaa vain yleisen, mahdollisesti väärän kyselyn.

Tehokas kehotus:

Tehtäväsi: SQL-assistentti. Minulla on tapahtumataulukko: sarakkeiden tunnus, asiakastunnus, päivämäärä (aikaleima), summa (numeerinen), kanava (teksti: 'web'/'mobiili'). Tehtävä: Kirjoita toistettava (deterministinen ja ORDER BY) kysely, joka palauttaa 10 000 edustavaa riviä kustakin kanavasta vuodelle 2024. Tarkoitus: kanavien vertaileva analyysi. Listaa kyselysi oletukset.

Tässä taulukko, tarkoitus, koko ja toistettavuus ovat selvät.

Yleisiä virheitä

  • Ei kyseenalaistaa otoksen edustavuutta. Helposti saatavilla olevat tiedot eivät ole tarkkoja tietoja; valintaharha vääristää tulosta.
  • Sarakkeiden merkityksen mukauttaminen tekoälyyn. Lähderyhmä tietää merkityksen; Älä käytä AI-ennustetta vahvistamatta sitä.
  • Ei seuraa API-muodon/yksikön muutosta. Hiljainen muutos kerää korruptoitunutta dataa päivien ajan.
  • Vuodon huomioimatta jättäminen keräysvaiheessa. Jos kysymystä "Onko minulla se ennustushetkellä" ei kysytä aikaisin, malli antaa väärän menestyksen.
  • Luvattomien tai laittomien tietojen kerääminen. Robots.txt-tiedoston, käyttöehtojen ja KVKK:n rikkominen on vakava riski.
Vinkki: Säilytä yksisivuinen "tietokortti" jokaista uutta tietolähdettä varten: lähde, vetopäivämäärä, rivien määrä, tunnetut rajat ja sarakkeet, joissa on vuotovaara. Tämä kortti tallentaa "mitä tämä data oli" -kysymyksen ja toistettavuuden kuukausia myöhemmin.

Yhteenvetona

Analyysin laatua rajoittaa kerättyjen tietojen laatu. Tunne lähde (tietokanta, API, tiedosto, scrape) ja skeema hyvin; varmista, että otos edustaa väestöä; Eliminoi vuoto ensimmäisestä päivästä alkaen kysymällä jokaiselta sarakkeelta "Onko minulla se ennustehetkellä?" Tekoäly on loistava kiihdytin kyselyihin ja dokumentointiin, mutta ihmiset päättävät kerättävän tiedon ja sen edustavuuden. Valtuutuksen, lain ja luottamuksellisuuden rajat ovat aina etusijalla.

Sovellustehtävä

Valitse tietolähde (omasta yrityksestäsi tai hypoteettisesta). Hanki luonnos tietosanakirjasta tekoälyltä yllä olevan "datasanastojen purku" -mallin avulla; Arvioi sitten jokainen sarake manuaalisesti nähdäksesi, onko se vuotanut. Yritä löytää ainakin yksi epäilyttävä/vuoto-sarake ja kirjoita yhdellä lauseella, miksi se on riskialtista.

tarkistuslista

  • [ ] Olenko vahvistanut tietolähteen ja skeeman lähdetiimin kanssa?
  • [ ] Olenko tarkistanut, että otos edustaa populaatiota?
  • [ ] Olenko esittänyt jokaiselle sarakkeelle kysymyksen "Saanko sen arvion aikaan?"
  • [ ] Olenko tehnyt näytteenotosta toistettavan (kiinteä siemen)?
  • [ ] Olenko tarkistanut keräämisen lailliset/eettiset (viranomainen, robots.txt, KVKK) rajat?