Fitimet:
- Aftësia për të vendosur një tubacion të dhënash (mbledhja, vlefshmëria, pastrimi, transformimi, ndarja, versioni) dhe vendosja e vlefshmërisë së skemës në fillim të tubacionit
- Aftësia për të marrë vendime për vlerat që mungojnë dhe etiketimin bazuar në kuptimin dhe ndarjen e fushës për të parandaluar rrjedhjen e të dhënave (grupore dhe të përkohshme)
- Aftësia për të krijuar një bazë të dhënash të riprodhueshme duke rregulluar versionin e të dhënave dhe farën e rastësisë
Fuqia e vërtetë e çdo sistemi të mësimit të makinerive qëndron në të dhënat, jo në model. Inxhinierët me përvojë e dinë: "plehrat brenda, mbeturinat jashtë" - edhe modeli më i avancuar i ushqyer me të dhëna të këqija do të prodhojë rezultate të këqija. Në këtë njësi, ne vendosim tubacionin e të dhënave (tubacioni i të dhënave: zinxhiri i hapave që i bëjnë të dhënat e papërpunuara të gatshme për trajnimin e modelit) nga fundi në fund dhe mësojmë se në cilin hap të kësaj linje mund të përdorim në mënyrë të sigurt inteligjencën artificiale.
Hapat e linjës së të dhënave
Një linjë e të dhënave zakonisht kalon nëpër këto ndalesa:
- Mbledhja (gëlltitja): Tërheqja e të dhënave nga burimet (baza e të dhënave, API, skedarët e regjistrave, transmetimet e ngjarjeve).
- Validimi: Kontrollimi nëse të dhënat përputhen me skemën, llojet dhe diapazonin e pritshëm.
- Pastrimi: Trajtimi i vlerave që mungojnë, regjistrimet e kopjuara, të dhënat e jashtme dhe mospërputhjet.
- Transformimi: Shndërrimi i të dhënave të papërpunuara në atribute - të tilla si konvertimi i një ndryshoreje kategorike në një numër, prodhimi i një "ditë të javës" nga një datë.
- Ndarja: Ndarja në grupe trajnimi, vërtetimi dhe testimi.
- Versionimi: Regjistrimi se cili model është trajnuar me cilat të dhëna.
Inteligjenca artificiale kursen kohë duke gjeneruar drafte kodesh dhe ide, veçanërisht në hapat 2, 3 dhe 4. Por vendime të tilla si se cili rekord të hidhet, cila vlerë i mungon të plotësohet dhe si, i përkasin inxhinierit që i njeh të dhënat; sepse pastrimi jo i duhur mund të injektojë një paragjykim të fshehur në model.
Verifikimi i të dhënave: mbrojtja e hershme e linjës
Gabimet më të shtrenjta fillojnë jo në prodhim, por aty ku kapërcehet hapi i verifikimit. Vlefshmëria e skemës kontrollon automatikisht nëse çdo grup i të dhënave hyrëse përputhet me strukturën e pritur. Për shembull, a është kolona e moshës midis 0-120, a është fusha e emailit bosh, a ka ndryshuar numri i kolonave?
Këshillë: Vendosni verifikimin në fillim të rreshtit. Sa më shpejt të kapen të dhënat e korruptuara, aq më lirë është të rregullohen. Një gabim skematik i kapur në prodhim është shumë herë më i shtrenjtë se ai i kapur në fazën e trajnimit.
Shkruani një skemë vërtetimi me pandera (ose Pritjet e Mëdha) për skemën e mëposhtme të të dhënave. Kolonat dhe rregullat: - ID_i i përdoruesit: numër i plotë, nuk mund të jetë i pavlefshëm, unik- mosha: numër i plotë, nuk mund të jetë nga 0-120- data_regjistrimi: data, nuk mund të jetë në të ardhmen- shteti: kategorik, nga grupi {TR, DE, SHBA, MB}- bilanci: dhjetor, nuk mund të jetë negativ Krijoni një mesazh gabimi kuptimplotë për çdo shkelje të rregullit. Trego testin me një shembull të vijës së thyer në fund të kodit.
Pastrimi: është njeriu ai që vendos
Vlerat që mungojnë janë një realitet i çdo grupi të dhënash. Mënyrat për të trajtuar:
- Fshirja: Heqja e një rreshti/kolone me një përqindje shumë të lartë të mungesës. Por ekziston rreziku i humbjes së informacionit dhe paragjykimeve.
- Imputimi: Imputimi me mesataren, mesataren, vlerën më të shpeshtë ose parashikimin e bazuar në model.
- Flamuri: Ruajtja e informacionit "ka munguar" në një kolonë të veçantë flamuri - ndonjëherë vetë sinjali që mungon është sinjali.
Cila është e saktë varet nga problemi. Në një grup të dhënash mjekësore, informacioni "vlera e gjakut që nuk matet" duhet të ruhet në vend që të fshihet; Sepse edhe refuzimi i mjekut për të bërë matje është një sinjal. AI mund t'ju japë opsione dhe kode; Ju zgjidhni se cila i përshtatet realitetit të fushës.
Prompt i dobët / Prompt i fortë
Prompt i dobët: "Plotëso vlerat që mungojnë".
Prompt i fortë: "Ka vlera që mungojnë në kolonat e mëposhtme: të ardhurat (12% mungojnë, shpërndarja e anuar djathtas), identifikimi i fundit (mungon 30%). Sugjeroni plotësimin e të ardhurave me mesataren, por shpjegoni pse mesataren dhe jo mesataren. Për last_login, supozoni se vlera që mungon mund të jetë e rëndësishme (përdoruesi mund të mos ketë hyrë kurrë në login_e_; Shkruani paragjykimet që secila qasje do t'i shtonte modelit."
Dallimi: prompti i fortë jep informacionin e shpërndarjes dhe kuptimin e zonës; inteligjenca artificiale prodhon mbështetje për vendimmarrje në vend të mbushjes mekanike.
Etiketimi: cilësia matet
Në mësimin e mbikëqyrur (të mësuarit në të cilin jepen shembuj me përgjigjet e sakta), ajo që modeli mëson janë etiketat (etiketat: përgjigja e saktë për secilin shembull). Cilësia e etiketës vendos një tavan - nëse njerëzit etiketojnë në mënyrë jokonsistente, modeli mëson në mënyrë jokonsistente.
Marrëveshja ndër-shënues mat shkallën me të cilën njerëz të ndryshëm i japin të njëjtën etiketë të njëjtit mostër; Ai shprehet me një koeficient të tillë si Kappa e Cohen. Pajtueshmëria e ulët tregon ose detyra është e paqartë ose udhëzimi është i dobët.
Inteligjenca artificiale ndihmon në etiketimin në dy mënyra: (1) hartimi i udhëzuesit për shënime, (2) para-etiketimi dhe lënia e njeriut që vetëm ta korrigjojë atë. Por etiketimi paraprak me LLM ka një kurth: gabimi sistematik i modelit mund të rrjedhë në të gjithë grupin e etiketave. Kjo është arsyeja pse njerëzit gjithmonë kontrollojnë disa nga etiketat LLM.
Kujdes: Mos i konsideroni etiketat e prodhuara nga LLM si "të vërteta bazë". Kontrolloni një mostër me një njeri dhe matni përshtatjen LLM-njerëzore. Nëse pajtueshmëria është e ulët, etiketimi paraprak do të bëjë më shumë dëm sesa dobi.
Ndarja e të dhënave: parandaloni rrjedhjen
Gabimi më i rrezikshëm kur ndahen të dhënat në trajnim/validim/testim është rrjedhja e të dhënave: përzierja e informacionit të testit në trajnim. Shembuj:
- Të dhënat e të njëjtit përdorues përfshihen si në trajnim ashtu edhe në testim (rrjedhje në grup).
- Përdorimi i së ardhmes në trajnim dhe i së kaluarës në testimin në seri kohore (rrjedhje e përkohshme).
- Llogaritja e parametrave të shkallëzimit (normalizimit) nga të gjitha të dhënat dhe më pas pjesëtimi.
Ndarja kohore është thelbësore për problemet që kanë të bëjnë me kohën: stërvituni me të kaluarën, testoni në të ardhmen. Ndarja e rastësishme jep një përfitim "të ardhshëm" që nuk do të ndodhë kurrë në prodhim dhe rrit metrikën.
Versionimi dhe riprodhueshmëria e të dhënave
"Me çfarë të dhënash e trajnuam këtë model?" Të jesh në gjendje t'i përgjigjesh pyetjes muaj më vonë është shenjë dalluese e inxhinierisë serioze të ML. Versionimi i të dhënave ruan çdo fotografi të të dhënave me një ID (hash ose etiketë versioni). Mjete të tilla si të dhënat e versionit të DVC (Data Version Control) si kodi.
Për të riprodhuar rezultatin e një modeli, duhet të rregullohen tre gjëra: versioni i të dhënave, versioni i kodit dhe fara e rastësishme. Nuk mund të thuash “kam të njëjtin rezultat” pa këtë treshe. Ne do të thellojmë Riprodhueshmërinë në njësinë 11; por fiksimi i farës në tubacionin e të dhënave fillon nga këtu.
tre mini kuti
Rasti 1 - Vlefshmëria e skemës së ditës është ruajtur. Kur një ekip konvertoi një fushë çmimi të sistemit në rrjedhën e sipërme nga qindarka në lira, të gjitha çmimet ranë 100 herë. Vleresimi i skemës e refuzoi grupin si "çmim jashtë diapazonit" dhe modeli nuk ishte trajnuar me të dhëna të korruptuara. Pa verifikim, gabimi do të vihej re vetëm në prodhim, me parashikime të pasakta.
Rasti 2 - Paragjykimi i mbushjes së gabuar. Në një model krediti, vlerat e të ardhurave të munguara plotësoheshin me mesataren. Por të ardhurat e munguara ishin kryesisht në grupin me të ardhura të ulëta; mesatarja e "pasuroi" artificialisht këtë grup dhe modeli u ofroi atyre një kufi të lartë të padrejtë. Rregulloi problemin me flamurin mesatar + mungesë.
Rasti 3 - Rrjedhje e përkohshme. Një model i parashikimit të kërkesës dukej i mrekullueshëm në grupin e provës (95% saktësi), por u rrëzua në prodhim. Pse: për shkak të ndarjes së rastësishme, modelja kishte parë të ardhmen. Kalimi në lidhjen e përkohshme e uli saktësinë e provës në 78% - por kjo ishte performancë reale dhe e mbajti atë në prodhim.
Modele të kopjueshme
Ndani të dhënat e mëposhtme në tre grupe: trajnim/vlefshmëri/testim. Kufizimi: Kjo është një seri kohore; Përdorni ndarjen e përkohshme (treni në të kaluarën, provë në të ardhmen). Parandaloni rrjedhjen e grupit: keni të njëjtin 'id_customer' vetëm në një grup. Llogaritni parametrat e shkallëzimit VETËM nga grupi i trajnimit, më pas aplikoni për të gjithë. Shtypni sa rreshta kanë mbetur në kod në çdo hap dhe shtoni një pohim që kontrollon për asnjë rrjedhje.
Shkruani një draft udhëzues shënimi për këtë detyrë etiketimi. Detyra: [p.sh. Etiketoni komentin e klientit pozitiv/negativ/neutral]Sqaroni rastet kufitare: sarkazmë, emocione të përziera, si të etiketoni komentin që nuk lidhet me produktin? Jepni 5 shembuj dhe 3 raste të vështira që do të rrisin qëndrueshmërinë midis etiketuesve.
Krijoni një listë kontrolli të riprodhueshmërisë për këtë tubacion të dhënash:- Si duhet të rregullohet versioni i të dhënave?- Cilat fara rastësie duhet të vendosen?- Cilat meta të dhëna (hash i të dhënave, numërimi i rreshtave, data) duhet të regjistrohen? Baza ime e kodit: [gjuhë/bibliotekë]
Kontrollo këtë kod pastrimi për rrjedhje të të dhënave. Shikoni konkretisht këtë: a janë llogaritur parametrat e shkallëzimit/kodifikimit PARA ndarjes? A llogaritet ndonjë statistikë nga të gjitha të dhënat apo vetëm trajnimi? Kodi: [kodi]
Tabela e vendimeve: strategjia e mungesës së vlerës
Statusi
Qasja e rekomanduar
Pse
Shpërndarje numerike, e anuar
mbush me mesatare
Mesatarja ndikohet nga vlerat e jashtme
Numerike, simetrike
mbush me mesatare
Mbron informacionin
Mangësia mund të jetë e konsiderueshme
Flamuri kolonë + mbushje
Mungesa është një sinjal
Shkalla e munguar > 60%
Vlerësoni / hidhni kolonën
Zhurma është e tepërt
Kategorike
Kategoria "E panjohur".
Nuk krijon shumicë artificiale
Gabimet e zakonshme
- Po kalon verifikimin. Pa kontroll të skemës, të dhënat e korruptuara futen në heshtje.
- Shkallëzimi para ndarjes. Ajo nxjerr statistika testimi në arsim.
- Përdorimi i ndarjes së rastësishme në seritë kohore. Ai prodhon metrika të rreme të larta.
- Besim verbërisht etiketave LLM. Gabimi sistematik përhapet në të gjithë të dhënat.
- Versioni i të dhënave nuk ruhet. Ju nuk mund të riprodhoni rezultatin.
- Mbushje mekanike me mesatare. Ai injoron kuptimin e fushës, shton paragjykimet.
Në përmbledhje
Tubacioni i të dhënave është themeli i sistemit ML dhe meriton më shumë përpjekje sesa modeli. Vendos verifikimin në krye; merrni vendime për pastrimin dhe etiketimin me njohuri për fushën; parandaloni rrjedhjet (grupore dhe të përkohshme) në ndarje; rregulloni versionin dhe seedin e të dhënave. AI gjeneron kode dhe ide në këtë linjë, por ju takon juve të vendosni se cilat të dhëna të përpunoni dhe si - sepse çdo vendim i gabuar këtu kalon në model si një e metë e fshehur.
Detyra e aplikimit
Shkruani një skemë vërtetimi (pandera/Pritjet e mëdha) në grupin tuaj të të dhënave dhe shtoni qëllimisht një rresht të keq dhe tregoni se u kap. Më pas ndani të dhënat përkohësisht ose në grup, llogaritni parametrat e shkallëzimit vetëm nga trajnimi dhe verifikoni që nuk ka rrjedhje me një pohim. Shkruani versionin e të dhënave dhe numrin e rreshtave në një skedar metadata.
listë kontrolli
- [ ] Vleresimi i skemës kryhet në krye të rreshtit.
- [ ] Zgjodha strategjinë e vlerës që mungon bazuar në kuptimin e fushës, nuk e plotësova mekanikisht.
- [ ] Kam matur cilësinë e etiketës (përputhshmërinë); Kam kontrolluar nga njeriu etiketat LLM.
- [ ] Unë parandalova rrjedhjen e grupit dhe të përkohshme në panel.
- [ ] Shkallëzimi/kodimi llogaritet vetëm nga grupi i trajnimit.
- [ ] Versioni i të dhënave, numri i rreshtave dhe fara e regjistruar.