Fitimet:
- Aftësia për të zgjedhur metrikën e përshtatshme për llojin e problemit dhe kontekstin e biznesit (PR-AUC/kujtesa në të dhëna të pabalancuara, MAE/RMSE në regresion) dhe për të njohur mbi/nën të mësuarit
- Aftësia për të interpretuar çdo metrikë kundrejt një linje bazë dhe për të matur devijimin dhe ndarjen e zhurmës nga progresi me verifikim të kryqëzuar
- Aftësia për të raportuar rezultate jo optimiste duke akorduar hiperparametrat me grupin e vlefshmërisë dhe duke përdorur grupin e testimit vetëm në fund
Trajnimi model (trajnimi: procesi i të mësuarit të modeleve nga të dhënat) është hapi më i dukshëm, por më mashtrues i inxhinierisë ML. Duket sepse prodhon një numër të kënaqshëm si "saktësia 95%". Mashtruese sepse ai numër shpesh është përgjigjja e duhur për pyetjen e gabuar. Në këtë njësi, edukimi dhe vlerësimi diskutohen me disiplinën inxhinierike; Ne përdorim inteligjencën artificiale si partner në dizajnimin eksperimental dhe e bazojmë vendimin në matje.
Logjika e ciklit të trajnimit
Një model mëson modelin në të dhëna duke minimizuar një funksion të humbjes: një funksion që mat në mënyrë numerike gabimin e modelit. Algoritmi i optimizimit (p.sh. zbritja e gradientit) redukton humbjen duke rregulluar parametrat hap pas hapi. Qëllimi nuk është memorizimi i të dhënave të trajnimit, por përgjithësimi i tyre në të dhëna të paprecedentë.
Dy rreziqe kryesore:
- Mbi përshtatja: Modeli memorizon të dhënat e trajnimit dhe dështon në të dhënat e reja. Suksesi i trajnimit është i lartë, suksesi i verifikimit është i ulët.
- Papërshtatja: Modeli nuk mund të kap modelin; Suksesi i trajnimit dhe i vërtetimit janë të ulëta.
Gjetja e ekuilibrit është arti i edukimit. Kompleti i vlefshmërisë është atje për të monitoruar këtë ekuilibër: nëse suksesi i vlefshmërisë fillon të ulet ndërsa suksesi i trajnimit rritet, mbimësimi ka filluar.
Këshillë: Paraqitni humbjen e trajnimit dhe të vërtetimit së bashku në çdo hap. Pika në të cilën dy kthesat fillojnë të ndryshojnë është aty ku fillon mbi-mësimi dhe është momenti i duhur për të "ndaluar herët".
Zgjedhja metrike: vendimi më kritik
Metrika e gabuar e bën një model të mirë të duket i keq dhe një model të keq të duket i mirë. Problemi përcakton metrikën:
- Klasifikimi i pabalancuar (një klasë është shumë e rrallë, p.sh. mashtrimi): Saktësia është mashtruese. Një model që thotë "quaji gjithçka normale" do të ketë 99% saktësi, por nuk do të kapë asnjë mashtrim të vetëm. Në vend të kësaj, përdoren saktësia (sa nga ajo që kam kapur është në të vërtetë pozitive), rikujtimi (sa nga ajo që kam kapur është vërtet pozitive) dhe bilanci i tyre F1 ose PR-AUC.
- Klasifikimi i balancuar: Saktësia dhe ROC-AUC mund të jenë të përshtatshme.
- Regresioni (vlerësimi i numrit): MAE (gabim mesatar absolut), RMSE (penalizon gabime të mëdha), MAPE (gabim në përqindje).
- Renditja/rekomandimi: NDCG, MRR, Recall@K.
Nëse saktësia apo rikujtimi është i rëndësishëm varet nga konteksti i biznesit. Rikujtimi (të mos mungojë asnjë pacient) është prioritet në depistimin e kancerit; Saktësia në filtrin e postës së padëshiruar (mos dërgimi i e-maileve të rëndësishme në spam) është i rëndësishëm. Ky është një vendim biznesi, jo teknik dhe merret së bashku nga inxhinieri dhe pronari.
Prompt i dobët / Prompt i fortë
Prompt i dobët: "Vlerëso performancën e modelit tim, saktësia 0.97."
Njoftim i fuqishëm: "Kam një model zbulimi mashtrimi; norma e klasës pozitive është 1,5%. Saktësia është raportuar si 0,97. Shpjegoni pse kjo metrikë mund të jetë mashtruese, më tregoni cilat metrikë (precizion, rikujtim, PR-AUC) duhet të preferoj dhe pse. Llogaritni gjithashtu se sa i saktë "quaj gjithçka negative" të dhëna bazë, kështu që mund ta shoh këtë model bazë të vërtetë të shtuar."
Dallimi: prompt i fuqishëm jep raportin e klasës dhe kontekstin e biznesit; ai gjithashtu kërkon një krahasim të modelit bazë - kjo është ankora më e rëndësishme nëse një metrikë është kuptimplotë.
Baza: metrika pa krahasim është e pakuptimtë
Një metrikë nuk është e mirë apo e keqe në vetvete; Është e mirë apo e keqe sipas një modeli bazë. Modeli bazë është zgjidhja më e thjeshtë që të vjen ndërmend: "thuaji gjithmonë klasës së shumicës", "përsërite vlerën e javës së kaluar", "mendoje mesataren". Nëse modeli juaj nuk mund ta kalojë qartë këtë zgjidhje të thjeshtë, i gjithë kompleksiteti është i kotë.
Kujdes: Fjalia "Modeli im është 85% i saktë" në vetvete nuk thotë asgjë. Nëse modeli bazë tashmë merr 84%, modeli juaj është pothuajse i pavlefshëm; Nëse modeli bazë merr 50%, modeli juaj është i përsosur. Flisni gjithmonë në terma të modelit bazë.
Vërtetimi i kryqëzuar dhe besimi
Një ndarje e vetme trajnimi/testimi mund të jetë për shkak të rastësisë. Vërtetimi i kryqëzuar: ndarja e të dhënave në k pjesë dhe testimi i secilës pjesë në mënyrë sekuenciale tregon se sa e qëndrueshme është performanca. Në vlerësimin e kryqëzuar 5-fish ju merrni pesë pikë të ndryshme; Mesatarja dhe devijimi standard i tyre janë të rëndësishme. Nëse mesatarja është 80%, por devijimi është ±12%, modeli juaj është i paqëndrueshëm - mund të sillet shumë ndryshe në grupin tjetër të të dhënave.
Kjo është gjithashtu kritike për "krahasimin e dy modeleve". Nëse Modeli A ka 81% dhe Modeli B 82%, a është vërtet B më i mirë? Nëse devijimi është ±3%, ky ndryshim mund të jetë zhurmë. Konsideroni nëse ndryshimi është i rëndësishëm përpara se të vendosni.
Akordimi i hiperparametrit: me vërtetim, jo testim
Hiperparametrat (cilësimet e përcaktuara manualisht përpara stërvitjes - shkalla e të mësuarit, thellësia e pemës, etj.) vendosen me grupin e vlefshmërisë. Seti i testimit përdoret vetëm në fund, një herë. Nëse zgjidhni hiperparametrat duke parë grupin e testimit, grupi i testimit do të kontaminohet dhe performanca që raportoni do të jetë optimiste, gjë që nuk është rasti në realitet.
Inteligjenca artificiale është një ndihmës i mirë në dizajnimin e hapësirës së kërkimit të hiperparametrit dhe shkrimin e kodit të kërkimit (kërkimi në rrjet, kërkimi i rastësishëm, optimizimi Bayesian). Por ju ende vendosni "cilën metrikë do të optimizojmë?"
tre mini kuti
Rasti 1 - Kurthi i saktësisë. Një ekip mjekësor ishte krenar për një model që zbuloi një sëmundje të rrallë: 98% saktësi. Kur u bë krahasimi i modelit bazë, doli e vërteta: duke qenë se shkalla e sëmundjes ishte 2%, modeli që thoshte "thirri të gjithë të shëndetshëm" mori gjithashtu 98%. Tërheqja e modeles ishte vetëm 11% - mungonin shumica e pacientëve. Pasi metrika u konvertua në PR-AUC, performanca aktuale u mat dhe modeli u ridizajnua.
Rasti 2 - Gabimi i zhurmës për progres. Një ekip kaloi muaj për të përmirësuar modelin nga 86.2% në 86.9%. Vërtetimi i kryqëzuar tregoi se paragjykimi ishte ±1.4% - kështu që "përmirësimi" prej 0.7 pikësh ishte zhurma statistikore. Ekipi kishte humbur tre javë me fitime joreale. Mësimi: mos shpall fitore pa verifikuar që përmirësimi është më i madh se devijimi.
Rasti 3 - Ndotja e grupit të testimit. Një inxhinier shikoi në mënyrë të përsëritur grupin e provës për të zgjedhur hiperparametrat më të mirë. 91% që raportoi ra në 83% në prodhim. Pse: ai kishte zgjedhur pa vetëdije modelin në përputhje me rrethanat duke parë grupin e testit pa pushim (duke mësuar mbi grupin e testimit). Performanca e raportuar dhe ajo aktuale mbivendosen kur u përdor një grup i veçantë vërtetimi.
Modele të kopjueshme
Më ndihmo të zgjedh metrikën e duhur për këtë problem klasifikimi. Problemi: [çfarë parashikohet] Shpërndarja në klasë: [normë pozitive
Vlerësoni krahasimin e dy modeleve të mëposhtëm.Vlerësimi i kryqëzuar i Modelit A: [lista e pikëve]Vlerësimi i kryqëzuar i modelit B: [lista e pikëve] Llogaritni mesataren dhe devijimin standard. A është dallimi i rëndësishëm statistikisht apo është vetëm zhurmë brenda devijimit? Cilin do të më rekomandonit të zgjedh dhe pse?
Kontrolloni këtë kod trajnimi për sa vijon:1) A janë zgjedhur hiperparametrat me grupin e testimit ose grupin e vlefshmërisë?2) A monitorohet ndalimi i hershëm me grupin e duhur?3) A ka ndonjë shenjë të mbimësimit (ndryshimi i humbjes së trajnimit/validimit)? Kodi: [kodi]
Cilin nga MAE, RMSE dhe MAPE duhet të raportoj për këtë problem të regresionit? Shkalla e ndryshores së synuar: [ranga]A janë gabimet e mëdha në mënyrë disproporcionale të këqija (RMSE), apo janë të gjitha të barabarta (MAE)? A ka vlera afër zeros (a shtrembërojnë MAPE)? Sugjeroni me një justifikim të shkurtër.
Tabela e përzgjedhjes metrike
Lloji i problemit
Metrikë e përshtatshme
Për t'u shmangur
Pse
Klasifikimi i pabalancuar
PR-AUC, F1, kujto
Saktësia
Klasa e shumicës fryn metrikën
Klasifikimi i balancuar
Saktësia, ROC-AUC
-
I besueshëm në të dhëna të balancuara
Regresioni (i jashtëzakonshëm i rëndësishëm)
RMSE
MAPE (nëse është zero)
Dënon gabimet e mëdha
Regresioni (peshë e barabartë)
MAE
-
Lehtë për t'u interpretuar
Renditja/rekomandimi
NDCG, Recall@K
Saktësia
Rendi është i rëndësishëm
Gabimet e zakonshme
- Përdorimi i saktësisë në të dhënat e pabalancuara. Gabimi metrik më i zakonshëm.
- Duke mos bërë krahasime të modeleve bazë. Kjo e bën metrikën të humbasë kuptimin e saj.
- Duke parë grupin e testimit për hiperparametrat. Rezultat optimist, joreal.
- Duke u mbështetur në një ndarje të vetme. Pa verifikim të kryqëzuar, nuk do të shihni paragjykim.
- Gabimi i zhurmës për përparim. “Përmirësimet” e vogla nga devijimi janë kryesisht fat.
- Injorimi i kontekstit të biznesit. Bilanci i saktësisë/tërheqjes është një vendim biznesi.
Në përmbledhje
Aftësia e vërtetë në trajnimin e modeleve nuk është të prodhosh një numër të lartë, por të dish se çfarë do të thotë ai numër. Problemi dhe konteksti i biznesit përcaktojnë metrikën e duhur; interpretojnë çdo metrikë sipas një modeli bazë; matni paragjykimet me verifikim të kryqëzuar dhe mos e ngatërroni zhurmën me përparimin; Përdorni grupin e testimit vetëm në fund, një herë. Inteligjenca artificiale është partneri juaj në hartimin e eksperimentit, por vendimi për "mjaft të mirë" varet nga ju dhe juaji.
Detyra e aplikimit
Për një model klasifikimi: (1) shkruani shpërndarjen e klasës, (2) ndërtoni një model bazë të përshtatshëm dhe matni rezultatin e tij, (3) vlerësoni modelin tuaj me vërtetim të kryqëzuar 5-fish dhe raportoni mesataren dhe devijimin standard, (4) llogaritni metrikën e përshtatshme për problemin (p.sh. PR-AUC) në vend të saktësisë. Shkruani nëse modeli juaj e mund modelin bazë me një diferencë të madhe pa paragjykime.
listë kontrolli
- [ ] Zgjodha metrikën bazuar në llojin e problemit dhe kontekstin e biznesit.
- [ ] Unë ndërtova një model bazë dhe e krahasova me të.
- [ ] Kam raportuar mesataren dhe devijimin me verifikimin e kryqëzuar.
- [ ] Unë konfirmova se përmirësimi është më i madh se devijimi.
- [ ] Zgjodha hiperparametrat me grupin e vlefshmërisë.
- [ ] Kam përdorur grupin e testimit vetëm një herë, në fund.