Hagnaður:
- Hæfni til að velja mælikvarða sem hæfir tegund vandamála og viðskiptasamhengi (PR-AUC/innköllun í ójafnvægum gögnum, MAE/RMSE í aðhvarf) og viðurkenna yfir-/undarnám
- Geta til að túlka hverja mælikvarða gegn grunnlínu og mæla frávik og aðgreina hávaða frá framvindu með krossgildingu
- Geta til að tilkynna niðurstöður sem ekki eru bjartsýnir með því að stilla ofurfæribreytur með staðfestingarsettinu og nota prófunarsettið aðeins í lokin
Líkanþjálfun (þjálfun: ferlið við að læra mynstur úr gögnum) er sýnilegasta en villandi skref ML verkfræðinnar. Það virðist vegna þess að það framleiðir viðunandi tölu eins og "nákvæmni 95%". Villandi vegna þess að þessi tala er oft rétta svarið við rangri spurningu. Í þessari einingu er fjallað um menntun og mat með verkfræðigreininni; Við notum gervigreind sem samstarfsaðila í tilraunahönnun og byggjum ákvörðunina á mælingum.
Rökfræði þjálfunarlotunnar
Líkan lærir mynstrið í gögnunum með því að lágmarka tapfall: fall sem mælir tölulega villu líkansins. Hagræðingaralgrímið (t.d. halli niður) dregur úr tapinu með því að stilla færibreyturnar skref fyrir skref. Markmiðið er ekki að leggja þjálfunargögnin á minnið heldur að alhæfa þau yfir áður óþekkt gögn.
Tvær meginhættur:
- Offitting: Líkanið leggur þjálfunargögnin á minnið og mistekst á nýjum gögnum. Árangur þjálfunar er mikill, árangur sannprófunar er lítill.
- Underfitting: Líkanið getur ekki náð mynstrinu; Árangur bæði við þjálfun og löggildingu er lítill.
Að finna jafnvægið er list menntunar. Staðfestingarsettið er til staðar til að fylgjast með þessu jafnvægi: ef staðfestingarárangur fer að minnka á meðan þjálfunarárangur eykst er ofnám hafið.
Ábending: Settu þjálfunar- og staðfestingartapið saman í hverju skrefi. Staðurinn þar sem ferillarnir tveir byrja að víkja er þar sem ofnám hefst og er rétta stundin til að "stöðva snemma".
Val á mælikvarða: mikilvægasta ákvörðunin
Rangt mælikvarði lætur gott líkan líta illa út og slæmt líkan lítur vel út. Vandamálið ákvarðar mælikvarða:
- Ójafnvægi flokkunar (einn flokkur er mjög sjaldgæfur, t.d. svik): Nákvæmni er villandi. Líkan sem segir „kalla allt eðlilegt“ mun fá 99% nákvæmni en mun ekki grípa til eitt einasta svik. Þess í stað er nákvæmni (hversu mikið af því sem ég náði er í raun jákvætt), muna (hversu mikið af því sem ég náði er satt jákvætt) og jafnvægi þeirra F1 eða PR-AUC notuð.
- Jafnvæg flokkun: Nákvæmni og ROC-AUC geta verið viðeigandi.
- Aðhvarf (talamat): MAE (meðaltalsvilla), RMSE (refsar stórum villum), MAPE (prósentuvilla).
- Röðun/ráðgjöf: NDCG, MRR, Recall@K.
Hvort nákvæmni eða innköllun er mikilvæg fer eftir viðskiptasamhenginu. Innköllun (ekki sakna sjúklinga) er forgangsverkefni í krabbameinsleit; Nákvæmni í ruslpóstsíu (ekki að senda mikilvægan tölvupóst í ruslpóst) er mikilvæg. Þetta er viðskiptaákvörðun, ekki tæknileg, og er tekin saman af verkfræðingi og eiganda.
Veik kvaðning / Sterk kvaðning
Veik kvaðning: "Mettu frammistöðu líkansins míns, nákvæmni 0,97."
Öflug tilvitnun: "Ég er með svikagreiningarlíkan; jákvætt flokkahlutfall er 1,5%. Nákvæmni er tilkynnt sem 0,97. Útskýrðu hvers vegna þessi mælikvarði gæti verið villandi, segðu mér hvaða mælikvarða (nákvæmni, muna, PR-AUC) ég ætti að kjósa og hvers vegna. Reiknaðu líka hversu nákvæmt "kalla allt neikvætt" grunnlínulíkan myndi fá á þessum gögnum, svo ég geti séð virðisauka.
Mismunur: öflug hvetja gefur bekkjarhlutfall og viðskiptasamhengi; það biður líka um samanburð á grunnlínulíkönum - þetta er mikilvægasta akkerið fyrir hvort mælikvarði sé þýðingarmikill.
Grunnlína: mælikvarði án samanburðar er tilgangslaus
Mæling er ekki góð eða slæm ein og sér; Það er gott eða slæmt samkvæmt grunnlíkani. Grunnlíkanið er einfaldasta lausnin sem mér dettur í hug: „segðu alltaf meirihlutastéttinni“, „endurtekið gildi síðustu viku“, „giska á meðaltalið“. Ef líkanið þitt getur ekki greinilega staðist þessa einföldu lausn er allt flókið fyrir ekki neitt.
Varúð: Setningin „Mitt líkan er 85% nákvæm“ segir í sjálfu sér ekki neitt. Ef grunnlíkanið fær nú þegar 84% er líkanið þitt næstum einskis virði; Ef grunnlíkanið fær 50% er líkanið þitt fullkomið. Talaðu alltaf út frá grunnlíkaninu.
Krossstaðfesting og traust
Einn þjálfun/prófaskil geta verið vegna tilviljunar. Krossstaðfesting: að skipta gögnunum í k hluta og prófa hvern hluta í röð sýnir hversu stöðug frammistaðan er. Í 5-faldri krossprófun færðu fimm mismunandi stig; Meðaltal þeirra og staðalfrávik eru mikilvæg. Ef meðaltalið er 80% en frávikið er ±12% er líkanið þitt óstöðugt - það gæti hegðað sér mjög öðruvísi í næstu gagnalotu.
Þetta er einnig mikilvægt fyrir „samanburðinn á tveimur gerðum“. Ef Model A fékk 81% og Model B fékk 82%, er B virkilega betri? Ef frávikið er ±3% getur þessi munur verið hávaði. Íhugaðu hvort munurinn sé marktækur áður en þú tekur ákvörðun.
Stuðning á háum breytum: með staðfestingu, ekki prófun
Ofbreytur (stillingar handvirkt ákvarðaðar fyrir þjálfun—námshraði, trédýpt osfrv.) eru stilltar með staðfestingarsettinu. Prófunarsettið er aðeins notað í lokin, einu sinni. Ef þú velur ofurfæribreytur með því að skoða prófunarsettið mun prófunarsettið mengast og árangurinn sem þú tilkynnir verður bjartsýnn sem er ekki raunin í raun og veru.
Gervigreind er góður hjálpari við að hanna leitarrýmið fyrir hyperparameter og skrifa leitarkóðann (netleit, handahófskennd leit, Bayesísk fínstilling). En þú ákveður samt "hvaða mælikvarða munum við fínstilla?"
þrjú smámál
Tilfelli 1 - Nákvæmnigildra. Læknateymi var stolt af líkani sem greindi sjaldgæfan sjúkdóm: 98% nákvæmni. Þegar grunnlíkansamanburðurinn var gerður kom sannleikurinn í ljós: þar sem sjúkdómshlutfallið var 2% fékk líkanið sem sagði "kalla alla heilbrigða" einnig 98%. Inköllun líkansins var aðeins 11% - vantaði flesta sjúklinga. Þegar mælistikunni var breytt í PR-AUC var raunveruleg frammistaða mæld og líkanið endurhannað.
Tilfelli 2 - Mistök hávaði fyrir framfarir. Hópur eyddi mánuðum í að bæta líkanið úr 86,2% í 86,9%. Krossstaðfesting sýndi að hlutdrægni var ±1,4% - þannig að 0,7 punkta „framför“ var tölfræðilegur hávaði. Liðið hafði eytt þremur vikum í óraunverulegar tekjur. Lexía: ekki lýsa yfir sigri án þess að staðfesta að framförin sé meiri en frávikið.
Tilfelli 3 - Mengun á prófunarsettinu. Verkfræðingur skoðaði prófunarsettið ítrekað til að velja bestu ofbreyturnar. Þau 91% sem það greindi frá lækkuðu í 83% í framleiðslu. Hvers vegna: hann hafði óafvitandi valið líkanið í samræmi við það með því að skoða prófunarsettið aftur og aftur (oflært á prófunarsettinu). Tilkynnt og raunveruleg frammistaða skarast þegar sérstakt staðfestingarsett var notað.
Afritanleg sniðmát
Hjálpaðu mér að velja réttu mælistikuna fyrir þetta flokkunarvandamál. Vandamál: [hvað er spáð fyrir] Stéttadreifing: [jákvætt hlutfall
Metið samanburð á eftirfarandi tveimur gerðum.Krossprófun líkan A: [listi yfir stig]Krossprófun líkan B: [listi yfir stig]Reiknið meðaltal og staðalfrávik. Er munurinn tölfræðilega marktækur eða er það bara hávaði innan fráviksins? Hvorn mynduð þið mæla með að ég velji og hvers vegna?
Athugaðu eftirfarandi þjálfunarkóða fyrir eftirfarandi:1) Eru ofþættirnir valdir með prófunarsettinu eða staðfestingarsettinu?2) Er fylgst með snemma stöðvun með réttu settinu?3) Eru einhver merki um ofnám (þjálfun/prófunartap munur)?Kóði: [kóði]
Hvert af MAE, RMSE og MAPE ætti ég að tilkynna vegna þessa aðhvarfsvandamáls?Kvarði markbreytu: [svið]Eru stórar villur óhóflega slæmar (RMSE), eða eru þær allar jafnar (MAE)?Eru gildi nálægt núlli (afbaka þau MAPE)?Stingið upp með stuttum rökstuðningi.
Metravaltafla
Tegund vandamál
Viðeigandi mælikvarði
Til að forðast
Hvers vegna
Ójafnvægi flokkunar
PR-AUC, F1, innköllun
Nákvæmni
Meirihlutaflokkur blásar upp mæligildið
Jafnvæg flokkun
Nákvæmni, ROC-AUC
—
Áreiðanleg í jafnvægisgögnum
Aðhvarf (mikil útlína)
RMSE
MAPE (ef núll)
Refsar stór mistök
Aðhvarf (jafnvægi)
MAE
—
Auðvelt að túlka
Röðun/tilmæli
NDCG, Recall@K
Nákvæmni
Röð er mikilvæg
Algeng mistök
- Notkun nákvæmni á ójafnvægi gagna. Algengasta mæligildisvillan.
- Gerir ekki grunnlíkanasamanburð. Það lætur mæligildið missa merkingu sína.
- Horft á prófunarsettið fyrir ofbreytur. Bjartsýn, óraunhæf niðurstaða.
- Að treysta á eitt hólf. Án krossstaðfestingar muntu ekki sjá hlutdrægni.
- Misvísandi hávaði fyrir framfarir. Lítil "umbætur" frá fráviki eru aðallega heppni.
- Hunsa viðskiptasamhengið. Nákvæmni/innköllunarjafnvægið er viðskiptaákvörðun.
Í stuttu máli
Raunveruleg kunnátta í módelþjálfun er ekki að framleiða háa tölu, heldur að vita hvað þessi tala þýðir. Vandamálið og viðskiptasamhengið ákvarðar rétta mælikvarða; túlka hvern mælikvarða í samræmi við grunnlínulíkan; mæla hlutdrægni með krossfestingu og ekki misskilja hávaða fyrir framfarir; Notaðu prófunarsettið aðeins í lokin, einu sinni. Gervigreind er félagi þinn í tilraunahönnun, en ákvörðunin um „nógu gott“ er undir þér og þínum komið.
Umsóknarverkefni
Fyrir flokkunarlíkan: (1) skrifaðu flokkadreifinguna, (2) byggðu viðeigandi grunnlíkan og mældu stig þess, (3) metðu líkanið þitt með 5-faldri krossprófun og tilkynntu meðaltalið og staðalfrávikið, (4) reiknaðu mæligildið sem hæfir vandamálinu (t.d. PR-AUC) í stað nákvæmni. Skrifaðu niður hvort líkanið þitt slær grunnlínulíkanið með miklum mun án hlutdrægni.
gátlisti
- [ ] Ég valdi mælistikuna út frá tegund vandamála og viðskiptasamhengi.
- [ ] Ég smíðaði grunnlíkan og bar saman við það.
- [ ] Ég tilkynnti meðaltal og frávik með krossgildingu.
- [ ] Ég staðfesti að framförin er meiri en frávikið.
- [ ] Ég valdi ofurfæribreyturnar með staðfestingarsettinu.
- [ ] Ég notaði prófunarsettið aðeins einu sinni, alveg í lokin.