Mga nadagdag:
- Kakayahang pumili ng sukatan na naaangkop sa uri ng problema at konteksto ng negosyo (PR-AUC/recall sa hindi balanseng data, MAE/RMSE sa regression) at kilalanin ang over/under learning
- Kakayahang bigyang-kahulugan ang bawat sukatan laban sa isang baseline at sukatin ang paglihis at paghiwalayin ang ingay mula sa pag-unlad na may cross-validation
- Kakayahang mag-ulat ng mga di-optimistic na resulta sa pamamagitan ng pag-tune ng mga hyperparameter gamit ang validation set at paggamit ng test set lamang sa dulo
Ang pagsasanay sa modelo (pagsasanay: ang proseso ng pag-aaral ng mga pattern mula sa data) ay ang pinakanakikita ngunit pinakanakapanlilinlang na hakbang ng ML engineering. Lumilitaw ito dahil gumagawa ito ng isang kasiya-siyang numero tulad ng "katumpakan 95%". Nakaliligaw dahil ang numerong iyon ang kadalasang tamang sagot sa maling tanong. Sa yunit na ito, ang edukasyon at pagsusuri ay tinatalakay sa disiplina ng inhenyero; Gumagamit kami ng artificial intelligence bilang kasosyo sa pang-eksperimentong disenyo at ibinabatay namin ang desisyon sa pagsukat.
Logic ng ikot ng pagsasanay
Natututuhan ng isang modelo ang pattern sa data sa pamamagitan ng pagliit ng function ng pagkawala: isang function na sumusukat sa error ng modelo ayon sa numero. Binabawasan ng algorithm ng pag-optimize (hal. gradient descent) ang pagkawala sa pamamagitan ng pagsasaayos ng mga parameter nang sunud-sunod. Ang layunin ay hindi kabisaduhin ang data ng pagsasanay, ngunit i-generalize ito sa hindi pa nagagawang data.
Dalawang pangunahing panganib:
- Overfitting: Ang modelo ay kabisado ang data ng pagsasanay at nabigo sa bagong data. Mataas ang tagumpay sa pagsasanay, mababa ang tagumpay sa pag-verify.
- Underfitting: Hindi makuha ng modelo ang pattern; Parehong mababa ang tagumpay ng pagsasanay at pagpapatunay.
Ang paghahanap ng balanse ay ang sining ng edukasyon. Ang validation set ay naroon upang subaybayan ang balanseng ito: kung ang tagumpay ng validation ay magsisimulang bumaba habang tumataas ang tagumpay ng pagsasanay, nagsimula na ang overlearning.
Tip: I-plot ang training at validation loss nang magkasama sa bawat hakbang. Ang punto kung saan nagsisimulang maghiwalay ang dalawang kurba ay kung saan magsisimula ang sobrang pagkatuto at ito ang tamang sandali para "maagang huminto".
Pagpili ng sukatan: ang pinakamahalagang desisyon
Ang maling sukatan ay nagmumukhang masama ang isang magandang modelo at ang isang masamang modelo ay nagmumukhang maganda. Tinutukoy ng problema ang sukatan:
- Hindi balanseng pag-uuri (isang klase ay napakabihirang, hal. panloloko): Ang katumpakan ay nakakapanlinlang. Ang isang modelo na nagsasabing "tawagan ang lahat ng normal" ay makakakuha ng 99% katumpakan ngunit hindi makakahuli ng isang panloloko. Sa halip, ang katumpakan (kung gaano karami sa nahuli ko ang aktwal na positibo), alalahanin (kung gaano karami sa nahuli ko ang totoong positibo) at ang kanilang balanseng F1 o PR-AUC ay ginagamit.
- Balanseng pag-uuri: Ang katumpakan at ROC-AUC ay maaaring naaangkop.
- Regression (pagtatantya ng numero): MAE (mean absolute error), RMSE (nagpaparusa ng malalaking error), MAPE (percentage error).
- Ranking/rekomendasyon: NDCG, MRR, Recall@K.
Kung mahalaga ang katumpakan o pagpapabalik ay depende sa konteksto ng negosyo. Ang pagpapabalik (hindi nawawala ang anumang mga pasyente) ay isang priyoridad sa screening ng kanser; Ang katumpakan sa spam filter (hindi pagpapadala ng mahahalagang e-mail sa spam) ay mahalaga. Isa itong desisyon sa negosyo, hindi isang teknikal, at ginawang magkasama ng engineer at ng may-ari.
Mahinang prompt / Malakas na prompt
Mahinang prompt: "Suriin ang pagganap ng aking modelo, katumpakan 0.97."
Napakahusay na prompt: "Mayroon akong modelo ng pagtuklas ng panloloko; ang positibong rate ng klase ay 1.5%. Inuulat ang katumpakan bilang 0.97. Ipaliwanag kung bakit maaaring nakakapanlinlang ang sukatang ito, sabihin sa akin kung aling mga sukatan (katumpakan, recall, PR-AUC) ang dapat kong gugustuhin at kung bakit. Kalkulahin din kung gaano katumpak ang makukuha ng baseline na modelo ng 'tawag sa lahat ng negatibo' sa data na ito, para makita ko ang tunay na idinagdag na halaga."
Pagkakaiba: ang malakas na prompt ay nagbibigay ng ratio ng klase at konteksto ng negosyo; humihingi din ito ng baseline na paghahambing ng modelo — ito ang pinakamahalagang anchor kung ang isang sukatan ay makabuluhan.
Baseline: ang sukatan na walang paghahambing ay walang kabuluhan
Ang isang sukatan ay hindi mabuti o masama nang mag-isa; Ito ay mabuti o masama ayon sa isang pangunahing modelo. Ang pangunahing modelo ay ang pinakasimpleng solusyon na nasa isip: "palaging sabihin sa karamihan ng klase", "ulitin ang halaga noong nakaraang linggo", "hulaan ang ibig sabihin". Kung hindi malinaw na maipapasa ng iyong modelo ang simpleng solusyon na ito, walang kabuluhan ang lahat ng pagiging kumplikado.
Babala: Ang pangungusap na "Ang aking modelo ay 85% tumpak" sa kanyang sarili ay walang sinasabi. Kung ang batayang modelo ay nakakakuha na ng 84%, ang iyong modelo ay halos walang halaga; Kung ang batayang modelo ay makakakuha ng 50%, ang iyong modelo ay perpekto. Palaging magsalita sa mga tuntunin ng pangunahing modelo.
Cross-validation at tiwala
Ang isang split sa pagsasanay/pagsubok ay maaaring dahil sa pagkakataon. Cross-validation: paghahati ng data sa mga k bahagi at pagsubok sa bawat bahagi nang sunud-sunod na nagpapakita kung gaano katatag ang pagganap. Sa 5-fold cross validation makakakuha ka ng limang magkakaibang mga marka; Mahalaga ang kanilang mean at standard deviation. Kung ang average ay 80% ngunit ang deviation ay ±12%, ang iyong modelo ay hindi stable — maaari itong maging ibang-iba sa susunod na batch ng data.
Ito ay kritikal din para sa "dalawang modelong paghahambing". Kung nakakuha ang Model A ng 81% at ang Model B ay nakakuha ng 82%, mas maganda ba talaga si B? Kung ang paglihis ay ±3%, ang pagkakaibang ito ay maaaring ingay. Isaalang-alang kung makabuluhan ang pagkakaiba bago magpasya.
Hyperparameter tuning: may validation, hindi pagsubok
Ang mga hyperparameter (mga setting na manu-manong tinutukoy bago ang pagsasanay—rate ng pagkatuto, lalim ng puno, atbp.) ay nakatakda kasama ang validation set. Ang test set ay ginagamit lamang sa dulo, isang beses. Kung pipili ka ng mga hyperparameter sa pamamagitan ng pagtingin sa set ng pagsubok, ang test set ay makokontaminado at ang performance na iyong iuulat ay magiging optimistiko na hindi ito ang kaso sa katotohanan.
Ang artificial intelligence ay isang mahusay na katulong sa pagdidisenyo ng hyperparameter na espasyo sa paghahanap at pagsulat ng search code (paghahanap ng grid, random na paghahanap, Bayesian optimization). Ngunit magpapasya ka pa rin "aling sukatan ang aming i-optimize?"
tatlong mini case
Kaso 1 - Katumpakan na bitag. Ipinagmamalaki ng isang medikal na koponan ang isang modelo na nakakita ng isang bihirang sakit: 98% katumpakan. Noong ginawa ang pangunahing paghahambing ng modelo, lumitaw ang katotohanan: dahil ang rate ng sakit ay 2%, ang modelo na nagsasabing "tawagan ang lahat ng malusog" ay nakatanggap din ng 98%. Ang pag-recall ng modelo ay 11% lamang - nawawala ang karamihan sa mga pasyente. Kapag ang sukatan ay na-convert sa PR-AUC, ang aktwal na pagganap ay sinusukat at ang modelo ay muling idinisenyo.
Kaso 2 - Napagkakamalang ingay para sa pag-unlad. Ang isang koponan ay gumugol ng mga buwan sa pagpapahusay ng modelo mula 86.2% hanggang 86.9%. Ipinakita ng cross-validation na ang bias ay ±1.4% — kaya ang 0.7 point na “improvement” ay statistical noise. Ang koponan ay nasayang ng tatlong linggo sa hindi tunay na kita. Lesson: huwag magdeklara ng tagumpay nang hindi na-verify na mas malaki ang improvement kaysa deviation.
Kaso 3 - Kontaminasyon ng set ng pagsubok. Ang isang inhinyero ay paulit-ulit na tumingin sa set ng pagsubok upang piliin ang pinakamahusay na mga hyperparameter. Ang 91% na iniulat nito ay bumaba sa 83% sa produksyon. Bakit: hindi niya alam na napili niya ang modelo nang naaayon sa pamamagitan ng pagtingin sa set ng pagsubok nang paulit-ulit (overlearning sa set ng pagsubok). Nag-overlap ang naiulat at aktwal na pagganap kapag ginamit ang isang hiwalay na hanay ng pagpapatunay.
Mga nakopyang template
Tulungan akong pumili ng tamang sukatan para sa problema sa pag-uuri na ito. Problema: [ano ang hinulaang] Pamamahagi ng klase: [positibong rate
Suriin ang paghahambing ng sumusunod na dalawang modelo.Model A cross-validation: [listahan ng mga score]Model B cross-validation: [listahan ng mga score]Kalkulahin ang mean at standard deviation. Ang pagkakaiba ba ay makabuluhan sa istatistika o ito ba ay ingay lamang sa loob ng paglihis? Alin ang irerekomenda mo na pipiliin ko at bakit?
Suriin ang training code na ito para sa mga sumusunod:1) Napili ba ang mga hyperparameter na may test set o validation set?2) Ang maagang paghinto ba ay sinusubaybayan gamit ang tamang hanay?3) Mayroon bang anumang mga senyales ng overlearning (training/validation loss difference)? Code: [code]
Alin sa MAE, RMSE, at MAPE ang dapat kong iulat para sa problemang ito sa regression?Scale ng target na variable: [range]Malalaki bang error ang disproportionately bad (RMSE), o pantay-pantay ba silang lahat (MAE)?May mga value ba na malapit sa zero (pino-distort ba nila ang MAPE)?Magmungkahi nang may maikling katwiran.
Talahanayan ng pagpili ng sukatan
Uri ng problema
Angkop na sukatan
Para iwasan
Bakit
Hindi balanseng pag-uuri
PR-AUC, F1, recall
Katumpakan
Pinapalaki ng karamihan ng klase ang sukatan
Balanseng pag-uuri
Katumpakan, ROC-AUC
—
Maaasahan sa balanseng data
Regression (makabuluhang outlier)
RMSE
MAPE (kung zero)
Pinarurusahan ang malalaking pagkakamali
Regression (pantay na timbang)
MAE
—
Madaling i-interpret
Pagraranggo/rekomendasyon
NDCG, Recall@K
Katumpakan
Mahalaga ang order
Mga karaniwang pagkakamali
- Paggamit ng katumpakan sa hindi balanseng data. Ang pinakakaraniwang error sa sukatan.
- Hindi gumagawa ng mga batayang paghahambing ng modelo. Ginagawa nitong mawalan ng kahulugan ang sukatan.
- Pagtingin sa set ng pagsubok para sa mga hyperparameter. Optimistiko, hindi makatotohanang resulta.
- Umaasa sa iisang compartment. Kung walang cross-validation hindi mo makikita ang bias.
- Napagkakamalang ingay para sa pag-unlad. Ang mga maliliit na "pagpapabuti" mula sa paglihis ay kadalasang swerte.
- Hindi pinapansin ang konteksto ng negosyo. Ang katumpakan/recall na balanse ay isang desisyon sa negosyo.
Sa buod
Ang tunay na kasanayan sa pagsasanay ng modelo ay hindi upang makagawa ng isang mataas na numero, ngunit upang malaman kung ano ang ibig sabihin ng numerong iyon. Tinutukoy ng problema at konteksto ng negosyo ang tamang sukatan; bigyang-kahulugan ang bawat sukatan ayon sa isang baseline na modelo; sukatin ang bias na may cross-validation at huwag ipagkamali ang ingay para sa pag-unlad; Gamitin lamang ang set ng pagsubok sa dulo, isang beses. Ang AI ay ang iyong kasosyo sa disenyo ng eksperimento, ngunit ang desisyon ng "sapat na mabuti" ay nasa iyo at sa iyo.
Gawain ng aplikasyon
Para sa isang modelo ng pag-uuri: (1) isulat ang distribusyon ng klase, (2) bumuo ng angkop na base model at sukatin ang marka nito, (3) suriin ang iyong modelo gamit ang 5-fold cross validation at iulat ang mean at standard deviation, (4) kalkulahin ang sukatan na naaangkop sa problema (hal. PR-AUC) sa halip na katumpakan. Isulat kung natalo ng iyong modelo ang baseline na modelo sa pamamagitan ng malaking margin nang walang bias.
checklist
- [ ] Pinili ko ang sukatan batay sa uri ng problema at konteksto ng negosyo.
- [ ] Nagtayo ako ng base model at inihambing ito.
- [ ] Iniulat ko ang mean at deviation na may cross-validation.
- [ ] Kinumpirma ko na ang improvement ay mas malaki kaysa sa deviation.
- [ ] Pinili ko ang mga hyperparameter na may set ng pagpapatunay.
- [ ] Isang beses ko lang ginamit ang test set, sa pinakadulo.