Пайдалар:
- Жумуштун максатына жараша классификация жана регрессия көрсөткүчтөрүн (чаташуу матрицасы, тактык/эске алуу/F1, MAE/RMSE/R²) тандоо жана чечмелөө жөндөмү
- Тренинг жана тесттин упайларын салыштыруу аркылуу ашыкча үйрөнүүнү аныктоо жана кайчылаш текшерүү менен ишенимдүү аткарууну алуу
- Ар бир модель аны базалык көрсөткүч менен салыштыруу аркылуу реалдуу бааны кошот же жокпу баалоо мүмкүнчүлүгү
Моделди орнотуу оңой; Ал чындап эле иштеп же жокпу, чынчылдык менен өлчөө кыйын. Бул бөлүмдүн предмети маалымат таануучунун эң маанилүү жөндөмү болуп саналат: моделди туура метрика менен баалоо, ишенимдүү болжолдуу көрсөткүчтөргө жетишүү жана эң тымызын тузакка түшүү: ашыкча үйрөнүү (жаттоо). AI көрсөткүчтөрдү эсептейт, чечмелейт жана салыштырат; бирок сиздин бизнесиңизге кайсы метрика туура келерин жана модель "жетиштүү жакшы" же жокпу, бул адам өзү чечет. Туура эмес метриканы караган команда бир нече ай бою жаман моделди "ийгилик" деп жаңылыштырышы мүмкүн.
Эмне үчүн тактык жетишсиз: башаламандык матрицасы
Классификациялоодо эске алынган биринчи метрика бул тактык (тактык — туура божомолдордун жалпы катышы). Бирок биз 6-бөлүмдө көргөнүбүздөй, тактык тең салмактуу эмес маалыматтар менен адаштыруучу. Жакшыраак башталышы - башаламандык матрицасы — болжолдоолорду төрт кутуга бөлгөн таблица:
- Чыныгы позитивдүү (TP): Биз чындыгында жасалма болгон нерсени жасалма деп атадык. (Жакшы)
- Чыныгы терс (TN): Биз чындап эле таза дедик. (Жакшы)
- Жалган позитив (ФП): Тазаны жасалма деп жаңылыштык. (Жалган сигнал)
- Жалган терс (FN): Биз жасалманы сагындык жана аны таза деп атадык. (Өткөрүлбөй калган коркунуч)
Бул төрт кутучадан эки негизги көрсөткүч алынат. Тактык: "Мен жасалма деп атаганымдын канчасы чындыгында жасалма?" — эгерде жалган сигнализациянын баасы жогору болсо, маанилүү. Сезимталдуулук (англисче эстеп): "Мен канча чыныгы жасалмаларды кармадым?" — коркунучту жоготуу кымбат болгондо маанилүү. Экөө көп учурда бири-бирине карама-каршы келет: босогону түшүрүп, көбүрөөк "жалган" деп айтсаңыз, эстеп калуу күчөйт, бирок тактык төмөндөйт. F1 эсеби бул экөөнүн тең салмактуу орточо (гармоникалык орточо) көрсөткүчү.
Көңүл буруңуз: "Кайсы метрика маанилүү" деген суроого жооп техникалык эмес, бизнес чечими болуп саналат. Рак скринингинде бир учурду (төмөн кайра чакыртып алуу) жок кылуу каргашалуу; Бул спам чыпкасы менен спам (төмөн тактык) үчүн маанилүү электрондук кат жөнөтүү тажатма. Наркы метриканы аныктайт.
Регрессия көрсөткүчтөрү
Эгерде чыгаруу сандар болсо, ар кандай көрсөткүчтөр колдонулат. MAE (Орточо абсолюттук ката): ошол эле бирдикте баалардын иш жүзүндөгү орточо көрсөткүчтөн канчалык четтөөлөрү (мисалы, "биз орто эсеп менен 4200 TL жаңылыштык"). RMSE (Root Mean Squared Error): негизги каталарды катаалыраак жазалайт жана четтөөлөргө сезгич. R² (R-квадрат — детерминация коэффициенти): моделдин максаттуу өзгөрмөлүүлүгүнүн канча бөлүгүн түшүндүрөт (1ге жакын жакшы, 0 орточону алдын ала айткандай жаман, терс андан да жаман).
Эң тымызын тузак: ашыкча үйрөнүү
Ашыкча тууралоо - бул жерде модель машыгуу маалыматтарын жаттап алат, бирок жаңы маалыматтарда иштебей калат - маалымат илиминдеги эң кеңири таралган ката. Симптом айкын көрүнүп турат: модель окуу топтомунда сонун (98%), тесттик топтомдо начар (72%). Модель маалыматтардагы чыныгы үлгүнү эмес, ошол үлгүдөгү ызы-чууну жаттап алган. Мунун тескериси да бар: underfitting — модель машыгууда да, тестирлөөдө да начар, анткени үлгүнү тартуу өтө жөнөкөй.
Ашыкча үйрөнүү менен күрөшүүнүн жолдору: моделди жөнөкөйлөтүү, көбүрөөк маалымат, регуляризация - моделдин өтө татаал болуп кетишинен сактаган математикалык тормоз - жана эң негизгиси, кайчылаш текшерүү.
Кайчылаш текшерүү: бир панелге ишенбеңиз
Жалгыз тренинг/сыноо подряды бактылуу же бактысыз болушу мүмкүн; Бул үлгү жеңил болгондуктан, сиз тест топтому үчүн жогорку балл ала аласыз. Cross-validation (кыскача CV) муну чечет. Эң кеңири таралган түрү - к-кат CV: маалыматтар k бөлүккө бөлүнөт (мисалы, 5); Ар бир турда бир бөлүгү тестирлөө, калганы машыгуу; бул 5 жолу тоголонуп, 5 упай орточо алынат. Ошентип, сиз аткаруу бир бактылуу бөлүү эмес, бир нече бөлүүлөрдүн орточо негизинде экенин көрөсүз. Упайларды бөлүштүрүү да маалыматтуу: абдан туруксуз баллдар (бир кабатта 85%, экинчи кабатта 62%) моделдин туруксуз экенин көрсөтүп турат.
Кадимки к-кат убакыттык катарда колдонулбайт (келечекти агып чыгат); Анын ордуна, сиз "алдыга чынжырлоону" (убакыт сериясын бөлүү) кыласыз: ар дайым өткөн менен машыгуу жана келечекти сынап көрүү.
метрикалык
Көйгөйдүн түрү
Качан маанилүү?
Тактык
Классификация
Эгерде класстар тең салмактуу болсо
Тактык
Классификация
Жалган сигнализация кымбат
Сезимталдуулук (эске алуу)
Классификация
Сагынуу кымбат болсо
F1
Классификация
Эгер баланс керек болсо
MAE
регрессия
Чечмелөөчү ката
RMSE
регрессия
Чоң катачылыктар олуттуу болсо
R²
регрессия
түшүндүрүү күчү
үч мини учурлар
1-жагдай - Жогорку тактыктын иллюзиясы. Бир алдамчылык модели 99,2% так көрсөттү жана команда майрамдады. Башаламандык матрицасын карасак, реалдуу: маалыматтардагы жасалма көрсөткүч 0,8% түздү; модель дээрлик эч кандай жасалмаларды кармаган жок, жөн гана "баары ачык" деп айткан. Чакыруу 6% түздү. Сабак: тактыкка эмес, метрикага караңыз.
2-жагдай – Жашыруун ашыкча үйрөнүү. Бир команда XGBoostту машыгуу топтомун 97% га жеткирип, жогорулатты. Тест топтому 69% болчу, бирок эч ким караган эмес. Модель өндүрүштө кыйрады. Эгерде кайчылаш валидация жасалган болсо, бүктөмдөрдүн ортосундагы чоң айырма (ашыкча үйрөнүү) башынан эле көрүнүп турмак. Сабак: билим берүү баллына эмес, резюмеге жана тесттин упайына ишен.
3-жагдай - Бактылуу бөлүнүү. Бир аналитик 88% алганына сүйүнгөн. Анын кесиптеши 5 эселенген резюме жасаганда, упайлар 88%, 71%, 83%, 64%, 79% болгон — орточо 77%, бирок бул өтө туруксуз. модель туруксуз болгон; Жалгыз купе адаштыруучу болду. Сабак: жеке бункерди эмес, резюмеди жана бөлүштүрүүнү караңыз.
Көчүрүү үчүн төрт шаблон
1) Толук классификациялык отчет:
Мен моделди жана тест топтомун үйрөттүм. Түзүү: башаламандык матрицасы, тактык, кайра чакыруу, F1 (ар бир класс үчүн) жана колдоо эсептери. Мен жыйынтык чыгарып жатам, бирок бул менден көз каранды: кайсы метрика маанилүү экенин айтып берем. Тактык тең салмактуу эмес маалыматтар менен адаштырууга алып келиши мүмкүн экенин эске алыңыз.
2) Ашыкча окууну контролдоо:
Менин моделимдин упайларын ТРЕНИНГ жана ТЕСТ топтомдорунда жанаша басып чыгарыңыз. Алардын ортосундагы айырманы эсептеп, чоң айырмачылык ашыкча үйрөнүүнүн белгиси катары эскертиңиз. Эгерде айырма чоң болсо, регуляризацияны же жөнөкөйлөтүүнү сунуштаңыз.
3) кайчылаш валидация:
5 эселенген кайчылаш текшерүүнү (стратификация, классификация үчүн) аткарыңыз. Ар бир бүктөмдүн эсебин, орточо жана стандарттык четтөөсүн басып чыгарыңыз. Эгерде упайлар өтө туруксуз болсо (жогорку стд), моделдин туруксуз экенин көрсөтүңүз. Трансформацияларды ар бир катмардагы окуу бөлүгүнөн гана үйрөнүү үчүн түтүктөрдү колдонуңуз.
4) Базалык салыштыруу:
Менин моделимдин метрикасын DummyClassifier базалык сызыгы менен катар коюңуз. Модель базалык сызыктан олуттуу түрдө ашып кетеби? Эгер ал өтпөй калса, модель эч кандай реалдуу мааниге ээ эмес экенин ачык айтыңыз.
Алсыз тездик / Күчтүү тездик
Алсыз билдирүү:
Менин моделим жакшыбы?
"Жакшы" аныкталбаган; Кайсы метрика, кайсы босого, кайсы базалык көрсөткүч экени белгисиз. AI бир тактык санын берип, адаштырышы мүмкүн.
Күчтүү билдирүү:
Сиздин ролуңуз: баалоо боюнча жардамчы. Классификация, балансталбаган маалыматтар (12% оң). Артыкчылык: кайра чакырып алуу (позитивдүү жактарын колдон чыгарбоо). Тапшырма: (1) башаламандык матрицасы, (2) тактык/эске алуу/F1, (3) 5-кабаттуу CV орточо жана std, (4) DummyClassifier базалык салыштыруу. Тактыкка эмес, кайра чакырып алуу жана негизги айырмачылыкка көңүл буруңуз. Комментарий, бирок акыркы чечимди мен чыгарам.
Бул жерде метрикалык артыкчылык, резюме жана базалык абал айкын.
Жалпы каталар
- Теңдештирилбеген маалыматтардын тактыгына ишенүү. 99% тактык азчылыктын классын такыр кармай албайт; Башаламандык матрицасын караңыз.
- Жөн гана билимиңизди карап. Жогорку билим, төмөн тест упай ашыкча окуу; Ар дайым эки упайды салыштырыңыз.
- Бир отсекке таянуу. Lucky бөлүштүрүү адашуу болуп саналат; Кайчылаш текшерүү менен орточо жана бөлүштүрүүнү караңыз.
- Негизги көрсөткүч менен салыштырып болбойт. Моделдин келесоо прогнозду жеңеби же жокпу билбей туруп "жакшы" деп айта албайсың.
- Убакыт сериясында кадимки k-бүктөмдү колдонуу. Бул келечекти ачат; убакыт сериясын бөлүү талап кылынат.
Кеңеш: Ар бир моделдин жанына үч санды жазыңыз: машыгуу упай, кайчылаш текшерүүнүн орточо эсеби жана базалык упай. Бул үчилтик бир караганда ашыкча үйрөнүүнү (тренинг >> CV) жана баалоону (CV ≈ базалык) көрсөтөт.
Кыскача айтканда
Моделди түзүү оңой, бирок аны чынчылдык менен баалоо кыйын. Классификацияда башаламандык матрицасы, тактык жана кайра чакырып алуу тактыкка караганда алда канча маалыматтуу; Жумуштун баасы кайсынысы маанилүү экенин аныктайт. MAE, RMSE жана R² регрессияда колдонулат. Эң тымызын тузак бул ашыкча үйрөнүү: ар дайым машыгуу менен тесттин упайларын салыштырыңыз. Кайчылаш текшерүүнүн ортосуна жана бөлүштүрүлүшүнө таянуу, бир бөлүү эмес; Баарын базалык көрсөткүч менен салыштырыңыз. AI булардын баарын эсептейт, бирок кайсы метриканы колдонууну адам өзү чечет.
Колдонмо тапшырмасы
Классификация модели үчүн башаламандык матрицасын, тактыкты, кайра чакырууну жана F1ди чыгарыңыз; Андан кийин 5 жолу кайчылаш текшерүүнү жүргүзүп, бүктөмөлөр боюнча упайлардын бөлүштүрүлүшүн караңыз. Акырында, машыгуу упайын, резюмедеги орточо баллды жана базалык упайды катарга жазыңыз. Сиздин моделиңиз ашыкча үйрөнүп жатабы жана базалык көрсөткүчтөн өтүп жатабы же жокпу, бир сүйлөм менен комментарий бериңиз.
текшерүү тизмеси
- [ ] Мен тактыктын ордуна жумуштун чыныгы метрикасын (тактык/эске алуу/F1 ж.б.) карадымбы?
- [ ] Мен баш аламандык матрицасын карап көрдүмбү?
- [ ] Мен машыгуу менен тесттин упайларын салыштырып, ашыкча үйрөнүүнү текшердимби?
- [ ] Мен кайчылаш текшерүү менен орточо жана бөлүштүрүүнү карадымбы?
- [ ] Мен моделди базалык көрсөткүчкө салыштырдымбы?