Unit 3 / 11

Latihan dan Penilaian Model: Metrik Tepat, Penandaarasan Jujur

Keuntungan:

  • Keupayaan untuk memilih metrik yang bersesuaian dengan jenis masalah dan konteks perniagaan (PR-AUC/panggil semula dalam data tidak seimbang, MAE/RMSE dalam regresi) dan mengenali pembelajaran atas/sedang
  • Keupayaan untuk mentafsir setiap metrik terhadap garis dasar dan mengukur sisihan dan mengasingkan hingar daripada kemajuan dengan pengesahan silang
  • Keupayaan untuk melaporkan keputusan tidak optimistik dengan menala hiperparameter dengan set pengesahan dan menggunakan set ujian hanya pada penghujungnya

Latihan model (latihan: proses pembelajaran corak daripada data) ialah langkah kejuruteraan ML yang paling ketara tetapi paling mengelirukan. Ia muncul kerana ia menghasilkan nombor yang memuaskan seperti "ketepatan 95%". Mengelirukan kerana nombor itu selalunya jawapan yang betul kepada soalan yang salah. Dalam unit ini, pendidikan dan penilaian dibincangkan dengan disiplin kejuruteraan; Kami menggunakan kecerdasan buatan sebagai rakan kongsi dalam reka bentuk eksperimen dan mendasarkan keputusan pada pengukuran.

Logik kitaran latihan

Model mempelajari corak dalam data dengan meminimumkan fungsi kehilangan: fungsi yang mengukur ralat model secara berangka. Algoritma pengoptimuman (cth. keturunan kecerunan) mengurangkan kerugian dengan melaraskan parameter langkah demi langkah. Matlamatnya bukan untuk menghafal data latihan, tetapi untuk menggeneralisasikannya kepada data yang tidak pernah berlaku sebelum ini.

Dua bahaya utama:

  • Overfitting: Model menghafal data latihan dan gagal pada data baharu. Kejayaan latihan adalah tinggi, kejayaan pengesahan adalah rendah.
  • Underfitting: Model tidak dapat menangkap corak; Kedua-dua latihan dan kejayaan pengesahan adalah rendah.

Mencari keseimbangan adalah seni pendidikan. Set pengesahan ada untuk memantau baki ini: jika kejayaan pengesahan mula berkurangan manakala kejayaan latihan meningkat, pembelajaran berlebihan telah bermula.

Petua: Rencanakan kehilangan latihan dan pengesahan bersama pada setiap langkah. Titik di mana kedua-dua lengkung mula menyimpang adalah di mana pembelajaran berlebihan bermula dan merupakan masa yang tepat untuk "berhenti awal".

Pemilihan metrik: keputusan paling kritikal

Metrik yang salah menjadikan model yang baik kelihatan buruk dan model yang buruk kelihatan baik. Masalah menentukan metrik:

  • Pengelasan tidak seimbang (satu kelas sangat jarang berlaku, mis. penipuan): Ketepatan mengelirukan. Model yang mengatakan "panggil semuanya biasa" akan mendapat ketepatan 99% tetapi tidak akan menangkap satu penipuan. Sebaliknya, ketepatan (berapa banyak yang saya tangkap sebenarnya positif), ingat (berapa banyak yang saya tangkap adalah positif benar) dan baki F1 atau PR-AUC mereka digunakan.
  • Pengelasan seimbang: Ketepatan dan ROC-AUC mungkin sesuai.
  • Regresi (anggaran nombor): MAE (min ralat mutlak), RMSE (menghukum ralat besar), MAPE (ralat peratusan).
  • Kedudukan/syor: NDCG, MRR, Recall@K.

Sama ada ketepatan atau ingatan penting bergantung pada konteks perniagaan. Ingat (tidak kehilangan mana-mana pesakit) adalah keutamaan dalam pemeriksaan kanser; Ketepatan dalam penapis spam (tidak menghantar e-mel penting kepada spam) adalah penting. Ini adalah keputusan perniagaan, bukan teknikal, dan dibuat bersama oleh jurutera dan pemilik.

Gesaan lemah / Gesaan kuat

Gesaan lemah: "Nilai prestasi model saya, ketepatan 0.97."

Gesaan berkuasa: "Saya mempunyai model pengesanan penipuan; kadar kelas positif ialah 1.5%. Ketepatan dilaporkan sebagai 0.97. Terangkan sebab metrik ini mungkin mengelirukan, beritahu saya metrik (ketepatan, ingat semula, PR-AUC) yang saya patut pilih dan sebabnya. Juga hitung sejauh mana model garis dasar 'panggil segala-galanya negatif' akan diperoleh pada data ini, supaya saya dapat melihat nilai tambah sebenar."

Perbezaan: gesaan berkuasa memberikan nisbah kelas dan konteks perniagaan; ia juga meminta perbandingan model garis dasar — ​​ini adalah sauh yang paling penting untuk sama ada sesuatu metrik itu bermakna.

Garis asas: metrik tanpa perbandingan tidak bermakna

Metrik tidak baik atau buruk dengan sendirinya; Ia baik atau buruk mengikut model asas. Model asas ialah penyelesaian paling mudah yang terlintas di fikiran: "sentiasa beritahu kelas majoriti", "ulang nilai minggu lepas", "teka min". Jika model anda tidak dapat melepasi penyelesaian mudah ini dengan jelas, semua kerumitan adalah percuma.

Awas: Ayat "Model saya 85% tepat" dengan sendirinya tidak mengatakan apa-apa. Jika model asas sudah mendapat 84%, model anda hampir tidak bernilai; Jika model asas mendapat 50%, model anda adalah sempurna. Sentiasa bercakap dari segi model asas.

Pengesahan silang dan kepercayaan

Satu perpecahan latihan/ujian mungkin disebabkan kebetulan. Pengesahan silang: membahagikan data kepada k bahagian dan menguji setiap bahagian secara berurutan menunjukkan betapa stabil prestasinya. Dalam pengesahan silang 5 kali ganda anda mendapat lima markah berbeza; Min dan sisihan piawai mereka adalah penting. Jika purata ialah 80% tetapi sisihan ialah ±12%, model anda tidak stabil — ia mungkin berkelakuan sangat berbeza dalam kumpulan data seterusnya.

Ini juga penting untuk "perbandingan dua model". Jika Model A mendapat 81% dan Model B mendapat 82%, adakah B benar-benar lebih baik? Jika sisihan ialah ±3%, perbezaan ini mungkin bunyi. Pertimbangkan sama ada perbezaan itu ketara sebelum membuat keputusan.

Penalaan hiperparameter: dengan pengesahan, bukan ujian

Hiperparameter (tetapan ditentukan secara manual sebelum latihan—kadar pembelajaran, kedalaman pokok, dll.) ditetapkan dengan set pengesahan. Set ujian digunakan hanya pada akhir, sekali. Jika anda memilih hiperparameter dengan melihat set ujian, set ujian akan tercemar dan prestasi yang anda laporkan adalah optimistik yang tidak berlaku dalam realiti.

Kecerdasan buatan ialah pembantu yang baik dalam mereka bentuk ruang carian hiperparameter dan menulis kod carian (carian grid, carian rawak, pengoptimuman Bayesian). Tetapi anda masih memutuskan "metrik manakah yang akan kami optimumkan?"

tiga kes mini

Kes 1 - Perangkap ketepatan. Pasukan perubatan berbangga dengan model yang mengesan penyakit jarang berlaku: 98% ketepatan. Apabila perbandingan model asas dibuat, kebenaran muncul: memandangkan kadar penyakit adalah 2%, model yang mengatakan "panggil semua orang sihat" juga menerima 98%. Penarikan semula model itu hanya 11% — hilang kebanyakan pesakit. Setelah metrik ditukar kepada PR-AUC, prestasi sebenar diukur dan model itu direka bentuk semula.

Kes 2 - Tersalah bunyi untuk kemajuan. Satu pasukan menghabiskan beberapa bulan untuk menambah baik model daripada 86.2% kepada 86.9%. Pengesahan silang menunjukkan bahawa berat sebelah ialah ±1.4% — jadi "peningkatan" 0.7 mata ialah bunyi statistik. Pasukan itu telah membazirkan tiga minggu pada pendapatan tidak benar. Pengajaran: jangan mengisytiharkan kemenangan tanpa mengesahkan bahawa peningkatan lebih besar daripada sisihan.

Kes 3 - Pencemaran set ujian. Seorang jurutera berulang kali melihat set ujian untuk memilih hiperparameter terbaik. 91% yang dilaporkan turun kepada 83% dalam pengeluaran. Sebab: dia secara tidak sedar telah memilih model dengan sewajarnya dengan melihat set ujian berulang kali (pembelajaran berlebihan pada set ujian). Prestasi yang dilaporkan dan sebenar bertindih apabila set pengesahan berasingan digunakan.

Templat yang boleh disalin

Bantu saya memilih metrik yang betul untuk masalah pengelasan ini. Masalah: [apa yang diramalkan] Taburan kelas: [kadar positif

Nilaikan perbandingan dua model berikut. Pengesahan silang Model A: [senarai skor]Pengesahan silang model B: [senarai markah]Kira min dan sisihan piawai. Adakah perbezaan ketara secara statistik atau hanya bunyi dalam sisihan? Mana satu yang anda cadangkan saya pilih dan mengapa?

Semak kod latihan ini untuk perkara berikut:1) Adakah hiperparameter dipilih dengan set ujian atau set pengesahan?2) Adakah pemberhentian awal dipantau dengan set yang betul?3) Adakah terdapat sebarang tanda pembelajaran berlebihan (perbezaan kehilangan latihan/pengesahan)?Kod: [kod]

Antara MAE, RMSE dan MAPE yang manakah harus saya laporkan untuk masalah regresi ini? Skala pembolehubah sasaran: [julat]Adakah ralat besar tidak seimbang (RMSE) atau adakah semuanya sama (MAE)?Adakah terdapat nilai yang hampir kepada sifar (adakah ia memesongkan MAPE)? Cadangkan dengan justifikasi ringkas.

Jadual pemilihan metrik

Jenis masalah

Metrik yang sesuai

Untuk dielakkan

kenapa

Pengelasan tidak seimbang

PR-AUC, F1, ingat semula

Ketepatan

Kelas majoriti mengembang metrik

Pengelasan seimbang

Ketepatan, ROC-AUC

Boleh dipercayai dalam data seimbang

Regresi (outlier yang ketara)

RMSE

MAPE (jika sifar)

Menghukum kesilapan besar

Regresi (berat sama)

MAE

Mudah ditafsir

Kedudukan/cadangan

NDCG, Recall@K

Ketepatan

Pesanan adalah penting

Kesilapan biasa

  • Menggunakan ketepatan pada data tidak seimbang. Ralat metrik yang paling biasa.
  • Tidak membuat perbandingan model asas. Ia menjadikan metrik kehilangan maknanya.
  • Melihat set ujian untuk hiperparameter. Optimis, hasil yang tidak realistik.
  • Bergantung pada satu petak. Tanpa pengesahan silang anda tidak akan melihat berat sebelah.
  • Tersalah bunyi untuk kemajuan. "Peningkatan" kecil daripada penyelewengan kebanyakannya adalah nasib.
  • Mengabaikan konteks perniagaan. Baki ketepatan/paling balik adalah keputusan perniagaan.

Secara ringkasnya

Kemahiran sebenar dalam latihan model bukanlah untuk menghasilkan nombor yang tinggi, tetapi untuk mengetahui maksud nombor itu. Masalah dan konteks perniagaan menentukan metrik yang betul; mentafsir setiap metrik mengikut model garis dasar; ukur bias dengan pengesahan silang dan jangan silap bunyi sebagai kemajuan; Gunakan set ujian hanya pada akhir, sekali. AI ialah rakan kongsi anda dalam reka bentuk percubaan, tetapi keputusan "cukup baik" terpulang kepada anda dan anda.

Tugasan permohonan

Untuk model klasifikasi: (1) tulis taburan kelas, (2) bina model asas yang sesuai dan ukur skornya, (3) nilai model anda dengan pengesahan silang 5 kali ganda dan laporkan min dan sisihan piawai, (4) hitung metrik yang sesuai dengan masalah (cth. PR-AUC) dan bukannya ketepatan. Tulis sama ada model anda mengalahkan model garis dasar dengan margin yang besar tanpa berat sebelah.

senarai semak

  • [ ] Saya memilih metrik berdasarkan jenis masalah dan konteks perniagaan.
  • [ ] Saya membina model asas dan membandingkannya.
  • [ ] Saya melaporkan min dan sisihan dengan pengesahan silang.
  • [ ] Saya mengesahkan bahawa peningkatan adalah lebih besar daripada sisihan.
  • [ ] Saya memilih hiperparameter dengan set pengesahan.
  • [ ] Saya hanya menggunakan set ujian sekali sahaja, pada penghujungnya.