Keuntungan:
- Keupayaan untuk memilih dan mentafsir metrik klasifikasi dan regresi (matriks kekeliruan, ketepatan/ingat/F1, MAE/RMSE/R²) mengikut tujuan kerja
- Keupayaan untuk mengesan pembelajaran berlebihan dengan membandingkan markah latihan dan ujian dan memperoleh prestasi yang boleh dipercayai dengan pengesahan silang
- Keupayaan untuk menilai sama ada setiap model menambah nilai sebenar dengan membandingkannya dengan garis dasar
Mudah untuk menyediakan model; Sukar untuk mengukur secara jujur sama ada ia benar-benar berkesan. Subjek unit ini ialah kemahiran paling kritikal seorang saintis data: menilai model dengan metrik yang betul, mencapai prestasi ramalan yang boleh dipercayai dan menangkap perangkap yang paling berbahaya: pembelajaran berlebihan (menghafal). AI mengira, mentafsir dan membandingkan metrik; tetapi terpulang kepada manusia untuk menentukan metrik yang sesuai untuk perniagaan anda dan sama ada model itu "cukup baik". Pasukan yang melihat metrik yang salah boleh menganggap model buruk selama berbulan-bulan sebagai "kejayaan".
Mengapa ketepatan tidak mencukupi: matriks kekeliruan
Metrik pertama yang terlintas di fikiran dalam pengelasan ialah ketepatan (ketepatan — jumlah nisbah ramalan yang betul). Tetapi seperti yang kita lihat dalam Unit 6, ketepatan mengelirukan dengan data tidak seimbang. Permulaan yang lebih baik ialah matriks kekeliruan — jadual yang membahagikan ramalan kepada empat tong sampah:
- Benar positif (TP): Kami memanggil palsu apa yang benar-benar palsu. (Baik)
- Negatif benar (TN): Kami berkata sangat bersih. (Baik)
- Positif palsu (FP): Kami tersilap mengatakan bahawa yang bersih itu palsu. (Penggera palsu)
- Negatif palsu (FN): Kami terlepas yang palsu dan menyebutnya bersih. (Ancaman terlepas)
Dua metrik utama diperoleh daripada empat kotak ini. Ketepatan: "Berapa banyak yang saya panggil palsu sebenarnya palsu?" — penting jika kos penggera palsu tinggi. Sensitiviti (ingat dalam bahasa Inggeris): "Berapa banyak palsu sebenar yang saya tangkap?" — penting apabila terlepas ancaman adalah mahal. Kedua-duanya sering bertentangan antara satu sama lain: jika anda menurunkan ambang dan menyebut "palsu" lebih banyak, ingatan meningkat tetapi ketepatan berkurangan. Skor F1 ialah purata seimbang (min harmonik) bagi kedua-dua ini.
Perhatian: Jawapan kepada soalan "Metrik yang manakah penting" ialah keputusan perniagaan, bukan teknikal. Kehilangan kes (ingat rendah) dalam pemeriksaan kanser adalah malapetaka; Adalah menjengkelkan untuk menghantar e-mel penting kepada spam (kepersisan rendah) dalam penapis spam. Kos menentukan metrik.
Metrik regresi
Jika output ialah nombor, metrik berbeza digunakan. MAE (Min Ralat Mutlak): berapa banyak anggaran menyimpang daripada purata sebenar, dalam unit yang sama (cth. "kami silap sebanyak 4,200 TL secara purata"). RMSE (Root Mean Squared Error): menghukum ralat utama dengan lebih teruk dan sensitif kepada outlier. R² (R-kuadrat — pekali penentuan): berapa banyak kebolehubahan dalam sasaran yang dijelaskan oleh model (hampir 1 adalah baik, 0 adalah seburuk meramalkan min, negatif adalah lebih teruk).
Perangkap yang paling berbahaya: pembelajaran berlebihan
Overfitting — di mana model menghafal data latihan tetapi gagal pada data baharu — ialah kesilapan paling biasa dalam sains data. Gejalanya jelas: modelnya bagus pada set latihan (98%), buruk pada set ujian (72%). Model ini telah menghafal hingar sampel tertentu itu, bukan corak sebenar dalam data. Terdapat juga sebaliknya: kurang sesuai—modelnya buruk dalam kedua-dua latihan dan ujian kerana terlalu mudah untuk menangkap corak.
Cara untuk memerangi pembelajaran berlebihan: memudahkan model, lebih banyak data, penyelarasan — brek matematik yang menghalang model daripada menjadi terlalu rumit — dan yang paling penting, pengesahan silang.
Pengesahan silang: jangan percaya anak tetingkap tunggal
Satu pod latihan/ujian mungkin bernasib baik atau tidak bernasib baik; Anda boleh mendapat markah tinggi untuk set ujian hanya kerana sampel itu mudah. Pengesahan silang (pendek kata CV) menyelesaikan masalah ini. Bentuk yang paling biasa ialah k-lipat CV: data dibahagikan kepada k bahagian (cth. 5); Dalam setiap pusingan, satu bahagian sedang menguji dan selebihnya adalah latihan; ini bergolek 5 kali dan 5 markah dipuratakan. Jadi anda akan melihat bahawa prestasi adalah berdasarkan purata berbilang pemisahan, bukan satu pemisahan bertuah. Taburan markah juga bermaklumat: skor yang sangat tidak menentu (85% di satu tingkat, 62% di tingkat yang lain) menunjukkan bahawa model itu tidak stabil.
K-lipat biasa tidak digunakan dalam siri masa (membocorkan masa depan); Sebaliknya, anda melakukan "perantaian ke hadapan" (pemisahan siri masa): sentiasa berlatih dengan masa lalu dan menguji masa depan.
metrik
Jenis masalah
Bilakah ia penting?
Ketepatan
Pengelasan
Jika kelas seimbang
Ketepatan
Pengelasan
Penggera palsu adalah mahal
Sensitiviti (ingat semula)
Pengelasan
Kalau mahal nak terlepas
F1
Pengelasan
Sekiranya keseimbangan diperlukan
MAE
regresi
Kesilapan yang boleh ditafsir
RMSE
regresi
Jika kesilapan besar adalah kritikal
R²
regresi
kuasa penerangan
tiga kes mini
Kes 1 — Ilusi ketepatan yang tinggi. Satu model penipuan menunjukkan ketepatan 99.2% dan pasukan meraikannya. Melihat pada matriks kekeliruan, yang sebenar: kadar palsu dalam data ialah 0.8%; model itu menangkap hampir tiada palsu, hanya berkata "semua jelas". Ingat ialah 6%. Pengajaran: lihat pada metrik, bukan ketepatan.
Kes 2 — Pembelajaran berlebihan terpendam. Satu pasukan menghantar dan meningkatkan XGBoost kepada 97% pada set latihan. Set ujian adalah 69%, tetapi tiada siapa yang melihat. Model itu runtuh dalam pengeluaran. Jika pengesahan silang telah dilakukan, perbezaan besar antara lipatan (pembelajaran berlebihan) akan dapat dilihat dari awal. Pelajaran: percaya CV dan skor ujian, bukan skor pendidikan.
Kes 3 — Perpecahan bertuah. Seorang penganalisis gembira mendapat 88% dalam satu perpecahan. Apabila rakan sekerjanya membuat CV 5 kali ganda, markahnya ialah 88%, 71%, 83%, 64%, 79% — purata ialah 77%, tetapi ia sangat tidak menentu. Model itu tidak stabil; Petak tunggal mengelirukan. Pengajaran: lihat pada purata CV dan pengedaran, bukan sampah individu.
Empat templat yang boleh disalin
1) Laporan klasifikasi penuh:
Saya mempunyai model terlatih dan set ujian. Hasilkan: matriks kekeliruan, ketepatan, ingatan semula, F1 (untuk setiap kelas) dan kiraan sokongan. Saya membuat kesimpulan, tetapi terpulang kepada saya: Saya akan memberitahu anda metrik mana yang penting. Ambil perhatian bahawa ketepatan boleh mengelirukan dengan data yang tidak seimbang.
2) Kawalan pembelajaran berlebihan:
Cetak markah model saya dalam kedua-dua set LATIHAN dan UJIAN sebelah menyebelah. Kira perbezaan antara mereka dan beri amaran kerana perbezaan yang besar adalah tanda pembelajaran berlebihan. Jika perbezaannya besar, cadangkan penyelarasan atau penyederhanaan.
3) Pengesahan silang:
Lakukan pengesahan silang 5 kali ganda (untuk berstrata, pengelasan). Cetak skor, min dan sisihan piawai bagi setiap lipatan. Jika skor sangat tidak menentu (std tinggi), tunjukkan bahawa model tidak stabil. Gunakan saluran paip supaya transformasi hanya dipelajari daripada bahagian latihan pada setiap lapisan.
4) Perbandingan garis dasar:
Letakkan metrik model saya bersebelahan dengan garis dasar DummyClassifier. Adakah model itu mengatasi garis dasar dengan ketara? Jika ia tidak lulus, jelaskan bahawa model itu tidak menambah sebarang nilai sebenar.
Gesaan lemah / Gesaan kuat
Gesaan yang lemah:
Adakah model saya bagus?
"Baik" tidak ditentukan; Tidak jelas metrik mana, ambang mana, garis dasar mana. AI boleh memberikan satu nombor ketepatan dan mengelirukan.
Gesaan kuat:
Peranan anda: pembantu pentaksiran. Klasifikasi, data tidak seimbang (12% positif). Keutamaan: mengingat kembali (tidak kehilangan yang positif). Tugasan: (1) matriks kekeliruan,(2) ketepatan/ingat/F1, (3) min CV berstrata 5 kali ganda dan std,(4) Perbandingan garis dasar DummyClassifier. Fokus pada ingatan semula dan perbezaan garis dasar, bukan ketepatan. Komen, tetapi saya membuat keputusan muktamad.
Di sini, keutamaan metrik, CV dan keadaan garis dasar adalah jelas.
Kesilapan biasa
- Mempercayai ketepatan dalam data tidak seimbang. Ketepatan 99% mungkin tidak menguasai kelas minoriti sama sekali; Lihat matriks kekeliruan.
- Hanya melihat markah pendidikan anda. Pendidikan tinggi, markah ujian rendah adalah pembelajaran berlebihan; Sentiasa bandingkan dua markah.
- Bergantung pada satu petak. Pembahagian bertuah mengelirukan; Lihat min dan taburan dengan pengesahan silang.
- Tidak membandingkan dengan garis dasar. Anda tidak boleh mengatakan "baik" tanpa mengetahui sama ada model itu mengalahkan peramal yang bodoh.
- Menggunakan lipatan k biasa pada siri masa. Ia membocorkan masa depan; Pembahagian siri masa diperlukan.
Petua: Tulis tiga nombor di sebelah setiap model: skor latihan, purata pengesahan silang dan skor garis dasar. Trio ini mendedahkan sekilas pandang pembelajaran berlebihan (latihan >> CV) dan penilaian rendah (CV ≈ garis dasar).
Secara ringkasnya
Membina model adalah mudah, tetapi menilai secara jujur adalah sukar. Dalam pengelasan, matriks kekeliruan, ketepatan dan ingatan adalah lebih bermaklumat daripada ketepatan; Kos kerja menentukan mana satu yang penting. MAE, RMSE dan R² digunakan dalam regresi. Perangkap yang paling berbahaya ialah pembelajaran berlebihan: sentiasa bandingkan latihan dan markah ujian. Bergantung pada min dan pengedaran pengesahan silang, bukan satu perpecahan; Bandingkan semuanya dengan garis dasar. AI mengira semua ini, tetapi terpulang kepada manusia untuk menentukan metrik yang hendak digunakan.
Tugasan permohonan
Ekstrak matriks kekeliruan, ketepatan, ingat semula dan F1 untuk model pengelasan; Kemudian lakukan pengesahan silang 5 kali ganda dan lihat taburan skor merentas lipatan. Akhir sekali, tuliskan skor latihan, purata CV, dan skor garis dasar bersebelahan. Komen dalam satu ayat sama ada model anda terlalu belajar dan melepasi garis dasar.
senarai semak
- [ ] Adakah saya telah melihat metrik sebenar kerja (ketepatan/panggil semula/F1 dll.) dan bukannya ketepatan?
- [ ] Adakah saya telah memeriksa matriks kekeliruan?
- [ ] Adakah saya telah membandingkan latihan dan markah ujian dan menyemak untuk pembelajaran berlebihan?
- [ ] Adakah saya telah melihat min dan taburan dengan pengesahan silang?
- [ ] Adakah saya telah membandingkan model dengan garis dasar?