Unit 11 / 11

Kebolehulangan dan Projek Hujung-ke-Hujung: Menggabungkan Segala-galanya

Keuntungan:

  • Keupayaan untuk memastikan kebolehulangan dengan empat tiang (penetapan benih, versi data, pembekuan media, pemantauan percubaan) dan menghasilkan hasil yang sama apabila mengulangi larian yang sama
  • Keupayaan untuk menggabungkan semua hentian modul (metrik, data, model, komponen LLM, eval, keadilan, keselamatan, pengedaran, pemantauan) dalam rantaian hujung ke hujung
  • Keupayaan untuk mengesahkan bahawa keputusan kritikal kekal dengan manusia di setiap perhentian dan mendokumenkan projek dengan cara yang boleh diaudit

Kegagalan projek ML yang paling berbahaya bukanlah kemalangan; "Tidak mendapat keputusan yang sama lagi." Jika anda tidak dapat menghasilkan semula skor hari ini bagi model yang anda keluarkan tiga bulan lalu, anda tidak benar-benar mengawal model itu. Dalam unit penutup ini, kami memperdalam kebolehulangan: keupayaan untuk memperoleh hasil yang sama dengan pasti dengan input yang sama dan menggabungkan keseluruhan modul dalam disiplin projek hujung ke hujung.

Mengapa kebolehulangan adalah sukar

Dalam perisian biasa, kod yang sama memberikan output yang sama. Dalam ML terdapat lebih banyak pembolehubah yang menentukan hasil:

  • Rawak: Pengocokan data, permulaan berat, pemisahan data — semuanya bergantung pada rawak.
  • Data: Kod yang sama menghasilkan model yang berbeza dengan versi data yang berbeza.
  • Persekitaran: Versi perpustakaan, perkakasan (CPU/GPU), malah sistem pengendalian boleh mengubah hasilnya.
  • Kes tersembunyi: Hiperparameter yang tidak disimpan, langkah prapemprosesan manual, pilihan yang tidak diperhatikan.

Kebolehulangan bukanlah "senang untuk dimiliki" tetapi keperluan saintifik dan kejuruteraan. Keputusan yang tidak boleh diterbitkan semula ialah tuntutan yang tidak boleh dibuktikan.

Empat tonggak kebolehulangan

1. Betulkan rawak. Tetapkan semua benih rawak di satu tempat: pemisahan data, pemulaan model, shuffling data. Benih tetap adalah asas jaminan "hasil yang sama apabila anda mengulangi larian yang sama".

2. Versi data. Rekod versi data yang digunakan oleh setiap percubaan (versi data dalam unit 2). "Data terkini" adalah kabur; "data versi v3, hash abc123" adalah tepat.

3. Membekukan medium. Sematkan semua kebergantungan pada versi tepatnya (cth. versi tepat seperti numpy==1.26.4 dalam requirements.txt atau imej bekas). "Versi terkini" akan memecahkan segala-galanya satu hari nanti.

4. Jejaki segala-galanya (penjejakan percubaan). Simpan secara automatik untuk setiap percubaan: versi kod (git commit), versi data, semua hiperparameter, metrik dan struktur output. Alat penjejakan percubaan seperti MLflow, Weights & Biase melakukan ini secara sistematik. Tanpa pendaftaran, soalan "tetapan mana yang terbaik" kekal tidak dijawab.

Awas: "Saya akan ingat kemudian" adalah kesilapan yang paling mahal. Dua minggu kemudian anda tidak akan ingat benih mana, data mana, hiperparameter yang anda gunakan. Penjejakan automatik menghapuskan pergantungan pada memori.

Pendekatan yang lemah / Pendekatan yang kuat

Lemah: "Saya dapati model terbaik, ia ada pada buku nota, saya rasa markahnya ialah 89%."

Kuat: "Jalankan #147 dalam alat penjejakan percubaan: git commit a3f9c, versi data v3 (hash abc123), seed 42, semua hiperparameter didaftarkan, uji PR-AUC 0.887. Apabila saya menjalankan perintah yang sama sekali lagi, saya mendapat hasil yang sama sedikit demi sedikit. Model bergantung pada larian ini dalam registri."

Perbezaannya: dalam pendekatan yang kuat hasilnya tidak berdasarkan ingatan, tetapi pada rantai yang tetap dan dipantau. Setiap orang boleh menghasilkan hasil yang sama setiap masa.

Projek hujung ke hujung: gabungan modul

Sekarang mari kita gabungkan keseluruhan modul ke dalam satu aliran projek. Sistem ML sebenar melalui perhentian ini, dan setiap perhentian dibina pada perhentian sebelumnya:

  1. Definisi masalah: Apakah yang kita selesaikan, cara mengukur kejayaan (unit 3: metrik yang betul, konteks perniagaan). Metrik dan ambang adalah jelas dari awal.
  2. Saluran paip data: Pengumpulan, pengesahan, pembersihan, pembahagian bebas kebocoran, versi (unit 2).
  3. Pembangunan model: Latihan, perbandingan garis dasar, pengesahan silang, benih keras (unit 3 + unit ini).
  4. Komponen LLM (jika berkenaan): RAG (unit 4) dan/atau ejen (unit 5); penalaan halus jika perlu (unit 6).
  5. Penilaian: kluster eval dengan kes tepi dan keselamatan, eval berbilang lapisan dalam sistem LLM (unit 8).
  6. Audit keadilan dan etika: Analisis subkumpulan, kad model, kebolehjelasan (unit 10).
  7. Audit keselamatan: Suntikan segera, privasi, rantaian bekalan (unit 9).
  8. Pengedaran: Pembungkusan, pengedaran beransur-ansur, rollback, daftar model (unit 7).
  9. Pemantauan: Pemantauan tiga lapisan, penggera hanyut (unit 8).
  10. Kebolehulangan: Benih, versi data, media dan penjejakan percubaan di seluruh rantaian (unit ini).

Dalam aliran ini, AI ialah penjana pemecut dan pelan tindakan di setiap perhentian; tetapi pemilihan metrik, keputusan data, keutamaan kesaksamaan, ambang penggunaan dan kelulusan pelepasan — keputusan kritikal kekal dengan manusia. Ini adalah intipati modul.

Dokumentasi: masa depan akan terima kasih

Projek ML yang baik mendokumenkan dirinya sendiri. Sekurang-kurangnya, perkara berikut hendaklah ditulis: kriteria masalah dan kejayaan, sumber dan versi data, pemilihan dan justifikasi model, keputusan penilaian (termasuk subkumpulan), had dan risiko yang diketahui, prosedur penempatan dan pengambilan semula, rancangan pemantauan. Dokumen ini adalah kawan baik orang (mungkin anda) yang kembali ke projek selepas enam bulan.

tiga kes mini

Kes 1 - Keputusan hilang. Seorang jurutera melatih model yang hebat, tetapi dia tidak membetulkan benih dan tidak menyimpan versi data. Apabila dia meninggalkan pekerjaan itu, tiada siapa yang boleh menghasilkan semula keputusan itu; model itu menjadi "legenda kotak hitam" dan akhirnya dibina dari awal. Minggu terbuang sia-sia. Pengajaran: hasil yang tidak boleh dihasilkan adalah hasil yang tidak wujud.

Kes 2 - Persekitaran runtuh. Satu pasukan tidak menetapkan kebergantungan. Apabila perpustakaan dikemas kini secara automatik, output model berubah secara senyap dan pengeluaran terganggu. Ia mengambil masa beberapa hari untuk mencari masalah. Apabila kebergantungan dibekukan dan disimpan dalam bekas dengan versi definitif, masalah itu tidak berlaku lagi. Pengajaran: membekukan alam sekitar.

Kes 3 - Kuasa pemantauan. Satu pasukan memantau secara automatik setiap percubaan. Tiga bulan kemudian, semasa audit kawal selia, mereka menjawab soalan "dengan data apa, dengan tetapan apa, prestasi apa yang diperolehi dalam kumpulan mana?" dengan rakaman penuh dalam beberapa minit. Pemeriksaan berjalan lancar. Pengajaran: pemantauan ialah alat pematuhan, bukan hanya kejuruteraan.

Templat yang boleh disalin

Lakukan semakan kebolehulangan untuk projek ML ini.- Adakah semua benih rawak tetap (dipecah, mulakan, kocok)?- Adakah data versi?- Adakah kebergantungan dibekukan kepada versi yang tepat?- Adakah setiap percubaan (komit komit, data, hiperparameter, metrik) dijejaki? Tulis langkah konkrit tentang cara membetulkannya untuk setiap lajur yang hilang. Struktur projek: [penerangan]

Hasilkan rangka pelan untuk projek ML hujung ke hujung ini. Masalah: [penerangan] Tutup hentian berikut dan tandakan di mana keputusan MANUSIA berada di setiap perhentian: masalah/metrik, saluran paip, model, (RAG/ejen/penalaan halus?), eval, keadilan, keselamatan, pengedaran, pemantauan, kebolehulangan. Tulis risiko utama dan langkah pengesahan untuk setiap perhentian.

Hasilkan templat dokumentasi teknikal untuk projek ini. Bahagian: masalah+kriteria kejayaan, data (sumber+versi), pemilihan model+justifikasi, penilaian (termasuk subkumpulan), had+risiko yang diketahui, penempatan+putar balik, pelan pemantauan. Berikan medan yang perlu diisi untuk setiap bahagian sebagai soalan.

Semak persediaan pemantauan percubaan saya: Adakah ia disimpan secara automatik pada setiap larian: git commit, versi data/cincang, semua hiperparameter, semua metrik, persekitaran (versi perpustakaan)? Adakah saya mendapat hasil yang sama apabila saya menjalankan larian yang sama sekali lagi? Persediaan: [penerangan]. Senaraikan kelemahan dan pembetulan.

Jadual lajur kebolehulangan

lajur

Apa yang ditetapkan

Contoh kenderaan

rawak

semua biji

penetapan benih

Data

Versi data/cincang

DVC

persekitaran

Versi perpustakaan

pin keperluan, Docker

Pemantauan

Kod+tetapan+data+metrik

MLflow, W&B

Kesilapan biasa

  • Tidak membetulkan benih. Hasilnya tidak boleh diulang.
  • Tidak menyimpan versi data. "Dengan data apa?" tetap tidak dijawab.
  • Tidak membekukan ketagihan. Kemas kini akan memecahkan segala-galanya secara senyap.
  • Meninggalkan eksperimen dalam ingatan. Dua minggu kemudian tiada apa yang diingati.
  • Serahkan keputusan kritikal kepada kecerdasan buatan. Metrik, keadilan dan keputusan pengedaran harus kekal dengan orang ramai.
  • Menangguhkan dokumentasi. Pasukan masa depan (dan anda) membayar harganya.

Secara ringkasnya

Kebolehulangan ialah tandatangan kejuruteraan ML yang serius: keputusan yang tidak boleh dihasilkan ialah tuntutan yang tidak boleh dibuktikan. Ia didatangkan dengan empat lajur — betulkan rawak, data versi, persekitaran beku, jejak setiap percubaan. Projek hujung ke hujung menggabungkan semua hentian modul ini (metrik, data, model, komponen LLM, eval, keadilan, keselamatan, pengedaran, pemantauan) dalam rantaian yang saling berkaitan; Kecerdasan buatan adalah pemecut di setiap perhentian, tetapi keputusan kritikal kekal dengan manusia. Dokumenkan segala-galanya — untuk pasukan dan audit masa hadapan. Disiplin ini adalah rangka kerja yang mengekalkan semua yang anda pelajari sepanjang modul.

Tugasan permohonan

Semak projek ML terhadap empat tiang kebolehulangan: adakah benih tidak boleh diubah, adakah versi data, adakah persekitaran beku, adakah eksperimen dijejaki? Betulkan mana-mana lajur yang hilang dan buktikan bahawa anda boleh menjalankan larian yang sama dua kali dan mendapat hasil yang sama. Kemudian keluarkan aliran hujung ke hujung projek (10 hentian) pada satu halaman dan tandakan "di mana keputusan manusia berada" di setiap perhentian. Akhir sekali, tulis draf dokumentasi teknikal ringkas.

senarai semak

  • [ ] Semua benih rawak tetap.
  • [ ] Versi data/cincang direkodkan dengan setiap percubaan.
  • [ ] Ketergantungan dibekukan kepada versi kukuh (pin/bekas).
  • [ ] Setiap percubaan dipantau secara automatik (kod+data+tetapan+metrik).
  • [ ] Apabila saya mengulangi larian yang sama, saya mendapat keputusan yang sama.
  • [ ] Saya mengesahkan dan mendokumenkan bahawa keputusan kritikal dalam aliran hujung ke hujung dibuat oleh manusia.

Peperiksaan Modul

1. Sebagai jurutera ML, apakah pendekatan terbaik apabila meletakkan kedudukan kecerdasan buatan dalam aliran kerja?

  • A) AI ialah pemecut dalam perniagaan berisiko rendah; Keputusan kritikal seperti metrik, data dan pengeluaran kekal disahkan dan diserahkan kepada manusia ✔
  • B) Selagi output AI kelihatan baik, tidak ada keperluan untuk pengesahan
  • C) Membiarkan keputusan untuk meletakkan model ke dalam pengeluaran untuk kecerdasan buatan menjimatkan masa.
  • D) Kecerdasan buatan hanya berguna untuk menulis teks, ia tidak ada kaitan dengan data dan kerja model

Penerangan: AI ialah pemecut yang berkuasa untuk tugasan berisiko rendah dan mudah disahkan seperti kod, ringkasan data dan dokumen; Walau bagaimanapun, tanggungjawab untuk keputusan yang mempengaruhi wang, kerahsiaan dan liabiliti undang-undang, seperti pemilihan metrik, data yang dimasukkan ke dalam latihan, dan meletakkan model ke dalam pengeluaran, terletak pada jurutera dan pasukan yang berkelayakan. Setiap output tidak boleh digunakan tanpa pengesahan.

2. Mengapakah pengesahan skema diletakkan pada permulaan saluran paip data?

  • A) Kerana ia secara langsung meningkatkan ketepatan model
  • B) Kerana ia menjadikan versi data tidak diperlukan
  • C) Kerana ia menangkap data yang rosak pada tahap paling awal dan paling murah dan menghalangnya daripada bocor ke langkah seterusnya ✔
  • D) Kerana ia menghapuskan keperluan untuk pelabelan

Penjelasan: Data rasuah lebih awal ditangkap, lebih murah untuk membaikinya. Pengesahan skema menghalang data yang rosak daripada bocor secara senyap ke dalam latihan atau pengeluaran dengan menolak data di luar jenis dan julat yang dijangkakan pada permulaan baris (cth. peralihan harga 100x dengan perubahan unit); Kesilapan yang sama berlaku dalam pengeluaran adalah berkali-kali lebih mahal.

3. Apakah pendekatan yang betul semasa membahagikan data kepada latihan dan ujian dalam masalah yang melibatkan masa (siri masa)?

  • A) Menggunakan pemisahan rawak kerana ia sentiasa kaedah yang paling adil
  • B) Menggunakan belahan temporal: mengelakkan kebocoran dengan berlatih dengan masa lalu dan menguji pada masa hadapan ✔
  • C) Menggunakan semua data sebagai latihan dan ujian
  • D) Menggabungkan data ujian ke dalam parameter penskalaan sebelum latihan

Penjelasan: Pemisahan rawak pada siri masa memberikan model kelebihan 'melihat masa hadapan' yang tidak akan berlaku dalam pengeluaran dan meningkatkan metrik secara buatan (kebocoran sementara). Yang betul ialah pembahagian temporal: berlatih dengan masa lalu, uji pada masa hadapan. Ini mengukur prestasi sebenar yang mengekalkannya dalam pengeluaran.

4. Mengapakah ketepatan mengelirukan dalam model pengesanan penipuan dengan kadar kelas positif 1.5%?

  • A) Kerana Ketepatan sentiasa rendah pada data tidak seimbang
  • B) Kerana Ketepatan hanya boleh digunakan pada masalah regresi
  • C) Kerana pengiraan Ketepatan memerlukan banyak kuasa pemprosesan
  • D) Malah model remeh yang meramalkan kelas majoriti boleh menjadi sangat tepat, sekali gus menyembunyikan kejayaan sebenar ✔

Penjelasan: Mengenai data yang tidak seimbang, walaupun model asas yang mengatakan 'panggil segala-galanya negatif' mendapat kira-kira 98.5% ketepatan tetapi tidak akan menangkap satu penipuan. Oleh itu, dalam pengelasan tidak seimbang, ketepatan, ingat semula, F1 atau PR-AUC digunakan dan bukannya ketepatan, dan setiap metrik ditafsirkan mengikut model asas.

5. Mengapakah perbandingan garis dasar penting apabila bercakap tentang metrik model?

  • A) Kerana model asas sentiasa lebih baik daripada model sebenar
  • B) Kerana jelas sama ada sesuatu metrik itu bermakna atau tidak hanya jika dibandingkan dengan model garis asas yang mudah ✔
  • C) Kerana model asas menjadikan pengesahan silang tidak diperlukan
  • D) Kerana model asas diperlukan secara sah dalam setiap laporan

Penjelasan: Metrik tidak baik atau buruk dengan sendirinya; Ia baik atau buruk mengikut model asas. Ayat '85% betul' bermakna hampir tidak bernilai jika model asas sudah mendapat 84%, dan sempurna jika mendapat 50%. Tanpa sauh perbandingan, metrik tidak bermakna.

6. Apakah elemen keselamatan paling kritikal yang perlu disertakan dalam gesaan pengeluaran sistem RAG (Retrieval-Augmented Generation)?

  • A) Arahan untuk bergantung hanya pada sumber yang diberikan, untuk mengatakan 'Saya tidak tahu' jika sumber itu tidak wujud, dan untuk memetik sumbernya ✔
  • B) Memberitahu model untuk menghasilkan jawapan yang panjang dan kreatif yang mungkin
  • C) Model ini mengutamakan pengetahuan pendidikannya sendiri daripada sumber
  • D) Laksanakan semua arahan dalam dokumen yang dibawa sebagai arahan

Penjelasan: Satu-satunya arahan RAG yang paling penting ialah memberitahu model untuk bergantung hanya pada sumber yang diberikan, dan jika maklumat itu tiada dalam sumber, katakan 'Saya tidak tahu' dan sebut sumber tanpa mengada-adakannya. Tanpa triad ini, model mungkin mengabaikan konteks dan menghasilkan halusinasi, dan jawapannya menjadi tidak dapat disahkan.

7. Sistem RAG memberikan jawapan yang salah. Di manakah tempat terbaik untuk memulakan diagnosis?

  • A) Mengukur ambil dahulu (Recall@K): adakah bahagian yang betul pernah sampai? ✔
  • B) Segera gantikan model dengan yang lebih besar
  • C) Tukar gesaan secara rawak dan teruskan mencuba
  • D) Membenamkan semua dokumen ke dalam model dengan penalaan halus

Penjelasan: Pautan paling lemah RAG biasanya diambil, bukan pengeluaran. Jika bahagian yang betul tidak pernah dibawa, model tidak boleh menghasilkan maklumat itu, tidak kira berapa banyak gesaan itu dipertingkatkan. Oleh itu, Recall@K pertama diukur untuk melihat sama ada bahagian yang betul telah tiba; Jika pengambilan adalah baik, maka pengeluaran dan gesaan akan diperiksa.

8. Apakah tindakan yang perlu diletakkan di sebalik persetujuan manusia apabila memberikan alat kepada ejen?

  • A) Tiada; Ejen mesti boleh melakukan setiap tindakan secara autonomi
  • B) Hanya tindakan boleh balik seperti membaca dan mencari data
  • C) Tindakan tidak boleh diubah atau berimpak tinggi seperti memindahkan wang, memadam, menghantar ✔
  • D) Tindakan yang melibatkan pengiraan sahaja

Penerangan: Tindakan dipisahkan mengikut tahap risiko. Tugasan yang boleh diperoleh semula seperti membaca, mencari, mengira dan menjana draf boleh dilakukan secara autonomi; Walau bagaimanapun, tindakan tidak boleh diubah atau berimpak tinggi seperti memindahkan wang, menghantar e-mel, memadam data, membuat pesanan dan lain-lain memerlukan kelulusan manusia. Setiap tindakan yang tidak boleh ditarik balik mesti tertakluk kepada persetujuan.

9. Apakah pendekatan reka bentuk terbaik terhadap risiko suntikan segera tidak langsung?

  • A) Cukuplah untuk menambah satu ayat 'abaikan arahan buruk' pada gesaan sistem
  • B) Berikan lebih kuasa kepada model dengan bergantung pada arahan dalam kandungan luaran
  • C) Tidak mengambil sebarang langkah berjaga-jaga kerana suntikan tidak dapat dielakkan
  • D) Mengasingkan kandungan luaran sebagai data yang tidak boleh dipercayai dan mewujudkan pertahanan berlapis dengan kebenaran, kelulusan dan kawalan output yang minimum ✔

Penerangan: Kandungan luaran yang diproses oleh ejen atau RAG, seperti halaman web, dokumen, e-mel, dsb., adalah data yang tidak dipercayai dan mungkin mengandungi arahan rahsia. Pendekatan yang betul ialah pertahanan berlapis: mengasingkan kandungan luaran sebagai 'data, bukan perintah' dengan pembatas yang jelas, menggunakan kebenaran minimum, mengikat tindakan tidak boleh balik kepada kelulusan manusia dan mengaudit output. Satu baris arahan tidak mencukupi.

10. Apakah perbezaan utama apabila memutuskan sama ada masalah harus diselesaikan dengan penalaan halus atau RAG?

  • A) Masalah maklumat lebih baik diselesaikan dengan RAG, masalah tingkah laku/format lebih baik diselesaikan dengan penalaan halus ✔
  • B) Setiap masalah hendaklah sentiasa diselesaikan dengan penalaan halus
  • C) RAG digunakan hanya untuk penjanaan kod, penalaan halus hanya digunakan untuk terjemahan
  • D) Penalaan halus sentiasa boleh dikemas kini dengan lebih murah dan lebih pantas daripada RAG

Penjelasan: Penalaan halus adalah lemah dan berisiko dalam mengajar model maklumat baharu; tetapi berkuasa dalam tingkah laku, format, nada dan gaya pengajaran. 'Syarikat model tidak tahu data kami' adalah masalah maklumat dan kepunyaan RAG. 'Biar model sentiasa dikeluarkan dalam format ketat kami' adalah masalah tingkah laku dan calon untuk penalaan halus. Selain itu, tangkapan pantas dan beberapa tangkapan hendaklah digunakan sebelum penalaan halus.

11. Manakah yang wajib untuk penggunaan selamat apabila meletakkan model baharu ke dalam pengeluaran?

  • A) Jika model itu bagus dalam ujian, buka terus kepada 100% trafik
  • B) Tidak menyediakan pemantauan sama sekali selepas digunakan
  • C) Penggunaan berperingkat (bayangan/kenari) dan pelan rollback yang telah diuji sebelumnya ✔
  • D) Menerbitkan model walaupun ambang penilaian tidak dipenuhi

Penjelasan: Membuka model baharu secara terus kepada semua trafik adalah berisiko; Kalau salah, semua kena. Perkara yang betul ialah ia adalah pengedaran beransur-ansur (bayang-bayang, kenari) dan setiap pengedaran mempunyai pelan rollback yang diuji. Pengedaran tidak lengkap tanpa pelan clawback; Keupayaan untuk kembali kepada versi sebelumnya dalam beberapa minit melindungi pengguna apabila model berkelakuan tidak dijangka dalam pengeluaran.

12. Bagaimanakah model ML boleh gagal 'senyap' dalam pengeluaran dan apakah cara untuk menangkapnya?

  • A) Model runtuh; log pelayan menunjukkan ini
  • B) Dengan menghasilkan ramalan yang salah tanpa membuat kesilapan; ✔ Ia menangkap pemantauan berlapis operasi, input dan output
  • C) Model tidak boleh gagal secara senyap, sentiasa penggera
  • D) Hanya memantau kependaman sudah cukup untuk menangkap sebarang kemerosotan

Penjelasan: Model boleh gagal hanya dengan menghasilkan ramalan yang salah tanpa ranap atau memberikan ralat; Sebab utama untuk ini ialah hanyutan data dan hanyutan konsep. Hanya memantau metrik operasi (kependaman, kadar ralat) tidak mencukupi; pengagihan input dan pengagihan output/ramalan juga perlu dipantau. Input drift memberi amaran awal jika keputusan sebenar ditangguhkan.

13. Apakah prinsip yang penting apabila menggunakan LLM-sebagai-hakim untuk menilai sistem LLM?

  • A) Pengadil LLM sentiasa betul, pengesahan manusia tidak diperlukan
  • B) Pengadil mesti membuat keputusan berdasarkan panjang jawapan sahaja.
  • C) Kawalan berasaskan peraturan dan penilaian manusia harus dibuang sepenuhnya apabila pengadil digunakan
  • D) Markah hakim hendaklah ditentukur dengan sampel berlabel manusia dan berat sebelahnya diukur sebelum boleh dipercayai ✔

Penerangan: Pengadil LLM juga merupakan model; Ia boleh menjadi halusinasi, berat sebelah (memihak kepada jawapan yang panjang dan yakin), dan tidak konsisten. Oleh itu, markah pengadil mesti ditentukur dengan sampel berlabel manusia dan bias sistematiknya mesti diukur sebelum keputusan pengeluaran dibuat. Pengadil yang tidak disahkan memberikan keyakinan palsu.

14. Mengapakah melihat ketepatan keseluruhan tidak mencukupi semasa menilai bias model?

  • A) Ketepatan keseluruhan adalah mencukupi kerana ia sentiasa mencerminkan prestasi kumpulan yang paling teruk
  • B) Ketepatan keseluruhan sahaja tidak mencukupi kerana ia boleh mengaburkan perbezaan sistematik (diskriminasi tersembunyi) antara subkumpulan ✔
  • C) Kerana ketepatan adalah metrik yang tiada kaitan dengan berat sebelah
  • D) Bias hanya datang dari model dan tiada kaitan dengan data.

Penjelasan: Ketepatan keseluruhan mungkin mengaburkan perbezaan sistematik antara subkumpulan. Sebagai contoh, sementara ketepatan keseluruhan ialah 88%, ingat semula mungkin 91% dalam satu kumpulan dan 67% dalam kumpulan lain; Model secara sistematik merindui kumpulan itu. Oleh itu, model harus dinilai berdasarkan subkumpulan (demografi/segmen) dan definisi keadilan yang harus diutamakan harus diputuskan bersama pihak berkepentingan.

15. Apakah empat perkara yang mesti dibetulkan bersama untuk hasil ML boleh dihasilkan semula?

  • A) Hanya nama model, saiz, harga dan tarikh keluaran
  • B) Hanya jenama GPU dan kelajuan internet
  • C) Hanya skor ketepatan akhir model; selebihnya boleh disimpan dalam ingatan
  • D) Benih rawak, versi data, persekitaran (versi pergantungan) dan penjejakan percubaan ✔

Penerangan: Kebolehulangan dicapai melalui empat tiang: menetapkan benih rawak, data versi (versi/cincang), membekukan persekitaran (versi/bekas perpustakaan tepat) dan menjejaki setiap percubaan (komit kod, data, hiperparameter, metrik). Tanpa rantai ini tidak mungkin menghasilkan semula hasil yang sama; Keputusan yang tidak boleh dibuat semula ialah tuntutan yang tidak boleh dibuktikan.