Keuntungan:
- Keupayaan untuk membezakan sama ada masalah adalah maklumat atau tingkah laku dan menilai penalaan halus untuk masalah tingkah laku hanya selepas segera, beberapa pukulan dan RAG habis.
- Memahami kaedah penalaan halus (SFT, LoRA/PEFT, RLHF) dan atribut data yang menentukan kualiti (ketekalan, kepelbagaian, kerahsiaan)
- Keupayaan untuk mengukur nilai sebenar penalaan halus dengan penilaian sebelum-selepas, pembelajaran berlebihan dan ujian melupakan bencana
Penalaan halus (menyesuaikan tingkah lakunya dengan melatih model pra-latihan lebih lanjut dengan data anda sendiri) ialah alat yang berkuasa tetapi mahal dalam senjata jurutera yang bekerja dengan LLM. Apabila digunakan di tempat yang salah, ia adalah pembaziran wang dan masa, tetapi apabila digunakan di tempat yang betul, ia memberikan kualiti yang tidak boleh dicapai sebaliknya. Dalam unit ini, kami meliputi apabila penalaan halus diperlukan, kaedah asas dan risikonya. Matlamatnya adalah untuk membuat anda membuat keputusan.
Pertama soalan yang betul: adakah penalaan halus perlu?
Kesilapan pemula yang paling mahal adalah dengan segera tergesa-gesa untuk menyempurnakan masalah yang boleh diselesaikan. Sediakan pesanan seperti ini:
- Kejuruteraan segera: Gesaan yang baik yang menerangkan tugas dengan jelas menyelesaikan kebanyakan masalah. Consume kat sini dulu.
- Pembelajaran beberapa pukulan: Meletakkan beberapa contoh dalam gesaan menunjukkan model format dan tingkah laku yang diingini.
- RAG: Jika masalahnya ialah "kekurangan maklumat" (keperluan untuk data yang model tidak tahu), penyelesaiannya ialah RAG (unit 4), bukan penalaan halus.
- Penalaan halus: Ia akan dimainkan jika perkara di atas tidak mencukupi dan masalahnya ialah "tingkah laku/format/gaya".
Perbezaan utama: Penalaan halus adalah lemah dan berisiko dalam mengajar model maklumat baharu; tetapi ia kuat untuk mengajar cara berkelakuan (format tertentu, nada, jargon medan, struktur yang konsisten). “Model saya tidak mengetahui maklumat syarikat kami” → RAG. "Biar model saya sentiasa memberikan output dalam format yang tepat yang kita mahu" → penalaan halus calon.
Petua: Sebelum membuat keputusan tentang penalaan halus, tanya: "Adakah ini masalah pengetahuan atau masalah tingkah laku?" Masalah maklumat lebih baik diselesaikan dengan RAG, masalah tingkah laku lebih baik diselesaikan dengan penalaan halus.
Kaedah penalaan halus
Penalaan halus penuh: Melatih semula semua parameter model. Paling berkuasa tetapi paling mahal; Ia memerlukan perkakasan yang besar (GPU) dan data yang teliti. Ia tidak perlu untuk kebanyakan pasukan.
Penalaan halus cekap parameter (PEFT): Kaedah yang membekukan sebahagian besar model, hanya melatih set kecil parameter tambahan. Yang paling biasa ialah LoRA (Penyesuaian Kedudukan Rendah: melatih lapisan "penyesuai" kecil yang ditambahkan pada model). LoRA memberikan hasil yang hampir kepada penalaan halus penuh, dengan lebih sedikit memori dan kos; Itulah sebabnya ia adalah pilihan pertama dalam amalan.
Penyeliaan Penalaan Halus (SFT): Mengajar model untuk "bertindak balas kepada input ini seperti ini" dengan data yang terdiri daripada pasangan keluaran input-ideal. Ia adalah senario yang paling biasa.
Pembelajaran pengukuhan daripada maklum balas manusia (RLHF): Menjajarkan tingkah laku model daripada respons pilihan orang ramai. Ia kompleks dan mahal; Keperluan kebanyakan pasukan aplikasi dipenuhi dengan SFT. Cukuplah mengetahui RLHF sebagai satu konsep.
Data: hati penalaan halus
Kualiti penalaan halus bergantung sepenuhnya pada kualiti data latihan. Beberapa ratus sampel yang berkualiti tinggi dan konsisten adalah lebih baik daripada beribu-ribu sampel yang ceroboh. Semasa menyediakan data:
- Ketekalan: Semua contoh menunjukkan format dan nada yang anda inginkan secara konsisten. Contoh bercanggah menjadikan model keliru.
- Kepelbagaian: Contoh meliputi kepelbagaian dalam penggunaan sebenar, tetapi tidak seragam.
- Pembersihan: Kejadian yang mengandungi data yang salah, berat sebelah atau tersembunyi dihantar secara kekal ke dalam model. Data penalaan halus harus dibaca dengan teliti seperti kontrak.
Awas: Setiap berat sebelah, ralat dan maklumat tersembunyi yang memasuki data penalaan halus terukir ke dalam model dan muncul semula dalam outputnya. Audit data latihan anda dengan teliti seolah-olah anda menerbitkannya; Jangan siarkan data peribadi.
Ulasan: adakah penalaan halus berfungsi?
Sebelum penalaan halus, tempah set eval yang ditahan dan ukur skor model tanpa penalaan halus (model asas). Selepas penalaan halus, ukur sekali lagi dalam bank yang sama. Anda tidak boleh mengatakan "ia menjadi lebih baik" tanpa perbandingan. Juga dua perangkap yang perlu diperhatikan:
- Pembelajaran Terlebih: Latihan berlebihan dengan data kecil menyebabkan model kehilangan keupayaannya untuk menghafal dan membuat generalisasi contoh latihan.
- Pelupaan bencana: Latihan berlebihan pada tugas yang sempit boleh menjejaskan kebolehan keseluruhan model. Uji sama ada kemahiran lama dikekalkan semasa memperoleh tingkah laku baharu.
Pendekatan yang lemah / Pendekatan yang kuat
Lemah: "Saya mempunyai 3000 log sembang, mari kita berikan semuanya untuk penalaan halus, supaya model boleh bercakap seperti kita."
Güçlü: "Mula-mula saya menilai model asas dengan 100 tugasan sebenar, mencatat markah. Saya mengukur sejauh mana ia bertambah baik dengan gesaan dan beberapa tangkapan — ia tidak mencukupi. Kemudian daripada 3000 log, saya memilih dan membersihkan hanya 400 sampel dengan kualiti tinggi, format yang konsisten dan tiada data tersembunyi. Saya menyelaraskan semula 10 dengan tugasan yang sama dan mengesahkan ujian yang sama dengan LoRA yang sama. keupayaan am adalah utuh."
Perbezaannya: pendekatan yang kuat menghabiskan alternatif dahulu, data pilihan ceri, langkah sebelum dan selepas, dan ujian untuk kesan sampingan.
Realiti kos dan penyelenggaraan
Penalaan halus bukan kerja sekali sahaja; Ia adalah kewajipan menjaga. Anda mungkin perlu melatih semula apabila model asas dikemas kini, memerlukan perubahan atau data hilang. Selain itu, pengehosan model yang diperhalusi membawa kos dan operasi tambahan. Bandingkan jumlah kos pemilikan ini dengan peningkatan kualiti yang disediakannya. Selalunya gesaan + RAG yang baik adalah lebih murah dan lebih fleksibel daripada penalaan halus.
tiga kes mini
Kes 1 - Penalaan halus yang tidak perlu. Satu pasukan memulakan projek penalaan halus yang mahal kerana "model kami tidak mengetahui produk kami." Bulan dan belanjawan dibelanjakan, hasilnya rapuh — model menjadi usang setiap kali katalog produk berubah. Akhirnya mereka beralih kepada RAG: mereka mengambil data produk dari pangkalan dokumen, kemas kini adalah serta-merta dan kos menurun. Pengajaran: masalah maklumat tidak diselesaikan dengan penalaan halus.
Kes 2 - Penalaan halus yang betul. Sebuah syarikat insurans mahu model itu sentiasa menghasilkan ringkasan polisi dalam struktur tegar yang sama (item demi klausa, dengan tajuk tertentu). Ketekalan dengan segera tersekat pada 70%. Selepas penalaan halus LoRA dengan 300 sampel yang baik, ketekalan format meningkat kepada 98%. Ini adalah masalah tingkah laku dan penalaan halus adalah alat yang betul.
Kes 3 - Privasi melarikan diri ke dalam data. Satu pasukan menyerahkan log sembang untuk diperhalusi tanpa membersihkannya. Log tersebut mengandungi nama pelanggan dan nombor pengenalan sebenar. Model yang diperhalusi mula "membocorkan" nama-nama ini sebagai output dalam soalan yang tidak berkaitan. Model itu ditarik balik, data ditutup dan dilatih semula. Pelajaran: Maklumat tersembunyi dalam data penalaan halus dipindahkan secara kekal ke model.
Templat yang boleh disalin
Bantu saya memutuskan sama ada penalaan halus diperlukan untuk masalah saya ini. Masalah: [penerangan] Adakah ini masalah MAKLUMAT (model tidak tahu sesuatu) atau masalah TINGKAH LAKU (model tidak menghasilkan format/nada/struktur yang saya inginkan)? Bolehkah ia diselesaikan dengan segera, beberapa pukulan dan RAG dahulu? Mengapa mencuba/tidak mencuba setiap satu daripadanya? Hanya dalam keadaan apakah anda akan mengesyorkan penalaan halus?
Semak set data penalaan halus ini:1) Adakah contoh konsisten dalam format dan nada?2) Adakah ia merangkumi variasi dalam penggunaan sebenar?3) Adakah ia mengandungi data sulit/peribadi (mesti bertopeng)?4) Adakah terdapat contoh yang bercanggah? Subset contoh: [contoh]Senaraikan setiap isu dan betulkan yang anda temui.
Menghasilkan pelan penilaian sebelum dan selepas penalaan halus. Tugasan: [penjelasan]- Bagaimanakah set eval yang dipegang harus dipilih?- Bagaimanakah skor model asas diukur?- Dengan metrik manakah ia dibandingkan selepas penalaan halus?- Bagaimanakah saya menguji bahawa keupayaan am tidak terjejas (pelupaan bencana)?
Cadangkan hiperparameter awal untuk penalaan halus dengan LoRA. Saiz data: [bilangan sampel]Tujuan: [format/nada pengajaran]Cadangkan zaman, kadar pembelajaran dan berhenti awal untuk mengelakkan pembelajaran berlebihan.
Jadual keputusan: alat yang manakah apabila
perlukan
cuba dulu
Penalaan halus?
Model tidak tahu apa-apa maklumat
RAG
tidak
Data semasa diperlukan
RAG
tidak
Format tegar khusus
beberapa pukulan
Jika tidak cukup ya
Nada/gaya yang konsisten
gesaan + beberapa pukulan
Jika tidak cukup ya
Jargon/gaya medan
segera
Jika itu tidak mencukupi, LoRA
Pengoptimuman tugas mudah
kejuruteraan segera
Secara amnya tidak
Kesilapan biasa
- Cuba menyelesaikan masalah maklumat dengan penalaan halus. RAG adalah alat yang betul.
- Menjalankan penalaan halus tanpa menggunakan segera/beberapa-shot/RAG. Mahal dan tidak perlu.
- Latihan dengan data berkualiti rendah/bercanggah. Data yang kurang tetapi jelas adalah lebih baik.
- Meletakkan data sulit ke dalam pendidikan. Menyusup secara kekal ke dalam model.
- Tidak mengukur sebelum dan selepas. Anda tidak boleh membuktikan pemulihan.
- Bukan menguji pelupaan bencana. Kemahiran baru boleh mengganggu kemahiran lama.
Secara ringkasnya
Penalaan halus ialah alat yang berkuasa tetapi mahal dan hanya perlu dipertimbangkan untuk masalah tingkah laku/format selepas menggunakan prompt-few-shot-RAG; masalah maklumat adalah milik RAG. Kaedah cekap parameter seperti LoRA adalah pilihan pertama yang praktikal. Kualiti bergantung sepenuhnya pada kualiti data; Gunakan data yang kecil tetapi bersih, konsisten dan sulit. Ukur sebelum dan selepas, uji untuk pembelajaran berlebihan dan kehilangan keupayaan. Penalaan halus adalah tanggungjawab penjagaan; Timbang jumlah kosnya dengan kualiti yang diberikannya.
Tugasan permohonan
Pilih masalah dan tentukan sama ada penalaan halus perlu dengan membezakan antara "pengetahuan atau tingkah laku" dan tulis justifikasi anda. Jika ia adalah masalah tingkah laku, sediakan 20-30 sampel yang konsisten, semak data tersembunyi dan dokumenkan rancangan penilaian sebelum dan selepas (kluster yang dipegang, skor asas, metrik perbandingan, ujian lupa). Jika ia boleh diselesaikan dengan RAG/few-shot dan bukannya penalaan halus, catatkan perkara ini juga.
senarai semak
- [ ] Saya menentukan sama ada masalahnya ialah pengetahuan atau tingkah laku.
- [ ] Saya mula-mula menilai alternatif segera, beberapa pukulan dan RAG.
- [ ] Saya mengaudit data penalaan halus untuk ketekalan, kepelbagaian dan kerahsiaan.
- [ ] Saya memperuntukkan kelompok eval yang ditahan dan mengukur skor asas.
- [ ] Saya merancang perbandingan sebelum-selepas dan ujian lupa.
- [ ] Saya membandingkan jumlah kos dengan kualiti yang diberikannya.