Mga nadagdag:
- Kakayahang makilala kung ang isang problema ay impormasyon o pag-uugali at suriin ang fine-tuning para sa mga problema sa pag-uugali pagkatapos lamang maubos ang prompt, few-shot at RAG.
- Pag-unawa sa mga pamamaraan ng fine-tuning (SFT, LoRA/PEFT, RLHF) at mga katangian ng data na tumutukoy sa kalidad (consistency, diversity, confidentiality)
- Kakayahang sukatin ang tunay na halaga ng fine-tuning gamit ang bago-pagkatapos na pagsusuri, overlearning at mga pagsubok sa paglimot sa sakuna
Ang fine-tuning (pag-customize ng gawi nito sa pamamagitan ng pagsasanay ng isang pre-trained na modelo nang higit pa gamit ang iyong sariling data) ay isang makapangyarihan ngunit mahal na tool sa arsenal ng engineer na nagtatrabaho sa mga LLM. Kapag ginamit sa maling lugar, ito ay isang pag-aaksaya ng pera at oras, ngunit kapag ginamit sa tamang lugar, ito ay nagbibigay ng isang kalidad na hindi maaaring makamit kung hindi man. Sa yunit na ito, sinasaklaw namin kung kinakailangan ang fine-tuning, ang mga pangunahing pamamaraan at panganib nito. Ang layunin ay gawin kang gumawa ng desisyon.
Una ang tamang tanong: kailangan ba ang fine-tuning?
Ang pinakamahal na pagkakamali ng mga nagsisimula ay ang agad na magmadali sa pag-fine-tune ng isang problema na maaaring malutas. I-set up ang order tulad nito:
- Maagap na engineering: Ang isang mahusay na prompt na nagpapaliwanag sa gawain ay malinaw na nalulutas ang karamihan sa mga problema. Uminom ka muna dito.
- Few-shot learning: Ang paglalagay ng ilang halimbawa sa prompt ay nagpapakita sa modelo ng gustong format at gawi.
- RAG: Kung ang problema ay "kakulangan ng impormasyon" (kailangan ng data na hindi alam ng modelo), ang solusyon ay RAG (unit 4), hindi fine-tuning.
- Fine-tuning: Naglalaro ito kung hindi sapat ang nasa itaas at ang problema ay "pag-uugali/format/estilo".
Pangunahing pagkakaiba: Ang fine-tuning ay mahina at mapanganib sa pagtuturo sa modelo ng bagong impormasyon; ngunit ito ay malakas sa pagtuturo kung paano kumilos (isang tiyak na format, tono, field jargon, pare-pareho ang istraktura). “Hindi alam ng aking modelo ang impormasyon ng aming kumpanya” → RAG. "Hayaan ang aking modelo na palaging magbigay ng output sa eksaktong format na gusto namin" → fine-tuning na kandidato.
Tip: Bago magpasya sa fine-tuning, itanong: "Ito ba ay isang problema sa kaalaman o isang problema sa pag-uugali?" Ang mga problema sa impormasyon ay mas mahusay na nalutas sa RAG, ang mga problema sa pag-uugali ay mas mahusay na nalutas sa pamamagitan ng fine-tuning.
Mga pamamaraan ng fine-tuning
Buong fine-tuning: Muling pagsasanay sa lahat ng parameter ng modelo. Pinakamakapangyarihan ngunit pinakamahal; Nangangailangan ito ng malaking hardware (GPU) at maingat na data. Ito ay hindi kailangan para sa karamihan ng mga koponan.
Parameter-efficient fine-tuning (PEFT): Mga pamamaraan na nag-freeze sa karamihan ng modelo, nagsasanay lamang ng maliit na hanay ng mga karagdagang parameter. Ang pinakakaraniwan ay ang LoRA (Low-Rank Adaptation: pagsasanay ng maliliit na "adapter" na layer na idinagdag sa modelo). Nagbibigay ang LoRA ng mga resulta na malapit sa ganap na pag-aayos, na may mas kaunting memorya at gastos; Iyon ang dahilan kung bakit ito ang unang pagpipilian sa pagsasanay.
Supervised Fine-Tuning (SFT): Pagtuturo sa modelo na "tumugon sa input na ito tulad nito" na may data na binubuo ng mga pares ng input-ideal na output. Ito ang pinakakaraniwang senaryo.
Reinforcement learning mula sa human feedback (RLHF): Pag-align ng gawi ng modelo mula sa mga gustong tugon ng mga tao. Ito ay kumplikado at mahal; Ang mga pangangailangan ng karamihan sa mga koponan ng aplikasyon ay natutugunan sa SFT. Sapat na malaman ang RLHF bilang isang konsepto.
Data: ang puso ng fine-tuning
Ang kalidad ng fine-tuning ay ganap na nakasalalay sa kalidad ng data ng pagsasanay. Ang ilang daang mataas na kalidad, pare-parehong mga sample ay mas mahusay kaysa sa libu-libong mga palpak na sample. Kapag naghahanda ng data:
- Consistency: Ang lahat ng mga halimbawa ay patuloy na nagpapakita ng format at tono na gusto mo. Ang mga salungat na halimbawa ay nag-iiwan sa modelo na nalilito.
- Variety: Ang mga halimbawa ay sumasaklaw sa iba't sa aktwal na paggamit, ngunit hindi pare-pareho.
- Paglilinis: Ang mga instance na naglalaman ng hindi tama, bias, o nakatagong data ay permanenteng ipinapasa sa modelo. Ang data ng fine-tuning ay dapat basahin nang maingat gaya ng isang kontrata.
Babala: Ang bawat bias, error, at nakatagong impormasyon na pumapasok sa fine-tuning na data ay nakaukit sa modelo at muling lilitaw sa mga output nito. I-audit ang iyong data ng pagsasanay nang masinsinan na parang ini-publish mo ito; Huwag mag-post ng personal na data.
Balik-aral: gumana ba ang fine-tuning?
Bago mag-fine-tuning, magreserba ng hold-out na eval set at sukatin ang marka ng modelo nang walang fine-tuning (base model). Pagkatapos ng fine-tuning, sukatin muli sa parehong bangko. Hindi mo masasabing "it got better" nang walang paghahambing. Gayundin ang dalawang bitag na dapat malaman:
- Overlearning: Ang sobrang pagsasanay na may maliit na data ay nagiging sanhi ng pagkawala ng kakayahan ng modelo na kabisaduhin at gawing pangkalahatan ang mga halimbawa ng pagsasanay.
- Sakuna na pagkalimot: Ang sobrang pagsasanay sa isang makitid na gawain ay maaaring makapinsala sa pangkalahatang kakayahan ng modelo. Subukan kung ang mga lumang kasanayan ay pinananatili habang kinukuha ang bagong pag-uugali.
Mahinang diskarte / Malakas na diskarte
Weak: "Mayroon akong 3000 chat logs, ibigay natin ang lahat sa fine-tuning, para makapagsalita ang modelo tulad natin."
Güçlü: "Una, sinuri ko ang base model na may 100 totoong gawain, nabanggit ang marka. Sinukat ko kung gaano ito napabuti sa pamamagitan ng mga senyas at ilang-shot — hindi ito sapat. Pagkatapos mula sa 3000 log, 400 na sample lang ang pinili at nilinis ko na may mataas na kalidad, pare-pareho ang format at walang nakatagong data. Pino-pino ko muli ang 10 na iyon gamit ang LoRA, at nakumpirma kong muli ang 10 na iyon gamit ang LoRA, at nakumpirma ko ang isang hiwalay na gawain. buo ang mga pangkalahatang kakayahan."
Ang pagkakaiba: ang malakas na diskarte ay nauubos muna ang mga alternatibo, ang data ng mga cherry-pick, mga panukala bago-at-pagkatapos, at mga pagsusuri para sa mga side effect.
Ang katotohanan ng gastos at pagpapanatili
Ang fine-tuning ay hindi isang beses na trabaho; Ito ay isang tungkulin ng pangangalaga. Maaaring kailanganin na muling magsanay kapag ang batayang modelo ay na-update, nangangailangan ng pagbabago, o nawala ang data. Bukod pa rito, ang pagho-host ng isang fine-tuned na modelo ay nagdudulot ng mga karagdagang gastos at operasyon. Ihambing ang kabuuang halaga ng pagmamay-ari na ito sa pagtaas ng kalidad na ibinibigay nito. Kadalasan ang isang magandang prompt + RAG ay mas mura at mas flexible kaysa sa fine-tuning.
tatlong mini case
Case 1 - Hindi kinakailangang fine-tuning. Isang team ang nagsimula sa isang mamahaling fine-tuning na proyekto dahil "hindi alam ng aming modelo ang aming mga produkto." Buwan at badyet ang ginugol, ang resulta ay marupok — ang modelo ay nagiging laos sa tuwing nagbabago ang katalogo ng produkto. Sa wakas ay lumipat sila sa RAG: kinuha nila ang data ng produkto mula sa base ng dokumento, agad-agad ang pag-update at bumaba ang gastos. Aralin: ang problema sa impormasyon ay hindi nalutas sa pamamagitan ng fine-tuning.
Case 2 - Tamang fine-tuning. Nais ng isang kompanya ng seguro na ang modelo ay palaging gumawa ng mga buod ng patakaran sa parehong mahigpit na istraktura (item ayon sa sugnay, na may mga partikular na heading). Ang pagkakapare-pareho sa prompt ay natigil sa 70%. Pagkatapos ng fine-tuning ng LoRA na may 300 magagandang sample, tumaas ang consistency ng format sa 98%. Ito ay isang problema sa pag-uugali at ang fine-tuning ang tamang tool.
Case 3 - Privacy escaping sa data. Isang team ang nagsumite ng mga chat log sa fine-tuning nang hindi nililinis ang mga ito. Ang mga log ay naglalaman ng mga tunay na pangalan ng customer at mga numero ng pagkakakilanlan. Sinimulan ng fine-tuned na modelo ang "paglabas" ng mga pangalang ito bilang output sa mga hindi nauugnay na tanong. Ang modelo ay na-withdraw, ang data ay naka-mask at muling sinanay. Aralin: Ang nakatagong impormasyon sa fine-tuning na data ay permanenteng inililipat sa modelo.
Mga nakopyang template
Tulungan akong magpasya kung kailangan ang fine-tuning para sa problema kong ito. Problema: [paglalarawan] Ito ba ay isang problema sa IMPORMASYON (ang modelo ay walang alam) o isang problema sa PAG-UUGALI (ang modelo ay hindi gumagawa ng format/tono/istraktura na gusto ko)? Maaari ba itong malutas sa prompt, few-shot at RAG muna? Bakit subukan/hindi subukan ang bawat isa sa kanila? Sa ilalim lamang ng anong kundisyon mo irerekomenda ang fine-tuning?
Suriin ang fine-tuning na dataset na ito:1) Pare-pareho ba ang mga halimbawa sa format at tono?2) Sinasaklaw ba nila ang pagkakaiba-iba sa aktwal na paggamit?3) Naglalaman ba ito ng kumpidensyal/personal na data (dapat naka-mask)?4) Mayroon bang magkasalungat na mga halimbawa?Isang subset ng mga halimbawa: [mga halimbawa]Ilista ang bawat isyu at ayusin ang iyong nakita.
Gumawa ng plano sa pagsusuri bago at pagkatapos ng fine-tuning. Gawain: [paliwanag]- Paano dapat piliin ang gaganaping eval set?- Paano sinusukat ang marka ng batayang modelo?- Sa aling sukatan ito inihahambing pagkatapos ng fine-tuning?- Paano ko susuriin na ang mga pangkalahatang kakayahan ay hindi napinsala (catastrophic forgetting)?
Magmungkahi ng mga paunang hyperparameter para sa fine-tuning gamit ang LoRA. Laki ng data: [bilang ng mga sample]Layunin: [format/tono pagtuturo]Magmungkahi ng panahon, rate ng pagkatuto, at maagang paghinto para maiwasan ang labis na pagkatuto.
Talahanayan ng desisyon: aling kasangkapan kung kailan
kailangan
subukan mo muna
Fine-tuning?
Walang alam na impormasyon ang modelo
RAG
hindi
Kinakailangan ang kasalukuyang data
RAG
hindi
Tukoy na matibay na format
ilang shots
Kung hindi sapat oo
Pare-parehong tono/estilo
prompt + few-shot
Kung hindi sapat oo
Field jargon/style
prompt
Kung hindi iyon sapat, LoRA
Simpleng pag-optimize ng gawain
agarang engineering
Sa pangkalahatan ay hindi
Mga karaniwang pagkakamali
- Sinusubukang lutasin ang problema sa impormasyon gamit ang fine-tuning. Ang RAG ay ang tamang tool.
- Tumatakbo sa fine-tuning nang hindi kumukonsumo ng prompt/few-shot/RAG. Mahal at hindi kailangan.
- Pagsasanay na may mababang kalidad/salungat na data. Mas mainam ang mas kaunti ngunit malinaw na data.
- Paglalagay ng kumpidensyal na data sa edukasyon. Permanenteng infiltrates ang modelo.
- Hindi nagsusukat bago at pagkatapos. Hindi mo mapapatunayan ang paggaling.
- Hindi pagsubok sa sakuna pagkalimot. Ang bagong kasanayan ay maaaring makagambala sa luma.
Sa buod
Ang fine-tuning ay isang malakas ngunit mahal na tool at dapat lamang isaalang-alang para sa mga problema sa gawi/format pagkatapos gamitin ang prompt-few-shot-RAG; Ang mga problema sa impormasyon ay nabibilang sa RAG. Parameter-efficient na pamamaraan tulad ng LoRA ang praktikal na unang pagpipilian. Ang kalidad ay ganap na nakasalalay sa kalidad ng data; Gumamit ng maliit ngunit malinis, pare-pareho at kumpidensyal na data. Sukatin bago at pagkatapos, subukan para sa labis na pagkatuto at pagkawala ng kakayahan. Ang fine-tuning ay isang tungkulin ng pangangalaga; Timbangin ang kabuuang halaga nito laban sa kalidad na inihahatid nito.
Gawain ng aplikasyon
Pumili ng problema at magpasya kung kailangan ang fine-tuning sa pamamagitan ng pagtukoy sa pagitan ng "kaalaman o pag-uugali" at isulat ang iyong katwiran. Kung ito ay isang problema sa pag-uugali, maghanda ng 20-30 pare-parehong mga sample, tingnan kung may nakatagong data, at idokumento ang bago-at-pagkatapos na plano ng ebalwasyon (ipinagpatuloy na cluster, batayang marka, sukatan ng paghahambing, pagsubok sa paglimot). Kung ito ay malulutas sa RAG/few-shot sa halip na fine-tuning, itala din ito.
checklist
- [ ] Natukoy ko kung ang problema ay kaalaman o pag-uugali.
- [ ] Una kong sinuri ang mga alternatibong prompt, few-shot at RAG.
- [ ] In-audit ko ang data ng fine-tuning para sa pagkakapare-pareho, pagkakaiba-iba at pagiging kumpidensyal.
- [ ] Naglaan ako ng isang hold-out na eval cluster at sinukat ang base score.
- [ ] Nagplano ako ng before-after comparison at forgetting test.
- [ ] Inihambing ko ang kabuuang gastos sa kalidad na ibinibigay nito.