Fitimet:
- Aftësia për të dalluar nëse një problem është informacion apo sjellje dhe për të vlerësuar rregullimin e saktë për problemet e sjelljes vetëm pasi të jenë shteruar kërkesat e shpejta, disa goditje dhe RAG.
- Kuptimi i metodave të rregullimit të imët (SFT, LoRA/PEFT, RLHF) dhe atributeve të të dhënave që përcaktojnë cilësinë (konsistenca, diversiteti, konfidencialiteti)
- Aftësia për të matur vlerën e vërtetë të rregullimit të imët me teste para-pas vlerësimit, mësimit të tepërt dhe harresës katastrofike
Rregullimi i imët (përshtatja e sjelljes së tij duke trajnuar më tej një model të para-trajnuar me të dhënat tuaja) është një mjet i fuqishëm, por i shtrenjtë në arsenalin e inxhinierit që punon me LLM. Kur përdoret në vendin e gabuar, është humbje parash dhe kohe, por kur përdoret në vendin e duhur, jep një cilësi që nuk mund të arrihet ndryshe. Në këtë njësi, ne mbulojmë kur është i nevojshëm rregullimi i imët, metodat bazë dhe rreziqet e tij. Qëllimi është t'ju bëjë vendimmarrës.
Së pari pyetja e duhur: a është i nevojshëm rregullimi i imët?
Gabimi më i shtrenjtë i fillestarëve është që menjëherë të nxitojnë për të rregulluar mirë një problem që mund të zgjidhet. Vendosni rendin si kjo:
- Inxhinieri e shpejtë: Një njoftim i mirë që shpjegon detyrën zgjidh qartë shumicën e problemeve. Konsumojeni këtu së pari.
- Mësimi i pakët: Vendosja e disa shembujve në prompt i tregon modelit formatin dhe sjelljen e dëshiruar.
- RAG: Nëse problemi është "mungesa e informacionit" (nevoja për të dhëna që modeli nuk i njeh), zgjidhja është RAG (njësia 4), jo rregullimi i imët.
- Rregullimi i imët: Ai hyn në lojë nëse sa më sipër nuk mjafton dhe problemi është "sjellja/formati/stili".
Dallimi kryesor: Rregullimi i imët është i dobët dhe i rrezikshëm për t'i mësuar modelit informacion të ri; por është i fortë në mësimdhënien se si të sillemi (një format specifik, ton, zhargon në terren, strukturë konsistente). "Modeli im nuk i njeh informacionet e kompanisë sonë" → RAG. "Lëreni modelin tim të japë gjithmonë rezultatin në formatin e saktë që duam" → kandidati për rregullim të imët.
Këshillë: Përpara se të vendosni për rregullimin e imët, pyesni: "A është ky një problem njohurish apo një problem sjelljeje?" Problemet e informacionit zgjidhen më mirë me RAG, problemet e sjelljes zgjidhen më mirë me rregullim të imët.
Metodat e rregullimit të imët
Rregullimi i plotë i imët: Rikualifikimi i të gjithë parametrave të modelit. Më i fuqishmi por më i shtrenjtë; Kërkon pajisje të mëdha (GPU) dhe të dhëna të kujdesshme. Është e panevojshme për shumicën e skuadrave.
Rregullimi i imët me efikasitet në parametra (PEFT): Metoda që ngrijnë shumicën dërrmuese të modelit, duke trajnuar vetëm një grup të vogël parametrash shtesë. Më e zakonshmja është LoRA (Përshtatja e rangut të ulët: trajnimi i shtresave të vogla "përshtatëse" të shtuara në model). LoRA ofron rezultate afër akordimit të plotë, me shumë më pak memorie dhe kosto; Kjo është arsyeja pse është zgjedhja e parë në praktikë.
Rregullimi i imët i mbikëqyrur (SFT): Mësimi i modelit t'i "përgjigjet kësaj hyrjeje në këtë mënyrë" me të dhëna që përbëhen nga çifte hyrje-dalje ideale. Është skenari më i zakonshëm.
Të mësuarit përforcues nga reagimet njerëzore (RLHF): Përafrimi i sjelljes së modelit nga përgjigjet e preferuara të njerëzve. Është kompleks dhe i shtrenjtë; Nevojat e shumicës së ekipeve të aplikimit plotësohen me SFT. Mjafton të njohësh RLHF si koncept.
Të dhënat: zemra e rregullimit të imët
Cilësia e rregullimit të imët varet tërësisht nga cilësia e të dhënave të trajnimit. Disa qindra mostra konsistente me cilësi të lartë janë më të mira se mijëra mostra të ngadalta. Gjatë përgatitjes së të dhënave:
- Konsistenca: Të gjithë shembujt tregojnë vazhdimisht formatin dhe tonin që dëshironi. Shembujt kontradiktore e lënë modelin konfuz.
- Shumëllojshmëria: Shembujt mbulojnë varietetin në përdorim aktual, por nuk janë uniformë.
- Pastrimi: Instancat që përmbajnë të dhëna të pasakta, të njëanshme ose të fshehura kalohen përgjithmonë në model. Të dhënat e rregullimit të imët duhet të lexohen me aq kujdes sa një kontratë.
Kujdes: Çdo paragjykim, gabim dhe informacion i fshehur që hyn në të dhënat e rregullimit të imët gërmohet në model dhe rishfaqet në daljet e tij. Kontrolloni të dhënat tuaja të trajnimit me aq përpikëri sikur po i publikonit; Mos postoni të dhëna personale.
Rishikimi: a funksionoi rregullimi i imët?
Përpara akordimit, rezervoni një grup vlerësues të mbajtur dhe matni rezultatin e modelit pa akordim të imët (modeli bazë). Pas akordimit, matni përsëri në të njëjtën bankë. Nuk mund të thuash "u bë më mirë" pa krahasim. Gjithashtu dy kurthe për t'u kujdesur:
- Mbi-mësimi: Mbi-stërvitja me të dhëna të vogla bën që modeli të humbasë aftësinë e tij për të memorizuar dhe përgjithësuar shembuj trajnimi.
- Harresa katastrofike: Stërvitja e tepërt në një detyrë të ngushtë mund të dëmtojë aftësitë e përgjithshme të modelit. Testoni nëse aftësitë e vjetra ruhen gjatë përvetësimit të sjelljes së re.
Qasje e dobët / Qasje e fortë
I dobët: "Kam 3000 regjistra bisedash, le t'i japim të gjitha në rregullim të imët, që modelja të flasë si ne."
Güçlü: "Së pari vlerësova modelin bazë me 100 detyra reale, vura në dukje rezultatin. Mata se sa u përmirësua me nxitje dhe disa shkrepje - nuk ishte e mjaftueshme. Më pas nga 3000 regjistrat, zgjodha dhe pastrova vetëm 400 mostra me cilësi të lartë, format konsistent dhe pa të dhëna të fshehura të matura përsëri me detyrat e njëjta, LoRA-t. konfirmoi me një test të veçantë se aftësitë e përgjithshme ishin të paprekura."
Dallimi: qasja e fortë shter alternativat së pari, të dhënat e përzgjedhjes së qershisë, masat para dhe pas dhe testet për efekte anësore.
Realiteti i kostos dhe mirëmbajtjes
Rregullimi i imët nuk është një punë vetëm një herë; Është detyrë e kujdesit. Mund të jetë e nevojshme të ritrajnohet kur modeli bazë përditësohet, ka nevojë të ndryshojë ose të dhënat humbasin. Për më tepër, mbajtja e një modeli të rregulluar mirë sjell kosto dhe operacione shtesë. Krahasoni këtë kosto totale të pronësisë me rritjen e cilësisë që ofron. Shumicën e kohës një prompt i mirë + RAG është më i lirë dhe më fleksibël sesa rregullimi i imët.
tre mini kuti
Rasti 1 - Rregullim i panevojshëm i imët. Një ekip filloi një projekt të shtrenjtë akordimi sepse "modeli ynë nuk i njeh produktet tona". U shpenzuan muaj dhe buxhet, rezultati ishte i brishtë - modeli u vjetërua sa herë që ndryshonte katalogu i produkteve. Më në fund ata kaluan në RAG: ata morën të dhënat e produktit nga baza e dokumenteve, përditësimi ishte i menjëhershëm dhe kostoja ra. Mësimi: problemi i informacionit nuk zgjidhet me rregullim të imët.
Rasti 2 - Rregullimi i saktë. Një kompani sigurimesh donte që modeli të prodhonte gjithmonë përmbledhje të politikave në të njëjtën strukturë të ngurtë (pik për klauzolë, me tituj specifikë). Përputhshmëria me kërkesën është mbërthyer në 70%. Pas akordimit të LoRA me 300 mostra të mira, konsistenca e formatit u rrit në 98%. Ky ishte një problem sjelljeje dhe rregullimi i imët ishte mjeti i duhur.
Rasti 3 - Privatësia ikën në të dhëna. Një ekip i dorëzoi regjistrat e bisedave për t'i rregulluar mirë pa i pastruar ato. Regjistrat përmbanin emrat e vërtetë të klientëve dhe numrat e identifikimit. Modeli i mirë-akorduar filloi t'i "rrjedhte" këta emra si rezultat në pyetje që nuk kishin lidhje. Modeli u tërhoq, të dhënat u maskuan dhe u ritrajnuan. Mësimi: Informacioni i fshehur në të dhënat e rregullimit të imët transferohet përgjithmonë te modeli.
Modele të kopjueshme
Më ndihmo të vendos nëse rregullimi i imët është i nevojshëm për këtë problem timin. Problem: [përshkrim] A është ky një problem INFORMACIONI (modeli nuk di diçka) apo një problem SJELLJE (modeli nuk prodhon formatin/tonin/strukturën që dua)? A mund të zgjidhet me prompt, disa-shot dhe RAG fillimisht? Pse të provoni/mos provoni secilën prej tyre? Vetëm në çfarë kushtesh do të rekomandonit akordimin e imët?
Kontrollo këtë grup të dhënash të rregullimit të imët:1) A janë shembujt konsistent në format dhe ton?2) A mbulojnë variacionin në përdorimin aktual?3) A përmban të dhëna konfidenciale/personale (duhet të maskohen)?4) A ka shembuj kontradiktore?Një nëngrup shembujsh: [shembuj] Rendisni çdo problem dhe rregulloni që keni gjetur.
Hartoni një plan vlerësimi para dhe pas rregullimit të imët. Detyrë: [shpjegim]- Si duhet të zgjidhet grupi vlerësues i mbajtur?- Si matet rezultati i modelit bazë?- Me cilën metrikë krahasohet pas rregullimit të imët?- Si të provoj që aftësitë e përgjithshme të mos dëmtohen (harresa katastrofike)?
Sugjeroni hiperparametrat fillestarë për rregullim të imët me LoRA. Madhësia e të dhënave: [numri i mostrave] Qëllimi: [mësim me format/ton] Sugjeroni epokën, shkallën e të mësuarit dhe ndalimin e hershëm për të shmangur mbimësimin.
Tabela e vendimeve: cili mjet kur
nevojë
provoni së pari
Rregullimi i imët?
Modelja nuk di asnjë informacion
RREGULL
nr
Kërkohen të dhëna aktuale
RREGULL
nr
Format specifik i ngurtë
disa të shtëna
Nëse nuk mjafton po
Toni/stili i qëndrueshëm
prompt + disa-goditje
Nëse nuk mjafton po
Zhargoni/stili i fushës
i shpejtë
Nëse kjo nuk mjafton, LoRA
Optimizimi i thjeshtë i detyrave
inxhinieri e shpejtë
Në përgjithësi jo
Gabimet e zakonshme
- Përpjekja për të zgjidhur problemin e informacionit me rregullim të imët. RAG është mjeti i duhur.
- Kryerja në akordim të imët pa konsumuar prompt/few-shot/RAG. Të shtrenjta dhe të panevojshme.
- Trajnim me cilësi të ulët/të dhëna kontradiktore. Të dhëna më pak por të qarta është më mirë.
- Vendosja e të dhënave konfidenciale në arsim. Infiltron në mënyrë të përhershme në model.
- Nuk matet para dhe pas. Ju nuk mund të provoni shërimin.
- Mos testimi i harresës katastrofike. Aftësia e re mund të prishë atë të vjetër.
Në përmbledhje
Rregullimi i imët është një mjet i fuqishëm por i shtrenjtë dhe duhet të merret parasysh vetëm për problemet e sjelljes/formatit pasi të keni konsumuar prompt-few-shot-RAG; problemet e informacionit i përkasin RAG. Metodat me efikasitet parametrash si LoRA janë zgjedhja e parë praktike. Cilësia varet tërësisht nga cilësia e të dhënave; Përdorni të dhëna të vogla, por të pastra, të qëndrueshme dhe konfidenciale. Matni para dhe pas, testoni për mësimin e tepërt dhe humbjen e aftësisë. Rregullimi i imët është një detyrë e kujdesit; Peshoni koston e tij totale kundrejt cilësisë që ofron.
Detyra e aplikimit
Zgjidhni një problem dhe vendosni nëse rregullimi i imët është i nevojshëm duke bërë dallimin midis "njohurisë ose sjelljes" dhe shkruani justifikimin tuaj. Nëse është një problem sjelljeje, përgatitni 20-30 mostra të qëndrueshme, kontrolloni për të dhëna të fshehura dhe dokumentoni një plan vlerësimi para dhe pas (grupi i mbajtur, rezultati bazë, metrika krahasuese, testi i harresës). Nëse mund të zgjidhet me RAG/few-shot në vend të rregullimit të imët, vini re edhe këtë.
listë kontrolli
- [ ] Përcaktova nëse problemi është njohuria apo sjellja.
- [ ] Fillimisht vlerësova alternativat prompt, disa-shot dhe RAG.
- [ ] Kam audituar të dhënat e rregullimit të imët për qëndrueshmëri, diversitet dhe konfidencialitet.
- [ ] I caktova një grup vlerësues të mbajtur dhe mata rezultatin bazë.
- [ ] Kam planifikuar një test krahasimi para-pas dhe harresës.
- [ ] Kam krahasuar koston totale me cilësinë që ofron.