Njësia 6 / 11

Baza e rregullimit të imët: Kur, si dhe me çfarë rreziku

Fitimet:

  • Aftësia për të dalluar nëse një problem është informacion apo sjellje dhe për të vlerësuar rregullimin e saktë për problemet e sjelljes vetëm pasi të jenë shteruar kërkesat e shpejta, disa goditje dhe RAG.
  • Kuptimi i metodave të rregullimit të imët (SFT, LoRA/PEFT, RLHF) dhe atributeve të të dhënave që përcaktojnë cilësinë (konsistenca, diversiteti, konfidencialiteti)
  • Aftësia për të matur vlerën e vërtetë të rregullimit të imët me teste para-pas vlerësimit, mësimit të tepërt dhe harresës katastrofike

Rregullimi i imët (përshtatja e sjelljes së tij duke trajnuar më tej një model të para-trajnuar me të dhënat tuaja) është një mjet i fuqishëm, por i shtrenjtë në arsenalin e inxhinierit që punon me LLM. Kur përdoret në vendin e gabuar, është humbje parash dhe kohe, por kur përdoret në vendin e duhur, jep një cilësi që nuk mund të arrihet ndryshe. Në këtë njësi, ne mbulojmë kur është i nevojshëm rregullimi i imët, metodat bazë dhe rreziqet e tij. Qëllimi është t'ju bëjë vendimmarrës.

Së pari pyetja e duhur: a është i nevojshëm rregullimi i imët?

Gabimi më i shtrenjtë i fillestarëve është që menjëherë të nxitojnë për të rregulluar mirë një problem që mund të zgjidhet. Vendosni rendin si kjo:

  1. Inxhinieri e shpejtë: Një njoftim i mirë që shpjegon detyrën zgjidh qartë shumicën e problemeve. Konsumojeni këtu së pari.
  2. Mësimi i pakët: Vendosja e disa shembujve në prompt i tregon modelit formatin dhe sjelljen e dëshiruar.
  3. RAG: Nëse problemi është "mungesa e informacionit" (nevoja për të dhëna që modeli nuk i njeh), zgjidhja është RAG (njësia 4), jo rregullimi i imët.
  4. Rregullimi i imët: Ai hyn në lojë nëse sa më sipër nuk mjafton dhe problemi është "sjellja/formati/stili".

Dallimi kryesor: Rregullimi i imët është i dobët dhe i rrezikshëm për t'i mësuar modelit informacion të ri; por është i fortë në mësimdhënien se si të sillemi (një format specifik, ton, zhargon në terren, strukturë konsistente). "Modeli im nuk i njeh informacionet e kompanisë sonë" → RAG. "Lëreni modelin tim të japë gjithmonë rezultatin në formatin e saktë që duam" → kandidati për rregullim të imët.

Këshillë: Përpara se të vendosni për rregullimin e imët, pyesni: "A është ky një problem njohurish apo një problem sjelljeje?" Problemet e informacionit zgjidhen më mirë me RAG, problemet e sjelljes zgjidhen më mirë me rregullim të imët.

Metodat e rregullimit të imët

Rregullimi i plotë i imët: Rikualifikimi i të gjithë parametrave të modelit. Më i fuqishmi por më i shtrenjtë; Kërkon pajisje të mëdha (GPU) dhe të dhëna të kujdesshme. Është e panevojshme për shumicën e skuadrave.

Rregullimi i imët me efikasitet në parametra (PEFT): Metoda që ngrijnë shumicën dërrmuese të modelit, duke trajnuar vetëm një grup të vogël parametrash shtesë. Më e zakonshmja është LoRA (Përshtatja e rangut të ulët: trajnimi i shtresave të vogla "përshtatëse" të shtuara në model). LoRA ofron rezultate afër akordimit të plotë, me shumë më pak memorie dhe kosto; Kjo është arsyeja pse është zgjedhja e parë në praktikë.

Rregullimi i imët i mbikëqyrur (SFT): Mësimi i modelit t'i "përgjigjet kësaj hyrjeje në këtë mënyrë" me të dhëna që përbëhen nga çifte hyrje-dalje ideale. Është skenari më i zakonshëm.

Të mësuarit përforcues nga reagimet njerëzore (RLHF): Përafrimi i sjelljes së modelit nga përgjigjet e preferuara të njerëzve. Është kompleks dhe i shtrenjtë; Nevojat e shumicës së ekipeve të aplikimit plotësohen me SFT. Mjafton të njohësh RLHF si koncept.

Të dhënat: zemra e rregullimit të imët

Cilësia e rregullimit të imët varet tërësisht nga cilësia e të dhënave të trajnimit. Disa qindra mostra konsistente me cilësi të lartë janë më të mira se mijëra mostra të ngadalta. Gjatë përgatitjes së të dhënave:

  • Konsistenca: Të gjithë shembujt tregojnë vazhdimisht formatin dhe tonin që dëshironi. Shembujt kontradiktore e lënë modelin konfuz.
  • Shumëllojshmëria: Shembujt mbulojnë varietetin në përdorim aktual, por nuk janë uniformë.
  • Pastrimi: Instancat që përmbajnë të dhëna të pasakta, të njëanshme ose të fshehura kalohen përgjithmonë në model. Të dhënat e rregullimit të imët duhet të lexohen me aq kujdes sa një kontratë.
Kujdes: Çdo paragjykim, gabim dhe informacion i fshehur që hyn në të dhënat e rregullimit të imët gërmohet në model dhe rishfaqet në daljet e tij. Kontrolloni të dhënat tuaja të trajnimit me aq përpikëri sikur po i publikonit; Mos postoni të dhëna personale.

Rishikimi: a funksionoi rregullimi i imët?

Përpara akordimit, rezervoni një grup vlerësues të mbajtur dhe matni rezultatin e modelit pa akordim të imët (modeli bazë). Pas akordimit, matni përsëri në të njëjtën bankë. Nuk mund të thuash "u bë më mirë" pa krahasim. Gjithashtu dy kurthe për t'u kujdesur:

  • Mbi-mësimi: Mbi-stërvitja me të dhëna të vogla bën që modeli të humbasë aftësinë e tij për të memorizuar dhe përgjithësuar shembuj trajnimi.
  • Harresa katastrofike: Stërvitja e tepërt në një detyrë të ngushtë mund të dëmtojë aftësitë e përgjithshme të modelit. Testoni nëse aftësitë e vjetra ruhen gjatë përvetësimit të sjelljes së re.

Qasje e dobët / Qasje e fortë

I dobët: "Kam 3000 regjistra bisedash, le t'i japim të gjitha në rregullim të imët, që modelja të flasë si ne."

Güçlü: "Së pari vlerësova modelin bazë me 100 detyra reale, vura në dukje rezultatin. Mata se sa u përmirësua me nxitje dhe disa shkrepje - nuk ishte e mjaftueshme. Më pas nga 3000 regjistrat, zgjodha dhe pastrova vetëm 400 mostra me cilësi të lartë, format konsistent dhe pa të dhëna të fshehura të matura përsëri me detyrat e njëjta, LoRA-t. konfirmoi me një test të veçantë se aftësitë e përgjithshme ishin të paprekura."

Dallimi: qasja e fortë shter alternativat së pari, të dhënat e përzgjedhjes së qershisë, masat para dhe pas dhe testet për efekte anësore.

Realiteti i kostos dhe mirëmbajtjes

Rregullimi i imët nuk është një punë vetëm një herë; Është detyrë e kujdesit. Mund të jetë e nevojshme të ritrajnohet kur modeli bazë përditësohet, ka nevojë të ndryshojë ose të dhënat humbasin. Për më tepër, mbajtja e një modeli të rregulluar mirë sjell kosto dhe operacione shtesë. Krahasoni këtë kosto totale të pronësisë me rritjen e cilësisë që ofron. Shumicën e kohës një prompt i mirë + RAG është më i lirë dhe më fleksibël sesa rregullimi i imët.

tre mini kuti

Rasti 1 - Rregullim i panevojshëm i imët. Një ekip filloi një projekt të shtrenjtë akordimi sepse "modeli ynë nuk i njeh produktet tona". U shpenzuan muaj dhe buxhet, rezultati ishte i brishtë - modeli u vjetërua sa herë që ndryshonte katalogu i produkteve. Më në fund ata kaluan në RAG: ata morën të dhënat e produktit nga baza e dokumenteve, përditësimi ishte i menjëhershëm dhe kostoja ra. Mësimi: problemi i informacionit nuk zgjidhet me rregullim të imët.

Rasti 2 - Rregullimi i saktë. Një kompani sigurimesh donte që modeli të prodhonte gjithmonë përmbledhje të politikave në të njëjtën strukturë të ngurtë (pik për klauzolë, me tituj specifikë). Përputhshmëria me kërkesën është mbërthyer në 70%. Pas akordimit të LoRA me 300 mostra të mira, konsistenca e formatit u rrit në 98%. Ky ishte një problem sjelljeje dhe rregullimi i imët ishte mjeti i duhur.

Rasti 3 - Privatësia ikën në të dhëna. Një ekip i dorëzoi regjistrat e bisedave për t'i rregulluar mirë pa i pastruar ato. Regjistrat përmbanin emrat e vërtetë të klientëve dhe numrat e identifikimit. Modeli i mirë-akorduar filloi t'i "rrjedhte" këta emra si rezultat në pyetje që nuk kishin lidhje. Modeli u tërhoq, të dhënat u maskuan dhe u ritrajnuan. Mësimi: Informacioni i fshehur në të dhënat e rregullimit të imët transferohet përgjithmonë te modeli.

Modele të kopjueshme

Më ndihmo të vendos nëse rregullimi i imët është i nevojshëm për këtë problem timin. Problem: [përshkrim] A është ky një problem INFORMACIONI (modeli nuk di diçka) apo një problem SJELLJE (modeli nuk prodhon formatin/tonin/strukturën që dua)? A mund të zgjidhet me prompt, disa-shot dhe RAG fillimisht? Pse të provoni/mos provoni secilën prej tyre? Vetëm në çfarë kushtesh do të rekomandonit akordimin e imët?

Kontrollo këtë grup të dhënash të rregullimit të imët:1) A janë shembujt konsistent në format dhe ton?2) A mbulojnë variacionin në përdorimin aktual?3) A përmban të dhëna konfidenciale/personale (duhet të maskohen)?4) A ka shembuj kontradiktore?Një nëngrup shembujsh: [shembuj] Rendisni çdo problem dhe rregulloni që keni gjetur.

Hartoni një plan vlerësimi para dhe pas rregullimit të imët. Detyrë: [shpjegim]- Si duhet të zgjidhet grupi vlerësues i mbajtur?- Si matet rezultati i modelit bazë?- Me cilën metrikë krahasohet pas rregullimit të imët?- Si të provoj që aftësitë e përgjithshme të mos dëmtohen (harresa katastrofike)?

Sugjeroni hiperparametrat fillestarë për rregullim të imët me LoRA. Madhësia e të dhënave: [numri i mostrave] Qëllimi: [mësim me format/ton] Sugjeroni epokën, shkallën e të mësuarit dhe ndalimin e hershëm për të shmangur mbimësimin.

Tabela e vendimeve: cili mjet kur

nevojë

provoni së pari

Rregullimi i imët?

Modelja nuk di asnjë informacion

RREGULL

nr

Kërkohen të dhëna aktuale

RREGULL

nr

Format specifik i ngurtë

disa të shtëna

Nëse nuk mjafton po

Toni/stili i qëndrueshëm

prompt + disa-goditje

Nëse nuk mjafton po

Zhargoni/stili i fushës

i shpejtë

Nëse kjo nuk mjafton, LoRA

Optimizimi i thjeshtë i detyrave

inxhinieri e shpejtë

Në përgjithësi jo

Gabimet e zakonshme

  • Përpjekja për të zgjidhur problemin e informacionit me rregullim të imët. RAG është mjeti i duhur.
  • Kryerja në akordim të imët pa konsumuar prompt/few-shot/RAG. Të shtrenjta dhe të panevojshme.
  • Trajnim me cilësi të ulët/të dhëna kontradiktore. Të dhëna më pak por të qarta është më mirë.
  • Vendosja e të dhënave konfidenciale në arsim. Infiltron në mënyrë të përhershme në model.
  • Nuk matet para dhe pas. Ju nuk mund të provoni shërimin.
  • Mos testimi i harresës katastrofike. Aftësia e re mund të prishë atë të vjetër.

Në përmbledhje

Rregullimi i imët është një mjet i fuqishëm por i shtrenjtë dhe duhet të merret parasysh vetëm për problemet e sjelljes/formatit pasi të keni konsumuar prompt-few-shot-RAG; problemet e informacionit i përkasin RAG. Metodat me efikasitet parametrash si LoRA janë zgjedhja e parë praktike. Cilësia varet tërësisht nga cilësia e të dhënave; Përdorni të dhëna të vogla, por të pastra, të qëndrueshme dhe konfidenciale. Matni para dhe pas, testoni për mësimin e tepërt dhe humbjen e aftësisë. Rregullimi i imët është një detyrë e kujdesit; Peshoni koston e tij totale kundrejt cilësisë që ofron.

Detyra e aplikimit

Zgjidhni një problem dhe vendosni nëse rregullimi i imët është i nevojshëm duke bërë dallimin midis "njohurisë ose sjelljes" dhe shkruani justifikimin tuaj. Nëse është një problem sjelljeje, përgatitni 20-30 mostra të qëndrueshme, kontrolloni për të dhëna të fshehura dhe dokumentoni një plan vlerësimi para dhe pas (grupi i mbajtur, rezultati bazë, metrika krahasuese, testi i harresës). Nëse mund të zgjidhet me RAG/few-shot në vend të rregullimit të imët, vini re edhe këtë.

listë kontrolli

  • [ ] Përcaktova nëse problemi është njohuria apo sjellja.
  • [ ] Fillimisht vlerësova alternativat prompt, disa-shot dhe RAG.
  • [ ] Kam audituar të dhënat e rregullimit të imët për qëndrueshmëri, diversitet dhe konfidencialitet.
  • [ ] I caktova një grup vlerësues të mbajtur dhe mata rezultatin bazë.
  • [ ] Kam planifikuar një test krahasimi para-pas dhe harresës.
  • [ ] Kam krahasuar koston totale me cilësinë që ofron.