Jedinica 6 / 11

Osnova finog podešavanja: kada, kako i sa kojim rizikom

Dobici:

  • Sposobnost da se razlikuje da li je problem informacija ili ponašanje i procijeni fino podešavanje za probleme u ponašanju tek nakon što se iscrpe brzi, nekoliko hitaca i RAG.
  • Razumijevanje metoda finog podešavanja (SFT, LoRA/PEFT, RLHF) i atributa podataka koji određuju kvalitet (dosljednost, raznolikost, povjerljivost)
  • Sposobnost mjerenja stvarne vrijednosti finog podešavanja s procjenom prije-poslije, testovima preučenosti i katastrofalnog zaboravljanja

Fino podešavanje (prilagođavanje njegovog ponašanja dodatnom obukom prethodno obučenog modela sa vašim vlastitim podacima) je moćan, ali skup alat u arsenalu inženjera koji radi sa LLM. Kada se koristi na pogrešnom mjestu, to je gubitak novca i vremena, ali kada se koristi na pravom mjestu, daje kvalitet koji se ne može postići drugačije. U ovoj jedinici pokrivamo kada je potrebno fino podešavanje, njegove osnovne metode i rizike. Cilj je da vas navede na donošenje odluka.

Prvo pravo pitanje: da li je potrebno fino podešavanje?

Najskuplja greška početnika je da odmah požure sa finim podešavanjem problema koji se može riješiti. Postavite redoslijed ovako:

  1. Prompt inženjering: Dobar upit koji objašnjava zadatak jasno rješava većinu problema. Konzumirajte prvo ovdje.
  2. Učenje u nekoliko koraka: Stavljanje nekoliko primjera u prompt pokazuje modelu željeni format i ponašanje.
  3. RAG: Ako je problem "nedostatak informacija" (potreba za podacima koje model ne poznaje), rješenje je RAG (jedinica 4), a ne fino podešavanje.
  4. Fino podešavanje: dolazi u obzir ako gore navedeno nije dovoljno i problem je "ponašanje/format/stil".

Ključna razlika: Fino podešavanje je slabo i rizično u podučavanju modela novim informacijama; ali je jak u podučavanju kako se ponašati (specifičan format, ton, žargon polja, konzistentna struktura). “Moj model ne zna informacije o našoj kompaniji” → RAG. "Neka moj model uvijek daje izlaz u točnom formatu koji želimo" → kandidat za fino podešavanje.

Savjet: Prije nego što se odlučite za fino podešavanje, pitajte: "Je li ovo problem znanja ili problem ponašanja?" Informacijski problemi se bolje rješavaju pomoću RAG-a, problemi u ponašanju bolje se rješavaju finim podešavanjem.

Metode finog podešavanja

Potpuno fino podešavanje: Ponovno obučavanje svih parametara modela. Najmoćniji ali najskuplji; Zahtijeva veliki hardver (GPU) i pažljive podatke. To je nepotrebno za većinu timova.

Parametarsko efikasno fino podešavanje (PEFT): Metode koje zamrzavaju ogromnu većinu modela, obučavaju samo mali skup dodatnih parametara. Najčešći je LoRA (Low-Rank Adaptation: obučavanje malih "adapterskih" slojeva koji se dodaju modelu). LoRA daje rezultate blizu potpunog finog podešavanja, sa mnogo manje memorije i troškova; Zato je to prvi izbor u praksi.

Nadzirano fino podešavanje (SFT): Učenje modela da "na ovaj ulaz odgovori ovako" sa podacima koji se sastoje od ulazno-idealnih izlaznih parova. To je najčešći scenario.

Učenje s pojačavanjem iz povratnih informacija od ljudi (RLHF): Usklađivanje ponašanja modela sa preferiranim odgovorima ljudi. Složen je i skup; Potrebe većine aplikativnih timova su zadovoljene sa SFT-om. Dovoljno je poznavati RLHF kao pojam.

Podaci: srce finog podešavanja

Kvalitet finog podešavanja u potpunosti ovisi o kvaliteti podataka o obuci. Nekoliko stotina visokokvalitetnih, konzistentnih uzoraka bolje je od hiljada aljkavih. Prilikom pripreme podataka:

  • Dosljednost: Svi primjeri dosljedno pokazuju format i ton koji želite. Kontradiktorni primjeri čine model zbunjenim.
  • Raznolikost: Primjeri pokrivaju raznolikost u stvarnoj upotrebi, ali nisu ujednačeni.
  • Čišćenje: Instance koje sadrže netačne, pristrasne ili skrivene podatke trajno se prenose u model. Podatke za fino podešavanje treba čitati pažljivo kao i ugovor.
Oprez: Svaka pristranost, greška i skrivene informacije koje ulaze u podatke finog podešavanja se urezuju u model i ponovo se pojavljuju na njegovim izlazima. Provjeravajte svoje podatke o obuci jednako pedantno kao da ih objavljujete; Nemojte objavljivati ​​lične podatke.

Pregled: da li je fino podešavanje funkcioniralo?

Prije finog podešavanja, rezervirajte skup za procjenu i izmjerite rezultat modela bez finog podešavanja (osnovni model). Nakon finog podešavanja, izmjerite ponovo u istoj banci. Ne možete reći "bilo je bolje" bez poređenja. Također dvije zamke kojih treba imati na umu:

  • Prekomjerno učenje: Pretreniranost s malim podacima uzrokuje da model izgubi sposobnost pamćenja i generalizacije primjera treninga.
  • Katastrofalno zaboravljanje: Pretreniranost na uskom zadatku može narušiti ukupne sposobnosti modela. Testirajte da li su stare vještine zadržane dok usvajate novo ponašanje.

Slab pristup / Snažan pristup

Slabo: "Imam 3000 dnevnika razgovora, dajmo ih sve na fino podešavanje, tako da model može pričati kao mi."

Güçlü: "Prvo sam procijenio osnovni model sa 100 stvarnih zadataka, zabilježio rezultat. Izmjerio sam koliko se poboljšao sa napomenama i nekoliko snimaka - to nije bilo dovoljno. Zatim sam od 3000 dnevnika odabrao i očistio samo 400 uzoraka visokog kvaliteta, konzistentnog formata i bez skrivenih podataka. Ponovo sam izvršio fino podešavanje0 zadataka i potvrdio sam0. uz poseban test da su opšte sposobnosti netaknute."

Razlika: snažan pristup prvo iscrpljuje alternative, podatke o odabiru trešanja, mjere prije i poslije i testira nuspojave.

Realnost troškova i održavanja

Fino podešavanje nije jednokratni posao; To je obaveza brige. Možda će biti potrebno ponoviti obuku kada se osnovni model ažurira, kada je potrebna promjena ili se podaci izgube. Osim toga, hostovanje fino podešenog modela donosi dodatne troškove i operacije. Uporedite ovaj ukupni trošak vlasništva sa povećanjem kvaliteta koje on pruža. Većinu vremena dobar prompt + RAG je jeftiniji i fleksibilniji od finog podešavanja.

tri mini kofera

Slučaj 1 - Nepotrebno fino podešavanje. Tim je krenuo u skupi projekat finog podešavanja jer "naš model ne poznaje naše proizvode". Mjeseci i budžet su potrošeni, rezultat je bio krhak — model je zastario svaki put kada se promijeni katalog proizvoda. Konačno su prešli na RAG: preuzeli su podatke o proizvodu iz baze dokumenata, ažuriranje je bilo trenutno i cijena je pala. Pouka: problem informacija nije riješen finim podešavanjem.

Slučaj 2 - Ispravno fino podešavanje. Osiguravajuća kompanija je željela da model uvijek proizvodi sažetke polisa u istoj rigidnoj strukturi (stavku po klauzulu, sa specifičnim naslovima). Dosljednost sa promptom je zaglavljena na 70%. Nakon LoRA finog podešavanja sa 300 dobrih uzoraka, konzistentnost formata se povećala na 98%. Ovo je bio problem ponašanja i fino podešavanje je bio pravi alat.

Slučaj 3 - Izbjegavanje privatnosti u podatke. Jedan tim je poslao dnevnike razgovora na fino podešavanje bez njihovog čišćenja. Dnevnici su sadržavali prava imena kupaca i identifikacione brojeve. Fino podešen model počeo je da "curi" ova imena kao izlaz u nepovezanim pitanjima. Model je povučen, podaci maskirani i ponovo obučeni. Lekcija: Skrivene informacije u podacima finog podešavanja se trajno prenose u model.

Predlošci koji se mogu kopirati

Pomozite mi da odlučim da li je potrebno fino podešavanje za ovaj moj problem. Problem: [opis] Da li je ovo problem INFORMACIJE (model nešto ne zna) ili problem PONAŠANJA (model ne proizvodi format/ton/strukturu koji želim)? Može li se to riješiti brzim, nekoliko hitaca i RAG prvim? Zašto probati/ne isprobati svaki od njih? Samo pod kojim uslovima biste preporučili fino podešavanje?

Provjerite ovaj skup podataka za fino podešavanje:1) Da li su primjeri konzistentni u formatu i tonu?2) Da li pokrivaju varijacije u stvarnoj upotrebi?3) Da li sadrži povjerljive/lične podatke (moraju biti maskirani)?4) Postoje li konfliktni primjeri? Podskup primjera: [primjeri]Navedite svaki problem i popravak koji ste pronašli.

Napravite plan evaluacije prije i nakon finog podešavanja. Zadatak: [objašnjenje]- Kako treba odabrati skup za procjenu?- Kako se mjeri rezultat osnovnog modela?- Sa kojom metrikom se poredi nakon finog podešavanja?- Kako da testiram da opšte sposobnosti nisu narušene (katastrofalno zaboravljanje)?

Predložite početne hiperparametre za fino podešavanje sa LoRA. Veličina podataka: [broj uzoraka]Svrha: [nastava formata/tona]Predložite epohu, brzinu učenja i rano zaustavljanje kako biste izbjegli prekomjerno učenje.

Tablica odluka: koji alat kada

potreba

probaj prvo

Fino podešavanje?

Model ne zna nikakve informacije

RAG

br

Potrebni su trenutni podaci

RAG

br

Specifičan kruti format

nekoliko snimaka

Ako nije dovoljno da

Konzistentan ton/stil

brz + nekoliko hitaca

Ako nije dovoljno da

Terenski žargon/stil

prompt

Ako to nije dovoljno, LoRA

Jednostavna optimizacija zadataka

prompt inženjering

Generalno ne

Uobičajene greške

  • Pokušavam riješiti problem informacija finim podešavanjem. KRPPA je pravi alat.
  • Upadanje u fino podešavanje bez konzumiranja prompt/few-shot/RAG. Skupo i nepotrebno.
  • Obuka sa niskim kvalitetom/konfliktnim podacima. Manje, ali jasni podaci su bolji.
  • Stavljanje povjerljivih podataka u obrazovanje. Trajno se infiltrira u model.
  • Ne mjeriti prije i poslije. Ne možete dokazati oporavak.
  • Ne testirati katastrofalno zaboravljanje. Nova vještina može poremetiti staru.

Ukratko

Fino podešavanje je moćan ali skup alat i treba ga uzeti u obzir samo za probleme u ponašanju/formatu nakon konzumiranja prompt-few-shot-RAG; informacioni problemi pripadaju RAG-u. Parametarski efikasne metode kao što je LoRA su praktičan prvi izbor. Kvaliteta u potpunosti ovisi o kvaliteti podataka; Koristite male, ali čiste, dosljedne i povjerljive podatke. Mjerite prije i poslije, testirajte prekomjerno učenje i gubitak sposobnosti. Fino podešavanje je obaveza brige; Odmjerite njegovu ukupnu cijenu u odnosu na kvalitetu koju isporučuje.

Zadatak aplikacije

Odaberite problem i odlučite da li je potrebno fino podešavanje tako što ćete napraviti razliku između "znanja ili ponašanja" i napišite svoje obrazloženje. Ako je problem u ponašanju, pripremite 20-30 konzistentnih uzoraka, provjerite da li postoje skriveni podaci i dokumentirajte plan evaluacije prije i poslije (održani klaster, osnovni rezultat, usporedna metrika, test zaboravljanja). Ako se to može riješiti pomoću RAG-a/nekoliko snimaka umjesto finog podešavanja, zabilježite i ovo.

kontrolna lista

  • [ ] Utvrdio sam da li je problem znanje ili ponašanje.
  • [ ] Prvo sam procijenio brze, nekoliko hitaca i RAG alternative.
  • [ ] Provjerio sam konzistentnost, raznolikost i povjerljivost podataka finog podešavanja.
  • [ ] Dodijelio sam klaster za procjenu i izmjerio osnovni rezultat.
  • [ ] Planirao sam poređenje prije-poslije i test zaboravljanja.
  • [ ] Uporedio sam ukupne troškove sa kvalitetom koji pruža.