Pelnas:
- Gebėjimas atskirti, ar problema yra informacija, ar elgesys, ir įvertinti elgesio problemų koregavimą tik išnaudojus greitą, kelių kadrų ir RAG.
- Supratimas apie koregavimo metodus (SFT, LoRA/PEFT, RLHF) ir duomenų atributus, kurie lemia kokybę (nuoseklumą, įvairovę, konfidencialumą)
- Gebėjimas išmatuoti tikrąją patikslinimo vertę atliekant įvertinimą prieš ir po, permokymosi ir katastrofiško užmiršimo testus
Tikslus derinimas (jo elgsenos pritaikymas mokant iš anksto paruoštą modelį toliau naudojant savo duomenis) yra galingas, bet brangus įrankis inžinieriaus, dirbančio su LLM, arsenale. Kai naudojamas netinkamoje vietoje, tai yra pinigų ir laiko švaistymas, tačiau kai naudojamas netinkamoje vietoje, tai suteikia kokybę, kurios kitaip nepasieksi. Šiame skyriuje aptariame, kada reikia tikslinti, pagrindinius jo metodus ir riziką. Tikslas yra priversti jus priimti sprendimus.
Pirmas teisingas klausimas: ar reikia koreguoti?
Brangiausia pradedančiųjų klaida – nedelsiant skubėti patikslinti problemą, kurią galima išspręsti. Nustatykite tvarką taip:
- Greita inžinerija: geras raginimas, aiškiai paaiškinantis užduotį, išsprendžia daugumą problemų. Pirmiausia suvartokite čia.
- Mokymasis trumpai: įdėjus kelis pavyzdžius į raginimą, modelis parodo norimą formatą ir elgseną.
- RAG: jei problema yra „informacijos trūkumas“ (reikia duomenų, kurių modelis nežino), sprendimas yra RAG (4 skyrius), o ne koregavimas.
- Tikslus reguliavimas: tai taikoma, jei to nepakanka, o problema yra „elgesys / formatas / stilius“.
Pagrindinis skirtumas: Tikslus derinimas yra silpnas ir rizikingas mokant modelį naujos informacijos; bet stipriai moko elgtis (konkretus formatas, tonas, lauko žargonas, nuosekli struktūra). „Mano modelis nežino mūsų įmonės informacijos“ → RAG. „Tegul mano modelis visada pateikia išvestį tiksliai tokiu formatu, kokio norime“ → tikslinio derinimo kandidatas.
Patarimas: prieš priimdami sprendimą dėl koregavimo, paklauskite: „Ar tai žinių ar elgesio problema? Informacinės problemos geriau išsprendžiamos naudojant RAG, elgesio problemos geriau išsprendžiamos koreguojant.
Tikslaus derinimo metodai
Visiškas koregavimas: visų modelio parametrų perkvalifikavimas. Galingiausias, bet brangiausias; Tam reikia didelės aparatinės įrangos (GPU) ir kruopštaus duomenų. Daugeliui komandų tai nereikalinga.
Parametrų efektyvumo koregavimas (PEFT): metodai, kurie sustabdo didžiąją modelio dalį, apmokydami tik nedidelį papildomų parametrų rinkinį. Labiausiai paplitęs yra LoRA (Low-Rank Adaptation: mokymo maži "adapterio" sluoksniai pridedami prie modelio). „LoRA“ suteikia rezultatus beveik iki galo, su daug mažiau atminties ir išlaidų; Štai kodėl tai yra pirmasis pasirinkimas praktikoje.
Prižiūrėtas tikslus derinimas (SFT): modelio mokymas „reaguoti į šią įvestį taip“ naudojant duomenis, sudarytus iš įvesties idealių išvesties porų. Tai yra labiausiai paplitęs scenarijus.
Mokymasis iš žmogaus grįžtamojo ryšio (RLHF): modelio elgesio suderinimas su žmonių pageidaujamais atsakymais. Tai sudėtinga ir brangi; Daugumos programų grupių poreikiai patenkinami naudojant SFT. Pakanka žinoti RLHF kaip sąvoką.
Duomenys: koregavimo pagrindas
Tikslaus derinimo kokybė visiškai priklauso nuo treniruočių duomenų kokybės. Keli šimtai aukštos kokybės, nuoseklių pavyzdžių yra geriau nei tūkstančiai netvarkingų. Rengiant duomenis:
- Nuoseklumas: visi pavyzdžiai nuosekliai rodo norimą formatą ir toną. Prieštaringi pavyzdžiai supainioja modelį.
- Veislė: pavyzdžiai apima faktinio naudojimo veislę, bet nėra vienodi.
- Valymas: egzemplioriai, kuriuose yra neteisingų, šališkų arba paslėptų duomenų, visam laikui perduodami modeliui. Tikslūs duomenys turėtų būti skaitomi taip pat atidžiai, kaip ir sutartis.
Atsargiai: kiekviena paklaida, klaida ir paslėpta informacija, įvedanti koreguojamuosius duomenis, yra išgraviruota į modelį ir vėl pasirodo jo išvestyje. Audituokite savo treniruočių duomenis taip kruopščiai, lyg juos skelbtumėte; Neskelbti asmeninių duomenų.
Apžvalga: ar patikslinimas veikė?
Prieš patikslindami, rezervuokite išlaikytą įvertinimo rinkinį ir išmatuokite modelio rezultatą be tikslaus derinimo (bazinis modelis). Po tikslaus derinimo išmatuokite dar kartą tame pačiame banke. Negalite sakyti „pagerėjo“ be palyginimo. Taip pat reikia žinoti dvi spąstus:
- Permokymasis: Persitreniruojant naudojant mažus duomenis modelis praranda gebėjimą įsiminti ir apibendrinti mokymo pavyzdžius.
- Katastrofiškas užmiršimas: pervargimas atliekant siaurą užduotį gali pakenkti bendriems modelio gebėjimams. Išbandykite, ar įgyjant naują elgesį išsaugomi seni įgūdžiai.
Silpnas požiūris / Stiprus požiūris
Silpnas: „Turiu 3000 pokalbių žurnalų, atiduokime juos visus patikslinti, kad modelis galėtų kalbėti kaip mes“.
Güçlü: "Pirmiausia įvertinau bazinį modelį su 100 realių užduočių, pažymėjau balą. Išmatavau, kiek jis pagerėjo raginimais ir keliais šūviais – to nepakako. Tada iš 3000 žurnalų atrinkau ir išvaliau tik 400 pavyzdžių su aukštos kokybės, nuosekliu formatu ir be paslėptų duomenų. Tiksliai sureguliavau su LoRA su ta pačia užduotimi ir vėl išmatavau pajėgumai buvo nepažeisti“.
Skirtumas: taikant tvirtą metodą pirmiausia išnaudojamos alternatyvos, renkami duomenys, atliekami matavimai prieš ir po ir tikrinami šalutiniai poveikiai.
Išlaidų ir priežiūros realybė
Tikslus derinimas nėra vienkartinis darbas; Tai pareiga rūpintis. Gali prireikti persikvalifikuoti, kai bazinis modelis atnaujinamas, reikia keisti arba prarandami duomenys. Be to, sureguliuoto modelio talpinimas sukelia papildomų išlaidų ir operacijų. Palyginkite šias bendras nuosavybės išlaidas su jos teikiamos kokybės pagerėjimu. Dažniausiai geras raginimas + RAG yra pigesnis ir lankstesnis nei koregavimas.
trys mini dėklai
1 atvejis – nereikalingas koregavimas. Komanda ėmėsi brangaus koregavimo projekto, nes „mūsų modelis nepažįsta mūsų produktų“. Buvo praleisti mėnesiai ir biudžetas, rezultatas buvo trapus – modelis pasendavo kiekvieną kartą, kai keitėsi prekių katalogas. Galiausiai jie perėjo prie RAG: jie gavo produkto duomenis iš dokumentų bazės, atnaujinimas buvo akimirksniu, o kaina sumažėjo. Pamoka: informacijos problema nėra išspręsta koreguojant.
2 atvejis – teisingas koregavimas. Draudimo bendrovė norėjo, kad modelis visada sudarytų polisų santraukas pagal tą pačią griežtą struktūrą (straipsnis po išlygos su konkrečiomis antraštėmis). Nuoseklumas su raginimu įstrigo 70%. Po LoRA patikslinimo su 300 gerų pavyzdžių formato nuoseklumas padidėjo iki 98%. Tai buvo elgesio problema, o koregavimas buvo tinkama priemonė.
3 atvejis – privatumo pabėgimas į duomenis. Viena komanda pateikė pokalbių žurnalams patikslinti jų neišvalius. Žurnaluose buvo nurodyti tikri klientų vardai ir identifikavimo numeriai. Tiksliai sureguliuotas modelis pradėjo „nutekėti“ šiuos pavadinimus kaip nesusijusius klausimus. Modelis buvo atšauktas, duomenys užmaskuoti ir perkvalifikuoti. Pamoka: Paslėpta informacija koreguojamuose duomenyse visam laikui perkeliama į modelį.
Kopijuojami šablonai
Padėkite man nuspręsti, ar reikia koreguoti šią mano problemą. Problema: [description] Ar tai INFORMACIJA (modelis kažko nežino) ar ELGESIO problema (modelis nesukuria norimo formato/tono/struktūros)? Ar tai galima išspręsti naudojant greitą, kelių kadrų ir RAG? Kodėl išbandyti / neišbandyti kiekvieną iš jų? Tik kokiomis sąlygomis rekomenduotumėte patikslinti?
Patikrinkite šį patikslinimo duomenų rinkinį:1) Ar pavyzdžiai atitinka formatą ir toną?2) Ar jie apima faktinio naudojimo skirtumus?3) Ar jame yra konfidencialių / asmeninių duomenų (turi būti užmaskuoti)?4) Ar yra prieštaraujančių pavyzdžių?Pavyzdžių poaibis: [pavyzdžiai]Išvardykite kiekvieną problemą ir pataisykite, ką radote.
Sudarykite vertinimo planą prieš ir po koregavimo. Užduotis: [paaiškinimas]- Kaip pasirinkti išlaikomą įvertinimo aibę?- Kaip matuojamas bazinio modelio balas?- Su kokia metrika jis lyginamas po patikslinimo?- Kaip patikrinti, ar nepablogėja bendrosios galimybės (katastrofiškai pamirštama)?
Siūlykite pradinius hiperparametrus, skirtus tiksliam LoRA derinimui. Duomenų dydis: [pavyzdžių skaičius] Tikslas: [formato / tono mokymas]Siūlyti epochą, mokymosi greitį ir ankstyvą sustabdymą, kad būtų išvengta perdėto mokymosi.
Sprendimų lentelė: kokia priemonė kada
reikia
pirma pabandyk
Tikslus derinimas?
Modelis nežino jokios informacijos
RAG
ne
Reikalingi dabartiniai duomenys
RAG
ne
Specifinis standus formatas
keli šūviai
Jei nepakanka, taip
Nuoseklus tonas/stilius
raginimas + keli kadrai
Jei nepakanka, taip
Lauko žargonas/stilius
paraginti
Jei to nepakanka, LoRA
Paprastas užduočių optimizavimas
greita inžinerija
Apskritai ne
Dažnos klaidos
- Informacijos problemą bandoma išspręsti koreguojant. RAG yra tinkamas įrankis.
- Paleidžiamas tikslus derinimas, nenaudojant greito / kelių kadrų / RAG. Brangus ir nereikalingas.
- Mokymai su žemos kokybės / prieštaraujančiais duomenimis. Mažiau, bet aiškūs duomenys yra geriau.
- Konfidencialių duomenų įtraukimas į švietimą. Visam laikui įsiskverbia į modelį.
- Nematuojama prieš ir po. Jūs negalite įrodyti pasveikimo.
- Nebando katastrofiško užmiršimo. Naujas įgūdis gali sutrikdyti senąjį.
Apibendrinant
Tikslus derinimas yra galingas, bet brangus įrankis ir turėtų būti svarstomas tik elgsenos / formato problemų atveju, kai sunaudojama prompt-few-shot-RAG; informacinės problemos priklauso RAG. Parametrus efektyvūs metodai, tokie kaip LoRA, yra pirmasis praktinis pasirinkimas. Kokybė visiškai priklauso nuo duomenų kokybės; Naudokite nedidelius, bet švarius, nuoseklius ir konfidencialius duomenis. Išmatuokite prieš ir po, patikrinkite, ar nesimokote ir nepraradote gebėjimų. Tikslus derinimas yra rūpestingumo pareiga; Pasverkite visas jo kainas su jo teikiama kokybe.
Taikymo užduotis
Pasirinkite problemą ir nuspręskite, ar reikia tikslinimo, atskirdami „žinias ar elgesį“, ir parašykite savo pagrindimą. Jei tai elgesio problema, paruoškite 20–30 nuoseklių pavyzdžių, patikrinkite, ar nėra paslėptų duomenų, ir dokumentuokite vertinimo planą prieš ir po (išlaikytas klasteris, bazinis balas, palyginimo metrika, užmiršimo testas). Jei tai gali būti išspręsta naudojant RAG/few-shot, o ne koreguojant, atkreipkite dėmesį ir į tai.
kontrolinis sąrašas
- [ ] Nusprendžiau, ar problema yra žinios ar elgesys.
- [ ] Pirmiausia įvertinau greitas, kelių kadrų ir RAG alternatyvas.
- [ ] Aš patikrinau patikslinamuosius duomenis dėl nuoseklumo, įvairovės ir konfidencialumo.
- [ ] Paskyriau išlaikytą vertinimo grupę ir išmatavau bazinį balą.
- [ ] Suplanavau palyginimą prieš ir po ir užmiršimo testą.
- [ ] Bendras išlaidas palyginau su jos teikiama kokybe.