zisky:
- Schopnosť rozlíšiť, či je problém informácia alebo správanie, a vyhodnotiť doladenie problémov so správaním až po vyčerpaní rýchlych, niekoľkých výstrelov a RAG.
- Pochopenie metód jemného ladenia (SFT, LoRA/PEFT, RLHF) a atribútov údajov, ktoré určujú kvalitu (konzistencia, rozmanitosť, dôvernosť)
- Schopnosť zmerať skutočnú hodnotu jemného ladenia pomocou hodnotenia pred a po, testov preučenia a katastrofických testov zabúdania
Jemné ladenie (prispôsobenie jeho správania ďalším trénovaním vopred trénovaného modelu s vašimi vlastnými údajmi) je výkonný, ale drahý nástroj v arzenáli inžinierov pracujúcich s LLM. Pri použití na nesprávnom mieste je to strata peňazí a času, no pri použití na správnom mieste poskytuje kvalitu, ktorá sa inak dosiahnuť nedá. V tejto jednotke pokryjeme, kedy je potrebné dolaďovanie, jeho základné metódy a riziká. Cieľom je, aby ste sa rozhodli.
Najprv správna otázka: je potrebné dolaďovanie?
Najdrahšou chybou začiatočníkov je, že sa okamžite vrhnú na dolaďovanie problému, ktorý sa dá vyriešiť. Objednávku nastavte takto:
- Prompt Engineering: Dobrá výzva, ktorá vysvetľuje úlohu jasne rieši väčšinu problémov. Tu najskôr skonzumujte.
- Niekoľkonásobné učenie: Uvedením niekoľkých príkladov do výzvy sa modelu ukáže požadovaný formát a správanie.
- RAG: Ak je problémom „nedostatok informácií“ (potreba údajov, ktoré model nepozná), riešením je RAG (jednotka 4), nie dolaďovanie.
- Jemné doladenie: Do hry prichádza, ak vyššie uvedené nestačí a problémom je „správanie/formát/štýl“.
Kľúčový rozdiel: Jemné ladenie je slabé a riskantné pri učení modelu novým informáciám; ale je silná pri učení, ako sa správať (špecifický formát, tón, žargón poľa, konzistentná štruktúra). „Môj model nepozná informácie o našej spoločnosti“ → RAG. „Nech môj model vždy poskytne výstup v presnom formáte, aký chceme“ → kandidát na jemné doladenie.
Tip: Skôr než sa rozhodnete pre jemné doladenie, opýtajte sa: "Je to problém s vedomosťami alebo problém so správaním?" Informačné problémy sa lepšie riešia pomocou RAG, problémy so správaním sa lepšie riešia jemným doladením.
Metódy jemného ladenia
Úplné doladenie: Pretrénovanie všetkých parametrov modelu. Najvýkonnejší, ale najdrahší; Vyžaduje si to veľký hardvér (GPU) a starostlivé dáta. Pre väčšinu tímov je to zbytočné.
Parametrovo efektívne jemné ladenie (PEFT): Metódy, ktoré zmrazujú veľkú väčšinu modelu, trénujú len malú množinu dodatočných parametrov. Najbežnejšia je LoRA (Low-Rank Adaptation: tréningové malé vrstvy „adaptéra“ pridané do modelu). LoRA poskytuje výsledky blízke úplnému jemnému doladeniu, s oveľa menšou pamäťou a nákladmi; Preto je v praxi prvou voľbou.
Supervised Fine-Tuning (SFT): Učenie modelu „reagovať na tento vstup takto“ s údajmi pozostávajúcimi z párov vstup-ideálny výstup. Je to najbežnejší scenár.
Posilnenie učenia z ľudskej spätnej väzby (RLHF): Zosúladenie správania modelu s preferovanými reakciami ľudí. Je to zložité a drahé; Potreby väčšiny aplikačných tímov spĺňa SFT. Stačí poznať RLHF ako pojem.
Dáta: srdce jemného ladenia
Kvalita jemného doladenia závisí výlučne od kvality tréningových údajov. Niekoľko stoviek kvalitných a konzistentných vzoriek je lepších ako tisíce nedbalých. Pri príprave údajov:
- Konzistencia: Všetky príklady konzistentne zobrazujú požadovaný formát a tón. Protichodné príklady zanechávajú model zmätený.
- Odroda: Príklady pokrývajú odrodu v skutočnom použití, ale nie sú jednotné.
- Čistenie: Inštancie obsahujúce nesprávne, skreslené alebo skryté údaje sa natrvalo prenesú do modelu. Údaje o dolaďovaní by ste si mali prečítať rovnako pozorne ako zmluvu.
Upozornenie: Každá odchýlka, chyba a skrytá informácia, ktorá vstúpi do dolaďovacích údajov, sa vryje do modelu a znova sa objaví v jeho výstupoch. Auditujte svoje tréningové údaje tak dôkladne, ako keby ste ich zverejňovali; Neuverejňujte osobné údaje.
Recenzia: Fungovalo doladenie?
Pred jemným dolaďovaním si rezervujte držanú hodnotiacu súpravu a zmerajte skóre modelu bez jemného doladenia (základný model). Po doladení znova zmerajte v tej istej banke. Bez porovnania sa nedá povedať „zlepšilo sa to“. Tiež si treba uvedomiť dve pasce:
- Pretrénovanie: Pretrénovanie s malými údajmi spôsobí, že model stratí schopnosť zapamätať si a zovšeobecniť tréningové príklady.
- Katastrofálne zabúdanie: Pretrénovanie na úzkej úlohe môže zhoršiť celkové schopnosti modelu. Otestujte, či si pri osvojovaní nového správania zachovávajú staré zručnosti.
Slabý prístup / Silný prístup
Slabý: "Mám 3000 chat logov, dajme ich všetky na doladenie, aby model mohol rozprávať ako my."
Güçlü: "Najskôr som vyhodnotil základný model so 100 skutočnými úlohami, zaznamenal som skóre. Zmeral som, o koľko sa zlepšil pomocou výziev a niekoľkých záberov - nestačilo to. Potom som z 3 000 protokolov vybral a vyčistil iba 400 vzoriek s vysokou kvalitou, konzistentným formátom a bez skrytých údajov. Doladil som pomocou LoRA, namerali som znova, že všeobecné schopnosti boli znova potvrdené tým istým testom a 10 úlohami."
Rozdiel: silný prístup najskôr vyčerpá alternatívy, vyberie údaje, meria pred a po a testuje vedľajšie účinky.
Realita nákladov a údržby
Dolaďovanie nie je jednorazová práca; Je to povinnosť starostlivosti. Môže byť potrebné preškolenie, keď sa základný model aktualizuje, potrebuje zmenu alebo sa stratia údaje. Okrem toho hosťovanie vyladeného modelu prináša dodatočné náklady a operácie. Porovnajte tieto celkové náklady na vlastníctvo so zvýšením kvality, ktorú poskytuje. Dobrý prompt + RAG je väčšinou lacnejší a flexibilnejší ako jemné ladenie.
tri mini prípady
Prípad 1 – Zbytočné dolaďovanie. Tím sa pustil do drahého dolaďovacieho projektu, pretože „náš model nepozná naše produkty“. Boli vyčerpané mesiace a rozpočet, výsledok bol krehký – model sa stal zastaraným pri každej zmene katalógu produktov. Nakoniec prešli na RAG: získali údaje o produkte zo základne dokumentov, aktualizácia bola okamžitá a náklady klesli. Ponaučenie: informačný problém sa nevyrieši dolaďovaním.
Prípad 2 – Správne jemné doladenie. Poisťovňa chcela, aby model vždy vytváral súhrny poistných zmlúv v rovnakej pevnej štruktúre (položka po klauzule, so špecifickými nadpismi). Konzistencia s výzvou je zaseknutá na 70 %. Po doladení LoRA s 300 dobrými vzorkami sa konzistencia formátu zvýšila na 98 %. Bol to problém so správaním a jemné ladenie bolo tým správnym nástrojom.
Prípad 3 – Súkromie unikajúce do údajov. Jeden tím predložil denníky chatu na doladenie bez toho, aby ich vyčistil. Záznamy obsahovali skutočné mená zákazníkov a identifikačné čísla. Doladený model začal tieto názvy „vypúšťať“ ako výstup v nesúvisiacich otázkach. Model bol stiahnutý, údaje zamaskované a preškolené. Lekcia: Skryté informácie v údajoch jemného ladenia sa natrvalo prenesú do modelu.
Kopírovateľné šablóny
Pomôžte mi rozhodnúť sa, či je potrebné dolaďovanie tohto môjho problému. Problém: [popis] Je to problém INFORMÁCIÍ (model niečo nevie) alebo problém SPRÁVANIA (model nevytvára požadovaný formát/tón/štruktúru)? Dá sa to vyriešiť promptne, niekoľkými ranami a najskôr RAG? Prečo vyskúšať/nevyskúšať každý z nich? Len za akých podmienok by ste odporučili doladiť?
Skontrolujte túto množinu dolaďovacích údajov: 1) Sú príklady konzistentné vo formáte a tóne?2) Pokrývajú variácie v skutočnom používaní?3) Obsahuje dôverné/osobné údaje (treba maskovať)?4) Existujú protichodné príklady? Podmnožina príkladov: [príklady]Uveďte každý problém a opravu, ktorú ste našli.
Vytvorte plán hodnotenia pred a po doladení. Úloha: [vysvetlenie]- Ako by sa mala vybrať zadržaná hodnotiaca množina?- Ako sa meria skóre základného modelu?- S ktorou metrikou sa porovnáva po doladení?- Ako otestujem, že všeobecné schopnosti nie sú narušené (katastrofické zabudnutie)?
Navrhnite počiatočné hyperparametre na jemné doladenie pomocou LoRA. Veľkosť údajov: [počet vzoriek] Účel: [učenie vo formáte/tóne] Navrhnite epochu, rýchlosť učenia a skoré zastavenie, aby ste sa vyhli preučeniu.
Rozhodovacia tabuľka: ktorý nástroj kedy
potrebu
skúste najskôr
Dolaďovanie?
Modelka nevie žiadne informácie
RAG
č
Vyžadujú sa aktuálne údaje
RAG
č
Špecifický pevný formát
málo záberov
Ak nie dosť áno
Konzistentný tón/štýl
prompt + niekoľko výstrelov
Ak nie dosť áno
Poľný žargón/štýl
výzva
Ak to nestačí, LoRA
Jednoduchá optimalizácia úloh
rýchle inžinierstvo
Vo všeobecnosti nie
Časté chyby
- Problém s informáciami sa snaží vyriešiť jemným doladením. RAG je ten správny nástroj.
- Spustenie jemného dolaďovania bez náročného rýchleho / niekoľkých záberov / RAG. Drahé a zbytočné.
- Školenie s nízkou kvalitou/konfliktnými údajmi. Menej, ale jasné údaje sú lepšie.
- Uvádzanie dôverných údajov do vzdelávania. Trvalo infiltruje model.
- Nemeriam pred a po. Nemôžete dokázať zotavenie.
- Netestovať katastrofické zabudnutie. Nová zručnosť môže narušiť starú.
V súhrne
Jemné ladenie je mocný, ale drahý nástroj a malo by sa o ňom uvažovať len pri problémoch so správaním/formátom po použití prompt-few-shot-RAG; informačné problémy patria do RAG. Parametre efektívne metódy ako LoRA sú praktickou prvou voľbou. Kvalita závisí výlučne od kvality údajov; Používajte malé, ale čisté, konzistentné a dôverné údaje. Zmerajte pred a po, otestujte preučenie a stratu schopností. Jemné doladenie je povinnosťou starostlivosti; Zvážte jeho celkové náklady v porovnaní s kvalitou, ktorú poskytuje.
Aplikačná úloha
Vyberte si problém a rozhodnite sa, či je potrebné dolaďovanie rozlišovaním medzi „vedomosťami alebo správaním“ a napíšte svoje odôvodnenie. Ak ide o problém so správaním, pripravte 20 – 30 konzistentných vzoriek, skontrolujte skryté údaje a zdokumentujte plán hodnotenia pred a po (prerušený klaster, základné skóre, porovnávacia metrika, test zabudnutia). Ak sa to dá vyriešiť RAG/niekoľkými ranami namiesto dolaďovania, poznačte si to aj vy.
kontrolný zoznam
- [ ] Určil som, či je problém vo vedomostiach alebo v správaní.
- [ ] Najprv som vyhodnotil promptné, málo ranové a RAG alternatívy.
- [ ] Skontroloval som konzistentnosť, rozmanitosť a dôvernosť údajov dolaďovania.
- [ ] Pridelil som držaný klaster hodnotenia a zmeral som základné skóre.
- [ ] Naplánoval som si pred-po porovnanie a test zabudnutia.
- [ ] Porovnal som celkové náklady s kvalitou, ktorú poskytuje.