Üksus 6 / 11

Peenhäälestuse alus: millal, kuidas ja millise riskiga

Kasu:

  • Oskus eristada, kas probleem on informatsioon või käitumine, ja hinnata käitumisprobleemide peenhäälestamist alles pärast seda, kui viipe, mõne võtte ja RAG on ammendatud.
  • Peenhäälestusmeetodite (SFT, LoRA/PEFT, RLHF) ja andmeatribuutide mõistmine, mis määravad kvaliteedi (järjepidevus, mitmekesisus, konfidentsiaalsus)
  • Võimalus mõõta peenhäälestuse tegelikku väärtust enne-pärast hindamist, üleõppimist ja katastroofilist unustamistesti

Peenhäälestus (selle käitumise kohandamine, koolitades eelnevalt koolitatud mudelit edasi oma andmetega) on võimas, kuid kallis tööriist LLM-idega töötava inseneri arsenalis. Vales kohas kasutades on see raha ja aja raiskamine, aga õiges kohas kasutades annab kvaliteedi, mida muidu saavutada ei saa. Selles üksuses käsitleme peenhäälestuse vajalikkust, selle põhimeetodeid ja riske. Eesmärk on panna teid otsustama.

Esiteks õige küsimus: kas peenhäälestus on vajalik?

Algajate kõige kallim viga on kohe tormata lahendatava probleemi peenhäälestamisel. Seadistage järjekord järgmiselt:

  1. Prompt insener: hea viip, mis selgitab selgelt ülesannet, lahendab enamiku probleemidest. Tarbi kõigepealt siin.
  2. Vähem õppimine: mõne näite lisamine viibale näitab mudelile soovitud vormingut ja käitumist.
  3. RAG: Kui probleemiks on "teabe puudumine" (vajadus andmete järele, mida mudel ei tea), on lahendus RAG (üksus 4), mitte peenhäälestus.
  4. Peenhäälestus: see tuleb mängu, kui ülaltoodust ei piisa ja probleem on "käitumine/vorming/stiil".

Peamine erinevus: Peenhäälestus on mudelile uue teabe õpetamisel nõrk ja riskantne; kuid see on tugev käitumise õpetamisel (konkreetne formaat, toon, valdkonna žargoon, järjepidev struktuur). "Minu mudel ei tea meie ettevõtte teavet" → RAG. "Las minu mudel annab alati väljundi täpselt sellises vormingus, nagu me tahame" → peenhäälestuskandidaat.

Näpunäide. Enne peenhäälestuse kasuks otsustamist küsige: "Kas see on teadmiste või käitumise probleem?" Infoprobleeme saab paremini lahendada RAG-iga, käitumisprobleeme peenhäälestusega.

Peenhäälestusmeetodid

Täielik peenhäälestus: mudeli kõigi parameetrite ümberõpe. Kõige võimsam, kuid kõige kallim; See nõuab suurt riistvara (GPU) ja hoolikat andmeid. Enamiku meeskondade jaoks pole see vajalik.

Parameetritõhus peenhäälestus (PEFT): meetodid, mis külmutavad suurema osa mudelist, treenides vaid väikest komplekti lisaparameetreid. Levinuim on LoRA (Low-Rank Adaptation: mudelile lisatud väikeste "adapteri" kihtide treenimine). LoRA annab tulemusi, mis on peaaegu täieliku peenhäälestusega, palju väiksema mälu ja kuluga; Seetõttu on see praktikas esimene valik.

Järelevalve peenhäälestus (SFT): mudeli õpetamine "sellele sisendile niimoodi reageerima" andmetega, mis koosnevad sisendi-ideaalsetest väljundpaaridest. See on kõige levinum stsenaarium.

Inimeste tagasisidest õppimise tugevdamine (RLHF): mudeli käitumise vastavusse viimine inimeste eelistatud vastustega. See on keeruline ja kallis; Enamiku rakendusmeeskondade vajadused rahuldatakse SFT-ga. Piisab RLHF-i kui mõiste tundmisest.

Andmed: peenhäälestuse süda

Peenhäälestuse kvaliteet sõltub täielikult treeningandmete kvaliteedist. Mõnisada kvaliteetset ühtlast näidist on paremad kui tuhanded lohakad. Andmete ettevalmistamisel:

  • Järjepidevus: kõik näited näitavad järjekindlalt soovitud vormingut ja tooni. Vastuolulised näited jätavad mudeli segadusse.
  • Sordi: näited hõlmavad tegelikku kasutust, kuid ei ole ühtsed.
  • Puhastamine: valesid, kallutatud või peidetud andmeid sisaldavad eksemplarid edastatakse jäädavalt mudelisse. Peenhäälestusandmeid tuleks lugeda sama hoolikalt kui lepingut.
Ettevaatust. Iga peenhäälestusandmetesse sisenev nihe, viga ja peidetud teave söövitatakse mudelisse ja ilmub uuesti selle väljunditesse. Kontrollige oma treeninguandmeid nii täpselt, nagu avaldaksite neid; Ärge postitage isikuandmeid.

Ülevaade: kas peenhäälestus töötas?

Enne peenhäälestamist reserveerige väljalükatud hindamiskomplekt ja mõõtke mudeli skoori ilma peenhäälestuseta (baasmudel). Pärast peenhäälestamist mõõta uuesti samas pangas. Ilma võrdluseta ei saa öelda "see läks paremaks". Samuti tasub meeles pidada kahte lõksu:

  • Üleõppimine: väikeste andmetega ületreening kaotab mudeli võime treeningnäiteid meelde jätta ja üldistada.
  • Katastroofiline unustamine: ületreening kitsa ülesande täitmisel võib kahjustada modelli üldisi võimeid. Katsetage, kas vanad oskused säilivad uue käitumise omandamisel.

Nõrk lähenemine / tugev lähenemine

Nõrk: "Mul on 3000 vestluslogi, andkem need kõik peenhäälestamiseks, et modell saaks rääkida nagu meie."

Güçlü: "Kõigepealt hindasin baasmudelit 100 reaalse ülesandega, märkisin hinde. Mõõtsin, kui palju see paranes viipade ja mõne kaadri abil – sellest ei piisanud. Seejärel valisin 3000 logi hulgast välja ja puhastasin ainult 400 kvaliteetset, järjepidevat vormingut ja varjatud andmeteta näidist. Peenhäälestasin uuesti LoRA-ga, mis on sama üldine, mõõtsin0 uuesti0 võimed olid puutumata."

Erinevus: tugev lähenemisviis ammendab kõigepealt alternatiivid, valib andmed, mõõdab enne ja pärast ning testib kõrvaltoimeid.

Kulude ja hoolduse tegelikkus

Peenhäälestus ei ole ühekordne töö; See on hoolsuskohustus. Kui baasmudelit värskendatakse, seda on vaja muuta või andmed kaovad, võib osutuda vajalikuks ümberõpe. Lisaks toob peenhäälestatud mudeli hostimine kaasa lisakulusid ja lisatoiminguid. Võrrelge seda omamise kogumaksumust selle pakutava kvaliteedi paranemisega. Enamasti on hea viip + RAG odavam ja paindlikum kui peenhäälestus.

kolm minikarpi

Juhtum 1 – tarbetu peenhäälestus. Meeskond alustas kallist peenhäälestusprojekti, kuna "meie mudel ei tunne meie tooteid". Kulusid kuud ja eelarve, tulemus oli habras — mudel vananes iga kord, kui tootekataloogi muutus. Lõpuks läksid nad üle RAG-ile: nad tõid tooteandmed dokumendibaasist, värskendus toimus hetkega ja hind langes. Õppetund: infoprobleemi ei lahenda peenhäälestus.

Juhtum 2 – õige peenhäälestus. Kindlustusselts soovis, et mudel koostaks poliiside kokkuvõtted alati samas jäigas struktuuris (punktide kaupa, konkreetsete pealkirjadega). Kooskõla viipaga on jäänud 70% juurde. Pärast LoRA peenhäälestamist 300 hea näidisega kasvas vormingu järjepidevus 98% -ni. See oli käitumisprobleem ja peenhäälestus oli õige vahend.

3. juhtum – privaatsus pääseb andmetesse. Üks meeskond esitas vestluslogid peenhäälestamisele neid puhastamata. Logid sisaldasid tegelikke klientide nimesid ja identifitseerimisnumbreid. Peenhäälestatud mudel hakkas neid nimesid "lekkima" mitteseotud küsimuste väljundina. Mudel võeti tagasi, andmed maskeeriti ja koolitati ümber. Õppetund: peenhäälestusandmete peidetud teave kantakse jäädavalt mudelisse.

Kopeeritavad mallid

Aidake mul otsustada, kas selle minu probleemi jaoks on vaja peenhäälestust. Probleem: [kirjeldus] Kas see on INFORMATSIOONI probleem (mudel ei tea midagi) või KÄITUMISE probleem (mudel ei tooda soovitud vormingut/tooni/struktuuri)? Kas seda saab lahendada kiire, väheste võtete ja RAG-iga? Miks proovida/mitte proovida neid kõiki?Ainult millistel tingimustel soovitaksite peenhäälestada?

Kontrollige seda peenhäälestusandmestikku:1) Kas näidete vorming ja toon on ühtsed?2) Kas need hõlmavad tegeliku kasutuse erinevusi?3) Kas see sisaldab konfidentsiaalseid/isikuandmeid (peab olema maskeeritud)?4) Kas on vastuolulisi näiteid?Näidete alamhulk: [näited]Loetlege kõik leitud probleemid ja parandused.

Koostage hindamiskava enne ja pärast peenhäälestamist. Ülesanne: [selgitus]- Kuidas valida välja hoitud hindamiskomplekti?- Kuidas mõõdetakse baasmudeli skoori?- Millise mõõdikuga seda pärast peenhäälestamist võrreldakse?- Kuidas testida, et üldised võimed ei ole kahjustatud (katastroofiline unustamine)?

Soovitage algseid hüperparameetreid LoRA-ga peenhäälestamiseks.Andmete suurus: [näidiste arv]Eesmärk: [vormingu/tooniga õpetamine]Paku epohhi, õppimiskiirust ja varajast peatamist, et vältida üleõppimist.

Otsustabel: milline tööriist millal

vaja

proovi kõigepealt

Peenhäälestus?

Modell ei tea mingit infot

RAG

ei

Vaja on jooksvaid andmeid

RAG

ei

Konkreetne jäik formaat

paar lasku

Kui ei piisa jah

Ühtlane toon/stiil

viip + paar lasku

Kui ei piisa jah

Välja žargoon/stiil

viip

Kui sellest ei piisa, siis LoRA

Lihtne ülesannete optimeerimine

kiire inseneritöö

Üldiselt ei

Levinud vead

  • Püüab infoprobleemi peenhäälestusega lahendada. RAG on õige tööriist.
  • Käivitub peenhäälestus ilma viipe/paha võtet/RAG-i kasutamata. Kallis ja mittevajalik.
  • Koolitus madala kvaliteediga/vastuoluliste andmetega. Parem on vähem, kuid selgeid andmeid.
  • Konfidentsiaalsete andmete lisamine haridusse. Imbub jäädavalt mudelisse.
  • Ei mõõta enne ja pärast. Sa ei saa tõestada taastumist.
  • Mitte katsetada katastroofilist unustamist. Uus oskus võib vana rikkuda.

Kokkuvõttes

Peenhäälestus on võimas, kuid kallis tööriist ja seda tuleks kaaluda ainult käitumis-/vorminguprobleemide korral pärast käsu prompt-few-shot-RAG kasutamist; infoprobleemid kuuluvad RAG-ile. Parameetritõhusad meetodid, nagu LoRA, on praktiline esimene valik. Kvaliteet sõltub täielikult andmete kvaliteedist; Kasutage väikeseid, kuid puhtaid, järjepidevaid ja konfidentsiaalseid andmeid. Mõõtke enne ja pärast, kontrollige üleõppimist ja võimekuse kaotust. Peenhäälestus on hoolsuskohustus; Kaaluge selle kogumaksumust pakutava kvaliteediga.

Rakenduse ülesanne

Valige probleem ja otsustage, kas peenhäälestus on vajalik, eristades "teadmisi või käitumist" ning kirjutage oma põhjendus. Kui tegemist on käitumisprobleemiga, valmistage ette 20–30 järjepidevat valimit, kontrollige peidetud andmeid ja dokumenteerige enne ja pärast hindamisplaan (peetud klaster, baasskoor, võrdlusmõõdik, unustamise test). Kui seda saab peenhäälestuse asemel lahendada RAG/fow-shot abil, pange ka see kirja.

kontrollnimekiri

  • [ ] Tegin kindlaks, kas probleem on teadmistes või käitumises.
  • [ ] Esmalt hindasin kiiret, väheste võtete ja RAG-i alternatiive.
  • [ ] Auditeerisin täpsustusandmeid järjepidevuse, mitmekesisuse ja konfidentsiaalsuse tagamiseks.
  • [ ] Jaotasin väljaulatuva hindamise klastri ja mõõtsin baasskoori.
  • [ ] Plaanisin enne-pärast võrdluse ja unustamise testi.
  • [ ] Võrdlesin kogumaksumust selle pakutava kvaliteediga.