Guadagni:
- Capacità di distinguere se un problema è un'informazione o un comportamento e di valutare la messa a punto dei problemi comportamentali solo dopo aver esaurito le opzioni prompt, little-shot e RAG.
- Comprendere i metodi di fine tuning (SFT, LoRA/PEFT, RLHF) e gli attributi dei dati che determinano la qualità (coerenza, diversità, riservatezza)
- Capacità di misurare il vero valore della messa a punto con test di valutazione prima e dopo, apprendimento eccessivo e dimenticanza catastrofica
La messa a punto (la personalizzazione del comportamento addestrando ulteriormente un modello pre-addestrato con i propri dati) è uno strumento potente ma costoso nell'arsenale dell'ingegnere che lavora con LLM. Se utilizzato nel posto sbagliato, è uno spreco di tempo e denaro, ma se utilizzato nel posto giusto, fornisce una qualità che non può essere ottenuta altrimenti. In questa unità, tratteremo quando è necessaria la messa a punto, i suoi metodi di base e i rischi. L’obiettivo è renderti decisionale.
Innanzitutto la domanda giusta: è necessaria una messa a punto?
L'errore più costoso dei principianti è affrettarsi immediatamente a mettere a punto un problema che può essere risolto. Imposta l'ordine in questo modo:
- Ingegneria tempestiva: un buon suggerimento che spiega l'attività risolve chiaramente la maggior parte dei problemi. Consumare qui prima.
- Apprendimento in pochi passaggi: l'inserimento di alcuni esempi nel prompt mostra al modello il formato e il comportamento desiderati.
- RAG: Se il problema è la "mancanza di informazioni" (necessità di dati che il modello non conosce), la soluzione è RAG (unità 4), non la messa a punto.
- Messa a punto: entra in gioco se quanto sopra non è sufficiente e il problema è "comportamento/formato/stile".
Distinzione fondamentale: il fine-tuning è debole e rischioso nell'insegnare al modello nuove informazioni; ma è forte nell'insegnare come comportarsi (un formato specifico, un tono, un gergo di campo, una struttura coerente). “Il mio modello non conosce le informazioni della nostra azienda” → RAG. "Lascia che il mio modello fornisca sempre l'output nel formato esatto che desideriamo" → candidato per la messa a punto.
Suggerimento: prima di decidere sulla messa a punto, chiedi: "È un problema di conoscenza o un problema di comportamento?" I problemi informativi si risolvono meglio con RAG, i problemi comportamentali si risolvono meglio con il fine tuning.
Metodi di messa a punto
Messa a punto completa: riqualificazione di tutti i parametri del modello. Il più potente ma il più costoso; Richiede hardware di grandi dimensioni (GPU) e dati attenti. Non è necessario per la maggior parte delle squadre.
Ottimizzazione efficiente dei parametri (PEFT): metodi che congelano la stragrande maggioranza del modello, addestrando solo un piccolo insieme di parametri aggiuntivi. Il più comune è LoRA (Low-Rank Adaptation: addestramento di piccoli strati "adattatori" aggiunti al modello). LoRA fornisce risultati prossimi alla messa a punto completa, con molta meno memoria e costi; Ecco perché nella pratica è la prima scelta.
Supervisioned Fine-Tuning (SFT): insegnare al modello a "rispondere a questo input in questo modo" con dati costituiti da coppie input-output ideali. È lo scenario più comune.
Apprendimento per rinforzo dal feedback umano (RLHF): allineamento del comportamento del modello alle risposte preferite delle persone. È complesso e costoso; Le esigenze della maggior parte dei team applicativi vengono soddisfatte con SFT. È sufficiente conoscere il concetto di RLHF.
Dati: il cuore della messa a punto
La qualità della messa a punto dipende interamente dalla qualità dei dati di addestramento. Alcune centinaia di campioni coerenti e di alta qualità sono migliori di migliaia di campioni approssimativi. Durante la preparazione dei dati:
- Coerenza: tutti gli esempi mostrano costantemente il formato e il tono desiderati. Contradictory examples leave the model confused.
- Varietà: gli esempi coprono la varietà nell'uso reale, ma non sono uniformi.
- Pulizia: le istanze contenenti dati errati, distorti o nascosti vengono passate in modo permanente nel modello. I dati di fine tuning dovrebbero essere letti con la stessa attenzione di un contratto.
Attenzione: ogni distorsione, errore e informazione nascosta che entra nei dati di fine tuning viene impressa nel modello e riappare nei suoi output. Controlla i tuoi dati di allenamento meticolosamente come se li stessi pubblicando; Do not post personal data.
Review: did fine-tuning work?
Prima della messa a punto, prenotare un set di valutazione trattenuto e misurare il punteggio del modello senza messa a punto (modello base). Dopo la messa a punto, misurare nuovamente nella stessa banca. Non si può dire "è migliorato" senza fare paragoni. Also two traps to be aware of:
- Overlearning: il sovrallenamento con dati di piccole dimensioni fa sì che il modello perda la sua capacità di memorizzare e generalizzare esempi di training.
- Dimenticanza catastrofica: il sovrallenamento su un compito ristretto può compromettere le capacità generali del modello. Verificare se le vecchie abilità vengono mantenute durante l'acquisizione del nuovo comportamento.
Approccio debole/Approccio forte
Debole: "Ho 3000 registri di chat, affiniamoli tutti, così la modella può parlare come noi."
Güçlü: "Per prima cosa ho valutato il modello base con 100 attività reali, ho annotato il punteggio. Ho misurato quanto fosse migliorato con istruzioni e pochi scatti: non era sufficiente. Poi dai 3000 registri ho selezionato e pulito solo 400 campioni con alta qualità, formato coerente e senza dati nascosti. Ho messo a punto con LoRA, misurato nuovamente con le stesse 100 attività e confermato con un test separato che le capacità generali erano intatte."
La differenza: l’approccio forte esaurisce prima le alternative, seleziona i dati, misura prima e dopo e testa gli effetti collaterali.
The reality of cost and maintenance
Fine-tuning is not a one-time job; È un dovere di diligenza. Potrebbe essere necessario ripetere l'addestramento quando il modello di base viene aggiornato, necessita di modifiche o i dati vengono persi. Inoltre, ospitare un modello ottimizzato comporta costi e operazioni aggiuntivi. Confronta questo costo totale di proprietà con l'aumento di qualità che offre. Nella maggior parte dei casi un buon prompt + RAG è più economico e più flessibile della messa a punto.
tre mini custodie
Case 1 - Unnecessary fine-tuning. Un team si è imbarcato in un costoso progetto di messa a punto perché "il nostro modello non conosce i nostri prodotti". Sono stati spesi mesi e budget, ma il risultato è stato fragile: il modello diventava obsoleto ogni volta che il catalogo dei prodotti cambiava. Alla fine sono passati a RAG: hanno recuperato i dati del prodotto dal database documentale, l'aggiornamento è stato istantaneo e il costo è sceso. Lezione: il problema dell'informazione non si risolve con la messa a punto.
Case 2 - Correct fine-tuning. Una compagnia assicurativa desiderava che il modello producesse sempre sintesi delle polizze nella stessa struttura rigida (voce per clausola, con intestazioni specifiche). Consistency with prompt is stuck at 70%. Dopo la messa a punto di LoRA con 300 campioni validi, la coerenza del formato è aumentata al 98%. Questo era un problema di comportamento e la messa a punto era lo strumento giusto.
Case 3 - Privacy escaping into data. Un team ha inviato i registri della chat alla messa a punto senza pulirli. I registri contenevano nomi di clienti reali e numeri di identificazione. Il modello perfezionato ha iniziato a "far trapelare" questi nomi come output in domande non correlate. Il modello è stato ritirato, i dati mascherati e riqualificati. Lezione: le informazioni nascoste nei dati di fine tuning vengono trasferite in modo permanente al modello.
Modelli copiabili
Aiutami a decidere se è necessaria una messa a punto per questo mio problema. Problema: [descrizione] È un problema di INFORMAZIONE (il modello non sa qualcosa) o un problema di COMPORTAMENTO (il modello non produce il formato/tono/struttura che desidero)? Può essere risolto prima con pronto, pochi colpi e RAG? Perché provare/non provare ciascuno di essi? Solo a quali condizioni consiglieresti di perfezionarli?
Controlla questo set di dati di perfezionamento:1) Gli esempi sono coerenti nel formato e nel tono?2) Coprono la variazione nell'uso effettivo?3) Contengono dati riservati/personali (devono essere mascherati)?4) Ci sono esempi contrastanti? Un sottoinsieme degli esempi: [esempi]Elenca ogni problema e soluzione trovata.
Produrre un piano di valutazione prima e dopo la messa a punto. Compito: [spiegazione]- Come dovrebbe essere selezionato il set di valutazione trattenuto?- Come viene misurato il punteggio del modello base?- Con quale metrica viene confrontato dopo la messa a punto?- Come posso verificare che le capacità generali non siano compromesse (dimenticanza catastrofica)?
Suggerisci iperparametri iniziali per la messa a punto con LoRA. Dimensioni dei dati: [numero di campioni] Scopo: [insegnamento formato/tono] Suggerisci epoca, velocità di apprendimento e arresto anticipato per evitare l'apprendimento eccessivo.
Tabella decisionale: quale strumento e quando
bisogno
prova prima
Messa a punto?
Il modello non conosce alcuna informazione
RAG
no
Dati attuali richiesti
RAG
no
Formato rigido specifico
pochi scatti
Se non bastasse sì
Tono/stile coerente
pronto + pochi colpi
Se non bastasse sì
Gergo/stile del campo
tempestivo
Se ciò non bastasse, LoRA
Semplice ottimizzazione delle attività
ingegneria tempestiva
Generalmente no
Errori comuni
- Cercando di risolvere il problema delle informazioni con la messa a punto. RAG è lo strumento giusto.
- Esecuzione della messa a punto senza consumare prompt/few-shot/RAG. Costoso e inutile.
- Formazione con dati di bassa qualità/conflittuali. Meno dati ma chiari sono meglio.
- Inserimento di dati riservati nell'istruzione. Si infiltra permanentemente nel modello.
- Non misurare prima e dopo. Non puoi dimostrare il recupero.
- Non testare l’oblio catastrofico. La nuova abilità potrebbe interrompere quella vecchia.
In sintesi
La messa a punto è uno strumento potente ma costoso e dovrebbe essere presa in considerazione solo per problemi di comportamento/formato dopo aver utilizzato prompt-few-shot-RAG; i problemi informativi appartengono a RAG. Metodi efficienti in termini di parametri come LoRA sono la prima scelta pratica. La qualità dipende interamente dalla qualità dei dati; Utilizza dati piccoli ma puliti, coerenti e riservati. Misurare prima e dopo, testare l'iperapprendimento e la perdita di capacità. La messa a punto è un dovere di diligenza; Valutare il costo totale rispetto alla qualità offerta.
Compito dell'applicazione
Scegli un problema e decidi se è necessario un aggiustamento distinguendo tra "conoscenza o comportamento" e scrivi la tua giustificazione. Se si tratta di un problema comportamentale, preparare 20-30 campioni coerenti, verificare la presenza di dati nascosti e documentare un piano di valutazione prima e dopo (cluster trattenuto, punteggio base, metrica di confronto, test di dimenticanza). Se il problema può essere risolto con RAG/few-shot invece che con la regolazione fine, prendi nota anche di questo.
lista di controllo
- [ ] Ho determinato se il problema è la conoscenza o il comportamento.
- [ ] Per prima cosa ho valutato le alternative pronta, pochi colpi e RAG.
- [ ] Ho verificato la coerenza, la diversità e la riservatezza dei dati di messa a punto.
- [] Ho assegnato un cluster di valutazione trattenuto e ho misurato il punteggio base.
- [ ] Ho pianificato un confronto prima-dopo e un test dell'oblio.
- [ ] Ho confrontato il costo totale con la qualità offerta.