Guadagni:
- Spiegare che RAG inserisce il contesto senza modificare i pesi del modello e funziona con una logica di "esame a libro aperto"
- Confronto tra RAG e approcci di fine tuning e contesto lungo in base a costi, tempestività e scenario di utilizzo
- Elenco dei passaggi di una tipica pipeline RAG composta da fasi di indicizzazione e query
Non importa quanto sia potente un modello linguistico (intelligenza artificiale che comprende e produce testo; da ora in poi lo chiameremo modello in breve), non conosce il contratto firmato ieri dalla tua azienda, la pagina wiki interna (base di conoscenza interna) o la nota di rilascio pubblicata questa mattina. Il modello è limitato alla conoscenza generale fino alla data in cui è stato addestrato; Questa è chiamata la "data limite per l'istruzione". RAG (Retrieval-Augmented Generation) colma proprio questa lacuna: trova i documenti aziendali relativi alla domanda, li fornisce come contesto al modello (cioè il testo aggiuntivo che leggerà producendo la risposta) e fa produrre la risposta in base a questo contesto.
In questa unità vedremo chiaramente cos'è RAG, quando è preferibile rispetto a quali alternative e i passaggi di una tipica pipeline RAG. Tutte le unità successive approfondiranno le parti di questa mappa una per una.
L'idea di base del RAG: esame a libro aperto
Spieghiamo RAG in una frase: "Prima trova il documento rilevante, poi chiedi al modello di leggere quel documento e stampare la risposta di conseguenza."
L’analogia più utile è questa: RAG sposta il modello da un “esame a libro chiuso” a un “esame a libro aperto”. Nell'esame a libro chiuso lo studente risponde solo a memoria; Il rischio di inventare ciò che non ricordi è alto. Nell'esame a libro aperto lo studente risponde guardando la fonte posta davanti a lui. In RAG, il modello non risponde più dalla propria memoria, ma dal testo attuale e specifico che gli dai.
Punto critico: RAG non modifica i pesi del modello, cioè i miliardi di parametri numerici che il modello ha appreso. Non riqualificare il modello. Per ogni domanda, inserisci porzioni di testo rilevanti per quella domanda nel prompt (testo di istruzioni inviato al modello). Pertanto non è necessario riqualificare il modello quando un documento viene aggiornato; è sufficiente aggiornare il record pertinente nel database di ricerca.
Suggerimento: due domande determinano la qualità del RAG: (1) Hai trovato il documento giusto? (2) Il modello lo ha letto correttamente? La prima è la "qualità di recupero", la seconda è la "qualità di generazione". I due vengono misurati e migliorati separatamente.
RAG, messa a punto o contesto lungo?
Spesso si confondono tre percorsi quando si cerca una soluzione a un problema organizzativo. Chiariamo le loro differenze. La messa a punto consiste nell'aggiornare i pesi del modello con i tuoi dati e insegnargli un nuovo comportamento/stile. Un contesto lungo significa inserire tutti i documenti direttamente nel prompt senza alcuna selezione.
Avvicinamento
Cosa fa
Quando è opportuno?
Costo/Rischio
RAG
Inserisce il documento rilevante come contesto
Informazioni frequenti, estese e specifiche che cambiano frequentemente
Basso; facile da aggiornare, è possibile citare la fonte
Messa a punto
Aggiorna i pesi con nuovi dati
Stile/formato/insegnamento della lingua fissi
Alto; È richiesta una riqualificazione ad ogni aggiornamento
Solo contesto lungo
Compila tutti i documenti nel prompt
Set di documenti piccolo e fisso
Il costo dei token e il rischio di "perdere la parte centrale" aumentano
Di norma: il fine-tuning insegna al modello come parlare; RAG dice al modello cosa sapere. Nella maggior parte degli scenari aziendali, RAG viene provato per primo perché è economico, aggiornabile e può mostrare l'origine della risposta. Un contesto lungo è ragionevole se il set di documenti è veramente piccolo e fisso (ad esempio un singolo manuale di 20 pagine); Ma con migliaia di pagine, è costoso e il modello potrebbe perdere informazioni nel mezzo di un testo lungo.
Una tipica pipeline RAG
RAG è costituito da due fasi principali: indicizzazione (preparazione, eseguita una volta o periodicamente) e interrogazione (esecuzione su ogni domanda dell'utente).
Indicizzazione passo passo (offline, senza attesa dell'utente):
- Raccogli: estrai documenti da fonti (PDF, wiki, sistema di ticket, database, e-mail).
- Chunking: suddividi il testo lungo in parti più piccole e gestibili.
- Incorpora: converti ogni parte in incorporamento (il vettore numerico che porta il significato del testo).
- Salva: scrive i vettori insieme al testo e ai metadati (fonte, data, informazioni sull'autorizzazione) nel database dei vettori.
Query passo passo (online, mentre l'utente è in attesa):
- Converti la domanda dell'utente in incorporamento.
- Recupera le parti più simili dal database vettoriale.
- Inserisci questi pezzi + la domanda in un modello di prompt.
- Ottieni la risposta contestuale e le sue fonti dal modello.
# Schema concettuale della fase di richiesta (non dipendente dalla lingua)question = "Quanti giorni di ferie annuali?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # parti più similiprompt = f"""Rispondi alla DOMANDA utilizzando il CONTESTO seguente. Se la risposta non è nel contesto, dì "Non ho informazioni a riguardo." Adattamento.CONTESTO:{parti}DOMANDA: {domanda}"""risposta = modello.uret(prompt) # es. modello: claude-opus-4-8
Questo flusso è una mappa di ogni fase, che scompattaremo una per una nelle unità successive.
Prompt debole / Prompt forte
Anche con lo stesso contesto RAG, la qualità del prompt cambia la risposta.
Prompt debole (aperto all'adattamento del modello, non richiede risorse):
Utilizza queste informazioni e dì ferie annuali: {parts}. Domanda: {domanda}
Prompt potente (messa a terra + autorizzazione "Non lo so" + richiesta di risorse):
Rispondi solo in base al CONTESTO riportato di seguito. Se non c'è una risposta chiara nel contesto, scrivi "Non ho trovato informazioni a riguardo nella documentazione"; Non indovinare. Aggiungi il tag [Source: file_name] del pezzo su cui fai affidamento alla fine della tua risposta. CONTESTO: {pezzi} DOMANDA: {domanda}
Tre mini custodie
Caso 1 — Assistente HR (Risorse umane). Un’azienda dispone di un manuale delle risorse umane di 340 pagine e i dipendenti fanno in media 90 domande al giorno. Si è tentato di perfezionarlo, ma poiché il manuale veniva aggiornato mensilmente, ogni volta era necessario riqualificarlo; Il costo ha raggiunto migliaia di dollari al mese. Dopo il passaggio a RAG, l'aggiornamento è stato ridotto alla fase "reindicizzare il documento" (minuti) e il tasso di risposte corrette è aumentato dal 71% al 93% nella misurazione manuale.
Caso 2: assistenza clienti. Il team di supporto dispone di 12.000 ticket risolti e 800 articoli di aiuto. Un agente impiega in media 4 minuti per trovare manualmente una risposta. Quando l'assistente RAG ha portato le 5 registrazioni più rilevanti e ha prodotto una bozza di risposta, il tempo si è ridotto a 40 secondi; Ma il team si è reso conto del rischio di "sembrare incerto riportando l'articolo sbagliato" e ha reso obbligatoria la citazione della fonte.
Caso 3 — Diritto. Un team contraente ha chiesto "in quali contratti la clausola di riservatezza dura 5 anni?" fa la domanda. Nella lunga prova contestuale, sono stati compilati 60 contratti in un unico prompt; il modello ha saltato i due contratti centrali. Quando con RAG sono stati introdotti solo gli elementi rilevanti, il costo del token è diminuito dell'80% e i salti mancanti sono stati ripristinati.
Perché è necessario il RAG?
- Attualità: accedi alle informazioni dopo la data limite della formazione.
- Informazioni speciali: i tuoi documenti interni non sono inclusi nella formazione di nessun modello; Solo tu puoi dare.
- Verificabilità: puoi citare la fonte della risposta (citazione), essenziale per l'auditing e la fiducia.
- Controllo delle allucinazioni: si basa sul testo posto davanti ad esso piuttosto che sulla creazione di un modello.
- Costo: la messa in funzione è molto più economica e rapida rispetto alla messa a punto.
Attenzione: RAG non è magico. Se si inserisce il pezzo sbagliato, la modella arriva alla risposta sbagliata apparendo “sicura”. Tieni presente la frase "Qualità di recupero = qualità RAG".
Errori comuni
- Confondere RAG con la messa a punto: RAG non modifica i pesi; Aggiunge semplicemente contesto. Confondere questi due porterà a scegliere l'architettura sbagliata.
- Non consentire "Non lo so": se il prompt lascia il modello libero di riempire lo spazio vuoto, si compenserà.
- Non citare le fonti: una risposta senza fonte non può essere verificata; L'utente non può notare l'errore.
- Raggruppare tutto in un unico prompt: il contesto lungo sembra economico ma è costoso e perde le informazioni centrali.
- Rimanere bloccati nella generazione senza misurare il recupero: se la risposta è negativa, chiedi prima "È arrivata la parte giusta?" dovrebbe essere chiesto.
In sintesi
- RAG è un approccio che inserisce documenti rilevanti per la domanda nel modello come contesto; non modifica i pesi ("esame a libro aperto").
- La messa a punto insegna lo stile/formato, RAG fornisce informazioni attuali e specifiche; il contesto lungo funziona bene per piccoli insiemi fissi. Nella maggior parte degli scenari, viene provato per primo RAG.
- La pipeline prevede due fasi: indicizzazione offline (blocco + incorporamento + salvataggio) e interrogazione online (recupero + prompt + generazione).
- RAG fornisce tempestività, informazioni specifiche, verificabilità, controllo delle allucinazioni e basso costo.
- La qualità del sistema dipende direttamente dalla qualità del recupero: pezzo sbagliato significa risposta sbagliata.
Compito dell'applicazione
Scegli una vera fonte di informazioni dal tuo team (ad esempio un documento di procedura o una pagina di domande frequenti). (1) Scrivi 5 domande concrete su questa fonte. (2) Annota quale parte del documento contiene la risposta corretta per ciascuna domanda: questa diventa la tua lista di "risposte d'oro". (3) Utilizzando il modello "prompt forte" sopra, incolla manualmente la sezione pertinente come contesto e chiedi un modello. (4) Confronta la risposta data dal modello con la risposta dorata e indica come vero/falso. Questa è la prima versione manuale della valutazione che automatizzerai nelle unità future.
lista di controllo
- [ ] Posso spiegare in una frase che RAG non cambia i pesi, aggiunge solo contesto.
- [ ] So distinguere tra RAG, messa a punto e contesto lungo e quando è appropriato.
- [ ] Posso contare le fasi di indicizzazione (raccolta-shred-embed-save) e di query (embed-fetch-prompt-generate) in ordine.
- [ ] So perché ho aggiunto le istruzioni "se non è nel contesto, di' che non lo so" e "cita la fonte" al prompt.
- [ ] Posso adattare il principio "Qualità di recupero = qualità RAG" al mio caso.