Câștiguri:
- Explicați cauzele halucinațiilor și rolul împământării
- Aplicarea tehnicilor care fac modelul să spună „Nu știu” dacă nu este în context
- Asigurarea încrederii și auditabilității prin adăugarea de surse/citări verificabile la răspunsuri
Cel mai periculos comportament al unui model de limbaj este să inventeze ceva pe care nu-l cunoaște pe un ton încrezător și persuasiv. Aceasta se numește halucinație. Halucinarea într-un asistent corporativ nu este doar enervant, este de-a dreptul riscant: o zi greșită liberă, un preț greșit, o substanță legală greșită pot pune în pericol un angajat sau un client. În această unitate, vom acoperi de ce apar halucinațiile, cum să le reducem în RAG și cum să facem răspunsul verificabil.
Ce cauzează halucinațiile?
Modelul este antrenat pentru a produce următorul cuvânt cel mai probabil; Nu „spune adevărul”, ci „produce text fluent și rezonabil”. Dacă lipsesc informații, aceasta poate umple golul cu ceva plauzibil din punct de vedere statistic, dar incorect din punct de vedere faptic. Trei declanșatori tipici:
- Nu există niciun răspuns în context, dar modelul se simte oricum obligat să spună ceva.
- Contextul este conflictual sau inadecvat; Modelul reduce decalajul prin predicție.
- Întrebarea depășește contextul; modelul revine la propriile cunoștințe generale (și posibil depășite).
RAG reduce halucinațiile, deoarece oferă modelului o sursă reală, dar nu o reseta. Dacă aduceți piesa greșită sau lăsați modelul „libertatea de a umple golul”, și sistemul cu RAG îl poate monta.
tip de halucinație
simptom
cauza principală
strat de soluție
provenind din recuperare
Răspunsul corect este în document, dar nu a ajuns
Piesa greșită/lipsă livrată
Fragmentare, hibrid, re-clasificare (Unitatea 3-4)
Sursă de generație
A sosit partea corectă, dar răspunsul este greșit/trebuie adăugat
Modelul a umplut golul cu predicții
Împământare, permisiunea „nu știu”, creativitate scăzută
Sursă de citare
Răspunsul este corect, dar sursa este greșită
Modelul face referire la o parte greșită
Verificarea citației (vezi Unitatea 8)
Sugestie: Împărțiți halucinația în două părți. Obținut din recuperare: a sosit o parte greșită/lipsă (soluție: îmbunătățirea recuperării). Sursa generației: A sosit piesa corectă, dar modelul a citit/a adăugat-o incorect (soluție: prompt și împământare). Nu o poți repara decât dacă știi care este.
Împământare: stabilirea răspunsului în context
Grounding este numele dat tuturor tehnicilor de a spune modelului „doar bazează-te pe textul pe care ți-l dau, nu depășește-l”. Tehnica sa cea mai de bază și cea mai eficientă: acordarea explicit modelului permisiunea de a spune „Nu știu”. Modelul, ca și umanul, ezită să spună „nu știu”; Trebuie să-i dai permisiunea expresă să facă acest lucru.
Răspundeți numai pe baza CONTEXTULUI de mai jos. Dacă răspunsul nu este CLAR în context, scrie exact așa: „Nu am găsit suficiente informații despre asta în documentație”. Nu includeți numere, date sau nume care nu sunt în context. Nu ghici.
Tehnici suplimentare de împământare:
- Cerință de citare: înainte de fiecare revendicare, citați textul contextului („Documentul spune: „...”). Producerea de citate fabricate este mai dificilă pentru model.
- Temperatură scăzută: temperatura (temperatura, creativitate/setare aleatorie) ar trebui să fie scăzută. Notă: în unele modele actuale acest parametru a fost eliminat; În ele, oferiți împământare cu un prompt. Creativitatea ridicată este inamicul integrității corporative.
- Limită de aplicare: „Răspundeți numai la problemele legate de politica de consimțământ; refuzați politicos să renunțați”.
Citare
Cea mai puternică apărare sistemică împotriva halucinațiilor este de a face răspunsul verificabil. Dacă utilizatorul poate vedea pe ce document se bazează răspunsul: (1) poate prinde el însuși greșeala, (2) auditul devine posibil, (3) încrederea crește și (4) modelul produce cu mai multă prudență cu conștientizarea că „va trebui să citez sursa”.
Două abordări comune:
Atribuire inline: etichetă sursă lângă fiecare revendicare. „Concediul anual este de 14 zile [1]”. Mai jos este documentația completă a [1].
Ieșire structurată: Cererea modelului să producă răspunsul și lista surselor în câmpuri separate; Se afișează resursele ca linkuri pe care se poate face clic în interfață.
# Producerea unui răspuns structurat pe baza modelului (conceptual) Dați răspunsul dvs. în următoarea structură:- răspuns: <răspuns bazat pe context>- surse: [{"part_no": 1, "file": "...", "section": "..."}]- încredere: <high|medium|low> # Cât de clar îl susține contextul? Dacă contextul nu susține răspunsul, scrieți „nicio informație găsită” în câmpul de răspuns și lăsați sursele necompletate.
Pentru ca Citation să funcționeze cu adevărat, este necesar să se verifice dacă atribuirea este corectă. Modelul poate oferi uneori răspunsul corect, dar sursa greșită. Sistemele avansate verifică automat dacă fiecare revendicare produsă este de fapt susținută în piesa către care indică (măsurarea „fidelității” în unitatea următoare).
Slab/Puternic: prompt împotriva halucinațiilor
Slab (invitație de a completa spațiul liber):
Răspundeți la întrebare cât mai bine puteți cu informațiile pe care le aveți: {context} Întrebare: {întrebare}# „Cât mai bine puteți” înseamnă „ghici dacă nu știți” pentru model.
Puternic (împământare + nu știu permisiunea + sursă + încredere):
Bazează-te pe CONTEXT. În caz contrar, spuneți „Nu am găsit nicio informație”; alcătuiți număr/data/nume.Adăugați [n] număr sursă la fiecare revendicare. Specificați nivelul de încredere susținut de context.CONTEXT: [1]... [2]... ÎNTREBARE: {întrebare}
Trei mini carcase
Cazul 1 — Numărul articolului inventat. Un asistent juridic a alcătuit o declarație „Articolul 17/B” care a fost în afara contextului și a oferit informații false angajatului. Când s-a adăugat instrucțiunea „Nu dați un număr de articol care nu este în context, altfel spuneți că nu știu” + obligația de a cita, cazurile de articole fabricate au scăzut de la 11 la 0 în 40 de exemple.
Cazul 2 — Răspuns corect, sursă greșită. Un asistent de asistență a declarat perioada corectă de returnare, dar a citat articolul greșit; Când clientul a făcut clic pe link, s-a deschis o pagină irelevantă. Când a fost adăugată verificarea citațiilor (verificarea dacă afirmația apare în piesa citată), rata de citare falsă a scăzut de la 23% la 2%.
Cazul 3 – Nu s-a acordat permisiunea „Nu știu”. Un asistent de resurse umane inventase un răspuns plauzibil, dar incorect la o întrebare care nu era în document. Când consimțământul explicit „Nu știu” și textul integral („Nu am putut găsi informații despre acest lucru în documentație”) au fost adăugate la prompter, rata de respingere sinceră pentru întrebările fără răspuns, mai degrabă decât inventare, a crescut de la 8% la 95%.
Greșeli comune
- Nepermiterea „nu știu”: modelul umple golul cu fabricație.
- Menținerea creativității ridicate: aleatorietatea este dăunătoare integrității corporative.
- A avea încredere în sursă fără a o verifica: modelul poate atașa sursa greșită la răspunsul corect.
- Nu se face distincția între cele două tipuri de halucinații: corectezi locul greșit fără să știi dacă este cauzat de regăsire sau generare.
- Citare greșită pentru produse cosmetice: citarea sursei este atât de confirmare, cât și de descurajare; ia-o în serios.
Atenție: „Modelul arată foarte încrezător” nu este același lucru cu „modelul este corect”. Halucinațiile sunt, în general, cele mai fluente și mai sigure propoziții. Citiți încrederea din sursa pe care o indică, nu din tonul propoziției.
În concluzie
- Halucinația este atunci când modelul umple golul de informații cu text plauzibil, dar fals; RAG reduce dar nu se resetează.
- Halucinația poate fi cauzată de regăsire (parte greșită) sau generare (lectura greșită); Stabiliți care dintre ele mai întâi.
- Cea mai puternică tehnică a punerii la pământ este să acorde modelului permisiunea explicită „Nu știu”; de asemenea, cerința de citare și creativitate scăzută.
- Citarea face răspunsul verificabil; Atât dă încredere, cât și împinge modelul să fie produs cu prudență.
- De asemenea, trebuie verificată acuratețea citației; La răspunsul corect poate fi atașată sursa greșită.
Sarcina de aplicare
(1) Pregătește 4 întrebări pe care să le adresezi asistentului tău, ale căror răspunsuri nu sunt în documente (întrebări capcană). Testați fiecare cu promptul slab și puternic și marcați dacă modelul se potrivește sau nu. (2) Pentru cele 4 întrebări ale căror răspunsuri se află în document, solicitați modelului să genereze numărul de sudură și să verifice manual dacă sudura pe care o arată este de fapt partea corectă. (3) Verificați dacă modelul oferă „răspuns corect, sursă greșită” în cel puțin un caz și scrieți într-o propoziție cum puteți înțelege acest lucru automat.
lista de verificare
- [ ] Pot spune de ce se întâmplă halucinația și că RAG o reduce, dar nu o reseta.
- [ ] Pot distinge între recuperarea și halucinațiile induse de generație și pot corecta locul corect.
- [ ] Adaug permisiunea explicită „Nu știu” și reguli de bază la prompt.
- [ ] Adaug o sursă verificabilă (citare) la răspuns.
- [ ] Înțeleg necesitatea de a verifica în continuare acuratețea atribuirii.