Voitot:
- Selitetään, että RAG lisää kontekstin muuttamatta mallin painoja ja toimii avoimen kirjan kokeen logiikan kanssa
- RAG:n vertaaminen hienosäätöön ja pitkiin kontekstiin kustannusten, ajantasaisuuden ja käyttöskenaarion mukaan
- Luettelo tyypillisen indeksointi- ja kyselyvaiheista koostuvan RAG-liukuhihnan vaiheet
Huolimatta siitä, kuinka voimakas kielimalli (tekstiä ymmärtävä ja tuottava tekoäly; kutsumme sitä tästä eteenpäin lyhyesti malliksi) on, se ei tiedä yrityksesi eilen allekirjoittamaa sopimusta, sisäistä wikisivuasi (sisäinen tietokanta) tai tänä aamuna julkaistua julkaisua. Malli on rajoitettu yleistietoon siihen päivään asti, kun se on koulutettu; Tätä kutsutaan "koulutuksen päättymispäiväksi". RAG (Retrieval-Augmented Generation) täyttää juuri tämän aukon: se etsii kysymykseen liittyvät yrityksen dokumentit, antaa sen mallille kontekstiksi (eli lisätekstin, jonka se lukee tuottaessaan vastausta) ja tuottaa vastauksen tämän kontekstin perusteella.
Tässä yksikössä näemme selvästi, mikä RAG on, milloin se on suositeltavampi kuin mitä vaihtoehtoja, ja tyypillisen RAG-putkilinjan vaiheet. Kaikki seuraavat yksiköt syventävät tämän kartan osia yksitellen.
RAG:n perusidea: Avoimen kirjan koe
Selitetään RAG yhdellä lauseella: "Etsi ensin asiaankuuluva asiakirja ja pyydä mallia lukemaan asiakirja ja tulostamaan vastaus sen mukaisesti."
Hyödyllisin analogia on tämä: RAG siirtää mallin "suljetusta kirjakokeesta" "avoimen kirjan kokeeseen". Suljetussa kirjakokeessa opiskelija vastaa vain muistista; On suuri riski keksiä asioita, joita et muista. Avoimen kirjan kokeessa opiskelija vastaa katsomalla eteensä asetettua lähdettä. RAG:ssa malli ei enää vastaa omasta muististaan, vaan sille antamastasi nykyisestä ja tietystä tekstistä.
Kriittinen kohta: RAG ei muuta mallin painoja, eli miljardeja numeerisia parametreja, jotka malli on oppinut. Et kouluta mallia uudelleen. Lisäät jokaisen kysymyksen kohdalla kehotteeseen (malliin lähetettävä ohjeteksti) osuvia tekstipätkiä. Joten sinun ei tarvitse kouluttaa mallia uudelleen, kun asiakirja päivitetään; Päivität vain asianomaisen tietueen hakutietokannassa.
Vihje: Kaksi kysymystä määrittää RAG:n laadun: (1) Löysitkö oikean asiakirjan? (2) Lukiko malli sen oikein? Ensimmäinen on "hakulaatu", toinen on "sukupolven laatu". Näitä kahta mitataan ja parannetaan erikseen.
RAG, hienosäätö vai pitkä konteksti?
Kolme polkua sekoittuvat usein, kun etsitään ratkaisua organisaatioongelmiin. Selvitetään niiden erot. Hienosäätö on mallin painojen päivittämistä tiedoillasi ja uuden käyttäytymisen/tyylin opettamista. Pitkä konteksti tarkoittaa kaikkien asiakirjojen täyttämistä suoraan kehotteeseen ilman valintaa.
Lähestymistapa
Mitä tekee
Milloin se on sopivaa?
Kustannukset / riski
RAG
Lisää asiaankuuluvan asiakirjan kontekstiksi
Usein muuttuva, kattava, täsmällinen tieto
Matala; helppo päivittää, lähde voidaan mainita
Hienosäätö
Päivittää painot uusilla tiedoilla
Kiinteä tyyli/muoto/kieliopetus
korkea; Jokaisen päivityksen yhteydessä vaaditaan uudelleenkoulutusta
Vain pitkä konteksti
Täyttää kaikki asiakirjat kehotteeseen
Pieni kiinteä asiakirjasarja
Token-kustannukset ja riski "keskiosan menettämisestä" kasvavat
Pääsääntöisesti: Hienosäätö opettaa mallin puhumaan; RAG kertoo mallille, mitä hänen tulee tietää. Useimmissa yritysskenaarioissa RAG:ta kokeillaan ensin, koska se on halpa, päivitettävissä ja voi näyttää vastauksen lähteen. Pitkä konteksti on järkevää, jos asiakirjajoukko on todella pieni ja kiinteä (esim. yksi 20-sivuinen käsikirja); Mutta tuhansien sivujen takia se on kallista ja mallista saattaa puuttua tietoa pitkän tekstin keskeltä.
Tyypillinen RAG-putki
RAG koostuu kahdesta päävaiheesta: indeksoinnista (valmistellaan kerran tai määräajoin) ja kyselystä (suorittaa jokaisen käyttäjän kysymyksen).
Vaiheittainen indeksointi (offline, ilman käyttäjän odottamista):
- Kerää: Hae dokumentteja lähteistä (PDF, wiki, lippujärjestelmä, tietokanta, sähköposti).
- Paloitteleminen: Pilko pitkä teksti pienempiin hallittaviin osiin.
- Upota: Muunna jokainen osa upotukseksi (tekstin merkityksen kantava lukuvektori).
- Tallenna: Kirjoita vektorit tekstin ja metatietojen (lähde, päivämäärä, valtuutustiedot) kanssa vektoritietokantaan.
Vaiheittainen kysely (online, kun käyttäjä odottaa):
- Muunna käyttäjän kysymys upotettaviksi.
- Hae samankaltaisimmat osat vektoritietokannasta.
- Sijoita nämä palaset + kysymys kehotemalliin.
- Hanki kontekstuaalinen vastaus ja sen lähteet mallista.
# Tiedusteluvaiheen käsite (kielestä riippumaton)question = "Kuinka monta päivää vuosilomaa?" Question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # useimmat samankaltaiset partsprompt = f"""Vastaa KYSYMYKSIIN käyttämällä KYSYMYKSIÄ käyttämällä alla olevaa KONTEKSTIÄ, jos vastaus ei ole kontekstissa. Sovitus.KONTEKSTI:{osat}KYSYMYS: {kysymys}"""vastaus = model.uret(prompt) # esim. malli: claude-opus-4-8
Tämä kulku on kunkin vaiheen kartta, jonka puramme yksitellen seuraavissa yksiköissä.
Heikko kehote / Vahva kehote
Jopa samassa RAG-kontekstissa kehotteen laatu muuttaa vastausta.
Heikko kehote (avoin mallin sovittamiseen, ei vaadi resursseja):
Käytä näitä tietoja ja sano vuosiloma: {parts}. Kysymys: {question}
Tehokas kehote (maadoitus + "en tiedä" lupa + resurssipyyntö):
Vastaa vain alla olevan KONTEKSTIN perusteella. Jos asiayhteydessä ei ole selkeää vastausta, kirjoita "En löytänyt tästä tietoa dokumentaatiosta"; Älä arvaa. Lisää vastauksesi loppuun sen kappaleen [Source: file_name] -tunniste, johon luotat. KONTEKSTI: {pieces} KYSYMYS: {kysymys}
Kolme minikoteloa
Tapaus 1 – Henkilöstöassistentti (henkilöstö). Yrityksellä on 340-sivuinen HR-käsikirja ja työntekijät esittävät keskimäärin 90 kysymystä päivässä. Hienosäätöä kokeiltiin, mutta koska käsikirja päivitettiin kuukausittain, uudelleenkoulutusta vaadittiin joka kerta; Kustannukset nousivat tuhansiin dollareihin kuukaudessa. RAG:iin vaihtamisen jälkeen päivitys väheni "indeksoi asiakirja uudelleen" -vaiheeseen (minuutteja) ja oikean vastauksen osuus nousi 71 %:sta 93 %:iin manuaalisessa mittauksessa.
Tapaus 2 – Asiakastuki. Tukitiimillä on 12 000 ratkaistua lippua ja 800 ohjeartikkelia. Edustajalla kestää keskimäärin 4 minuuttia löytää vastaus manuaalisesti. Kun RAG-assistentti toi 5 tärkeintä tietuetta ja tuotti vastausluonnoksen, aika lyheni 40 sekuntiin; Mutta tiimi ymmärsi riskin "näyttää epävarmalta tuomalla väärän artikkelin" ja teki lähteen mainitsemisen pakolliseksi.
Tapaus 3 — Laki. Sopimustiimi kysyi "missä sopimuksissa salassapitolauseke kestää 5 vuotta?" hän kysyy kysymyksen. Pitkässä kontekstitutkimuksessa 60 sopimusta täytettiin yhteen kehotteeseen; malli ohitti kaksi keskimmäistä sopimusta. Kun vain asiaankuuluvat tuotteet otettiin käyttöön RAG:n kanssa, token-kustannukset laskivat 80 % ja puuttuva ohitus nollattiin.
Miksi RAG:ta tarvitaan?
- Ajankohtaisuus: Pääset tietoihin koulutuksen päättymispäivän jälkeen.
- Erityistiedot: Sisäiset asiakirjasi eivät sisälly minkään mallin koulutukseen; Vain sinä voit antaa.
- Todennettavuus: Voit mainita vastauksen lähteen (sitaatin) – olennaista tarkastuksen ja luottamuksen kannalta.
- Hallusinaatioiden hallinta: Se luottaa sen eteen asetettuun tekstiin mallin muodostamisen sijaan.
- Kustannukset: Se on paljon halvempaa ja nopeampaa ottaa käyttöön kuin hienosäätö.
Varoitus: RAG ei ole taikuutta. Jos tuot sisään väärän palan, malli saa väärän vastauksen näyttäen "luottamukselta". Muista lause "Haun laatu = RAG-laatu".
Yleisiä virheitä
- RAG:n sekoittaminen hienosäätöön: RAG ei muuta painoja; Se vain lisää kontekstia. Näiden kahden sekoittaminen johtaa väärän arkkitehtuurin valintaan.
- Ei salli "En tiedä": Jos kehote jättää mallin vapaaksi täyttää tyhjän tilan, se korvaa.
- Lähteitä ei mainita: Vastausta ilman lähdettä ei voida tarkistaa; Käyttäjä ei voi huomata virhettä.
- Kaiken yhdistäminen yhteen kehotteeseen: Pitkä konteksti näyttää halvalta, mutta on kallis ja puuttuu keskimmäinen tieto.
- Jumissa sukupolvessa ilman haun mittaamista: Jos vastaus on huono, kysy ensin "Tuiko oikea osa?" pitäisi kysyä.
Yhteenvetona
- RAG on lähestymistapa, joka liittää kysymykseen relevantteja asiakirjoja malliin kontekstina; ei muuta painoja ("avoin kirjakoe").
- Hienosäätö opettaa tyyliä/muotoa, RAG antaa ajankohtaista ja erityistä tietoa; pitkä konteksti toimii hyvin pienille kiinteille sarjoille. Useimmissa skenaarioissa RAG:ta kokeillaan ensin.
- Liukuhihnassa on kaksi vaihetta: offline-indeksointi (pala + upotus + tallennus) ja online-kysely (haku + kehote + generointi).
- RAG tarjoaa oikea-aikaisuutta, tarkkoja tietoja, todennettavuutta, hallusinaatioiden hallintaa ja edullisia kustannuksia.
- Järjestelmän laatu riippuu suoraan haun laadusta: väärä pala tarkoittaa väärää vastausta.
Sovellustehtävä
Valitse aito tietolähde omalta tiimiltäsi (esim. menettelydokumentti tai UKK-sivu). (1) Kirjoita 5 asiakysymystä tästä lähteestä. (2) Huomaa, mikä osa asiakirjasta sisältää oikean vastauksen kuhunkin kysymykseen – tästä tulee "kultainen vastaus" -luettelosi. (3) Käytä yllä olevaa "vahva kehote" -mallia, liitä asianmukainen osio manuaalisesti kontekstiksi ja kysy mallia. (4) Vertaa mallin antamaa vastausta kultaiseen ja merkitse tosi/epätosi. Tämä on ensimmäinen manuaalinen versio arvioinnista, jonka automatisoit tulevissa yksiköissä.
tarkistuslista
- [ ] Voin selittää yhdellä lauseella, että RAG ei muuta painoja, se vain lisää kontekstia.
- [ ] Osaan erottaa RAG:n, hienosäädön ja pitkän kontekstin ja milloin mikä on sopivaa.
- [ ] Osaan laskea indeksointivaiheet (kerää-silputa-upota-tallentaa) ja kyselyn (embed-fetch-prompt-generate) vaiheet järjestyksessä.
- [ ] Tiedän, miksi lisäsin kehotteeseen "jos se ei ole asiayhteydessä, sano, että en tiedä" ja "mainitse lähdettä" -ohjeet.
- [ ] Pystyn mukauttamaan periaatteen "Retrieval quality = RAG quality" omaan tapaukseeni.