Mga nadagdag:
- Ipinapaliwanag na ang RAG ay nag-inject ng konteksto nang hindi binabago ang mga timbang ng modelo at gumagana sa isang 'open book exam' na lohika
- Paghahambing ng RAG sa fine-tuning at mahabang konteksto ng mga diskarte ayon sa gastos, pagiging maagap at senaryo ng paggamit
- Paglilista ng mga hakbang ng isang tipikal na pipeline ng RAG na binubuo ng mga yugto ng pag-index at query
Gaano man kalakas ang isang modelo ng wika (artificial intelligence na nakakaunawa at gumagawa ng text; tatawagin natin itong modelo para sa maikli mula ngayon), hindi nito alam ang kontratang pinirmahan ng iyong kumpanya kahapon, ang iyong internal na wiki (internal knowledge base) na pahina, o ang release note na na-publish ngayong umaga. Ang modelo ay limitado sa pangkalahatang kaalaman hanggang sa petsa na ito ay sinanay; Ito ay tinatawag na "education cut-off date". Eksaktong pinupunan ng RAG (Retrieval-Augmented Generation) ang puwang na ito: hinahanap nito ang mga dokumento ng kumpanya na nauugnay sa tanong, ibinibigay ito sa modelo bilang konteksto (iyon ay, ang karagdagang teksto na babasahin nito habang ginagawa ang sagot) at may sagot na ginawa batay sa kontekstong ito.
Sa unit na ito, malinaw nating makikita kung ano ang RAG, kapag mas gusto ito kaysa sa kung aling mga alternatibo, at ang mga hakbang ng isang tipikal na pipeline ng RAG. Ang lahat ng kasunod na yunit ay magpapalalim sa mga bahagi ng mapa na ito nang paisa-isa.
Ang Pangunahing Ideya ng RAG: Open Book Exam
Ipaliwanag natin ang RAG sa isang pangungusap: "Hanapin muna ang nauugnay na dokumento, pagkatapos ay ipabasa sa modelo ang dokumentong iyon at i-print ang sagot nang naaayon."
Ang pinakakapaki-pakinabang na pagkakatulad ay ito: inililipat ng RAG ang modelo mula sa isang "closed book exam" patungo sa isang "open book exam." Sa saradong pagsusulit sa libro, ang mag-aaral ay sumasagot lamang mula sa memorya; Malaki ang panganib na gumawa ng hindi mo naaalala. Sa pagsusulit sa bukas na libro, ang mag-aaral ay sumasagot sa pamamagitan ng pagtingin sa pinagmulan na nakalagay sa harap niya. Sa RAG, hindi na sumasagot ang modelo mula sa sarili nitong memorya, ngunit mula sa kasalukuyan at partikular na text na ibibigay mo dito.
Kritikal na punto: Hindi binabago ng RAG ang mga timbang ng modelo, iyon ay, ang bilyun-bilyong numerong parameter na natutunan ng modelo. Hindi mo muling sanayin ang modelo. Para sa bawat tanong, mag-inject ka ng mga chunks ng text na may kaugnayan sa tanong na iyon sa prompt (text ng pagtuturo na ipinadala sa modelo). Kaya hindi mo kailangang sanayin muli ang modelo kapag na-update ang isang dokumento; i-refresh mo lang ang nauugnay na tala sa database ng paghahanap.
Hint: Dalawang tanong ang tumutukoy sa kalidad ng RAG: (1) Nahanap mo ba ang tamang dokumento? (2) Nabasa ba ito nang tama ng modelo? Ang una ay "kalidad ng pagkuha", ang pangalawa ay "kalidad ng henerasyon". Ang dalawa ay sinusukat at pinagbuti nang hiwalay.
RAG, Fine-Tuning o Mahabang Konteksto?
Tatlong landas ang madalas na nalilito kapag naghahanap ng solusyon sa isang problema sa organisasyon. Linawin natin ang kanilang pagkakaiba. Ang fine-tuning ay ang pag-update ng mga timbang ng modelo sa iyong data at pagtuturo dito ng bagong gawi/estilo. Ang mahabang konteksto ay nangangahulugan ng pagpuno ng lahat ng mga dokumento nang direkta sa prompt nang walang anumang pagpili.
Diskarte
Ano ang ginagawa
Kailan ito angkop?
Gastos / Panganib
RAG
Ini-inject ang nauugnay na dokumento bilang konteksto
Madalas na nagbabago, malawak, tiyak na impormasyon
mababa; madaling i-update, maaaring banggitin ang pinagmulan
Fine-tuning
Ina-update ang mga timbang gamit ang bagong data
Nakapirming istilo/format/pagtuturo ng wika
Mataas; Kinakailangan ang muling pagsasanay sa bawat pag-update
Mahabang konteksto lang
Punan ang lahat ng mga dokumento sa prompt
Maliit, nakatigil na hanay ng dokumento
Ang halaga ng token at panganib na "mawala ang gitnang bahagi" ay tumataas
Bilang panuntunan: Itinuturo ng fine-tuning ang modelo kung paano magsalita; Sinasabi ng RAG sa modelo kung ano ang dapat malaman. Sa karamihan ng mga sitwasyon ng negosyo, ang RAG ay sinubukan muna dahil ito ay mura, naa-update, at maaaring ipakita ang pinagmulan ng sagot. Ang mahabang konteksto ay makatwiran kung ang hanay ng dokumento ay talagang maliit at naayos (hal. isang solong 20-pahinang manwal); Ngunit sa libu-libong mga pahina, ito ay mahal at ang modelo ay maaaring makaligtaan ng impormasyon sa gitna ng mahabang teksto.
Isang Karaniwang RAG Pipeline
Ang RAG ay binubuo ng dalawang pangunahing yugto: pag-index (paghahanda, ginagawa nang isang beses o pana-panahon) at pag-query (tumatakbo sa bawat tanong ng user).
Hakbang-hakbang na pag-index (offline, nang hindi naghihintay ng user):
- Kolektahin: Hilahin ang mga dokumento mula sa mga mapagkukunan (PDF, wiki, ticket system, database, email).
- Chunking: Hatiin ang mahabang text sa mas maliliit na mapapamahalaang piraso.
- I-embed: I-convert ang bawat bahagi sa pag-embed (ang vector ng numero na nagdadala ng kahulugan ng teksto).
- I-save: Isulat ang mga vector kasama ang teksto at metadata (pinagmulan, petsa, impormasyon ng awtorisasyon) sa database ng vector.
Hakbang-hakbang na query (online, habang naghihintay ang user):
- I-convert ang tanong ng user sa pag-embed.
- Kunin ang pinakakaparehong bahagi mula sa database ng vector.
- Ilagay ang mga piraso + tanong na ito sa isang prompt na template.
- Kunin ang sagot sa konteksto at ang mga pinagmulan nito mula sa modelo.
# Conceptual outline of the inquiry phase (not dependent on language)question = "Ilang araw ng annual leave?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # most similar partsprompt = f"""Sagutin ang TANONG gamit ang CONTEXTI sa ibaba. Kung ang sagot ay "wala." Fitting.CONTEXT:{parts}QUESTION: {question}"""answer = model.uret(prompt) # e.g. modelo: claude-opus-4-8
Ang daloy na ito ay isang mapa ng bawat yugto, na isa-isa naming i-unpack sa mga kasunod na unit.
Mahina Prompt / Malakas na Prompt
Kahit na may parehong konteksto ng RAG, binabago ng kalidad ng prompt ang sagot.
Mahina ang prompt (bukas sa modelong angkop, hindi nangangailangan ng mga mapagkukunan):
Gamitin ang impormasyong ito at sabihin ang taunang bakasyon: {parts}. Tanong: {tanong}
Napakahusay na prompt (grounding + "Hindi ko alam" na pahintulot + kahilingan sa mapagkukunan):
Sagot lamang batay sa CONTEXT sa ibaba. Kung walang malinaw na sagot sa konteksto, isulat ang "Hindi ko mahanap ang impormasyon tungkol dito sa dokumentasyon"; Huwag hulaan. Idagdag ang tag na [Source: file_name] ng piraso na iyong pinagkakatiwalaan sa dulo ng iyong sagot. CONTEXT: {pieces} TANONG: {question}
Tatlong Mini Case
Case 1 — HR assistant (Human Resources). Ang isang kumpanya ay may 340-pahinang HR handbook at ang mga empleyado ay nagtatanong ng average na 90 mga katanungan sa isang araw. Sinubukan ang fine-tuning, ngunit dahil ang manwal ay na-update buwan-buwan, kinakailangan ang muling pagsasanay sa bawat pagkakataon; Ang gastos ay umabot ng libu-libong dolyar bawat buwan. Pagkatapos lumipat sa RAG, ibinaba ang update sa hakbang na "muling i-index ang dokumento" (minuto) at tumaas ang rate ng tamang sagot mula 71% hanggang 93% sa manu-manong pagsukat.
Kaso 2 — Suporta sa customer. Ang koponan ng suporta ay may 12,000 naresolbang ticket at 800 artikulo ng tulong. Tumatagal ng average na 4 na minuto para manual na mahanap ng isang kinatawan ang sagot. Kapag ang RAG assistant ay nagdala ng 5 pinaka-kaugnay na mga talaan at gumawa ng draft na tugon, ang oras ay nabawasan sa 40 segundo; Ngunit napagtanto ng koponan ang panganib na "magmukhang hindi sigurado sa pamamagitan ng pagdadala ng maling artikulo" at ginawang mandatory ang pagbanggit sa pinagmulan.
Kaso 3 — Batas. Isang contracting team ang nagtanong "sa aling mga kontrata ang sugnay ng pagiging kumpidensyal ay tumatagal ng 5 taon?" pagtatanong niya. Sa mahabang pagsubok sa konteksto, 60 kontrata ang napunan sa isang prompt; Nilaktawan ng modelo ang gitnang dalawang kontrata. Kapag ang mga nauugnay na item lang ang ipinakilala sa RAG, ang halaga ng token ay bumaba ng 80% at ang nawawalang paglaktaw ay na-reset.
Bakit kailangan ang RAG?
- Currentness: Ina-access mo ang impormasyon pagkatapos ng cut-off date ng pagsasanay.
- Espesyal na impormasyon: Ang iyong mga panloob na dokumento ay hindi kasama sa pagsasanay ng anumang modelo; Ikaw lang ang makakapagbigay.
- Pagpapatunay: Maaari mong banggitin ang pinagmulan ng sagot (citation) — mahalaga para sa pag-audit at pagtitiwala.
- Kontrol ng hallucination: Umaasa ito sa tekstong inilagay sa harap nito sa halip na gumawa ng isang modelo.
- Gastos: Ito ay mas mura at mas mabilis na gamitin kaysa sa fine-tuning.
Babala: Ang RAG ay hindi magic. Kung maling piraso ang dinala mo, darating ang modelo sa maling sagot na mukhang "tiwala." Tandaan ang pariralang "Retrieval quality = RAG quality".
Mga karaniwang pagkakamali
- Napagkamalan ang RAG para sa fine-tuning: Hindi binabago ng RAG ang mga timbang; Nagdaragdag lamang ito ng konteksto. Ang pagkalito sa dalawang ito ay hahantong sa pagpili ng maling arkitektura.
- Hindi pinapayagan ang "Hindi ko alam": Kung iniwan ng prompt ang modelo na libre upang punan ang blangko, ito ay bubuo.
- Hindi nagbabanggit ng mga mapagkukunan: Ang isang sagot na walang pinagmulan ay hindi maaaring suriin; Hindi mapapansin ng user ang pagkakamali.
- I-cramming ang lahat sa isang prompt: Ang mahabang konteksto ay mukhang mura ngunit mahal at nakakaligtaan ang gitnang impormasyon.
- Natigil sa henerasyon nang hindi sinusukat ang pagkuha: Kung masama ang sagot, itanong muna ang "Dumating ba ang tamang bahagi?" dapat itanong.
Sa buod
- Ang RAG ay isang diskarte na naglalagay ng mga dokumentong nauugnay sa tanong sa modelo bilang konteksto; hindi binabago ang mga timbang ("open book exam").
- Ang fine-tuning ay nagtuturo ng istilo/format, ang RAG ay nagbibigay ng kasalukuyan at tiyak na impormasyon; mahusay na gumagana ang mahabang konteksto para sa maliliit na nakapirming set. Sa karamihan ng mga sitwasyon, sinubukan muna ang RAG.
- Ang pipeline ay may dalawang yugto: offline indexing (chunk + embedding + save) at online querying (pagbawi + prompt + generate).
- Ang RAG ay nagbibigay ng pagiging maagap, partikular na impormasyon, pagpapatunay, kontrol sa guni-guni, at mababang gastos.
- Ang kalidad ng system ay direktang nakasalalay sa kalidad ng pagkuha: ang maling piraso ay nangangahulugang maling sagot.
Gawain ng aplikasyon
Pumili ng isang tunay na mapagkukunan ng impormasyon mula sa iyong sariling koponan (hal. isang dokumento ng pamamaraan o pahina ng FAQ). (1) Sumulat ng 5 makatotohanang tanong tungkol sa pinagmulang ito. (2) Tandaan kung aling bahagi ng dokumento ang naglalaman ng tamang sagot para sa bawat tanong — ito ang magiging iyong listahan ng "gintong sagot". (3) Gamit ang template na "malakas na prompt" sa itaas, manu-manong i-paste ang nauugnay na seksyon bilang konteksto at magtanong sa isang modelo. (4) Ihambing ang sagot na ibinigay ng modelo sa gintong sagot at markahan bilang tama/mali. Ito ang unang manu-manong bersyon ng pagtatasa na isa-automate mo sa mga unit sa hinaharap.
checklist
- [ ] Maaari kong ipaliwanag sa isang pangungusap na hindi binabago ng RAG ang mga timbang, nagdaragdag lamang ito ng konteksto.
- [ ] Maaari kong makilala ang pagitan ng RAG, fine-tuning at mahabang konteksto at kung alin ang naaangkop.
- [ ] Maaari kong bilangin ang mga yugto ng pag-index (collect-shred-embed-save) at query (embed-fetch-prompt-generate) sa pagkakasunud-sunod.
- [ ] Alam ko kung bakit ko idinagdag ang "kung wala ito sa konteksto, sabihing hindi ko alam" at "cite source" na mga tagubilin sa prompt.
- [ ] Maaari kong iakma ang prinsipyo ng "Retrieval quality = RAG quality" sa sarili kong kaso.