Keuntungan:
- Menjelaskan bahawa RAG menyuntik konteks tanpa mengubah berat model dan berfungsi dengan logik 'peperiksaan buku terbuka'
- Membandingkan RAG dengan pendekatan konteks penalaan halus dan panjang mengikut kos, ketepatan masa dan senario penggunaan
- Menyenaraikan langkah-langkah saluran paip RAG biasa yang terdiri daripada fasa pengindeksan dan pertanyaan
Tidak kira betapa hebatnya model bahasa (kecerdasan buatan yang memahami dan menghasilkan teks; kami akan memanggilnya sebagai model mulai sekarang), ia tidak mengetahui kontrak yang ditandatangani oleh syarikat anda semalam, halaman wiki dalaman anda (pangkalan pengetahuan dalaman) atau nota keluaran yang diterbitkan pagi ini. Model ini terhad kepada pengetahuan am sehingga tarikh ia dilatih; Ini dipanggil "tarikh tamat pendidikan". RAG (Retrieval-Augmented Generation) mengisi jurang ini dengan tepat: ia mencari dokumen syarikat yang berkaitan dengan soalan, memberikannya kepada model sebagai konteks (iaitu teks tambahan yang akan dibacanya semasa menghasilkan jawapan) dan mempunyai jawapan yang dihasilkan berdasarkan konteks ini.
Dalam unit ini, kita akan melihat dengan jelas apa itu RAG, apabila ia diutamakan berbanding alternatif yang mana, dan langkah-langkah saluran paip RAG biasa. Semua unit seterusnya akan mendalami bahagian peta ini satu persatu.
Idea Asas RAG: Peperiksaan Buku Terbuka
Mari jelaskan RAG dalam satu ayat: "Mula-mula cari dokumen yang berkaitan, kemudian minta model membaca dokumen itu dan cetak jawapannya dengan sewajarnya."
Analogi yang paling berguna ialah ini: RAG mengalihkan model daripada "peperiksaan buku tertutup" kepada "peperiksaan buku terbuka." Dalam peperiksaan buku tertutup, pelajar menjawab hanya dari ingatan; Terdapat risiko tinggi untuk mengada-adakan perkara yang anda tidak ingat. Dalam peperiksaan buku terbuka, pelajar menjawab dengan melihat sumber yang diletakkan di hadapannya. Dalam RAG, model tidak lagi menjawab daripada ingatannya sendiri, tetapi daripada teks semasa dan khusus yang anda berikan.
Perkara kritikal: RAG tidak mengubah berat model, iaitu, berbilion parameter berangka yang telah dipelajari oleh model. Anda tidak melatih semula model. Untuk setiap soalan, anda menyuntik ketulan teks yang berkaitan dengan soalan itu ke dalam gesaan (teks arahan dihantar kepada model). Jadi anda tidak perlu melatih semula model apabila dokumen dikemas kini; anda hanya memuat semula rekod yang berkaitan dalam pangkalan data carian.
Petunjuk: Dua soalan menentukan kualiti RAG: (1) Adakah anda menemui dokumen yang betul? (2) Adakah model membacanya dengan betul? Yang pertama ialah "kualiti retrieval", yang kedua ialah "kualiti generasi". Kedua-duanya diukur dan diperbaiki secara berasingan.
RAG, Penalaan Halus atau Konteks Panjang?
Tiga laluan sering keliru apabila mencari penyelesaian kepada masalah organisasi. Mari kita jelaskan perbezaan mereka. Penalaan halus adalah mengemas kini berat model dengan data anda dan mengajarnya tingkah laku/gaya baharu. Konteks panjang bermakna mengisi semua dokumen terus ke dalam gesaan tanpa sebarang pilihan.
Pendekatan
Apa yang boleh
Bilakah ia sesuai?
Kos / Risiko
RAG
Menyuntik dokumen yang berkaitan sebagai konteks
Maklumat yang kerap berubah, luas dan khusus
Rendah; mudah dikemas kini, sumber boleh dipetik
Penalaan halus
Mengemas kini berat dengan data baharu
Gaya/format/pengajaran bahasa tetap
Tinggi; Latihan semula diperlukan dengan setiap kemas kini
Konteks panjang sahaja
Isi semua dokumen ke dalam gesaan
Set dokumen kecil dan pegun
Kos token dan risiko "kehilangan bahagian tengah" meningkat
Sebagai peraturan: Penalaan halus mengajar model cara bercakap; RAG memberitahu model apa yang perlu diketahui. Dalam kebanyakan senario perusahaan, RAG dicuba terlebih dahulu kerana ia murah, boleh dikemas kini dan boleh menunjukkan sumber jawapan. Konteks panjang adalah munasabah jika set dokumen benar-benar kecil dan tetap (mis. manual 20 halaman tunggal); Tetapi dengan beribu-ribu halaman, ia mahal dan model mungkin terlepas maklumat di tengah-tengah teks yang panjang.
Talian Paip RAG Biasa
RAG terdiri daripada dua fasa utama: pengindeksan (persediaan, dilakukan sekali atau secara berkala) dan pertanyaan (berjalan pada setiap soalan pengguna).
Pengindeksan langkah demi langkah (luar talian, tanpa menunggu pengguna):
- Kumpul: Tarik dokumen daripada sumber (PDF, wiki, sistem tiket, pangkalan data, e-mel).
- Pecahan: Pecahkan teks panjang kepada kepingan yang lebih kecil yang boleh diurus.
- Benamkan: Tukarkan setiap bahagian menjadi benam (vektor nombor yang membawa maksud teks).
- Simpan: Tulis vektor bersama teks dan metadata (sumber, tarikh, maklumat kebenaran) ke pangkalan data vektor.
Pertanyaan langkah demi langkah (dalam talian, sementara pengguna menunggu):
- Tukar soalan pengguna kepada pembenaman.
- Dapatkan bahagian yang paling serupa daripada pangkalan data vektor.
- Letakkan kepingan + soalan ini ke dalam templat segera.
- Dapatkan jawapan kontekstual dan sumbernya daripada model.
# Rangka konsep fasa pertanyaan (tidak bergantung pada bahasa)soalan = "Berapa hari cuti tahunan?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # most similar partsprompt = f"""Jawab SOALAN menggunakan KONTEKS di bawah. Jika jawapannya adalah "bukan" di bawah. Jika jawapannya adalah "bukan" di bawah. Pemasangan.KONTEKS:{bahagian}SOALAN: {soalan}"""jawapan = model.uret(prompt) # cth. model: claude-opus-4-8
Aliran ini ialah peta setiap peringkat, yang akan kami bongkar satu persatu dalam unit seterusnya.
Gesaan Lemah / Gesaan Kuat
Walaupun dengan konteks RAG yang sama, kualiti gesaan mengubah jawapan.
Gesaan lemah (terbuka kepada pemasangan model, tidak memerlukan sumber):
Gunakan maklumat ini dan sebut cuti tahunan: {parts}. Soalan: {soalan}
Gesaan berkuasa (grounding + kebenaran "Saya tidak tahu" + permintaan sumber):
Jawab hanya berdasarkan KONTEKS di bawah. Jika tiada jawapan yang jelas dalam konteks, tulis "Saya tidak dapat mencari maklumat tentang ini dalam dokumentasi"; Jangan meneka. Tambahkan teg [Sumber: file_name] bahagian yang anda harapkan pada penghujung jawapan anda. KONTEKS: {pieces} SOALAN: {question}
Tiga Kes Mini
Kes 1 — Pembantu HR (Sumber Manusia). Sebuah syarikat mempunyai buku panduan HR 340 muka surat dan pekerja bertanya secara purata 90 soalan sehari. Penalaan halus telah dicuba, tetapi memandangkan manual dikemas kini setiap bulan, latihan semula diperlukan setiap kali; Kosnya mencecah ribuan ringgit sebulan. Selepas bertukar kepada RAG, kemas kini telah dikurangkan kepada langkah "indeks semula dokumen" (minit) dan kadar jawapan betul meningkat daripada 71% kepada 93% dalam pengukuran manual.
Kes 2 — Sokongan pelanggan. Pasukan sokongan mempunyai 12,000 tiket yang diselesaikan dan 800 artikel bantuan. Ia mengambil masa purata 4 minit untuk seorang wakil mencari jawapan secara manual. Apabila pembantu RAG membawa 5 rekod paling relevan dan menghasilkan respons draf, masa dikurangkan kepada 40 saat; Tetapi pasukan itu menyedari risiko "kelihatan tidak pasti dengan membawa artikel yang salah" dan menjadikan memetik sumber itu wajib.
Kes 3 - Undang-undang. Pasukan kontrak bertanya "dalam kontrak manakah klausa kerahsiaan bertahan 5 tahun?" dia bertanya soalan. Dalam percubaan konteks yang panjang, 60 kontrak telah diisi dalam satu gesaan; model itu melangkau dua kontrak pertengahan. Apabila hanya item yang berkaitan diperkenalkan dengan RAG, kos token berkurangan sebanyak 80% dan langkau yang hilang telah ditetapkan semula.
Mengapa RAG diperlukan?
- Semasa: Anda mengakses maklumat selepas tarikh tamat latihan.
- Maklumat khas: Dokumen dalaman anda tidak termasuk dalam latihan mana-mana model; Hanya anda boleh memberi.
- Kebolehpercayaan: Anda boleh memetik sumber jawapan (petikan) — penting untuk pengauditan dan kepercayaan.
- Kawalan halusinasi: Ia bergantung pada teks yang diletakkan di hadapannya dan bukannya membuat model.
- Kos: Ia jauh lebih murah dan lebih cepat untuk digunakan daripada penalaan halus.
Awas: RAG bukan sihir. Jika anda membawa masuk bahagian yang salah, model tiba pada jawapan yang salah kelihatan "yakin". Perlu diingat frasa "Kualiti pengambilan = kualiti RAG".
Kesilapan biasa
- Tersilap RAG untuk penalaan halus: RAG tidak mengubah pemberat; Ia hanya menambah konteks. Mengelirukan kedua-dua ini akan membawa kepada memilih seni bina yang salah.
- Tidak membenarkan "Saya tidak tahu": Jika gesaan membiarkan model bebas untuk mengisi tempat kosong, ia akan menggantikannya.
- Tidak memetik sumber: Jawapan tanpa sumber tidak boleh disemak; Pengguna tidak dapat menyedari kesilapan itu.
- Menyusun segala-galanya menjadi satu gesaan: Konteks panjang kelihatan murah tetapi mahal dan terlepas maklumat tengah.
- Terperangkap dalam generasi tanpa mengukur perolehan semula: Jika jawapannya buruk, mula-mula tanya "Adakah bahagian yang betul tiba?" patut ditanya.
Secara ringkasnya
- RAG ialah pendekatan yang menyuntik dokumen yang berkaitan dengan soalan ke dalam model sebagai konteks; tidak mengubah pemberat ("peperiksaan buku terbuka").
- Penalaan halus mengajar gaya/format, RAG memberikan maklumat terkini dan khusus; konteks panjang berfungsi dengan baik untuk set tetap kecil. Dalam kebanyakan senario, RAG dicuba terlebih dahulu.
- Saluran paip mempunyai dua fasa: pengindeksan luar talian (potongan + pembenaman + simpan) dan pertanyaan dalam talian (pendapatan + gesaan + jana).
- RAG menyediakan ketepatan masa, maklumat khusus, kebolehtentusahan, kawalan halusinasi dan kos rendah.
- Kualiti sistem secara langsung bergantung pada kualiti perolehan semula: bahagian yang salah bermakna jawapan yang salah.
Tugasan permohonan
Pilih sumber maklumat yang tulen daripada pasukan anda sendiri (cth. dokumen prosedur atau halaman Soalan Lazim). (1) Tulis 5 soalan fakta tentang sumber ini. (2) Perhatikan bahagian dokumen mana yang mengandungi jawapan yang betul untuk setiap soalan — ini menjadi senarai "jawapan emas" anda. (3) Menggunakan templat "gesaan kuat" di atas, tampal bahagian yang berkaitan secara manual sebagai konteks dan tanya model. (4) Bandingkan jawapan yang diberikan oleh model dengan jawapan emas dan tandakan sebagai benar/salah. Ini ialah versi manual pertama penilaian yang akan anda automasi dalam unit masa hadapan.
senarai semak
- [ ] Saya boleh menerangkan dalam satu ayat bahawa RAG tidak mengubah pemberat, ia hanya menambah konteks.
- [ ] Saya boleh membezakan antara RAG, penalaan halus dan konteks panjang dan bila mana yang sesuai.
- [ ] Saya boleh mengira fasa pengindeksan (collect-shred-embed-save) dan pertanyaan (embed-fetch-prompt-generate) mengikut urutan.
- [ ] Saya tahu sebab saya menambahkan arahan "jika tidak dalam konteks, katakan saya tidak tahu" dan "petik sumber" pada gesaan.
- [ ] Saya boleh menyesuaikan prinsip "Kualiti pengambilan = kualiti RAG" kepada kes saya sendiri.