Unit 1 / 11

Apakah RAG dan Mengapa Ia Perlu?

Keuntungan:

  • Menjelaskan bahawa RAG menyuntik konteks tanpa mengubah berat model dan berfungsi dengan logik 'peperiksaan buku terbuka'
  • Membandingkan RAG dengan pendekatan konteks penalaan halus dan panjang mengikut kos, ketepatan masa dan senario penggunaan
  • Menyenaraikan langkah-langkah saluran paip RAG biasa yang terdiri daripada fasa pengindeksan dan pertanyaan

Tidak kira betapa hebatnya model bahasa (kecerdasan buatan yang memahami dan menghasilkan teks; kami akan memanggilnya sebagai model mulai sekarang), ia tidak mengetahui kontrak yang ditandatangani oleh syarikat anda semalam, halaman wiki dalaman anda (pangkalan pengetahuan dalaman) atau nota keluaran yang diterbitkan pagi ini. Model ini terhad kepada pengetahuan am sehingga tarikh ia dilatih; Ini dipanggil "tarikh tamat pendidikan". RAG (Retrieval-Augmented Generation) mengisi jurang ini dengan tepat: ia mencari dokumen syarikat yang berkaitan dengan soalan, memberikannya kepada model sebagai konteks (iaitu teks tambahan yang akan dibacanya semasa menghasilkan jawapan) dan mempunyai jawapan yang dihasilkan berdasarkan konteks ini.

Dalam unit ini, kita akan melihat dengan jelas apa itu RAG, apabila ia diutamakan berbanding alternatif yang mana, dan langkah-langkah saluran paip RAG biasa. Semua unit seterusnya akan mendalami bahagian peta ini satu persatu.

Idea Asas RAG: Peperiksaan Buku Terbuka

Mari jelaskan RAG dalam satu ayat: "Mula-mula cari dokumen yang berkaitan, kemudian minta model membaca dokumen itu dan cetak jawapannya dengan sewajarnya."

Analogi yang paling berguna ialah ini: RAG mengalihkan model daripada "peperiksaan buku tertutup" kepada "peperiksaan buku terbuka." Dalam peperiksaan buku tertutup, pelajar menjawab hanya dari ingatan; Terdapat risiko tinggi untuk mengada-adakan perkara yang anda tidak ingat. Dalam peperiksaan buku terbuka, pelajar menjawab dengan melihat sumber yang diletakkan di hadapannya. Dalam RAG, model tidak lagi menjawab daripada ingatannya sendiri, tetapi daripada teks semasa dan khusus yang anda berikan.

Perkara kritikal: RAG tidak mengubah berat model, iaitu, berbilion parameter berangka yang telah dipelajari oleh model. Anda tidak melatih semula model. Untuk setiap soalan, anda menyuntik ketulan teks yang berkaitan dengan soalan itu ke dalam gesaan (teks arahan dihantar kepada model). Jadi anda tidak perlu melatih semula model apabila dokumen dikemas kini; anda hanya memuat semula rekod yang berkaitan dalam pangkalan data carian.

Petunjuk: Dua soalan menentukan kualiti RAG: (1) Adakah anda menemui dokumen yang betul? (2) Adakah model membacanya dengan betul? Yang pertama ialah "kualiti retrieval", yang kedua ialah "kualiti generasi". Kedua-duanya diukur dan diperbaiki secara berasingan.

RAG, Penalaan Halus atau Konteks Panjang?

Tiga laluan sering keliru apabila mencari penyelesaian kepada masalah organisasi. Mari kita jelaskan perbezaan mereka. Penalaan halus adalah mengemas kini berat model dengan data anda dan mengajarnya tingkah laku/gaya baharu. Konteks panjang bermakna mengisi semua dokumen terus ke dalam gesaan tanpa sebarang pilihan.

Pendekatan

Apa yang boleh

Bilakah ia sesuai?

Kos / Risiko

RAG

Menyuntik dokumen yang berkaitan sebagai konteks

Maklumat yang kerap berubah, luas dan khusus

Rendah; mudah dikemas kini, sumber boleh dipetik

Penalaan halus

Mengemas kini berat dengan data baharu

Gaya/format/pengajaran bahasa tetap

Tinggi; Latihan semula diperlukan dengan setiap kemas kini

Konteks panjang sahaja

Isi semua dokumen ke dalam gesaan

Set dokumen kecil dan pegun

Kos token dan risiko "kehilangan bahagian tengah" meningkat

Sebagai peraturan: Penalaan halus mengajar model cara bercakap; RAG memberitahu model apa yang perlu diketahui. Dalam kebanyakan senario perusahaan, RAG dicuba terlebih dahulu kerana ia murah, boleh dikemas kini dan boleh menunjukkan sumber jawapan. Konteks panjang adalah munasabah jika set dokumen benar-benar kecil dan tetap (mis. manual 20 halaman tunggal); Tetapi dengan beribu-ribu halaman, ia mahal dan model mungkin terlepas maklumat di tengah-tengah teks yang panjang.

Talian Paip RAG Biasa

RAG terdiri daripada dua fasa utama: pengindeksan (persediaan, dilakukan sekali atau secara berkala) dan pertanyaan (berjalan pada setiap soalan pengguna).

Pengindeksan langkah demi langkah (luar talian, tanpa menunggu pengguna):

  1. Kumpul: Tarik dokumen daripada sumber (PDF, wiki, sistem tiket, pangkalan data, e-mel).
  2. Pecahan: Pecahkan teks panjang kepada kepingan yang lebih kecil yang boleh diurus.
  3. Benamkan: Tukarkan setiap bahagian menjadi benam (vektor nombor yang membawa maksud teks).
  4. Simpan: Tulis vektor bersama teks dan metadata (sumber, tarikh, maklumat kebenaran) ke pangkalan data vektor.

Pertanyaan langkah demi langkah (dalam talian, sementara pengguna menunggu):

  1. Tukar soalan pengguna kepada pembenaman.
  2. Dapatkan bahagian yang paling serupa daripada pangkalan data vektor.
  3. Letakkan kepingan + soalan ini ke dalam templat segera.
  4. Dapatkan jawapan kontekstual dan sumbernya daripada model.

# Rangka konsep fasa pertanyaan (tidak bergantung pada bahasa)soalan = "Berapa hari cuti tahunan?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # most similar partsprompt = f"""Jawab SOALAN menggunakan KONTEKS di bawah. Jika jawapannya adalah "bukan" di bawah. Jika jawapannya adalah "bukan" di bawah. Pemasangan.KONTEKS:{bahagian}SOALAN: {soalan}"""jawapan = model.uret(prompt) # cth. model: claude-opus-4-8

Aliran ini ialah peta setiap peringkat, yang akan kami bongkar satu persatu dalam unit seterusnya.

Gesaan Lemah / Gesaan Kuat

Walaupun dengan konteks RAG yang sama, kualiti gesaan mengubah jawapan.

Gesaan lemah (terbuka kepada pemasangan model, tidak memerlukan sumber):

Gunakan maklumat ini dan sebut cuti tahunan: {parts}. Soalan: {soalan}

Gesaan berkuasa (grounding + kebenaran "Saya tidak tahu" + permintaan sumber):

Jawab hanya berdasarkan KONTEKS di bawah. Jika tiada jawapan yang jelas dalam konteks, tulis "Saya tidak dapat mencari maklumat tentang ini dalam dokumentasi"; Jangan meneka. Tambahkan teg [Sumber: file_name] bahagian yang anda harapkan pada penghujung jawapan anda. KONTEKS: {pieces} SOALAN: {question}

Tiga Kes Mini

Kes 1 — Pembantu HR (Sumber Manusia). Sebuah syarikat mempunyai buku panduan HR 340 muka surat dan pekerja bertanya secara purata 90 soalan sehari. Penalaan halus telah dicuba, tetapi memandangkan manual dikemas kini setiap bulan, latihan semula diperlukan setiap kali; Kosnya mencecah ribuan ringgit sebulan. Selepas bertukar kepada RAG, kemas kini telah dikurangkan kepada langkah "indeks semula dokumen" (minit) dan kadar jawapan betul meningkat daripada 71% kepada 93% dalam pengukuran manual.

Kes 2 — Sokongan pelanggan. Pasukan sokongan mempunyai 12,000 tiket yang diselesaikan dan 800 artikel bantuan. Ia mengambil masa purata 4 minit untuk seorang wakil mencari jawapan secara manual. Apabila pembantu RAG membawa 5 rekod paling relevan dan menghasilkan respons draf, masa dikurangkan kepada 40 saat; Tetapi pasukan itu menyedari risiko "kelihatan tidak pasti dengan membawa artikel yang salah" dan menjadikan memetik sumber itu wajib.

Kes 3 - Undang-undang. Pasukan kontrak bertanya "dalam kontrak manakah klausa kerahsiaan bertahan 5 tahun?" dia bertanya soalan. Dalam percubaan konteks yang panjang, 60 kontrak telah diisi dalam satu gesaan; model itu melangkau dua kontrak pertengahan. Apabila hanya item yang berkaitan diperkenalkan dengan RAG, kos token berkurangan sebanyak 80% dan langkau yang hilang telah ditetapkan semula.

Mengapa RAG diperlukan?

  • Semasa: Anda mengakses maklumat selepas tarikh tamat latihan.
  • Maklumat khas: Dokumen dalaman anda tidak termasuk dalam latihan mana-mana model; Hanya anda boleh memberi.
  • Kebolehpercayaan: Anda boleh memetik sumber jawapan (petikan) — penting untuk pengauditan dan kepercayaan.
  • Kawalan halusinasi: Ia bergantung pada teks yang diletakkan di hadapannya dan bukannya membuat model.
  • Kos: Ia jauh lebih murah dan lebih cepat untuk digunakan daripada penalaan halus.
Awas: RAG bukan sihir. Jika anda membawa masuk bahagian yang salah, model tiba pada jawapan yang salah kelihatan "yakin". Perlu diingat frasa "Kualiti pengambilan = kualiti RAG".

Kesilapan biasa

  • Tersilap RAG untuk penalaan halus: RAG tidak mengubah pemberat; Ia hanya menambah konteks. Mengelirukan kedua-dua ini akan membawa kepada memilih seni bina yang salah.
  • Tidak membenarkan "Saya tidak tahu": Jika gesaan membiarkan model bebas untuk mengisi tempat kosong, ia akan menggantikannya.
  • Tidak memetik sumber: Jawapan tanpa sumber tidak boleh disemak; Pengguna tidak dapat menyedari kesilapan itu.
  • Menyusun segala-galanya menjadi satu gesaan: Konteks panjang kelihatan murah tetapi mahal dan terlepas maklumat tengah.
  • Terperangkap dalam generasi tanpa mengukur perolehan semula: Jika jawapannya buruk, mula-mula tanya "Adakah bahagian yang betul tiba?" patut ditanya.

Secara ringkasnya

  • RAG ialah pendekatan yang menyuntik dokumen yang berkaitan dengan soalan ke dalam model sebagai konteks; tidak mengubah pemberat ("peperiksaan buku terbuka").
  • Penalaan halus mengajar gaya/format, RAG memberikan maklumat terkini dan khusus; konteks panjang berfungsi dengan baik untuk set tetap kecil. Dalam kebanyakan senario, RAG dicuba terlebih dahulu.
  • Saluran paip mempunyai dua fasa: pengindeksan luar talian (potongan + pembenaman + simpan) dan pertanyaan dalam talian (pendapatan + gesaan + jana).
  • RAG menyediakan ketepatan masa, maklumat khusus, kebolehtentusahan, kawalan halusinasi dan kos rendah.
  • Kualiti sistem secara langsung bergantung pada kualiti perolehan semula: bahagian yang salah bermakna jawapan yang salah.

Tugasan permohonan

Pilih sumber maklumat yang tulen daripada pasukan anda sendiri (cth. dokumen prosedur atau halaman Soalan Lazim). (1) Tulis 5 soalan fakta tentang sumber ini. (2) Perhatikan bahagian dokumen mana yang mengandungi jawapan yang betul untuk setiap soalan — ini menjadi senarai "jawapan emas" anda. (3) Menggunakan templat "gesaan kuat" di atas, tampal bahagian yang berkaitan secara manual sebagai konteks dan tanya model. (4) Bandingkan jawapan yang diberikan oleh model dengan jawapan emas dan tandakan sebagai benar/salah. Ini ialah versi manual pertama penilaian yang akan anda automasi dalam unit masa hadapan.

senarai semak

  • [ ] Saya boleh menerangkan dalam satu ayat bahawa RAG tidak mengubah pemberat, ia hanya menambah konteks.
  • [ ] Saya boleh membezakan antara RAG, penalaan halus dan konteks panjang dan bila mana yang sesuai.
  • [ ] Saya boleh mengira fasa pengindeksan (collect-shred-embed-save) dan pertanyaan (embed-fetch-prompt-generate) mengikut urutan.
  • [ ] Saya tahu sebab saya menambahkan arahan "jika tidak dalam konteks, katakan saya tidak tahu" dan "petik sumber" pada gesaan.
  • [ ] Saya boleh menyesuaikan prinsip "Kualiti pengambilan = kualiti RAG" kepada kes saya sendiri.