Unit 5 / 11

Penolong Seni Bina yang Berbincang dengan Data Syarikat

Keuntungan:

  • Mereka bentuk komponen dan aliran data pembantu RAG perusahaan hujung ke hujung
  • Menggabungkan data berbilang sumber (wiki, tiket, PDF, pangkalan data) menjadi pembantu tunggal
  • Buat keputusan seni bina untuk kebolehskalaan, caching dan kependaman

Dalam unit sebelumnya, kami mempelajari bahagian satu demi satu: pembenaman, pangkalan data vektor, chunking, pengambilan semula. Sekarang mari kita gabungkan ini dan bina seni bina hujung ke hujung pembantu yang bercakap dengan data syarikat anda sendiri. Matlamatnya adalah untuk meminta pekerja bertanya, "Apakah polisi cuti kami?" Sistem di mana orang boleh bertanya soalan, jawapannya adalah berdasarkan dokumen dalaman sebenar, petikan dan menggabungkan berbilang sumber data. Unit ini memproses keseluruhan seni bina, aliran data dan keputusan peringkat pengeluaran.

Komponen Hujung ke Hujung

Pembantu RAG korporat terdiri daripada dua barisan berasingan. Barisan pengindeksan (luar talian) menyediakan data; Baris pertanyaan (dalam talian) menjawab soalan.

Komponen baris pengindeksan:

  1. Penyambung: Penyambung yang menarik data daripada sumber — wiki, sistem tiket, stor fail, pangkalan data, e-mel.
  2. Normalisasi: Menukar format berbeza (PDF, HTML, DOCX) kepada membersihkan teks; pembersihan header/footer.
  3. Chunking + metadata: Chunking dan penandaan (sumber, tarikh, kuasa).
  4. Membenamkan + memuatkan: Menulis vektor dan metadata ke dalam pangkalan data vektor.

Pertanyaan komponen saluran paip:

  1. Prapemprosesan pertanyaan: Penulisan semula, desentralisasi.
  2. Pendapatan semula: Carian hibrid + penapis metadata + kedudukan semula.
  3. Penciptaan segera: Meletakkan konteks + soalan + arahan ke dalam templat.
  4. Penjanaan: Jawapan berasaskan (kontekstual) daripada model + sumber.
  5. Pemprosesan pasca: Pemformatan petikan, semakan keselamatan, pengelogan.
Petua: Pisahkan secara fizikal baris pengindeksan daripada baris pertanyaan. Pengindeksan adalah perlahan dan berkala (berjalan dalam kelompok semalaman); Barisan siasatan hendaklah ringan dan serta-merta. Mencampurkan dua baris memaksa pemprosesan berat sementara pengguna menunggu.

Visualisasi Aliran Data

[INDEXING - luar talian]Sumber → Normalize → Chunk+Metadata → Benam → Vector DB (wiki, tiket, PDF, DB)[QUERY - dalam talian]Soalan pengguna → Pra-pemprosesan → Retrieval (hybrid+filter+rerank) → Prompt (konteks+soalan+arahan)+→ Model → kami

Menggabungkan Data Pelbagai Sumber

Dalam syarikat sebenar, jawapannya tidak berhenti di satu tempat. “Bagaimana untuk mengeluarkan bayaran balik kepada pelanggan?” Jawapan kepada soalan boleh didapati dalam artikel bantuan (prosedur), dalam sejarah tiket (contoh sebenar) dan dalam PDF dasar (peraturan). Pembantu harus mencari kesemuanya dalam satu kolam.

Perkara kritikal: apabila menggabungkan sumber ke dalam stor vektor tunggal, setiap serpihan mesti membawa metadata `source_tour`. Jadi anda boleh mencari kesemuanya dan menapisnya jika perlu, seperti "hanya bawa dasar rasmi". Selain itu, sumber yang berbeza mempunyai tahap kebolehpercayaan yang berbeza: dasar rasmi > artikel bantuan > nota tiket pekerja. Anda boleh menentukan keutamaan ini dalam kedudukan semula atau gesaan.

Sumber

Jenis kandungan

amanah

Kekerapan kemas kini

PDF dasar

peraturan rasmi

tinggi

bulanan

Artikel bantuan

Prosedur

sederhana tinggi

mingguan

Sejarah tiket

sampel sebenar

sederhana

Berterusan

wiki

Nota campuran/semasa

Pembolehubah

Berterusan

Kebolehskalaan, Cache dan Latensi

Tiga isu menonjol dalam pengeluaran. Latensi: Pengalaman merosot apabila pengguna menunggu lebih daripada 2 saat. Penyelesaian: paparkan jawapan dalam bentuk penstriman — ia dituangkan ke skrin semasa model menulis. Cache: Untuk soalan lazim dan konteks berulang, cache meningkatkan kelajuan dan mengurangkan kos. Skala: Apabila pengguna bertambah, adalah perlu untuk dapat menskalakan pengambilan semula dan model panggilan secara mendatar.

Peraturan praktikal dari segi kos: langkah paling mahal biasanya bilangan token yang pergi ke model yang lebih besar. Oleh itu, mengurangkan konteks kepada 4 bahagian yang baik dengan penarafan semula meningkatkan kualiti dan kos. Reka bentuk biasa ialah menggunakan model yang lebih kecil/cepat untuk pengelasan atau penghalaan mudah, dan model yang lebih berkuasa untuk jawapan akhir (cth. claude-opus-4-8).

Awas: Jangan sediakan pengindeksan sebagai "buat sekali, lupakan". Dokumen ditukar, dipadam, ditambah. Wujudkan strategi pengindeksan semula: mengesan dokumen yang diubah dan hanya memprosesnya. Indeks basi menghasilkan jawapan yang kelihatan semasa tetapi salah.

Seni Bina Lemah / Seni Bina Kuat

Lemah (skrip tunggal, semuanya bercampur):

Apabila pengguna bertanya: baca dokumen pada masa itu, carikkannya, benamkannya, cari, jawabnya.# Masalah: semua pengindeksan diulang untuk setiap soalan; detik kelewatan, # tiada pemisahan sumber, tiada penapis, tiada muat semula.

Berkuasa (paip berpecah + metadata + cache + penstriman):

Pengindeksan: kumpulan berjalan pada waktu malam, menyegarkan dokumen yang telah ditukar. Pertanyaan: garis ringan — pra-pemprosesan → perolehan semula hibrid+penapis → kedudukan semula → gesaan → model (penstriman) → petikan → log. Soalan lazim dan sumber dicache.

Tiga Kes Mini

Kes 1 — Talian keliru, kelewatan berat. Sebuah permulaan menulis skrip yang memproses semula PDF dengan setiap soalan; Setiap jawapan mengambil purata 11 saat. Apabila baris pengindeksan dipisahkan dan data sebelum ini dipindahkan ke stor vektor, masa pertanyaan berkurangan kepada 1.3 saat dan dengan penstriman, "perkataan pertama" muncul dalam 400 ms.

Kes 2 — Terlalu banyak sumber, keutamaan yang salah. Pembantu sokongan memberikan berat yang sama kepada PDF polisi dan nota tiket lama; Model itu kadangkala membentangkan penilaian salah pekerja dari dua tahun lalu sebagai peraturan rasmi. Apabila metadata source_tour dan arahan "pertimbangkan dasar rasmi sekiranya berlaku konflik" ditambahkan pada segera, ralat keutamaan palsu telah dikurangkan sebanyak 89%.

Kes 3 — Indeks basi. Pembantu HR bekerja dengan indeks yang tidak dikemas kini selama 3 bulan; Dasar cuti telah berubah, tetapi pembantu itu mengatakan zaman dahulu. Apabila muat semula harian dipasang, yang mengesan fail berubah, kadar tindak balas semasa meningkat daripada 70% kepada 99%.

Kesilapan biasa

  • Mencampur baris pengindeksan dan pertanyaan: Pemprosesan berat dilakukan sementara pengguna menunggu; kelewatan meletup.
  • Tidak meletakkan jenis sumber dalam metadata: Tiada keutamaan dan penapisan; Sumber yang tidak dipercayai itu nampaknya rasmi.
  • Tidak mewujudkan strategi muat semula: Indeks menjadi basi; Jawapan salah yang kelihatan semasa dihasilkan.
  • Langkau penstriman: Pengguna melihat skrin kosong; Kelewatan yang dirasakan menjadi tinggi.
  • Menggunakan model terbesar pada setiap langkah: Kos meningkat tanpa perlu; Biarkan stereng kepada model yang lebih kecil.

Secara ringkasnya

  • Pembantu RAG korporat terdiri daripada dua baris berasingan: pengindeksan luar talian dan pertanyaan dalam talian; memisahkan mereka secara fizikal.
  • Pengindeksan = penyambung + normalize + chunk/metadata + embed/upload; pertanyaan = pra-proses + perolehan + gesaan + jana + pasca-proses.
  • Data berbilang sumber digabungkan menjadi satu repositori, tetapi metadata jenis_sumber dan keutamaan amanah dipelihara.
  • Penstriman dan cache untuk kependaman, pendikitan konteks dan pemilihan model untuk kos adalah kritikal.
  • Tanpa pengindeksan semula, indeks menjadi basi; Memproses semula menukar dokumen dengan kerap.

Tugasan permohonan

Lukis gambarajah seni bina pembantu untuk pasukan anda sendiri. (1) Kenal pasti sekurang-kurangnya tiga sumber data sebenar dan tuliskan keperluan penyambung, kekerapan kemas kini dan tahap kepercayaan untuk setiap satu. (2) Lukis garis pengindeksan dan pertanyaan secara berasingan dengan gambar rajah anak panah kotak. (3) "Di manakah saya boleh mengurangkan kependaman dan kos dalam pembantu ini?" Tulis sekurang-kurangnya dua keputusan konkrit untuk soalan itu. (4) Terangkan strategi muat semula anda dalam satu ayat: sumber manakah yang akan diindeks semula dan berapa kerap?

senarai semak

  • [ ] Saya boleh melukis baris pengindeksan dan pertanyaan secara berasingan dan dengan komponen yang betul.
  • [ ] Saya boleh menggabungkan data berbilang sumber dengan jenis_sumber dan keutamaan amanah.
  • [ ] Saya boleh membuat keputusan penstriman/cache untuk kependaman dan pemilihan model untuk kos.
  • [ ] Saya tahu mengapa strategi pengindeksan semula adalah penting.
  • [ ] Saya perlu ingat bahawa langkah paling mahal dalam seni bina saya biasanya token yang pergi ke model yang lebih besar.