المكاسب:
- تصميم المكونات وتدفق البيانات لمساعد RAG الشامل للمؤسسة
- الجمع بين البيانات متعددة المصادر (ويكي، تذكرة، PDF، قاعدة البيانات) في مساعد واحد
- اتخذ قرارات معمارية تتعلق بقابلية التوسع والتخزين المؤقت ووقت الاستجابة
في الوحدات السابقة، تعلمنا الأجزاء واحدًا تلو الآخر: التضمين، وقاعدة بيانات المتجهات، والتقطيع، والاسترجاع. الآن دعونا ندمج هذه العناصر ونبني بنية شاملة لمساعد يتحدث مع بيانات شركتك الخاصة. الهدف هو أن يسأل الموظف: "ما هي سياسة الإجازات لدينا؟" نظام يمكن للأشخاص من خلاله طرح الأسئلة، وتستند الإجابات إلى مستندات داخلية حقيقية واستشهادات ودمج مصادر بيانات متعددة. تعالج هذه الوحدة البنية الكاملة وتدفق البيانات وقرارات مستوى الإنتاج.
مكونات نهاية إلى نهاية
يتكون مساعد RAG الخاص بالشركة من سطرين منفصلين. يقوم خط الفهرسة (غير متصل) بإعداد البيانات؛ سطر الاستعلام (عبر الإنترنت) يجيب على السؤال.
مكونات خط الفهرسة:
- الموصلات: الموصلات التي تسحب البيانات من المصادر - ويكي، ونظام التذاكر، ومخزن الملفات، وقاعدة البيانات، والبريد الإلكتروني.
- التطبيع: تحويل التنسيقات المختلفة (PDF، HTML، DOCX) إلى نص نظيف؛ تنظيف الرأس/التذييل.
- التقطيع + البيانات الوصفية: التقطيع ووضع العلامات (المصدر، التاريخ، السلطة).
- التضمين + التحميل: كتابة المتجهات والبيانات الوصفية في قاعدة بيانات المتجهات.
مكونات مسار الاستعلام:
- المعالجة المسبقة للاستعلام: إعادة الكتابة واللامركزية.
- الاسترجاع: بحث مختلط + مرشح بيانات التعريف + إعادة الترتيب.
- الإنشاء الفوري: وضع السياق + السؤال + التعليمات في القالب.
- التوليد: إجابة مؤرضة (سياقية) من النموذج + المصادر.
- مرحلة ما بعد المعالجة: تنسيق الاقتباس، والتحقق الأمني، والتسجيل.
نصيحة: قم بفصل سطر الفهرسة فعليًا عن سطر الاستعلام. الفهرسة بطيئة ودورية (تعمل على دفعات طوال الليل)؛ يجب أن يكون خط التحقيق خفيفًا وفوريًا. يؤدي خلط الخطين إلى إجراء عمليات معالجة ثقيلة أثناء انتظار المستخدم.
تصور تدفق البيانات
[الفهرس - غير متصل] الموارد → تطبيع → قطعة + بيانات التعريف → تضمين → Vector DB (wiki، تذكرة، PDF، DB) [QUERY - عبر الإنترنت] سؤال المستخدم → المعالجة المسبقة → الاسترجاع (مختلط + مرشح + إعادة ترتيب) → موجه (سياق + سؤال + تعليمات) → النموذج → الإجابة + المصدر → المستخدم
الجمع بين البيانات متعددة المصادر
في الشركات الحقيقية، لا يتوقف الجواب عند مكان واحد. "كيفية إصدار استرداد للعميل؟" يمكن العثور على إجابة السؤال في مقالة المساعدة (الإجراء)، وفي سجل التذكرة (أمثلة حقيقية)، وفي ملف السياسة PDF (القواعد). يجب على المساعد البحث عنهم جميعًا في مجموعة واحدة.
نقطة حرجة: عند دمج الموارد في مخزن متجه واحد، يجب أن تحمل كل جزء البيانات الوصفية لـ "source_tour". لذا يمكنك البحث فيها جميعًا وتصفيتها إذا لزم الأمر، مثل "إحضار السياسات الرسمية فقط". بالإضافة إلى ذلك، تتمتع المصادر المختلفة بمستويات مختلفة من الموثوقية: السياسة الرسمية > مقالة المساعدة > مذكرة تذكرة الموظف. يمكنك تحديد هذه الأولوية في إعادة الترتيب أو المطالبة.
المصدر
نوع المحتوى
الثقة
تردد التحديث
سياسة PDF
القاعدة الرسمية
عالية
شهريا
مقالة مساعدة
الإجراء
متوسطة عالية
أسبوعيا
تاريخ التذاكر
عينة حقيقية
متوسطة
مستمر
ويكي
مذكرة مختلطة / الحالية
متغير
مستمر
قابلية التوسع وذاكرة التخزين المؤقت ووقت الاستجابة
ثلاث قضايا تبرز في الإنتاج. الكمون: تتدهور التجربة عندما ينتظر المستخدم أكثر من ثانيتين. الحل: اعرض الإجابة في شكل بث مباشر - يتم سكبها على الشاشة بينما يكتب النموذج. ذاكرة التخزين المؤقت: بالنسبة للأسئلة المتداولة والسياقات المتكررة، تعمل ذاكرة التخزين المؤقت على زيادة السرعة وتقليل التكلفة. النطاق: مع زيادة عدد المستخدمين، من الضروري أن تكون قادرًا على توسيع نطاق الاسترجاع واستدعاءات النماذج أفقيًا.
القاعدة الأساسية فيما يتعلق بالتكلفة: الخطوة الأكثر تكلفة هي عادةً عدد الرموز المميزة التي تذهب إلى النموذج الأكبر. ولذلك، فإن تقليل السياق إلى 4 أجزاء جيدة عن طريق إعادة الترتيب يؤدي إلى تحسين الجودة والتكلفة. التصميم الشائع هو استخدام نموذج أصغر/أسرع للتصنيف أو التوجيه البسيط، ونموذج أكثر قوة للإجابة النهائية (على سبيل المثال، claude-opus-4-8).
تحذير: لا تقم بإعداد الفهرسة على أنها "افعلها مرة واحدة، انساها". يتم تغيير المستندات وحذفها وإضافتها. وضع استراتيجية لإعادة الفهرسة: اكتشاف المستندات التي تم تغييرها وإعادة معالجتها فقط. يُنتج الفهرس القديم إجابة تبدو حديثة ولكنها خاطئة.
عمارة ضعيفة / عمارة قوية
ضعيف (نص واحد، كل شيء مختلط):
عندما يسأل المستخدم: اقرأ المستندات في تلك اللحظة، قم بتمزيقها، تضمينها، البحث فيها، الإجابة عليها. # المشكلة: يتم تكرار جميع الفهرسة لكل سؤال؛ ثواني من التأخير، # لا يوجد فصل للمصدر، لا مرشح، لا تحديث.
قوية (تقسيم الأنابيب + البيانات الوصفية + ذاكرة التخزين المؤقت + الدفق):
الفهرسة: تشغيل الدفعة ليلاً، وتحديث المستندات التي تم تغييرها. الاستعلام: خط خفيف - معالجة مسبقة ← استرجاع مختلط + مرشح ← إعادة ترتيب ← موجه ← نموذج (تدفق) ← اقتباس ← سجل. يتم تخزين الأسئلة المتداولة والمصدر مؤقتًا.
ثلاث حالات صغيرة
الحالة 1 - خط مرتبك، تأخير شديد. قامت شركة ناشئة بكتابة برنامج نصي يعيد معالجة ملفات PDF مع كل سؤال؛ استغرقت كل إجابة ما متوسطه 11 ثانية. عندما تم فصل سطر الفهرسة وتم نقل البيانات مسبقًا إلى مخزن المتجهات، انخفض وقت الاستعلام إلى 1.3 ثانية ومع البث، ظهرت "الكلمة الأولى" في 400 مللي ثانية.
الحالة 2 - موارد كثيرة جدًا، وأولوية خاطئة. أعطى مساعد الدعم وزنًا متساويًا لملف PDF الخاص بالسياسة وملاحظات التذاكر القديمة؛ يقدم النموذج أحيانًا تقييمًا غير صحيح للموظف منذ عامين كقاعدة رسمية. عند إضافة بيانات تعريف source_tour والتعليمات "ضع في اعتبارك السياسة الرسمية في حالة وجود تعارض" إلى الموجه، تم تقليل أخطاء الأولوية الخاطئة بنسبة 89%.
الحالة 3 - مؤشر لا معنى له. كان مساعد الموارد البشرية يعمل على فهرس لم يتم تحديثه لمدة 3 أشهر؛ لقد تغيرت سياسة الإجازة، لكن المساعد كان يقول أيام زمان. عند تثبيت التحديث اليومي، الذي يكتشف الملفات التي تم تغييرها، زاد معدل الاستجابة الحالية من 70% إلى 99%.
الأخطاء الشائعة
- خلط سطور الفهرسة والاستعلام: تتم المعالجة الثقيلة أثناء انتظار المستخدم؛ تأخير ينفجر.
- عدم وضع نوع المصدر في البيانات الوصفية: لا يوجد تحديد للأولويات والتصفية؛ ويبدو أن المصدر غير الموثوق به هو رسمي.
- عدم إنشاء استراتيجية تحديث: يصبح الفهرس قديمًا؛ يتم إنتاج الإجابات الخاطئة التي تظهر الحالية.
- تخطي البث: ينظر المستخدم إلى شاشة فارغة؛ يصبح التأخير الملحوظ مرتفعًا.
- استخدام النموذج الأكبر في كل خطوة: زيادة التكلفة بلا داع؛ اترك التوجيه للنموذج الأصغر.
باختصار
- يتكون مساعد RAG الخاص بالشركة من سطرين منفصلين: الفهرسة دون اتصال بالإنترنت والاستعلام عبر الإنترنت؛ فصلهم جسديا.
- الفهرسة = الموصل + التطبيع + قطعة/بيانات التعريف + تضمين/تحميل؛ الاستعلام = المعالجة المسبقة + الاسترجاع + المطالبة + التوليد + المعالجة اللاحقة.
- يتم دمج البيانات متعددة المصادر في مستودع واحد، ولكن يتم الاحتفاظ ببيانات التعريف source_type وأولوية الثقة.
- يعد البث وذاكرة التخزين المؤقت لوقت الاستجابة وتقييد السياق واختيار النموذج للتكلفة أمرًا بالغ الأهمية.
- وبدون إعادة الفهرسة، يصبح الفهرس قديمًا؛ أعد معالجة المستندات المتغيرة بانتظام.
مهمة التطبيق
ارسم مخططًا معماريًا لمساعد فريقك الخاص. (1) حدد ثلاثة مصادر بيانات حقيقية على الأقل واكتب حاجة الموصل وتكرار التحديث ومستوى الثقة لكل منها. (2) ارسم خطوط الفهرسة والاستعلام بشكل منفصل باستخدام رسم تخطيطي على شكل سهم مربع. (3) "أين يمكنني تقليل زمن الوصول والتكلفة في هذا المساعد؟" اكتب على الأقل قرارين ملموسين بشأن السؤال. (4) قم بوصف استراتيجية التحديث الخاصة بك في جملة واحدة: ما هو المورد الذي سيتم إعادة فهرسته وكم مرة؟
قائمة مرجعية
- [ ] يمكنني رسم خطوط الفهرسة والاستعلام بشكل منفصل وبالمكونات الصحيحة.
- [ ] يمكنني دمج البيانات متعددة المصادر مع نوع المصدر وأولوية الثقة.
- [ ] يمكنني اتخاذ قرارات البث/التخزين المؤقت لوقت الاستجابة واختيار النموذج للتكلفة.
- [ ] أعرف سبب أهمية استراتيجية إعادة الفهرسة.
- [ ] أضع في اعتباري أن أغلى خطوة في بنيتي هي عادةً الرمز المميز الذي ينتقل إلى النموذج الأكبر.