یونٹ 5 / 12

نالج بیس اور آر اے جی: بوٹ اور ایجنٹ کیسے صحیح جواب تلاش کرتے ہیں۔

فائدہ:

  • سمجھیں کہ کس طرح RAG (ٹکڑا، رسائی، وسائل پر منحصر نسل) کام کرتا ہے اور یہ کس طرح فریب کو کم کرتا ہے۔
  • ایک علمی بنیاد قائم کرکے جوابات کے معیار کو بڑھانے کی صلاحیت جو موجودہ، واضح، تنازعات سے پاک اور واحد صحیح ذریعہ ہو۔
  • ماڈل کو ہدایت دینے کی اہلیت 'اگر یہ ماخذ میں نہیں ہے تو مجھے بتائیں کہ آپ نہیں جانتے' اور جن سوالات کے جوابات نہیں دے سکتے ان کو علم کی بنیاد میں بہتری میں بدل دیں۔

بوٹ یا ایجنٹ کا اسسٹنٹ جو جواب دیتا ہے وہ اتنا ہی اچھا ہوتا ہے جتنا کہ وہ معلومات جس پر مبنی ہے۔ جب صارف پوچھتا ہے کہ "کیا مہم جاری ہے؟"، تو صحیح جواب ماڈل کی یادداشت میں نہیں ہے، بلکہ ادارے کے موجودہ علمی مرکز میں ہے۔ اسی لیے کال سینٹر مصنوعی ذہانت کا مرکز علم کی بنیاد ہے (KB): ایک تازہ ترین وسیلہ جہاں پروڈکٹس، پالیسیاں، عمومی سوالنامہ، طریقہ کار اور قواعد تحریری طور پر رکھے جاتے ہیں۔ اور وہ طریقہ جو اس نالج بیس کو مصنوعی ذہانت سے محفوظ طریقے سے جوڑتا ہے اسے RAG کہا جاتا ہے: Retrieval-Augmented Generation — جواب کو اپنی یادداشت سے بنانے کے بجائے، ماڈل پہلے ماخذ (بازیافت) سے معلومات کے متعلقہ ٹکڑوں کو بازیافت کرتا ہے اور پھر صرف ان ٹکڑوں کی بنیاد پر جواب تیار کرتا ہے (جنریشن)۔

RAG فریب کو روکنے کا سب سے طاقتور طریقہ ہے۔ ماڈل اس سوال کے لیے اپنے سر میں کوئی نمبر نہیں بناتا ہے "قرض کی شرح سود کیا ہے؟" یہ علم کی بنیاد سے موجودہ دلچسپی کے متن کو بازیافت کرتا ہے اور اس کی بنیاد پر جوابات دیتا ہے۔ اس یونٹ میں ہم دیکھیں گے کہ نالج بیس کیسے ترتیب دیا جاتا ہے، RAG کیسے کام کرتا ہے اور ایک اچھی نالج بیس جوابات کے معیار کا تعین کیسے کرتی ہے۔

RAG کیسے کام کرتا ہے: چار مراحل

لائبریرین کی طرح RAG کے بارے میں سوچیں۔ گاہک سوال پوچھتا ہے؛ سسٹم پہلے لائبریری کے دائیں شیلف سے متعلقہ صفحات تلاش کرتا ہے، پھر ان صفحات کو پڑھتا ہے اور جواب لکھتا ہے۔ تکنیکی اقدامات درج ذیل ہیں:

  1. چنکنگ: نالج بیس میں لمبی دستاویزات کو چھوٹے، بامعنی ٹکڑوں میں توڑا جاتا ہے (مثال کے طور پر، ہر عمومی سوالنامہ ایک حصہ ہوتا ہے)۔ کیونکہ ماڈل متعلقہ چھوٹے حصوں کے ساتھ ایک سوال کا زیادہ درست جواب دیتا ہے۔
  2. ایمبیڈنگ اور انڈیکسنگ: ہر ٹکڑے کا ایک عددی شکل میں ترجمہ کیا جاتا ہے جو اس کے معنی کی نمائندگی کرتا ہے (ایمبیڈنگ - متن کے معنی کی نمائندگی کرنے والے اعداد کا ایک سلسلہ) اور تلاش کے قابل ڈیٹا بیس میں رکھا جاتا ہے۔ اس طرح، یہ "لفظ کی مماثلت" نہیں بلکہ "معنی میچ" ہے۔ یہاں تک کہ اگر صارف پوچھتا ہے کہ "میری رقم کب جمع ہوگی؟"، "ریفنڈ کی مدت" کا حصہ مل سکتا ہے۔
  3. بازیافت: گاہک کے سوال کے معنی میں قریب ترین حصے بازیافت کیے جاتے ہیں (جیسے قریب ترین 3-5 حصے)۔
  4. جنریشن: ماڈل صرف تیار کردہ حصوں کی بنیاد پر جواب لکھتا ہے اور اگر ممکن ہو تو ماخذ کی نشاندہی کرتا ہے۔

اہم نکتہ مرحلہ 4 میں ہے: ماڈل کو ہدایت دی گئی ہے کہ "صرف دیے گئے ٹکڑوں پر بھروسہ کریں، یا کہہ دیں کہ آپ کو معلوم نہیں۔" اس ہدایت کے بغیر، RAG ماڈل کو فٹ ہونے سے نہیں روکتا ہے۔

اشارہ: RAG کا سنہری اصول: "اگر یہ ماخذ میں نہیں ہے تو کوئی جواب نہیں ہے۔" ایک اچھا RAG سسٹم کہے گا "میں اس بارے میں یقینی طور پر نہیں جانتا ہوں" ایسے سوال پر جو علم کی بنیاد میں نہیں ہے۔ قیاس آرائیوں سے خلا کو کبھی نہیں پُر کرتا ہے۔ بوٹ کی "مجھے نہیں معلوم" کہنے کی صلاحیت ایک حفاظتی خصوصیت ہے، کمزوری نہیں۔

ایک اچھی علمی بنیاد: جواب کے معیار کا اصل ذریعہ

اس بات سے کوئی فرق نہیں پڑتا ہے کہ RAG کتنا اچھا ہے، اگر علم کی بنیاد خراب ہے، تو جواب برا ہے. علم کی بنیاد کے معیار کی پیمائش کی جاتی ہے:

خصوصیت

غلط علم کی بنیاد

اچھی علمی بنیاد

کرنٹنس

مہینوں سے اپ ڈیٹ نہیں ہوا۔

تبدیل ہونے پر فوری طور پر اپ ڈیٹ کیا گیا۔

وضاحت

لمبا، پیچیدہ متن

مختصر، واحد موضوع کے مضامین

ساخت

گندا پی ڈی ایف ڈھیر

انحطاط پذیر مادوں کا لیبل لگا ہوا ہے۔

مستقل مزاجی

دو متضاد جوابات

سچائی کا واحد ذریعہ

دائرہ کار

بہت سارے خلاء ہیں۔

اکثر پوچھے گئے سوالات کا احاطہ کرتا ہے۔

ملکیت

کوئی بھی ذمہ دار نہیں۔

ہر موضوع کا ایک مالک ہوتا ہے۔

کال سینٹر کے سیاق و سباق میں سب سے خطرناک مسئلہ تضاد ہے: اگر نالج بیس میں واپسی کے دو مختلف ادوار لکھے گئے ہیں، تو RAG اس میں سے جو بھی لے گا کہے گا اور کسٹمر کو ایک متضاد جواب بھیجا جائے گا۔ اسی لیے "سچائی کا واحد ذریعہ" اصول اہم ہے: معلومات کو ایک جگہ پر تازہ ترین رکھا جاتا ہے۔ اس ماخذ کے حوالے استعمال کیے جاتے ہیں، کاپیاں نہیں۔

مرحلہ وار: ایک RAG کی حمایت یافتہ رسپانس سسٹم بنانا

  1. علم کی بنیاد کو صاف کریں: پرانے، متضاد، نقلی مضامین کو ہٹا دیں۔ ہر مضمون کو مختصر اور واحد موضوع بنائیں۔
  2. اسے توڑ دیں اور اسے ٹیگ کریں: ہر مضمون میں ٹاپک ٹیگ اور آخری اپ ڈیٹ کی تاریخ شامل کریں۔
  3. رسائی قائم کریں: ایک ایسا طریقہ کار جوڑیں جو پوچھے جانے پر متعلقہ حصوں کو کھینچ لے (انٹرپرائز RAG ٹولز یہ فراہم کرتے ہیں)۔
  4. ایک سخت اشارہ لکھیں: ماڈل کو بتائیں "صرف فراہم کردہ حصوں پر بھروسہ کریں، ذریعہ کا حوالہ دیں، یا کہیں کہ آپ نہیں جانتے۔"
  5. ماخذ کا حوالہ دیں: وہ مضمون دکھائیں جس پر جواب مبنی ہو۔ یہ دونوں اعتماد دیتا ہے اور تصدیق میں سہولت فراہم کرتا ہے۔
  6. خالی جگہوں پر نگاہ رکھیں: سوالات جمع کریں جہاں بوٹ کہے "مجھے نہیں معلوم"؛ یہ علم کی بنیاد میں کمی کو ظاہر کرتے ہیں، وہاں سے کھانا کھلاتے ہیں۔

چار کاپی کرنے کے قابل ٹیمپلیٹس

1) سخت RAG جواب کا اشارہ:

درج ذیل [ذریعہ] حصوں کی بنیاد پر جواب دیں۔ قواعد: (1) صرف ماخذ میں موجود معلومات کا استعمال کریں، (2) اگر یہ ماخذ میں نہیں ہے تو کہے کہ "میرے پاس اس بارے میں کوئی قطعی معلومات نہیں ہے، میں آپ کو نمائندے سے جوڑتا ہوں"، (3) بتائیں کہ یہ کس مضمون پر مبنی ہے [ماخذ: آئٹم نمبر]، (4) ماخذ سے بالکل رقم/مدت/حالت کا حوالہ دیں، گول/میک نہ کریں۔ [ذریعہ]: <<کھنچے ہوئے حصے>>سوال: "<<گاہک کا سوال>>"

2) نالج بیس مضمون تحریر:

درج ذیل بکھرے ہوئے پالیسی متن کو RAG کے لیے موزوں FAQ مضمون میں تبدیل کریں۔ فارمیٹ: سوال (گاہک کی زبان میں) / مختصر جواب (2-3 جملے) / شرائط (شق) / آخری اپ ڈیٹ کی تاریخ / موضوع کا ٹیگ۔ کسی بھی مبہم نکات کو بطور "وضاحت کرنے کے لیے" نشان زد کریں، یقین کریں۔ خام متن: <<text>>

3) تضادات اور خلاء کے لیے اسکیننگ:

درج ذیل علمی مضامین کا جائزہ لیں۔ (1) مضامین کے ان جوڑوں کو نشان زد کریں جو ایک دوسرے سے متصادم ہیں (جیسے مختلف واپسی کا دورانیہ)۔ (2) ان عنوانات کا اندازہ لگائیں جو اکثر پوچھے جائیں گے لیکن ان کے جوابات نہیں ہیں۔ صرف دیے گئے مضامین کو دیکھیں؛ نئی پالیسی تیار کرنا۔آرٹیکلز: <<list>>

4) "میں نہیں جانتا" لاگ سے بہتری:

ذیل میں ایسے سوالات ہیں جن کا بوٹ جواب نہیں دے سکا (ذریعہ نہیں مل سکا)۔ ان کو عنوانات میں گروپ کریں اور مضمون کا عنوان تجویز کریں جسے ہر گروپ کے علم کی بنیاد میں شامل کیا جانا چاہیے۔ جواب کا مواد نہ بنائیں، بس مجھے بتائیں کہ کون سا آئٹم غائب ہے۔ سوالات: <<list>>

کمزور فوری / مضبوط اشارہ

کمزور اشارہ:

گاہک کی واپسی کے سوال کا جواب دیں۔

کوئی ذریعہ نہیں؛ ماڈل میموری سے فٹ ہو سکتا ہے، رقم/دورانیہ غلط ہو سکتا ہے، اس کی تصدیق نہیں کی جا سکتی۔

طاقتور اشارہ:

صرف ذیل میں واپسی کی پالیسی کی شق کی بنیاد پر جواب دیں۔ اگر یہ ماخذ میں دستیاب نہیں ہے تو، "مجھے یقین سے نہیں معلوم" کہیں۔ مدت اور حالت کا لفظی حوالہ دیں، [ماخذ: RETURN-03] کی شکل میں حوالہ دیں۔ سورس: RETURN-03]: "غیر استعمال شدہ پروڈکٹ کو 14 دنوں کے اندر واپس کیا جا سکتا ہے۔ ذاتی مصنوعات واپسی کے دائرہ کار میں نہیں ہیں۔" سوال: "کیا میں 20 دن پہلے خریدی گئی ذاتی مصنوعات کو واپس کر سکتا ہوں؟"

فرق: ماخذ پر منحصر، حوالہ لازمی، من گھڑت پابندی واضح؛ ماڈل ماخذ سے درست جواب ("14 دن گزرے اور ذاتی نوعیت کا، ناقابل واپسی") تیار کرتا ہے۔

تین چھوٹے مقدمات

کیس 1 - فریب کا خاتمہ۔ ایک ٹیلی کام بوٹ کی مہم کے سوالات کے جوابات کی درستگی بغیر RAG سیٹ اپ میں 71% تھی۔ ماڈل بعض اوقات پرانی مہمات بناتا ہے۔ جب موجودہ مہم کے صفحات کو RAG سے منسلک کیا گیا اور "اگر یہ ماخذ میں نہیں ہے تو اسے مت کہو" کا اصول شامل کیا گیا، درستگی 96% تک بڑھ گئی اور "غلط مہم کے الفاظ" کے بارے میں شکایات تقریباً ختم ہو گئیں۔

کیس 2 - تضاد کی قیمت۔ ایک ای کامرس کمپنی کے نالج بیس میں، دو صفحات پر دو مختلف شپنگ کے اخراجات لکھے گئے تھے (ایک موجودہ، ایک پرانا بھولا ہوا صفحہ)۔ بوٹ تصادفی طور پر کسی کو کھینچ رہا تھا اور کچھ صارفین کو غلط قیمت بتا رہا تھا۔ جب پرانے صفحہ کو واحد صحیح ماخذ کے اصول کے ساتھ آرکائیو کیا گیا تو عدم مطابقت ختم ہو گئی۔ سبق: RAG تضاد کو حل نہیں کرتا، یہ تضاد کو ویسا ہی پھیلاتا ہے۔

کیس 3 - "میں نہیں جانتا" لاگ کی قدر۔ ایک بینک میں، بوٹ کہہ رہا تھا کہ "میں یقینی طور پر نہیں جانتا" سے ~ 4,000 سوالات ماہانہ۔ جب ان سوالات کو گروپ کیا گیا تو یہ دیکھا گیا کہ 40% "بین الاقوامی کارڈ کے استعمال" کے بارے میں تھے۔ اس پر کوئی مضمون نہیں تھا۔ جب متعلقہ آئٹمز کو شامل کیا گیا تو یہ سوالات حل ہو گئے اور اس موضوع پر لوگوں کا ٹرن اوور 55 فیصد کم ہو گیا۔ حقیقت یہ ہے کہ بوٹ نے کہا کہ وہ نہیں جانتا تھا بہتری کے لئے روڈ میپ بن گیا.

عام غلطیاں

  • ماخذ سے منسلک کیے بغیر جواب دینا۔ RAG کے بغیر، ماڈل ٹھوس معلومات پر فٹ بیٹھتا ہے۔ کسی بھی ٹھوس جواب کا انحصار ماخذ پر ہونا چاہیے۔
  • "مجھے نہیں معلوم" آپشن کو آف کرنا۔ ماڈل کو ہر سوال کا جواب دینے کے لیے مجبور کرنا مناسب ہونے کو یقینی بناتا ہے۔
  • متضاد/پرانی معلومات کو صاف نہیں کرنا۔ RAG تضاد پھیلاتا ہے۔ ایک واحد صحیح ذریعہ ضروری ہے۔
  • ٹکڑے ٹکڑے کرنے کو نظر انداز کرنا۔ بڑے پی ڈی ایف ایکسپورٹ کرنے سے درست رسائی میں خلل پڑتا ہے۔ مختصر، واحد موضوع والے مضامین استعمال کریں۔
  • ماخذ کو چھپا رہا ہے۔ اس بات کی نشاندہی نہ کرنا کہ جواب کس بنیاد پر ہے توثیق اور اعتماد کو کمزور کرتا ہے۔
احتیاط: RAG درستگی کو بہتر بناتا ہے لیکن 100% گارنٹی فراہم نہیں کرتا ہے۔ ماڈل بعض اوقات پکڑے گئے حصے کی غلط تشریح کر سکتا ہے۔ لہٰذا، مالی، قانونی اور سلامتی کے مسائل کے لیے انسانی منظوری کی ضرورت ہوتی ہے چاہے ذریعہ کا حوالہ دیا جائے۔ RAG فریب کو کم کرتا ہے لیکن ذمہ داری کو دور نہیں کرتا ہے۔

خلاصہ میں

نالج بیس اور RAG کال سینٹر AI کی درستگی کی بنیاد ہیں۔ RAG بڑی حد تک فریب کو روکتا ہے ماڈل کو میموری سے جواب کو فٹ کرنے سے روکتا ہے اور مکمل طور پر موجودہ ماخذ پر انحصار کرتا ہے۔ لیکن RAG صرف اتنا ہی اچھا ہے جتنا کہ اس کے علم کی بنیاد: ایک ایسی نالج بیس جو تازہ ترین، واضح، ساختہ، تنازعات سے پاک اور سچائی کا واحد ذریعہ ہو۔ ماڈل کو بتائیں کہ "اگر یہ ماخذ میں نہیں ہے تو مجھے بتائیں کہ آپ نہیں جانتے"، ماخذ کی طرف اشارہ کریں، اور اپنے علم کی بنیاد کو بہتر بنانے کے لیے ان سوالات کا استعمال کریں جن کا بوٹ جواب نہیں دے سکتا۔ اعلی داؤ پر چلنے والے معاملات کے ذریعہ ہونے کے باوجود انسانی رضامندی کو برقرار رکھیں۔

درخواست کا کام

اپنی صنعت سے 8 حقیقی/حقیقت پسند کسٹمر سوالات اور 8 متعلقہ مختصر علمی مضامین لکھیں (ہر مضمون: سوال، مختصر جواب، حالات، تاریخ، ٹیگ)۔ پھر جانچیں کہ آیا ماڈل "1) Tight RAG جواب پرامپٹ" پیٹرن کا استعمال کرکے "مجھے نہیں جانتا" کہہ سکتا ہے اور ایک سوال بھی پوچھ سکتا ہے، جس میں سے ایک علم کی بنیاد میں نہیں ہے۔ آخر میں، اپنے مضامین کو "3) تضاد اور گیپ سکیننگ کے ساتھ چیک کریں۔

چیک لسٹ

  • بوٹ/اسسٹنٹ کی طرف سے دیا گیا ہر ٹھوس جواب موجودہ نالج بیس (RAG کے ذریعے) پر منحصر ہے۔
  • میں نے ماڈل کو ہدایت کی کہ "اگر یہ ماخذ میں نہیں ہے تو مجھے بتائیں کہ آپ نہیں جانتے" اور اس کا تجربہ کیا۔
  • میرے علم کی بنیاد تازہ ترین، واضح، واحد موضوع کے مضامین پر مشتمل ہے۔
  • میں نے متضاد اور پرانے مضامین کو صاف کر دیا ہے۔ تمام معلومات کے لیے صرف ایک صحیح ذریعہ ہے۔
  • [ ] جوابات بتاتے ہیں کہ یہ کس مضمون پر مبنی ہے (ماخذ)۔
  • میں "میں نہیں جانتا" سوالات جمع کرتا ہوں اور علم کی بنیاد فراہم کرتا ہوں۔