فائدہ:
- میٹرکس کی وضاحت کرنا جو برقرار رکھنے اور نسل کے معیار کو الگ سے ماپتے ہیں۔
- گولڈ سوال سیٹ اپ کریں اور LLM-بطور جج کے ساتھ خودکار تشخیص چلائیں۔
- پیداوار میں فیڈ بیک، مانیٹرنگ اور ریگریشن ٹیسٹنگ کے ذریعے معیار کو برقرار رکھنا
جملہ "میں نے اسسٹنٹ کو انسٹال کیا ہے، ایسا لگتا ہے کہ یہ ٹھیک کام کر رہا ہے" انجینئرنگ کا بیان نہیں ہے۔ RAG سسٹم خاموشی سے ٹوٹ جاتے ہیں: ایک نئی دستاویز کی قسم بازیافت کو بیوقوف بناتی ہے، فوری تبدیلی درستگی کو کم کر دیتی ہے، انڈیکس باسی ہو جاتا ہے۔ اس کا احساس کرنے کا واحد طریقہ پیمائش کرنا ہے۔ اس یونٹ میں، ہم اس بات کا احاطہ کرتے ہیں کہ کس طرح RAG کے معیار کی پیمائش کی جائے (حاصل اور جنریشن الگ سے)، خودکار تشخیص (ایل ایل ایم-بطور جج) اور پیداوار میں معیار کو برقرار رکھا جائے (مانیٹرنگ، ریگریشن)۔ "آپ جس چیز کی پیمائش نہیں کرتے اسے آپ بہتر نہیں کر سکتے" اس یونٹ کا نصب العین ہے۔
دو الگ الگ چیزوں کی پیمائش کریں۔
RAG کی دو ٹانگیں ہیں اور اسے الگ سے ناپا جانا چاہیے کیونکہ مسئلہ ان میں سے کسی ایک میں بھی ہو سکتا ہے:
- بازیافت کا معیار: کیا صحیح حصہ پہنچا؟
- نسل کا معیار: کیا صحیح جواب آنے والے ٹکڑے سے تیار کیا گیا تھا؟
اگر جواب برا ہے تو آپ کو پہلے یہ جاننا ہوگا کہ کون سی ٹانگ خراب ہے۔ اگر صحیح حصہ کبھی نہیں پہنچتا ہے، تو بہترین پرامپٹ بھی محفوظ نہیں کر سکتا (بازیافت کا مسئلہ)۔ اگر صحیح حصہ پہنچ گیا ہے لیکن ماڈل نے اسے غلط پڑھا ہے تو بازیافت کو بہتر بنانا فضول ہے (نسل کا مسئلہ)۔
بازیافت میٹرکس
بازیافت ایک چھانٹنا/رسائی کا مسئلہ ہے۔ کلاسیکی معلومات کی بازیافت کے میٹرکس سے ماپا جاتا ہے۔ اس کے لیے آپ کے پاس گولڈن کلسٹر ہونا ضروری ہے: ہر سوال کے لیے کون سا حصہ "درست" ہے اس کا علم۔
میٹرک
کیا اقدامات
سادہ تعریف
Recall@k
کیا اوپر کے میں صحیح ٹکڑا ہے؟
صحیح حصہ کی گرفتاری کی شرح
precision@k
واپس کیے گئے k ٹکڑوں میں سے کتنے متعلقہ ہیں؟
جو لایا ہے اس کی صفائی
MRR (مطلب باہمی درجہ)
صحیح ٹکڑا کس ترتیب میں ہے؟
انعامات اعلیٰ صفوں میں ہیں۔
ہٹ ریٹ
کیا کم از کم ایک صحیح ٹکڑا پہنچا؟
کامیابی کا سب سے بنیادی پیمانہ
عملی تبصرہ: اگر Recall@k کم ہے تو چنکنگ یا تلاش کی حکمت عملی (ہائبرڈ، کے، ری رینکنگ) پر دوبارہ کام کیا جانا چاہیے۔ اگر درستگی کم ہے لیکن یاد کرنا زیادہ ہے تو دوبارہ درجہ بندی شامل کرنا ایک اچھا اقدام ہے۔
جنریشن میٹرکس
جب صحیح حصہ آتا ہے، ہم ماڈل کے ذریعہ تیار کردہ ردعمل کے معیار کی پیمائش کرتے ہیں۔ تین بنیادی جہتیں:
- وفاداری: کیا جواب میں ہر دعوے کی تائید سیاق و سباق سے ہوتی ہے؟ کیا کوئی فٹنگ ہے؟ یہ فریب کاری کا براہ راست پیمانہ ہے۔
- جواب کی مطابقت: کیا جواب درحقیقت سوال کا جواب دیتا ہے یا یہ موضوع سے ہٹ کر ہے؟
- مکملیت: کیا سیاق و سباق میں تمام متعلقہ معلومات استعمال کی گئی ہیں یا یہ غائب ہے؟
یہ اکثر درجہ بندی کی بنیاد پر اسکور کیے جاتے ہیں (مثلاً 1-5) بائنری جیسے "سچ/غلط" کے بجائے۔
مشورہ: وفاداری کو ایک علیحدہ میٹرک کے طور پر ٹریک کریں۔ اگر درستگی میں کمی کے ساتھ وفاداری کم ہو جاتی ہے، تو مسئلہ نسل کا ہے۔ اگر وفاداری زیادہ ہے لیکن جواب غلط ہے تو مسئلہ غلط ٹکڑا (بازیافت) ہے۔ ایک ساتھ، یہ دونوں میٹرکس ایک کمپاس ہیں جو غلطی کی جگہ کو ظاہر کرتی ہے۔
ایک گولڈن سوال سیٹ قائم کرنا
ہر پیمائش کے لیے سنہری سیٹ / تشخیصی ڈیٹاسیٹ کی ضرورت ہوتی ہے: حقیقت پسندانہ سوالات + متوقع درست جوابات + درست ماخذ کے ٹکڑے۔ 30-50 اچھی طرح سے منتخب کردہ سوالات کے ساتھ شروع کرنا 500 بے ترتیب سوالات سے بہتر ہے۔ سیٹ میں درج ذیل کو شامل کریں: اکثر پوچھے جانے والے حقیقی سوالات، معلوم مشکل سوالات، بغیر جوابات کے ٹریپ سوالات (کسی کو یہ کہنا چاہیے کہ "میں نہیں جانتا")، متضاد ذرائع والے سوالات۔
# گولڈن کلسٹر کی مثال (تصوراتی)[ {"سوال": "سالانہ چھٹی کے کتنے دن؟"، "متوقع_جواب": "1-5 سال کی سنیارٹی کے لیے 14 دن"، "صحیح_حصہ_آئی ڈی": "دو حصہ-3"، "زمرہ": "چھوٹی"}، {"سوال": "کمپنی کا دفتر کہاں ہے؟"، "مارکیٹ_کا جواب"، "مارکیٹ_کا جواب کہاں ہے؟" # ٹریپ: میں نہیں جانتا "صحیح_پارٹ_آئی ڈی": null، "زمرہ": "ٹریپ"}]
ایل ایل ایم بطور جج: خودکار تشخیص
ہاتھ سے سینکڑوں جوابات اسکور کرنا تھکا دینے والا ہے۔ LLM-بطور جج ماڈل وہ ہوتا ہے جب ایک ماڈل اسکور کرتا ہے اور کسی دوسرے ماڈل کے جواب کو مخصوص معیارات کی بنیاد پر درست ثابت کرتا ہے۔ ایک اچھا جج فوری طور پر معیار کی وضاحت کرتا ہے، مثالیں دیتا ہے اور جواز طلب کرتا ہے۔
# LLM-بطور جج پرامپٹ (تصوراتی) آپ ایک غیر جانبدارانہ جائزہ لینے والے ہیں۔ دیے گئے CONTEXT اور متوقع جواب کے مطابق نیچے دیئے گئے ANSWER کا اندازہ لگائیں۔ سکور (1-5) اور جواز پیش کریں:- وفاداری: کیا جواب میں ہر دعویٰ سیاق و سباق میں تائید کرتا ہے؟- درستگی: کیا جواب متوقع جواب سے میل کھاتا ہے؟- مکمل: کیا متعلقہ معلومات مکمل ہے؟ خاص طور پر: اگر جواب سیاق و سباق میں معلومات پر مشتمل نہیں ہے تو، وفاداری1 دیں اور اس بات کی نشاندہی کریں کہ کون سا دعویٰ من گھڑت ہے۔
احتیاط: ایل ایل ایم بطور جج کامل نہیں ہے۔ ان کے اپنے تعصبات ہوسکتے ہیں (لمبا جواب، اپنے انداز کو ترجیح دیتے ہوئے)۔ جج کی بھی تصدیق کریں: جج اور انسان دونوں کے ذریعہ کچھ جوابات حاصل کریں اور ان کے درمیان معاہدے کی پیمائش کریں۔ اگر جج انسانی اسکور سے مطابقت رکھتا ہے، تو آپ اس پر بھروسہ کر سکتے ہیں۔
کمزور/مضبوط درجہ بندی
کمزور ("یہ میرے لیے اچھا تھا"):
میں نے چند سوال پوچھے اور جوابات اچھے لگے۔ میں نے اسے براہ راست حاصل کر لیا ہے۔ # مسئلہ: کوئی پیمائش نہیں، رجعت ناقابل تصور، بہتری اندھی۔
طاقتور (گولڈ کلسٹر + مجرد میٹرکس + خودکار فیصلہ + رجعت):
40 سوالات کا گولڈن کلسٹر۔ ہر تبدیلی کے ساتھ، recall@5، وفاداری اور درستگی خود بخود ناپی جاتی ہے۔ اگر سکور گر جاتا ہے، تو تبدیلی واپس کر دی جاتی ہے۔ پیداوار میں، صارف کی رائے جمع کی جاتی ہے اور سیٹ میں شامل کی جاتی ہے۔
پیداوار میں نگرانی اور رجعت
تشخیص ایک بار اور ختم نہیں کیا جاتا ہے. تین مستقل مشقیں:
- ریگریشن ٹیسٹنگ: ہر پرامپٹ/ریٹریول/ماڈل کی تبدیلی پر خودکار گولڈن کلسٹر چلائیں۔ اگر سکور کم ہو جائے تو تبدیلی الٹ جاتی ہے۔ یہ "اسے بہتر بنانے کی کوشش کرتے ہوئے اسے توڑنے" سے روکتا ہے۔
- پیداوار کی نگرانی: حقیقی سوالات میں "مجھے معلومات نہیں مل سکیں" کی شرح، اوسط تاخیر، لاگت، صارف کی رائے (👍/👎) کی نگرانی کی جاتی ہے۔ "میں نہیں جانتا" میں اچانک اضافہ اکثر انڈیکس یا بازیافت کی خرابی کی پہلی علامت ہوتا ہے۔
- فیڈ بیک لوپ: صارف کے ذریعہ فراہم کردہ حقیقی سوالات کا جائزہ لیا جاتا ہے اور سنہری ڈھیر میں شامل کیا جاتا ہے۔ اس طرح وقت کے ساتھ سیٹ مزید امیر ہوتا جاتا ہے اور نظام کے اندھے دھبے بند ہو جاتے ہیں۔
تین چھوٹے کیسز
کیس 1 - خاموش رجعت۔ ایک ٹیم نے اسے "بہتر بنانے" کے لیے پرامپٹ میں ترمیم کی۔ عمومی درستگی میں اضافہ ہوا، لیکن ٹریپ سوالات میں وفاداری میں 30% کمی واقع ہوئی (ماڈل زیادہ فٹ ہونے لگا)۔ سنہری جھرمٹ میں ٹریپ سوالات نہ ہوتے تو اس پر توجہ نہ دی جاتی۔ ریگریشن ٹیسٹنگ نے تبدیلی کو پلٹا دیا۔
کیس 2 - غلط ٹانگ کو سیدھا کرنا۔ ایک اسسٹنٹ میں جوابات خراب تھے۔ ٹیم نے ہفتوں تک فوری طور پر کام کیا۔ جب ہم نے بازیافت کی پیمائش کی تو recall@5 صرف 48% تھا — مسئلہ بازیافت میں تھا، نسل میں نہیں۔ جب ہائبرڈ + ری رینکنگ کو شامل کیا گیا تو واپسی 89% تک بڑھ گئی اور درستگی بھی بڑھ گئی۔
کیس 3 - پروڈکشن الرٹ۔ ایک دن، سپورٹ اسسٹنٹ کے لیے "میں معلومات نہیں مل سکا" کی شرح 6% سے بڑھ کر 34% ہو گئی۔ ٹریک پیڈ نے خبردار کیا؛ وجہ یہ تھی کہ رات کو چلنے والی اشاریہ سازی کا کام خاموشی سے ناکام ہو گیا اور نئے مضامین اپ لوڈ نہیں ہوئے۔ نگرانی کے بغیر، غلط "میں نہیں جانتا" کے بیانات دنوں تک جاری رہتے۔
عام غلطیاں
- "اس نے میرے لیے اچھا کام کیا" سے مطمئن ہونا: پیمائش کے بغیر، رجعت کا دھیان نہیں جاتا۔
- بازیافت اور نسل کو الگ نہیں کرنا: آپ غلط ٹانگ کو درست کریں گے اور وقت ضائع کریں گے۔
- ٹریپ سوالات نہیں پوچھنا: چیزوں کو بنانے کا رجحان سنہری جھرمٹ میں ظاہر نہیں ہوتا ہے۔
- جج کی تصدیق نہ کرنا: ایک متعصب جیوری غلط اعتماد دیتی ہے۔
- پیداوار کی نگرانی نہیں کرنا: انڈیکس کی ناکامی، لاگت کا دھماکہ خاموشی سے جاری ہے۔
خلاصہ میں
- RAG میں، بازیافت اور نسل کے معیار کو الگ سے ماپا جاتا ہے۔ پہلے یہ طے کرنا چاہیے کہ کون سی ٹانگ کو نقصان پہنچا ہے۔
- recall@k، precision@k، MRR برائے بازیافت؛ وفاداری، مناسبیت، مکملیت نسل کے لیے استعمال ہوتی ہے۔
- ہر پیمائش کے لیے سونے کے جھرمٹ کی ضرورت ہوتی ہے۔ اس میں حقیقی، مشکل، ٹریپ اور متضاد سوالات ڈالیں۔
- LLM-بطور جج بڑے سیٹ آٹو اسکورز؛ لیکن جج کو خود انسان کے خلاف انصاف کرنا چاہیے۔
- ریگریشن ٹیسٹنگ، پروڈکشن مانیٹرنگ، اور فیڈ بیک لوپ وقت کے ساتھ معیار کو برقرار رکھتا ہے۔
درخواست کا کام
(1) اپنے اسسٹنٹ کے لیے کم از کم 15 سوالات کا سنہری سیٹ بنائیں: کم از کم 3 ٹریپس (جواب نہیں)، 3 مشکل، 2 متضاد سورس سوالات شامل کریں۔ ہر سوال کا متوقع جواب اور صحیح حصہ لکھیں۔ (2) اس سیٹ کے ساتھ دستی طور پر دو مختلف پرامپٹ ورژن کا موازنہ کریں۔ وفاداری اور درستگی کے لیے ہر جواب کو 1-5 پوائنٹس دیں۔ (3) اوپر دیے گئے LLM-بطور جج پرامپٹ کو اپنے معیار کے مطابق ڈھال لیں۔ (4) 3 میٹرکس کی شناخت کریں جنہیں آپ پیداوار میں ٹریک کریں گے اور ہر ایک کے لیے پوچھیں "میں کس حد پر الارم کروں؟" قدر لکھیں.
چیک لسٹ
- [ ] میں علیحدہ میٹرکس کے ساتھ برقراری اور نسل کے معیار کی پیمائش کر سکتا ہوں۔
- [ ] میں جانتا ہوں کہ recall@k، وفاداری کا کیا مطلب ہے۔
- میں ایک سنہری جھرمٹ بنا سکتا ہوں جس میں حقیقی، مشکل، ٹریپ اور متضاد سوالات شامل ہوں۔
- میں خودکار تشخیص ترتیب دے سکتا ہوں اور جج کی تصدیق LLM-بطور جج کر سکتا ہوں۔
- میں ریگریشن ٹیسٹنگ، پروڈکشن مانیٹرنگ اور فیڈ بیک لوپ چلا سکتا ہوں۔