ஆதாயங்கள்:
- தனித்தனியாக தக்கவைப்பு மற்றும் தலைமுறை தரத்தை அளவிடும் அளவீடுகளை வரையறுத்தல்
- தங்க கேள்வி தொகுப்பை அமைத்து, LLM-ஆக-நீதிபதியுடன் தானியங்கி மதிப்பீட்டை இயக்கவும்
- உற்பத்தியில் பின்னூட்டம், கண்காணிப்பு மற்றும் பின்னடைவு சோதனை மூலம் தரத்தை பராமரித்தல்
"நான் உதவியாளரை நிறுவினேன், அது நன்றாக வேலை செய்வதாகத் தெரிகிறது" என்ற வாக்கியம் ஒரு பொறியியல் அறிக்கை அல்ல. RAG அமைப்புகள் அமைதியாக உடைந்து விடுகின்றன: ஒரு புதிய ஆவண வகை மீட்டெடுப்பை முட்டாளாக்குகிறது, உடனடி மாற்றம் துல்லியத்தை குறைக்கிறது, குறியீடு பழையதாகிறது. இதை உணர ஒரே வழி அளப்பதுதான். இந்த யூனிட்டில், RAG தரத்தை எவ்வாறு அளவிடுவது (மீட்பு மற்றும் தனித்தனியாக உருவாக்கம்), தானியங்கி மதிப்பீடு (LLM-ஆய்-நீதிபதி) மற்றும் உற்பத்தியில் தரத்தை பராமரிப்பது (கண்காணிப்பு, பின்னடைவு) ஆகியவற்றை நாங்கள் உள்ளடக்குகிறோம். "நீங்கள் அளவிடாததை உங்களால் மேம்படுத்த முடியாது" என்பது இந்த அலகின் குறிக்கோள்.
இரண்டு தனித்தனி விஷயங்களை அளவிடவும்
RAG க்கு இரண்டு கால்கள் உள்ளன மற்றும் அவை ஒவ்வொன்றிலும் சிக்கல் இருக்கலாம் என்பதால் தனித்தனியாக அளவிடப்பட வேண்டும்:
- மீட்டெடுப்பு தரம்: சரியான பகுதி வந்ததா?
- தலைமுறை தரம்: சரியான பதில் உள்வரும் துண்டிலிருந்து தயாரிக்கப்பட்டதா?
பதில் மோசமாக இருந்தால், எந்த கால் கெட்டது என்பதை முதலில் தெரிந்து கொள்ள வேண்டும். சரியான பகுதி வரவில்லை என்றால், சிறந்த ப்ராம்ட் கூட சேமிக்க முடியாது (மீட்டெடுப்பதில் சிக்கல்). சரியான பகுதி வந்துவிட்டது ஆனால் மாதிரி தவறாகப் படித்தால், மீட்டெடுப்பை மேம்படுத்துவது பயனற்றது (தலைமுறை சிக்கல்).
மீட்டெடுப்பு அளவீடுகள்
மீட்டெடுப்பது ஒரு வரிசைப்படுத்தல்/அணுகல் பிரச்சனை; கிளாசிக்கல் தகவல் மீட்டெடுப்பு அளவீடுகளால் அளவிடப்படுகிறது. இதற்கு உங்களிடம் தங்கக் கொத்து இருக்க வேண்டும்: ஒவ்வொரு கேள்விக்கும் எந்தத் துண்டு "சரியானது" என்பது பற்றிய அறிவு.
மெட்ரிக்
என்ன நடவடிக்கைகள்
எளிய வரையறை
Recall@k
மேல் k இல் சரியான துண்டு உள்ளதா?
சரியான பகுதி பிடிப்பு விகிதம்
துல்லியம்@k
திரும்பிய கே துண்டுகளில் எத்தனை பொருத்தமானவை?
கொண்டு வரப்பட்டதை சுத்தம் செய்தல்
MRR (சராசரி பரஸ்பர தரவரிசை)
எந்த வரிசையில் சரியான துண்டு உள்ளது?
சிறந்த தரவரிசையில் இருப்பது வெகுமதிகள்
வெற்றி விகிதம்
குறைந்தது ஒரு சரியான துண்டு வந்ததா?
வெற்றியின் மிக அடிப்படையான அளவுகோல்
நடைமுறை கருத்து: Recall@k குறைவாக இருந்தால், துண்டித்தல் அல்லது தேடல் உத்தி (ஹைப்ரிட், கே, மறு தரவரிசை) மறுவேலை செய்யப்பட வேண்டும். துல்லியம் குறைவாக இருந்தாலும், திரும்பப் பெறுதல் அதிகமாக இருந்தால், மறு தரவரிசையைச் சேர்ப்பது ஒரு நல்ல நடவடிக்கையாகும்.
தலைமுறை அளவீடுகள்
சரியான பகுதி வரும்போது, மாதிரியால் உருவாக்கப்பட்ட பதிலின் தரத்தை நாங்கள் அளவிடுகிறோம். மூன்று அடிப்படை பரிமாணங்கள்:
- விசுவாசம்: பதிலில் உள்ள ஒவ்வொரு கோரிக்கையும் சூழலால் ஆதரிக்கப்படுகிறதா? ஏதேனும் பொருத்தம் உள்ளதா? இது மாயத்தோற்றத்தின் நேரடி அளவீடு ஆகும்.
- பதில் பொருத்தம்: பதில் உண்மையில் கேள்விக்கு பதிலளிக்கிறதா அல்லது அது தலைப்பிற்கு அப்பாற்பட்டதா?
- முழுமை: சூழலில் தொடர்புடைய அனைத்து தகவல்களும் பயன்படுத்தப்பட்டதா அல்லது விடுபட்டதா?
இவை பெரும்பாலும் "உண்மை/தவறு" போன்ற பைனரிக்கு பதிலாக தரப்படுத்தப்பட்ட அடிப்படையில் (எ.கா. 1-5) மதிப்பெண் பெறுகின்றன.
உதவிக்குறிப்பு: ஃபைத்ஃபுல்னஸை தனி மெட்ரிக்காக கண்காணிக்கவும். துல்லியம் குறைவதால் விசுவாசம் குறைந்தால், பிரச்சனை தலைமுறை; விசுவாசம் அதிகமாக இருந்தாலும் பதில் தவறாக இருந்தால், பிரச்சனை தவறான துண்டு (மீட்பு). ஒன்றாக, இந்த இரண்டு அளவீடுகளும் பிழையின் இருப்பிடத்தைக் காட்டும் திசைகாட்டி ஆகும்.
கோல்டன் கேள்வித் தொகுப்பை நிறுவுதல்
ஒவ்வொரு அளவீட்டுக்கும் ஒரு கோல்டன் செட் / மதிப்பீட்டு தரவுத்தொகுப்பு தேவை: யதார்த்தமான கேள்விகள் + எதிர்பார்க்கப்படும் சரியான பதில்கள் + சரியான மூல துண்டுகள். 500 சீரற்ற கேள்விகளை விட 30-50 நன்கு தேர்ந்தெடுக்கப்பட்ட கேள்விகளில் தொடங்குவது சிறந்தது. தொகுப்பில் பின்வருவனவற்றைச் சேர்க்கவும்: அடிக்கடி கேட்கப்படும் உண்மையான கேள்விகள், தெரிந்த கடினமான கேள்விகள், பதில்கள் இல்லாத கேள்விகள் ("எனக்குத் தெரியாது" என்று ஒருவர் கூற வேண்டும்), முரண்பாடான ஆதாரங்களைக் கொண்ட கேள்விகள்.
# கோல்டன் கிளஸ்டர் உதாரணம் (கருத்து சார்ந்தது)[ {"கேள்வி": "வருடாந்திர விடுப்பு எத்தனை நாட்கள்?", "எதிர்பார்க்கப்படும்_பதில்": "1-5 வருட சீனியாரிட்டிக்கு 14 நாட்கள்", "சரியான_பாகம்_ஐடி": "இரண்டு-பகுதி-3", "வகை": "விடுப்பு"}, {"கேள்வி": "எங்கே_அலுவலகம்?" "NO_INFORMATION", # trap: எனக்கு "சரியான_பகுதி_ஐடி" தெரியாது: null, "category": "trap"}]
நீதிபதியாக LLM: தானியங்கி மதிப்பீடு
நூற்றுக்கணக்கான பதில்களைக் கையால் அடிப்பது சோர்வாக இருக்கிறது. LLM-as-judge மாதிரி என்பது ஒரு மாதிரியானது குறிப்பிட்ட அளவுகோல்களின் அடிப்படையில் மற்றொரு மாதிரியின் பதிலைப் பெறுவது மற்றும் நியாயப்படுத்துவது. ஒரு நல்ல நீதிபதி ப்ராம்ப்ட் அளவுகோல்களை தெளிவாக வரையறுத்து, உதாரணங்களை அளித்து நியாயத்தைக் கேட்கிறார்.
# LLM-ஆக-நீதிபதியாக (கருத்துசார்ந்த) நீங்கள் ஒரு பாரபட்சமற்ற மதிப்பீட்டாளர். கொடுக்கப்பட்டுள்ள சூழல் மற்றும் எதிர்பார்க்கப்பட்ட பதிலின் படி கீழே உள்ள பதிலை மதிப்பிடவும். மதிப்பெண் (1-5) மற்றும் நியாயப்படுத்தவும்:- உண்மைத்தன்மை: பதிலில் உள்ள ஒவ்வொரு கூற்றும் சூழலில் ஆதரிக்கப்படுகிறதா?- துல்லியம்: பதில் எதிர்பார்த்த பதிலுடன் பொருந்துகிறதா?- முழுமை: தொடர்புடைய தகவல் முழுமையானதா? குறிப்பாக: பதில் சூழலில் இல்லாத தகவல்களைக் கொண்டிருந்தால், உண்மைத்தன்மை1 மற்றும் எந்த உரிமைகோரல் புனையப்பட்டது என்பதைக் குறிப்பிடவும். சூழல்: {context}எதிர்பார்க்கப்பட்டது: {expected}பதில்: {பதில்}வெளியீடு: {விசுவாசம், துல்லியம், முழுமை, நியாயப்படுத்தல்}
எச்சரிக்கை: LLM-ஆக-நீதிபதி சரியானவர் அல்ல; அவர்கள் தங்கள் சொந்த சார்புகளைக் கொண்டிருக்கலாம் (நீண்ட பதில், அவர்களின் சொந்த பாணியை விரும்புகிறார்கள்). நீதிபதியையும் சரிபார்க்கவும்: நீதிபதி மற்றும் மனிதர் ஆகிய இருவராலும் சில பதில்களைப் பெற்று அவர்களுக்கு இடையேயான ஒப்பந்தத்தை அளவிடவும். நீதிபதி மனித மதிப்பெண்களுடன் இணக்கமாக இருந்தால், நீங்கள் அவரை நம்பலாம்.
பலவீனமான/வலுவான மதிப்பீடு
பலவீனமான ("இது எனக்கு நன்றாக இருந்தது"):
நான் சில கேள்விகளைக் கேட்டேன், பதில்கள் நன்றாக இருந்தன. நான் அதை நேரலையில் பெற்றுள்ளேன்.# சிக்கல்: அளவீடுகள் இல்லை, பின்னடைவு கண்ணுக்கு தெரியாதது, முன்னேற்றம் குருட்டு.
சக்திவாய்ந்த (தங்கக் கொத்து + தனித்த அளவீடுகள் + தானியங்கி தீர்ப்பு + பின்னடைவு):
40 கேள்விகள் கொண்ட கோல்டன் கிளஸ்டர். ஒவ்வொரு மாற்றத்திலும், நினைவு@5, நம்பகத்தன்மை மற்றும் துல்லியம் தானாகவே அளவிடப்படுகிறது. மதிப்பெண் குறைந்தால், மாற்றம் திரும்பப் பெறப்படும். தயாரிப்பில், பயனர் கருத்து சேகரிக்கப்பட்டு தொகுப்பில் சேர்க்கப்படுகிறது.
உற்பத்தியில் கண்காணிப்பு மற்றும் பின்னடைவு
மதிப்பீடு ஒருமுறை செய்து முடிக்கப்படுவதில்லை. மூன்று நிலையான நடைமுறைகள்:
- பின்னடைவு சோதனை: ஒவ்வொரு ப்ராம்ட்/மீட்பு/மாடல் மாற்றத்திலும் தானாக இயங்கும் கோல்டன் கிளஸ்டர். மதிப்பெண் குறைக்கப்பட்டால், மாற்றம் தலைகீழாக மாறும். இது "அதைச் சிறப்பாகச் செய்ய முயற்சிக்கும்போது அதை உடைப்பதை" தடுக்கிறது.
- உற்பத்தி கண்காணிப்பு: உண்மையான கேள்விகளில் "என்னால் தகவலைக் கண்டுபிடிக்க முடியவில்லை" விகிதம், சராசரி தாமதம், செலவு, பயனர் கருத்து (👍/👎) கண்காணிக்கப்படும். "எனக்குத் தெரியாது" என்ற திடீர் அதிகரிப்பு பெரும்பாலும் குறியீட்டு அல்லது மீட்டெடுப்பு செயலிழப்பின் முதல் அறிகுறியாகும்.
- கருத்து வளையம்: பயனர் 👎 வழங்கிய உண்மையான கேள்விகள் மதிப்பாய்வு செய்யப்பட்டு தங்கக் குவியலில் சேர்க்கப்படும்; இதனால், தொகுப்பு காலப்போக்கில் பணக்காரர் ஆகிறது மற்றும் அமைப்பின் குருட்டு புள்ளிகள் மூடப்படும்.
மூன்று சிறிய வழக்குகள்
வழக்கு 1 - அமைதியான பின்னடைவு. ஒரு குழு அதை "மேம்படுத்த" வரியில் மாற்றியமைத்தது; பொதுவான துல்லியம் அதிகரித்தது, ஆனால் பொறி கேள்விகளில் விசுவாசம் 30% குறைந்துள்ளது (மாடல் இன்னும் பொருந்தத் தொடங்கியது). தங்கக் கொத்துக்களில் பொறி கேள்விகள் இல்லாவிட்டால் இது கவனிக்கப்பட்டிருக்காது; பின்னடைவு சோதனை மாற்றத்தை மாற்றியது.
வழக்கு 2 - தவறான காலை நேராக்குதல். ஒரு உதவியாளரிடம் பதில்கள் மோசமாக இருந்தன; குழு வாரக்கணக்கில் பணிபுரிந்தது. மீட்டெடுப்பு அளவீடுகளை நாங்கள் அளந்தபோது, recall@5 48% மட்டுமே - சிக்கல் மீட்டெடுப்பதில் இருந்தது, தலைமுறை அல்ல. ஹைப்ரிட் + மறு தரவரிசை சேர்க்கப்பட்டதும், நினைவுபடுத்துதல் 89% ஆக அதிகரித்தது மற்றும் துல்லியமும் அதிகரித்தது.
வழக்கு 3 - தயாரிப்பு எச்சரிக்கை. ஒரு நாள், ஆதரவு உதவியாளருக்கான "என்னால் தகவலைக் கண்டுபிடிக்க முடியவில்லை" விகிதம் 6% லிருந்து 34% ஆக உயர்ந்தது. டிராக்பேட் எச்சரித்தது; காரணம், இரவில் நடக்கும் இண்டெக்சிங் வேலை, அமைதியாக தோல்வியடைந்து, புதிய கட்டுரைகள் பதிவேற்றம் செய்யப்படவில்லை. கண்காணிப்பு இல்லாமல், தவறான "எனக்குத் தெரியாது" அறிக்கைகள் பல நாட்கள் தொடர்ந்திருக்கும்.
பொதுவான தவறுகள்
- "இது எனக்கு நன்றாக வேலை செய்தது" என்பதில் திருப்தி அடைவது: அளவீடு இல்லாமல், பின்னடைவு கவனிக்கப்படாமல் போகும்.
- மீட்டெடுப்பு மற்றும் தலைமுறையை பிரிக்கவில்லை: நீங்கள் தவறான காலை சரிசெய்து நேரத்தை வீணடிப்பீர்கள்.
- பொறி கேள்விகளைக் கேட்கவில்லை: விஷயங்களை உருவாக்கும் போக்கு தங்கக் கொத்துகளில் தோன்றாது.
- நீதிபதியை சரிபார்க்கவில்லை: ஒரு பாரபட்சமான நடுவர் மன்றம் தவறான நம்பிக்கையை அளிக்கிறது.
- உற்பத்தியை கண்காணிக்கவில்லை: குறியீட்டு தோல்வி, செலவு வெடிப்பு அமைதியாக தொடர்கிறது.
சுருக்கமாக
- RAG இல், மீட்டெடுப்பு மற்றும் தலைமுறை தரம் தனித்தனியாக அளவிடப்படுகிறது; எந்த காலில் சேதம் ஏற்பட்டது என்பதை முதலில் தீர்மானிக்க வேண்டும்.
- recall@k, precision@k, மீட்டெடுப்பதற்கான MRR; விசுவாசம், பொருத்தம், முழுமை ஆகியவை தலைமுறைக்கு பயன்படுகின்றன.
- ஒவ்வொரு அளவீடுக்கும் ஒரு தங்கக் கொத்து தேவை; உண்மையான, கடினமான, பொறி மற்றும் முரண்பாடான கேள்விகளை அதில் வைக்கவும்.
- LLM-ஆக-நிர்வாகி பெரிய செட் தானியங்கு மதிப்பெண்கள்; ஆனால் நீதிபதியே மனிதனுக்கு எதிராக நியாயப்படுத்தப்பட வேண்டும்.
- பின்னடைவு சோதனை, உற்பத்தி கண்காணிப்பு மற்றும் பின்னூட்ட வளையம் ஆகியவை காலப்போக்கில் தரத்தை பராமரிக்கின்றன.
விண்ணப்ப பணி
(1) உங்கள் சொந்த உதவியாளருக்காக குறைந்தபட்சம் 15 கேள்விகளைக் கொண்ட தங்கத் தொகுப்பை உருவாக்கவும்: குறைந்தது 3 பொறிகள் (பதில் இல்லை), 3 கடினமான, 2 முரண்பாடான மூலக் கேள்விகள். ஒவ்வொரு கேள்விக்கும் எதிர்பார்த்த பதிலையும் சரியான பகுதியையும் எழுதுங்கள். (2) இந்த தொகுப்புடன் இரண்டு வெவ்வேறு உடனடி பதிப்புகளை கைமுறையாக ஒப்பிட்டுப் பாருங்கள்; நம்பகத்தன்மை மற்றும் துல்லியத்திற்காக ஒவ்வொரு பதிலுக்கும் 1-5 புள்ளிகளைக் கொடுங்கள். (3) மேலே உள்ள LLM-ஆக-நீதிபதியாக உங்கள் சொந்த அளவுகோல்களை மாற்றியமைக்கவும். (4) உற்பத்தியில் நீங்கள் கண்காணிக்கும் 3 அளவீடுகளை அடையாளம் காணவும், ஒவ்வொன்றிற்கும் "எந்த வாசலில் நான் அலாரம் செய்வது?" மதிப்பை எழுதுங்கள்.
சரிபார்ப்பு பட்டியல்
- [ ] நான் தனித்த அளவீடுகள் மூலம் தக்கவைப்பு மற்றும் தலைமுறை தரத்தை அளவிட முடியும்.
- [ ] recall@k, உண்மைத்தன்மை போன்ற அளவீடுகள் என்னவென்று எனக்குத் தெரியும்.
- [ ] உண்மையான, கடினமான, பொறி மற்றும் முரண்பாடான கேள்விகளை உள்ளடக்கிய தங்கக் கிளஸ்டரை என்னால் உருவாக்க முடியும்.
- [ ] நான் தானியங்கி மதிப்பீட்டை அமைத்து LLM-ஆக-நீதிபதியைக் கொண்டு நீதிபதியை சரிபார்க்க முடியும்.
- [ ] நான் பின்னடைவு சோதனை, உற்பத்தி கண்காணிப்பு மற்றும் பின்னூட்ட வளையத்தை இயக்க முடியும்.