ትርፍ፡
- የማቆየት እና የማመንጨት ጥራትን በተናጥል የሚለኩ መለኪያዎችን መወሰን
- የወርቅ ጥያቄ አዘጋጅ እና በራስ ሰር ግምገማን ከኤልኤልኤም-እንደ ዳኛ ጋር አሂድ
- በምርት ውስጥ በአስተያየት ፣ በክትትል እና በድጋሜ ሙከራ ጥራትን መጠበቅ
"ረዳቱን ጫንኩኝ፣ ጥሩ እየሰራ ይመስላል" የሚለው ዓረፍተ ነገር የምህንድስና መግለጫ አይደለም። RAG ሲስተሞች በፀጥታ ይፈርሳሉ፡ አዲስ የሰነድ አይነት መልሶ ማግኘትን ያሞኛል፣ ፈጣን ለውጥ ትክክለኛነትን ይቀንሳል፣ መረጃ ጠቋሚው ያረጀ ይሆናል። ይህንን ለመገንዘብ ብቸኛው መንገድ መለካት ነው። በዚህ ክፍል ውስጥ የ RAG ጥራትን (መለየት እና ማመንጨት በተናጥል) ፣ አውቶማቲክ ግምገማ (LLM-as-judge) እና የምርት ጥራትን (ክትትል ፣ መመለሻ) እንዴት እንደምንለካ እንሸፍናለን። "የማትለኩትን ማሻሻል አትችልም" የሚለው መሪ ቃል ነው።
ሁለት የተለያዩ ነገሮችን ይለኩ።
RAG ሁለት እግሮች ያሉት ሲሆን ችግሩ ከሁለቱም ውስጥ ሊሆን ስለሚችል በተናጠል መለካት አለበት.
- የመልሶ ጥራት፡ ትክክለኛው ክፍል ደርሷል?
- የትውልድ ጥራት፡ ትክክለኛው መልስ ከመጪው ክፍል ተዘጋጅቷል?
መልሱ መጥፎ ከሆነ በመጀመሪያ የትኛው እግር መጥፎ እንደሆነ ማወቅ ያስፈልግዎታል. ትክክለኛው ክፍል ጨርሶ ካልመጣ፣ ምርጡ መጠየቂያ እንኳ ማስቀመጥ አይችልም (የመልሶ ማግኛ ችግር)። ትክክለኛው ክፍል ከደረሰ ግን ሞዴሉ በተሳሳተ መንገድ ካነበበው, መልሶ ማግኘትን ማሻሻል ከንቱ ነው (የትውልድ ችግር).
የመልሶ ማግኛ መለኪያዎች
ሰርስሮ ማውጣት የመደርደር/መዳረሻ ችግር ነው፤ የሚለካው በጥንታዊ መረጃ ማግኛ መለኪያዎች። ለእዚህ ወርቃማ ክላስተር ሊኖርዎት ይገባል: ለእያንዳንዱ ጥያቄ የትኛው ቁራጭ "ትክክለኛ" እንደሆነ ማወቅ.
መለኪያ
ምን ይለካል
ቀላል ትርጉም
አስታውስ@k
ትክክለኛው ቁራጭ ከላይ k ነው?
ትክክለኛው የክፍል ቀረጻ መጠን
ትክክለኛነት @ ኪ
ከተመለሱት የ k ቁርጥራጮች ውስጥ ምን ያህሉ ተዛማጅ ናቸው?
የመጣውን ማጽዳት
MRR (አማካይ የተገላቢጦሽ ደረጃ)
ትክክለኛው ቁራጭ በየትኛው ቅደም ተከተል ነው?
ሽልማቶች በከፍተኛ ደረጃዎች ውስጥ ይገኛሉ
የመምታት መጠን
ቢያንስ አንድ ትክክለኛ ቁራጭ ደርሷል?
በጣም መሠረታዊው የስኬት መለኪያ
ተግባራዊ አስተያየት፡ Recall@k ዝቅተኛ ከሆነ፣ መቆራረጥ ወይም የፍለጋ ስልት (ድብልቅ፣ ኪ፣ ዳግም ደረጃ መስጠት) እንደገና መሠራት አለበት። ትክክለኝነት ዝቅተኛ ከሆነ ግን ማስታወስ ከፍተኛ ከሆነ፣ እንደገና ደረጃ መስጠት ጥሩ እርምጃ ነው።
የትውልድ መለኪያዎች
ትክክለኛው ክፍል ሲመጣ በአምሳያው የተሰራውን ምላሽ ጥራት እንለካለን. ሶስት መሰረታዊ ልኬቶች:
- ታማኝነት፡ በመልሱ ውስጥ ያለው እያንዳንዱ የይገባኛል ጥያቄ በአውድ የተደገፈ ነው? የሚስማማ ነገር አለ? እሱ በቀጥታ የቅዠት መለኪያ ነው።
- አግባብነት ያለው መልስ፡ መልሱ በእርግጥ ለጥያቄው መልስ ይሰጣል ወይስ ከርዕስ ውጪ ነው?
- ሙሉነት፡ በዐውደ-ጽሑፉ ውስጥ ያሉት ሁሉም ተዛማጅ መረጃዎች ጥቅም ላይ ውለዋል ወይንስ ጠፍተዋል?
እነዚህ ብዙውን ጊዜ የሚመሩት እንደ “እውነት/ሐሰት” ባለ ሁለትዮሽ ሳይሆን በደረጃ (ለምሳሌ 1-5) ነው።
ጠቃሚ ምክር፡ ታማኝነትን እንደ የተለየ መለኪያ ይከታተሉ። ትክክለኛነት ሲቀንስ ታማኝነት ከቀነሰ ችግሩ ትውልድ ነው; ታማኝነት ከፍ ያለ ከሆነ ግን መልሱ የተሳሳተ ከሆነ, ችግሩ የተሳሳተ ቁራጭ (መልሶ ማግኘት) ነው. እነዚህ ሁለት መለኪያዎች አንድ ላይ ሆነው የስህተቱን ቦታ የሚያሳይ ኮምፓስ ናቸው።
ወርቃማ ጥያቄ ስብስብ ማቋቋም
እያንዳንዱ መለኪያ ወርቃማ ስብስብ/የግምገማ ዳታ ስብስብ ያስፈልገዋል፡ ተጨባጭ ጥያቄዎች + የሚጠበቁ ትክክለኛ መልሶች + ትክክለኛ የምንጭ ቁርጥራጮች። ከ30-50 በሚገባ በተመረጡ ጥያቄዎች መጀመር ከ500 የዘፈቀደ ጥያቄዎች ይሻላል። በስብስቡ ውስጥ የሚከተሉትን ያካትቱ፡- በተደጋጋሚ የሚጠየቁ እውነተኛ ጥያቄዎች፣ የታወቁ አስቸጋሪ ጥያቄዎች፣ መልስ የሌላቸው ወጥመድ ጥያቄዎች (አንድ ሰው "አላውቅም" ማለት አለበት)፣ የሚቃረኑ ምንጮች ያላቸው ጥያቄዎች።
# ወርቃማ ክላስተር ምሳሌ (ፅንሰ-ሀሳብ)[ {"ጥያቄ"፡ "የዓመት ፈቃድ ስንት ቀናት?"፣ "የሚጠበቀው_መልስ"፡ "14 ቀናት ለ1-5 አመት ከፍተኛ ደረጃ"፣ "ትክክለኛ_ክፍል_መታወቂያ"፡ "ሁለት-ክፍል-3"፣ "ምድብ"፡ "ተወው"}፣ {"ጥያቄ"፣"ጥያቄ"፡"የኩባንያው_ቢሮ"የት ነው? # ወጥመድ፡ "ትክክለኛ_ክፍል_መታወቂያ" አላውቅም፡ null, "categori": "ወጥመድ"}]
LLM-እንደ ዳኛ፡ ራስሰር ግምገማ
በመቶዎች የሚቆጠሩ መልሶችን በእጅ ማስቆጠር አድካሚ ነው። የኤልኤልኤም-እንደ ዳኛ ሞዴል አንድ ሞዴል ነጥብ ሲያስቆጥር እና በተወሰኑ መስፈርቶች ላይ ተመስርቶ የሌላ ሞዴል መልስ ሲያጸድቅ ነው። ጥሩ የዳኛ ጥያቄ መስፈርቶቹን በግልፅ ይገልፃል ፣ ምሳሌዎችን ይሰጣል እና ፅድቅን ይጠይቃል።
# LLM-እንደ ዳኛ ጥያቄ (ፅንሰ-ሀሳብ) እርስዎ ገለልተኛ ገምጋሚ ነዎት። በተሰጠው CONTEXT እና የሚጠበቀው መልስ መሰረት ከዚህ በታች ያለውን መልስ ገምግመው። ነጥብ (1-5) እና ያጸድቁ፡- ታማኝነት፡ በመልሱ ውስጥ ያለው እያንዳንዱ የይገባኛል ጥያቄ በዐውደ-ጽሑፉ የተደገፈ ነው? በተለይ፡ መልሱ በዐውደ-ጽሑፉ ውስጥ ያልሆነ መረጃ የያዘ ከሆነ ታማኝነት1 እና የትኛው የይገባኛል ጥያቄ እንደተፈበረ ጠቁም።
ማስጠንቀቂያ: LLM-እንደ-ዳኛ ፍጹም አይደለም; የራሳቸው አድልዎ ሊኖራቸው ይችላል (ረዥም መልስ, የራሳቸውን ዘይቤ ይመርጣሉ). እንዲሁም ዳኛውን ያረጋግጡ፡- በዳኛው እና በሰው የተመዘገቡ አንዳንድ መልሶች ይኑርዎት እና በመካከላቸው ያለውን ስምምነት ይለኩ። ዳኛው ከሰው ውጤቶች ጋር የሚስማማ ከሆነ እሱን ማመን ይችላሉ።
ደካማ/ጠንካራ ደረጃ አሰጣጥ
ደካማ ("ለእኔ ጥሩ ነበር"):
ጥቂት ጥያቄዎችን ጠየኩ እና መልሱ ጥሩ መሰለኝ። በቀጥታ አግኝቼዋለሁ።# ችግር፡ ምንም አይነት መለኪያዎች የሉም፣ ወደ ኋላ መመለስ የማይታወቅ፣ መሻሻል ዓይነ ስውር።
ኃይለኛ (የወርቅ ክላስተር + ልዩ መለኪያዎች + አውቶማቲክ ፍርድ + መመለሻ)
የ40 ጥያቄዎች ወርቃማ ስብስብ። በእያንዳንዱ ለውጥ፣ recall@5፣ ታማኝነት እና ትክክለኛነት በራስ-ሰር ይለካሉ። ውጤቱ ከቀነሰ ለውጡ ወደ ኋላ ይመለሳል። በምርት ውስጥ የተጠቃሚ ግብረመልስ ተሰብስቦ ወደ ስብስቡ ይታከላል።
በምርት ውስጥ ክትትል እና ማገገም
ግምገማ አንድ ጊዜ ተሠርቶ አልተጠናቀቀም. ሶስት ቋሚ ልምዶች;
- የመልሶ ማቋቋም ሙከራ፡ በእያንዳንዱ የጥያቄ/ማስመለስ/ሞዴል ለውጥ ላይ በራስ ሰር የሚሰራ የወርቅ ስብስብ። ውጤቱ ከተቀነሰ ለውጡ ይለወጣል. ይህ "የተሻለ ለማድረግ በሚሞክርበት ጊዜ መስበር" ይከላከላል.
- የምርት ክትትል፡ "መረጃ ላገኝ አልቻልኩም" ደረጃ በእውነተኛ ጥያቄዎች፣ አማካኝ መዘግየት፣ ወጪ፣ የተጠቃሚ ግብረመልስ (👍/👎) ክትትል ይደረግበታል። በድንገት "አላውቅም" መጨመር ብዙውን ጊዜ የመረጃ ጠቋሚ ወይም የመልሶ ማግኛ ብልሽት የመጀመሪያው ምልክት ነው።
- የግብረመልስ ምልልስ፡ በተጠቃሚው 👎 የቀረቡት ትክክለኛ ጥያቄዎች ተገምግመው ወደ ወርቃማው ክምር ተጨምረዋል። ስለዚህ, ስብስቡ ከጊዜ በኋላ የበለፀገ እና የስርዓቱ ዓይነ ስውር ቦታዎች ይዘጋሉ.
ሶስት ሚኒ ጉዳዮች
ጉዳይ 1 - ጸጥ ያለ መመለስ. አንድ ቡድን ጥያቄውን "ለማሻሻል" አሻሽሏል; አጠቃላይ ትክክለኛነት ጨምሯል ፣ ግን ታማኝነት በወጥመዱ ጥያቄዎች በ 30% ቀንሷል (አምሳያው የበለጠ መገጣጠም ጀመረ)። በወርቃማው ክላስተር ውስጥ ያሉ የወጥመዱ ጥያቄዎች ባይኖሩ ኖሮ ትኩረት አይሰጠውም ነበር; የድጋፍ ሙከራ ለውጡን መልሰዋል።
ጉዳይ 2 - የተሳሳተውን እግር ማስተካከል. በአንድ ረዳት ውስጥ መልሶች መጥፎ ነበሩ; ቡድኑ በጥያቄው ላይ ለሳምንታት ሰርቷል። የመልሶ ማግኛ መለኪያዎችን ስንለካ፣ recall@5 48% ብቻ ነበር - ችግሩ በማምጣት ላይ እንጂ በማመንጨት ላይ አልነበረም። ድቅል + ድጋሚ ደረጃ ሲጨመር፣ አስታውስ ወደ 89% አድጓል እና ትክክለኛነትም እንዲሁ ጨምሯል።
ጉዳይ 3 - የምርት ማንቂያ. አንድ ቀን፣ የድጋፍ ረዳት የ"መረጃ ማግኘት አልቻልኩም" ደረጃ ከ 6% ወደ 34% ዘሎ። ትራክፓድ አስጠንቅቋል; ምክንያቱ በምሽት የሚሰራው የመረጃ ጠቋሚ ስራ በፀጥታ ወድቋል እና አዳዲስ መጣጥፎች አልተሰቀሉም. ያለ ክትትል፣ የተሳሳቱ "አላውቅም" መግለጫዎች ለቀናት ይቀጥላሉ ነበር።
የተለመዱ ስህተቶች
- "በጥሩ ሰርቶልኛል" በሚለው እርካታ: ያለ መለኪያ, መመለሻነት ሳይስተዋል ይቀራል.
- ማደስ እና ማመንጨት አለመለያየት፡ የተሳሳተውን እግር ታስተካክላላችሁ እና ጊዜ ታባክናላችሁ።
- ወጥመድ ጥያቄዎችን አለመጠየቅ፡- ነገሮችን የመፍጠር ዝንባሌ በወርቃማ ክላስተር ውስጥ አይታይም።
- ዳኛን አለማረጋገጥ፡ አድሏዊ ዳኝነት የውሸት እምነት ይሰጣል።
- ምርትን አለመቆጣጠር፡ የመረጃ ጠቋሚ አለመሳካት፣ የወጪ ፍንዳታ በጸጥታ ይቀጥላል።
በማጠቃለያው
- በ RAG ውስጥ የመልሶ ማግኛ እና የማመንጨት ጥራት በተናጠል ይለካሉ; በመጀመሪያ የትኛው እግር እንደተጎዳ መወሰን አለበት.
- recall@k፣ precision@k፣ MRR ለዳግም ማግኛ; ታማኝነት, ተስማሚነት, ሙሉነት ለትውልድ ጥቅም ላይ ይውላል.
- እያንዳንዱ መለኪያ የወርቅ ክላስተር ያስፈልገዋል; በውስጡ እውነተኛ፣ አስቸጋሪ፣ ወጥመድ እና ተቃራኒ ጥያቄዎችን ያስቀምጡ።
- LLM-እንደ ፍርድ ትልቅ ስብስቦች ራስ-ውጤት; ዳኛው ግን ራሱ በሰው ላይ መመጻደቅ አለበት።
- የድጋሚ ሙከራ፣ የምርት ክትትል እና የግብረመልስ ዑደት በጊዜ ሂደት ጥራቱን ይጠብቃል።
የመተግበሪያ ተግባር
(1) ለራስዎ ረዳት ቢያንስ 15 ጥያቄዎችን የያዘ ወርቃማ ስብስብ ይፍጠሩ፡ ቢያንስ 3 ወጥመዶችን ያካትቱ (መልስ የለም)፣ 3 አስቸጋሪ፣ 2 የሚቃረኑ የመነሻ ጥያቄዎች። የሚጠበቀውን መልስ እና ለእያንዳንዱ ጥያቄ ትክክለኛውን ክፍል ይፃፉ. (2) ሁለት የተለያዩ ፈጣን ስሪቶችን ከዚህ ስብስብ ጋር በእጅ ያወዳድሩ። ለእያንዳንዱ መልስ ከ1-5 ነጥብ ለታማኝነት እና ለትክክለኛነት ይስጡ። (3) ከላይ ያለውን የኤልኤልኤም-እንደ ዳኛ ጥያቄ ከራስህ መስፈርት ጋር አስተካክል። (4) በምርት ውስጥ የሚከታተሉዋቸውን 3 መለኪያዎችን ይለዩ እና ለእያንዳንዱም "በየትኛው ደረጃ ላይ ነው የምነቃው?" ዋጋውን ይፃፉ.
የማረጋገጫ ዝርዝር
- [] የማቆየት እና የማመንጨት ጥራትን በተለዩ መለኪያዎች መለካት እችላለሁ።
- [] እንደ recall@k፣ ታማኝነት ምን ማለት እንደሆነ አውቃለሁ።
- [ ] እውነተኛ፣ አስቸጋሪ፣ ወጥመድ እና እርስ በርሱ የሚጋጩ ጥያቄዎችን ያካተተ ወርቃማ ክላስተር መገንባት እችላለሁ።
- [ ] አውቶማቲክ ግምገማን አዘጋጅቼ ዳኛውን በኤልኤልኤም-እንደ ዳኛ ማረጋገጥ እችላለሁ።
- [ ] የድጋሚ ሙከራን፣ የምርት ክትትልን እና የግብረመልስ ምልልስን መሥራት እችላለሁ።