Пайдалар:
- Сактоо жана генерация сапатын өзүнчө өлчөгөн метрикаларды аныктоо
- Алтын суроолор топтомун орнотуңуз жана LLM-as-judge менен автоматтык түрдө баа бериңиз
- Өндүрүштө пикир, мониторинг жана регрессиялык тест аркылуу сапатты сактоо
"Мен жардамчыны орноттум, жакшы иштеп жатат окшойт" деген сүйлөм инженердик билдирүү эмес. RAG системалары унчукпай бузулат: документтин жаңы түрү издөөнү алдайт, тез өзгөртүү тактыкты азайтат, индекс эскирип калат. Муну түшүнүүнүн бирден-бир жолу - өлчөө. Бул бөлүмдө биз RAG сапатын (издөө жана генерацияны өзүнчө), автоматтык баалоону (LLM-сот катары) кантип өлчөөнү жана өндүрүштө сапатты сактоону (мониторинг, регрессия) камтыйт. «Өлчөбөсөң жакшырта албайсың» — бул звенонун урааны.
Эки өзүнчө нерсени өлчөө
RAG эки буту бар жана өзүнчө өлчөө керек, анткени көйгөй алардын биринде болушу мүмкүн:
- Издөө сапаты: Туура бөлүгү келдиби?
- Муун сапаты: Туура жооп келген бөлүктөн алынганбы?
Жооп жаман болсо, биринчи кайсы буту жаман экенин билиш керек. Эгер оң бөлүк эч качан келбесе, эң жакшы эскертүү да сактай албайт (издөө көйгөйү). Эгерде туура бөлүк келип, бирок модель аны туура эмес окуп калса, издөөнү жакшыртуу пайдасыз (муун көйгөйү).
Retrieval Metrics
Издөө - бул сорттоо/кирүү маселеси; классикалык маалымат издөө көрсөткүчтөрү менен өлчөнөт. Бул үчүн сизде алтын кластер болушу керек: ар бир суроо үчүн кайсы бөлүгү "туура" экенин билүү.
метрикалык
Кандай чаралар
Жөнөкөй аныктама
Recall@k
Жогорку к-да туура кесим барбы?
Туура бөлүгүн тартуу ылдамдыгы
precision@k
Кайтарылып берилген к даананын канчасы тиешелүү?
Келген нерсени тазалоо
MRR (орточо өз ара даража)
Туура кесим кайсы иретте?
Сыйлыктар жогорку саптарда болуу
Хит ылдамдыгы
Жок дегенде бир туура бөлүгү келдиби?
Ийгиликтин эң негизги көрсөткүчү
Практикалык комментарий: Эгерде Recall@k төмөн болсо, анда бөлүү же издөө стратегиясы (гибриддик, к, кайра рейтинг) кайра иштелип чыгышы керек. Эгер тактык төмөн болсо, бирок кайра чакырып алуу жогору болсо, рейтингди кайра кошуу жакшы кадам.
Generation Metrics
Туура бөлүк келгенде, биз модель чыгарган жооптун сапатын өлчөйбүз. Үч негизги өлчөм:
- Ишенимдүүлүк: Жооптун ар бир талабы контекст менен бекемделгенби? Орнотуу барбы? Бул галлюцинациянын түздөн-түз көрсөткүчү.
- Жооптун актуалдуулугу: Жооп чындыгында суроого жооп береби же темадан башкабы?
- Толуктук: Контексттеги бардык тиешелүү маалыматтар колдонулдубу же ал жетишсизби?
Булар көбүнчө “чын/жалган” сыяктуу бинардык эмес, бааланган негизде бааланат (мисалы, 1-5).
Кеңеш: Ишенимдүүлүккө өзүнчө көрсөткүч катары көз салыңыз. Эгер тактык азайган сайын ишенимдүүлүк азайса, анда көйгөй муун; Ишенимдүүлүк жогору болсо, бирок жооп туура эмес болсо, маселе туура эмес кесимде (издөө). Бул эки көрсөткүч биргелешип, катанын ордун көрсөткөн компас болуп саналат.
Алтын суроолор топтомун түзүү
Ар бир өлчөө алтын топтомду / баалоо маалымат топтомун талап кылат: реалдуу суроолор + күтүлгөн туура жооптор + туура булак даана. Туура тандалган 30-50 суроодон баштоо 500 туш келди суроолорго караганда жакшыраак. Төмөнкүлөрдү топтомго кошуңуз: көп берилүүчү реалдуу суроолор, белгилүү татаал суроолор, жообу жок тузак суроолор («билбейм» деп айтыш керек), карама-каршы булактары бар суроолор.
# Алтын кластердин мисалы (концептуалдык)[ {"суроо": "Канча күн жылдык эмгек өргүү?", "күтүлгөн_жооп": "1-5 жылдык стаж үчүн 14 күн", "туура_бөлүк": "эки бөлүк-3", "категория": "кетүү"}, {"суроо": "компания кайда,"кайда? "NO_INFORMATION", # trap: Билбейм "туура_бөлүк_идентификатор": null, "категория": "тпак"}]
LLM-судья: Автоматтык баалоо
Жүздөгөн жоопторду кол менен упай коюу чарчатат. LLM-судья модели – бул бир моделдин башка моделдин жообун белгилүү критерийлердин негизинде упай топтоп, негиздөө. Жакшы судья критерийлерди так аныктайт, мисалдарды келтирет жана негиздөө үчүн сурайт.
# LLM-сот катары тез (концептуалдык) Сиз калыс баа берүүчүсүз. Төмөндөгү ЖООПту берилген КОНТЕКСТ жана КҮТҮЛГӨН ЖООП боюнча баалаңыз. Балл (1-5) жана негиздөө:- ишенимдүүлүк: жооптун ар бир талабы контекстте колдоого алынганбы?- тактык: жооп күтүлгөн жоопко дал келеби?- толуктук: тиешелүү маалымат толукбу? Атап айтканда: эгерде жооп контекстке кирбеген маалыматты камтыса, ишенимдүүлүктү1 бериңиз жана кайсы доомат ойдон чыгарылганын көрсөтүңүз.КОНТЕКСТ: {контекст}КҮТҮЛГӨН: {күтүлгөн}ЖООП: {жооп}Чыгыш: {ишенимдүүлүк, тактык, толуктук, негиздөө}
Абайлаңыз: LLM-судья кемчиликсиз эмес; Алардын өз көз караштары болушу мүмкүн (узун жооп, өз стилин артык). Ошондой эле Судьяны текшериңиз: кээ бир жоопторду судья менен адам тең эсептеп, алардын ортосундагы макулдашууну өлчөңүз. Эгерде Судья адамдын упайларына шайкеш келсе, ага ишенсеңиз болот.
Алсыз/күчтүү рейтинг
Алсыз ("бул мен үчүн жакшы болду"):
Мен бир нече суроо бердим, жооптор жакшы көрүндү. Мен аны түз алып алдым.# Маселе: өлчөөлөр жок, регрессия байкалбайт, жакшыртуу сокур.
Күчтүү (алтын кластер + дискреттик метрика + автоматтык сот + регрессия):
40 суроодон турган алтын кластер. Ар бир өзгөртүү менен, recall@5, ишенимдүүлүк жана тактык автоматтык түрдө өлчөнөт. Эгерде упай төмөндөп кетсе, өзгөртүү артка жылдырылат. Өндүрүштө колдонуучунун пикири чогултулуп, комплектке кошулат.
Өндүрүштөгү мониторинг жана регрессия
Баалоо бир жолу жасалып бүтпөйт. Үч туруктуу практика:
- Регрессиялык тестирлөө: Ар бир ыкчам/издөө/моделди өзгөртүүдө автоматтык түрдө иштетилген алтын кластер. Эгерде упай азайса, өзгөртүү тескери болот. Бул "аны жакшыртууга аракет кылып жатып, аны бузууга" жол бербейт.
- Өндүрүш мониторинги: "Мен маалымат таба алган жокмун" реалдуу суроолордун баасы, орточо кечигүү, наркы, колдонуучунун пикири (👍/👎) көзөмөлдөнөт. "Мен билбейм" дегендин кескин көбөйүшү көбүнчө индекстин же издөөнүн бузулушунун биринчи белгиси болуп саналат.
- Пикир байланыш цикли: Колдонуучу тарабынан берилген реалдуу суроолор 👎 каралып, алтын үймөккө кошулат; Ошентип, топтом убакыттын өтүшү менен байып, системанын сокур тактары жабылат.
Үч мини Case
1-жагдай — Унчукпай регрессия. Команда сунушту "жакшыртуу" үчүн өзгөрттү; Жалпы тактык жогорулады, бирок тузак суроолорунда ишенимдүүлүк 30% га төмөндөдү (модель көбүрөөк туура келе баштады). Эгерде алтын түстөгү капкан суроолору болбогондо байкалмак эмес; Регрессиялык тест өзгөртүүнү кайтарды.
2-жагдай - туура эмес бутту түздөө. Бир жардамчыда жооптор начар болгон; Команда бир нече жума бою ыкчам иштеген. Биз издөө көрсөткүчтөрүн ченегенде, recall@5 болгону 48% түздү — көйгөй генерацияда эмес, издөөдө болгон. Гибрид + кайра рейтинг кошулганда, кайра чакырып алуу 89% га чейин көбөйүп, тактык да жогорулаган.
3-жагдай - Өндүрүш эскертүүсү. Бир күнү, колдоочу жардамчы үчүн "Мен маалымат таба алган жокмун" баасы 6% дан 34% га көтөрүлдү. трекпад эскертти; Себеби, түнү менен иштеген индекстөө иши унчукпай ишке ашпай, жаңы макалалар жүктөлбөй калган. Мониторинг болбосо, “билбейм” деген туура эмес сөздөр бир нече күнгө созулмак.
Жалпы каталар
- "Бул мен үчүн жакшы иштеди" менен канааттануу: өлчөөсүз, регрессия байкалбайт.
- Издөө жана генерацияны бөлбөстөн: Сиз туура эмес бутту оңдоп, убакытты текке кетиресиз.
- Тузак суроолорду бербөө: Бир нерселерди жасоо тенденциясы алтын кластерде көрүнбөйт.
- Судьяны текшербейт: калыс калыстар тобу жалган ишеним берет.
- Өндүрүшкө мониторинг жүргүзүү эмес: индекстин бузулушу, чыгымдын жарылуусу унчукпай уланууда.
Кыскача айтканда
- RAGда издөө жана генерация сапаты өзүнчө өлчөнөт; Адегенде кайсы буту жабыркаганын аныктоо керек.
- recall@k, precision@k, издөө үчүн MRR; Урук үчүн ишенимдүүлүк, ылайыктуулук, толуктук колдонулат.
- Ар бир өлчөө алтын кластерин талап кылат; Ага реалдуу, татаал, тузак жана карама-каршы суроолорду кой.
- LLM-сот катары чоң топтомдор авто-упайлар; бирок соттун өзү адамга каршы акталышы керек.
- Регрессиялык тестирлөө, өндүрүшкө мониторинг жүргүзүү жана кайтарым байланыш цикли убакыттын өтүшү менен сапатты сактайт.
Колдонмо тапшырмасы
(1) Өзүңүздүн жардамчыңыз үчүн кеминде 15 суроодон турган алтын топтомду түзүңүз: жок дегенде 3 тузак (жооп жок), 3 татаал, 2 карама-каршы булактан турган суроолорду кошуңуз. Ар бир суроо үчүн күтүлгөн жоопту жана туура бөлүгүн жазыңыз. (2) Бул топтом менен эки башка ыкчам версияны кол менен салыштырыңыз; Ар бир жоопко ишенимдүүлүк жана тактык үчүн 1-5 упай бериңиз. (3) Жогорудагы LLM-сот катары сунушун өз критерийлериңизге ылайыкташтырыңыз. (4) Өндүрүштө байкай турган 3 көрсөткүчтү аныктаңыз жана ар бири үчүн “кайсы босогодо коңгуроо кылам?” деп сураңыз. баасын жаз.
текшерүү тизмеси
- [ ] Мен өзүнчө көрсөткүчтөр менен сактоо жана муундун сапатын өлчөй алам.
- [ ] Мен recall@k, ишенимдүүлүк сыяктуу көрсөткүчтөр эмнени билдирерин билем.
- [ ] Мен чыныгы, татаал, тузак жана карама-каршы суроолорду камтыган алтын кластер кура алам.
- [ ] Мен автоматтык баалоону орнотуп, судьяны LLM-судья менен текшере алам.
- [ ] Мен регрессиялык тестирлөө, өндүрүшкө мониторинг жана кайтарым байланыш циклин иштете алам.