ਲਾਭ:
- ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਨਾ ਜੋ ਧਾਰਨ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਮਾਪਦੇ ਹਨ
- ਇੱਕ ਸੁਨਹਿਰੀ ਪ੍ਰਸ਼ਨ ਸੈੱਟ ਸੈੱਟ ਕਰੋ ਅਤੇ LLM-ਜੱਜ-ਜੱਜ ਦੇ ਨਾਲ ਆਟੋਮੈਟਿਕ ਮੁਲਾਂਕਣ ਚਲਾਓ
- ਉਤਪਾਦਨ ਵਿੱਚ ਫੀਡਬੈਕ, ਨਿਗਰਾਨੀ ਅਤੇ ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ ਦੁਆਰਾ ਗੁਣਵੱਤਾ ਨੂੰ ਬਣਾਈ ਰੱਖਣਾ
ਵਾਕ "ਮੈਂ ਸਹਾਇਕ ਸਥਾਪਿਤ ਕੀਤਾ ਹੈ, ਇਹ ਵਧੀਆ ਕੰਮ ਕਰਦਾ ਜਾਪਦਾ ਹੈ" ਕੋਈ ਇੰਜੀਨੀਅਰਿੰਗ ਬਿਆਨ ਨਹੀਂ ਹੈ। RAG ਸਿਸਟਮ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦੇ ਹਨ: ਇੱਕ ਨਵੀਂ ਦਸਤਾਵੇਜ਼ ਕਿਸਮ ਪੁਨਰ ਪ੍ਰਾਪਤੀ ਨੂੰ ਮੂਰਖ ਬਣਾ ਦਿੰਦੀ ਹੈ, ਇੱਕ ਤੁਰੰਤ ਤਬਦੀਲੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਸੂਚਕਾਂਕ ਪੁਰਾਣਾ ਹੋ ਜਾਂਦਾ ਹੈ। ਇਸ ਨੂੰ ਸਮਝਣ ਦਾ ਇੱਕੋ ਇੱਕ ਤਰੀਕਾ ਮਾਪਣਾ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਕਵਰ ਕਰਦੇ ਹਾਂ ਕਿ ਕਿਵੇਂ ਆਰਏਜੀ ਗੁਣਵੱਤਾ (ਮੁੜ ਪ੍ਰਾਪਤੀ ਅਤੇ ਪੀੜ੍ਹੀ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ), ਆਟੋਮੈਟਿਕ ਮੁਲਾਂਕਣ (ਐਲਐਲਐਮ-ਜੱਜ) ਅਤੇ ਉਤਪਾਦਨ ਵਿੱਚ ਗੁਣਵੱਤਾ (ਨਿਗਰਾਨੀ, ਰਿਗਰੈਸ਼ਨ) ਨੂੰ ਕਿਵੇਂ ਮਾਪਣਾ ਹੈ। "ਤੁਸੀਂ ਉਸ ਨੂੰ ਸੁਧਾਰ ਨਹੀਂ ਸਕਦੇ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਮਾਪਦੇ ਨਹੀਂ ਹੋ" ਇਸ ਯੂਨਿਟ ਦਾ ਆਦਰਸ਼ ਹੈ।
ਦੋ ਵੱਖਰੀਆਂ ਚੀਜ਼ਾਂ ਨੂੰ ਮਾਪੋ
RAG ਦੀਆਂ ਦੋ ਲੱਤਾਂ ਹਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਮਾਪਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿਉਂਕਿ ਸਮੱਸਿਆ ਦੋਵਾਂ ਵਿੱਚੋਂ ਕਿਸੇ ਇੱਕ ਵਿੱਚ ਹੋ ਸਕਦੀ ਹੈ:
- ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਗੁਣਵੱਤਾ: ਕੀ ਸਹੀ ਹਿੱਸਾ ਆਇਆ ਸੀ?
- ਜਨਰੇਸ਼ਨ ਕੁਆਲਿਟੀ: ਕੀ ਆਉਣ ਵਾਲੇ ਹਿੱਸੇ ਤੋਂ ਸਹੀ ਜਵਾਬ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਸੀ?
ਜੇ ਜਵਾਬ ਬੁਰਾ ਹੈ, ਤਾਂ ਤੁਹਾਨੂੰ ਪਹਿਲਾਂ ਇਹ ਜਾਣਨ ਦੀ ਜ਼ਰੂਰਤ ਹੈ ਕਿ ਕਿਹੜੀ ਲੱਤ ਖਰਾਬ ਹੈ। ਜੇਕਰ ਸਹੀ ਹਿੱਸਾ ਕਦੇ ਨਹੀਂ ਆਉਂਦਾ, ਤਾਂ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰੋਂਪਟ ਵੀ ਬਚਾ ਨਹੀਂ ਸਕਦਾ (ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਸਮੱਸਿਆ)। ਜੇਕਰ ਸਹੀ ਹਿੱਸਾ ਆਇਆ ਹੈ ਪਰ ਮਾਡਲ ਨੇ ਇਸ ਨੂੰ ਗਲਤ ਪੜ੍ਹਿਆ ਹੈ, ਤਾਂ ਪ੍ਰਾਪਤੀ ਨੂੰ ਸੁਧਾਰਨਾ ਵਿਅਰਥ ਹੈ (ਪੀੜ੍ਹੀ ਦੀ ਸਮੱਸਿਆ)।
ਮੁੜ ਪ੍ਰਾਪਤੀ ਮੈਟ੍ਰਿਕਸ
ਮੁੜ ਪ੍ਰਾਪਤੀ ਇੱਕ ਛਾਂਟੀ/ਪਹੁੰਚ ਸਮੱਸਿਆ ਹੈ; ਕਲਾਸੀਕਲ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤੀ ਮੈਟ੍ਰਿਕਸ ਦੁਆਰਾ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ। ਇਸਦੇ ਲਈ ਤੁਹਾਡੇ ਕੋਲ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ: ਹਰੇਕ ਪ੍ਰਸ਼ਨ ਲਈ ਕਿਸ ਟੁਕੜੇ ਦਾ ਗਿਆਨ "ਸਹੀ" ਹੈ।
ਮੈਟ੍ਰਿਕ
ਕੀ ਉਪਾਅ
ਸਧਾਰਨ ਪਰਿਭਾਸ਼ਾ
Recall@k
ਕੀ ਸਿਖਰ k ਵਿੱਚ ਸਹੀ ਟੁਕੜਾ ਹੈ?
ਸਹੀ ਪਾਰਟ ਕੈਪਚਰ ਰੇਟ
precision@k
ਵਾਪਸ ਕੀਤੇ k ਟੁਕੜਿਆਂ ਵਿੱਚੋਂ ਕਿੰਨੇ ਢੁਕਵੇਂ ਹਨ?
ਕੀ ਲਿਆਇਆ ਗਿਆ ਹੈ ਦੀ ਸਫਾਈ
MRR (ਔਸਤ ਪਰਸਪਰ ਰੈਂਕ)
ਕਿਸ ਕ੍ਰਮ ਵਿੱਚ ਸਹੀ ਟੁਕੜਾ ਹੈ?
ਇਨਾਮ ਚੋਟੀ ਦੇ ਰੈਂਕ ਵਿੱਚ ਹਨ
ਹਿੱਟ ਰੇਟ
ਕੀ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਸਹੀ ਟੁਕੜਾ ਆਇਆ?
ਸਫਲਤਾ ਦਾ ਸਭ ਤੋਂ ਬੁਨਿਆਦੀ ਮਾਪ
ਵਿਹਾਰਕ ਟਿੱਪਣੀ: ਜੇਕਰ Recall@k ਘੱਟ ਹੈ, ਤਾਂ ਚੰਕਿੰਗ ਜਾਂ ਖੋਜ ਰਣਨੀਤੀ (ਹਾਈਬ੍ਰਿਡ, ਕੇ, ਰੀ-ਰੈਂਕਿੰਗ) ਨੂੰ ਦੁਬਾਰਾ ਕੰਮ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਜੇਕਰ ਸ਼ੁੱਧਤਾ ਘੱਟ ਹੈ ਪਰ ਰੀਕਾਲ ਜ਼ਿਆਦਾ ਹੈ, ਤਾਂ ਰੀ-ਰੈਂਕਿੰਗ ਜੋੜਨਾ ਇੱਕ ਚੰਗਾ ਕਦਮ ਹੈ।
ਜਨਰੇਸ਼ਨ ਮੈਟ੍ਰਿਕਸ
ਜਦੋਂ ਸਹੀ ਹਿੱਸਾ ਆਉਂਦਾ ਹੈ, ਅਸੀਂ ਮਾਡਲ ਦੁਆਰਾ ਪੈਦਾ ਕੀਤੇ ਜਵਾਬ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪਦੇ ਹਾਂ। ਤਿੰਨ ਬੁਨਿਆਦੀ ਮਾਪ:
- ਵਫ਼ਾਦਾਰੀ: ਕੀ ਜਵਾਬ ਵਿੱਚ ਹਰੇਕ ਦਾਅਵੇ ਦਾ ਸੰਦਰਭ ਦੁਆਰਾ ਸਮਰਥਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ? ਕੀ ਕੋਈ ਫਿਟਿੰਗ ਹੈ? ਇਹ ਭਰਮ ਦਾ ਸਿੱਧਾ ਮਾਪ ਹੈ।
- ਜਵਾਬ ਦੀ ਸਾਰਥਕਤਾ: ਕੀ ਜਵਾਬ ਅਸਲ ਵਿੱਚ ਸਵਾਲ ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ ਜਾਂ ਕੀ ਇਹ ਵਿਸ਼ਾ ਤੋਂ ਬਾਹਰ ਹੈ?
- ਸੰਪੂਰਨਤਾ: ਕੀ ਸੰਦਰਭ ਵਿੱਚ ਸਾਰੀ ਸੰਬੰਧਿਤ ਜਾਣਕਾਰੀ ਵਰਤੀ ਗਈ ਹੈ ਜਾਂ ਕੀ ਇਹ ਗੁੰਮ ਹੈ?
ਇਹਨਾਂ ਨੂੰ ਅਕਸਰ "ਸੱਚ/ਗਲਤ" ਵਾਂਗ ਬਾਈਨਰੀ ਦੀ ਬਜਾਏ ਇੱਕ ਗ੍ਰੇਡ ਦੇ ਆਧਾਰ 'ਤੇ ਅੰਕ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ (ਉਦਾਹਰਨ ਲਈ 1-5)।
ਸੁਝਾਅ: ਵਫ਼ਾਦਾਰੀ ਨੂੰ ਇੱਕ ਵੱਖਰੇ ਮੈਟ੍ਰਿਕ ਵਜੋਂ ਟ੍ਰੈਕ ਕਰੋ। ਜੇਕਰ ਵਫ਼ਾਦਾਰੀ ਘਟਦੀ ਹੈ ਕਿਉਂਕਿ ਸ਼ੁੱਧਤਾ ਘਟਦੀ ਹੈ, ਸਮੱਸਿਆ ਪੈਦਾ ਹੁੰਦੀ ਹੈ; ਜੇਕਰ ਵਫ਼ਾਦਾਰੀ ਉੱਚੀ ਹੈ ਪਰ ਜਵਾਬ ਗਲਤ ਹੈ, ਤਾਂ ਸਮੱਸਿਆ ਗਲਤ ਟੁਕੜਾ (ਮੁੜ ਪ੍ਰਾਪਤੀ) ਹੈ। ਇਕੱਠੇ, ਇਹ ਦੋ ਮੈਟ੍ਰਿਕਸ ਇੱਕ ਕੰਪਾਸ ਹਨ ਜੋ ਨੁਕਸ ਦਾ ਸਥਾਨ ਦਿਖਾਉਂਦਾ ਹੈ।
ਇੱਕ ਸੁਨਹਿਰੀ ਪ੍ਰਸ਼ਨ ਸੈੱਟ ਸਥਾਪਤ ਕਰਨਾ
ਹਰੇਕ ਮਾਪ ਲਈ ਇੱਕ ਸੁਨਹਿਰੀ ਸੈੱਟ / ਮੁਲਾਂਕਣ ਡੇਟਾਸੈਟ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ: ਯਥਾਰਥਵਾਦੀ ਸਵਾਲ + ਸੰਭਾਵਿਤ ਸਹੀ ਜਵਾਬ + ਸਹੀ ਸਰੋਤ ਟੁਕੜੇ। 30-50 ਚੰਗੀ ਤਰ੍ਹਾਂ ਚੁਣੇ ਗਏ ਸਵਾਲਾਂ ਨਾਲ ਸ਼ੁਰੂ ਕਰਨਾ 500 ਬੇਤਰਤੀਬ ਸਵਾਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਹੈ। ਸੈੱਟ ਵਿੱਚ ਹੇਠਾਂ ਦਿੱਤੇ ਨੂੰ ਸ਼ਾਮਲ ਕਰੋ: ਅਕਸਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਅਸਲ ਸਵਾਲ, ਜਾਣੇ-ਪਛਾਣੇ ਔਖੇ ਸਵਾਲ, ਬਿਨਾਂ ਜਵਾਬਾਂ ਦੇ ਫਸੇ ਸਵਾਲ (ਕਿਸੇ ਨੂੰ "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਕਹਿਣਾ ਚਾਹੀਦਾ ਹੈ), ਵਿਰੋਧੀ ਸਰੋਤਾਂ ਵਾਲੇ ਸਵਾਲ।
# ਗੋਲਡਨ ਕਲੱਸਟਰ ਉਦਾਹਰਨ (ਸੰਕਲਪਿਕ)[ {"ਸਵਾਲ": "ਕਿੰਨੇ ਦਿਨਾਂ ਦੀ ਸਾਲਾਨਾ ਛੁੱਟੀ?", "ਉਮੀਦ_ਜਵਾਬ": "ਸੀਨੀਆਰਤਾ ਦੇ 1-5 ਸਾਲਾਂ ਲਈ 14 ਦਿਨ", "ਸਹੀ_ਭਾਗ_ਆਈਡੀ": "ਦੋ-ਭਾਗ-3", "ਸ਼੍ਰੇਣੀ": "ਛੁੱਟੀ"}, {"ਸਵਾਲ": "ਕੰਪਨੀ ਦਾ ਦਫ਼ਤਰ ਕਿੱਥੇ ਹੈ?", IN_FORM ਦਾ ਦਫ਼ਤਰ, "IN_EXPRESS": "IN_FORM_OFFICE" # ਟਰੈਪ: ਮੈਨੂੰ "ਸਹੀ_ਭਾਗ_ਆਈਡੀ" ਨਹੀਂ ਪਤਾ: null, "ਸ਼੍ਰੇਣੀ": "ਜਾਲ"}]
ਜੱਜ ਵਜੋਂ ਐਲਐਲਐਮ: ਆਟੋਮੈਟਿਕ ਅਸੈਸਮੈਂਟ
ਹੱਥਾਂ ਨਾਲ ਸੈਂਕੜੇ ਜਵਾਬ ਸਕੋਰ ਕਰਨਾ ਥਕਾ ਦੇਣ ਵਾਲਾ ਹੈ। LLM-ਜੱਜ ਦਾ ਮਾਡਲ ਉਦੋਂ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਕੁਝ ਮਾਪਦੰਡਾਂ ਦੇ ਆਧਾਰ 'ਤੇ ਦੂਜੇ ਮਾਡਲ ਦੇ ਜਵਾਬ ਨੂੰ ਸਕੋਰ ਅਤੇ ਜਾਇਜ਼ ਠਹਿਰਾਉਂਦਾ ਹੈ। ਇੱਕ ਚੰਗਾ ਜੱਜ ਪ੍ਰੋਂਪਟ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਮਾਪਦੰਡਾਂ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦਾ ਹੈ, ਉਦਾਹਰਣਾਂ ਦਿੰਦਾ ਹੈ ਅਤੇ ਉਚਿਤਤਾ ਲਈ ਪੁੱਛਦਾ ਹੈ।
# LLM-ਜੱਜ-ਜੱਜ ਪ੍ਰੋਂਪਟ (ਸੰਕਲਪਿਕ) ਤੁਸੀਂ ਇੱਕ ਨਿਰਪੱਖ ਮੁਲਾਂਕਣਕਰਤਾ ਹੋ। ਦਿੱਤੇ ਗਏ CONTEXT ਅਤੇ ਉਮੀਦ ਕੀਤੇ ਜਵਾਬ ਦੇ ਅਨੁਸਾਰ ਹੇਠਾਂ ਦਿੱਤੇ ਜਵਾਬ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ। ਸਕੋਰ (1-5) ਅਤੇ ਜਾਇਜ਼ ਠਹਿਰਾਓ:- ਵਫ਼ਾਦਾਰੀ: ਕੀ ਜਵਾਬ ਵਿੱਚ ਹਰੇਕ ਦਾਅਵੇ ਦਾ ਸੰਦਰਭ ਵਿੱਚ ਸਮਰਥਨ ਕੀਤਾ ਗਿਆ ਹੈ?- ਸ਼ੁੱਧਤਾ: ਕੀ ਉੱਤਰ ਸੰਭਾਵਿਤ ਜਵਾਬ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ?- ਸੰਪੂਰਨਤਾ: ਕੀ ਸੰਬੰਧਿਤ ਜਾਣਕਾਰੀ ਪੂਰੀ ਹੈ? ਖਾਸ ਤੌਰ 'ਤੇ: ਜੇਕਰ ਜਵਾਬ ਵਿੱਚ ਜਾਣਕਾਰੀ ਸ਼ਾਮਲ ਹੈ ਜੋ ਸੰਦਰਭ ਵਿੱਚ ਨਹੀਂ ਹੈ, ਤਾਂ ਵਫ਼ਾਦਾਰੀ1 ਦਿਓ ਅਤੇ ਦੱਸੋ ਕਿ ਕਿਹੜਾ ਦਾਅਵਾ ਮਨਘੜਤ ਹੈ।
ਸਾਵਧਾਨ: ਜੱਜ ਵਜੋਂ ਐਲਐਲਐਮ ਸੰਪੂਰਨ ਨਹੀਂ ਹੈ; ਉਹਨਾਂ ਦੇ ਆਪਣੇ ਪੱਖਪਾਤ ਹੋ ਸਕਦੇ ਹਨ (ਲੰਬੇ ਜਵਾਬ, ਆਪਣੀ ਸ਼ੈਲੀ ਨੂੰ ਤਰਜੀਹ ਦਿੰਦੇ ਹੋਏ) ਜੱਜ ਦੀ ਵੀ ਪੁਸ਼ਟੀ ਕਰੋ: ਜੱਜ ਅਤੇ ਮਨੁੱਖ ਦੋਵਾਂ ਦੁਆਰਾ ਸਕੋਰ ਕੀਤੇ ਗਏ ਕੁਝ ਜਵਾਬ ਹਨ ਅਤੇ ਉਹਨਾਂ ਵਿਚਕਾਰ ਸਮਝੌਤੇ ਨੂੰ ਮਾਪੋ। ਜੇ ਜੱਜ ਮਨੁੱਖੀ ਸਕੋਰਾਂ ਨਾਲ ਇਕਸਾਰ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਉਸ 'ਤੇ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹੋ।
ਕਮਜ਼ੋਰ/ਮਜ਼ਬੂਤ ਰੇਟਿੰਗ
ਕਮਜ਼ੋਰ ("ਇਹ ਮੇਰੇ ਲਈ ਚੰਗਾ ਸੀ"):
ਮੈਂ ਕੁਝ ਸਵਾਲ ਪੁੱਛੇ ਅਤੇ ਜਵਾਬ ਚੰਗੇ ਲੱਗੇ। ਮੈਨੂੰ ਇਹ ਲਾਈਵ ਮਿਲ ਗਿਆ ਹੈ। # ਸਮੱਸਿਆ: ਕੋਈ ਮਾਪ ਨਹੀਂ, ਰੀਗਰੈਸ਼ਨ ਅਪ੍ਰਤੱਖ, ਸੁਧਾਰ ਅੰਨ੍ਹਾ।
ਸ਼ਕਤੀਸ਼ਾਲੀ (ਗੋਲਡ ਕਲੱਸਟਰ + ਡਿਸਕ੍ਰਿਟ ਮੈਟ੍ਰਿਕਸ + ਆਟੋਮੈਟਿਕ ਜਜਮੈਂਟ + ਰਿਗਰੈਸ਼ਨ):
40 ਸਵਾਲਾਂ ਦਾ ਗੋਲਡਨ ਕਲੱਸਟਰ। ਹਰੇਕ ਤਬਦੀਲੀ ਦੇ ਨਾਲ, recall@5, ਵਫ਼ਾਦਾਰੀ ਅਤੇ ਸ਼ੁੱਧਤਾ ਆਪਣੇ ਆਪ ਹੀ ਮਾਪੀ ਜਾਂਦੀ ਹੈ। ਜੇਕਰ ਸਕੋਰ ਘੱਟ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਬਦਲਾਅ ਵਾਪਸ ਲਿਆ ਜਾਂਦਾ ਹੈ। ਉਤਪਾਦਨ ਵਿੱਚ, ਉਪਭੋਗਤਾ ਫੀਡਬੈਕ ਇਕੱਠਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਸੈੱਟ ਵਿੱਚ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ।
ਉਤਪਾਦਨ ਵਿੱਚ ਨਿਗਰਾਨੀ ਅਤੇ ਰਿਗਰੈਸ਼ਨ
ਮੁਲਾਂਕਣ ਇੱਕ ਵਾਰ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ ਅਤੇ ਪੂਰਾ ਹੋ ਜਾਂਦਾ ਹੈ। ਤਿੰਨ ਨਿਰੰਤਰ ਅਭਿਆਸ:
- ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ: ਹਰ ਪ੍ਰੋਂਪਟ/ਮੁੜ ਪ੍ਰਾਪਤੀ/ਮਾਡਲ ਤਬਦੀਲੀ 'ਤੇ ਆਟੋ-ਰਨ ਗੋਲਡਨ ਕਲੱਸਟਰ। ਜੇਕਰ ਸਕੋਰ ਘਟਾਇਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਤਬਦੀਲੀ ਉਲਟ ਹੋ ਜਾਂਦੀ ਹੈ। ਇਹ "ਇਸ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ ਹੋਏ ਇਸ ਨੂੰ ਤੋੜਨ" ਤੋਂ ਰੋਕਦਾ ਹੈ।
- ਉਤਪਾਦਨ ਨਿਗਰਾਨੀ: ਅਸਲ ਪ੍ਰਸ਼ਨਾਂ ਵਿੱਚ "ਮੈਨੂੰ ਜਾਣਕਾਰੀ ਨਹੀਂ ਮਿਲ ਸਕੀ" ਦਰ, ਔਸਤ ਦੇਰੀ, ਲਾਗਤ, ਉਪਭੋਗਤਾ ਫੀਡਬੈਕ (👍/👎) ਦੀ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਵਿੱਚ ਅਚਾਨਕ ਵਾਧਾ ਅਕਸਰ ਇੱਕ ਸੂਚਕਾਂਕ ਜਾਂ ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਖਰਾਬੀ ਦਾ ਪਹਿਲਾ ਸੰਕੇਤ ਹੁੰਦਾ ਹੈ।
- ਫੀਡਬੈਕ ਲੂਪ: ਉਪਭੋਗਤਾ 👎 ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤੇ ਗਏ ਅਸਲ ਸਵਾਲਾਂ ਦੀ ਸਮੀਖਿਆ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਸੁਨਹਿਰੀ ਢੇਰ ਵਿੱਚ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ; ਇਸ ਤਰ੍ਹਾਂ, ਸੈੱਟ ਸਮੇਂ ਦੇ ਨਾਲ ਅਮੀਰ ਹੋ ਜਾਂਦਾ ਹੈ ਅਤੇ ਸਿਸਟਮ ਦੇ ਅੰਨ੍ਹੇ ਚਟਾਕ ਬੰਦ ਹੋ ਜਾਂਦੇ ਹਨ.
ਤਿੰਨ ਮਿੰਨੀ ਕੇਸ
ਕੇਸ 1 - ਚੁੱਪ ਰਿਗਰੈਸ਼ਨ। ਇੱਕ ਟੀਮ ਨੇ ਇਸਨੂੰ "ਸੁਧਾਰ" ਕਰਨ ਲਈ ਪ੍ਰੋਂਪਟ ਨੂੰ ਸੋਧਿਆ; ਆਮ ਸ਼ੁੱਧਤਾ ਵਧੀ, ਪਰ ਜਾਲ ਦੇ ਸਵਾਲਾਂ ਵਿੱਚ ਵਫ਼ਾਦਾਰੀ 30% ਘਟ ਗਈ (ਮਾਡਲ ਹੋਰ ਫਿੱਟ ਹੋਣ ਲੱਗਾ)। ਇਹ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਵਿੱਚ ਫਸਾਉਣ ਵਾਲੇ ਸਵਾਲਾਂ ਲਈ ਨਾ ਹੁੰਦੇ ਤਾਂ ਇਹ ਧਿਆਨ ਨਹੀਂ ਦਿੱਤਾ ਜਾਂਦਾ; ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ ਨੇ ਤਬਦੀਲੀ ਨੂੰ ਵਾਪਸ ਕਰ ਦਿੱਤਾ।
ਕੇਸ 2 - ਗਲਤ ਲੱਤ ਨੂੰ ਸਿੱਧਾ ਕਰਨਾ। ਇੱਕ ਸਹਾਇਕ ਵਿੱਚ ਜਵਾਬ ਮਾੜੇ ਸਨ; ਟੀਮ ਨੇ ਹਫ਼ਤਿਆਂ ਤੱਕ ਪ੍ਰੋਂਪਟ 'ਤੇ ਕੰਮ ਕੀਤਾ। ਜਦੋਂ ਅਸੀਂ ਮੁੜ ਪ੍ਰਾਪਤੀ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਮਾਪਿਆ, ਤਾਂ ਰੀਕਾਲ@5 ਸਿਰਫ 48% ਸੀ — ਸਮੱਸਿਆ ਪੁਨਰ ਪ੍ਰਾਪਤੀ ਵਿੱਚ ਸੀ, ਪੀੜ੍ਹੀ ਵਿੱਚ ਨਹੀਂ। ਜਦੋਂ ਹਾਈਬ੍ਰਿਡ + ਰੀ-ਰੈਂਕਿੰਗ ਨੂੰ ਜੋੜਿਆ ਗਿਆ, ਤਾਂ ਰੀਕਾਲ 89% ਤੱਕ ਵਧ ਗਿਆ ਅਤੇ ਸ਼ੁੱਧਤਾ ਵੀ ਵਧ ਗਈ।
ਕੇਸ 3 — ਉਤਪਾਦਨ ਚੇਤਾਵਨੀ। ਇੱਕ ਦਿਨ, ਇੱਕ ਸਹਾਇਕ ਸਹਾਇਕ ਲਈ "ਮੈਂ ਜਾਣਕਾਰੀ ਨਹੀਂ ਲੱਭ ਸਕਿਆ" ਦਰ 6% ਤੋਂ 34% ਹੋ ਗਈ। ਟ੍ਰੈਕਪੈਡ ਨੇ ਚੇਤਾਵਨੀ ਦਿੱਤੀ; ਕਾਰਨ ਇਹ ਸੀ ਕਿ ਇੰਡੈਕਸਿੰਗ ਨੌਕਰੀ, ਜੋ ਰਾਤ ਨੂੰ ਚਲਦੀ ਹੈ, ਚੁੱਪਚਾਪ ਅਸਫਲ ਹੋ ਗਈ ਅਤੇ ਨਵੇਂ ਲੇਖ ਅਪਲੋਡ ਨਹੀਂ ਕੀਤੇ ਗਏ ਸਨ. ਨਿਗਰਾਨੀ ਦੇ ਬਿਨਾਂ, ਗਲਤ "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਬਿਆਨ ਦਿਨਾਂ ਲਈ ਜਾਰੀ ਰਹਿਣਗੇ।
ਆਮ ਗਲਤੀਆਂ
- "ਇਸਨੇ ਮੇਰੇ ਲਈ ਵਧੀਆ ਕੰਮ ਕੀਤਾ" ਨਾਲ ਸੰਤੁਸ਼ਟ ਹੋਣਾ: ਮਾਪ ਤੋਂ ਬਿਨਾਂ, ਰੀਗਰੈਸ਼ਨ ਦਾ ਧਿਆਨ ਨਹੀਂ ਜਾਂਦਾ।
- ਪ੍ਰਾਪਤੀ ਅਤੇ ਪੀੜ੍ਹੀ ਨੂੰ ਵੱਖਰਾ ਨਹੀਂ ਕਰਨਾ: ਤੁਸੀਂ ਗਲਤ ਲੱਤ ਨੂੰ ਠੀਕ ਕਰੋਗੇ ਅਤੇ ਸਮਾਂ ਬਰਬਾਦ ਕਰੋਗੇ।
- ਜਾਲ ਦੇ ਸਵਾਲ ਨਾ ਪੁੱਛਣਾ: ਚੀਜ਼ਾਂ ਨੂੰ ਬਣਾਉਣ ਦੀ ਪ੍ਰਵਿਰਤੀ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਵਿੱਚ ਦਿਖਾਈ ਨਹੀਂ ਦਿੰਦੀ।
- ਜੱਜ ਦੀ ਤਸਦੀਕ ਨਾ ਕਰਨਾ: ਇੱਕ ਪੱਖਪਾਤੀ ਜਿਊਰੀ ਝੂਠਾ ਭਰੋਸਾ ਦਿੰਦੀ ਹੈ।
- ਉਤਪਾਦਨ ਦੀ ਨਿਗਰਾਨੀ ਨਹੀਂ: ਸੂਚਕਾਂਕ ਅਸਫਲਤਾ, ਲਾਗਤ ਵਿਸਫੋਟ ਚੁੱਪਚਾਪ ਜਾਰੀ ਹੈ.
ਸੰਖੇਪ ਵਿੱਚ
- RAG ਵਿੱਚ, ਪ੍ਰਾਪਤੀ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ; ਪਹਿਲਾਂ ਇਹ ਨਿਰਧਾਰਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਕਿਹੜੀ ਲੱਤ ਨੂੰ ਨੁਕਸਾਨ ਹੋਇਆ ਹੈ।
- recall@k, precision@k, ਮੁੜ ਪ੍ਰਾਪਤੀ ਲਈ MRR; ਵਫ਼ਾਦਾਰੀ, ਅਨੁਕੂਲਤਾ, ਸੰਪੂਰਨਤਾ ਪੀੜ੍ਹੀ ਲਈ ਵਰਤੀ ਜਾਂਦੀ ਹੈ.
- ਹਰੇਕ ਮਾਪ ਲਈ ਸੋਨੇ ਦੇ ਕਲੱਸਟਰ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਇਸ ਵਿੱਚ ਅਸਲੀ, ਔਖੇ, ਜਾਲ ਅਤੇ ਵਿਰੋਧੀ ਸਵਾਲਾਂ ਨੂੰ ਪਾਓ।
- LLM-ਬਤੌਰ ਜੱਜ ਵੱਡੇ ਸੈੱਟ ਆਟੋ-ਸਕੋਰ; ਪਰ ਜੱਜ ਨੂੰ ਆਪਣੇ ਆਪ ਨੂੰ ਮਨੁੱਖ ਦੇ ਵਿਰੁੱਧ ਧਰਮੀ ਠਹਿਰਾਉਣਾ ਚਾਹੀਦਾ ਹੈ।
- ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ, ਉਤਪਾਦਨ ਦੀ ਨਿਗਰਾਨੀ, ਅਤੇ ਇੱਕ ਫੀਡਬੈਕ ਲੂਪ ਸਮੇਂ ਦੇ ਨਾਲ ਗੁਣਵੱਤਾ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
(1) ਆਪਣੇ ਖੁਦ ਦੇ ਸਹਾਇਕ ਲਈ ਘੱਟੋ-ਘੱਟ 15 ਸਵਾਲਾਂ ਦਾ ਸੁਨਹਿਰੀ ਸੈੱਟ ਬਣਾਓ: ਘੱਟੋ-ਘੱਟ 3 ਟਰੈਪ (ਕੋਈ ਜਵਾਬ ਨਹੀਂ), 3 ਔਖੇ, 2 ਵਿਰੋਧੀ ਸਰੋਤ ਸਵਾਲ ਸ਼ਾਮਲ ਕਰੋ। ਹਰੇਕ ਸਵਾਲ ਲਈ ਸੰਭਾਵਿਤ ਜਵਾਬ ਅਤੇ ਸਹੀ ਭਾਗ ਲਿਖੋ। (2) ਇਸ ਸੈੱਟ ਦੇ ਨਾਲ ਦੋ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਂਪਟ ਸੰਸਕਰਣਾਂ ਦੀ ਦਸਤੀ ਤੁਲਨਾ ਕਰੋ; ਵਫ਼ਾਦਾਰੀ ਅਤੇ ਸ਼ੁੱਧਤਾ ਲਈ ਹਰੇਕ ਜਵਾਬ ਨੂੰ 1-5 ਅੰਕ ਦਿਓ। (3) ਆਪਣੇ ਖੁਦ ਦੇ ਮਾਪਦੰਡਾਂ ਲਈ ਉਪਰੋਕਤ LLM-ਜੱਜ-ਜੱਜ ਪ੍ਰੋਂਪਟ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਓ। (4) 3 ਮੈਟ੍ਰਿਕਸ ਦੀ ਪਛਾਣ ਕਰੋ ਜੋ ਤੁਸੀਂ ਉਤਪਾਦਨ ਵਿੱਚ ਟਰੈਕ ਕਰੋਗੇ ਅਤੇ ਹਰੇਕ ਲਈ ਪੁੱਛੋ ਕਿ "ਮੈਂ ਕਿਸ ਥ੍ਰੈਸ਼ਹੋਲਡ 'ਤੇ ਅਲਾਰਮ ਕਰਦਾ ਹਾਂ?" ਮੁੱਲ ਲਿਖੋ.
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਵੱਖਰੇ ਮੈਟ੍ਰਿਕਸ ਨਾਲ ਧਾਰਨ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪ ਸਕਦਾ ਹਾਂ।
- [ ] ਮੈਨੂੰ ਪਤਾ ਹੈ ਕਿ recall@k, ਵਫ਼ਾਦਾਰੀ ਦਾ ਕੀ ਅਰਥ ਹੈ।
- [ ] ਮੈਂ ਇੱਕ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਬਣਾ ਸਕਦਾ ਹਾਂ ਜਿਸ ਵਿੱਚ ਅਸਲ, ਮੁਸ਼ਕਲ, ਜਾਲ ਅਤੇ ਵਿਰੋਧੀ ਸਵਾਲ ਸ਼ਾਮਲ ਹਨ।
- [ ] ਮੈਂ ਸਵੈਚਲਿਤ ਮੁਲਾਂਕਣ ਸਥਾਪਤ ਕਰ ਸਕਦਾ/ਸਕਦੀ ਹਾਂ ਅਤੇ ਜੱਜ ਨੂੰ LLM-ਜੱਜ-ਜੱਜ ਨਾਲ ਪ੍ਰਮਾਣਿਤ ਕਰ ਸਕਦਾ/ਸਕਦੀ ਹਾਂ।
- [] ਮੈਂ ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ, ਉਤਪਾਦਨ ਨਿਗਰਾਨੀ ਅਤੇ ਫੀਡਬੈਕ ਲੂਪ ਚਲਾ ਸਕਦਾ ਹਾਂ।