ਯੂਨਿਟ 8 / 11

RAG ਮੁਲਾਂਕਣ ਅਤੇ ਨਿਗਰਾਨੀ

ਲਾਭ:

  • ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਨਾ ਜੋ ਧਾਰਨ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਮਾਪਦੇ ਹਨ
  • ਇੱਕ ਸੁਨਹਿਰੀ ਪ੍ਰਸ਼ਨ ਸੈੱਟ ਸੈੱਟ ਕਰੋ ਅਤੇ LLM-ਜੱਜ-ਜੱਜ ਦੇ ਨਾਲ ਆਟੋਮੈਟਿਕ ਮੁਲਾਂਕਣ ਚਲਾਓ
  • ਉਤਪਾਦਨ ਵਿੱਚ ਫੀਡਬੈਕ, ਨਿਗਰਾਨੀ ਅਤੇ ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ ਦੁਆਰਾ ਗੁਣਵੱਤਾ ਨੂੰ ਬਣਾਈ ਰੱਖਣਾ

ਵਾਕ "ਮੈਂ ਸਹਾਇਕ ਸਥਾਪਿਤ ਕੀਤਾ ਹੈ, ਇਹ ਵਧੀਆ ਕੰਮ ਕਰਦਾ ਜਾਪਦਾ ਹੈ" ਕੋਈ ਇੰਜੀਨੀਅਰਿੰਗ ਬਿਆਨ ਨਹੀਂ ਹੈ। RAG ਸਿਸਟਮ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦੇ ਹਨ: ਇੱਕ ਨਵੀਂ ਦਸਤਾਵੇਜ਼ ਕਿਸਮ ਪੁਨਰ ਪ੍ਰਾਪਤੀ ਨੂੰ ਮੂਰਖ ਬਣਾ ਦਿੰਦੀ ਹੈ, ਇੱਕ ਤੁਰੰਤ ਤਬਦੀਲੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਸੂਚਕਾਂਕ ਪੁਰਾਣਾ ਹੋ ਜਾਂਦਾ ਹੈ। ਇਸ ਨੂੰ ਸਮਝਣ ਦਾ ਇੱਕੋ ਇੱਕ ਤਰੀਕਾ ਮਾਪਣਾ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਕਵਰ ਕਰਦੇ ਹਾਂ ਕਿ ਕਿਵੇਂ ਆਰਏਜੀ ਗੁਣਵੱਤਾ (ਮੁੜ ਪ੍ਰਾਪਤੀ ਅਤੇ ਪੀੜ੍ਹੀ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ), ਆਟੋਮੈਟਿਕ ਮੁਲਾਂਕਣ (ਐਲਐਲਐਮ-ਜੱਜ) ਅਤੇ ਉਤਪਾਦਨ ਵਿੱਚ ਗੁਣਵੱਤਾ (ਨਿਗਰਾਨੀ, ਰਿਗਰੈਸ਼ਨ) ਨੂੰ ਕਿਵੇਂ ਮਾਪਣਾ ਹੈ। "ਤੁਸੀਂ ਉਸ ਨੂੰ ਸੁਧਾਰ ਨਹੀਂ ਸਕਦੇ ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਮਾਪਦੇ ਨਹੀਂ ਹੋ" ਇਸ ਯੂਨਿਟ ਦਾ ਆਦਰਸ਼ ਹੈ।

ਦੋ ਵੱਖਰੀਆਂ ਚੀਜ਼ਾਂ ਨੂੰ ਮਾਪੋ

RAG ਦੀਆਂ ਦੋ ਲੱਤਾਂ ਹਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਮਾਪਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿਉਂਕਿ ਸਮੱਸਿਆ ਦੋਵਾਂ ਵਿੱਚੋਂ ਕਿਸੇ ਇੱਕ ਵਿੱਚ ਹੋ ਸਕਦੀ ਹੈ:

  1. ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਗੁਣਵੱਤਾ: ਕੀ ਸਹੀ ਹਿੱਸਾ ਆਇਆ ਸੀ?
  2. ਜਨਰੇਸ਼ਨ ਕੁਆਲਿਟੀ: ਕੀ ਆਉਣ ਵਾਲੇ ਹਿੱਸੇ ਤੋਂ ਸਹੀ ਜਵਾਬ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਸੀ?

ਜੇ ਜਵਾਬ ਬੁਰਾ ਹੈ, ਤਾਂ ਤੁਹਾਨੂੰ ਪਹਿਲਾਂ ਇਹ ਜਾਣਨ ਦੀ ਜ਼ਰੂਰਤ ਹੈ ਕਿ ਕਿਹੜੀ ਲੱਤ ਖਰਾਬ ਹੈ। ਜੇਕਰ ਸਹੀ ਹਿੱਸਾ ਕਦੇ ਨਹੀਂ ਆਉਂਦਾ, ਤਾਂ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰੋਂਪਟ ਵੀ ਬਚਾ ਨਹੀਂ ਸਕਦਾ (ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਸਮੱਸਿਆ)। ਜੇਕਰ ਸਹੀ ਹਿੱਸਾ ਆਇਆ ਹੈ ਪਰ ਮਾਡਲ ਨੇ ਇਸ ਨੂੰ ਗਲਤ ਪੜ੍ਹਿਆ ਹੈ, ਤਾਂ ਪ੍ਰਾਪਤੀ ਨੂੰ ਸੁਧਾਰਨਾ ਵਿਅਰਥ ਹੈ (ਪੀੜ੍ਹੀ ਦੀ ਸਮੱਸਿਆ)।

ਮੁੜ ਪ੍ਰਾਪਤੀ ਮੈਟ੍ਰਿਕਸ

ਮੁੜ ਪ੍ਰਾਪਤੀ ਇੱਕ ਛਾਂਟੀ/ਪਹੁੰਚ ਸਮੱਸਿਆ ਹੈ; ਕਲਾਸੀਕਲ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤੀ ਮੈਟ੍ਰਿਕਸ ਦੁਆਰਾ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ। ਇਸਦੇ ਲਈ ਤੁਹਾਡੇ ਕੋਲ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ: ਹਰੇਕ ਪ੍ਰਸ਼ਨ ਲਈ ਕਿਸ ਟੁਕੜੇ ਦਾ ਗਿਆਨ "ਸਹੀ" ਹੈ।

ਮੈਟ੍ਰਿਕ

ਕੀ ਉਪਾਅ

ਸਧਾਰਨ ਪਰਿਭਾਸ਼ਾ

Recall@k

ਕੀ ਸਿਖਰ k ਵਿੱਚ ਸਹੀ ਟੁਕੜਾ ਹੈ?

ਸਹੀ ਪਾਰਟ ਕੈਪਚਰ ਰੇਟ

precision@k

ਵਾਪਸ ਕੀਤੇ k ਟੁਕੜਿਆਂ ਵਿੱਚੋਂ ਕਿੰਨੇ ਢੁਕਵੇਂ ਹਨ?

ਕੀ ਲਿਆਇਆ ਗਿਆ ਹੈ ਦੀ ਸਫਾਈ

MRR (ਔਸਤ ਪਰਸਪਰ ਰੈਂਕ)

ਕਿਸ ਕ੍ਰਮ ਵਿੱਚ ਸਹੀ ਟੁਕੜਾ ਹੈ?

ਇਨਾਮ ਚੋਟੀ ਦੇ ਰੈਂਕ ਵਿੱਚ ਹਨ

ਹਿੱਟ ਰੇਟ

ਕੀ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਸਹੀ ਟੁਕੜਾ ਆਇਆ?

ਸਫਲਤਾ ਦਾ ਸਭ ਤੋਂ ਬੁਨਿਆਦੀ ਮਾਪ

ਵਿਹਾਰਕ ਟਿੱਪਣੀ: ਜੇਕਰ Recall@k ਘੱਟ ਹੈ, ਤਾਂ ਚੰਕਿੰਗ ਜਾਂ ਖੋਜ ਰਣਨੀਤੀ (ਹਾਈਬ੍ਰਿਡ, ਕੇ, ਰੀ-ਰੈਂਕਿੰਗ) ਨੂੰ ਦੁਬਾਰਾ ਕੰਮ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਜੇਕਰ ਸ਼ੁੱਧਤਾ ਘੱਟ ਹੈ ਪਰ ਰੀਕਾਲ ਜ਼ਿਆਦਾ ਹੈ, ਤਾਂ ਰੀ-ਰੈਂਕਿੰਗ ਜੋੜਨਾ ਇੱਕ ਚੰਗਾ ਕਦਮ ਹੈ।

ਜਨਰੇਸ਼ਨ ਮੈਟ੍ਰਿਕਸ

ਜਦੋਂ ਸਹੀ ਹਿੱਸਾ ਆਉਂਦਾ ਹੈ, ਅਸੀਂ ਮਾਡਲ ਦੁਆਰਾ ਪੈਦਾ ਕੀਤੇ ਜਵਾਬ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪਦੇ ਹਾਂ। ਤਿੰਨ ਬੁਨਿਆਦੀ ਮਾਪ:

  • ਵਫ਼ਾਦਾਰੀ: ਕੀ ਜਵਾਬ ਵਿੱਚ ਹਰੇਕ ਦਾਅਵੇ ਦਾ ਸੰਦਰਭ ਦੁਆਰਾ ਸਮਰਥਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ? ਕੀ ਕੋਈ ਫਿਟਿੰਗ ਹੈ? ਇਹ ਭਰਮ ਦਾ ਸਿੱਧਾ ਮਾਪ ਹੈ।
  • ਜਵਾਬ ਦੀ ਸਾਰਥਕਤਾ: ਕੀ ਜਵਾਬ ਅਸਲ ਵਿੱਚ ਸਵਾਲ ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ ਜਾਂ ਕੀ ਇਹ ਵਿਸ਼ਾ ਤੋਂ ਬਾਹਰ ਹੈ?
  • ਸੰਪੂਰਨਤਾ: ਕੀ ਸੰਦਰਭ ਵਿੱਚ ਸਾਰੀ ਸੰਬੰਧਿਤ ਜਾਣਕਾਰੀ ਵਰਤੀ ਗਈ ਹੈ ਜਾਂ ਕੀ ਇਹ ਗੁੰਮ ਹੈ?

ਇਹਨਾਂ ਨੂੰ ਅਕਸਰ "ਸੱਚ/ਗਲਤ" ਵਾਂਗ ਬਾਈਨਰੀ ਦੀ ਬਜਾਏ ਇੱਕ ਗ੍ਰੇਡ ਦੇ ਆਧਾਰ 'ਤੇ ਅੰਕ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ (ਉਦਾਹਰਨ ਲਈ 1-5)।

ਸੁਝਾਅ: ਵਫ਼ਾਦਾਰੀ ਨੂੰ ਇੱਕ ਵੱਖਰੇ ਮੈਟ੍ਰਿਕ ਵਜੋਂ ਟ੍ਰੈਕ ਕਰੋ। ਜੇਕਰ ਵਫ਼ਾਦਾਰੀ ਘਟਦੀ ਹੈ ਕਿਉਂਕਿ ਸ਼ੁੱਧਤਾ ਘਟਦੀ ਹੈ, ਸਮੱਸਿਆ ਪੈਦਾ ਹੁੰਦੀ ਹੈ; ਜੇਕਰ ਵਫ਼ਾਦਾਰੀ ਉੱਚੀ ਹੈ ਪਰ ਜਵਾਬ ਗਲਤ ਹੈ, ਤਾਂ ਸਮੱਸਿਆ ਗਲਤ ਟੁਕੜਾ (ਮੁੜ ਪ੍ਰਾਪਤੀ) ਹੈ। ਇਕੱਠੇ, ਇਹ ਦੋ ਮੈਟ੍ਰਿਕਸ ਇੱਕ ਕੰਪਾਸ ਹਨ ਜੋ ਨੁਕਸ ਦਾ ਸਥਾਨ ਦਿਖਾਉਂਦਾ ਹੈ।

ਇੱਕ ਸੁਨਹਿਰੀ ਪ੍ਰਸ਼ਨ ਸੈੱਟ ਸਥਾਪਤ ਕਰਨਾ

ਹਰੇਕ ਮਾਪ ਲਈ ਇੱਕ ਸੁਨਹਿਰੀ ਸੈੱਟ / ਮੁਲਾਂਕਣ ਡੇਟਾਸੈਟ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ: ਯਥਾਰਥਵਾਦੀ ਸਵਾਲ + ਸੰਭਾਵਿਤ ਸਹੀ ਜਵਾਬ + ਸਹੀ ਸਰੋਤ ਟੁਕੜੇ। 30-50 ਚੰਗੀ ਤਰ੍ਹਾਂ ਚੁਣੇ ਗਏ ਸਵਾਲਾਂ ਨਾਲ ਸ਼ੁਰੂ ਕਰਨਾ 500 ਬੇਤਰਤੀਬ ਸਵਾਲਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਹੈ। ਸੈੱਟ ਵਿੱਚ ਹੇਠਾਂ ਦਿੱਤੇ ਨੂੰ ਸ਼ਾਮਲ ਕਰੋ: ਅਕਸਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਅਸਲ ਸਵਾਲ, ਜਾਣੇ-ਪਛਾਣੇ ਔਖੇ ਸਵਾਲ, ਬਿਨਾਂ ਜਵਾਬਾਂ ਦੇ ਫਸੇ ਸਵਾਲ (ਕਿਸੇ ਨੂੰ "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਕਹਿਣਾ ਚਾਹੀਦਾ ਹੈ), ਵਿਰੋਧੀ ਸਰੋਤਾਂ ਵਾਲੇ ਸਵਾਲ।

# ਗੋਲਡਨ ਕਲੱਸਟਰ ਉਦਾਹਰਨ (ਸੰਕਲਪਿਕ)[ {"ਸਵਾਲ": "ਕਿੰਨੇ ਦਿਨਾਂ ਦੀ ਸਾਲਾਨਾ ਛੁੱਟੀ?", "ਉਮੀਦ_ਜਵਾਬ": "ਸੀਨੀਆਰਤਾ ਦੇ 1-5 ਸਾਲਾਂ ਲਈ 14 ਦਿਨ", "ਸਹੀ_ਭਾਗ_ਆਈਡੀ": "ਦੋ-ਭਾਗ-3", "ਸ਼੍ਰੇਣੀ": "ਛੁੱਟੀ"}, {"ਸਵਾਲ": "ਕੰਪਨੀ ਦਾ ਦਫ਼ਤਰ ਕਿੱਥੇ ਹੈ?", IN_FORM ਦਾ ਦਫ਼ਤਰ, "IN_EXPRESS": "IN_FORM_OFFICE" # ਟਰੈਪ: ਮੈਨੂੰ "ਸਹੀ_ਭਾਗ_ਆਈਡੀ" ਨਹੀਂ ਪਤਾ: null, "ਸ਼੍ਰੇਣੀ": "ਜਾਲ"}]

ਜੱਜ ਵਜੋਂ ਐਲਐਲਐਮ: ਆਟੋਮੈਟਿਕ ਅਸੈਸਮੈਂਟ

ਹੱਥਾਂ ਨਾਲ ਸੈਂਕੜੇ ਜਵਾਬ ਸਕੋਰ ਕਰਨਾ ਥਕਾ ਦੇਣ ਵਾਲਾ ਹੈ। LLM-ਜੱਜ ਦਾ ਮਾਡਲ ਉਦੋਂ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਕੁਝ ਮਾਪਦੰਡਾਂ ਦੇ ਆਧਾਰ 'ਤੇ ਦੂਜੇ ਮਾਡਲ ਦੇ ਜਵਾਬ ਨੂੰ ਸਕੋਰ ਅਤੇ ਜਾਇਜ਼ ਠਹਿਰਾਉਂਦਾ ਹੈ। ਇੱਕ ਚੰਗਾ ਜੱਜ ਪ੍ਰੋਂਪਟ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਮਾਪਦੰਡਾਂ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦਾ ਹੈ, ਉਦਾਹਰਣਾਂ ਦਿੰਦਾ ਹੈ ਅਤੇ ਉਚਿਤਤਾ ਲਈ ਪੁੱਛਦਾ ਹੈ।

# LLM-ਜੱਜ-ਜੱਜ ਪ੍ਰੋਂਪਟ (ਸੰਕਲਪਿਕ) ਤੁਸੀਂ ਇੱਕ ਨਿਰਪੱਖ ਮੁਲਾਂਕਣਕਰਤਾ ਹੋ। ਦਿੱਤੇ ਗਏ CONTEXT ਅਤੇ ਉਮੀਦ ਕੀਤੇ ਜਵਾਬ ਦੇ ਅਨੁਸਾਰ ਹੇਠਾਂ ਦਿੱਤੇ ਜਵਾਬ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ। ਸਕੋਰ (1-5) ਅਤੇ ਜਾਇਜ਼ ਠਹਿਰਾਓ:- ਵਫ਼ਾਦਾਰੀ: ਕੀ ਜਵਾਬ ਵਿੱਚ ਹਰੇਕ ਦਾਅਵੇ ਦਾ ਸੰਦਰਭ ਵਿੱਚ ਸਮਰਥਨ ਕੀਤਾ ਗਿਆ ਹੈ?- ਸ਼ੁੱਧਤਾ: ਕੀ ਉੱਤਰ ਸੰਭਾਵਿਤ ਜਵਾਬ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ?- ਸੰਪੂਰਨਤਾ: ਕੀ ਸੰਬੰਧਿਤ ਜਾਣਕਾਰੀ ਪੂਰੀ ਹੈ? ਖਾਸ ਤੌਰ 'ਤੇ: ਜੇਕਰ ਜਵਾਬ ਵਿੱਚ ਜਾਣਕਾਰੀ ਸ਼ਾਮਲ ਹੈ ਜੋ ਸੰਦਰਭ ਵਿੱਚ ਨਹੀਂ ਹੈ, ਤਾਂ ਵਫ਼ਾਦਾਰੀ1 ਦਿਓ ਅਤੇ ਦੱਸੋ ਕਿ ਕਿਹੜਾ ਦਾਅਵਾ ਮਨਘੜਤ ਹੈ।

ਸਾਵਧਾਨ: ਜੱਜ ਵਜੋਂ ਐਲਐਲਐਮ ਸੰਪੂਰਨ ਨਹੀਂ ਹੈ; ਉਹਨਾਂ ਦੇ ਆਪਣੇ ਪੱਖਪਾਤ ਹੋ ਸਕਦੇ ਹਨ (ਲੰਬੇ ਜਵਾਬ, ਆਪਣੀ ਸ਼ੈਲੀ ਨੂੰ ਤਰਜੀਹ ਦਿੰਦੇ ਹੋਏ) ਜੱਜ ਦੀ ਵੀ ਪੁਸ਼ਟੀ ਕਰੋ: ਜੱਜ ਅਤੇ ਮਨੁੱਖ ਦੋਵਾਂ ਦੁਆਰਾ ਸਕੋਰ ਕੀਤੇ ਗਏ ਕੁਝ ਜਵਾਬ ਹਨ ਅਤੇ ਉਹਨਾਂ ਵਿਚਕਾਰ ਸਮਝੌਤੇ ਨੂੰ ਮਾਪੋ। ਜੇ ਜੱਜ ਮਨੁੱਖੀ ਸਕੋਰਾਂ ਨਾਲ ਇਕਸਾਰ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਉਸ 'ਤੇ ਭਰੋਸਾ ਕਰ ਸਕਦੇ ਹੋ।

ਕਮਜ਼ੋਰ/ਮਜ਼ਬੂਤ ਰੇਟਿੰਗ

ਕਮਜ਼ੋਰ ("ਇਹ ਮੇਰੇ ਲਈ ਚੰਗਾ ਸੀ"):

ਮੈਂ ਕੁਝ ਸਵਾਲ ਪੁੱਛੇ ਅਤੇ ਜਵਾਬ ਚੰਗੇ ਲੱਗੇ। ਮੈਨੂੰ ਇਹ ਲਾਈਵ ਮਿਲ ਗਿਆ ਹੈ। # ਸਮੱਸਿਆ: ਕੋਈ ਮਾਪ ਨਹੀਂ, ਰੀਗਰੈਸ਼ਨ ਅਪ੍ਰਤੱਖ, ਸੁਧਾਰ ਅੰਨ੍ਹਾ।

ਸ਼ਕਤੀਸ਼ਾਲੀ (ਗੋਲਡ ਕਲੱਸਟਰ + ਡਿਸਕ੍ਰਿਟ ਮੈਟ੍ਰਿਕਸ + ਆਟੋਮੈਟਿਕ ਜਜਮੈਂਟ + ਰਿਗਰੈਸ਼ਨ):

40 ਸਵਾਲਾਂ ਦਾ ਗੋਲਡਨ ਕਲੱਸਟਰ। ਹਰੇਕ ਤਬਦੀਲੀ ਦੇ ਨਾਲ, recall@5, ਵਫ਼ਾਦਾਰੀ ਅਤੇ ਸ਼ੁੱਧਤਾ ਆਪਣੇ ਆਪ ਹੀ ਮਾਪੀ ਜਾਂਦੀ ਹੈ। ਜੇਕਰ ਸਕੋਰ ਘੱਟ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਬਦਲਾਅ ਵਾਪਸ ਲਿਆ ਜਾਂਦਾ ਹੈ। ਉਤਪਾਦਨ ਵਿੱਚ, ਉਪਭੋਗਤਾ ਫੀਡਬੈਕ ਇਕੱਠਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਸੈੱਟ ਵਿੱਚ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ।

ਉਤਪਾਦਨ ਵਿੱਚ ਨਿਗਰਾਨੀ ਅਤੇ ਰਿਗਰੈਸ਼ਨ

ਮੁਲਾਂਕਣ ਇੱਕ ਵਾਰ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ ਅਤੇ ਪੂਰਾ ਹੋ ਜਾਂਦਾ ਹੈ। ਤਿੰਨ ਨਿਰੰਤਰ ਅਭਿਆਸ:

  • ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ: ਹਰ ਪ੍ਰੋਂਪਟ/ਮੁੜ ਪ੍ਰਾਪਤੀ/ਮਾਡਲ ਤਬਦੀਲੀ 'ਤੇ ਆਟੋ-ਰਨ ਗੋਲਡਨ ਕਲੱਸਟਰ। ਜੇਕਰ ਸਕੋਰ ਘਟਾਇਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਤਬਦੀਲੀ ਉਲਟ ਹੋ ਜਾਂਦੀ ਹੈ। ਇਹ "ਇਸ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ ਹੋਏ ਇਸ ਨੂੰ ਤੋੜਨ" ਤੋਂ ਰੋਕਦਾ ਹੈ।
  • ਉਤਪਾਦਨ ਨਿਗਰਾਨੀ: ਅਸਲ ਪ੍ਰਸ਼ਨਾਂ ਵਿੱਚ "ਮੈਨੂੰ ਜਾਣਕਾਰੀ ਨਹੀਂ ਮਿਲ ਸਕੀ" ਦਰ, ਔਸਤ ਦੇਰੀ, ਲਾਗਤ, ਉਪਭੋਗਤਾ ਫੀਡਬੈਕ (👍/👎) ਦੀ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਵਿੱਚ ਅਚਾਨਕ ਵਾਧਾ ਅਕਸਰ ਇੱਕ ਸੂਚਕਾਂਕ ਜਾਂ ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਖਰਾਬੀ ਦਾ ਪਹਿਲਾ ਸੰਕੇਤ ਹੁੰਦਾ ਹੈ।
  • ਫੀਡਬੈਕ ਲੂਪ: ਉਪਭੋਗਤਾ 👎 ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤੇ ਗਏ ਅਸਲ ਸਵਾਲਾਂ ਦੀ ਸਮੀਖਿਆ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਸੁਨਹਿਰੀ ਢੇਰ ਵਿੱਚ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ; ਇਸ ਤਰ੍ਹਾਂ, ਸੈੱਟ ਸਮੇਂ ਦੇ ਨਾਲ ਅਮੀਰ ਹੋ ਜਾਂਦਾ ਹੈ ਅਤੇ ਸਿਸਟਮ ਦੇ ਅੰਨ੍ਹੇ ਚਟਾਕ ਬੰਦ ਹੋ ਜਾਂਦੇ ਹਨ.

ਤਿੰਨ ਮਿੰਨੀ ਕੇਸ

ਕੇਸ 1 - ਚੁੱਪ ਰਿਗਰੈਸ਼ਨ। ਇੱਕ ਟੀਮ ਨੇ ਇਸਨੂੰ "ਸੁਧਾਰ" ਕਰਨ ਲਈ ਪ੍ਰੋਂਪਟ ਨੂੰ ਸੋਧਿਆ; ਆਮ ਸ਼ੁੱਧਤਾ ਵਧੀ, ਪਰ ਜਾਲ ਦੇ ਸਵਾਲਾਂ ਵਿੱਚ ਵਫ਼ਾਦਾਰੀ 30% ਘਟ ਗਈ (ਮਾਡਲ ਹੋਰ ਫਿੱਟ ਹੋਣ ਲੱਗਾ)। ਇਹ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਵਿੱਚ ਫਸਾਉਣ ਵਾਲੇ ਸਵਾਲਾਂ ਲਈ ਨਾ ਹੁੰਦੇ ਤਾਂ ਇਹ ਧਿਆਨ ਨਹੀਂ ਦਿੱਤਾ ਜਾਂਦਾ; ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ ਨੇ ਤਬਦੀਲੀ ਨੂੰ ਵਾਪਸ ਕਰ ਦਿੱਤਾ।

ਕੇਸ 2 - ਗਲਤ ਲੱਤ ਨੂੰ ਸਿੱਧਾ ਕਰਨਾ। ਇੱਕ ਸਹਾਇਕ ਵਿੱਚ ਜਵਾਬ ਮਾੜੇ ਸਨ; ਟੀਮ ਨੇ ਹਫ਼ਤਿਆਂ ਤੱਕ ਪ੍ਰੋਂਪਟ 'ਤੇ ਕੰਮ ਕੀਤਾ। ਜਦੋਂ ਅਸੀਂ ਮੁੜ ਪ੍ਰਾਪਤੀ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਮਾਪਿਆ, ਤਾਂ ਰੀਕਾਲ@5 ਸਿਰਫ 48% ਸੀ — ਸਮੱਸਿਆ ਪੁਨਰ ਪ੍ਰਾਪਤੀ ਵਿੱਚ ਸੀ, ਪੀੜ੍ਹੀ ਵਿੱਚ ਨਹੀਂ। ਜਦੋਂ ਹਾਈਬ੍ਰਿਡ + ਰੀ-ਰੈਂਕਿੰਗ ਨੂੰ ਜੋੜਿਆ ਗਿਆ, ਤਾਂ ਰੀਕਾਲ 89% ਤੱਕ ਵਧ ਗਿਆ ਅਤੇ ਸ਼ੁੱਧਤਾ ਵੀ ਵਧ ਗਈ।

ਕੇਸ 3 — ਉਤਪਾਦਨ ਚੇਤਾਵਨੀ। ਇੱਕ ਦਿਨ, ਇੱਕ ਸਹਾਇਕ ਸਹਾਇਕ ਲਈ "ਮੈਂ ਜਾਣਕਾਰੀ ਨਹੀਂ ਲੱਭ ਸਕਿਆ" ਦਰ 6% ਤੋਂ 34% ਹੋ ਗਈ। ਟ੍ਰੈਕਪੈਡ ਨੇ ਚੇਤਾਵਨੀ ਦਿੱਤੀ; ਕਾਰਨ ਇਹ ਸੀ ਕਿ ਇੰਡੈਕਸਿੰਗ ਨੌਕਰੀ, ਜੋ ਰਾਤ ਨੂੰ ਚਲਦੀ ਹੈ, ਚੁੱਪਚਾਪ ਅਸਫਲ ਹੋ ਗਈ ਅਤੇ ਨਵੇਂ ਲੇਖ ਅਪਲੋਡ ਨਹੀਂ ਕੀਤੇ ਗਏ ਸਨ. ਨਿਗਰਾਨੀ ਦੇ ਬਿਨਾਂ, ਗਲਤ "ਮੈਨੂੰ ਨਹੀਂ ਪਤਾ" ਬਿਆਨ ਦਿਨਾਂ ਲਈ ਜਾਰੀ ਰਹਿਣਗੇ।

ਆਮ ਗਲਤੀਆਂ

  • "ਇਸਨੇ ਮੇਰੇ ਲਈ ਵਧੀਆ ਕੰਮ ਕੀਤਾ" ਨਾਲ ਸੰਤੁਸ਼ਟ ਹੋਣਾ: ਮਾਪ ਤੋਂ ਬਿਨਾਂ, ਰੀਗਰੈਸ਼ਨ ਦਾ ਧਿਆਨ ਨਹੀਂ ਜਾਂਦਾ।
  • ਪ੍ਰਾਪਤੀ ਅਤੇ ਪੀੜ੍ਹੀ ਨੂੰ ਵੱਖਰਾ ਨਹੀਂ ਕਰਨਾ: ਤੁਸੀਂ ਗਲਤ ਲੱਤ ਨੂੰ ਠੀਕ ਕਰੋਗੇ ਅਤੇ ਸਮਾਂ ਬਰਬਾਦ ਕਰੋਗੇ।
  • ਜਾਲ ਦੇ ਸਵਾਲ ਨਾ ਪੁੱਛਣਾ: ਚੀਜ਼ਾਂ ਨੂੰ ਬਣਾਉਣ ਦੀ ਪ੍ਰਵਿਰਤੀ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਵਿੱਚ ਦਿਖਾਈ ਨਹੀਂ ਦਿੰਦੀ।
  • ਜੱਜ ਦੀ ਤਸਦੀਕ ਨਾ ਕਰਨਾ: ਇੱਕ ਪੱਖਪਾਤੀ ਜਿਊਰੀ ਝੂਠਾ ਭਰੋਸਾ ਦਿੰਦੀ ਹੈ।
  • ਉਤਪਾਦਨ ਦੀ ਨਿਗਰਾਨੀ ਨਹੀਂ: ਸੂਚਕਾਂਕ ਅਸਫਲਤਾ, ਲਾਗਤ ਵਿਸਫੋਟ ਚੁੱਪਚਾਪ ਜਾਰੀ ਹੈ.

ਸੰਖੇਪ ਵਿੱਚ

  • RAG ਵਿੱਚ, ਪ੍ਰਾਪਤੀ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ; ਪਹਿਲਾਂ ਇਹ ਨਿਰਧਾਰਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਕਿਹੜੀ ਲੱਤ ਨੂੰ ਨੁਕਸਾਨ ਹੋਇਆ ਹੈ।
  • recall@k, precision@k, ਮੁੜ ਪ੍ਰਾਪਤੀ ਲਈ MRR; ਵਫ਼ਾਦਾਰੀ, ਅਨੁਕੂਲਤਾ, ਸੰਪੂਰਨਤਾ ਪੀੜ੍ਹੀ ਲਈ ਵਰਤੀ ਜਾਂਦੀ ਹੈ.
  • ਹਰੇਕ ਮਾਪ ਲਈ ਸੋਨੇ ਦੇ ਕਲੱਸਟਰ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਇਸ ਵਿੱਚ ਅਸਲੀ, ਔਖੇ, ਜਾਲ ਅਤੇ ਵਿਰੋਧੀ ਸਵਾਲਾਂ ਨੂੰ ਪਾਓ।
  • LLM-ਬਤੌਰ ਜੱਜ ਵੱਡੇ ਸੈੱਟ ਆਟੋ-ਸਕੋਰ; ਪਰ ਜੱਜ ਨੂੰ ਆਪਣੇ ਆਪ ਨੂੰ ਮਨੁੱਖ ਦੇ ਵਿਰੁੱਧ ਧਰਮੀ ਠਹਿਰਾਉਣਾ ਚਾਹੀਦਾ ਹੈ।
  • ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ, ਉਤਪਾਦਨ ਦੀ ਨਿਗਰਾਨੀ, ਅਤੇ ਇੱਕ ਫੀਡਬੈਕ ਲੂਪ ਸਮੇਂ ਦੇ ਨਾਲ ਗੁਣਵੱਤਾ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

(1) ਆਪਣੇ ਖੁਦ ਦੇ ਸਹਾਇਕ ਲਈ ਘੱਟੋ-ਘੱਟ 15 ਸਵਾਲਾਂ ਦਾ ਸੁਨਹਿਰੀ ਸੈੱਟ ਬਣਾਓ: ਘੱਟੋ-ਘੱਟ 3 ਟਰੈਪ (ਕੋਈ ਜਵਾਬ ਨਹੀਂ), 3 ਔਖੇ, 2 ਵਿਰੋਧੀ ਸਰੋਤ ਸਵਾਲ ਸ਼ਾਮਲ ਕਰੋ। ਹਰੇਕ ਸਵਾਲ ਲਈ ਸੰਭਾਵਿਤ ਜਵਾਬ ਅਤੇ ਸਹੀ ਭਾਗ ਲਿਖੋ। (2) ਇਸ ਸੈੱਟ ਦੇ ਨਾਲ ਦੋ ਵੱਖ-ਵੱਖ ਪ੍ਰੋਂਪਟ ਸੰਸਕਰਣਾਂ ਦੀ ਦਸਤੀ ਤੁਲਨਾ ਕਰੋ; ਵਫ਼ਾਦਾਰੀ ਅਤੇ ਸ਼ੁੱਧਤਾ ਲਈ ਹਰੇਕ ਜਵਾਬ ਨੂੰ 1-5 ਅੰਕ ਦਿਓ। (3) ਆਪਣੇ ਖੁਦ ਦੇ ਮਾਪਦੰਡਾਂ ਲਈ ਉਪਰੋਕਤ LLM-ਜੱਜ-ਜੱਜ ਪ੍ਰੋਂਪਟ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾਓ। (4) 3 ਮੈਟ੍ਰਿਕਸ ਦੀ ਪਛਾਣ ਕਰੋ ਜੋ ਤੁਸੀਂ ਉਤਪਾਦਨ ਵਿੱਚ ਟਰੈਕ ਕਰੋਗੇ ਅਤੇ ਹਰੇਕ ਲਈ ਪੁੱਛੋ ਕਿ "ਮੈਂ ਕਿਸ ਥ੍ਰੈਸ਼ਹੋਲਡ 'ਤੇ ਅਲਾਰਮ ਕਰਦਾ ਹਾਂ?" ਮੁੱਲ ਲਿਖੋ.

ਚੈੱਕਲਿਸਟ

  • [ ] ਮੈਂ ਵੱਖਰੇ ਮੈਟ੍ਰਿਕਸ ਨਾਲ ਧਾਰਨ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪ ਸਕਦਾ ਹਾਂ।
  • [ ] ਮੈਨੂੰ ਪਤਾ ਹੈ ਕਿ recall@k, ਵਫ਼ਾਦਾਰੀ ਦਾ ਕੀ ਅਰਥ ਹੈ।
  • [ ] ਮੈਂ ਇੱਕ ਸੁਨਹਿਰੀ ਕਲੱਸਟਰ ਬਣਾ ਸਕਦਾ ਹਾਂ ਜਿਸ ਵਿੱਚ ਅਸਲ, ਮੁਸ਼ਕਲ, ਜਾਲ ਅਤੇ ਵਿਰੋਧੀ ਸਵਾਲ ਸ਼ਾਮਲ ਹਨ।
  • [ ] ਮੈਂ ਸਵੈਚਲਿਤ ਮੁਲਾਂਕਣ ਸਥਾਪਤ ਕਰ ਸਕਦਾ/ਸਕਦੀ ਹਾਂ ਅਤੇ ਜੱਜ ਨੂੰ LLM-ਜੱਜ-ਜੱਜ ਨਾਲ ਪ੍ਰਮਾਣਿਤ ਕਰ ਸਕਦਾ/ਸਕਦੀ ਹਾਂ।
  • [] ਮੈਂ ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ, ਉਤਪਾਦਨ ਨਿਗਰਾਨੀ ਅਤੇ ਫੀਡਬੈਕ ਲੂਪ ਚਲਾ ਸਕਦਾ ਹਾਂ।