ਇਕਾਈਆਂ
1. ML ਇੰਜੀਨੀਅਰਿੰਗ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ: ਭੂਮਿਕਾ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰੀ 2. ਡੇਟਾ ਪਾਈਪਲਾਈਨ: ਸੰਗ੍ਰਹਿ, ਕਲੀਨਿੰਗ, ਟੈਗਿੰਗ ਅਤੇ ਵਰਜਨਿੰਗ 3. ਮਾਡਲ ਸਿਖਲਾਈ ਅਤੇ ਮੁਲਾਂਕਣ: ਸਹੀ ਮੈਟ੍ਰਿਕਸ, ਇਮਾਨਦਾਰ ਬੈਂਚਮਾਰਕਿੰਗ 4. LLM ਐਪਲੀਕੇਸ਼ਨ: RAG ਨਾਲ ਤੁਹਾਡੇ ਆਪਣੇ ਡੇਟਾ ਦੇ ਆਧਾਰ 'ਤੇ ਜਵਾਬ 5. LLM ਐਪਲੀਕੇਸ਼ਨ: ਏਜੰਟ, ਟੂਲਿੰਗ ਅਤੇ ਸੁਰੱਖਿਅਤ ਆਟੋਮੇਸ਼ਨ 6. ਫਾਈਨ-ਟਿਊਨਿੰਗ ਆਧਾਰ: ਕਦੋਂ, ਕਿਵੇਂ ਅਤੇ ਕਿਸ ਜੋਖਮ ਨਾਲ 7. MLOps ਅਤੇ ਤੈਨਾਤੀ: ਮਾਡਲ ਨੂੰ ਲੈਬ ਤੋਂ ਉਤਪਾਦਨ ਤੱਕ ਲਿਜਾਣਾ 8. ਈਵਲ ਅਤੇ ਨਿਗਰਾਨੀ: ਇਹ ਜਾਣਨਾ ਕਿ ਮਾਡਲ ਅਸਲ ਵਿੱਚ ਉਤਪਾਦਨ ਵਿੱਚ ਕੀ ਕਰਦਾ ਹੈ 9. ਸੁਰੱਖਿਆ ਅਤੇ ਗੋਪਨੀਯਤਾ: AI ਸਿਸਟਮਾਂ ਦਾ ਬਚਾਅ ਕਰਨਾ 10. ਪੱਖਪਾਤ, ਨੈਤਿਕਤਾ ਅਤੇ ਲਾਗਤ: ਜ਼ਿੰਮੇਵਾਰ ਅਤੇ ਸਸਟੇਨੇਬਲ ਏਆਈ ਇੰਜੀਨੀਅਰਿੰਗ 11. ਰੀਪ੍ਰੋਡਸੀਬਿਲਟੀ ਅਤੇ ਐਂਡ-ਟੂ-ਐਂਡ ਪ੍ਰੋਜੈਕਟ: ਹਰ ਚੀਜ਼ ਨੂੰ ਜੋੜਨਾ
ਯੂਨਿਟ 8 / 11

ਈਵਲ ਅਤੇ ਨਿਗਰਾਨੀ: ਇਹ ਜਾਣਨਾ ਕਿ ਮਾਡਲ ਅਸਲ ਵਿੱਚ ਉਤਪਾਦਨ ਵਿੱਚ ਕੀ ਕਰਦਾ ਹੈ

ਲਾਭ:

  • ਮਾਡਲ (ਡੇਟਾ ਡਰਾਫਟ, ਸੰਕਲਪ ਡ੍ਰਾਈਫਟ, ਅਪਸਟ੍ਰੀਮ ਗਲਤੀ) ਦੇ ਨਿਘਾਰ ਦੇ ਚੁੱਪ ਕਾਰਨਾਂ ਨੂੰ ਪਛਾਣਨ ਅਤੇ ਤਿੰਨ-ਲੇਅਰ (ਕਾਰਜਸ਼ੀਲ, ਇਨਪੁਟ, ਆਉਟਪੁੱਟ) ਨਿਗਰਾਨੀ ਸਥਾਪਤ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
  • ਨਿਯਮ ਜਾਂਚਾਂ, ਐਲਐਲਐਮ-ਰੈਫਰੀ ਅਤੇ ਮਨੁੱਖੀ ਮੁਲਾਂਕਣ ਦੇ ਨਾਲ ਕਈ ਲੇਅਰਾਂ ਵਿੱਚ ਐਲਐਲਐਮ ਪ੍ਰਣਾਲੀਆਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਦੀ ਸਮਰੱਥਾ, ਅਤੇ ਐਲਐਲਐਮ-ਰੈਫਰੀ ਮਨੁੱਖੀ ਐਂਕਰ ਨਾਲ ਕੈਲੀਬਰੇਟ
  • ਕਿਨਾਰੇ ਅਤੇ ਸੁਰੱਖਿਆ ਕੇਸਾਂ ਵਾਲੇ ਇੱਕ ਈਵਲ ਸੈੱਟ ਨੂੰ ਡਿਜ਼ਾਈਨ ਕਰਨ ਅਤੇ ਹਰ ਫੜੀ ਗਈ ਗਲਤੀ ਨੂੰ ਸਥਾਈ ਟੈਸਟ ਕੇਸ ਵਿੱਚ ਬਦਲਣ ਦੀ ਸਮਰੱਥਾ

ਇੱਕ ਵਾਰ ਜਦੋਂ ਇੱਕ ਮਾਡਲ ਉਤਪਾਦਨ ਵਿੱਚ ਚਲਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਤੁਹਾਡਾ ਕੰਮ ਪੂਰਾ ਨਹੀਂ ਹੁੰਦਾ; ਅਸਲ ਜ਼ਿੰਮੇਵਾਰੀ ਹੁਣੇ ਸ਼ੁਰੂ ਹੁੰਦੀ ਹੈ. ਕਿਉਂਕਿ ਮਾਡਲ ਚੁੱਪਚਾਪ ਟੁੱਟ ਸਕਦਾ ਹੈ ਜਦੋਂ ਕੋਈ ਨਹੀਂ ਦੇਖ ਰਿਹਾ ਹੁੰਦਾ. ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਦੋ ਪੂਰਕ ਅਨੁਸ਼ਾਸਨਾਂ ਨੂੰ ਕਵਰ ਕਰਦੇ ਹਾਂ: ਮੁਲਾਂਕਣ (ਵਿਵਸਥਿਤ ਰੂਪ ਵਿੱਚ ਮਾਡਲ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪਣਾ) ਅਤੇ ਨਿਗਰਾਨੀ (ਉਤਪਾਦਨ ਵਿੱਚ ਮਾਡਲ ਦੀ ਨਿਰੰਤਰ ਨਿਗਰਾਨੀ)। ਖਾਸ ਤੌਰ 'ਤੇ ਐਲਐਲਐਮ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ, ਈਵਲ ਵਧੇਰੇ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ ਅਤੇ ਕਲਾਸੀਕਲ ਐਮਐਲ ਨਾਲੋਂ ਵਧੇਰੇ ਦੇਖਭਾਲ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਉਤਪਾਦਨ ਮਾਡਲ ਚੁੱਪ-ਚਾਪ ਕਿਉਂ ਟੁੱਟ ਰਿਹਾ ਹੈ

ਇੱਕ ਬੱਗ ਕਰੈਸ਼ ਹੋ ਜਾਂਦਾ ਹੈ, ਲੌਗ ਪ੍ਰਿੰਟ ਹੁੰਦਾ ਹੈ, ਅਲਾਰਮ ਬੰਦ ਹੋ ਜਾਂਦਾ ਹੈ। ਇੱਕ ML ਮਾਡਲ, ਦੂਜੇ ਪਾਸੇ, ਗਲਤੀਆਂ ਪੈਦਾ ਕੀਤੇ ਬਿਨਾਂ ਗਲਤ ਹੋ ਸਕਦਾ ਹੈ। ਪਤਨ ਦੇ ਤਿੰਨ ਮੁੱਖ ਕਾਰਨ:

  • ਡੇਟਾ ਡ੍ਰਾਈਫਟ: ਸਮੇਂ ਦੇ ਨਾਲ ਇਨਪੁਟ ਡੇਟਾ ਦੀ ਵੰਡ ਬਦਲਦੀ ਹੈ (ਨਵੇਂ ਉਤਪਾਦ, ਉਪਭੋਗਤਾ ਵਿਹਾਰ ਬਦਲਣਾ, ਮੌਸਮੀਤਾ)। ਮਾਡਲ ਉਹੀ ਰਹਿੰਦਾ ਹੈ ਪਰ ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ।
  • ਸੰਕਲਪ ਡ੍ਰਾਈਫਟ: ਇਨਪੁਟ-ਆਉਟਪੁੱਟ ਰਿਸ਼ਤਾ ਬਦਲਦਾ ਹੈ। ਧੋਖਾਧੜੀ ਦੀਆਂ ਚਾਲਾਂ ਅਤੇ ਸਪੈਮ ਪੈਟਰਨ ਵਿਕਸਿਤ ਹੁੰਦੇ ਹਨ; ਜੋ ਕੱਲ ਸਹੀ ਸੀ ਅੱਜ ਗਲਤ ਹੋਵੇਗਾ।
  • ਅੱਪਸਟਰੀਮ ਭ੍ਰਿਸ਼ਟਾਚਾਰ: ਇੱਕ ਡਾਟਾ ਸਰੋਤ ਫਾਰਮੈਟ ਬਦਲਦਾ ਹੈ, ਇੱਕ ਖੇਤਰ ਖਾਲੀ ਹੋ ਜਾਂਦਾ ਹੈ; ਮਾਡਲ ਖ਼ਰਾਬ ਇਨਪੁਟ ਨਾਲ ਚੁੱਪ-ਚਾਪ ਤਰਦਾ ਹੈ।

ਟਰੇਸਿੰਗ ਇਹਨਾਂ ਚੁੱਪ ਵਿਗਾੜਾਂ ਨੂੰ ਸੁਣਨਯੋਗ ਬਣਾ ਰਹੀ ਹੈ।

ਕੀ ਦੇਖਣਾ ਹੈ: ਤਿੰਨ ਪਰਤਾਂ

ਚੰਗੀ ਨਿਗਰਾਨੀ ਤਿੰਨ ਪਰਤਾਂ ਨੂੰ ਕਵਰ ਕਰਦੀ ਹੈ:

  1. ਸੰਚਾਲਨ ਮੈਟ੍ਰਿਕਸ: ਲੇਟੈਂਸੀ, ਗਲਤੀ ਦਰ, ਬੇਨਤੀ ਵਾਲੀਅਮ, ਸਰੋਤ ਵਰਤੋਂ। "ਕੀ ਸਿਸਟਮ ਖੜ੍ਹਾ ਹੈ?"
  2. ਡੇਟਾ/ਇਨਪੁਟ ਮੈਟ੍ਰਿਕਸ: ਕੀ ਇੰਪੁੱਟ ਵੰਡ ਸਿਖਲਾਈ ਵਿੱਚ ਸਮਾਨ ਹੈ? ਕੀ ਗੁੰਮ ਮੁੱਲ ਦੀ ਦਰ ਵਧ ਗਈ ਹੈ? ਕੀ ਨਵੀਆਂ ਸ਼੍ਰੇਣੀਆਂ ਆ ਗਈਆਂ ਹਨ? "ਕੀ ਮਾਡਲ ਜਾਣਿਆ-ਪਛਾਣਿਆ ਡੇਟਾ ਦੇਖ ਰਿਹਾ ਹੈ?"
  3. ਮਾਡਲ/ਆਉਟਪੁੱਟ ਮੈਟ੍ਰਿਕਸ: ਭਵਿੱਖਬਾਣੀ ਵੰਡ ਲੌਗ? ਕੀ ਆਤਮਵਿਸ਼ਵਾਸ ਦੇ ਅੰਕ ਘਟ ਗਏ ਹਨ? ਅਤੇ ਜੇ ਸੰਭਵ ਹੋਵੇ, ਤਾਂ ਜ਼ਮੀਨੀ ਸੱਚਾਈ ਦੇ ਮੁਕਾਬਲੇ ਸ਼ੁੱਧਤਾ ਕੀ ਹੈ? "ਕੀ ਮਾਡਲ ਅਜੇ ਵੀ ਸਹੀ ਹੈ?"

ਤੀਜੀ ਪਰਤ ਸਭ ਤੋਂ ਕੀਮਤੀ ਪਰ ਸਭ ਤੋਂ ਔਖੀ ਹੈ; ਕਿਉਂਕਿ ਅਸਲ ਨਤੀਜਾ ਆਮ ਤੌਰ 'ਤੇ ਦੇਰੀ ਨਾਲ ਆਉਂਦਾ ਹੈ (ਇਹ ਮਹੀਨਿਆਂ ਬਾਅਦ ਸਪੱਸ਼ਟ ਹੋ ਜਾਂਦਾ ਹੈ ਕਿ ਕਰਜ਼ੇ ਦੀ ਅਦਾਇਗੀ ਕੀਤੀ ਜਾਵੇਗੀ ਜਾਂ ਨਹੀਂ)।

ਸੁਝਾਅ: ਜੇਕਰ ਅਸਲ ਨਤੀਜੇ ਵਿੱਚ ਦੇਰੀ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਪਹਿਲਾਂ ਇਨਪੁਟ ਅਤੇ ਪੂਰਵ ਅਨੁਮਾਨ ਵੰਡ ਦੀ ਨਿਗਰਾਨੀ ਕਰੋ। ਇਨਪੁਟ ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ ਦੀ ਸ਼ਿਫਟ ਸ਼ੁੱਧਤਾ ਦੀ ਗਿਰਾਵਟ ਦਾ ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਸੰਕੇਤ ਹੈ ਅਤੇ ਅਸਲ ਨਤੀਜੇ ਦੀ ਉਡੀਕ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਅਲਾਰਮ ਵਧਾ ਸਕਦਾ ਹੈ।

ਐਲਐਲਐਮ ਪ੍ਰਣਾਲੀਆਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ: ਵਿਸ਼ੇਸ਼ ਚੁਣੌਤੀ

ਕਲਾਸੀਕਲ ML ਵਿੱਚ, "ਸਹੀ ਜਵਾਬ" ਸਪਸ਼ਟ ਹੈ (ਕਲਾਸ 0 ਜਾਂ 1)। ਦੂਜੇ ਪਾਸੇ, LLM ਨਤੀਜਾ ਖੁੱਲਾ ਹੈ: ਇੱਕੋ ਸਵਾਲ ਦੇ ਬਹੁਤ ਸਾਰੇ ਸਹੀ ਜਵਾਬ ਹੋ ਸਕਦੇ ਹਨ, "ਸ਼ੁੱਧਤਾ" ਇੱਕ ਸੰਖਿਆ ਵਿੱਚ ਫਿੱਟ ਨਹੀਂ ਹੁੰਦੀ ਹੈ। LLM ਈਵਲ ਪਹੁੰਚ:

  • ਹਵਾਲਾ ਮੈਟ੍ਰਿਕਸ: ਆਦਰਸ਼ ਜਵਾਬ ਨਾਲ ਆਉਟਪੁੱਟ ਦੀ ਤੁਲਨਾ ਕਰਨਾ। ਸੀਮਿਤ; ਕਿਉਂਕਿ ਇਹ ਸਹੀ ਜਵਾਬ ਨੂੰ "ਗਲਤ" ਵਜੋਂ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਸਮਝ ਸਕਦਾ ਹੈ।
  • ਨਿਯਮ-ਅਧਾਰਿਤ ਜਾਂਚ: ਕੀ ਆਉਟਪੁੱਟ ਵੈਧ JSON ਹੈ? ਕੀ ਕੋਈ ਪਾਬੰਦੀਸ਼ੁਦਾ ਸ਼ਬਦ ਹਨ? ਕੀ ਇਸ ਵਿੱਚ ਲੋੜੀਂਦੇ ਖੇਤਰ ਸ਼ਾਮਲ ਹਨ? ਸਸਤੇ, ਭਰੋਸੇਮੰਦ, ਤੰਗ.
  • LLM-ਜੱਜ (LLM-ਜੱਜ): ਇੱਕ ਮਾਡਲ ਨੂੰ ਇਹ ਨਾ ਪੁੱਛੋ ਕਿ "ਕੀ ਇਹ ਜਵਾਬ ਇਸ ਮਾਪਦੰਡ ਦੇ ਅਨੁਸਾਰ ਚੰਗਾ ਹੈ?" ਇਹ ਸਕੇਲ ਕਰਦਾ ਹੈ, ਪਰ ਰੈਫਰੀ ਨੂੰ ਖੁਦ ਪ੍ਰਮਾਣਿਤ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ।
  • ਮਨੁੱਖੀ ਸਮੀਖਿਆ: ਗੋਲਡ ਸਟੈਂਡਰਡ ਪਰ ਮਹਿੰਗਾ ਅਤੇ ਹੌਲੀ। ਇਹ ਨਮੂਨੇ 'ਤੇ ਵਰਤਿਆ ਗਿਆ ਹੈ.

ਅਭਿਆਸ ਵਿੱਚ ਇਹ ਇਕੱਠੇ ਵਰਤੇ ਜਾਂਦੇ ਹਨ: ਹਰੇਕ ਆਉਟਪੁੱਟ 'ਤੇ ਸਸਤੇ ਨਿਯਮ ਦੀ ਜਾਂਚ, ਇੱਕ ਵੱਡੇ ਨਮੂਨੇ 'ਤੇ LLM- ਜੱਜ, ਇੱਕ ਛੋਟੇ ਪਰ ਸਖ਼ਤ ਨਮੂਨੇ 'ਤੇ ਮਨੁੱਖੀ ਮੁਲਾਂਕਣ।

ਕਮਜ਼ੋਰ ਪਹੁੰਚ / ਮਜ਼ਬੂਤ ਪਹੁੰਚ

ਕਮਜ਼ੋਰ: "LLM-ਮੈਂ ਰੈਫਰੀ ਨੂੰ ਪੁੱਛਿਆ, ਸਾਡੇ 92% ਜਵਾਬ ਚੰਗੇ ਸਨ। ਸਿਸਟਮ ਬਹੁਤ ਵਧੀਆ ਹੈ।"

Güçlü: "ਅਸੀਂ ਪਹਿਲਾਂ ਮਨੁੱਖੀ-ਲੇਬਲ ਵਾਲੇ 100 ਪ੍ਰਿੰਟਆਉਟਸ। ਅਸੀਂ ਉਸੇ 100 ਪ੍ਰਿੰਟਆਉਟਸ 'ਤੇ LLM-ਜੱਜ ਨੂੰ ਚਲਾਇਆ ਅਤੇ ਮਾਨਵ-ਜੱਜ ਸਮਝੌਤਾ ਮਾਪਿਆ - 85% ਸਮਝੌਤਾ, ਸਵੀਕਾਰਯੋਗ। ਅਸੀਂ ਦਸਤਾਵੇਜ਼ੀ ਤੌਰ 'ਤੇ ਜਿੱਥੇ ਜੱਜ ਗਲਤ ਸੀ (ਲੰਬੇ ਜਵਾਬਾਂ ਨੂੰ ਗਲਤ ਤਰੀਕੇ ਨਾਲ ਵਧੀਆ ਲੱਭਣ ਦੀ ਪ੍ਰਵਿਰਤੀ) ਦਾ ਦਸਤਾਵੇਜ਼ੀਕਰਨ ਕੀਤਾ ਅਤੇ ਉਸ ਦੇ ਸਕੋਰ ਨੂੰ ਨਿਸ਼ਚਿਤ ਕੀਤਾ ਤਾਂ ਹੀ ਅਸੀਂ ਜੱਜਾਂ 'ਤੇ ਭਰੋਸਾ ਕੀਤਾ।"

ਅੰਤਰ: ਮਜ਼ਬੂਤ ​​ਪਹੁੰਚ ਰੈਫਰੀ ਨੂੰ ਮਨੁੱਖੀ ਐਂਕਰ ਨਾਲ ਪ੍ਰਮਾਣਿਤ ਕਰਦੀ ਹੈ, ਅੰਨ੍ਹੇਵਾਹ ਨਹੀਂ। ਇੱਕ ਗੈਰ-ਪ੍ਰਮਾਣਿਤ LLM-ਰੈਫਰੀ ਵਧੀਆ ਦਿੱਖ ਵਾਲਾ ਪਰ ਝੂਠਾ ਭਰੋਸਾ ਦਿੰਦਾ ਹੈ।

ਧਿਆਨ ਦਿਓ: LLM-ਰੈਫਰੀ ਵੀ ਇੱਕ ਮਾਡਲ ਹੈ; ਹੈਲੁਸੀਨੋਜਨਿਕ, ਪੱਖਪਾਤੀ (ਲੰਬੇ/ਭਰੋਸੇ ਵਾਲੇ ਜਵਾਬਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ), ਅਸੰਗਤ ਹੋ ਸਕਦਾ ਹੈ। ਉਤਪਾਦਨ ਦੇ ਫੈਸਲੇ ਲੈਣ ਤੋਂ ਪਹਿਲਾਂ ਮਨੁੱਖੀ ਟੈਗਾਂ ਨਾਲ ਰੈਫਰੀ ਸਕੋਰਾਂ ਨੂੰ ਕੈਲੀਬਰੇਟ ਕਰੋ।

ਮੁਲਾਂਕਣ ਸੈੱਟ: ਧਿਆਨ ਨਾਲ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ

ਇੱਕ ਚੰਗਾ ਈਵਲ ਸੈੱਟ ਅਸਲ ਵਰਤੋਂ ਅਤੇ ਮੁਸ਼ਕਲ ਮਾਮਲਿਆਂ ਦੀ ਵਿਭਿੰਨਤਾ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਸਿਰਫ਼ ਆਸਾਨ ਉਦਾਹਰਣਾਂ ਨਾਲ ਭਰਿਆ ਇੱਕ ਈਵਲ ਤੁਹਾਨੂੰ ਝੂਠੇ ਭਰੋਸੇ ਵਿੱਚ ਛੱਡ ਦੇਵੇਗਾ। ਇਸ ਨੂੰ eval ਕਲੱਸਟਰ ਵਿੱਚ ਰੱਖਣਾ ਯਕੀਨੀ ਬਣਾਓ:

  • ਕਿਨਾਰੇ ਦੇ ਕੇਸ: ਖਾਲੀ ਇੰਪੁੱਟ, ਬਹੁਤ ਲੰਮਾ ਇੰਪੁੱਟ, ਅਸਾਧਾਰਨ ਫਾਰਮੈਟ।
  • ਜਾਣੇ-ਪਛਾਣੇ ਹਾਰਡ ਕੇਸ: ਉਦਾਹਰਨਾਂ ਜਿੱਥੇ ਮਾਡਲ ਨੇ ਅਤੀਤ ਵਿੱਚ ਗਲਤੀਆਂ ਕੀਤੀਆਂ ਹਨ (ਰਿਗਰੈਸ਼ਨ ਟੈਸਟ ਵਜੋਂ)।
  • ਸੁਰੱਖਿਆ ਘਟਨਾਵਾਂ: ਤੁਰੰਤ ਟੀਕੇ ਲਗਾਉਣ ਦੀਆਂ ਕੋਸ਼ਿਸ਼ਾਂ, ਖਤਰਨਾਕ ਬੇਨਤੀਆਂ, ਗੋਪਨੀਯਤਾ ਦੀ ਉਲੰਘਣਾ ਦੇ ਜਾਲ।

ਈਵਲ ਕਲੱਸਟਰ ਸਮੇਂ ਦੇ ਨਾਲ ਵਧਦਾ ਹੈ: ਹਰੇਕ ਨਵਾਂ ਬੱਗ ਜੋ ਤੁਸੀਂ ਉਤਪਾਦਨ ਵਿੱਚ ਫੜਦੇ ਹੋ, ਅਗਲੇ ਮੁਲਾਂਕਣ ਲਈ ਇੱਕ ਟੈਸਟ ਕੇਸ ਬਣ ਜਾਂਦਾ ਹੈ।

ਅਲਾਰਮ ਅਤੇ ਦਖਲ

ਅਲਾਰਮ ਤੋਂ ਬਿਨਾਂ ਨਿਗਰਾਨੀ ਅਧੂਰੀ ਰਹਿੰਦੀ ਹੈ। ਹਰੇਕ ਮਹੱਤਵਪੂਰਨ ਮੈਟ੍ਰਿਕ ਲਈ ਇੱਕ ਥ੍ਰੈਸ਼ਹੋਲਡ ਅਤੇ ਇੱਕ ਜਵਾਬ ਯੋਜਨਾ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ: "ਇੰਜੀਨੀਅਰ ਨੂੰ ਸੂਚਿਤ ਕਰੋ ਜੇਕਰ ਇਨਪੁਟ ਡ੍ਰਾਈਫਟ X ਤੋਂ ਵੱਧ ਹੈ", "ਜੇ ਗਲਤੀ ਦਰ Y ਤੋਂ ਵੱਧ ਜਾਂਦੀ ਹੈ ਤਾਂ ਆਟੋ ਰੋਲ ਬੈਕ"। ਅਲਾਰਮਾਂ ਨੂੰ ਸਾਰਥਕ ਰੱਖੋ — ਬਹੁਤ ਸਾਰੇ ਝੂਠੇ ਅਲਾਰਮ ਟੀਮ ਨੂੰ ਸੰਵੇਦਨਸ਼ੀਲ ਬਣਾਉਂਦੇ ਹਨ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਅਸਲ ਅਲਾਰਮ ਤੋਂ ਖੁੰਝ ਜਾਂਦੇ ਹਨ।

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 - ਸ਼ੁਰੂਆਤੀ ਚੇਤਾਵਨੀ। ਮੰਗ ਪੂਰਵ ਅਨੁਮਾਨ ਮਾਡਲ ਦੀ ਸਹੀ ਸ਼ੁੱਧਤਾ ਹਫ਼ਤੇ ਦੇ ਅੰਤ ਵਿੱਚ ਹੀ ਸਪੱਸ਼ਟ ਹੋ ਗਈ। ਟੀਮ ਇਨਪੁਟ ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ ਦੀ ਨਿਗਰਾਨੀ ਕਰ ਰਹੀ ਸੀ ਅਤੇ ਮੰਗਲਵਾਰ ਨੂੰ ਇੱਕ ਨਵੀਂ ਉਤਪਾਦ ਸ਼੍ਰੇਣੀ ਵਿੱਚ ਅਚਾਨਕ ਵਾਧਾ ਦੇਖਿਆ - ਅਜਿਹਾ ਕੁਝ ਮਾਡਲ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖਿਆ ਸੀ। ਉਨ੍ਹਾਂ ਨੇ ਸ਼ੁੱਧਤਾ ਡ੍ਰੌਪ ਦੀ ਉਡੀਕ ਕੀਤੇ ਬਿਨਾਂ ਮਾਡਲ ਨੂੰ ਅਪਡੇਟ ਕੀਤਾ. ਇਨਪੁਟ ਨਿਗਰਾਨੀ ਦਿਨ ਬਚਾਏ ਗਏ ਹਨ.

ਕੇਸ 2 - ਗੈਰ-ਪ੍ਰਮਾਣਿਤ ਰੈਫਰੀ। ਇੱਕ ਟੀਮ ਨੇ LLM- ਸਮੀਖਿਅਕ ਦੇ ਆਧਾਰ 'ਤੇ "ਸਾਡੀ ਗੁਣਵੱਤਾ ਸ਼ਾਨਦਾਰ ਹੈ" ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ। ਜਦੋਂ ਗਾਹਕ ਦੀਆਂ ਸ਼ਿਕਾਇਤਾਂ ਵਧੀਆਂ, ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ ਸ਼ੁਰੂ ਕੀਤੀ ਗਈ: ਰੈਫਰੀ ਨੇ ਭਰੋਸੇਮੰਦ ਪਰ ਗਲਤ ਜਵਾਬਾਂ ਨੂੰ "ਚੰਗਾ" ਮੰਨਿਆ। ਇੱਕ ਵਾਰ ਰੈਫਰੀ ਨੂੰ ਮਨੁੱਖੀ ਟੈਗਸ ਨਾਲ ਕੈਲੀਬਰੇਟ ਕੀਤਾ ਗਿਆ ਸੀ, ਅਸਲ ਗੁਣਵੱਤਾ ਪ੍ਰਗਟ ਕੀਤੀ ਗਈ ਸੀ ਅਤੇ ਬਹੁਤ ਘੱਟ ਸੀ। ਸਬਕ: ਰੈਫਰੀ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੇ ਬਿਨਾਂ ਉਸ 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ।

ਕੇਸ 3 - ਰਿਗਰੈਸ਼ਨ ਟੈਸਟਿੰਗ। ਇੱਕ ਤੁਰੰਤ ਤਬਦੀਲੀ ਨੇ ਇੱਕ ਮੁੱਦੇ ਨੂੰ ਹੱਲ ਕੀਤਾ ਜਦੋਂ ਕਿ ਚੁੱਪਚਾਪ ਦੂਜੇ ਨੂੰ ਤੋੜ ਦਿੱਤਾ। ਪਰ ਟੀਮ ਨੇ ਪਿਛਲੇ ਬੱਗਾਂ ਨੂੰ ਈਵਲ ਬਾਲਟੀ ਵਿੱਚ ਰੱਖਿਆ; ਜਦੋਂ ਇਸ ਕਲੱਸਟਰ 'ਤੇ ਨਵੀਂ ਤਬਦੀਲੀ ਦੀ ਜਾਂਚ ਕੀਤੀ ਗਈ ਤਾਂ ਟੁੱਟੇ ਹੋਏ ਕੇਸ ਨੂੰ ਤੁਰੰਤ ਫੜ ਲਿਆ ਗਿਆ ਅਤੇ ਤਬਦੀਲੀ ਨੂੰ ਠੀਕ ਕਰ ਦਿੱਤਾ ਗਿਆ। ਪਾਠ: ਹਰ ਫਿਕਸਡ ਬੱਗ ਇੱਕ ਸਥਾਈ ਟੈਸਟ ਕੇਸ ਬਣ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

ਨਕਲ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟਸ

ਇਸ ਉਤਪਾਦਨ ਮਾਡਲ ਲਈ ਇੱਕ ਟਰੈਕਿੰਗ ਯੋਜਨਾ ਤਿਆਰ ਕਰੋ। ਤਿੰਨ ਪਰਤਾਂ ਨੂੰ ਕਵਰ ਕਰੋ: 1) ਕਾਰਜਸ਼ੀਲ (ਲੇਟੈਂਸੀ, ਗਲਤੀ ਦਰ, ਵਾਲੀਅਮ) 2) ਇਨਪੁਟ/ਡਾਟਾ (ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ ਸ਼ਿਫਟ, ਗੁੰਮ ਮੁੱਲ, ਨਵੀਂ ਸ਼੍ਰੇਣੀ) 3) ਮਾਡਲ/ਆਊਟਪੁੱਟ (ਪੂਰਵ ਅਨੁਮਾਨ ਵੰਡ, ਵਿਸ਼ਵਾਸ, ਸ਼ੁੱਧਤਾ ਜੇ ਸੰਭਵ ਹੋਵੇ) ਮਾਡਲ: [ਵੇਰਵਾ]। ਅਸਲ ਨਤੀਜਾ ਆਉਣ ਵਿੱਚ ਕਿੰਨਾ ਸਮਾਂ ਲੱਗਦਾ ਹੈ: [ਅਵਧੀ] ਹਰੇਕ ਮੈਟ੍ਰਿਕ ਲਈ ਥ੍ਰੈਸ਼ਹੋਲਡ ਅਤੇ ਦਖਲ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਸ਼ਾਮਲ ਕਰੋ।

ਇਸ LLM ਪ੍ਰਣਾਲੀ ਲਈ ਇੱਕ ਮੁਲਾਂਕਣ (ਮੁਲਾਂਕਣ) ਰਣਨੀਤੀ ਦਾ ਪ੍ਰਸਤਾਵ ਕਰੋ। ਕੰਮ: [ਵੇਰਵਾ] ਪਰਤਾਂ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰੋ:- ਹਰੇਕ ਆਉਟਪੁੱਟ 'ਤੇ ਕਿਹੜੇ ਨਿਯਮ-ਅਧਾਰਿਤ ਜਾਂਚਾਂ ਚੱਲਣੀਆਂ ਚਾਹੀਦੀਆਂ ਹਨ? - LLM-ਆਰਬਿਟਰੇਟਰ ਨੂੰ ਕਿਹੜੇ ਮਾਪਦੰਡਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਮਾਣਿਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ (ਮਨੁੱਖੀ ਐਂਕਰ)? - ਕਿਸ ਨਮੂਨੇ ਵਿੱਚ ਮਨੁੱਖੀ ਮੁਲਾਂਕਣ ਨੂੰ ਰੱਖਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਸੁਰੱਖਿਆ ਦੇ ਮਾਮਲਿਆਂ ਵਿੱਚ ਮੁਲਾਂਕਣ ਕਰਨ ਵਾਲੇ ਨੂੰ ਨਿਰਧਾਰਿਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

ਇਸ LLM-ਰੈਫਰੀ ਪ੍ਰੋਂਪਟ ਦੀ ਜਾਂਚ ਕਰੋ:- ਕੀ ਮੁਲਾਂਕਣ ਦੇ ਮਾਪਦੰਡ ਸਪਸ਼ਟ ਜਾਂ ਵਿਅਕਤੀਗਤ ਹੈ?- ਕੀ ਇਹ ਲੰਬਾਈ/ਵਿਸ਼ਵਾਸ ਪੱਖਪਾਤ ਦੀ ਸੰਭਾਵਨਾ ਹੈ?- ਮੈਂ ਮਨੁੱਖੀ ਟੈਗਾਂ ਨਾਲ ਰੈਫਰੀ ਨੂੰ ਕਿਵੇਂ ਕੈਲੀਬਰੇਟ ਕਰਾਂ? ਰੈਫਰੀ ਪ੍ਰੋਂਪਟ: [ਪ੍ਰੋਂਪਟ]

ਇਸ ਨਿਗਰਾਨੀ ਅਲਾਰਮ ਲਈ ਇੱਕ ਜਵਾਬ ਰਨਬੁੱਕ ਲਿਖੋ। ਅਲਾਰਮ: [ਉਦਾ. ਇਨਪੁਟ ਡ੍ਰਾਈਫਟ ਥ੍ਰੈਸ਼ਹੋਲਡ ਵੱਧ ਗਿਆ] ਇਹ ਸ਼ਾਮਲ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ: ਸ਼ੁਰੂਆਤੀ ਨਿਯੰਤਰਣ ਪੜਾਅ, ਸੰਭਾਵੀ ਕਾਰਨ, ਰੋਲਬੈਕ ਮਾਪਦੰਡ, ਕਿਸ ਨੂੰ ਸੂਚਿਤ ਕਰਨਾ ਹੈ।

ਵਿਗਾੜ ਦਾ ਕਾਰਨ ਸਾਰਣੀ

ਵਿਗਾੜ

ਲੱਛਣ

ਜਲਦੀ ਪਤਾ ਲਗਾਉਣ ਦਾ ਤਰੀਕਾ

ਡਾਟਾ ਵਹਾਅ

ਇੰਪੁੱਟ ਵੰਡ ਤਬਦੀਲੀਆਂ

ਇੰਪੁੱਟ ਵੰਡ ਨਿਗਰਾਨੀ

ਸੰਕਲਪ ਤਬਦੀਲੀ

ਧਾਰਮਿਕਤਾ ਚੁੱਪਚਾਪ ਡਿੱਗ ਜਾਂਦੀ ਹੈ

ਭਵਿੱਖਬਾਣੀ + ਅਸਲ ਤੁਲਨਾ

ਅੱਪਸਟਰੀਮ ਗਲਤੀ

ਫੀਲਡ ਖਾਲੀ/ਫਾਰਮੈਟ ਬਦਲਾਅ ਹੋ ਜਾਂਦੇ ਹਨ

ਸਕੀਮਾ ਪ੍ਰਮਾਣਿਕਤਾ + ਗੁੰਮ ਦਰ

ਮਾਡਲ ਅਸੰਗਤਤਾ

ਆਉਟਪੁੱਟ ਵੰਡ ਸ਼ਿਫਟ

ਆਉਟਪੁੱਟ ਵੰਡ ਨਿਗਰਾਨੀ

ਆਮ ਗਲਤੀਆਂ

  • ਨਿਗਰਾਨੀ ਦੀ ਸਥਾਪਨਾ ਨਹੀਂ ਕੀਤੀ ਜਾ ਰਹੀ। ਮਾਡਲ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦਾ ਹੈ, ਕੋਈ ਇਸ ਨੂੰ ਨਹੀਂ ਦੇਖਦਾ.
  • ਸਿਰਫ਼ ਸੰਚਾਲਨ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਟ੍ਰੈਕ ਕਰੋ। ਸਿਸਟਮ ਤਿਆਰ ਹੈ, ਪਰ ਭਵਿੱਖਬਾਣੀਆਂ ਗਲਤ ਹੋ ਸਕਦੀਆਂ ਹਨ।
  • ਰੈਫਰੀ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੇ ਬਿਨਾਂ ਐਲਐਲਐਮ ਦੀ ਵਰਤੋਂ ਕਰਨਾ। ਇਹ ਝੂਠਾ ਭਰੋਸਾ ਦਿੰਦਾ ਹੈ।
  • ਆਸਾਨ ਉਦਾਹਰਣਾਂ ਨਾਲ ਈਵਲ। ਇਹ ਅਸਲ ਮੁਸ਼ਕਲ ਨੂੰ ਦਰਸਾਉਂਦਾ ਨਹੀਂ ਹੈ.
  • eval ਵਿੱਚ ਪਿਛਲੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਸ਼ਾਮਲ ਨਹੀਂ ਕਰਨਾ। ਉਹੀ ਗਲਤੀ ਦੁਬਾਰਾ ਆਉਂਦੀ ਹੈ।
  • ਉੱਚੀ ਅਲਾਰਮ ਟੀਮ ਅਸੰਵੇਦਨਸ਼ੀਲ ਹੋ ਜਾਂਦੀ ਹੈ, ਅਸਲ ਅਲਾਰਮ ਗੁਆ ਬੈਠਦੀ ਹੈ।

ਸੰਖੇਪ ਵਿੱਚ

ਉਤਪਾਦਨ ਵਿੱਚ ਤਰੁੱਟੀਆਂ ਪੈਦਾ ਕੀਤੇ ਬਿਨਾਂ ਮਾਡਲ ਗਲਤ ਹੋ ਸਕਦਾ ਹੈ; ਇਸ ਲਈ eval ਅਤੇ ਨਿਗਰਾਨੀ ਵਿਕਾਸ ਵਾਂਗ ਹੀ ਮਹੱਤਵਪੂਰਨ ਹਨ। ਤਿੰਨ ਲੇਅਰਾਂ (ਕਾਰਜਸ਼ੀਲ, ਇਨਪੁਟ, ਆਉਟਪੁੱਟ) 'ਤੇ ਨਿਗਰਾਨੀ ਸਥਾਪਤ ਕਰੋ; ਜੇਕਰ ਅਸਲ ਨਤੀਜੇ ਵਿੱਚ ਦੇਰੀ ਹੁੰਦੀ ਹੈ ਤਾਂ ਸ਼ੁਰੂਆਤੀ ਚੇਤਾਵਨੀ ਦੇ ਤੌਰ 'ਤੇ ਇਨਪੁਟ ਡ੍ਰਾਈਫਟ ਦੀ ਵਰਤੋਂ ਕਰੋ। LLM ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ, eval ਓਪਨ-ਐਂਡ ਹੈ; ਨਿਯਮ ਜਾਂਚਾਂ, LLM-ਰੈਫਰੀ, ਅਤੇ ਮਨੁੱਖੀ ਮੁਲਾਂਕਣ ਨੂੰ ਇਕੱਠੇ ਵਰਤੋ — ਪਰ ਮਨੁੱਖੀ ਐਂਕਰ ਨਾਲ LLM-ਰੈਫਰੀ ਨੂੰ ਪ੍ਰਮਾਣਿਤ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ। ਆਪਣੇ ਈਵਲ ਕਲੱਸਟਰ ਨੂੰ ਕਿਨਾਰੇ ਅਤੇ ਸੁਰੱਖਿਆ ਕੇਸਾਂ ਨਾਲ ਭਰਪੂਰ ਬਣਾਓ ਅਤੇ ਹਰ ਫੜੀ ਗਈ ਗਲਤੀ ਨੂੰ ਸਥਾਈ ਟੈਸਟ ਕੇਸ ਵਿੱਚ ਬਦਲੋ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਇੱਕ ਉਤਪਾਦਨ (ਜਾਂ ਨੇੜੇ-ਉਤਪਾਦਨ) ਮਾਡਲ ਲਈ ਇੱਕ ਤਿੰਨ-ਲੇਅਰ ਨਿਗਰਾਨੀ ਯੋਜਨਾ ਲਿਖੋ ਅਤੇ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਇਨਪੁਟ-ਵੰਡ ਮੀਟ੍ਰਿਕ ਲਈ ਥ੍ਰੈਸ਼ਹੋਲਡ + ਅਲਾਰਮ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰੋ। ਜੇਕਰ ਤੁਹਾਡੇ ਕੋਲ ਇੱਕ LLM ਸਿਸਟਮ ਹੈ: ਮਨੁੱਖਾਂ ਨਾਲ 30 ਆਉਟਪੁੱਟਾਂ ਨੂੰ ਟੈਗ ਕਰੋ, ਉਸੇ ਆਉਟਪੁੱਟ 'ਤੇ ਇੱਕ LLM-ਰੈਫਰੀ ਚਲਾਓ, ਅਤੇ ਮਨੁੱਖੀ-ਰੈਫਰੀ ਸਮਝੌਤੇ ਨੂੰ ਮਾਪੋ; ਰੈਫਰੀ ਦੇ ਯੋਜਨਾਬੱਧ ਪੱਖਪਾਤ ਵੱਲ ਧਿਆਨ ਦਿਓ। ਆਪਣੇ ਈਵਲ ਕਲੱਸਟਰ ਵਿੱਚ ਘੱਟੋ-ਘੱਟ 3 ਕਿਨਾਰੇ ਅਤੇ 2 ਸੁਰੱਖਿਆ ਕੇਸ ਸ਼ਾਮਲ ਕਰੋ।

ਚੈੱਕਲਿਸਟ

  • ਮਾਨੀਟਰਿੰਗ ਸਾਰੀਆਂ ਤਿੰਨ ਪਰਤਾਂ (ਕਾਰਜਸ਼ੀਲ, ਇਨਪੁਟ, ਆਉਟਪੁੱਟ) ਨੂੰ ਕਵਰ ਕਰਦੀ ਹੈ।
  • ਜੇਕਰ ਅਸਲ ਨਤੀਜੇ ਵਿੱਚ ਦੇਰੀ ਹੁੰਦੀ ਹੈ ਤਾਂ ਮੈਂ ਸ਼ੁਰੂਆਤੀ ਚੇਤਾਵਨੀ ਦੇ ਤੌਰ 'ਤੇ ਇਨਪੁਟ ਡ੍ਰਾਈਫਟ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹਾਂ।
  • [ ] ਮੈਂ ਮਨੁੱਖੀ ਲੇਬਲਾਂ ਨਾਲ LLM-ਆਰਬਿਟਰੇਟਰ ਨੂੰ ਕੈਲੀਬਰੇਟ ਕੀਤਾ।
  • [ ] ਈਵਲ ਕਲੱਸਟਰ ਵਿੱਚ ਕਿਨਾਰੇ ਅਤੇ ਸੁਰੱਖਿਆ ਕੇਸ ਸ਼ਾਮਲ ਹਨ।
  • [ ] ਮੈਂ ਫੜੇ ਗਏ ਹਰ ਬੱਗ ਨੂੰ ਇੱਕ ਸਥਾਈ ਟੈਸਟ ਕੇਸ ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ।
  • [ ] ਹਰੇਕ ਮਹੱਤਵਪੂਰਨ ਮੈਟ੍ਰਿਕ ਦੀ ਇੱਕ ਥ੍ਰੈਸ਼ਹੋਲਡ ਅਤੇ ਜਵਾਬ ਯੋਜਨਾ ਹੁੰਦੀ ਹੈ।