ਲਾਭ:
- MLOps ਪੜਾਵਾਂ (ਰਿਲੀਜ਼, ਤੈਨਾਤੀ, ਨਿਗਰਾਨੀ, ਮੁੜ ਸਿਖਲਾਈ, ਰੋਲਬੈਕ) ਅਤੇ ਮਾਡਲ ਡ੍ਰਾਈਫਟ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਨਿਗਰਾਨੀ ਕੀਤੀ ਤੈਨਾਤੀ ਦੀ ਯੋਜਨਾ ਬਣਾਓ
- ਮਾਡਲ ਨਿਰਪੱਖਤਾ, ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਜਵਾਬਦੇਹੀ ਦੇ ਸਿਧਾਂਤਾਂ ਨੂੰ ਲਾਗੂ ਕਰਨ ਅਤੇ ਨੈਤਿਕ ਸਵੀਕਾਰਤਾ ਤੋਂ ਅੰਕੜਾ ਸ਼ੁੱਧਤਾ ਨੂੰ ਵੱਖ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
- KVKK/GDPR ਸਿਧਾਂਤਾਂ ਨਾਲ ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਰੱਖਿਆ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ ਵਿੱਚ ਮਨੁੱਖ ਨੂੰ ਅੰਤਮ ਜ਼ਿੰਮੇਵਾਰੀ ਸੌਂਪਣ ਦੀ ਸਮਰੱਥਾ
ਇੱਕ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣਾ ਅਤੇ ਉੱਚ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਨਾ ਅੰਤ ਨਹੀਂ ਹੈ, ਪਰ ਮੱਧ ਹੈ. ਅਸਲ ਮੁੱਲ ਉਦੋਂ ਆਉਂਦਾ ਹੈ ਜਦੋਂ ਮਾਡਲ ਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ, ਸਮੇਂ ਦੇ ਨਾਲ ਬਿਨਾਂ ਕਿਸੇ ਵਿਗਾੜ ਦੇ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਸਾਰੀ ਪ੍ਰਕਿਰਿਆ ਨੈਤਿਕ ਅਤੇ ਕਾਨੂੰਨੀ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਕਲੋਜ਼ਿੰਗ ਯੂਨਿਟ ਤਿੰਨ ਵਿਸ਼ਿਆਂ ਨੂੰ ਜੋੜਦੀ ਹੈ: MLOps (ਮਾਡਲਾਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਅਤੇ ਸੰਭਾਲਣ ਦਾ ਅਨੁਸ਼ਾਸਨ), ਨੈਤਿਕਤਾ (ਨਿਰਪੱਖਤਾ, ਪਾਰਦਰਸ਼ਤਾ, ਗੈਰ-ਨੁਕਸਾਨ) ਅਤੇ ਗੋਪਨੀਯਤਾ (ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਸੁਰੱਖਿਆ)। AI ਇਹਨਾਂ ਖੇਤਰਾਂ ਵਿੱਚ ਕੋਡ, ਚੈਕਲਿਸਟਸ ਅਤੇ ਬਲੂਪ੍ਰਿੰਟ ਤਿਆਰ ਕਰਦਾ ਹੈ; ਪਰ ਮਨੁੱਖ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਕੋਈ ਮਾਡਲ ਲਾਈਵ ਹੁੰਦਾ ਹੈ, ਕੌਣ ਪ੍ਰਭਾਵਿਤ ਹੋਵੇਗਾ, ਅਤੇ ਕਿਹੜਾ ਡੇਟਾ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਫੈਸਲੇ ਤਕਨੀਕੀ ਨਹੀਂ, ਸਗੋਂ ਜ਼ਿੰਮੇਵਾਰੀ ਵਾਲੇ ਫੈਸਲੇ ਹਨ।
MLOps: ਮਾਡਲ ਇੱਕ ਉਤਪਾਦ ਵਾਂਗ ਰਹਿੰਦਾ ਹੈ
MLOps (ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਓਪਰੇਸ਼ਨਜ਼ - ਉਤਪਾਦਨ ਵਿੱਚ ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ, ਨਿਗਰਾਨੀ ਕਰਨ ਅਤੇ ਅੱਪਡੇਟ ਕਰਨ ਦਾ ਅਭਿਆਸ) ਡੇਟਾ ਵਿਗਿਆਨ ਵਿੱਚ ਸੌਫਟਵੇਅਰ ਵਿਕਾਸ ਵਿੱਚ DevOps ਦਾ ਅਨੁਕੂਲਨ ਹੈ। ਮੂਲ ਵਿਚਾਰ: ਇੱਕ ਮਾਡਲ ਇੱਕ ਫਾਈਲ ਨਹੀਂ ਹੈ ਜੋ ਇੱਕ ਵਾਰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਭੁੱਲ ਜਾਂਦੀ ਹੈ, ਪਰ ਇੱਕ ਜੀਵਿਤ ਉਤਪਾਦ ਜਿਸਦੀ ਨਿਰੰਤਰ ਦੇਖਭਾਲ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ. ਮੁੱਖ ਪੜਾਅ:
1. ਵਰਜਨਿੰਗ: ਕੋਡ (Git), ਡੇਟਾ ਅਤੇ ਮਾਡਲ ਇਕੱਠੇ ਵਰਜਨ ਕੀਤੇ ਗਏ ਹਨ; ਇਹ ਰਿਕਾਰਡ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਕਿ ਕਿਹੜਾ ਮਾਡਲ ਕਿਸ ਡੇਟਾ ਅਤੇ ਕੋਡ ਨਾਲ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਸੀ।
2. ਤੈਨਾਤੀ: ਮਾਡਲ ਨੂੰ ਇੱਕ API ਜਾਂ ਬੈਚ ਜੌਬ ਵਜੋਂ ਲਾਈਵ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਪਹਿਲਾਂ ਛੋਟੇ ਦਰਸ਼ਕਾਂ ਨੂੰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ (ਸ਼ੇਡ/ਕੈਨਰੀ ਵੰਡ)।
3. ਨਿਗਰਾਨੀ: ਮਾਡਲ ਅਤੇ ਇਨਪੁਟ ਡੇਟਾ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਨਿਰੰਤਰ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।
4. ਮੁੜ ਸਿਖਲਾਈ: ਜਦੋਂ ਪ੍ਰਦਰਸ਼ਨ ਘਟਦਾ ਹੈ, ਮਾਡਲ ਨੂੰ ਅੱਪਡੇਟ ਕੀਤੇ ਡੇਟਾ ਨਾਲ ਦੁਬਾਰਾ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ।
ਪੈਟਰਨ ਸ਼ਿਫਟ: ਚੁੱਪ ਵਿਗਾੜ
ਉਤਪਾਦਨ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਡਾ ਖ਼ਤਰਾ ਮਾਡਲ ਡਰਾਫਟ (ਮਾਡਲ ਡਰਾਫਟ/ਡਾਟਾ ਡਰਾਫਟ) ਹੈ। ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ; ਉਹ ਸ਼ਰਤਾਂ ਜਿਨ੍ਹਾਂ 'ਤੇ ਤੁਸੀਂ ਆਪਣੇ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ (ਗਾਹਕ ਵਿਹਾਰ, ਕੀਮਤਾਂ, ਸੀਜ਼ਨ, ਕਾਨੂੰਨ) ਸਮੇਂ ਦੇ ਨਾਲ ਬਦਲ ਜਾਂਦੇ ਹਨ ਅਤੇ ਮਾਡਲ ਪੁਰਾਣਾ ਹੋਣਾ ਸ਼ੁਰੂ ਹੋ ਜਾਂਦਾ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਮਹਾਂਮਾਰੀ ਤੋਂ ਪਹਿਲਾਂ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਇੱਕ ਮੰਗ ਮਾਡਲ ਮਹਾਂਮਾਰੀ ਦੌਰਾਨ ਪੂਰੀ ਤਰ੍ਹਾਂ ਗਲਤ ਹੈ। ਡ੍ਰਾਈਫਟ ਦੋ ਰੂਪਾਂ ਵਿੱਚ ਹੁੰਦਾ ਹੈ: ਡੇਟਾ ਡ੍ਰਾਈਫਟ (ਇਨਪੁਟ ਡੇਟਾ ਤਬਦੀਲੀਆਂ ਦੀ ਵੰਡ) ਅਤੇ ਸੰਕਲਪ ਡ੍ਰਾਈਫਟ (ਇਨਪੁਟ ਅਤੇ ਟੀਚੇ ਵਿੱਚ ਤਬਦੀਲੀਆਂ ਵਿਚਕਾਰ ਸਬੰਧ)। ਇਹਨਾਂ ਨੂੰ ਹਾਸਲ ਕਰਨ ਦਾ ਤਰੀਕਾ ਨਿਗਰਾਨੀ ਹੈ: ਅਸਲ ਨਤੀਜੇ ਦੇ ਮੁਕਾਬਲੇ ਇਨਪੁਟ ਵੰਡ, ਪੂਰਵ ਅਨੁਮਾਨ ਵੰਡ, ਅਤੇ (ਜੇ ਸੰਭਵ ਹੋਵੇ) ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਲਗਾਤਾਰ ਟਰੈਕ ਕਰੋ।
ਸਾਵਧਾਨ: ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਮਾਡਲ ਆਪਣੇ ਆਪ ਹੀ ਵਿਗੜ ਜਾਵੇਗਾ; ਇਹ "ਜੇ" ਪਰ "ਕਦੋਂ" ਦੀ ਗੱਲ ਨਹੀਂ ਹੈ। ਨਿਰੀਖਣ ਸਥਾਪਤ ਕੀਤੇ ਬਿਨਾਂ ਮਾਡਲਾਂ ਨੂੰ ਤੈਨਾਤ ਕਰਨਾ ਇੱਕ ਕਾਰ ਨੂੰ ਆਪਣੇ ਇੰਜਣ ਨੂੰ ਨਿਯੰਤਰਿਤ ਕੀਤੇ ਬਿਨਾਂ ਚਲਾਉਣ ਵਰਗਾ ਹੈ; ਇੱਕ ਦਿਨ ਇਹ ਚੁੱਪਚਾਪ ਉੱਥੇ ਬੈਠ ਜਾਂਦਾ ਹੈ ਅਤੇ ਤੁਸੀਂ ਧਿਆਨ ਨਹੀਂ ਦਿੰਦੇ.
MLOps ਤੱਤ
ਮਕਸਦ
ਜੇਕਰ ਅਣਗਹਿਲੀ ਕੀਤੀ ਜਾਵੇ
ਸੰਸਕਰਣ
ਇਹ ਜਾਣਨਾ ਕਿ ਕੀ ਪੈਦਾ ਹੁੰਦਾ ਹੈ
ਗੈਰ-ਪ੍ਰਜਣਨਯੋਗ, ਗੈਰ-ਪ੍ਰਾਪਤ ਕਰਨ ਯੋਗ
ਨਿਗਰਾਨੀ
ਤਿਲਕ ਜਲਦੀ ਦੇਖ ਕੇ
ਮਾਡਲ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦਾ ਹੈ
ਮੁੜ ਸਿਖਲਾਈ
ਅੱਪ ਟੂ ਡੇਟ ਰਹੋ
ਭਵਿੱਖਬਾਣੀਆਂ ਪੁਰਾਣੀਆਂ ਹੋ ਜਾਂਦੀਆਂ ਹਨ
ਰੋਲਬੈਕ
ਮਾੜੇ ਮਾਡਲ 'ਤੇ ਵਾਪਸ ਜਾਓ
ਨੁਕਸਦਾਰ ਮਾਡਲ ਲਾਈਵ ਰਹਿੰਦਾ ਹੈ
ਦਸਤਾਵੇਜ਼ੀਕਰਨ
ਪਾਰਦਰਸ਼ਤਾ, ਟਰਨਓਵਰ
ਜਾਣਕਾਰੀ ਇੱਕ ਵਿਅਕਤੀ ਵਿੱਚ ਫਸ ਜਾਂਦੀ ਹੈ
ਨੈਤਿਕਤਾ: ਮਾਡਲ ਦੇ ਫੈਸਲੇ ਲੋਕਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦੇ ਹਨ
ਡੇਟਾ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਉਹਨਾਂ ਫੈਸਲਿਆਂ ਵਿੱਚ ਵੱਧਦੀ ਜਾ ਰਹੀ ਹੈ ਜੋ ਲੋਕਾਂ ਦੇ ਜੀਵਨ ਨੂੰ ਪ੍ਰਭਾਵਤ ਕਰਦੇ ਹਨ: ਕ੍ਰੈਡਿਟ, ਭਰਤੀ, ਬੀਮਾ, ਨਿਆਂ। ਇਸ ਸ਼ਕਤੀ ਨਾਲ ਜ਼ਿੰਮੇਵਾਰੀ ਆਉਂਦੀ ਹੈ। ਮੁੱਖ ਨੈਤਿਕ ਜੋਖਮ:
ਪੱਖਪਾਤ ਅਤੇ ਵਿਤਕਰਾ: ਮਾਡਲ ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਬੇਇਨਸਾਫ਼ੀ ਨੂੰ ਸਿੱਖ ਸਕਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਕਾਇਮ ਰੱਖ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਕਿਸੇ ਖਾਸ ਸਮੂਹ ਨੂੰ ਅਤੀਤ ਵਿੱਚ ਘੱਟ ਕ੍ਰੈਡਿਟ ਦਿੱਤਾ ਗਿਆ ਹੈ, ਤਾਂ ਮਾਡਲ ਮੰਨਦਾ ਹੈ ਕਿ ਇਹ ਇੱਕ "ਨਿਯਮ" ਹੈ ਅਤੇ ਵਿਤਕਰੇ ਨੂੰ ਸਵੈਚਾਲਤ ਕਰਦਾ ਹੈ। ਇਸ ਲਈ ਨਿਰਪੱਖਤਾ ਵਿਸ਼ਲੇਸ਼ਣ — ਇਹ ਜਾਂਚਣਾ ਕਿ ਕੀ ਮਾਡਲ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ (ਲਿੰਗ, ਉਮਰ, ਖੇਤਰ) ਲਈ ਸਮਾਨ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ — ਜ਼ਰੂਰੀ ਹੈ।
ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਵਿਆਖਿਆਯੋਗਤਾ: ਤੁਹਾਨੂੰ ਇਹ ਦੱਸਣ ਦੇ ਯੋਗ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਨੇ ਇੱਕ ਵਿਅਕਤੀ ਨੂੰ ਕਿਉਂ ਰੱਦ ਕੀਤਾ। "ਬਲੈਕ ਬਾਕਸ ਨੇ ਅਜਿਹਾ ਕਿਹਾ" ਨੈਤਿਕ ਤੌਰ 'ਤੇ ਅਤੇ ਅਕਸਰ ਕਾਨੂੰਨੀ ਤੌਰ 'ਤੇ ਅਸਵੀਕਾਰਨਯੋਗ ਹੈ। ਇਸ ਲਈ ਵਿਆਖਿਆਯੋਗਤਾ ਸਾਧਨ (ਵਿਸ਼ੇਸ਼ਤਾ ਮਹੱਤਵ, SHAP ਮੁੱਲ) ਕੀਮਤੀ ਹਨ।
ਜਵਾਬਦੇਹੀ: ਜੇ ਮਾਡਲ ਗਲਤ ਫੈਸਲਾ ਲੈਂਦਾ ਹੈ ਤਾਂ ਕੌਣ ਜ਼ਿੰਮੇਵਾਰ ਹੈ? ਜਵਾਬ ਹਮੇਸ਼ਾ ਇੱਕ ਵਿਅਕਤੀ/ਸੰਸਥਾ ਹੁੰਦਾ ਹੈ, ਇੱਕ ਮਾਡਲ ਨਹੀਂ। ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ (ਮਨੁੱਖੀ-ਇਨ-ਦੀ-ਲੂਪ - ਅੰਤਮ ਫੈਸਲੇ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦੇਣ ਵਾਲਾ ਮਨੁੱਖ) ਨੂੰ ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ ਵਿੱਚ ਸੁਰੱਖਿਅਤ ਰੱਖਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।
ਸਾਵਧਾਨ: ਇੱਕ ਮਾਡਲ ਅੰਕੜਾਤਮਕ ਤੌਰ 'ਤੇ "ਸਹੀ" ਹੋ ਸਕਦਾ ਹੈ ਪਰ ਨੈਤਿਕ ਤੌਰ 'ਤੇ ਅਸਵੀਕਾਰਨਯੋਗ ਹੈ। ਇੱਕ ਬਹੁਤ ਹੀ ਸਟੀਕ ਮਾਡਲ ਜੋ ਇੱਕ ਸਮੂਹ ਨੂੰ ਵਿਵਸਥਿਤ ਰੂਪ ਵਿੱਚ ਨੁਕਸਾਨ ਪਹੁੰਚਾਉਂਦਾ ਹੈ ਇੱਕ ਚੰਗਾ ਮਾਡਲ ਨਹੀਂ ਹੈ। ਇਮਾਨਦਾਰੀ ਇਨਸਾਫ਼ ਦਾ ਕੋਈ ਬਦਲ ਨਹੀਂ ਹੈ।
ਗੋਪਨੀਯਤਾ: ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ ਧਿਆਨ ਨਾਲ ਸੁਰੱਖਿਅਤ ਕੀਤਾ ਗਿਆ ਹੈ
ਡੇਟਾ ਵਿਗਿਆਨ ਦਾ ਕੱਚਾ ਮਾਲ ਅਕਸਰ ਨਿੱਜੀ ਡੇਟਾ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਇਹ ਡੇਟਾ ਕਾਨੂੰਨ ਦੁਆਰਾ ਸੁਰੱਖਿਅਤ ਹੁੰਦਾ ਹੈ: ਤੁਰਕੀਏ ਵਿੱਚ ਕੇਵੀਕੇਕੇ, ਯੂਰਪ ਵਿੱਚ ਜੀਡੀਪੀਆਰ। ਮੂਲ ਸਿਧਾਂਤ ਹਨ: ਉਦੇਸ਼ ਸੀਮਾ (ਡਾਟਾ ਉਸ ਉਦੇਸ਼ ਤੋਂ ਇਲਾਵਾ ਹੋਰ ਉਦੇਸ਼ਾਂ ਲਈ ਨਹੀਂ ਵਰਤਿਆ ਜਾਂਦਾ ਜਿਸ ਲਈ ਇਸ ਨੂੰ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ ਸੀ), ਡੇਟਾ ਮਿਨੀਮਾਈਜ਼ੇਸ਼ਨ (ਲੋੜ ਤੋਂ ਵੱਧ ਕੋਈ ਡਾਟਾ ਇਕੱਠਾ/ਰੱਖਿਆ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ), ਅਗਿਆਤਤਾ (ਜਾਣਕਾਰੀ ਦੀ ਪਛਾਣ ਹਟਾ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ) ਅਤੇ ਸੁਰੱਖਿਆ (ਡੇਟਾ ਏਨਕ੍ਰਿਪਟਡ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਪਹੁੰਚ ਪ੍ਰਤਿਬੰਧਿਤ ਹੈ)। AI ਟੂਲਸ ਨਾਲ ਕੰਮ ਕਰਦੇ ਸਮੇਂ ਨਾਜ਼ੁਕ ਨਿਯਮ: ਕਦੇ ਵੀ ਅਸਲੀ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ ਜਨਤਕ AI ਟੂਲ ਵਿੱਚ ਪੇਸਟ ਨਾ ਕਰੋ। ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ, ਇੱਕ ਚਿੱਤਰ ਅਤੇ ਇੱਕ ਅਗਿਆਤ/ਸਿੰਥੈਟਿਕ ਨਮੂਨਾ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਕਾਫੀ ਹੁੰਦੇ ਹਨ।
ਜਾਣਕਾਰੀ ਸੁਰੱਖਿਆ ਦੇ ਸੰਦਰਭ ਵਿੱਚ ਇੱਕ ਵਾਧੂ ਜ਼ੋਰ: ਰੱਖਿਆਤਮਕ ਅਤੇ ਜਾਇਜ਼ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਉਦੇਸ਼ਾਂ ਲਈ, ਡੇਟਾ ਵਿਗਿਆਨ ਦੇ ਸਾਧਨਾਂ ਅਤੇ ਤਕਨੀਕਾਂ ਦੀ ਵਰਤੋਂ ਸਿਰਫ਼ ਉਹਨਾਂ ਡੇਟਾ ਅਤੇ ਪ੍ਰਣਾਲੀਆਂ 'ਤੇ ਕਰੋ ਜਿਨ੍ਹਾਂ ਲਈ ਤੁਹਾਡੇ ਕੋਲ ਅਧਿਕਾਰ ਹੈ। ਕਿਸੇ ਹੋਰ ਦੇ ਡੇਟਾ ਤੱਕ ਅਣਅਧਿਕਾਰਤ ਪਹੁੰਚ, ਵਿਅਕਤੀਆਂ ਦੀ ਮੁੜ-ਪਛਾਣ (ਅਗਿਆਤ ਡੇਟਾ ਤੋਂ ਪਛਾਣ ਕੱਢਣਾ) ਜਾਂ ਅਣਅਧਿਕਾਰਤ ਪ੍ਰੋਫਾਈਲਿੰਗ ਦੋਵੇਂ ਗੈਰ-ਕਾਨੂੰਨੀ ਅਤੇ ਅਨੈਤਿਕ ਹਨ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 — ਟਰੈਕ ਨਾ ਕੀਤਾ ਗਿਆ ਢਹਿ। ਇੱਕ ਈ-ਕਾਮਰਸ ਕੰਪਨੀ ਆਪਣੇ ਸਿਫ਼ਾਰਿਸ਼ ਮਾਡਲ ਦੇ ਨਾਲ ਲਾਈਵ ਹੋ ਗਈ ਅਤੇ ਟਰੈਕਿੰਗ ਸੈਟ ਅਪ ਨਹੀਂ ਕੀਤੀ। 4 ਮਹੀਨਿਆਂ ਬਾਅਦ ਉਤਪਾਦ ਕੈਟਾਲਾਗ ਬਹੁਤ ਬਦਲ ਗਿਆ ਹੈ; ਮਾਡਲ ਪੁਰਾਣੇ ਉਤਪਾਦਾਂ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦਾ ਰਿਹਾ, ਅਤੇ ਪਰਿਵਰਤਨ ਦਰ ਚੁੱਪਚਾਪ 30% ਤੱਕ ਘਟ ਗਈ। ਮਹੀਨਿਆਂ ਬੱਧੀ ਕਿਸੇ ਦਾ ਧਿਆਨ ਨਹੀਂ ਗਿਆ। ਸਬਕ: ਬਿਨਾਂ ਨਿਗਰਾਨੀ ਦੇ ਤੈਨਾਤੀ ਅੰਨ੍ਹੇ ਹੋ ਰਹੀ ਹੈ।
ਕੇਸ 2 - ਲੁਕਿਆ ਹੋਇਆ ਵਿਤਕਰਾ। ਇੱਕ ਹਾਇਰਿੰਗ ਸਕ੍ਰੀਨਿੰਗ ਮਾਡਲ ਨੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਲਿੰਗ ਅਸੰਤੁਲਨ ਅਤੇ ਯੋਜਨਾਬੱਧ ਤੌਰ 'ਤੇ ਘੱਟ ਦਰਜਾ ਪ੍ਰਾਪਤ ਮਹਿਲਾ ਉਮੀਦਵਾਰਾਂ ਬਾਰੇ ਸਿੱਖਿਆ। ਇਹ ਧਿਆਨ ਨਹੀਂ ਦਿੱਤਾ ਗਿਆ ਕਿਉਂਕਿ ਕੋਈ ਨਿਰਪੱਖਤਾ ਵਿਸ਼ਲੇਸ਼ਣ ਨਹੀਂ ਸੀ; ਇਹ ਇੱਕ ਆਡਿਟ ਵਿੱਚ ਸਾਹਮਣੇ ਆਇਆ ਸੀ ਅਤੇ ਸੰਸਥਾ ਨੂੰ ਗੰਭੀਰ ਪ੍ਰਤਿਸ਼ਠਾ/ਕਾਨੂੰਨੀ ਜੋਖਮ ਦਾ ਸਾਹਮਣਾ ਕਰਨਾ ਪਿਆ ਸੀ। ਸਬਕ: ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਮਾਡਲਾਂ ਵਿੱਚ ਸਮੂਹ-ਅਧਾਰਿਤ ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ ਜ਼ਰੂਰੀ ਹੈ।
ਕੇਸ 3 - ਗੁਪਤਤਾ ਦੀ ਉਲੰਘਣਾ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ ਇੱਕ ਜਨਤਕ ਏਆਈ ਟੂਲ ਵਿੱਚ ਅਸਲ ਗਾਹਕ ਈਮੇਲਾਂ ਅਤੇ ਖਰੀਦ ਇਤਿਹਾਸ ਵਾਲੀ ਇੱਕ ਫਾਈਲ ਲੋਡ ਕੀਤੀ ਅਤੇ ਕਿਹਾ, "ਖੰਡਾਂ ਨੂੰ ਸੰਖੇਪ ਕਰੋ।" ਨਿੱਜੀ ਡੇਟਾ ਨੇ ਸੰਸਥਾ ਨੂੰ ਛੱਡ ਦਿੱਤਾ ਹੈ; KVKK ਪ੍ਰਕਿਰਿਆ ਸ਼ੁਰੂ ਹੋ ਗਈ ਹੈ। ਸਹੀ ਤਰੀਕਾ ਪਛਾਣ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾਉਣਾ ਅਤੇ ਸਿਰਫ਼ ਬੇਨਾਮੀ ਸੰਪਤੀਆਂ ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ ਸੀ। ਸਬਕ: ਅਸਲ ਨਿੱਜੀ ਡੇਟਾ ਓਪਨ ਟੂਲ ਵਿੱਚ ਦਾਖਲ ਨਹੀਂ ਹੁੰਦਾ।
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) ਪ੍ਰੀ-ਡਿਪਲਾਇਮੈਂਟ ਚੈੱਕਲਿਸਟ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: MLOps ਸਲਾਹਕਾਰ। ਉਹਨਾਂ ਚੀਜ਼ਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ ਜਿਨ੍ਹਾਂ ਦੀ ਮੈਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਮਾਡਲ ਲਗਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਜਾਂਚ ਕਰਨ ਦੀ ਲੋੜ ਹੈ: ਸੰਸਕਰਣ, ਨਿਗਰਾਨੀ ਮੈਟ੍ਰਿਕਸ, ਰੋਲਬੈਕ ਯੋਜਨਾ, ਪ੍ਰਦਰਸ਼ਨ ਥ੍ਰੈਸ਼ਹੋਲਡ, ਡੇਟਾ ਡ੍ਰਾਈਫਟ ਚੇਤਾਵਨੀ, ਜ਼ਿੰਮੇਵਾਰ ਵਿਅਕਤੀ। ਹਰੇਕ ਆਈਟਮ ਲਈ ਇੱਕ-ਵਾਕ "ਇਹ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ" ਵਿਆਖਿਆ ਸ਼ਾਮਲ ਕਰੋ। ਮੈਂ ਫੈਸਲਾ ਕਰਾਂਗਾ।
2) ਮਾਡਲ ਸ਼ਿਫਟ ਟਰੈਕਿੰਗ ਡਿਜ਼ਾਈਨ:
ਉਤਪਾਦਨ ਵਿੱਚ ਇੱਕ ਵਰਗੀਕਰਣ ਮਾਡਲ ਲਈ ਇੱਕ ਡ੍ਰਫਟ ਨਿਗਰਾਨੀ ਯੋਜਨਾ ਦਾ ਸੁਝਾਅ ਦਿਓ: (1) ਮੈਨੂੰ ਕਿਹੜੀਆਂ ਇਨਪੁਟ ਵੰਡਾਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ, (2) ਭਵਿੱਖਬਾਣੀ ਵੰਡ ਲਈ ਕਿਹੜਾ ਅਲਾਰਮ, (3) ਅਸਲ ਨਤੀਜਾ ਆਉਣ 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਤੁਲਨਾ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, (4) ਕਿਸ ਥ੍ਰੈਸ਼ਹੋਲਡ 'ਤੇ ਮੁੜ ਸਿਖਲਾਈ ਸ਼ੁਰੂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ। ਇੱਕ ਕੋਡ ਪਿੰਜਰ ਵੀ ਪ੍ਰਦਾਨ ਕਰੋ।
3) ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ:
ਕੋਡ ਲਿਖੋ ਜੋ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ ਲਈ ਮੇਰੇ ਮਾਡਲ ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਤੁਲਨਾ ਕਰਦਾ ਹੈ (ਉਦਾਹਰਨ ਲਈ ਉਮਰ ਬੈਂਡ, ਖੇਤਰ): ਹਰ ਇੱਕ ਸਮੂਹ ਲਈ ਯਾਦ/ਸ਼ੁੱਧਤਾ ਅਤੇ ਸਕਾਰਾਤਮਕ ਫੈਸਲੇ ਦੀ ਦਰ। ਜੇਕਰ ਸਮੂਹਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਅੰਤਰ ਹੈ ਤਾਂ ਚੇਤਾਵਨੀ ਦਿਓ। ਕਾਰਣ/ਰਾਜਨੀਤਿਕ ਵਿਆਖਿਆ ਕਰਨਾ; ਬੱਸ ਮੈਨੂੰ ਮਤਭੇਦ ਦਿਖਾਓ ਅਤੇ ਮੈਂ ਫੈਸਲੇ 'ਤੇ ਵਿਚਾਰ ਕਰਾਂਗਾ।
4) ਗੋਪਨੀਯਤਾ ਪ੍ਰੀ-ਚੈੱਕ:
AI ਟੂਲ ਨੂੰ ਡੇਟਾ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ, ਜਾਂਚ ਕਰੋ: ਕੀ ਹੇਠਾਂ ਦਿੱਤੇ ਕਾਲਮ ਸੂਚੀ ਵਿੱਚ ਨਿੱਜੀ/ਪਛਾਣ ਡੇਟਾ (ਨਾਮ, ਈਮੇਲ, ID, ਫ਼ੋਨ, ਪਤਾ, IP) ਹੈ? ਜੇਕਰ ਅਜਿਹਾ ਹੈ, ਤਾਂ ਸੂਚੀਬੱਧ ਕਰੋ ਕਿ ਕਿਸ ਨੂੰ ਹਟਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਜਾਂ ਅਗਿਆਤ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਕਾਲਮ: [ਸੂਚੀ]। ਉਦੇਸ਼: ਸਿਰਫ਼ ਅਗਿਆਤ ਸਕੀਮਾ ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:
ਮੇਰਾ ਮਾਡਲ ਤਿਆਰ ਹੈ, ਲਾਈਵ ਹੋਵੋ।
ਤਾਇਨਾਤੀ ਇੱਕ ਕਦਮ ਨਹੀਂ ਹੈ; ਬਿਨਾਂ ਨਿਗਰਾਨੀ, ਰੋਲਬੈਕ, ਨਿਰਪੱਖਤਾ ਅਤੇ ਗੋਪਨੀਯਤਾ ਨਿਯੰਤਰਣ ਦੇ ਲਾਈਵ ਜਾਣਾ ਤਬਾਹੀ ਲਈ ਇੱਕ ਚੁੱਪ ਸੱਦਾ ਹੈ।
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਜ਼ਿੰਮੇਵਾਰ MLOps ਸਲਾਹਕਾਰ। ਮੇਰੇ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਹੈ, ਮੈਂ ਲਾਈਵ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਪੂਰੀ ਤਿਆਰੀ ਚਾਹੁੰਦਾ ਹਾਂ। ਤਿਆਰ ਕਰੋ: (1) ਪ੍ਰੀ-ਡਿਪਲਾਇਮੈਂਟ ਚੈਕਲਿਸਟ, (2) ਡਰਿਫਟ ਨਿਗਰਾਨੀ ਯੋਜਨਾ, (3) ਸਮੂਹ-ਅਧਾਰਤ ਨਿਰਪੱਖਤਾ ਜਾਂਚ ਕੋਡ, (4) ਗੋਪਨੀਯਤਾ ਜਾਂਚ (ਕੀ ਨਿੱਜੀ ਡੇਟਾ ਹੈ)। ਇਹ ਵੀ ਸੁਝਾਅ ਦਿਓ ਕਿ ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ ਵਿੱਚ ਮਨੁੱਖੀ ਸਹਿਮਤੀ ਦੀ ਰੱਖਿਆ ਕਿਵੇਂ ਕੀਤੀ ਜਾਵੇ। ਅੰਤਿਮ ਫੈਸਲੇ ਮੇਰੇ ਹਨ।
ਇੱਥੇ ਵੰਡ, ਨਿਗਰਾਨੀ, ਨਿਰਪੱਖਤਾ ਅਤੇ ਗੋਪਨੀਯਤਾ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਜ਼ਿੰਮੇਵਾਰ ਪ੍ਰਕਿਰਿਆ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ।
ਆਮ ਗਲਤੀਆਂ
- ਨਿਰੀਖਣ ਸਥਾਪਤ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਮਾਡਲ ਤੈਨਾਤ ਕਰਨਾ। ਮਾਡਲ ਚੁੱਪਚਾਪ ਖਿਸਕ ਜਾਂਦਾ ਹੈ ਅਤੇ ਵਿਗਾੜਦਾ ਹੈ; ਧਿਆਨ ਦੇਣ ਵਿੱਚ ਮਹੀਨੇ ਲੱਗ ਸਕਦੇ ਹਨ।
- ਇਨਸਾਫ਼ ਦੀ ਜਾਂਚ ਨੂੰ ਬਾਈਪਾਸ ਕਰਨਾ. ਇੱਕ ਉੱਚ-ਵਫ਼ਾਦਾਰ ਮਾਡਲ ਇੱਕ ਸਮੂਹ ਨੂੰ ਯੋਜਨਾਬੱਧ ਤੌਰ 'ਤੇ ਨੁਕਸਾਨ ਪਹੁੰਚਾ ਸਕਦਾ ਹੈ।
- ਇੱਕ ਅਣਜਾਣ ਬਲੈਕ ਬਾਕਸ ਦਾ ਫੈਸਲਾ ਲੈਣਾ। ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲੇ ਸਮਝਾਉਣ ਯੋਗ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ; "ਮਾਡਲ ਨੇ ਅਜਿਹਾ ਕਿਹਾ" ਕਾਫ਼ੀ ਨਹੀਂ ਹੈ।
- AI ਟੂਲ ਨੂੰ ਖੋਲ੍ਹਣ ਲਈ ਅਸਲ ਨਿੱਜੀ ਡਾਟਾ ਦੇਣਾ। KVKK/GDPR ਦੀ ਉਲੰਘਣਾ; ਚਿੱਤਰ ਅਤੇ ਅਗਿਆਤ ਉਦਾਹਰਨ ਕਾਫ਼ੀ ਹਨ.
- ਮਾਡਲ ਨੂੰ ਫੈਸਲਾ ਸੌਂਪਦੇ ਹੋਏ। ਜ਼ਿੰਮੇਵਾਰੀ ਹਮੇਸ਼ਾ ਇੱਕ ਵਿਅਕਤੀ ਦੇ ਨਾਲ ਹੁੰਦੀ ਹੈ; ਉੱਚ ਪ੍ਰਭਾਵ ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ ਰੱਖੀ ਜਾਂਦੀ ਹੈ।
ਸੁਝਾਅ: ਹਰੇਕ ਮਾਡਲ ਨਾਲ ਲਾਈਵ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ, ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਇੱਕ ਸਵਾਲ ਪੁੱਛੋ: "ਜੇਕਰ ਇਹ ਮਾਡਲ ਕੱਲ੍ਹ ਨੂੰ ਚੁੱਪਚਾਪ ਤੋੜਦਾ ਹੈ ਜਾਂ ਕਿਸੇ ਸਮੂਹ ਨੂੰ ਗਲਤ ਢੰਗ ਨਾਲ ਸਜ਼ਾ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਮੈਂ ਇਸਨੂੰ ਕਿਵੇਂ ਨੋਟਿਸ ਕਰਾਂਗਾ ਅਤੇ ਇਸਨੂੰ ਵਾਪਸ ਕਿਵੇਂ ਕਰਾਂਗਾ?" ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਇਸ ਸਵਾਲ ਦਾ ਸਪੱਸ਼ਟ ਜਵਾਬ ਨਹੀਂ ਹੈ, ਤਾਂ ਮਾਡਲ ਅਜੇ ਉਤਪਾਦਨ ਲਈ ਤਿਆਰ ਨਹੀਂ ਹੈ.
ਸਾਰੰਸ਼ ਵਿੱਚ
ਇੱਕ ਮਾਡਲ ਦੀ ਨੌਕਰੀ ਇੱਕ ਉੱਚ ਸਕੋਰ ਨਾਲ ਖਤਮ ਨਹੀਂ ਹੁੰਦੀ, ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਭਰੋਸੇਯੋਗ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਕੰਮ ਕਰਨ ਨਾਲ. MLOps ਲਾਈਵ ਹੋਣ ਦਾ ਅਨੁਸ਼ਾਸਨ ਹੈ, ਵਹਿਣ ਲਈ ਨਿਗਰਾਨੀ, ਮੁੜ ਸਿਖਲਾਈ, ਅਤੇ ਮਾਡਲ ਨੂੰ ਵਾਪਸ ਰੋਲ ਕਰਨਾ; ਟਰੈਕਿੰਗ ਦੇ ਬਿਨਾਂ ਤੈਨਾਤੀ ਚੁੱਪ ਢਹਿ ਹੈ। ਨੈਤਿਕਤਾ ਲਈ ਮਾਡਲ ਦੀ ਨਿਰਪੱਖਤਾ, ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਜਵਾਬਦੇਹੀ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਅੰਕੜਾ ਸ਼ੁੱਧਤਾ ਨੈਤਿਕ ਸਵੀਕਾਰਯੋਗਤਾ ਦਾ ਕੋਈ ਬਦਲ ਨਹੀਂ ਹੈ। ਗੋਪਨੀਯਤਾ ਦਾ ਮਤਲਬ ਹੈ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ KVKK/GDPR ਸਿਧਾਂਤਾਂ ਨਾਲ ਸੁਰੱਖਿਅਤ ਕਰਨਾ ਅਤੇ ਅਸਲ ਡੇਟਾ ਨੂੰ ਖੁੱਲੇ ਸਾਧਨਾਂ ਤੋਂ ਦੂਰ ਰੱਖਣਾ। ਇਹ ਸਾਰੇ ਫੈਸਲੇ ਤਕਨੀਕੀ ਨਹੀਂ ਸਗੋਂ ਜ਼ਿੰਮੇਵਾਰੀ ਵਾਲੇ ਫੈਸਲੇ ਹੁੰਦੇ ਹਨ ਅਤੇ ਹਮੇਸ਼ਾ ਮਨੁੱਖ ਨਾਲ ਸਬੰਧਤ ਹੁੰਦੇ ਹਨ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਇਸ ਬਾਰੇ ਸੋਚੋ ਜਿਵੇਂ ਤੁਸੀਂ ਇੱਕ ਮਾਡਲ (ਜਾਂ ਕਲਪਨਾਤਮਕ) ਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਲਗਾਉਣ ਜਾ ਰਹੇ ਹੋ ਅਤੇ ਚਾਰ ਸੂਚੀਆਂ ਭਰਨ ਜਾ ਰਹੇ ਹੋ: (1) ਪ੍ਰੀ-ਡਿਪਲਾਇਮੈਂਟ ਚੈਕਲਿਸਟ, (2) ਡ੍ਰਾਈਫਟ ਮੈਟ੍ਰਿਕਸ ਜੋ ਤੁਸੀਂ ਟਰੈਕ ਕਰੋਗੇ, (3) ਸਮੂਹ-ਅਧਾਰਿਤ ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ ਯੋਜਨਾ, (4) ਗੋਪਨੀਯਤਾ ਨਿਯੰਤਰਣ। ਫਿਰ ਸਵਾਲ ਦਾ ਇੱਕ ਠੋਸ ਜਵਾਬ ਲਿਖੋ "ਮੈਂ ਕਿਵੇਂ ਨੋਟਿਸ ਕਰਾਂਗਾ ਜੇ ਇਹ ਕੱਲ੍ਹ ਨੂੰ ਚੁੱਪਚਾਪ ਤੋੜਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਵਾਪਸ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹਾਂ?"
ਚੈੱਕਲਿਸਟ
- ਕੀ ਮੈਂ ਇੱਕ ਨਿਗਰਾਨੀ (ਸਲਿੱਪ ਚੇਤਾਵਨੀ) ਅਤੇ ਰੋਲਬੈਕ ਯੋਜਨਾ ਦੇ ਨਾਲ ਮਾਡਲ ਨੂੰ ਤੈਨਾਤ ਕਰ ਰਿਹਾ ਹਾਂ?
- ਕੀ ਮੈਂ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ ਲਈ ਨਿਰਪੱਖਤਾ/ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਅੰਤਰ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਉੱਚ ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ 'ਤੇ ਮਨੁੱਖੀ-ਇਨ-ਦੀ-ਲੂਪ ਨੂੰ ਕਾਇਮ ਰੱਖਿਆ ਹੈ?
- ਕੀ ਮੈਂ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ KVKK/GDPR ਸਿਧਾਂਤਾਂ ਨਾਲ ਸੁਰੱਖਿਅਤ ਕੀਤਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਖੁੱਲ੍ਹੇ ਸਾਧਨਾਂ ਤੋਂ ਦੂਰ ਰੱਖਿਆ ਹੈ?
- ਕੀ ਮੈਂ ਅੰਤਮ ਜਿੰਮੇਵਾਰੀ ਇੱਕ ਮਨੁੱਖ ਉੱਤੇ ਰੱਖੀ ਹੈ, ਮਾਡਲ ਉੱਤੇ ਨਹੀਂ?
ਮੋਡੀਊਲ ਪ੍ਰੀਖਿਆ
1. ਇੱਕ ਡੇਟਾ ਵਿਗਿਆਨੀ ਨਕਲੀ ਬੁੱਧੀ ਨੂੰ ਪੁੱਛਦਾ ਹੈ, "ਇਸ ਡੇਟਾ ਤੇ ਬੇਤਰਤੀਬ ਜੰਗਲ ਕਿੰਨਾ ਸਹੀ ਹੈ?" ਮਾਡਲ ਨੂੰ ਬਿਲਕੁਲ ਸਿਖਲਾਈ ਦਿੱਤੇ ਬਿਨਾਂ, ਅਤੇ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਪੇਸ਼ਕਾਰੀ ਵਿੱਚ "89%" ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ। ਇਸ ਪਹੁੰਚ ਵਿੱਚ ਬੁਨਿਆਦੀ ਗਲਤੀ ਕੀ ਹੈ?
- ਏ) ਨਕਲੀ ਬੁੱਧੀ ਨੂੰ ਡੇਟਾ ਅਤੇ ਮਾਡਲ ਦਿੱਤੇ ਬਿਨਾਂ ਮੈਟ੍ਰਿਕਸ ਦੀ ਉਡੀਕ; ਇਸ ਗੱਲ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ ਕਿ ਇਹ ਜੋ ਨੰਬਰ ਤਿਆਰ ਕਰਦਾ ਹੈ ਉਹ ਜਾਅਲੀ ਹੈ ਅਤੇ ਅਸਲ ਮੈਟ੍ਰਿਕ ਸਿਰਫ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟਿੰਗ ਦੁਆਰਾ ਲੱਭਿਆ ਜਾ ਸਕਦਾ ਹੈ ✔
- ਅ) ਬੇਤਰਤੀਬੇ ਜੰਗਲ ਦੀ ਬਜਾਏ ਲੌਜਿਸਟਿਕ ਰਿਗਰੈਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ
- C) ਸ਼ੁੱਧਤਾ ਦਰ ਹਮੇਸ਼ਾ 90% ਤੋਂ ਉੱਪਰ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।
- ਡੀ) ਪੇਸ਼ਕਾਰੀ ਵਿੱਚ ਮੈਟ੍ਰਿਕਸ ਸ਼ਾਮਲ ਕਰਨ ਦੀ ਸਖ਼ਤ ਮਨਾਹੀ ਹੈ
ਵਿਆਖਿਆ: ਨਕਲੀ ਬੁੱਧੀ ਮਾਡਲ ਅਤੇ ਡੇਟਾ ਤੱਕ ਪਹੁੰਚ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਮੈਟ੍ਰਿਕ ਤਿਆਰ ਨਹੀਂ ਕਰ ਸਕਦੀ; ਉਹ ਜੋ ਨੰਬਰ ਦਿੰਦਾ ਹੈ ਉਹ ਭੁਲੇਖਾ (ਮਨਘੜਤ) ਹੈ। ਮਾੱਡਲ ਨੂੰ ਅਸਲ ਵਿੱਚ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟ ਕੀਤੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਹੀ ਡਾਟਾ ਵਿਗਿਆਨੀ ਦੀ ਆਪਣੀ ਗਣਨਾ ਦੁਆਰਾ ਮੈਟ੍ਰਿਕ ਪ੍ਰਾਪਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਗੈਰ-ਪ੍ਰਮਾਣਿਤ ਆਉਟਪੁੱਟ ਇੱਕ ਹਸਤਾਖਰਿਤ ਰਿਪੋਰਟ ਵਾਂਗ ਹੈ।
2. ਇੱਕ ਮੰਥਨ ਪੂਰਵ ਅਨੁਮਾਨ ਲਈ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨ ਵੇਲੇ 'ਖਾਤਾ ਬੰਦ ਕਰਨ ਦਾ ਕਾਰਨ' ਕਾਲਮ ਸ਼ਾਮਲ ਕੀਤਾ ਜਾਂਦਾ ਹੈ; ਇਹ ਕਾਲਮ ਗਾਹਕ ਦੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਹੀ ਭਰਿਆ ਜਾਂਦਾ ਹੈ। ਮਾਡਲ ਟੈਸਟ ਸੈੱਟ 'ਤੇ 97% ਦਿੰਦਾ ਹੈ, ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕੰਮ ਨਹੀਂ ਕਰਦਾ. ਇਸ ਸਥਿਤੀ ਦਾ ਨਾਮ ਅਤੇ ਕਾਰਨ ਕੀ ਹੈ?
- ਏ) ਓਵਰਲਰਨਿੰਗ; ਮਾਡਲ ਬਹੁਤ ਗੁੰਝਲਦਾਰ ਹੈ
- ਬੀ) ਡਾਟਾ ਲੀਕ; ✔ ਜਾਣਕਾਰੀ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਜੋ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਉਪਲਬਧ ਨਹੀਂ ਹੋਵੇਗੀ, ਪਰ ਇੱਕ ਵਿਸ਼ੇਸ਼ਤਾ ਦੇ ਰੂਪ ਵਿੱਚ, ਟੀਚੇ ਦਾ ਨਤੀਜਾ ਹੈ
- ਸੀ) ਨਾਕਾਫ਼ੀ ਸਿੱਖਣ; ਮਾਡਲ ਬਹੁਤ ਸਧਾਰਨ ਹੈ
- ਡੀ) ਚੋਣ ਪੱਖਪਾਤ; ਛੋਟਾ ਨਮੂਨਾ ਆਕਾਰ
ਵਿਆਖਿਆ: ਇਹ ਇੱਕ ਕਲਾਸਿਕ ਡਾਟਾ ਲੀਕ ਹੈ: 'ਬੰਦ ਹੋਣ ਦਾ ਕਾਰਨ' ਟੀਚੇ ਦਾ ਨਤੀਜਾ ਹੈ ਅਤੇ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਅਜੇ ਵੀ ਖਾਲੀ ਹੈ। ਮਾਡਲ ਇਸ ਭਵਿੱਖ ਦੇ ਗਿਆਨ ਨਾਲ ਚਾਲ ਕਰਦਾ ਹੈ, ਇਹ ਟੈਸਟ ਸੈੱਟ 'ਤੇ ਬਹੁਤ ਵਧੀਆ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕ੍ਰੈਸ਼ ਹੋ ਜਾਂਦਾ ਹੈ ਕਿਉਂਕਿ ਉਹ ਕਾਲਮ ਖਾਲੀ ਹੈ। ਪ੍ਰਸ਼ਨ 'ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੇਰੇ ਕੋਲ ਹੈ' ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਪੁੱਛਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।
3. ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਮਤਲਬ ਦੇ ਨਾਲ ਮਾਲੀਆ ਕਾਲਮ ਵਿੱਚ ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ ਨੂੰ ਭਰਦਾ ਹੈ; ਪਰ ਲਾਪਤਾ ਲੋਕ ਅਸਲ ਵਿੱਚ ਘੱਟ ਆਮਦਨੀ ਵਾਲੇ ਹਿੱਸੇ ਨਾਲ ਸਬੰਧਤ ਹਨ ਜਿਨ੍ਹਾਂ ਨੇ ਕਦੇ ਆਮਦਨੀ ਦਾ ਐਲਾਨ ਨਹੀਂ ਕੀਤਾ (ਸਿਸਟਮਮੈਟਿਕ ਲਾਪਤਾ)। ਇਹ ਭਰਨਾ ਗਲਤ ਕਿਉਂ ਹੈ?
- A) ਮੱਧਮਾਨ ਹਮੇਸ਼ਾ ਮੱਧਮਾਨ ਤੋਂ ਵੱਡਾ ਹੁੰਦਾ ਹੈ, ਇਸਲਈ ਇਹ ਗਲਤ ਹੈ
- ਅ) ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ ਨੂੰ ਕਦੇ ਵੀ ਭਰਿਆ ਨਹੀਂ ਜਾਣਾ ਚਾਹੀਦਾ, ਉਹਨਾਂ ਨੂੰ ਹਮੇਸ਼ਾ ਮਿਟਾਉਣਾ ਚਾਹੀਦਾ ਹੈ
- C) ਮੱਧਮਾਨ ਦੇ ਨਾਲ ਵਿਵਸਥਿਤ ਪਾੜੇ ਨੂੰ ਭਰਨਾ ਉਸ ਸਮੂਹ ਨੂੰ ਨਕਲੀ ਰੂਪ ਵਿੱਚ ਦਰਸਾਉਂਦੇ ਹੋਏ ਡੇਟਾ ਨੂੰ ਵਿਗਾੜਦਾ ਹੈ; 'ਖਾਲੀ ਕਿਉਂ ਹੈ?' ਸਵਾਲ ਪੁੱਛੇ ਬਿਨਾਂ ਹੀ ਭਰਨ ਦਾ ਕੰਮ ਕੀਤਾ ਗਿਆ। ✔
- ਡੀ) ਔਸਤ ਦੀ ਗਣਨਾ ਕਰਨਾ ਇੱਕ ਪ੍ਰਦਰਸ਼ਨ ਸਮੱਸਿਆ ਪੈਦਾ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਬਹੁਤ ਹੌਲੀ ਹੈ
ਵਿਆਖਿਆ: ਘਾਟ ਦਾ ਕਾਰਨ ਹੱਲ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ। ਜਦੋਂ ਯੋਜਨਾਬੱਧ ਗੁੰਮ (ਕਿਸੇ ਖਾਸ ਸਮੂਹ ਵਿੱਚ ਕੇਂਦਰਿਤ ਅੰਤਰ) ਔਸਤ ਨਾਲ ਭਰਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਉਹ ਸਮੂਹ ਨਕਲੀ ਤੌਰ 'ਤੇ 'ਔਸਤ ਆਮਦਨ' ਬਣ ਜਾਂਦਾ ਹੈ ਅਤੇ ਡੇਟਾ ਨੂੰ ਵਿਗਾੜ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਨੂੰ ਭਰਨ ਤੋਂ ਪਹਿਲਾਂ, 'ਇਹ ਖਾਲੀ ਕਿਉਂ ਹੈ' ਸਵਾਲ ਪੁੱਛਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ; ਵਿਵਸਥਿਤ/ਮਹੱਤਵਪੂਰਣ ਗੁੰਮ ਹੋਏ ਮਾਧਿਅਮ ਨੂੰ ਭਰਿਆ ਨਹੀਂ ਜਾਣਾ ਚਾਹੀਦਾ।
4. ਇੱਕ ਟੀਮ 'ਵਿਗਿਆਪਨ ਖਰਚ' ਅਤੇ 'ਵਿਕਰੀ' ਵਿਚਕਾਰ 0.78 ਸਬੰਧ ਲੱਭਦੀ ਹੈ ਅਤੇ ਬਜਟ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਦਿੰਦੀ ਹੈ; ਹਾਲਾਂਕਿ, ਜੋ ਅਸਲ ਵਿੱਚ ਦੋਵਾਂ ਨੂੰ ਚਾਲੂ ਕਰਦਾ ਹੈ ਉਹ ਮੌਸਮੀ ਮੁਹਿੰਮਾਂ ਹਨ. ਅੰਕੜਿਆਂ ਵਿੱਚ ਕਿਹੜਾ ਸਿਧਾਂਤ ਇਸ ਗਲਤੀ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ?
- ਏ) ਸਬੰਧ ਕਾਰਨ ਨਹੀਂ ਹੈ; ਇੱਕ ਲੁਕਿਆ ਤੀਜਾ ਵੇਰੀਏਬਲ ਦੋਵਾਂ ਵੇਰੀਏਬਲਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦਾ ਹੈ ✔
- ਅ) ਕਿਉਂਕਿ 0.78 ਦਾ ਸਬੰਧ ਬਹੁਤ ਘੱਟ ਹੈ, ਇਸ ਲਈ ਰਿਸ਼ਤੇ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ
- C) ਸਬੰਧ ਹਮੇਸ਼ਾ ਕਾਰਨ ਸਾਬਤ ਕਰਦਾ ਹੈ, ਟੀਮ ਨੇ ਇਸ ਨੂੰ ਸਹੀ ਕੀਤਾ
- ਡੀ) ਇਸ਼ਤਿਹਾਰਬਾਜ਼ੀ ਅਤੇ ਵਿਕਰੀ ਵਿਚਕਾਰ ਸਬੰਧ ਨੂੰ ਗਣਿਤਿਕ ਤੌਰ 'ਤੇ ਨਹੀਂ ਗਿਣਿਆ ਜਾ ਸਕਦਾ।
ਵਿਆਖਿਆ: ਸਬੰਧ ਕਾਰਨ ਨਹੀਂ ਹੈ। ਦੋ ਵੇਰੀਏਬਲ ਇਕੱਠੇ ਕੰਮ ਕਰ ਸਕਦੇ ਹਨ ਕਿਉਂਕਿ ਇੱਕ ਲੁਕਿਆ ਹੋਇਆ ਤੀਜਾ ਵੇਰੀਏਬਲ (ਇੱਥੇ ਮੌਸਮੀ ਮੁਹਿੰਮਾਂ) ਦੋਵਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ। ਸਿੱਟਾ ਕਿ ਇੱਕ ਦੂਜੇ ਦਾ ਕਾਰਨ ਬਣਦਾ ਹੈ ਕੇਵਲ ਪ੍ਰਯੋਗ ਅਤੇ ਖੇਤਰੀ ਗਿਆਨ ਦੁਆਰਾ ਸਥਾਪਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ; ਇਕੱਲੇ ਸਬੰਧਾਂ ਦੀ ਗਿਣਤੀ ਕਾਰਣ ਦਾ ਸਬੂਤ ਨਹੀਂ ਹੈ।
5. ਇੱਕ ਧੋਖਾਧੜੀ ਦਾ ਪਤਾ ਲਗਾਉਣ ਵਾਲਾ ਮਾਡਲ 99.2% ਸ਼ੁੱਧਤਾ ਦਿਖਾਉਂਦਾ ਹੈ ਅਤੇ ਟੀਮ ਜਸ਼ਨ ਮਨਾਉਂਦੀ ਹੈ; ਹਾਲਾਂਕਿ, ਡੇਟਾ ਵਿੱਚ ਫਰਜ਼ੀ ਲੈਣ-ਦੇਣ ਦੀ ਦਰ ਸਿਰਫ 0.8% ਹੈ ਅਤੇ ਮਾਡਲ ਦੀ ਵਾਪਸੀ 6% ਹੈ। ਇਹ ਸਾਰਣੀ ਕੀ ਦਰਸਾਉਂਦੀ ਹੈ?
- ਏ) ਮਾਡਲ ਸੰਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਸ਼ੁੱਧਤਾ 99% ਤੋਂ ਵੱਧ ਹੈ
- ਅ) ਸ਼ੁੱਧਤਾ ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਦੇ ਨਾਲ ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ; ਮਾਡਲ ਲਗਭਗ ਸਾਰੇ ਨਕਲੀ (ਘੱਟ ਯਾਦ) ਨੂੰ ਖੁੰਝਾਉਂਦਾ ਹੈ, ਉਚਿਤ ਮੈਟ੍ਰਿਕ ਨੂੰ ਦੇਖਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ✔
- C) ਮਾਡਲ ਦੀ ਰੀਕਾਲ ਜ਼ਿਆਦਾ ਹੋਣ ਕਾਰਨ ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ
- ਡੀ) ਨਕਲੀ ਰੇਟ ਘੱਟ ਹੋਣ ਕਰਕੇ ਮਾਡਲ ਬਣਾਉਣ ਦੀ ਲੋੜ ਨਹੀਂ ਸੀ
ਵਿਆਖਿਆ: ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਵਿੱਚ 'ਸ਼ੁੱਧਤਾ' ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ। ਜਦੋਂ ਮਾਡਲ ਲਗਭਗ ਹਰ ਟ੍ਰਾਂਜੈਕਸ਼ਨ ਨੂੰ 'ਕਲੀਨ' ਕਹਿੰਦਾ ਹੈ, ਤਾਂ ਇਹ ਉੱਚ ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਨਕਲੀ ਬਹੁਤ ਘੱਟ ਹੁੰਦੇ ਹਨ, ਪਰ ਇਹ ਨਕਲੀ ਨੂੰ ਫੜਨ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦਾ ਹੈ, ਜੋ ਕਿ ਇਸਦਾ ਮੁੱਖ ਉਦੇਸ਼ ਹੈ (6% ਯਾਦ ਕਰੋ)। ਇਸ ਲਈ, ਅਸੰਤੁਲਿਤ ਸਮੱਸਿਆਵਾਂ ਵਿੱਚ, ਫੋਕਸ ਸ਼ੁੱਧਤਾ 'ਤੇ ਨਹੀਂ ਹੈ, ਪਰ ਕੰਮ ਦੇ ਉਦੇਸ਼ ਲਈ ਉਲਝਣ ਵਾਲੇ ਮੈਟ੍ਰਿਕਸ ਅਤੇ ਮੈਟ੍ਰਿਕਸ 'ਤੇ ਹੈ, ਜਿਵੇਂ ਕਿ ਰੀਕਾਲ/ਸ਼ੁੱਧਤਾ।
6. ਇੱਕ ਮੰਗ ਪੂਰਵ ਅਨੁਮਾਨ ਪ੍ਰੋਜੈਕਟ ਵਿੱਚ, ਸਮਾਂ-ਨਿਰਭਰ ਡੇਟਾ ਬੇਤਰਤੀਬੇ ਤੌਰ 'ਤੇ ਸਿਖਲਾਈ/ਟੈਸਟਿੰਗ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ। ਮਾਡਲ 93% ਸ਼ੁੱਧਤਾ ਦਿੰਦਾ ਹੈ ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕਰੈਸ਼ ਹੋ ਜਾਂਦਾ ਹੈ। ਸਹੀ ਵੰਡ ਪਹੁੰਚ ਕੀ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ?
- ਏ) ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਵੱਡਾ ਕਰਨਾ, ਉਦਾਹਰਨ ਲਈ ਵੰਡਣਾ 50%/50%
- ਅ) ਇੱਕ ਹੋਰ ਗੁੰਝਲਦਾਰ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਨਾ
- C) ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਾਲ ਭਾਗ ਨੂੰ ਹਟਾਓ ਅਤੇ ਸਾਰੇ ਡੇਟਾ ਨਾਲ ਟ੍ਰੇਨ ਕਰੋ
- ਡੀ) ਕਾਲਕ੍ਰਮਿਕ ਵੰਡ: ਪੁਰਾਣੇ ਸਮੇਂ ਦੇ ਨਾਲ ਸਿਖਲਾਈ ਅਤੇ ਨਵੀਂ ਮਿਆਦ ਦੇ ਨਾਲ ਟੈਸਟਿੰਗ, ਇਸ ਤਰ੍ਹਾਂ ਮਾਡਲ ਨੂੰ ਭਵਿੱਖ ਨੂੰ ਦੇਖਣ ਤੋਂ ਰੋਕਦਾ ਹੈ ✔
ਵਿਆਖਿਆ: ਜੇਕਰ ਸਮਾਂ ਲੜੀ ਦੇ ਡੇਟਾ ਵਿੱਚ ਬੇਤਰਤੀਬ ਵੰਡ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਮਾਡਲ ਭਵਿੱਖ ਨੂੰ ਵੇਖਦਾ ਹੈ ਅਤੇ ਸਿਖਲਾਈ ਵਿੱਚ ਅਤੀਤ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ; ਇਹ ਇੱਕ ਲੀਕ ਹੈ ਅਤੇ ਸਫਲਤਾ ਪੈਦਾ ਕਰਦਾ ਹੈ ਜੋ ਅਸਲ ਵਿੱਚ ਮੌਜੂਦ ਨਹੀਂ ਹੈ। ਸਹੀ ਪਹੁੰਚ ਕਾਲਕ੍ਰਮਿਕ ਵੰਡ ਹੈ: ਪੁਰਾਣੇ ਸਮੇਂ ਦੇ ਨਾਲ ਸਿਖਲਾਈ ਅਤੇ ਨਵੀਂ ਮਿਆਦ ਦੇ ਨਾਲ ਟੈਸਟਿੰਗ, ਉਤਪਾਦਨ ਵਿੱਚ ਅਸਲ ਸਥਿਤੀ ਦੀ ਨਕਲ ਕਰਨਾ (ਅਤੀਤ ਤੋਂ ਭਵਿੱਖ ਤੱਕ ਭਵਿੱਖਬਾਣੀ ਕਰਨਾ)।
7. ਫੀਚਰ ਇੰਜਨੀਅਰਿੰਗ ਵਿੱਚ ਕਿਸ ਡੇਟਾ ਤੋਂ ਸਕੇਲਿੰਗ (ਸਟੈਂਡਰਡ ਸਕੇਲਰ) ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਕਿਵੇਂ ਲਾਗੂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ?
- ਏ) ਇਸਦੀ ਗਣਨਾ ਸਾਰੇ ਡੇਟਾ (ਸਿਖਲਾਈ + ਇਕੱਠੇ ਟੈਸਟਿੰਗ) ਤੋਂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ਤਾਂ ਜੋ ਇਹ ਵਧੇਰੇ ਸਹੀ ਹੋਵੇ
- ਅ) ਹਰੇਕ ਕਤਾਰ ਲਈ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਇਸ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ, ਉਸ ਕਤਾਰ ਦੇ ਆਪਣੇ ਮੁੱਲ ਤੋਂ
- C) ਟੈਸਟ ਡੇਟਾ ਤੋਂ ਹੀ ਗਣਨਾ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ
- ਡੀ) ਇਸਦੀ ਗਣਨਾ ਸਿਰਫ ਸਿਖਲਾਈ ਡੇਟਾ ਤੋਂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ, ਫਿਰ ਉਹੀ ਮਾਪਦੰਡ ਟੈਸਟ ਡੇਟਾ ਤੇ ਲਾਗੂ ਕੀਤੇ ਜਾਣੇ ਚਾਹੀਦੇ ਹਨ; ਨਹੀਂ ਤਾਂ ਇਹ ਲੀਕ ਹੋ ਜਾਵੇਗਾ ✔
ਵਿਆਖਿਆ: ਸਾਰੇ ਪਰਿਵਰਤਨ ਦੇ ਮਾਪਦੰਡ (ਮਤਲਬ, ਮਿਆਰੀ ਵਿਵਹਾਰ, ਆਦਿ) ਜਿਵੇਂ ਕਿ ਸਕੇਲਿੰਗ, ਏਨਕੋਡਿੰਗ ਅਤੇ ਪੈਡਿੰਗ ਸਿਰਫ ਸਿਖਲਾਈ ਡੇਟਾ ਤੋਂ ਹੀ ਸਿੱਖੇ ਜਾਣੇ ਚਾਹੀਦੇ ਹਨ, ਫਿਰ ਇਹੀ ਟੈਸਟ ਡੇਟਾ 'ਤੇ ਲਾਗੂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਟੈਸਟ ਡੇਟਾ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਣ ਨਾਲ ਟੈਸਟ ਜਾਣਕਾਰੀ ਸਿਖਲਾਈ ਵਿੱਚ ਦਖਲਅੰਦਾਜ਼ੀ ਦਾ ਕਾਰਨ ਬਣਦੀ ਹੈ, ਯਾਨੀ ਕਿ ਲੀਕ ਹੋਣਾ, ਅਤੇ ਮਾਡਲ ਨੂੰ ਇਸ ਤੋਂ ਬਿਹਤਰ ਦਿਖਦਾ ਹੈ। ਪਾਈਪਲਾਈਨ ਦੀ ਵਰਤੋਂ ਇਸ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਂਦੀ ਹੈ।
8. ਇੱਕ ਮਾਡਲ ਸਿਖਲਾਈ ਸੈੱਟ 'ਤੇ 98% ਸ਼ੁੱਧਤਾ ਅਤੇ ਟੈਸਟ ਸੈੱਟ 'ਤੇ 72% ਸ਼ੁੱਧਤਾ ਦਿੰਦਾ ਹੈ। ਇਹ ਲੱਛਣ ਕੀ ਦਰਸਾਉਂਦਾ ਹੈ ਅਤੇ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ?
- ਏ) ਨਾਕਾਫ਼ੀ ਸਿੱਖਣ; ਮਾਡਲ ਨੂੰ ਹੋਰ ਗੁੰਝਲਦਾਰ ਬਣਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ
- ਬੀ) ਡਾਟਾ ਲੀਕ; ਟੈਸਟ ਸੈੱਟ ਬਦਲਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ
- ਸੀ) ਓਵਰਫਿਟਿੰਗ; ਮਾਡਲ ਨੂੰ ਸਰਲ ਬਣਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ, ਰੈਗੂਲਰਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ ਲਾਗੂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ✔
- ਡੀ) ਇੱਕ ਆਮ ਸਥਿਤੀ; ਸਿੱਖਿਆ ਦਾ ਸਕੋਰ ਹਮੇਸ਼ਾ ਉੱਚਾ ਹੁੰਦਾ ਹੈ, ਸਾਵਧਾਨੀ ਬੇਲੋੜੀ ਹੈ
ਵਿਆਖਿਆ: ਸਿਖਲਾਈ ਵਿੱਚ ਇੱਕ ਬਹੁਤ ਉੱਚ ਸਕੋਰ ਅਤੇ ਟੈਸਟਿੰਗ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਘੱਟ ਸਕੋਰ ਓਵਰਫਿਟਿੰਗ ਦਾ ਇੱਕ ਸ਼ਾਨਦਾਰ ਲੱਛਣ ਹੈ: ਮਾਡਲ ਨੇ ਅਸਲ ਪੈਟਰਨ ਦੀ ਬਜਾਏ ਸਿਖਲਾਈ ਡੇਟਾ ਦੇ ਰੌਲੇ ਨੂੰ ਯਾਦ ਕੀਤਾ ਹੈ। ਹੱਲਾਂ ਵਿੱਚ ਮਾਡਲ ਨੂੰ ਸਰਲ ਬਣਾਉਣਾ, ਵਧੇਰੇ ਡੇਟਾ, ਨਿਯਮਤੀਕਰਨ, ਅਤੇ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਨਾਲ ਰਾਜ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨਾ ਸ਼ਾਮਲ ਹੈ। ਸਿਰਫ਼ ਸਿੱਖਿਆ ਸਕੋਰ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਇਸ ਖਰਾਬੀ ਨੂੰ ਛੁਪਾਉਂਦਾ ਹੈ।
9. ਇੱਕ ਪ੍ਰਬੰਧਨ ਪ੍ਰਸਤੁਤੀ ਵਿੱਚ, ਇੱਕ ਬਾਰ ਚਾਰਟ ਦਾ y-ਧੁਰਾ ਜਿਸ ਵਿੱਚ ਵਿਕਰੀ 1,000 ਤੋਂ 1,020 ਤੱਕ ਵਧਦੀ ਹੈ, ਨੂੰ 980 ਤੋਂ ਸ਼ੁਰੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਤਾਂ ਜੋ ਵਾਧੇ ਨੂੰ ਵਿਸ਼ਾਲ ਬਣਾਇਆ ਜਾ ਸਕੇ। ਅਸਲ ਵਾਧਾ 2% ਹੈ। ਇਹ ਇੱਕ ਨੈਤਿਕ ਮੁੱਦਾ ਕਿਉਂ ਹੈ?
- A) ਇੱਕ ਕੱਟਿਆ ਹੋਇਆ y-ਧੁਰਾ ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਇੱਕ ਛੋਟੇ ਫਰਕ ਨੂੰ ਵਧਾ-ਚੜ੍ਹਾ ਕੇ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਅਤੇ ਦਰਸ਼ਕ ਨੂੰ ਗੁੰਮਰਾਹ ਕਰਦਾ ਹੈ; ਨਿਰਪੱਖਤਾ ਲਈ, ਤੁਲਨਾਤਮਕ ਬਾਰਾਂ ਵਿੱਚ ਧੁਰਾ 0 ✔ ਤੋਂ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ
- ਅ) ਬਾਰ ਚਾਰਟ ਕਦੇ ਵੀ ਵਿਕਰੀ ਡੇਟਾ ਲਈ ਨਹੀਂ ਵਰਤੇ ਜਾ ਸਕਦੇ ਹਨ
- C) ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ; ਚਾਰਟ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਣਾਉਣਾ ਹਮੇਸ਼ਾ ਚੰਗਾ ਹੁੰਦਾ ਹੈ
- D) Y-ਧੁਰਾ ਹਮੇਸ਼ਾ ਡੇਟਾ ਦੇ ਸਭ ਤੋਂ ਵੱਡੇ ਮੁੱਲ ਤੋਂ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ
ਵਿਆਖਿਆ: ਤੁਲਨਾਤਮਕ ਉਦੇਸ਼ਾਂ ਲਈ ਬਾਰ ਚਾਰਟ ਵਿੱਚ, y-ਧੁਰਾ ਆਮ ਤੌਰ 'ਤੇ 0 ਤੋਂ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਧੁਰੇ ਨੂੰ ਕੱਟਣ ਅਤੇ 980 ਤੋਂ ਸ਼ੁਰੂ ਕਰਨ ਨਾਲ 2% ਦਾ ਇੱਕ ਛੋਟਾ ਜਿਹਾ ਅੰਤਰ ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਬਹੁਤ ਵੱਡਾ ਜਾਪਦਾ ਹੈ ਅਤੇ ਦਰਸ਼ਕ ਨੂੰ ਗੁੰਮਰਾਹ ਕਰਦਾ ਹੈ। ਡੇਟਾ ਪ੍ਰੋਫੈਸ਼ਨਲ ਦੀ ਨੈਤਿਕ ਜ਼ਿੰਮੇਵਾਰੀ ਇਮਾਨਦਾਰ ਗ੍ਰਾਫਾਂ ਨੂੰ ਖਿੱਚਣਾ ਹੈ ਜੋ ਡੇਟਾ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਜਾਂ ਘੱਟ ਨਹੀਂ ਸਮਝਦੇ।
10. ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਉਤਪਾਦ ਸਾਰਣੀ ਦੇ ਨਾਲ ਆਰਡਰਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋਣ ਤੋਂ ਬਾਅਦ ਕੁੱਲ ਟਰਨਓਵਰ 3 ਵਾਰ ਲੱਭਦਾ ਹੈ; ਲਾਈਨਾਂ ਦੀ ਗਿਣਤੀ 240 ਹਜ਼ਾਰ ਤੋਂ ਵੱਧ ਕੇ 690 ਹਜ਼ਾਰ ਹੋ ਗਈ ਹੈ। ਇਸ ਚੁੱਪ ਗਲਤੀ ਨੂੰ ਰੋਕਣ ਲਈ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਸੀ?
- A) ਕੁੱਲ ਟਰਨਓਵਰ ਨੂੰ 3 ਨਾਲ ਵੰਡੋ
- B) ਹਮੇਸ਼ਾ JOIN ਦੀ ਬਜਾਏ ਵੱਖਰੇ ਸਵਾਲਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ
- C) ਉਤਪਾਦ ਸਾਰਣੀ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਮਿਟਾਉਣਾ
- D) ਵਿਲੀਨ/ਸ਼ਾਮਲ ਹੋਣ ਤੋਂ ਬਾਅਦ ਕਤਾਰਾਂ ਦੀ ਸੰਖਿਆ ਦੀ ਜਾਂਚ ਕਰਨਾ ਅਤੇ ਇਹ ਪੁਸ਼ਟੀ ਕਰਨਾ ਕਿ ਉਹ ਸਹੀ ਕੁੰਜੀ ਦੁਆਰਾ ਜੁੜੀਆਂ ਹਨ; ਨਕਲ ਨੂੰ ਜਲਦੀ ਫੜਨਾ ✔
ਸਪੱਸ਼ਟੀਕਰਨ: ਜਦੋਂ ਉਤਪਾਦ ਸਾਰਣੀ ਵਿੱਚ ਹਰੇਕ ਉਤਪਾਦ (ਉਦਾਹਰਣ ਲਈ ਵੱਖ-ਵੱਖ ਰੰਗ) ਲਈ ਇੱਕ ਤੋਂ ਵੱਧ ਕਤਾਰਾਂ ਹੁੰਦੀਆਂ ਹਨ, ਤਾਂ ਗਲਤ ਕੁੰਜੀ ਦੁਆਰਾ ਸ਼ਾਮਲ ਹੋਣ ਨਾਲ ਹਰੇਕ ਆਰਡਰ ਦੀ ਡੁਪਲੀਕੇਟ ਹੋ ਜਾਂਦੀ ਹੈ ਅਤੇ ਕੁੱਲ ਗਿਣਤੀ ਵਧ ਜਾਂਦੀ ਹੈ। ਕੋਡ ਬਿਨਾਂ ਕਿਸੇ ਤਰੁੱਟੀ ਦੇ ਚੱਲਦਾ ਹੈ ਪਰ ਨਤੀਜਾ ਗਲਤ ਹੈ। ਇਸ ਤੋਂ ਬਚਣ ਦਾ ਤਰੀਕਾ ਇਹ ਹੈ ਕਿ ਹਰੇਕ ਮਰਜ/ਜੁਆਇਨ ਤੋਂ ਬਾਅਦ ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ ਦੀ ਜਾਂਚ ਕਰੋ ਅਤੇ ਸਹੀ ਕੁੰਜੀ ਨਾਲ ਮਿਲਾਓ।
11. ਇੱਕ ਹਾਇਰਿੰਗ ਸਕ੍ਰੀਨਿੰਗ ਮਾਡਲ ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਲਿੰਗ ਅਸੰਤੁਲਨ ਬਾਰੇ ਸਿੱਖਦਾ ਹੈ ਅਤੇ ਯੋਜਨਾਬੱਧ ਤੌਰ 'ਤੇ ਸਕੋਰ ਮਹਿਲਾ ਉਮੀਦਵਾਰਾਂ ਦੇ ਅਧੀਨ ਹੈ, ਪਰ ਇਸਦੀ ਸਮੁੱਚੀ ਸ਼ੁੱਧਤਾ ਉੱਚ ਹੈ। ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ?
- ਏ) ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ ਕਿਉਂਕਿ ਮਾਡਲ ਦੀ ਉੱਚ ਸ਼ੁੱਧਤਾ ਹੈ
- ਅ) ਅੰਕੜਾ ਸ਼ੁੱਧਤਾ ਨੈਤਿਕ ਸਵੀਕਾਰਯੋਗਤਾ ਦਾ ਬਦਲ ਨਹੀਂ ਹੈ; ਮਾਡਲ ਨੇ ਪਿਛਲੇ ਵਿਤਕਰੇ ਬਾਰੇ ਸਿੱਖਿਆ ਹੈ, ਸਮੂਹ-ਅਧਾਰਿਤ ਨਿਰਪੱਖਤਾ ਜਾਂਚ ਦੀ ਲੋੜ ਹੈ ✔
- C) ਮਾਡਲ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਹੋਰ ਵਧਾਉਣਾ ਸਮੱਸਿਆ ਦਾ ਹੱਲ ਕਰਦਾ ਹੈ
- ਡੀ) ਨਿਰਪੱਖਤਾ ਡੇਟਾ ਵਿਗਿਆਨ ਦੇ ਦਾਇਰੇ ਤੋਂ ਬਾਹਰ ਹੈ
ਸਪੱਸ਼ਟੀਕਰਨ: ਭਾਵੇਂ ਕੋਈ ਮਾਡਲ ਅੰਕੜਾ ਪੱਖੋਂ ਸਹੀ ਹੈ, ਇਹ ਨੈਤਿਕ ਤੌਰ 'ਤੇ ਅਸਵੀਕਾਰਨਯੋਗ ਹੋ ਸਕਦਾ ਹੈ। ਮਾਡਲ ਪਿਛਲੇ ਡੇਟਾ ਵਿੱਚ ਬੇਇਨਸਾਫ਼ੀ ਸਿੱਖਦਾ ਹੈ ਅਤੇ ਵਿਤਕਰੇ ਨੂੰ ਸਵੈਚਾਲਤ ਕਰਦਾ ਹੈ। ਉੱਚ ਇਮਾਨਦਾਰੀ ਨਿਆਂ ਦਾ ਕੋਈ ਬਦਲ ਨਹੀਂ ਹੈ; ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਮਾਡਲਾਂ ਵਿੱਚ, ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ, ਜੋ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ ਲਈ ਪ੍ਰਦਰਸ਼ਨ/ਫੈਸਲੇ ਦੇ ਅੰਤਰ ਨੂੰ ਮਾਪਦਾ ਹੈ, ਜ਼ਰੂਰੀ ਹੈ ਅਤੇ ਅੰਤਮ ਜ਼ਿੰਮੇਵਾਰੀ ਮਨੁੱਖ ਦੀ ਹੁੰਦੀ ਹੈ।
12. ਇੱਕ ਕਰਮਚਾਰੀ ਇੱਕ ਜਨਤਕ AI ਟੂਲ ਵਿੱਚ ਅਸਲ ਗਾਹਕ ਈਮੇਲਾਂ ਅਤੇ ਖਰੀਦ ਇਤਿਹਾਸ ਵਾਲੀ ਇੱਕ ਫਾਈਲ ਨੂੰ ਅਪਲੋਡ ਕਰਦਾ ਹੈ ਅਤੇ ਕਹਿੰਦਾ ਹੈ ਕਿ 'ਖੰਡਾਂ ਦਾ ਸੰਖੇਪ'। ਇਹ ਇੱਕ ਗੰਭੀਰ ਗਲਤੀ ਕਿਉਂ ਹੈ ਅਤੇ ਸਹੀ ਤਰੀਕਾ ਕੀ ਹੈ?
- ਏ) ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ; AI ਟੂਲ ਕਦੇ ਵੀ ਡਾਟਾ ਸਟੋਰ ਨਹੀਂ ਕਰਦੇ ਹਨ
- ਅ) ਗਲਤੀ ਇਹ ਹੈ ਕਿ ਫਾਈਲ ਬਹੁਤ ਵੱਡੀ ਹੈ; ਘਟਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਸੀ
- C) ਇੱਕ ਓਪਨ ਟੂਲ ਨੂੰ ਅਸਲ ਨਿੱਜੀ ਡੇਟਾ ਪ੍ਰਦਾਨ ਕਰਨਾ KVKK/GDPR ਦੀ ਉਲੰਘਣਾ ਹੈ; ਪਛਾਣ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਸਿਰਫ਼ ਅਗਿਆਤ ਸਕੀਮਾ/ਪ੍ਰਾਪਰਟੀ ਸਾਂਝੀ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ✔
- ਡੀ) ਸਿਰਫ਼ ਐਕਸਲ ਦੀ ਬਜਾਏ CSV ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ
ਸਪੱਸ਼ਟੀਕਰਨ: ਜਦੋਂ ਅਸਲੀ ਨਿੱਜੀ ਡੇਟਾ (ਜਿਵੇਂ ਕਿ ਈ-ਮੇਲ, ਨਾਮ, ਆਦਿ) ਜਨਤਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਨਕਲੀ ਖੁਫੀਆ ਟੂਲ ਨੂੰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ KVKK / GDPR ਦੇ ਦਾਇਰੇ ਦੇ ਅੰਦਰ ਗੋਪਨੀਯਤਾ ਦੀ ਉਲੰਘਣਾ ਹੋਵੇਗੀ; ਡਾਟਾ ਸੰਗਠਨ ਨੂੰ ਛੱਡ ਦਿੰਦਾ ਹੈ. ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ, ਇੱਕ ਚਿੱਤਰ ਅਤੇ ਇੱਕ ਅਗਿਆਤ/ਸਿੰਥੈਟਿਕ ਨਮੂਨਾ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਕਾਫੀ ਹੁੰਦੇ ਹਨ। ਸਹੀ ਤਰੀਕਾ ਹੈ ਪਛਾਣ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾਉਣਾ ਅਤੇ ਸਿਰਫ਼ ਅਗਿਆਤ ਸੰਪਤੀਆਂ ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ।
13. ਇੱਕ ਸਿਫਾਰਿਸ਼ ਮਾਡਲ ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਗਿਆ ਹੈ ਪਰ ਟਰੈਕਿੰਗ ਸਥਾਪਤ ਨਹੀਂ ਕੀਤੀ ਗਈ ਹੈ; ਜਦੋਂ ਉਤਪਾਦ ਕੈਟਾਲਾਗ 4 ਮਹੀਨਿਆਂ ਬਾਅਦ ਬਦਲਦਾ ਹੈ, ਤਾਂ ਮਾਡਲ ਪੁਰਾਣੇ ਉਤਪਾਦਾਂ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਨਾ ਜਾਰੀ ਰੱਖਦਾ ਹੈ ਅਤੇ ਪਰਿਵਰਤਨ ਦਰ ਚੁੱਪਚਾਪ 30% ਤੱਕ ਘੱਟ ਜਾਂਦੀ ਹੈ। ਇਸ ਵਰਤਾਰੇ ਦਾ ਨਾਮ ਕੀ ਹੈ?
- ਏ) ਓਵਰਲਰਨਿੰਗ; ਮਾਡਲ ਸਿਖਲਾਈ ਸੈੱਟ ਨੂੰ ਯਾਦ ਕਰਦਾ ਹੈ
- ਬੀ) ਮਾਡਲ ਡ੍ਰਾਈਫਟ; ਜਿਵੇਂ ਕਿ ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ, ਮਾਡਲ ਚੁੱਪਚਾਪ ਅਪ੍ਰਚਲਿਤ ਹੋ ਜਾਂਦਾ ਹੈ, ਕਿਸੇ ਦਾ ਧਿਆਨ ਨਹੀਂ ਕਿਉਂਕਿ ਨਿਗਰਾਨੀ ਸਥਾਪਤ ਨਹੀਂ ਕੀਤੀ ਜਾਂਦੀ ✔
- ਸੀ) ਚੋਣ ਪੱਖਪਾਤ; ਨਮੂਨਾ ਪੱਖਪਾਤ
- ਡੀ) ਡੇਟਾ ਮਿਨੀਮਾਈਜ਼ੇਸ਼ਨ ਦੀ ਉਲੰਘਣਾ
ਵਿਆਖਿਆ: ਇਹ ਮਾਡਲ ਡ੍ਰਾਈਫਟ (ਮਾਡਲ/ਡਾਟਾ ਡ੍ਰਾਈਫਟ) ਹੈ: ਜਦੋਂ ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ (ਕੈਟਲਾਗ, ਵਿਹਾਰ, ਸੀਜ਼ਨ) ਉਹ ਸਥਿਤੀਆਂ ਜਿਨ੍ਹਾਂ ਦੇ ਤਹਿਤ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ ਸ਼ਿਫਟ ਅਤੇ ਮਾਡਲ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦਾ ਹੈ। ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਮਾਡਲ ਆਪਣੇ ਆਪ ਵਿਗੜਦਾ ਹੈ; ਇਹ 'ਕਦ' ਦੀ ਗੱਲ ਹੈ। ਨਿਗਰਾਨੀ ਦੇ ਬਿਨਾਂ ਤੈਨਾਤੀ (ਟਰੈਕਿੰਗ ਇਨਪੁਟ ਅਤੇ ਪ੍ਰਦਰਸ਼ਨ) ਇਸ ਨੂੰ ਡਿਗਰੇਡੇਸ਼ਨ ਦਾ ਪਤਾ ਲਗਾਉਣਾ ਅਸੰਭਵ ਬਣਾਉਂਦੀ ਹੈ।
14. ਇੱਕ ਮਾਡਲ ਜੋ ਇੱਕ ਸਿੰਗਲ ਸਿਖਲਾਈ/ਟੈਸਟ ਸਪਲਿਟ ਵਿੱਚ 88% ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਵਿੱਚ 88%, 71%, 83%, 64%, 79% ਦੇ 5-ਗੁਣਾ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਸਕੋਰ ਹਨ। ਇਹ ਕੀ ਦਰਸਾਉਂਦਾ ਹੈ ਅਤੇ ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ?
- ਏ) ਮਾਡਲ ਸਥਿਰ ਹੈ; 88% ਅਸਲ ਪ੍ਰਦਰਸ਼ਨ ਹੈ
- ਅ) ਕਰਾਸ-ਪ੍ਰਮਾਣਿਕਤਾ ਬੇਲੋੜੀ ਹੈ; ਇੱਕ ਡੱਬਾ ਕਾਫ਼ੀ ਹੈ
- C) ਸਕੋਰਾਂ ਦੀ ਵੱਡੀ ਅਸਥਿਰਤਾ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਮਾਡਲ ਅਸਥਿਰ ਹੈ; ਔਸਤ ਅਤੇ ਮਲਟੀਪਲ ਬਿਨਾਂ ਦੀ ਵੰਡ 'ਤੇ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਅਧਾਰ ਪ੍ਰਦਰਸ਼ਨ, ਇੱਕ ਵੀ ਲੱਕੀ ਬਿਨ ਨਹੀਂ ✔
- D) ਸਭ ਤੋਂ ਵੱਧ ਸਕੋਰ (88%) ਦੀ ਰਿਪੋਰਟ ਕਰਨਾ ਸਭ ਤੋਂ ਵਧੀਆ ਹੈ
ਵਿਆਖਿਆ: ਇੱਕ ਸਿੰਗਲ ਡੱਬਾ ਖੁਸ਼ਕਿਸਮਤ ਜਾਂ ਬਦਕਿਸਮਤ ਹੋ ਸਕਦਾ ਹੈ; 88% ਸਿਰਫ਼ ਉਸ ਆਸਾਨ ਵੰਡ ਦਾ ਨਤੀਜਾ ਸੀ। ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਮੱਧਮਾਨ (ਇੱਥੇ ~ 77%) ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਆਧਾਰਿਤ ਕਰਦੇ ਹੋਏ ਅਤੇ ਸਕੋਰ ਦੀ ਅਸਥਿਰਤਾ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹੋਏ, ਡੇਟਾ ਨੂੰ ਕਈ ਵਾਰ ਵੰਡਦਾ ਹੈ। ਇੱਥੇ ਉੱਚ ਅਸਥਿਰਤਾ ਸੁਝਾਅ ਦਿੰਦੀ ਹੈ ਕਿ ਮਾਡਲ ਅਸਥਿਰ ਹੈ; ਇੱਕ ਡੱਬੇ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ।