ਇਕਾਈਆਂ
1. ਡੇਟਾ ਸਾਇੰਸ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਜਾਣ-ਪਛਾਣ: ਵਰਕਫਲੋ, ਭੂਮਿਕਾਵਾਂ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਨੈਤਿਕਤਾ 2. ਡੇਟਾ ਸੰਗ੍ਰਹਿ ਅਤੇ ਸਰੋਤ ਸਮਝ: ਸਕੀਮਾ, ਨਮੂਨਾ, ਗੁਣਵੱਤਾ ਅਤੇ ਲੀਕ ਜਾਗਰੂਕਤਾ 3. ਡੇਟਾ ਕਲੀਨਿੰਗ ਅਤੇ ਪ੍ਰੀਪ੍ਰੋਸੈਸਿੰਗ: ਗੁੰਮ ਮੁੱਲ, ਬਾਹਰੀ ਅਤੇ ਕਿਸਮ ਰੂਪਾਂਤਰਣ 4. ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (EDA): ਵੰਡ, ਰਿਸ਼ਤੇ, ਅਤੇ ਸ਼ੁਰੂਆਤੀ ਸੂਝ 5. ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ: ਵੇਰੀਐਂਟ ਤਿਆਰ ਕਰਨਾ, ਕੋਡਿੰਗ, ਸਕੇਲਿੰਗ, ਅਤੇ ਲੀਕੇਜ ਤੋਂ ਬਚਣਾ 6. ਮਾਡਲ ਬਿਲਡਿੰਗ: ਸਮੱਸਿਆ ਪਰਿਭਾਸ਼ਾ, ਐਲਗੋਰਿਦਮ ਚੋਣ, ਅਤੇ ਸਿਖਲਾਈ/ਟੈਸਟ ਸਪਲਿਟ 7. ਮਾਡਲ ਮੁਲਾਂਕਣ: ਮੈਟ੍ਰਿਕਸ, ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ, ਅਤੇ ਐਕਸਟ੍ਰੀਮ ਲਰਨਿੰਗ 8. ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਕਹਾਣੀ ਸੁਣਾਉਣਾ: ਸਹੀ ਗ੍ਰਾਫਿਕਸ, ਇਮਾਨਦਾਰ ਗ੍ਰਾਫਿਕਸ 9. ਕੋਡ ਜਨਰੇਸ਼ਨ: ਪਾਈਥਨ (ਪਾਂਡਾ) ਅਤੇ SQL ਨਾਲ AI-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਵਿਸ਼ਲੇਸ਼ਣ 10. ਡਾਟਾ ਲੀਕੇਜ ਅਤੇ ਰੀਪ੍ਰੋਡਸੀਬਿਲਟੀ: ਸਾਈਲੈਂਟ ਡਿਸਟਰਸ ਅਤੇ ਅਨੁਸ਼ਾਸਨ 11. MLOps ਫਾਊਂਡੇਸ਼ਨ, ਨੈਤਿਕਤਾ, ਗੋਪਨੀਯਤਾ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰ ਵਿਸ਼ਲੇਸ਼ਣ
ਯੂਨਿਟ 11 / 11

MLOps ਫਾਊਂਡੇਸ਼ਨ, ਨੈਤਿਕਤਾ, ਗੋਪਨੀਯਤਾ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰ ਵਿਸ਼ਲੇਸ਼ਣ

ਲਾਭ:

  • MLOps ਪੜਾਵਾਂ (ਰਿਲੀਜ਼, ਤੈਨਾਤੀ, ਨਿਗਰਾਨੀ, ਮੁੜ ਸਿਖਲਾਈ, ਰੋਲਬੈਕ) ਅਤੇ ਮਾਡਲ ਡ੍ਰਾਈਫਟ ਨੂੰ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਨਿਗਰਾਨੀ ਕੀਤੀ ਤੈਨਾਤੀ ਦੀ ਯੋਜਨਾ ਬਣਾਓ
  • ਮਾਡਲ ਨਿਰਪੱਖਤਾ, ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਜਵਾਬਦੇਹੀ ਦੇ ਸਿਧਾਂਤਾਂ ਨੂੰ ਲਾਗੂ ਕਰਨ ਅਤੇ ਨੈਤਿਕ ਸਵੀਕਾਰਤਾ ਤੋਂ ਅੰਕੜਾ ਸ਼ੁੱਧਤਾ ਨੂੰ ਵੱਖ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
  • KVKK/GDPR ਸਿਧਾਂਤਾਂ ਨਾਲ ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਰੱਖਿਆ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ ਵਿੱਚ ਮਨੁੱਖ ਨੂੰ ਅੰਤਮ ਜ਼ਿੰਮੇਵਾਰੀ ਸੌਂਪਣ ਦੀ ਸਮਰੱਥਾ

ਇੱਕ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣਾ ਅਤੇ ਉੱਚ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਨਾ ਅੰਤ ਨਹੀਂ ਹੈ, ਪਰ ਮੱਧ ਹੈ. ਅਸਲ ਮੁੱਲ ਉਦੋਂ ਆਉਂਦਾ ਹੈ ਜਦੋਂ ਮਾਡਲ ਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ, ਸਮੇਂ ਦੇ ਨਾਲ ਬਿਨਾਂ ਕਿਸੇ ਵਿਗਾੜ ਦੇ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਸਾਰੀ ਪ੍ਰਕਿਰਿਆ ਨੈਤਿਕ ਅਤੇ ਕਾਨੂੰਨੀ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਕਲੋਜ਼ਿੰਗ ਯੂਨਿਟ ਤਿੰਨ ਵਿਸ਼ਿਆਂ ਨੂੰ ਜੋੜਦੀ ਹੈ: MLOps (ਮਾਡਲਾਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਅਤੇ ਸੰਭਾਲਣ ਦਾ ਅਨੁਸ਼ਾਸਨ), ਨੈਤਿਕਤਾ (ਨਿਰਪੱਖਤਾ, ਪਾਰਦਰਸ਼ਤਾ, ਗੈਰ-ਨੁਕਸਾਨ) ਅਤੇ ਗੋਪਨੀਯਤਾ (ਨਿੱਜੀ ਡੇਟਾ ਦੀ ਸੁਰੱਖਿਆ)। AI ਇਹਨਾਂ ਖੇਤਰਾਂ ਵਿੱਚ ਕੋਡ, ਚੈਕਲਿਸਟਸ ਅਤੇ ਬਲੂਪ੍ਰਿੰਟ ਤਿਆਰ ਕਰਦਾ ਹੈ; ਪਰ ਮਨੁੱਖ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਕੋਈ ਮਾਡਲ ਲਾਈਵ ਹੁੰਦਾ ਹੈ, ਕੌਣ ਪ੍ਰਭਾਵਿਤ ਹੋਵੇਗਾ, ਅਤੇ ਕਿਹੜਾ ਡੇਟਾ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਫੈਸਲੇ ਤਕਨੀਕੀ ਨਹੀਂ, ਸਗੋਂ ਜ਼ਿੰਮੇਵਾਰੀ ਵਾਲੇ ਫੈਸਲੇ ਹਨ।

MLOps: ਮਾਡਲ ਇੱਕ ਉਤਪਾਦ ਵਾਂਗ ਰਹਿੰਦਾ ਹੈ

MLOps (ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਓਪਰੇਸ਼ਨਜ਼ - ਉਤਪਾਦਨ ਵਿੱਚ ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ, ਨਿਗਰਾਨੀ ਕਰਨ ਅਤੇ ਅੱਪਡੇਟ ਕਰਨ ਦਾ ਅਭਿਆਸ) ਡੇਟਾ ਵਿਗਿਆਨ ਵਿੱਚ ਸੌਫਟਵੇਅਰ ਵਿਕਾਸ ਵਿੱਚ DevOps ਦਾ ਅਨੁਕੂਲਨ ਹੈ। ਮੂਲ ਵਿਚਾਰ: ਇੱਕ ਮਾਡਲ ਇੱਕ ਫਾਈਲ ਨਹੀਂ ਹੈ ਜੋ ਇੱਕ ਵਾਰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਭੁੱਲ ਜਾਂਦੀ ਹੈ, ਪਰ ਇੱਕ ਜੀਵਿਤ ਉਤਪਾਦ ਜਿਸਦੀ ਨਿਰੰਤਰ ਦੇਖਭਾਲ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ. ਮੁੱਖ ਪੜਾਅ:

1. ਵਰਜਨਿੰਗ: ਕੋਡ (Git), ਡੇਟਾ ਅਤੇ ਮਾਡਲ ਇਕੱਠੇ ਵਰਜਨ ਕੀਤੇ ਗਏ ਹਨ; ਇਹ ਰਿਕਾਰਡ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਕਿ ਕਿਹੜਾ ਮਾਡਲ ਕਿਸ ਡੇਟਾ ਅਤੇ ਕੋਡ ਨਾਲ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਸੀ।

2. ਤੈਨਾਤੀ: ਮਾਡਲ ਨੂੰ ਇੱਕ API ਜਾਂ ਬੈਚ ਜੌਬ ਵਜੋਂ ਲਾਈਵ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਪਹਿਲਾਂ ਛੋਟੇ ਦਰਸ਼ਕਾਂ ਨੂੰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ (ਸ਼ੇਡ/ਕੈਨਰੀ ਵੰਡ)।

3. ਨਿਗਰਾਨੀ: ਮਾਡਲ ਅਤੇ ਇਨਪੁਟ ਡੇਟਾ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦੀ ਨਿਰੰਤਰ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।

4. ਮੁੜ ਸਿਖਲਾਈ: ਜਦੋਂ ਪ੍ਰਦਰਸ਼ਨ ਘਟਦਾ ਹੈ, ਮਾਡਲ ਨੂੰ ਅੱਪਡੇਟ ਕੀਤੇ ਡੇਟਾ ਨਾਲ ਦੁਬਾਰਾ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ।

ਪੈਟਰਨ ਸ਼ਿਫਟ: ਚੁੱਪ ਵਿਗਾੜ

ਉਤਪਾਦਨ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਡਾ ਖ਼ਤਰਾ ਮਾਡਲ ਡਰਾਫਟ (ਮਾਡਲ ਡਰਾਫਟ/ਡਾਟਾ ਡਰਾਫਟ) ਹੈ। ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ; ਉਹ ਸ਼ਰਤਾਂ ਜਿਨ੍ਹਾਂ 'ਤੇ ਤੁਸੀਂ ਆਪਣੇ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ (ਗਾਹਕ ਵਿਹਾਰ, ਕੀਮਤਾਂ, ਸੀਜ਼ਨ, ਕਾਨੂੰਨ) ਸਮੇਂ ਦੇ ਨਾਲ ਬਦਲ ਜਾਂਦੇ ਹਨ ਅਤੇ ਮਾਡਲ ਪੁਰਾਣਾ ਹੋਣਾ ਸ਼ੁਰੂ ਹੋ ਜਾਂਦਾ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਮਹਾਂਮਾਰੀ ਤੋਂ ਪਹਿਲਾਂ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਇੱਕ ਮੰਗ ਮਾਡਲ ਮਹਾਂਮਾਰੀ ਦੌਰਾਨ ਪੂਰੀ ਤਰ੍ਹਾਂ ਗਲਤ ਹੈ। ਡ੍ਰਾਈਫਟ ਦੋ ਰੂਪਾਂ ਵਿੱਚ ਹੁੰਦਾ ਹੈ: ਡੇਟਾ ਡ੍ਰਾਈਫਟ (ਇਨਪੁਟ ਡੇਟਾ ਤਬਦੀਲੀਆਂ ਦੀ ਵੰਡ) ਅਤੇ ਸੰਕਲਪ ਡ੍ਰਾਈਫਟ (ਇਨਪੁਟ ਅਤੇ ਟੀਚੇ ਵਿੱਚ ਤਬਦੀਲੀਆਂ ਵਿਚਕਾਰ ਸਬੰਧ)। ਇਹਨਾਂ ਨੂੰ ਹਾਸਲ ਕਰਨ ਦਾ ਤਰੀਕਾ ਨਿਗਰਾਨੀ ਹੈ: ਅਸਲ ਨਤੀਜੇ ਦੇ ਮੁਕਾਬਲੇ ਇਨਪੁਟ ਵੰਡ, ਪੂਰਵ ਅਨੁਮਾਨ ਵੰਡ, ਅਤੇ (ਜੇ ਸੰਭਵ ਹੋਵੇ) ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਲਗਾਤਾਰ ਟਰੈਕ ਕਰੋ।

ਸਾਵਧਾਨ: ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਮਾਡਲ ਆਪਣੇ ਆਪ ਹੀ ਵਿਗੜ ਜਾਵੇਗਾ; ਇਹ "ਜੇ" ਪਰ "ਕਦੋਂ" ਦੀ ਗੱਲ ਨਹੀਂ ਹੈ। ਨਿਰੀਖਣ ਸਥਾਪਤ ਕੀਤੇ ਬਿਨਾਂ ਮਾਡਲਾਂ ਨੂੰ ਤੈਨਾਤ ਕਰਨਾ ਇੱਕ ਕਾਰ ਨੂੰ ਆਪਣੇ ਇੰਜਣ ਨੂੰ ਨਿਯੰਤਰਿਤ ਕੀਤੇ ਬਿਨਾਂ ਚਲਾਉਣ ਵਰਗਾ ਹੈ; ਇੱਕ ਦਿਨ ਇਹ ਚੁੱਪਚਾਪ ਉੱਥੇ ਬੈਠ ਜਾਂਦਾ ਹੈ ਅਤੇ ਤੁਸੀਂ ਧਿਆਨ ਨਹੀਂ ਦਿੰਦੇ.

MLOps ਤੱਤ

ਮਕਸਦ

ਜੇਕਰ ਅਣਗਹਿਲੀ ਕੀਤੀ ਜਾਵੇ

ਸੰਸਕਰਣ

ਇਹ ਜਾਣਨਾ ਕਿ ਕੀ ਪੈਦਾ ਹੁੰਦਾ ਹੈ

ਗੈਰ-ਪ੍ਰਜਣਨਯੋਗ, ਗੈਰ-ਪ੍ਰਾਪਤ ਕਰਨ ਯੋਗ

ਨਿਗਰਾਨੀ

ਤਿਲਕ ਜਲਦੀ ਦੇਖ ਕੇ

ਮਾਡਲ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦਾ ਹੈ

ਮੁੜ ਸਿਖਲਾਈ

ਅੱਪ ਟੂ ਡੇਟ ਰਹੋ

ਭਵਿੱਖਬਾਣੀਆਂ ਪੁਰਾਣੀਆਂ ਹੋ ਜਾਂਦੀਆਂ ਹਨ

ਰੋਲਬੈਕ

ਮਾੜੇ ਮਾਡਲ 'ਤੇ ਵਾਪਸ ਜਾਓ

ਨੁਕਸਦਾਰ ਮਾਡਲ ਲਾਈਵ ਰਹਿੰਦਾ ਹੈ

ਦਸਤਾਵੇਜ਼ੀਕਰਨ

ਪਾਰਦਰਸ਼ਤਾ, ਟਰਨਓਵਰ

ਜਾਣਕਾਰੀ ਇੱਕ ਵਿਅਕਤੀ ਵਿੱਚ ਫਸ ਜਾਂਦੀ ਹੈ

ਨੈਤਿਕਤਾ: ਮਾਡਲ ਦੇ ਫੈਸਲੇ ਲੋਕਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦੇ ਹਨ

ਡੇਟਾ ਮਾਡਲਾਂ ਦੀ ਵਰਤੋਂ ਉਹਨਾਂ ਫੈਸਲਿਆਂ ਵਿੱਚ ਵੱਧਦੀ ਜਾ ਰਹੀ ਹੈ ਜੋ ਲੋਕਾਂ ਦੇ ਜੀਵਨ ਨੂੰ ਪ੍ਰਭਾਵਤ ਕਰਦੇ ਹਨ: ਕ੍ਰੈਡਿਟ, ਭਰਤੀ, ਬੀਮਾ, ਨਿਆਂ। ਇਸ ਸ਼ਕਤੀ ਨਾਲ ਜ਼ਿੰਮੇਵਾਰੀ ਆਉਂਦੀ ਹੈ। ਮੁੱਖ ਨੈਤਿਕ ਜੋਖਮ:

ਪੱਖਪਾਤ ਅਤੇ ਵਿਤਕਰਾ: ਮਾਡਲ ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਬੇਇਨਸਾਫ਼ੀ ਨੂੰ ਸਿੱਖ ਸਕਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਕਾਇਮ ਰੱਖ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਕਿਸੇ ਖਾਸ ਸਮੂਹ ਨੂੰ ਅਤੀਤ ਵਿੱਚ ਘੱਟ ਕ੍ਰੈਡਿਟ ਦਿੱਤਾ ਗਿਆ ਹੈ, ਤਾਂ ਮਾਡਲ ਮੰਨਦਾ ਹੈ ਕਿ ਇਹ ਇੱਕ "ਨਿਯਮ" ਹੈ ਅਤੇ ਵਿਤਕਰੇ ਨੂੰ ਸਵੈਚਾਲਤ ਕਰਦਾ ਹੈ। ਇਸ ਲਈ ਨਿਰਪੱਖਤਾ ਵਿਸ਼ਲੇਸ਼ਣ — ਇਹ ਜਾਂਚਣਾ ਕਿ ਕੀ ਮਾਡਲ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ (ਲਿੰਗ, ਉਮਰ, ਖੇਤਰ) ਲਈ ਸਮਾਨ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ — ਜ਼ਰੂਰੀ ਹੈ।

ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਵਿਆਖਿਆਯੋਗਤਾ: ਤੁਹਾਨੂੰ ਇਹ ਦੱਸਣ ਦੇ ਯੋਗ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਇੱਕ ਮਾਡਲ ਨੇ ਇੱਕ ਵਿਅਕਤੀ ਨੂੰ ਕਿਉਂ ਰੱਦ ਕੀਤਾ। "ਬਲੈਕ ਬਾਕਸ ਨੇ ਅਜਿਹਾ ਕਿਹਾ" ਨੈਤਿਕ ਤੌਰ 'ਤੇ ਅਤੇ ਅਕਸਰ ਕਾਨੂੰਨੀ ਤੌਰ 'ਤੇ ਅਸਵੀਕਾਰਨਯੋਗ ਹੈ। ਇਸ ਲਈ ਵਿਆਖਿਆਯੋਗਤਾ ਸਾਧਨ (ਵਿਸ਼ੇਸ਼ਤਾ ਮਹੱਤਵ, SHAP ਮੁੱਲ) ਕੀਮਤੀ ਹਨ।

ਜਵਾਬਦੇਹੀ: ਜੇ ਮਾਡਲ ਗਲਤ ਫੈਸਲਾ ਲੈਂਦਾ ਹੈ ਤਾਂ ਕੌਣ ਜ਼ਿੰਮੇਵਾਰ ਹੈ? ਜਵਾਬ ਹਮੇਸ਼ਾ ਇੱਕ ਵਿਅਕਤੀ/ਸੰਸਥਾ ਹੁੰਦਾ ਹੈ, ਇੱਕ ਮਾਡਲ ਨਹੀਂ। ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ (ਮਨੁੱਖੀ-ਇਨ-ਦੀ-ਲੂਪ - ਅੰਤਮ ਫੈਸਲੇ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦੇਣ ਵਾਲਾ ਮਨੁੱਖ) ਨੂੰ ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ ਵਿੱਚ ਸੁਰੱਖਿਅਤ ਰੱਖਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

ਸਾਵਧਾਨ: ਇੱਕ ਮਾਡਲ ਅੰਕੜਾਤਮਕ ਤੌਰ 'ਤੇ "ਸਹੀ" ਹੋ ਸਕਦਾ ਹੈ ਪਰ ਨੈਤਿਕ ਤੌਰ 'ਤੇ ਅਸਵੀਕਾਰਨਯੋਗ ਹੈ। ਇੱਕ ਬਹੁਤ ਹੀ ਸਟੀਕ ਮਾਡਲ ਜੋ ਇੱਕ ਸਮੂਹ ਨੂੰ ਵਿਵਸਥਿਤ ਰੂਪ ਵਿੱਚ ਨੁਕਸਾਨ ਪਹੁੰਚਾਉਂਦਾ ਹੈ ਇੱਕ ਚੰਗਾ ਮਾਡਲ ਨਹੀਂ ਹੈ। ਇਮਾਨਦਾਰੀ ਇਨਸਾਫ਼ ਦਾ ਕੋਈ ਬਦਲ ਨਹੀਂ ਹੈ।

ਗੋਪਨੀਯਤਾ: ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ ਧਿਆਨ ਨਾਲ ਸੁਰੱਖਿਅਤ ਕੀਤਾ ਗਿਆ ਹੈ

ਡੇਟਾ ਵਿਗਿਆਨ ਦਾ ਕੱਚਾ ਮਾਲ ਅਕਸਰ ਨਿੱਜੀ ਡੇਟਾ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਇਹ ਡੇਟਾ ਕਾਨੂੰਨ ਦੁਆਰਾ ਸੁਰੱਖਿਅਤ ਹੁੰਦਾ ਹੈ: ਤੁਰਕੀਏ ਵਿੱਚ ਕੇਵੀਕੇਕੇ, ਯੂਰਪ ਵਿੱਚ ਜੀਡੀਪੀਆਰ। ਮੂਲ ਸਿਧਾਂਤ ਹਨ: ਉਦੇਸ਼ ਸੀਮਾ (ਡਾਟਾ ਉਸ ਉਦੇਸ਼ ਤੋਂ ਇਲਾਵਾ ਹੋਰ ਉਦੇਸ਼ਾਂ ਲਈ ਨਹੀਂ ਵਰਤਿਆ ਜਾਂਦਾ ਜਿਸ ਲਈ ਇਸ ਨੂੰ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ ਸੀ), ਡੇਟਾ ਮਿਨੀਮਾਈਜ਼ੇਸ਼ਨ (ਲੋੜ ਤੋਂ ਵੱਧ ਕੋਈ ਡਾਟਾ ਇਕੱਠਾ/ਰੱਖਿਆ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ), ਅਗਿਆਤਤਾ (ਜਾਣਕਾਰੀ ਦੀ ਪਛਾਣ ਹਟਾ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ) ਅਤੇ ਸੁਰੱਖਿਆ (ਡੇਟਾ ਏਨਕ੍ਰਿਪਟਡ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਪਹੁੰਚ ਪ੍ਰਤਿਬੰਧਿਤ ਹੈ)। AI ਟੂਲਸ ਨਾਲ ਕੰਮ ਕਰਦੇ ਸਮੇਂ ਨਾਜ਼ੁਕ ਨਿਯਮ: ਕਦੇ ਵੀ ਅਸਲੀ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ ਜਨਤਕ AI ਟੂਲ ਵਿੱਚ ਪੇਸਟ ਨਾ ਕਰੋ। ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ, ਇੱਕ ਚਿੱਤਰ ਅਤੇ ਇੱਕ ਅਗਿਆਤ/ਸਿੰਥੈਟਿਕ ਨਮੂਨਾ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਕਾਫੀ ਹੁੰਦੇ ਹਨ।

ਜਾਣਕਾਰੀ ਸੁਰੱਖਿਆ ਦੇ ਸੰਦਰਭ ਵਿੱਚ ਇੱਕ ਵਾਧੂ ਜ਼ੋਰ: ਰੱਖਿਆਤਮਕ ਅਤੇ ਜਾਇਜ਼ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਉਦੇਸ਼ਾਂ ਲਈ, ਡੇਟਾ ਵਿਗਿਆਨ ਦੇ ਸਾਧਨਾਂ ਅਤੇ ਤਕਨੀਕਾਂ ਦੀ ਵਰਤੋਂ ਸਿਰਫ਼ ਉਹਨਾਂ ਡੇਟਾ ਅਤੇ ਪ੍ਰਣਾਲੀਆਂ 'ਤੇ ਕਰੋ ਜਿਨ੍ਹਾਂ ਲਈ ਤੁਹਾਡੇ ਕੋਲ ਅਧਿਕਾਰ ਹੈ। ਕਿਸੇ ਹੋਰ ਦੇ ਡੇਟਾ ਤੱਕ ਅਣਅਧਿਕਾਰਤ ਪਹੁੰਚ, ਵਿਅਕਤੀਆਂ ਦੀ ਮੁੜ-ਪਛਾਣ (ਅਗਿਆਤ ਡੇਟਾ ਤੋਂ ਪਛਾਣ ਕੱਢਣਾ) ਜਾਂ ਅਣਅਧਿਕਾਰਤ ਪ੍ਰੋਫਾਈਲਿੰਗ ਦੋਵੇਂ ਗੈਰ-ਕਾਨੂੰਨੀ ਅਤੇ ਅਨੈਤਿਕ ਹਨ।

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 — ਟਰੈਕ ਨਾ ਕੀਤਾ ਗਿਆ ਢਹਿ। ਇੱਕ ਈ-ਕਾਮਰਸ ਕੰਪਨੀ ਆਪਣੇ ਸਿਫ਼ਾਰਿਸ਼ ਮਾਡਲ ਦੇ ਨਾਲ ਲਾਈਵ ਹੋ ਗਈ ਅਤੇ ਟਰੈਕਿੰਗ ਸੈਟ ਅਪ ਨਹੀਂ ਕੀਤੀ। 4 ਮਹੀਨਿਆਂ ਬਾਅਦ ਉਤਪਾਦ ਕੈਟਾਲਾਗ ਬਹੁਤ ਬਦਲ ਗਿਆ ਹੈ; ਮਾਡਲ ਪੁਰਾਣੇ ਉਤਪਾਦਾਂ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦਾ ਰਿਹਾ, ਅਤੇ ਪਰਿਵਰਤਨ ਦਰ ਚੁੱਪਚਾਪ 30% ਤੱਕ ਘਟ ਗਈ। ਮਹੀਨਿਆਂ ਬੱਧੀ ਕਿਸੇ ਦਾ ਧਿਆਨ ਨਹੀਂ ਗਿਆ। ਸਬਕ: ਬਿਨਾਂ ਨਿਗਰਾਨੀ ਦੇ ਤੈਨਾਤੀ ਅੰਨ੍ਹੇ ਹੋ ਰਹੀ ਹੈ।

ਕੇਸ 2 - ਲੁਕਿਆ ਹੋਇਆ ਵਿਤਕਰਾ। ਇੱਕ ਹਾਇਰਿੰਗ ਸਕ੍ਰੀਨਿੰਗ ਮਾਡਲ ਨੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਲਿੰਗ ਅਸੰਤੁਲਨ ਅਤੇ ਯੋਜਨਾਬੱਧ ਤੌਰ 'ਤੇ ਘੱਟ ਦਰਜਾ ਪ੍ਰਾਪਤ ਮਹਿਲਾ ਉਮੀਦਵਾਰਾਂ ਬਾਰੇ ਸਿੱਖਿਆ। ਇਹ ਧਿਆਨ ਨਹੀਂ ਦਿੱਤਾ ਗਿਆ ਕਿਉਂਕਿ ਕੋਈ ਨਿਰਪੱਖਤਾ ਵਿਸ਼ਲੇਸ਼ਣ ਨਹੀਂ ਸੀ; ਇਹ ਇੱਕ ਆਡਿਟ ਵਿੱਚ ਸਾਹਮਣੇ ਆਇਆ ਸੀ ਅਤੇ ਸੰਸਥਾ ਨੂੰ ਗੰਭੀਰ ਪ੍ਰਤਿਸ਼ਠਾ/ਕਾਨੂੰਨੀ ਜੋਖਮ ਦਾ ਸਾਹਮਣਾ ਕਰਨਾ ਪਿਆ ਸੀ। ਸਬਕ: ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਮਾਡਲਾਂ ਵਿੱਚ ਸਮੂਹ-ਅਧਾਰਿਤ ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ ਜ਼ਰੂਰੀ ਹੈ।

ਕੇਸ 3 - ਗੁਪਤਤਾ ਦੀ ਉਲੰਘਣਾ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ ਇੱਕ ਜਨਤਕ ਏਆਈ ਟੂਲ ਵਿੱਚ ਅਸਲ ਗਾਹਕ ਈਮੇਲਾਂ ਅਤੇ ਖਰੀਦ ਇਤਿਹਾਸ ਵਾਲੀ ਇੱਕ ਫਾਈਲ ਲੋਡ ਕੀਤੀ ਅਤੇ ਕਿਹਾ, "ਖੰਡਾਂ ਨੂੰ ਸੰਖੇਪ ਕਰੋ।" ਨਿੱਜੀ ਡੇਟਾ ਨੇ ਸੰਸਥਾ ਨੂੰ ਛੱਡ ਦਿੱਤਾ ਹੈ; KVKK ਪ੍ਰਕਿਰਿਆ ਸ਼ੁਰੂ ਹੋ ਗਈ ਹੈ। ਸਹੀ ਤਰੀਕਾ ਪਛਾਣ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾਉਣਾ ਅਤੇ ਸਿਰਫ਼ ਬੇਨਾਮੀ ਸੰਪਤੀਆਂ ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ ਸੀ। ਸਬਕ: ਅਸਲ ਨਿੱਜੀ ਡੇਟਾ ਓਪਨ ਟੂਲ ਵਿੱਚ ਦਾਖਲ ਨਹੀਂ ਹੁੰਦਾ।

ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ

1) ਪ੍ਰੀ-ਡਿਪਲਾਇਮੈਂਟ ਚੈੱਕਲਿਸਟ:

ਤੁਹਾਡੀ ਭੂਮਿਕਾ: MLOps ਸਲਾਹਕਾਰ। ਉਹਨਾਂ ਚੀਜ਼ਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ ਜਿਨ੍ਹਾਂ ਦੀ ਮੈਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਮਾਡਲ ਲਗਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਜਾਂਚ ਕਰਨ ਦੀ ਲੋੜ ਹੈ: ਸੰਸਕਰਣ, ਨਿਗਰਾਨੀ ਮੈਟ੍ਰਿਕਸ, ਰੋਲਬੈਕ ਯੋਜਨਾ, ਪ੍ਰਦਰਸ਼ਨ ਥ੍ਰੈਸ਼ਹੋਲਡ, ਡੇਟਾ ਡ੍ਰਾਈਫਟ ਚੇਤਾਵਨੀ, ਜ਼ਿੰਮੇਵਾਰ ਵਿਅਕਤੀ। ਹਰੇਕ ਆਈਟਮ ਲਈ ਇੱਕ-ਵਾਕ "ਇਹ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ" ਵਿਆਖਿਆ ਸ਼ਾਮਲ ਕਰੋ। ਮੈਂ ਫੈਸਲਾ ਕਰਾਂਗਾ।

2) ਮਾਡਲ ਸ਼ਿਫਟ ਟਰੈਕਿੰਗ ਡਿਜ਼ਾਈਨ:

ਉਤਪਾਦਨ ਵਿੱਚ ਇੱਕ ਵਰਗੀਕਰਣ ਮਾਡਲ ਲਈ ਇੱਕ ਡ੍ਰਫਟ ਨਿਗਰਾਨੀ ਯੋਜਨਾ ਦਾ ਸੁਝਾਅ ਦਿਓ: (1) ਮੈਨੂੰ ਕਿਹੜੀਆਂ ਇਨਪੁਟ ਵੰਡਾਂ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ, (2) ਭਵਿੱਖਬਾਣੀ ਵੰਡ ਲਈ ਕਿਹੜਾ ਅਲਾਰਮ, (3) ਅਸਲ ਨਤੀਜਾ ਆਉਣ 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਤੁਲਨਾ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, (4) ਕਿਸ ਥ੍ਰੈਸ਼ਹੋਲਡ 'ਤੇ ਮੁੜ ਸਿਖਲਾਈ ਸ਼ੁਰੂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ। ਇੱਕ ਕੋਡ ਪਿੰਜਰ ਵੀ ਪ੍ਰਦਾਨ ਕਰੋ।

3) ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ:

ਕੋਡ ਲਿਖੋ ਜੋ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ ਲਈ ਮੇਰੇ ਮਾਡਲ ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਦੀ ਤੁਲਨਾ ਕਰਦਾ ਹੈ (ਉਦਾਹਰਨ ਲਈ ਉਮਰ ਬੈਂਡ, ਖੇਤਰ): ਹਰ ਇੱਕ ਸਮੂਹ ਲਈ ਯਾਦ/ਸ਼ੁੱਧਤਾ ਅਤੇ ਸਕਾਰਾਤਮਕ ਫੈਸਲੇ ਦੀ ਦਰ। ਜੇਕਰ ਸਮੂਹਾਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਅੰਤਰ ਹੈ ਤਾਂ ਚੇਤਾਵਨੀ ਦਿਓ। ਕਾਰਣ/ਰਾਜਨੀਤਿਕ ਵਿਆਖਿਆ ਕਰਨਾ; ਬੱਸ ਮੈਨੂੰ ਮਤਭੇਦ ਦਿਖਾਓ ਅਤੇ ਮੈਂ ਫੈਸਲੇ 'ਤੇ ਵਿਚਾਰ ਕਰਾਂਗਾ।

4) ਗੋਪਨੀਯਤਾ ਪ੍ਰੀ-ਚੈੱਕ:

AI ਟੂਲ ਨੂੰ ਡੇਟਾ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ, ਜਾਂਚ ਕਰੋ: ਕੀ ਹੇਠਾਂ ਦਿੱਤੇ ਕਾਲਮ ਸੂਚੀ ਵਿੱਚ ਨਿੱਜੀ/ਪਛਾਣ ਡੇਟਾ (ਨਾਮ, ਈਮੇਲ, ID, ਫ਼ੋਨ, ਪਤਾ, IP) ਹੈ? ਜੇਕਰ ਅਜਿਹਾ ਹੈ, ਤਾਂ ਸੂਚੀਬੱਧ ਕਰੋ ਕਿ ਕਿਸ ਨੂੰ ਹਟਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਜਾਂ ਅਗਿਆਤ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਕਾਲਮ: [ਸੂਚੀ]। ਉਦੇਸ਼: ਸਿਰਫ਼ ਅਗਿਆਤ ਸਕੀਮਾ ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ।

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:

ਮੇਰਾ ਮਾਡਲ ਤਿਆਰ ਹੈ, ਲਾਈਵ ਹੋਵੋ।

ਤਾਇਨਾਤੀ ਇੱਕ ਕਦਮ ਨਹੀਂ ਹੈ; ਬਿਨਾਂ ਨਿਗਰਾਨੀ, ਰੋਲਬੈਕ, ਨਿਰਪੱਖਤਾ ਅਤੇ ਗੋਪਨੀਯਤਾ ਨਿਯੰਤਰਣ ਦੇ ਲਾਈਵ ਜਾਣਾ ਤਬਾਹੀ ਲਈ ਇੱਕ ਚੁੱਪ ਸੱਦਾ ਹੈ।

ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:

ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਜ਼ਿੰਮੇਵਾਰ MLOps ਸਲਾਹਕਾਰ। ਮੇਰੇ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਹੈ, ਮੈਂ ਲਾਈਵ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਪੂਰੀ ਤਿਆਰੀ ਚਾਹੁੰਦਾ ਹਾਂ। ਤਿਆਰ ਕਰੋ: (1) ਪ੍ਰੀ-ਡਿਪਲਾਇਮੈਂਟ ਚੈਕਲਿਸਟ, (2) ਡਰਿਫਟ ਨਿਗਰਾਨੀ ਯੋਜਨਾ, (3) ਸਮੂਹ-ਅਧਾਰਤ ਨਿਰਪੱਖਤਾ ਜਾਂਚ ਕੋਡ, (4) ਗੋਪਨੀਯਤਾ ਜਾਂਚ (ਕੀ ਨਿੱਜੀ ਡੇਟਾ ਹੈ)। ਇਹ ਵੀ ਸੁਝਾਅ ਦਿਓ ਕਿ ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ ਵਿੱਚ ਮਨੁੱਖੀ ਸਹਿਮਤੀ ਦੀ ਰੱਖਿਆ ਕਿਵੇਂ ਕੀਤੀ ਜਾਵੇ। ਅੰਤਿਮ ਫੈਸਲੇ ਮੇਰੇ ਹਨ।

ਇੱਥੇ ਵੰਡ, ਨਿਗਰਾਨੀ, ਨਿਰਪੱਖਤਾ ਅਤੇ ਗੋਪਨੀਯਤਾ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਜ਼ਿੰਮੇਵਾਰ ਪ੍ਰਕਿਰਿਆ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ।

ਆਮ ਗਲਤੀਆਂ

  • ਨਿਰੀਖਣ ਸਥਾਪਤ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਮਾਡਲ ਤੈਨਾਤ ਕਰਨਾ। ਮਾਡਲ ਚੁੱਪਚਾਪ ਖਿਸਕ ਜਾਂਦਾ ਹੈ ਅਤੇ ਵਿਗਾੜਦਾ ਹੈ; ਧਿਆਨ ਦੇਣ ਵਿੱਚ ਮਹੀਨੇ ਲੱਗ ਸਕਦੇ ਹਨ।
  • ਇਨਸਾਫ਼ ਦੀ ਜਾਂਚ ਨੂੰ ਬਾਈਪਾਸ ਕਰਨਾ. ਇੱਕ ਉੱਚ-ਵਫ਼ਾਦਾਰ ਮਾਡਲ ਇੱਕ ਸਮੂਹ ਨੂੰ ਯੋਜਨਾਬੱਧ ਤੌਰ 'ਤੇ ਨੁਕਸਾਨ ਪਹੁੰਚਾ ਸਕਦਾ ਹੈ।
  • ਇੱਕ ਅਣਜਾਣ ਬਲੈਕ ਬਾਕਸ ਦਾ ਫੈਸਲਾ ਲੈਣਾ। ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲੇ ਸਮਝਾਉਣ ਯੋਗ ਹੋਣੇ ਚਾਹੀਦੇ ਹਨ; "ਮਾਡਲ ਨੇ ਅਜਿਹਾ ਕਿਹਾ" ਕਾਫ਼ੀ ਨਹੀਂ ਹੈ।
  • AI ਟੂਲ ਨੂੰ ਖੋਲ੍ਹਣ ਲਈ ਅਸਲ ਨਿੱਜੀ ਡਾਟਾ ਦੇਣਾ। KVKK/GDPR ਦੀ ਉਲੰਘਣਾ; ਚਿੱਤਰ ਅਤੇ ਅਗਿਆਤ ਉਦਾਹਰਨ ਕਾਫ਼ੀ ਹਨ.
  • ਮਾਡਲ ਨੂੰ ਫੈਸਲਾ ਸੌਂਪਦੇ ਹੋਏ। ਜ਼ਿੰਮੇਵਾਰੀ ਹਮੇਸ਼ਾ ਇੱਕ ਵਿਅਕਤੀ ਦੇ ਨਾਲ ਹੁੰਦੀ ਹੈ; ਉੱਚ ਪ੍ਰਭਾਵ ਮਨੁੱਖੀ ਨਿਗਰਾਨੀ ਰੱਖੀ ਜਾਂਦੀ ਹੈ।
ਸੁਝਾਅ: ਹਰੇਕ ਮਾਡਲ ਨਾਲ ਲਾਈਵ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ, ਉੱਚੀ ਆਵਾਜ਼ ਵਿੱਚ ਇੱਕ ਸਵਾਲ ਪੁੱਛੋ: "ਜੇਕਰ ਇਹ ਮਾਡਲ ਕੱਲ੍ਹ ਨੂੰ ਚੁੱਪਚਾਪ ਤੋੜਦਾ ਹੈ ਜਾਂ ਕਿਸੇ ਸਮੂਹ ਨੂੰ ਗਲਤ ਢੰਗ ਨਾਲ ਸਜ਼ਾ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਮੈਂ ਇਸਨੂੰ ਕਿਵੇਂ ਨੋਟਿਸ ਕਰਾਂਗਾ ਅਤੇ ਇਸਨੂੰ ਵਾਪਸ ਕਿਵੇਂ ਕਰਾਂਗਾ?" ਜੇ ਤੁਹਾਡੇ ਕੋਲ ਇਸ ਸਵਾਲ ਦਾ ਸਪੱਸ਼ਟ ਜਵਾਬ ਨਹੀਂ ਹੈ, ਤਾਂ ਮਾਡਲ ਅਜੇ ਉਤਪਾਦਨ ਲਈ ਤਿਆਰ ਨਹੀਂ ਹੈ.

ਸਾਰੰਸ਼ ਵਿੱਚ

ਇੱਕ ਮਾਡਲ ਦੀ ਨੌਕਰੀ ਇੱਕ ਉੱਚ ਸਕੋਰ ਨਾਲ ਖਤਮ ਨਹੀਂ ਹੁੰਦੀ, ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਭਰੋਸੇਯੋਗ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਕੰਮ ਕਰਨ ਨਾਲ. MLOps ਲਾਈਵ ਹੋਣ ਦਾ ਅਨੁਸ਼ਾਸਨ ਹੈ, ਵਹਿਣ ਲਈ ਨਿਗਰਾਨੀ, ਮੁੜ ਸਿਖਲਾਈ, ਅਤੇ ਮਾਡਲ ਨੂੰ ਵਾਪਸ ਰੋਲ ਕਰਨਾ; ਟਰੈਕਿੰਗ ਦੇ ਬਿਨਾਂ ਤੈਨਾਤੀ ਚੁੱਪ ਢਹਿ ਹੈ। ਨੈਤਿਕਤਾ ਲਈ ਮਾਡਲ ਦੀ ਨਿਰਪੱਖਤਾ, ਪਾਰਦਰਸ਼ਤਾ ਅਤੇ ਜਵਾਬਦੇਹੀ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਅੰਕੜਾ ਸ਼ੁੱਧਤਾ ਨੈਤਿਕ ਸਵੀਕਾਰਯੋਗਤਾ ਦਾ ਕੋਈ ਬਦਲ ਨਹੀਂ ਹੈ। ਗੋਪਨੀਯਤਾ ਦਾ ਮਤਲਬ ਹੈ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ KVKK/GDPR ਸਿਧਾਂਤਾਂ ਨਾਲ ਸੁਰੱਖਿਅਤ ਕਰਨਾ ਅਤੇ ਅਸਲ ਡੇਟਾ ਨੂੰ ਖੁੱਲੇ ਸਾਧਨਾਂ ਤੋਂ ਦੂਰ ਰੱਖਣਾ। ਇਹ ਸਾਰੇ ਫੈਸਲੇ ਤਕਨੀਕੀ ਨਹੀਂ ਸਗੋਂ ਜ਼ਿੰਮੇਵਾਰੀ ਵਾਲੇ ਫੈਸਲੇ ਹੁੰਦੇ ਹਨ ਅਤੇ ਹਮੇਸ਼ਾ ਮਨੁੱਖ ਨਾਲ ਸਬੰਧਤ ਹੁੰਦੇ ਹਨ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਇਸ ਬਾਰੇ ਸੋਚੋ ਜਿਵੇਂ ਤੁਸੀਂ ਇੱਕ ਮਾਡਲ (ਜਾਂ ਕਲਪਨਾਤਮਕ) ਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਲਗਾਉਣ ਜਾ ਰਹੇ ਹੋ ਅਤੇ ਚਾਰ ਸੂਚੀਆਂ ਭਰਨ ਜਾ ਰਹੇ ਹੋ: (1) ਪ੍ਰੀ-ਡਿਪਲਾਇਮੈਂਟ ਚੈਕਲਿਸਟ, (2) ਡ੍ਰਾਈਫਟ ਮੈਟ੍ਰਿਕਸ ਜੋ ਤੁਸੀਂ ਟਰੈਕ ਕਰੋਗੇ, (3) ਸਮੂਹ-ਅਧਾਰਿਤ ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ ਯੋਜਨਾ, (4) ਗੋਪਨੀਯਤਾ ਨਿਯੰਤਰਣ। ਫਿਰ ਸਵਾਲ ਦਾ ਇੱਕ ਠੋਸ ਜਵਾਬ ਲਿਖੋ "ਮੈਂ ਕਿਵੇਂ ਨੋਟਿਸ ਕਰਾਂਗਾ ਜੇ ਇਹ ਕੱਲ੍ਹ ਨੂੰ ਚੁੱਪਚਾਪ ਤੋੜਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਵਾਪਸ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹਾਂ?"

ਚੈੱਕਲਿਸਟ

  • ਕੀ ਮੈਂ ਇੱਕ ਨਿਗਰਾਨੀ (ਸਲਿੱਪ ਚੇਤਾਵਨੀ) ਅਤੇ ਰੋਲਬੈਕ ਯੋਜਨਾ ਦੇ ਨਾਲ ਮਾਡਲ ਨੂੰ ਤੈਨਾਤ ਕਰ ਰਿਹਾ ਹਾਂ?
  • ਕੀ ਮੈਂ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ ਲਈ ਨਿਰਪੱਖਤਾ/ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਅੰਤਰ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ?
  • [ ] ਕੀ ਮੈਂ ਉੱਚ ਪ੍ਰਭਾਵ ਵਾਲੇ ਫੈਸਲਿਆਂ 'ਤੇ ਮਨੁੱਖੀ-ਇਨ-ਦੀ-ਲੂਪ ਨੂੰ ਕਾਇਮ ਰੱਖਿਆ ਹੈ?
  • ਕੀ ਮੈਂ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ KVKK/GDPR ਸਿਧਾਂਤਾਂ ਨਾਲ ਸੁਰੱਖਿਅਤ ਕੀਤਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਖੁੱਲ੍ਹੇ ਸਾਧਨਾਂ ਤੋਂ ਦੂਰ ਰੱਖਿਆ ਹੈ?
  • ਕੀ ਮੈਂ ਅੰਤਮ ਜਿੰਮੇਵਾਰੀ ਇੱਕ ਮਨੁੱਖ ਉੱਤੇ ਰੱਖੀ ਹੈ, ਮਾਡਲ ਉੱਤੇ ਨਹੀਂ?

ਮੋਡੀਊਲ ਪ੍ਰੀਖਿਆ

1. ਇੱਕ ਡੇਟਾ ਵਿਗਿਆਨੀ ਨਕਲੀ ਬੁੱਧੀ ਨੂੰ ਪੁੱਛਦਾ ਹੈ, "ਇਸ ਡੇਟਾ ਤੇ ਬੇਤਰਤੀਬ ਜੰਗਲ ਕਿੰਨਾ ਸਹੀ ਹੈ?" ਮਾਡਲ ਨੂੰ ਬਿਲਕੁਲ ਸਿਖਲਾਈ ਦਿੱਤੇ ਬਿਨਾਂ, ਅਤੇ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਪੇਸ਼ਕਾਰੀ ਵਿੱਚ "89%" ਦਾ ਜਵਾਬ ਦਿੰਦਾ ਹੈ। ਇਸ ਪਹੁੰਚ ਵਿੱਚ ਬੁਨਿਆਦੀ ਗਲਤੀ ਕੀ ਹੈ?

  • ਏ) ਨਕਲੀ ਬੁੱਧੀ ਨੂੰ ਡੇਟਾ ਅਤੇ ਮਾਡਲ ਦਿੱਤੇ ਬਿਨਾਂ ਮੈਟ੍ਰਿਕਸ ਦੀ ਉਡੀਕ; ਇਸ ਗੱਲ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ ਕਿ ਇਹ ਜੋ ਨੰਬਰ ਤਿਆਰ ਕਰਦਾ ਹੈ ਉਹ ਜਾਅਲੀ ਹੈ ਅਤੇ ਅਸਲ ਮੈਟ੍ਰਿਕ ਸਿਰਫ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟਿੰਗ ਦੁਆਰਾ ਲੱਭਿਆ ਜਾ ਸਕਦਾ ਹੈ ✔
  • ਅ) ਬੇਤਰਤੀਬੇ ਜੰਗਲ ਦੀ ਬਜਾਏ ਲੌਜਿਸਟਿਕ ਰਿਗਰੈਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ
  • C) ਸ਼ੁੱਧਤਾ ਦਰ ਹਮੇਸ਼ਾ 90% ਤੋਂ ਉੱਪਰ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।
  • ਡੀ) ਪੇਸ਼ਕਾਰੀ ਵਿੱਚ ਮੈਟ੍ਰਿਕਸ ਸ਼ਾਮਲ ਕਰਨ ਦੀ ਸਖ਼ਤ ਮਨਾਹੀ ਹੈ

ਵਿਆਖਿਆ: ਨਕਲੀ ਬੁੱਧੀ ਮਾਡਲ ਅਤੇ ਡੇਟਾ ਤੱਕ ਪਹੁੰਚ ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਮੈਟ੍ਰਿਕ ਤਿਆਰ ਨਹੀਂ ਕਰ ਸਕਦੀ; ਉਹ ਜੋ ਨੰਬਰ ਦਿੰਦਾ ਹੈ ਉਹ ਭੁਲੇਖਾ (ਮਨਘੜਤ) ਹੈ। ਮਾੱਡਲ ਨੂੰ ਅਸਲ ਵਿੱਚ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟ ਕੀਤੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਹੀ ਡਾਟਾ ਵਿਗਿਆਨੀ ਦੀ ਆਪਣੀ ਗਣਨਾ ਦੁਆਰਾ ਮੈਟ੍ਰਿਕ ਪ੍ਰਾਪਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਗੈਰ-ਪ੍ਰਮਾਣਿਤ ਆਉਟਪੁੱਟ ਇੱਕ ਹਸਤਾਖਰਿਤ ਰਿਪੋਰਟ ਵਾਂਗ ਹੈ।

2. ਇੱਕ ਮੰਥਨ ਪੂਰਵ ਅਨੁਮਾਨ ਲਈ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨ ਵੇਲੇ 'ਖਾਤਾ ਬੰਦ ਕਰਨ ਦਾ ਕਾਰਨ' ਕਾਲਮ ਸ਼ਾਮਲ ਕੀਤਾ ਜਾਂਦਾ ਹੈ; ਇਹ ਕਾਲਮ ਗਾਹਕ ਦੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਹੀ ਭਰਿਆ ਜਾਂਦਾ ਹੈ। ਮਾਡਲ ਟੈਸਟ ਸੈੱਟ 'ਤੇ 97% ਦਿੰਦਾ ਹੈ, ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕੰਮ ਨਹੀਂ ਕਰਦਾ. ਇਸ ਸਥਿਤੀ ਦਾ ਨਾਮ ਅਤੇ ਕਾਰਨ ਕੀ ਹੈ?

  • ਏ) ਓਵਰਲਰਨਿੰਗ; ਮਾਡਲ ਬਹੁਤ ਗੁੰਝਲਦਾਰ ਹੈ
  • ਬੀ) ਡਾਟਾ ਲੀਕ; ✔ ਜਾਣਕਾਰੀ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਜੋ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਉਪਲਬਧ ਨਹੀਂ ਹੋਵੇਗੀ, ਪਰ ਇੱਕ ਵਿਸ਼ੇਸ਼ਤਾ ਦੇ ਰੂਪ ਵਿੱਚ, ਟੀਚੇ ਦਾ ਨਤੀਜਾ ਹੈ
  • ਸੀ) ਨਾਕਾਫ਼ੀ ਸਿੱਖਣ; ਮਾਡਲ ਬਹੁਤ ਸਧਾਰਨ ਹੈ
  • ਡੀ) ਚੋਣ ਪੱਖਪਾਤ; ਛੋਟਾ ਨਮੂਨਾ ਆਕਾਰ

ਵਿਆਖਿਆ: ਇਹ ਇੱਕ ਕਲਾਸਿਕ ਡਾਟਾ ਲੀਕ ਹੈ: 'ਬੰਦ ਹੋਣ ਦਾ ਕਾਰਨ' ਟੀਚੇ ਦਾ ਨਤੀਜਾ ਹੈ ਅਤੇ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਅਜੇ ਵੀ ਖਾਲੀ ਹੈ। ਮਾਡਲ ਇਸ ਭਵਿੱਖ ਦੇ ਗਿਆਨ ਨਾਲ ਚਾਲ ਕਰਦਾ ਹੈ, ਇਹ ਟੈਸਟ ਸੈੱਟ 'ਤੇ ਬਹੁਤ ਵਧੀਆ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕ੍ਰੈਸ਼ ਹੋ ਜਾਂਦਾ ਹੈ ਕਿਉਂਕਿ ਉਹ ਕਾਲਮ ਖਾਲੀ ਹੈ। ਪ੍ਰਸ਼ਨ 'ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੇਰੇ ਕੋਲ ਹੈ' ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਪੁੱਛਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

3. ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਮਤਲਬ ਦੇ ਨਾਲ ਮਾਲੀਆ ਕਾਲਮ ਵਿੱਚ ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ ਨੂੰ ਭਰਦਾ ਹੈ; ਪਰ ਲਾਪਤਾ ਲੋਕ ਅਸਲ ਵਿੱਚ ਘੱਟ ਆਮਦਨੀ ਵਾਲੇ ਹਿੱਸੇ ਨਾਲ ਸਬੰਧਤ ਹਨ ਜਿਨ੍ਹਾਂ ਨੇ ਕਦੇ ਆਮਦਨੀ ਦਾ ਐਲਾਨ ਨਹੀਂ ਕੀਤਾ (ਸਿਸਟਮਮੈਟਿਕ ਲਾਪਤਾ)। ਇਹ ਭਰਨਾ ਗਲਤ ਕਿਉਂ ਹੈ?

  • A) ਮੱਧਮਾਨ ਹਮੇਸ਼ਾ ਮੱਧਮਾਨ ਤੋਂ ਵੱਡਾ ਹੁੰਦਾ ਹੈ, ਇਸਲਈ ਇਹ ਗਲਤ ਹੈ
  • ਅ) ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ ਨੂੰ ਕਦੇ ਵੀ ਭਰਿਆ ਨਹੀਂ ਜਾਣਾ ਚਾਹੀਦਾ, ਉਹਨਾਂ ਨੂੰ ਹਮੇਸ਼ਾ ਮਿਟਾਉਣਾ ਚਾਹੀਦਾ ਹੈ
  • C) ਮੱਧਮਾਨ ਦੇ ਨਾਲ ਵਿਵਸਥਿਤ ਪਾੜੇ ਨੂੰ ਭਰਨਾ ਉਸ ਸਮੂਹ ਨੂੰ ਨਕਲੀ ਰੂਪ ਵਿੱਚ ਦਰਸਾਉਂਦੇ ਹੋਏ ਡੇਟਾ ਨੂੰ ਵਿਗਾੜਦਾ ਹੈ; 'ਖਾਲੀ ਕਿਉਂ ਹੈ?' ਸਵਾਲ ਪੁੱਛੇ ਬਿਨਾਂ ਹੀ ਭਰਨ ਦਾ ਕੰਮ ਕੀਤਾ ਗਿਆ। ✔
  • ਡੀ) ਔਸਤ ਦੀ ਗਣਨਾ ਕਰਨਾ ਇੱਕ ਪ੍ਰਦਰਸ਼ਨ ਸਮੱਸਿਆ ਪੈਦਾ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਬਹੁਤ ਹੌਲੀ ਹੈ

ਵਿਆਖਿਆ: ਘਾਟ ਦਾ ਕਾਰਨ ਹੱਲ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ। ਜਦੋਂ ਯੋਜਨਾਬੱਧ ਗੁੰਮ (ਕਿਸੇ ਖਾਸ ਸਮੂਹ ਵਿੱਚ ਕੇਂਦਰਿਤ ਅੰਤਰ) ਔਸਤ ਨਾਲ ਭਰਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਉਹ ਸਮੂਹ ਨਕਲੀ ਤੌਰ 'ਤੇ 'ਔਸਤ ਆਮਦਨ' ਬਣ ਜਾਂਦਾ ਹੈ ਅਤੇ ਡੇਟਾ ਨੂੰ ਵਿਗਾੜ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਇਸ ਨੂੰ ਭਰਨ ਤੋਂ ਪਹਿਲਾਂ, 'ਇਹ ਖਾਲੀ ਕਿਉਂ ਹੈ' ਸਵਾਲ ਪੁੱਛਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ; ਵਿਵਸਥਿਤ/ਮਹੱਤਵਪੂਰਣ ਗੁੰਮ ਹੋਏ ਮਾਧਿਅਮ ਨੂੰ ਭਰਿਆ ਨਹੀਂ ਜਾਣਾ ਚਾਹੀਦਾ।

4. ਇੱਕ ਟੀਮ 'ਵਿਗਿਆਪਨ ਖਰਚ' ਅਤੇ 'ਵਿਕਰੀ' ਵਿਚਕਾਰ 0.78 ਸਬੰਧ ਲੱਭਦੀ ਹੈ ਅਤੇ ਬਜਟ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਦਿੰਦੀ ਹੈ; ਹਾਲਾਂਕਿ, ਜੋ ਅਸਲ ਵਿੱਚ ਦੋਵਾਂ ਨੂੰ ਚਾਲੂ ਕਰਦਾ ਹੈ ਉਹ ਮੌਸਮੀ ਮੁਹਿੰਮਾਂ ਹਨ. ਅੰਕੜਿਆਂ ਵਿੱਚ ਕਿਹੜਾ ਸਿਧਾਂਤ ਇਸ ਗਲਤੀ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ?

  • ਏ) ਸਬੰਧ ਕਾਰਨ ਨਹੀਂ ਹੈ; ਇੱਕ ਲੁਕਿਆ ਤੀਜਾ ਵੇਰੀਏਬਲ ਦੋਵਾਂ ਵੇਰੀਏਬਲਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰ ਸਕਦਾ ਹੈ ✔
  • ਅ) ਕਿਉਂਕਿ 0.78 ਦਾ ਸਬੰਧ ਬਹੁਤ ਘੱਟ ਹੈ, ਇਸ ਲਈ ਰਿਸ਼ਤੇ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ
  • C) ਸਬੰਧ ਹਮੇਸ਼ਾ ਕਾਰਨ ਸਾਬਤ ਕਰਦਾ ਹੈ, ਟੀਮ ਨੇ ਇਸ ਨੂੰ ਸਹੀ ਕੀਤਾ
  • ਡੀ) ਇਸ਼ਤਿਹਾਰਬਾਜ਼ੀ ਅਤੇ ਵਿਕਰੀ ਵਿਚਕਾਰ ਸਬੰਧ ਨੂੰ ਗਣਿਤਿਕ ਤੌਰ 'ਤੇ ਨਹੀਂ ਗਿਣਿਆ ਜਾ ਸਕਦਾ।

ਵਿਆਖਿਆ: ਸਬੰਧ ਕਾਰਨ ਨਹੀਂ ਹੈ। ਦੋ ਵੇਰੀਏਬਲ ਇਕੱਠੇ ਕੰਮ ਕਰ ਸਕਦੇ ਹਨ ਕਿਉਂਕਿ ਇੱਕ ਲੁਕਿਆ ਹੋਇਆ ਤੀਜਾ ਵੇਰੀਏਬਲ (ਇੱਥੇ ਮੌਸਮੀ ਮੁਹਿੰਮਾਂ) ਦੋਵਾਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ। ਸਿੱਟਾ ਕਿ ਇੱਕ ਦੂਜੇ ਦਾ ਕਾਰਨ ਬਣਦਾ ਹੈ ਕੇਵਲ ਪ੍ਰਯੋਗ ਅਤੇ ਖੇਤਰੀ ਗਿਆਨ ਦੁਆਰਾ ਸਥਾਪਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ; ਇਕੱਲੇ ਸਬੰਧਾਂ ਦੀ ਗਿਣਤੀ ਕਾਰਣ ਦਾ ਸਬੂਤ ਨਹੀਂ ਹੈ।

5. ਇੱਕ ਧੋਖਾਧੜੀ ਦਾ ਪਤਾ ਲਗਾਉਣ ਵਾਲਾ ਮਾਡਲ 99.2% ਸ਼ੁੱਧਤਾ ਦਿਖਾਉਂਦਾ ਹੈ ਅਤੇ ਟੀਮ ਜਸ਼ਨ ਮਨਾਉਂਦੀ ਹੈ; ਹਾਲਾਂਕਿ, ਡੇਟਾ ਵਿੱਚ ਫਰਜ਼ੀ ਲੈਣ-ਦੇਣ ਦੀ ਦਰ ਸਿਰਫ 0.8% ਹੈ ਅਤੇ ਮਾਡਲ ਦੀ ਵਾਪਸੀ 6% ਹੈ। ਇਹ ਸਾਰਣੀ ਕੀ ਦਰਸਾਉਂਦੀ ਹੈ?

  • ਏ) ਮਾਡਲ ਸੰਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਸ਼ੁੱਧਤਾ 99% ਤੋਂ ਵੱਧ ਹੈ
  • ਅ) ਸ਼ੁੱਧਤਾ ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਦੇ ਨਾਲ ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ; ਮਾਡਲ ਲਗਭਗ ਸਾਰੇ ਨਕਲੀ (ਘੱਟ ਯਾਦ) ਨੂੰ ਖੁੰਝਾਉਂਦਾ ਹੈ, ਉਚਿਤ ਮੈਟ੍ਰਿਕ ਨੂੰ ਦੇਖਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ✔
  • C) ਮਾਡਲ ਦੀ ਰੀਕਾਲ ਜ਼ਿਆਦਾ ਹੋਣ ਕਾਰਨ ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ
  • ਡੀ) ਨਕਲੀ ਰੇਟ ਘੱਟ ਹੋਣ ਕਰਕੇ ਮਾਡਲ ਬਣਾਉਣ ਦੀ ਲੋੜ ਨਹੀਂ ਸੀ

ਵਿਆਖਿਆ: ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਵਿੱਚ 'ਸ਼ੁੱਧਤਾ' ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ। ਜਦੋਂ ਮਾਡਲ ਲਗਭਗ ਹਰ ਟ੍ਰਾਂਜੈਕਸ਼ਨ ਨੂੰ 'ਕਲੀਨ' ਕਹਿੰਦਾ ਹੈ, ਤਾਂ ਇਹ ਉੱਚ ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਨਕਲੀ ਬਹੁਤ ਘੱਟ ਹੁੰਦੇ ਹਨ, ਪਰ ਇਹ ਨਕਲੀ ਨੂੰ ਫੜਨ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦਾ ਹੈ, ਜੋ ਕਿ ਇਸਦਾ ਮੁੱਖ ਉਦੇਸ਼ ਹੈ (6% ਯਾਦ ਕਰੋ)। ਇਸ ਲਈ, ਅਸੰਤੁਲਿਤ ਸਮੱਸਿਆਵਾਂ ਵਿੱਚ, ਫੋਕਸ ਸ਼ੁੱਧਤਾ 'ਤੇ ਨਹੀਂ ਹੈ, ਪਰ ਕੰਮ ਦੇ ਉਦੇਸ਼ ਲਈ ਉਲਝਣ ਵਾਲੇ ਮੈਟ੍ਰਿਕਸ ਅਤੇ ਮੈਟ੍ਰਿਕਸ 'ਤੇ ਹੈ, ਜਿਵੇਂ ਕਿ ਰੀਕਾਲ/ਸ਼ੁੱਧਤਾ।

6. ਇੱਕ ਮੰਗ ਪੂਰਵ ਅਨੁਮਾਨ ਪ੍ਰੋਜੈਕਟ ਵਿੱਚ, ਸਮਾਂ-ਨਿਰਭਰ ਡੇਟਾ ਬੇਤਰਤੀਬੇ ਤੌਰ 'ਤੇ ਸਿਖਲਾਈ/ਟੈਸਟਿੰਗ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ। ਮਾਡਲ 93% ਸ਼ੁੱਧਤਾ ਦਿੰਦਾ ਹੈ ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕਰੈਸ਼ ਹੋ ਜਾਂਦਾ ਹੈ। ਸਹੀ ਵੰਡ ਪਹੁੰਚ ਕੀ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ?

  • ਏ) ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਵੱਡਾ ਕਰਨਾ, ਉਦਾਹਰਨ ਲਈ ਵੰਡਣਾ 50%/50%
  • ਅ) ਇੱਕ ਹੋਰ ਗੁੰਝਲਦਾਰ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਨਾ
  • C) ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਾਲ ਭਾਗ ਨੂੰ ਹਟਾਓ ਅਤੇ ਸਾਰੇ ਡੇਟਾ ਨਾਲ ਟ੍ਰੇਨ ਕਰੋ
  • ਡੀ) ਕਾਲਕ੍ਰਮਿਕ ਵੰਡ: ਪੁਰਾਣੇ ਸਮੇਂ ਦੇ ਨਾਲ ਸਿਖਲਾਈ ਅਤੇ ਨਵੀਂ ਮਿਆਦ ਦੇ ਨਾਲ ਟੈਸਟਿੰਗ, ਇਸ ਤਰ੍ਹਾਂ ਮਾਡਲ ਨੂੰ ਭਵਿੱਖ ਨੂੰ ਦੇਖਣ ਤੋਂ ਰੋਕਦਾ ਹੈ ✔

ਵਿਆਖਿਆ: ਜੇਕਰ ਸਮਾਂ ਲੜੀ ਦੇ ਡੇਟਾ ਵਿੱਚ ਬੇਤਰਤੀਬ ਵੰਡ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਤਾਂ ਮਾਡਲ ਭਵਿੱਖ ਨੂੰ ਵੇਖਦਾ ਹੈ ਅਤੇ ਸਿਖਲਾਈ ਵਿੱਚ ਅਤੀਤ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ; ਇਹ ਇੱਕ ਲੀਕ ਹੈ ਅਤੇ ਸਫਲਤਾ ਪੈਦਾ ਕਰਦਾ ਹੈ ਜੋ ਅਸਲ ਵਿੱਚ ਮੌਜੂਦ ਨਹੀਂ ਹੈ। ਸਹੀ ਪਹੁੰਚ ਕਾਲਕ੍ਰਮਿਕ ਵੰਡ ਹੈ: ਪੁਰਾਣੇ ਸਮੇਂ ਦੇ ਨਾਲ ਸਿਖਲਾਈ ਅਤੇ ਨਵੀਂ ਮਿਆਦ ਦੇ ਨਾਲ ਟੈਸਟਿੰਗ, ਉਤਪਾਦਨ ਵਿੱਚ ਅਸਲ ਸਥਿਤੀ ਦੀ ਨਕਲ ਕਰਨਾ (ਅਤੀਤ ਤੋਂ ਭਵਿੱਖ ਤੱਕ ਭਵਿੱਖਬਾਣੀ ਕਰਨਾ)।

7. ਫੀਚਰ ਇੰਜਨੀਅਰਿੰਗ ਵਿੱਚ ਕਿਸ ਡੇਟਾ ਤੋਂ ਸਕੇਲਿੰਗ (ਸਟੈਂਡਰਡ ਸਕੇਲਰ) ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਕਿਵੇਂ ਲਾਗੂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ?

  • ਏ) ਇਸਦੀ ਗਣਨਾ ਸਾਰੇ ਡੇਟਾ (ਸਿਖਲਾਈ + ਇਕੱਠੇ ਟੈਸਟਿੰਗ) ਤੋਂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ਤਾਂ ਜੋ ਇਹ ਵਧੇਰੇ ਸਹੀ ਹੋਵੇ
  • ਅ) ਹਰੇਕ ਕਤਾਰ ਲਈ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਇਸ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ, ਉਸ ਕਤਾਰ ਦੇ ਆਪਣੇ ਮੁੱਲ ਤੋਂ
  • C) ਟੈਸਟ ਡੇਟਾ ਤੋਂ ਹੀ ਗਣਨਾ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ
  • ਡੀ) ਇਸਦੀ ਗਣਨਾ ਸਿਰਫ ਸਿਖਲਾਈ ਡੇਟਾ ਤੋਂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ, ਫਿਰ ਉਹੀ ਮਾਪਦੰਡ ਟੈਸਟ ਡੇਟਾ ਤੇ ਲਾਗੂ ਕੀਤੇ ਜਾਣੇ ਚਾਹੀਦੇ ਹਨ; ਨਹੀਂ ਤਾਂ ਇਹ ਲੀਕ ਹੋ ਜਾਵੇਗਾ ✔

ਵਿਆਖਿਆ: ਸਾਰੇ ਪਰਿਵਰਤਨ ਦੇ ਮਾਪਦੰਡ (ਮਤਲਬ, ਮਿਆਰੀ ਵਿਵਹਾਰ, ਆਦਿ) ਜਿਵੇਂ ਕਿ ਸਕੇਲਿੰਗ, ਏਨਕੋਡਿੰਗ ਅਤੇ ਪੈਡਿੰਗ ਸਿਰਫ ਸਿਖਲਾਈ ਡੇਟਾ ਤੋਂ ਹੀ ਸਿੱਖੇ ਜਾਣੇ ਚਾਹੀਦੇ ਹਨ, ਫਿਰ ਇਹੀ ਟੈਸਟ ਡੇਟਾ 'ਤੇ ਲਾਗੂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਟੈਸਟ ਡੇਟਾ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਣ ਨਾਲ ਟੈਸਟ ਜਾਣਕਾਰੀ ਸਿਖਲਾਈ ਵਿੱਚ ਦਖਲਅੰਦਾਜ਼ੀ ਦਾ ਕਾਰਨ ਬਣਦੀ ਹੈ, ਯਾਨੀ ਕਿ ਲੀਕ ਹੋਣਾ, ਅਤੇ ਮਾਡਲ ਨੂੰ ਇਸ ਤੋਂ ਬਿਹਤਰ ਦਿਖਦਾ ਹੈ। ਪਾਈਪਲਾਈਨ ਦੀ ਵਰਤੋਂ ਇਸ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਂਦੀ ਹੈ।

8. ਇੱਕ ਮਾਡਲ ਸਿਖਲਾਈ ਸੈੱਟ 'ਤੇ 98% ਸ਼ੁੱਧਤਾ ਅਤੇ ਟੈਸਟ ਸੈੱਟ 'ਤੇ 72% ਸ਼ੁੱਧਤਾ ਦਿੰਦਾ ਹੈ। ਇਹ ਲੱਛਣ ਕੀ ਦਰਸਾਉਂਦਾ ਹੈ ਅਤੇ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ?

  • ਏ) ਨਾਕਾਫ਼ੀ ਸਿੱਖਣ; ਮਾਡਲ ਨੂੰ ਹੋਰ ਗੁੰਝਲਦਾਰ ਬਣਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ
  • ਬੀ) ਡਾਟਾ ਲੀਕ; ਟੈਸਟ ਸੈੱਟ ਬਦਲਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ
  • ਸੀ) ਓਵਰਫਿਟਿੰਗ; ਮਾਡਲ ਨੂੰ ਸਰਲ ਬਣਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ, ਰੈਗੂਲਰਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ ਲਾਗੂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ✔
  • ਡੀ) ਇੱਕ ਆਮ ਸਥਿਤੀ; ਸਿੱਖਿਆ ਦਾ ਸਕੋਰ ਹਮੇਸ਼ਾ ਉੱਚਾ ਹੁੰਦਾ ਹੈ, ਸਾਵਧਾਨੀ ਬੇਲੋੜੀ ਹੈ

ਵਿਆਖਿਆ: ਸਿਖਲਾਈ ਵਿੱਚ ਇੱਕ ਬਹੁਤ ਉੱਚ ਸਕੋਰ ਅਤੇ ਟੈਸਟਿੰਗ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਘੱਟ ਸਕੋਰ ਓਵਰਫਿਟਿੰਗ ਦਾ ਇੱਕ ਸ਼ਾਨਦਾਰ ਲੱਛਣ ਹੈ: ਮਾਡਲ ਨੇ ਅਸਲ ਪੈਟਰਨ ਦੀ ਬਜਾਏ ਸਿਖਲਾਈ ਡੇਟਾ ਦੇ ਰੌਲੇ ਨੂੰ ਯਾਦ ਕੀਤਾ ਹੈ। ਹੱਲਾਂ ਵਿੱਚ ਮਾਡਲ ਨੂੰ ਸਰਲ ਬਣਾਉਣਾ, ਵਧੇਰੇ ਡੇਟਾ, ਨਿਯਮਤੀਕਰਨ, ਅਤੇ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਨਾਲ ਰਾਜ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨਾ ਸ਼ਾਮਲ ਹੈ। ਸਿਰਫ਼ ਸਿੱਖਿਆ ਸਕੋਰ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਇਸ ਖਰਾਬੀ ਨੂੰ ਛੁਪਾਉਂਦਾ ਹੈ।

9. ਇੱਕ ਪ੍ਰਬੰਧਨ ਪ੍ਰਸਤੁਤੀ ਵਿੱਚ, ਇੱਕ ਬਾਰ ਚਾਰਟ ਦਾ y-ਧੁਰਾ ਜਿਸ ਵਿੱਚ ਵਿਕਰੀ 1,000 ਤੋਂ 1,020 ਤੱਕ ਵਧਦੀ ਹੈ, ਨੂੰ 980 ਤੋਂ ਸ਼ੁਰੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਤਾਂ ਜੋ ਵਾਧੇ ਨੂੰ ਵਿਸ਼ਾਲ ਬਣਾਇਆ ਜਾ ਸਕੇ। ਅਸਲ ਵਾਧਾ 2% ਹੈ। ਇਹ ਇੱਕ ਨੈਤਿਕ ਮੁੱਦਾ ਕਿਉਂ ਹੈ?

  • A) ਇੱਕ ਕੱਟਿਆ ਹੋਇਆ y-ਧੁਰਾ ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਇੱਕ ਛੋਟੇ ਫਰਕ ਨੂੰ ਵਧਾ-ਚੜ੍ਹਾ ਕੇ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਅਤੇ ਦਰਸ਼ਕ ਨੂੰ ਗੁੰਮਰਾਹ ਕਰਦਾ ਹੈ; ਨਿਰਪੱਖਤਾ ਲਈ, ਤੁਲਨਾਤਮਕ ਬਾਰਾਂ ਵਿੱਚ ਧੁਰਾ 0 ✔ ਤੋਂ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ
  • ਅ) ਬਾਰ ਚਾਰਟ ਕਦੇ ਵੀ ਵਿਕਰੀ ਡੇਟਾ ਲਈ ਨਹੀਂ ਵਰਤੇ ਜਾ ਸਕਦੇ ਹਨ
  • C) ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ; ਚਾਰਟ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਣਾਉਣਾ ਹਮੇਸ਼ਾ ਚੰਗਾ ਹੁੰਦਾ ਹੈ
  • D) Y-ਧੁਰਾ ਹਮੇਸ਼ਾ ਡੇਟਾ ਦੇ ਸਭ ਤੋਂ ਵੱਡੇ ਮੁੱਲ ਤੋਂ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ

ਵਿਆਖਿਆ: ਤੁਲਨਾਤਮਕ ਉਦੇਸ਼ਾਂ ਲਈ ਬਾਰ ਚਾਰਟ ਵਿੱਚ, y-ਧੁਰਾ ਆਮ ਤੌਰ 'ਤੇ 0 ਤੋਂ ਸ਼ੁਰੂ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਧੁਰੇ ਨੂੰ ਕੱਟਣ ਅਤੇ 980 ਤੋਂ ਸ਼ੁਰੂ ਕਰਨ ਨਾਲ 2% ਦਾ ਇੱਕ ਛੋਟਾ ਜਿਹਾ ਅੰਤਰ ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਬਹੁਤ ਵੱਡਾ ਜਾਪਦਾ ਹੈ ਅਤੇ ਦਰਸ਼ਕ ਨੂੰ ਗੁੰਮਰਾਹ ਕਰਦਾ ਹੈ। ਡੇਟਾ ਪ੍ਰੋਫੈਸ਼ਨਲ ਦੀ ਨੈਤਿਕ ਜ਼ਿੰਮੇਵਾਰੀ ਇਮਾਨਦਾਰ ਗ੍ਰਾਫਾਂ ਨੂੰ ਖਿੱਚਣਾ ਹੈ ਜੋ ਡੇਟਾ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਜਾਂ ਘੱਟ ਨਹੀਂ ਸਮਝਦੇ।

10. ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਉਤਪਾਦ ਸਾਰਣੀ ਦੇ ਨਾਲ ਆਰਡਰਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋਣ ਤੋਂ ਬਾਅਦ ਕੁੱਲ ਟਰਨਓਵਰ 3 ਵਾਰ ਲੱਭਦਾ ਹੈ; ਲਾਈਨਾਂ ਦੀ ਗਿਣਤੀ 240 ਹਜ਼ਾਰ ਤੋਂ ਵੱਧ ਕੇ 690 ਹਜ਼ਾਰ ਹੋ ਗਈ ਹੈ। ਇਸ ਚੁੱਪ ਗਲਤੀ ਨੂੰ ਰੋਕਣ ਲਈ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਸੀ?

  • A) ਕੁੱਲ ਟਰਨਓਵਰ ਨੂੰ 3 ਨਾਲ ਵੰਡੋ
  • B) ਹਮੇਸ਼ਾ JOIN ਦੀ ਬਜਾਏ ਵੱਖਰੇ ਸਵਾਲਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ
  • C) ਉਤਪਾਦ ਸਾਰਣੀ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਮਿਟਾਉਣਾ
  • D) ਵਿਲੀਨ/ਸ਼ਾਮਲ ਹੋਣ ਤੋਂ ਬਾਅਦ ਕਤਾਰਾਂ ਦੀ ਸੰਖਿਆ ਦੀ ਜਾਂਚ ਕਰਨਾ ਅਤੇ ਇਹ ਪੁਸ਼ਟੀ ਕਰਨਾ ਕਿ ਉਹ ਸਹੀ ਕੁੰਜੀ ਦੁਆਰਾ ਜੁੜੀਆਂ ਹਨ; ਨਕਲ ਨੂੰ ਜਲਦੀ ਫੜਨਾ ✔

ਸਪੱਸ਼ਟੀਕਰਨ: ਜਦੋਂ ਉਤਪਾਦ ਸਾਰਣੀ ਵਿੱਚ ਹਰੇਕ ਉਤਪਾਦ (ਉਦਾਹਰਣ ਲਈ ਵੱਖ-ਵੱਖ ਰੰਗ) ਲਈ ਇੱਕ ਤੋਂ ਵੱਧ ਕਤਾਰਾਂ ਹੁੰਦੀਆਂ ਹਨ, ਤਾਂ ਗਲਤ ਕੁੰਜੀ ਦੁਆਰਾ ਸ਼ਾਮਲ ਹੋਣ ਨਾਲ ਹਰੇਕ ਆਰਡਰ ਦੀ ਡੁਪਲੀਕੇਟ ਹੋ ਜਾਂਦੀ ਹੈ ਅਤੇ ਕੁੱਲ ਗਿਣਤੀ ਵਧ ਜਾਂਦੀ ਹੈ। ਕੋਡ ਬਿਨਾਂ ਕਿਸੇ ਤਰੁੱਟੀ ਦੇ ਚੱਲਦਾ ਹੈ ਪਰ ਨਤੀਜਾ ਗਲਤ ਹੈ। ਇਸ ਤੋਂ ਬਚਣ ਦਾ ਤਰੀਕਾ ਇਹ ਹੈ ਕਿ ਹਰੇਕ ਮਰਜ/ਜੁਆਇਨ ਤੋਂ ਬਾਅਦ ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ ਦੀ ਜਾਂਚ ਕਰੋ ਅਤੇ ਸਹੀ ਕੁੰਜੀ ਨਾਲ ਮਿਲਾਓ।

11. ਇੱਕ ਹਾਇਰਿੰਗ ਸਕ੍ਰੀਨਿੰਗ ਮਾਡਲ ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਲਿੰਗ ਅਸੰਤੁਲਨ ਬਾਰੇ ਸਿੱਖਦਾ ਹੈ ਅਤੇ ਯੋਜਨਾਬੱਧ ਤੌਰ 'ਤੇ ਸਕੋਰ ਮਹਿਲਾ ਉਮੀਦਵਾਰਾਂ ਦੇ ਅਧੀਨ ਹੈ, ਪਰ ਇਸਦੀ ਸਮੁੱਚੀ ਸ਼ੁੱਧਤਾ ਉੱਚ ਹੈ। ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ?

  • ਏ) ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ ਕਿਉਂਕਿ ਮਾਡਲ ਦੀ ਉੱਚ ਸ਼ੁੱਧਤਾ ਹੈ
  • ਅ) ਅੰਕੜਾ ਸ਼ੁੱਧਤਾ ਨੈਤਿਕ ਸਵੀਕਾਰਯੋਗਤਾ ਦਾ ਬਦਲ ਨਹੀਂ ਹੈ; ਮਾਡਲ ਨੇ ਪਿਛਲੇ ਵਿਤਕਰੇ ਬਾਰੇ ਸਿੱਖਿਆ ਹੈ, ਸਮੂਹ-ਅਧਾਰਿਤ ਨਿਰਪੱਖਤਾ ਜਾਂਚ ਦੀ ਲੋੜ ਹੈ ✔
  • C) ਮਾਡਲ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਹੋਰ ਵਧਾਉਣਾ ਸਮੱਸਿਆ ਦਾ ਹੱਲ ਕਰਦਾ ਹੈ
  • ਡੀ) ਨਿਰਪੱਖਤਾ ਡੇਟਾ ਵਿਗਿਆਨ ਦੇ ਦਾਇਰੇ ਤੋਂ ਬਾਹਰ ਹੈ

ਸਪੱਸ਼ਟੀਕਰਨ: ਭਾਵੇਂ ਕੋਈ ਮਾਡਲ ਅੰਕੜਾ ਪੱਖੋਂ ਸਹੀ ਹੈ, ਇਹ ਨੈਤਿਕ ਤੌਰ 'ਤੇ ਅਸਵੀਕਾਰਨਯੋਗ ਹੋ ਸਕਦਾ ਹੈ। ਮਾਡਲ ਪਿਛਲੇ ਡੇਟਾ ਵਿੱਚ ਬੇਇਨਸਾਫ਼ੀ ਸਿੱਖਦਾ ਹੈ ਅਤੇ ਵਿਤਕਰੇ ਨੂੰ ਸਵੈਚਾਲਤ ਕਰਦਾ ਹੈ। ਉੱਚ ਇਮਾਨਦਾਰੀ ਨਿਆਂ ਦਾ ਕੋਈ ਬਦਲ ਨਹੀਂ ਹੈ; ਉੱਚ-ਪ੍ਰਭਾਵ ਵਾਲੇ ਮਾਡਲਾਂ ਵਿੱਚ, ਨਿਰਪੱਖਤਾ ਨਿਯੰਤਰਣ, ਜੋ ਵੱਖ-ਵੱਖ ਸਮੂਹਾਂ ਲਈ ਪ੍ਰਦਰਸ਼ਨ/ਫੈਸਲੇ ਦੇ ਅੰਤਰ ਨੂੰ ਮਾਪਦਾ ਹੈ, ਜ਼ਰੂਰੀ ਹੈ ਅਤੇ ਅੰਤਮ ਜ਼ਿੰਮੇਵਾਰੀ ਮਨੁੱਖ ਦੀ ਹੁੰਦੀ ਹੈ।

12. ਇੱਕ ਕਰਮਚਾਰੀ ਇੱਕ ਜਨਤਕ AI ਟੂਲ ਵਿੱਚ ਅਸਲ ਗਾਹਕ ਈਮੇਲਾਂ ਅਤੇ ਖਰੀਦ ਇਤਿਹਾਸ ਵਾਲੀ ਇੱਕ ਫਾਈਲ ਨੂੰ ਅਪਲੋਡ ਕਰਦਾ ਹੈ ਅਤੇ ਕਹਿੰਦਾ ਹੈ ਕਿ 'ਖੰਡਾਂ ਦਾ ਸੰਖੇਪ'। ਇਹ ਇੱਕ ਗੰਭੀਰ ਗਲਤੀ ਕਿਉਂ ਹੈ ਅਤੇ ਸਹੀ ਤਰੀਕਾ ਕੀ ਹੈ?

  • ਏ) ਕੋਈ ਸਮੱਸਿਆ ਨਹੀਂ ਹੈ; AI ਟੂਲ ਕਦੇ ਵੀ ਡਾਟਾ ਸਟੋਰ ਨਹੀਂ ਕਰਦੇ ਹਨ
  • ਅ) ਗਲਤੀ ਇਹ ਹੈ ਕਿ ਫਾਈਲ ਬਹੁਤ ਵੱਡੀ ਹੈ; ਘਟਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਸੀ
  • C) ਇੱਕ ਓਪਨ ਟੂਲ ਨੂੰ ਅਸਲ ਨਿੱਜੀ ਡੇਟਾ ਪ੍ਰਦਾਨ ਕਰਨਾ KVKK/GDPR ਦੀ ਉਲੰਘਣਾ ਹੈ; ਪਛਾਣ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਸਿਰਫ਼ ਅਗਿਆਤ ਸਕੀਮਾ/ਪ੍ਰਾਪਰਟੀ ਸਾਂਝੀ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ ✔
  • ਡੀ) ਸਿਰਫ਼ ਐਕਸਲ ਦੀ ਬਜਾਏ CSV ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ

ਸਪੱਸ਼ਟੀਕਰਨ: ਜਦੋਂ ਅਸਲੀ ਨਿੱਜੀ ਡੇਟਾ (ਜਿਵੇਂ ਕਿ ਈ-ਮੇਲ, ਨਾਮ, ਆਦਿ) ਜਨਤਕ ਤੌਰ 'ਤੇ ਉਪਲਬਧ ਨਕਲੀ ਖੁਫੀਆ ਟੂਲ ਨੂੰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ KVKK / GDPR ਦੇ ਦਾਇਰੇ ਦੇ ਅੰਦਰ ਗੋਪਨੀਯਤਾ ਦੀ ਉਲੰਘਣਾ ਹੋਵੇਗੀ; ਡਾਟਾ ਸੰਗਠਨ ਨੂੰ ਛੱਡ ਦਿੰਦਾ ਹੈ. ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ, ਇੱਕ ਚਿੱਤਰ ਅਤੇ ਇੱਕ ਅਗਿਆਤ/ਸਿੰਥੈਟਿਕ ਨਮੂਨਾ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਕਾਫੀ ਹੁੰਦੇ ਹਨ। ਸਹੀ ਤਰੀਕਾ ਹੈ ਪਛਾਣ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾਉਣਾ ਅਤੇ ਸਿਰਫ਼ ਅਗਿਆਤ ਸੰਪਤੀਆਂ ਨੂੰ ਸਾਂਝਾ ਕਰਨਾ।

13. ਇੱਕ ਸਿਫਾਰਿਸ਼ ਮਾਡਲ ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਗਿਆ ਹੈ ਪਰ ਟਰੈਕਿੰਗ ਸਥਾਪਤ ਨਹੀਂ ਕੀਤੀ ਗਈ ਹੈ; ਜਦੋਂ ਉਤਪਾਦ ਕੈਟਾਲਾਗ 4 ਮਹੀਨਿਆਂ ਬਾਅਦ ਬਦਲਦਾ ਹੈ, ਤਾਂ ਮਾਡਲ ਪੁਰਾਣੇ ਉਤਪਾਦਾਂ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਨਾ ਜਾਰੀ ਰੱਖਦਾ ਹੈ ਅਤੇ ਪਰਿਵਰਤਨ ਦਰ ਚੁੱਪਚਾਪ 30% ਤੱਕ ਘੱਟ ਜਾਂਦੀ ਹੈ। ਇਸ ਵਰਤਾਰੇ ਦਾ ਨਾਮ ਕੀ ਹੈ?

  • ਏ) ਓਵਰਲਰਨਿੰਗ; ਮਾਡਲ ਸਿਖਲਾਈ ਸੈੱਟ ਨੂੰ ਯਾਦ ਕਰਦਾ ਹੈ
  • ਬੀ) ਮਾਡਲ ਡ੍ਰਾਈਫਟ; ਜਿਵੇਂ ਕਿ ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ, ਮਾਡਲ ਚੁੱਪਚਾਪ ਅਪ੍ਰਚਲਿਤ ਹੋ ਜਾਂਦਾ ਹੈ, ਕਿਸੇ ਦਾ ਧਿਆਨ ਨਹੀਂ ਕਿਉਂਕਿ ਨਿਗਰਾਨੀ ਸਥਾਪਤ ਨਹੀਂ ਕੀਤੀ ਜਾਂਦੀ ✔
  • ਸੀ) ਚੋਣ ਪੱਖਪਾਤ; ਨਮੂਨਾ ਪੱਖਪਾਤ
  • ਡੀ) ਡੇਟਾ ਮਿਨੀਮਾਈਜ਼ੇਸ਼ਨ ਦੀ ਉਲੰਘਣਾ

ਵਿਆਖਿਆ: ਇਹ ਮਾਡਲ ਡ੍ਰਾਈਫਟ (ਮਾਡਲ/ਡਾਟਾ ਡ੍ਰਾਈਫਟ) ਹੈ: ਜਦੋਂ ਸੰਸਾਰ ਬਦਲਦਾ ਹੈ (ਕੈਟਲਾਗ, ਵਿਹਾਰ, ਸੀਜ਼ਨ) ਉਹ ਸਥਿਤੀਆਂ ਜਿਨ੍ਹਾਂ ਦੇ ਤਹਿਤ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ ਸ਼ਿਫਟ ਅਤੇ ਮਾਡਲ ਚੁੱਪਚਾਪ ਟੁੱਟ ਜਾਂਦਾ ਹੈ। ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਮਾਡਲ ਆਪਣੇ ਆਪ ਵਿਗੜਦਾ ਹੈ; ਇਹ 'ਕਦ' ਦੀ ਗੱਲ ਹੈ। ਨਿਗਰਾਨੀ ਦੇ ਬਿਨਾਂ ਤੈਨਾਤੀ (ਟਰੈਕਿੰਗ ਇਨਪੁਟ ਅਤੇ ਪ੍ਰਦਰਸ਼ਨ) ਇਸ ਨੂੰ ਡਿਗਰੇਡੇਸ਼ਨ ਦਾ ਪਤਾ ਲਗਾਉਣਾ ਅਸੰਭਵ ਬਣਾਉਂਦੀ ਹੈ।

14. ਇੱਕ ਮਾਡਲ ਜੋ ਇੱਕ ਸਿੰਗਲ ਸਿਖਲਾਈ/ਟੈਸਟ ਸਪਲਿਟ ਵਿੱਚ 88% ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਵਿੱਚ 88%, 71%, 83%, 64%, 79% ਦੇ 5-ਗੁਣਾ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਸਕੋਰ ਹਨ। ਇਹ ਕੀ ਦਰਸਾਉਂਦਾ ਹੈ ਅਤੇ ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ?

  • ਏ) ਮਾਡਲ ਸਥਿਰ ਹੈ; 88% ਅਸਲ ਪ੍ਰਦਰਸ਼ਨ ਹੈ
  • ਅ) ਕਰਾਸ-ਪ੍ਰਮਾਣਿਕਤਾ ਬੇਲੋੜੀ ਹੈ; ਇੱਕ ਡੱਬਾ ਕਾਫ਼ੀ ਹੈ
  • C) ਸਕੋਰਾਂ ਦੀ ਵੱਡੀ ਅਸਥਿਰਤਾ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਮਾਡਲ ਅਸਥਿਰ ਹੈ; ਔਸਤ ਅਤੇ ਮਲਟੀਪਲ ਬਿਨਾਂ ਦੀ ਵੰਡ 'ਤੇ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਅਧਾਰ ਪ੍ਰਦਰਸ਼ਨ, ਇੱਕ ਵੀ ਲੱਕੀ ਬਿਨ ਨਹੀਂ ✔
  • D) ਸਭ ਤੋਂ ਵੱਧ ਸਕੋਰ (88%) ਦੀ ਰਿਪੋਰਟ ਕਰਨਾ ਸਭ ਤੋਂ ਵਧੀਆ ਹੈ

ਵਿਆਖਿਆ: ਇੱਕ ਸਿੰਗਲ ਡੱਬਾ ਖੁਸ਼ਕਿਸਮਤ ਜਾਂ ਬਦਕਿਸਮਤ ਹੋ ਸਕਦਾ ਹੈ; 88% ਸਿਰਫ਼ ਉਸ ਆਸਾਨ ਵੰਡ ਦਾ ਨਤੀਜਾ ਸੀ। ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਮੱਧਮਾਨ (ਇੱਥੇ ~ 77%) ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਆਧਾਰਿਤ ਕਰਦੇ ਹੋਏ ਅਤੇ ਸਕੋਰ ਦੀ ਅਸਥਿਰਤਾ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹੋਏ, ਡੇਟਾ ਨੂੰ ਕਈ ਵਾਰ ਵੰਡਦਾ ਹੈ। ਇੱਥੇ ਉੱਚ ਅਸਥਿਰਤਾ ਸੁਝਾਅ ਦਿੰਦੀ ਹੈ ਕਿ ਮਾਡਲ ਅਸਥਿਰ ਹੈ; ਇੱਕ ਡੱਬੇ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ।