ਇਕਾਈਆਂ
1. ਡੇਟਾ ਸਾਇੰਸ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਜਾਣ-ਪਛਾਣ: ਵਰਕਫਲੋ, ਭੂਮਿਕਾਵਾਂ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਨੈਤਿਕਤਾ 2. ਡੇਟਾ ਸੰਗ੍ਰਹਿ ਅਤੇ ਸਰੋਤ ਸਮਝ: ਸਕੀਮਾ, ਨਮੂਨਾ, ਗੁਣਵੱਤਾ ਅਤੇ ਲੀਕ ਜਾਗਰੂਕਤਾ 3. ਡੇਟਾ ਕਲੀਨਿੰਗ ਅਤੇ ਪ੍ਰੀਪ੍ਰੋਸੈਸਿੰਗ: ਗੁੰਮ ਮੁੱਲ, ਬਾਹਰੀ ਅਤੇ ਕਿਸਮ ਰੂਪਾਂਤਰਣ 4. ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (EDA): ਵੰਡ, ਰਿਸ਼ਤੇ, ਅਤੇ ਸ਼ੁਰੂਆਤੀ ਸੂਝ 5. ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ: ਵੇਰੀਐਂਟ ਤਿਆਰ ਕਰਨਾ, ਕੋਡਿੰਗ, ਸਕੇਲਿੰਗ, ਅਤੇ ਲੀਕੇਜ ਤੋਂ ਬਚਣਾ 6. ਮਾਡਲ ਬਿਲਡਿੰਗ: ਸਮੱਸਿਆ ਪਰਿਭਾਸ਼ਾ, ਐਲਗੋਰਿਦਮ ਚੋਣ, ਅਤੇ ਸਿਖਲਾਈ/ਟੈਸਟ ਸਪਲਿਟ 7. ਮਾਡਲ ਮੁਲਾਂਕਣ: ਮੈਟ੍ਰਿਕਸ, ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ, ਅਤੇ ਐਕਸਟ੍ਰੀਮ ਲਰਨਿੰਗ 8. ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਕਹਾਣੀ ਸੁਣਾਉਣਾ: ਸਹੀ ਗ੍ਰਾਫਿਕਸ, ਇਮਾਨਦਾਰ ਗ੍ਰਾਫਿਕਸ 9. ਕੋਡ ਜਨਰੇਸ਼ਨ: ਪਾਈਥਨ (ਪਾਂਡਾ) ਅਤੇ SQL ਨਾਲ AI-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਵਿਸ਼ਲੇਸ਼ਣ 10. ਡਾਟਾ ਲੀਕੇਜ ਅਤੇ ਰੀਪ੍ਰੋਡਸੀਬਿਲਟੀ: ਸਾਈਲੈਂਟ ਡਿਸਟਰਸ ਅਤੇ ਅਨੁਸ਼ਾਸਨ 11. MLOps ਫਾਊਂਡੇਸ਼ਨ, ਨੈਤਿਕਤਾ, ਗੋਪਨੀਯਤਾ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰ ਵਿਸ਼ਲੇਸ਼ਣ
ਯੂਨਿਟ 7 / 11

ਮਾਡਲ ਮੁਲਾਂਕਣ: ਮੈਟ੍ਰਿਕਸ, ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ, ਅਤੇ ਐਕਸਟ੍ਰੀਮ ਲਰਨਿੰਗ

ਲਾਭ:

  • ਨੌਕਰੀ ਦੇ ਉਦੇਸ਼ ਦੇ ਅਨੁਸਾਰ ਵਰਗੀਕਰਨ ਅਤੇ ਰਿਗਰੈਸ਼ਨ ਮੈਟ੍ਰਿਕਸ (ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ, ਸ਼ੁੱਧਤਾ/ਰੀਕਾਲ/F1, MAE/RMSE/R²) ਦੀ ਚੋਣ ਅਤੇ ਵਿਆਖਿਆ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
  • ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟ ਸਕੋਰਾਂ ਦੀ ਤੁਲਨਾ ਕਰਕੇ ਓਵਰਲਰਨਿੰਗ ਦਾ ਪਤਾ ਲਗਾਉਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਨਾਲ ਭਰੋਸੇਯੋਗ ਪ੍ਰਦਰਸ਼ਨ ਪ੍ਰਾਪਤ ਕਰਨਾ
  • ਇਹ ਮੁਲਾਂਕਣ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਕਿ ਕੀ ਹਰੇਕ ਮਾਡਲ ਇੱਕ ਬੇਸਲਾਈਨ ਨਾਲ ਤੁਲਨਾ ਕਰਕੇ ਅਸਲ ਮੁੱਲ ਜੋੜਦਾ ਹੈ

ਇੱਕ ਮਾਡਲ ਸਥਾਪਤ ਕਰਨਾ ਆਸਾਨ ਹੈ; ਇਹ ਇਮਾਨਦਾਰੀ ਨਾਲ ਮਾਪਣਾ ਮੁਸ਼ਕਲ ਹੈ ਕਿ ਕੀ ਇਹ ਅਸਲ ਵਿੱਚ ਕੰਮ ਕਰਦਾ ਹੈ. ਇਸ ਯੂਨਿਟ ਦਾ ਵਿਸ਼ਾ ਇੱਕ ਡੇਟਾ ਵਿਗਿਆਨੀ ਦਾ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਹੁਨਰ ਹੈ: ਸਹੀ ਮੈਟ੍ਰਿਕਸ ਦੇ ਨਾਲ ਮਾਡਲ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ, ਭਰੋਸੇਯੋਗ ਭਵਿੱਖਬਾਣੀ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਨਾ, ਅਤੇ ਸਭ ਤੋਂ ਧੋਖੇਬਾਜ਼ ਜਾਲ ਨੂੰ ਫੜਨਾ: ਓਵਰਲਰਨਿੰਗ (ਯਾਦ ਕਰਨਾ)। AI ਮੈਟ੍ਰਿਕਸ ਦੀ ਗਣਨਾ, ਵਿਆਖਿਆ ਅਤੇ ਤੁਲਨਾ ਕਰਦਾ ਹੈ; ਪਰ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਮਨੁੱਖ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਕਾਰੋਬਾਰ ਲਈ ਕਿਹੜਾ ਮੈਟ੍ਰਿਕ ਸਹੀ ਹੈ ਅਤੇ ਕੀ ਕੋਈ ਮਾਡਲ "ਕਾਫ਼ੀ ਚੰਗਾ" ਹੈ। ਗਲਤ ਮੈਟ੍ਰਿਕ ਨੂੰ ਦੇਖ ਰਹੀ ਇੱਕ ਟੀਮ "ਸਫਲਤਾ" ਵਜੋਂ ਮਹੀਨਿਆਂ ਲਈ ਇੱਕ ਮਾੜੇ ਮਾਡਲ ਨੂੰ ਗਲਤ ਕਰ ਸਕਦੀ ਹੈ।

ਸ਼ੁੱਧਤਾ ਕਾਫ਼ੀ ਕਿਉਂ ਨਹੀਂ ਹੈ: ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ

ਵਰਗੀਕਰਨ ਵਿੱਚ ਮਨ ਵਿੱਚ ਆਉਣ ਵਾਲੀ ਪਹਿਲੀ ਮੈਟ੍ਰਿਕ ਸ਼ੁੱਧਤਾ ਹੈ (ਸ਼ੁੱਧਤਾ — ਸਹੀ ਪੂਰਵ ਅਨੁਮਾਨਾਂ ਦਾ ਕੁੱਲ ਅਨੁਪਾਤ)। ਪਰ ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਯੂਨਿਟ 6 ਵਿੱਚ ਦੇਖਿਆ ਹੈ, ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਨਾਲ ਸ਼ੁੱਧਤਾ ਗੁੰਮਰਾਹ ਹੁੰਦੀ ਹੈ। ਇੱਕ ਬਿਹਤਰ ਸ਼ੁਰੂਆਤ ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ ਹੈ — ਇੱਕ ਸਾਰਣੀ ਜੋ ਪੂਰਵ-ਅਨੁਮਾਨਾਂ ਨੂੰ ਚਾਰ ਬਿੰਨਾਂ ਵਿੱਚ ਵੰਡਦੀ ਹੈ:

  • ਸੱਚਾ ਸਕਾਰਾਤਮਕ (TP): ਅਸੀਂ ਨਕਲੀ ਕਹਿੰਦੇ ਹਾਂ ਜੋ ਅਸਲ ਵਿੱਚ ਨਕਲੀ ਹੈ। (ਚੰਗਾ)
  • ਸੱਚਾ ਨਕਾਰਾਤਮਕ (TN): ਅਸੀਂ ਸੱਚਮੁੱਚ ਸਾਫ਼ ਕਿਹਾ। (ਚੰਗਾ)
  • ਗਲਤ ਸਕਾਰਾਤਮਕ (FP): ਅਸੀਂ ਗਲਤੀ ਨਾਲ ਕਿਹਾ ਕਿ ਸਾਫ਼ ਨਕਲੀ ਸੀ। (ਗਲਤ ਅਲਾਰਮ)
  • ਗਲਤ ਨਕਾਰਾਤਮਕ (FN): ਅਸੀਂ ਨਕਲੀ ਨੂੰ ਖੁੰਝ ਗਏ ਅਤੇ ਇਸਨੂੰ ਸਾਫ਼ ਕਿਹਾ। (ਖੁੰਝੀ ਧਮਕੀ)

ਇਹਨਾਂ ਚਾਰ ਬਕਸਿਆਂ ਤੋਂ ਦੋ ਮੁੱਖ ਮੈਟ੍ਰਿਕਸ ਨਿਕਲਦੇ ਹਨ। ਸ਼ੁੱਧਤਾ: "ਜਿਸ ਨੂੰ ਮੈਂ ਜਾਅਲੀ ਕਹਿੰਦਾ ਹਾਂ ਉਹ ਅਸਲ ਵਿੱਚ ਕਿੰਨਾ ਨਕਲੀ ਹੈ?" - ਮਹੱਤਵਪੂਰਨ ਜੇਕਰ ਗਲਤ ਅਲਾਰਮ ਦੀ ਲਾਗਤ ਵੱਧ ਹੈ। ਸੰਵੇਦਨਸ਼ੀਲਤਾ (ਅੰਗਰੇਜ਼ੀ ਵਿੱਚ ਯਾਦ ਕਰੋ): "ਮੈਂ ਕਿੰਨੇ ਅਸਲੀ ਨਕਲੀ ਫੜੇ?" - ਮਹੱਤਵਪੂਰਨ ਹੈ ਜਦੋਂ ਕੋਈ ਧਮਕੀ ਗੁਆਉਣਾ ਮਹਿੰਗਾ ਹੁੰਦਾ ਹੈ। ਦੋਵੇਂ ਅਕਸਰ ਇੱਕ ਦੂਜੇ ਨਾਲ ਮਤਭੇਦ ਹੁੰਦੇ ਹਨ: ਜੇਕਰ ਤੁਸੀਂ ਥ੍ਰੈਸ਼ਹੋਲਡ ਨੂੰ ਘੱਟ ਕਰਦੇ ਹੋ ਅਤੇ "ਜਾਅਲੀ" ਵਧੇਰੇ ਕਹਿੰਦੇ ਹੋ, ਤਾਂ ਯਾਦ ਵਧਦਾ ਹੈ ਪਰ ਸ਼ੁੱਧਤਾ ਘੱਟ ਜਾਂਦੀ ਹੈ। F1 ਸਕੋਰ ਇਹਨਾਂ ਦੋਵਾਂ ਦਾ ਸੰਤੁਲਿਤ ਔਸਤ (ਹਾਰਮੋਨਿਕ ਮਾਧਿਅਮ) ਹੈ।

ਧਿਆਨ ਦਿਓ: ਸਵਾਲ ਦਾ ਜਵਾਬ "ਕਿਹੜਾ ਮੈਟ੍ਰਿਕ ਮਹੱਤਵਪੂਰਨ ਹੈ" ਇੱਕ ਵਪਾਰਕ ਫੈਸਲਾ ਹੈ, ਨਾ ਕਿ ਤਕਨੀਕੀ। ਕੈਂਸਰ ਸਕ੍ਰੀਨਿੰਗ ਵਿੱਚ ਇੱਕ ਕੇਸ (ਘੱਟ ਯਾਦ) ਨਾ ਹੋਣਾ ਵਿਨਾਸ਼ਕਾਰੀ ਹੈ; ਸਪੈਮ ਫਿਲਟਰ ਵਿੱਚ ਸਪੈਮ (ਘੱਟ ਸ਼ੁੱਧਤਾ) ਨੂੰ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਈਮੇਲ ਭੇਜਣਾ ਤੰਗ ਕਰਨ ਵਾਲਾ ਹੈ. ਲਾਗਤ ਮੈਟ੍ਰਿਕ ਨਿਰਧਾਰਤ ਕਰਦੀ ਹੈ।

ਰਿਗਰੈਸ਼ਨ ਮੈਟ੍ਰਿਕਸ

ਜੇਕਰ ਆਉਟਪੁੱਟ ਨੰਬਰ ਹੈ, ਤਾਂ ਵੱਖ-ਵੱਖ ਮੈਟ੍ਰਿਕਸ ਵਰਤੇ ਜਾਂਦੇ ਹਨ। MAE (ਔਸਤਨ ਸੰਪੂਰਨ ਗਲਤੀ): ਉਸੇ ਯੂਨਿਟ ਵਿੱਚ, ਅੰਦਾਜ਼ੇ ਅਸਲ ਔਸਤ ਤੋਂ ਕਿੰਨਾ ਭਟਕਦੇ ਹਨ (ਉਦਾਹਰਨ ਲਈ, "ਅਸੀਂ ਔਸਤਨ 4,200 TL ਦੁਆਰਾ ਗਲਤ ਹਾਂ")। RMSE (ਰੂਟ ਮੀਨ ਸਕੁਆਇਰਡ ਐਰਰ): ਵੱਡੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਵਧੇਰੇ ਗੰਭੀਰਤਾ ਨਾਲ ਸਜ਼ਾ ਦਿੰਦਾ ਹੈ ਅਤੇ ਬਾਹਰੀ ਲੋਕਾਂ ਲਈ ਸੰਵੇਦਨਸ਼ੀਲ ਹੁੰਦਾ ਹੈ। R² (R-ਵਰਗ — ਨਿਰਧਾਰਨ ਦਾ ਗੁਣਕ): ਮਾਡਲ ਦੱਸਦਾ ਹੈ ਕਿ ਟੀਚੇ ਵਿੱਚ ਕਿੰਨੀ ਪਰਿਵਰਤਨਸ਼ੀਲਤਾ ਹੈ (1 ਦੇ ਨੇੜੇ ਚੰਗਾ ਹੈ, 0 ਮੱਧਮਾਨ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਜਿੰਨਾ ਮਾੜਾ ਹੈ, ਨੈਗੇਟਿਵ ਹੋਰ ਵੀ ਮਾੜਾ ਹੈ)।

ਸਭ ਤੋਂ ਧੋਖੇਬਾਜ਼ ਜਾਲ: ਓਵਰਲਰਨਿੰਗ

ਓਵਰਫਿਟਿੰਗ - ਜਿੱਥੇ ਮਾਡਲ ਸਿਖਲਾਈ ਡੇਟਾ ਨੂੰ ਯਾਦ ਰੱਖਦਾ ਹੈ ਪਰ ਨਵੇਂ ਡੇਟਾ 'ਤੇ ਅਸਫਲ ਹੁੰਦਾ ਹੈ - ਡੇਟਾ ਵਿਗਿਆਨ ਵਿੱਚ ਸਭ ਤੋਂ ਆਮ ਗਲਤੀ ਹੈ। ਲੱਛਣ ਸਪੱਸ਼ਟ ਹੈ: ਮਾਡਲ ਸਿਖਲਾਈ ਸੈੱਟ (98%) 'ਤੇ ਵਧੀਆ ਹੈ, ਟੈਸਟ ਸੈੱਟ (72%) 'ਤੇ ਮਾੜਾ ਹੈ। ਮਾਡਲ ਨੇ ਉਸ ਖਾਸ ਨਮੂਨੇ ਦੇ ਰੌਲੇ ਨੂੰ ਯਾਦ ਕੀਤਾ ਹੈ, ਨਾ ਕਿ ਡੇਟਾ ਵਿੱਚ ਅਸਲ ਪੈਟਰਨ। ਇਸਦੇ ਉਲਟ ਵੀ ਹੈ: ਅੰਡਰਫਿਟਿੰਗ — ਮਾਡਲ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟਿੰਗ ਦੋਵਾਂ ਵਿੱਚ ਮਾੜਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਪੈਟਰਨ ਨੂੰ ਹਾਸਲ ਕਰਨਾ ਬਹੁਤ ਸੌਖਾ ਹੈ।

ਓਵਰਲਰਨਿੰਗ ਦਾ ਮੁਕਾਬਲਾ ਕਰਨ ਦੇ ਤਰੀਕੇ: ਮਾਡਲ ਨੂੰ ਸਰਲ ਬਣਾਉਣਾ, ਵਧੇਰੇ ਡੇਟਾ, ਨਿਯਮਤ ਕਰਨਾ - ਗਣਿਤਿਕ ਬ੍ਰੇਕ ਜੋ ਮਾਡਲ ਨੂੰ ਬਹੁਤ ਗੁੰਝਲਦਾਰ ਹੋਣ ਤੋਂ ਰੋਕਦਾ ਹੈ - ਅਤੇ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ, ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ।

ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ: ਸਿੰਗਲ ਪੈਨ 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ

ਇੱਕ ਸਿੰਗਲ ਸਿਖਲਾਈ/ਟੈਸਟ ਪੋਡ ਖੁਸ਼ਕਿਸਮਤ ਜਾਂ ਬਦਕਿਸਮਤ ਹੋ ਸਕਦਾ ਹੈ; ਤੁਸੀਂ ਟੈਸਟ ਸੈੱਟ ਲਈ ਉੱਚ ਅੰਕ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹੋ ਕਿਉਂਕਿ ਉਹ ਨਮੂਨਾ ਆਸਾਨ ਹੈ। ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ (ਛੋਟੇ ਲਈ ਸੀਵੀ) ਇਸਦਾ ਹੱਲ ਕਰਦਾ ਹੈ। ਸਭ ਤੋਂ ਆਮ ਰੂਪ k-fold CV ਹੈ: ਡੇਟਾ ਨੂੰ k ਭਾਗਾਂ ਵਿੱਚ ਵੰਡਿਆ ਗਿਆ ਹੈ (ਉਦਾਹਰਨ ਲਈ 5); ਹਰ ਦੌਰ ਵਿੱਚ, ਇੱਕ ਹਿੱਸਾ ਟੈਸਟਿੰਗ ਹੈ ਅਤੇ ਬਾਕੀ ਸਿਖਲਾਈ ਹੈ; ਇਹ 5 ਵਾਰ ਰੋਲ ਕਰਦਾ ਹੈ ਅਤੇ 5 ਸਕੋਰ ਔਸਤ ਹੁੰਦੇ ਹਨ। ਇਸ ਲਈ ਤੁਸੀਂ ਦੇਖੋਗੇ ਕਿ ਪ੍ਰਦਰਸ਼ਨ ਇੱਕ ਤੋਂ ਵੱਧ ਸਪਲਿਟਸ ਦੀ ਔਸਤ 'ਤੇ ਅਧਾਰਤ ਹੈ, ਇੱਕ ਵੀ ਖੁਸ਼ਕਿਸਮਤ ਸਪਲਿਟ ਨਹੀਂ। ਸਕੋਰਾਂ ਦੀ ਵੰਡ ਵੀ ਜਾਣਕਾਰੀ ਭਰਪੂਰ ਹੈ: ਬਹੁਤ ਅਸਥਿਰ ਸਕੋਰ (ਇੱਕ ਮੰਜ਼ਿਲ 'ਤੇ 85%, ਦੂਜੇ 'ਤੇ 62%) ਦਰਸਾਉਂਦੇ ਹਨ ਕਿ ਮਾਡਲ ਅਸਥਿਰ ਹੈ।

ਆਮ ਕੇ-ਫੋਲਡ ਸਮਾਂ ਲੜੀ ਵਿੱਚ ਨਹੀਂ ਵਰਤਿਆ ਜਾਂਦਾ (ਭਵਿੱਖ ਨੂੰ ਲੀਕ ਕਰਦਾ ਹੈ); ਇਸ ਦੀ ਬਜਾਏ, ਤੁਸੀਂ "ਫਾਰਵਰਡ ਚੇਨਿੰਗ" (ਟਾਈਮ ਸੀਰੀਜ਼ ਸਪਲਿਟ) ਕਰਦੇ ਹੋ: ਹਮੇਸ਼ਾ ਅਤੀਤ ਨਾਲ ਸਿਖਲਾਈ ਅਤੇ ਭਵਿੱਖ ਦੀ ਜਾਂਚ ਕਰੋ।

ਮੈਟ੍ਰਿਕ

ਸਮੱਸਿਆ ਦੀ ਕਿਸਮ

ਇਹ ਕਦੋਂ ਮਾਇਨੇ ਰੱਖਦਾ ਹੈ?

ਸ਼ੁੱਧਤਾ

ਵਰਗੀਕਰਨ

ਜੇ ਕਲਾਸਾਂ ਸੰਤੁਲਿਤ ਹਨ

ਸ਼ੁੱਧਤਾ

ਵਰਗੀਕਰਨ

ਝੂਠਾ ਅਲਾਰਮ ਮਹਿੰਗਾ ਹੈ

ਸੰਵੇਦਨਸ਼ੀਲਤਾ (ਯਾਦ)

ਵਰਗੀਕਰਨ

ਜੇ ਮਿਸ ਕਰਨਾ ਮਹਿੰਗਾ ਹੈ

F1

ਵਰਗੀਕਰਨ

ਜੇਕਰ ਸੰਤੁਲਨ ਦੀ ਲੋੜ ਹੈ

ਐਮ.ਏ.ਈ

ਰਿਗਰੈਸ਼ਨ

ਵਿਆਖਿਆਯੋਗ ਗਲਤੀ

RMSE

ਰਿਗਰੈਸ਼ਨ

ਜੇ ਵੱਡੀਆਂ ਗਲਤੀਆਂ ਨਾਜ਼ੁਕ ਹਨ

ਰਿਗਰੈਸ਼ਨ

ਵਿਆਖਿਆਤਮਕ ਸ਼ਕਤੀ

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 - ਉੱਚ ਸ਼ੁੱਧਤਾ ਦਾ ਭਰਮ। ਇੱਕ ਫਰਾਡ ਮਾਡਲ ਨੇ 99.2% ਸ਼ੁੱਧਤਾ ਦਿਖਾਈ ਅਤੇ ਟੀਮ ਨੇ ਜਸ਼ਨ ਮਨਾਇਆ। ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਦੇਖਦੇ ਹੋਏ, ਅਸਲ: ਡੇਟਾ ਵਿੱਚ ਨਕਲੀ ਦਰ 0.8% ਸੀ; ਮਾਡਲ ਨੇ ਲਗਭਗ ਕੋਈ ਜਾਅਲੀ ਨਹੀਂ ਫੜਿਆ, ਸਿਰਫ਼ "ਸਭ ਸਾਫ਼" ਕਹਿ ਕੇ। ਰੀਕਾਲ 6% ਸੀ। ਪਾਠ: ਮੈਟ੍ਰਿਕਸ ਦੇਖੋ, ਸ਼ੁੱਧਤਾ ਨਹੀਂ।

ਕੇਸ 2 - ਲੁਕਵੀਂ ਓਵਰਲਰਿੰਗ। ਇੱਕ ਟੀਮ ਨੇ ਸਿਖਲਾਈ ਸੈੱਟ 'ਤੇ XGBoost ਨੂੰ 97% ਤੱਕ ਪਹੁੰਚਾਇਆ ਅਤੇ ਵਧਾ ਦਿੱਤਾ। ਟੈਸਟ ਸੈੱਟ 69% ਸੀ, ਪਰ ਕਿਸੇ ਨੇ ਦੇਖਿਆ ਨਹੀਂ ਸੀ। ਮਾਡਲ ਉਤਪਾਦਨ ਵਿੱਚ ਢਹਿ ਗਿਆ। ਜੇਕਰ ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਕੀਤੀ ਗਈ ਹੁੰਦੀ, ਤਾਂ ਫੋਲਡ (ਓਵਰਲੀਰਨਿੰਗ) ਵਿਚਕਾਰ ਵੱਡਾ ਅੰਤਰ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਦਿਖਾਈ ਦੇ ਸਕਦਾ ਸੀ। ਪਾਠ: CV ਅਤੇ ਟੈਸਟ ਸਕੋਰ 'ਤੇ ਭਰੋਸਾ ਕਰੋ, ਸਿੱਖਿਆ ਦੇ ਸਕੋਰ 'ਤੇ ਨਹੀਂ।

ਕੇਸ 3 - ਖੁਸ਼ਕਿਸਮਤ ਵੰਡ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਇੱਕ ਸਿੰਗਲ ਸਪਲਿਟ ਵਿੱਚ 88% ਪ੍ਰਾਪਤ ਕਰਕੇ ਖੁਸ਼ ਸੀ। ਜਦੋਂ ਉਸਦੇ ਸਹਿਕਰਮੀ ਨੇ 5-ਗੁਣਾ CV ਕੀਤਾ, ਤਾਂ ਸਕੋਰ 88%, 71%, 83%, 64%, 79% ਸਨ — ਔਸਤ 77% ਹੈ, ਪਰ ਇਹ ਬਹੁਤ ਅਸਥਿਰ ਹੈ। ਮਾਡਲ ਅਸਥਿਰ ਸੀ; ਸਿੰਗਲ ਡੱਬਾ ਗੁੰਮਰਾਹ ਕਰ ਰਿਹਾ ਸੀ. ਪਾਠ: CV ਦਾ ਮਤਲਬ ਅਤੇ ਵੰਡ ਦੇਖੋ, ਵਿਅਕਤੀਗਤ ਬਿਨ ਨਹੀਂ।

ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ

1) ਪੂਰੀ ਵਰਗੀਕਰਣ ਰਿਪੋਰਟ:

ਮੇਰੇ ਕੋਲ ਮਾਡਲ ਅਤੇ ਟੈਸਟ ਸੈੱਟ ਹੈ। ਤਿਆਰ ਕਰੋ: ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ, ਸ਼ੁੱਧਤਾ, ਰੀਕਾਲ, F1 (ਹਰੇਕ ਕਲਾਸ ਲਈ) ਅਤੇ ਸਹਾਇਤਾ ਗਿਣਤੀ। ਮੈਂ ਅਨੁਮਾਨ ਲਗਾ ਰਿਹਾ ਹਾਂ, ਪਰ ਇਹ ਮੇਰੇ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ: ਮੈਂ ਤੁਹਾਨੂੰ ਦੱਸਾਂਗਾ ਕਿ ਕਿਹੜਾ ਮੈਟ੍ਰਿਕ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਨੋਟ ਕਰੋ ਕਿ ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਨਾਲ ਸ਼ੁੱਧਤਾ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦੀ ਹੈ।

2) ਓਵਰਲਰਨਿੰਗ ਕੰਟਰੋਲ:

ਮੇਰੇ ਮਾਡਲ ਦੇ ਸਕੋਰ TRAINING ਅਤੇ TEST ਸੈੱਟਾਂ ਵਿੱਚ ਨਾਲ-ਨਾਲ ਪ੍ਰਿੰਟ ਕਰੋ। ਉਹਨਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਦੀ ਗਣਨਾ ਕਰੋ ਅਤੇ ਚੇਤਾਵਨੀ ਦਿਓ ਕਿਉਂਕਿ ਵੱਡਾ ਅੰਤਰ ਓਵਰਲਰਨਿੰਗ ਦੀ ਨਿਸ਼ਾਨੀ ਹੈ। ਜੇਕਰ ਫਰਕ ਵੱਡਾ ਹੈ, ਤਾਂ ਨਿਯਮਿਤ ਜਾਂ ਸਰਲੀਕਰਨ ਦਾ ਸੁਝਾਅ ਦਿਓ।

3) ਕਰਾਸ ਪ੍ਰਮਾਣਿਕਤਾ:

5-ਗੁਣਾ ਕਰਾਸ-ਪ੍ਰਮਾਣਿਕਤਾ (ਸਤਰੀਕਰਨ, ਵਰਗੀਕਰਨ ਲਈ) ਕਰੋ। ਹਰੇਕ ਫੋਲਡ ਦੇ ਅੰਕ, ਮੱਧਮਾਨ ਅਤੇ ਮਿਆਰੀ ਵਿਵਹਾਰ ਨੂੰ ਛਾਪੋ। ਜੇਕਰ ਸਕੋਰ ਬਹੁਤ ਅਸਥਿਰ (ਉੱਚ ਐਸਟੀਡੀ) ਹਨ, ਤਾਂ ਸੰਕੇਤ ਕਰੋ ਕਿ ਮਾਡਲ ਅਸਥਿਰ ਹੈ। ਪਾਈਪਲਾਈਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ ਤਾਂ ਕਿ ਹਰ ਪਰਤ 'ਤੇ ਸਿਖਲਾਈ ਦੇ ਟੁਕੜੇ ਤੋਂ ਹੀ ਪਰਿਵਰਤਨ ਸਿੱਖੇ ਜਾ ਸਕਣ।

4) ਬੇਸਲਾਈਨ ਤੁਲਨਾ:

ਮੇਰੇ ਮਾਡਲ ਦੇ ਮੀਟ੍ਰਿਕ ਨੂੰ ਇੱਕ ਡਮੀ ਕਲਾਸੀਫਾਇਰ ਬੇਸਲਾਈਨ ਦੇ ਨਾਲ ਨਾਲ ਰੱਖੋ। ਕੀ ਮਾਡਲ ਬੇਸਲਾਈਨ ਨੂੰ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਹਰਾਉਂਦਾ ਹੈ? ਜੇਕਰ ਇਹ ਪਾਸ ਨਹੀਂ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਇਹ ਸਪੱਸ਼ਟ ਕਰੋ ਕਿ ਮਾਡਲ ਕੋਈ ਅਸਲ ਮੁੱਲ ਨਹੀਂ ਜੋੜਦਾ ਹੈ।

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:

ਕੀ ਮੇਰਾ ਮਾਡਲ ਚੰਗਾ ਹੈ?

"ਚੰਗਾ" ਪਰਿਭਾਸ਼ਿਤ ਹੈ; ਇਹ ਸਪੱਸ਼ਟ ਨਹੀਂ ਹੈ ਕਿ ਕਿਹੜੀ ਮੈਟ੍ਰਿਕ, ਕਿਹੜੀ ਥ੍ਰੈਸ਼ਹੋਲਡ, ਕਿਹੜੀ ਬੇਸਲਾਈਨ। AI ਇੱਕ ਸਿੰਗਲ ਸ਼ੁੱਧਤਾ ਨੰਬਰ ਦੇ ਸਕਦਾ ਹੈ ਅਤੇ ਗੁੰਮਰਾਹ ਕਰ ਸਕਦਾ ਹੈ।

ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:

ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਮੁਲਾਂਕਣ ਸਹਾਇਕ। ਵਰਗੀਕਰਨ, ਅਸੰਤੁਲਿਤ ਡੇਟਾ (12% ਸਕਾਰਾਤਮਕ). ਪ੍ਰਾਥਮਿਕਤਾ: ਯਾਦ ਕਰੋ (ਸਕਾਰਾਤਮਕ ਨਹੀਂ ਗੁਆਉਣਾ) ਟਾਸਕ: (1) ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ, (2) ਸ਼ੁੱਧਤਾ/ਰੀਕਾਲ/F1, (3) 5-ਗੁਣਾ ਪੱਧਰੀ CV ਮੱਧਮਾਨ ਅਤੇ std, (4) ਡਮੀ ਕਲਾਸੀਫਾਇਰ ਬੇਸਲਾਈਨ ਤੁਲਨਾ। ਰੀਕਾਲ ਅਤੇ ਬੇਸਲਾਈਨ ਫਰਕ 'ਤੇ ਫੋਕਸ ਕਰੋ, ਸ਼ੁੱਧਤਾ ਨਹੀਂ। ਟਿੱਪਣੀ ਕਰੋ, ਪਰ ਮੈਂ ਅੰਤਿਮ ਫੈਸਲਾ ਕਰਦਾ ਹਾਂ।

ਇੱਥੇ, ਮੀਟ੍ਰਿਕ ਤਰਜੀਹ, ਸੀਵੀ ਅਤੇ ਬੇਸਲਾਈਨ ਸਥਿਤੀ ਸਪਸ਼ਟ ਹਨ।

ਆਮ ਗਲਤੀਆਂ

  • ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਵਿੱਚ ਸ਼ੁੱਧਤਾ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ। 99% ਸ਼ੁੱਧਤਾ ਘੱਟ ਗਿਣਤੀ ਵਰਗ ਨੂੰ ਬਿਲਕੁਲ ਵੀ ਹਾਸਲ ਨਹੀਂ ਕਰ ਸਕਦੀ; ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਦੇਖੋ।
  • ਬਸ ਤੁਹਾਡੇ ਸਿੱਖਿਆ ਸਕੋਰ ਨੂੰ ਦੇਖ ਰਿਹਾ ਹੈ. ਉੱਚ ਸਿੱਖਿਆ, ਘੱਟ ਟੈਸਟ ਸਕੋਰ ਓਵਰਲਰਿੰਗ ਹੈ; ਹਮੇਸ਼ਾ ਦੋ ਸਕੋਰਾਂ ਦੀ ਤੁਲਨਾ ਕਰੋ।
  • ਇਕੋ ਡੱਬੇ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ. ਖੁਸ਼ਕਿਸਮਤ ਵੰਡ ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ; ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨਾਲ ਮੱਧਮਾਨ ਅਤੇ ਵੰਡ ਨੂੰ ਦੇਖੋ।
  • ਬੇਸਲਾਈਨ ਨਾਲ ਤੁਲਨਾ ਨਹੀਂ ਕੀਤੀ ਜਾ ਰਹੀ। ਤੁਸੀਂ ਇਹ ਜਾਣੇ ਬਿਨਾਂ "ਚੰਗਾ" ਨਹੀਂ ਕਹਿ ਸਕਦੇ ਕਿ ਕੀ ਮਾਡਲ ਇੱਕ ਮੂਰਖ ਭਵਿੱਖਬਾਣੀ ਨੂੰ ਹਰਾਉਂਦਾ ਹੈ।
  • ਸਮਾਂ ਲੜੀ 'ਤੇ ਆਮ ਕੇ-ਫੋਲਡ ਦੀ ਵਰਤੋਂ ਕਰਨਾ। ਇਹ ਭਵਿੱਖ ਨੂੰ ਲੀਕ ਕਰਦਾ ਹੈ; ਸਮਾਂ ਲੜੀ ਵੰਡ ਦੀ ਲੋੜ ਹੈ।
ਸੰਕੇਤ: ਹਰੇਕ ਮਾਡਲ ਦੇ ਅੱਗੇ ਤਿੰਨ ਨੰਬਰ ਲਿਖੋ: ਸਿਖਲਾਈ ਸਕੋਰ, ਕਰਾਸ-ਵੈਧੀਕਰਨ ਔਸਤ, ਅਤੇ ਬੇਸਲਾਈਨ ਸਕੋਰ। ਇਹ ਤਿਕੜੀ ਓਵਰਲਰਨਿੰਗ (ਸਿਖਲਾਈ >> CV) ਅਤੇ ਘੱਟ ਮੁੱਲ (CV ≈ ਬੇਸਲਾਈਨ) ਨੂੰ ਇੱਕ ਨਜ਼ਰ ਵਿੱਚ ਪ੍ਰਗਟ ਕਰਦੀ ਹੈ।

ਸੰਖੇਪ ਵਿੱਚ

ਇੱਕ ਮਾਡਲ ਬਣਾਉਣਾ ਆਸਾਨ ਹੈ, ਪਰ ਇਮਾਨਦਾਰੀ ਨਾਲ ਇਸਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ ਔਖਾ ਹੈ। ਵਰਗੀਕਰਨ ਵਿੱਚ, ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ, ਸ਼ੁੱਧਤਾ, ਅਤੇ ਯਾਦ ਸ਼ੁੱਧਤਾ ਨਾਲੋਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਜਾਣਕਾਰੀ ਭਰਪੂਰ ਹਨ; ਨੌਕਰੀ ਦੀ ਕੀਮਤ ਇਹ ਨਿਰਧਾਰਤ ਕਰਦੀ ਹੈ ਕਿ ਕਿਹੜਾ ਮਹੱਤਵਪੂਰਨ ਹੈ। MAE, RMSE ਅਤੇ R² ਨੂੰ ਰਿਗਰੈਸ਼ਨ ਵਿੱਚ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ। ਸਭ ਤੋਂ ਧੋਖੇਬਾਜ਼ ਜਾਲ ਓਵਰਲਰਨਿੰਗ ਹੈ: ਹਮੇਸ਼ਾ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟ ਸਕੋਰ ਦੀ ਤੁਲਨਾ ਕਰੋ। ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਮੱਧਮਾਨ ਅਤੇ ਵੰਡ 'ਤੇ ਭਰੋਸਾ ਕਰੋ, ਇੱਕ ਵੀ ਵੰਡ ਨਹੀਂ; ਹਰ ਚੀਜ਼ ਦੀ ਬੇਸਲਾਈਨ ਨਾਲ ਤੁਲਨਾ ਕਰੋ। AI ਇਹਨਾਂ ਸਾਰਿਆਂ ਦੀ ਗਣਨਾ ਕਰਦਾ ਹੈ, ਪਰ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਮਨੁੱਖ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ ਕਿ ਕਿਹੜੀ ਮੈਟ੍ਰਿਕ ਦੀ ਵਰਤੋਂ ਕਰਨੀ ਹੈ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਵਰਗੀਕਰਣ ਮਾਡਲ ਲਈ ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ, ਸ਼ੁੱਧਤਾ, ਰੀਕਾਲ ਅਤੇ F1 ਨੂੰ ਐਕਸਟਰੈਕਟ ਕਰੋ; ਫਿਰ 5-ਗੁਣਾ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਕਰੋ ਅਤੇ ਫੋਲਡਾਂ ਵਿੱਚ ਸਕੋਰ ਵੰਡ ਨੂੰ ਦੇਖੋ। ਅੰਤ ਵਿੱਚ, ਸਿਖਲਾਈ ਸਕੋਰ, ਸੀਵੀ ਔਸਤ, ਅਤੇ ਇੱਕ ਬੇਸਲਾਈਨ ਸਕੋਰ ਨੂੰ ਨਾਲ-ਨਾਲ ਲਿਖੋ। ਇੱਕ ਵਾਕ ਵਿੱਚ ਟਿੱਪਣੀ ਕਰੋ ਕਿ ਕੀ ਤੁਹਾਡਾ ਮਾਡਲ ਬੇਸਲਾਈਨ ਨੂੰ ਪੜ੍ਹ ਰਿਹਾ ਹੈ ਅਤੇ ਪਾਸ ਕਰ ਰਿਹਾ ਹੈ।

ਚੈੱਕਲਿਸਟ

  • ਕੀ ਮੈਂ ਸਟੀਕਤਾ ਦੀ ਬਜਾਏ ਨੌਕਰੀ ਦੇ ਅਸਲ ਮਾਪਦੰਡ (ਸ਼ੁੱਧਤਾ/ਰੀਕਾਲ/F1 ਆਦਿ) ਨੂੰ ਦੇਖਿਆ ਹੈ?
  • [ ] ਕੀ ਮੈਂ ਉਲਝਣ ਮੈਟ੍ਰਿਕਸ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ?
  • ਕੀ ਮੈਂ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟ ਸਕੋਰ ਦੀ ਤੁਲਨਾ ਕੀਤੀ ਹੈ ਅਤੇ ਓਵਰਲਰਨਿੰਗ ਲਈ ਜਾਂਚ ਕੀਤੀ ਹੈ?
  • ਕੀ ਮੈਂ ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨਾਲ ਮੱਧਮਾਨ ਅਤੇ ਵੰਡ ਨੂੰ ਦੇਖਿਆ ਹੈ?
  • ਕੀ ਮੈਂ ਮਾਡਲ ਦੀ ਤੁਲਨਾ ਬੇਸਲਾਈਨ ਨਾਲ ਕੀਤੀ ਹੈ?