ਲਾਭ:
- ਸਮੱਸਿਆ ਦੀ ਕਿਸਮ ਅਤੇ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ (ਪੀਆਰ-ਏਯੂਸੀ/ਅਸੰਤੁਲਿਤ ਡੇਟਾ ਵਿੱਚ ਰੀਕਾਲ, ਰੀਗਰੈਸ਼ਨ ਵਿੱਚ MAE/RMSE) ਲਈ ਉਚਿਤ ਮੈਟ੍ਰਿਕ ਚੁਣਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਓਵਰ/ਅਡਰ ਲਰਨਿੰਗ ਨੂੰ ਪਛਾਣਨਾ
- ਇੱਕ ਬੇਸਲਾਈਨ ਦੇ ਵਿਰੁੱਧ ਹਰੇਕ ਮੈਟ੍ਰਿਕ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਅਤੇ ਭਟਕਣ ਨੂੰ ਮਾਪਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਨਾਲ ਪ੍ਰਗਤੀ ਤੋਂ ਵੱਖਰਾ ਰੌਲਾ
- ਪ੍ਰਮਾਣਿਕਤਾ ਸੈੱਟ ਦੇ ਨਾਲ ਹਾਈਪਰਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਟਿਊਨ ਕਰਕੇ ਅਤੇ ਕੇਵਲ ਅੰਤ ਵਿੱਚ ਟੈਸਟ ਸੈੱਟ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਗੈਰ-ਆਸ਼ਾਵਾਦੀ ਨਤੀਜਿਆਂ ਦੀ ਰਿਪੋਰਟ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
ਮਾਡਲ ਸਿਖਲਾਈ (ਸਿਖਲਾਈ: ਡੇਟਾ ਤੋਂ ਪੈਟਰਨ ਸਿੱਖਣ ਦੀ ਪ੍ਰਕਿਰਿਆ) ML ਇੰਜੀਨੀਅਰਿੰਗ ਦਾ ਸਭ ਤੋਂ ਵੱਧ ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਪਰ ਸਭ ਤੋਂ ਗੁੰਮਰਾਹਕੁੰਨ ਕਦਮ ਹੈ। ਇਹ ਇਸ ਲਈ ਪ੍ਰਗਟ ਹੁੰਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ "ਸ਼ੁੱਧਤਾ 95%" ਵਰਗੀ ਸੰਤੁਸ਼ਟੀਜਨਕ ਸੰਖਿਆ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਗੁੰਮਰਾਹਕੁੰਨ ਕਿਉਂਕਿ ਉਹ ਨੰਬਰ ਅਕਸਰ ਗਲਤ ਸਵਾਲ ਦਾ ਸਹੀ ਜਵਾਬ ਹੁੰਦਾ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਇੰਜੀਨੀਅਰਿੰਗ ਅਨੁਸ਼ਾਸਨ ਦੇ ਨਾਲ ਸਿੱਖਿਆ ਅਤੇ ਮੁਲਾਂਕਣ ਬਾਰੇ ਚਰਚਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ; ਅਸੀਂ ਪ੍ਰਯੋਗਾਤਮਕ ਡਿਜ਼ਾਈਨ ਵਿੱਚ ਇੱਕ ਸਹਿਭਾਗੀ ਵਜੋਂ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ ਅਤੇ ਮਾਪ 'ਤੇ ਫੈਸਲੇ ਨੂੰ ਅਧਾਰਤ ਕਰਦੇ ਹਾਂ।
ਸਿਖਲਾਈ ਚੱਕਰ ਦਾ ਤਰਕ
ਇੱਕ ਮਾਡਲ ਇੱਕ ਨੁਕਸਾਨ ਫੰਕਸ਼ਨ ਨੂੰ ਘੱਟ ਤੋਂ ਘੱਟ ਕਰਕੇ ਡੇਟਾ ਵਿੱਚ ਪੈਟਰਨ ਸਿੱਖਦਾ ਹੈ: ਇੱਕ ਫੰਕਸ਼ਨ ਜੋ ਮਾਡਲ ਦੀ ਗਲਤੀ ਨੂੰ ਸੰਖਿਆਤਮਕ ਤੌਰ 'ਤੇ ਮਾਪਦਾ ਹੈ। ਔਪਟੀਮਾਈਜੇਸ਼ਨ ਐਲਗੋਰਿਦਮ (ਉਦਾਹਰਨ ਲਈ ਗਰੇਡੀਐਂਟ ਡਿਸੈਂਟ) ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਕਦਮ ਦਰ ਕਦਮ ਵਿਵਸਥਿਤ ਕਰਕੇ ਨੁਕਸਾਨ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ। ਉਦੇਸ਼ ਸਿਖਲਾਈ ਡੇਟਾ ਨੂੰ ਯਾਦ ਕਰਨਾ ਨਹੀਂ ਹੈ, ਪਰ ਇਸਨੂੰ ਬੇਮਿਸਾਲ ਡੇਟਾ ਵਿੱਚ ਆਮ ਬਣਾਉਣਾ ਹੈ।
ਦੋ ਮੁੱਖ ਖ਼ਤਰੇ:
- ਓਵਰਫਿਟਿੰਗ: ਮਾਡਲ ਸਿਖਲਾਈ ਡੇਟਾ ਨੂੰ ਯਾਦ ਰੱਖਦਾ ਹੈ ਅਤੇ ਨਵੇਂ ਡੇਟਾ 'ਤੇ ਅਸਫਲ ਹੋ ਜਾਂਦਾ ਹੈ। ਸਿਖਲਾਈ ਦੀ ਸਫਲਤਾ ਜ਼ਿਆਦਾ ਹੈ, ਤਸਦੀਕ ਸਫਲਤਾ ਘੱਟ ਹੈ।
- ਅੰਡਰਫਿਟਿੰਗ: ਮਾਡਲ ਪੈਟਰਨ ਨੂੰ ਹਾਸਲ ਨਹੀਂ ਕਰ ਸਕਦਾ; ਸਿਖਲਾਈ ਅਤੇ ਪ੍ਰਮਾਣਿਕਤਾ ਸਫਲਤਾ ਦੋਵੇਂ ਘੱਟ ਹਨ।
ਸੰਤੁਲਨ ਲੱਭਣਾ ਸਿੱਖਿਆ ਦੀ ਕਲਾ ਹੈ। ਇਸ ਸੰਤੁਲਨ ਦੀ ਨਿਗਰਾਨੀ ਕਰਨ ਲਈ ਪ੍ਰਮਾਣਿਕਤਾ ਸੈੱਟ ਹੈ: ਜੇਕਰ ਪ੍ਰਮਾਣਿਕਤਾ ਦੀ ਸਫਲਤਾ ਘੱਟ ਹੋਣੀ ਸ਼ੁਰੂ ਹੋ ਜਾਂਦੀ ਹੈ ਜਦੋਂ ਕਿ ਸਿਖਲਾਈ ਦੀ ਸਫਲਤਾ ਵਧਦੀ ਹੈ, ਓਵਰਲਰਨਿੰਗ ਸ਼ੁਰੂ ਹੋ ਗਈ ਹੈ।
ਨੁਕਤਾ: ਹਰ ਪੜਾਅ 'ਤੇ ਸਿਖਲਾਈ ਅਤੇ ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨੁਕਸਾਨ ਨੂੰ ਇਕੱਠੇ ਪਲਾਟ ਕਰੋ। ਉਹ ਬਿੰਦੂ ਜਿਸ 'ਤੇ ਦੋ ਕਰਵ ਵੱਖ ਹੋਣੇ ਸ਼ੁਰੂ ਹੁੰਦੇ ਹਨ, ਜਿੱਥੇ ਓਵਰਲਰਨਿੰਗ ਸ਼ੁਰੂ ਹੁੰਦੀ ਹੈ ਅਤੇ "ਜਲਦੀ ਰੁਕਣ" ਦਾ ਸਹੀ ਪਲ ਹੁੰਦਾ ਹੈ।
ਮੀਟ੍ਰਿਕ ਚੋਣ: ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਫੈਸਲਾ
ਗਲਤ ਮੈਟ੍ਰਿਕ ਇੱਕ ਚੰਗੇ ਮਾਡਲ ਨੂੰ ਮਾੜਾ ਅਤੇ ਇੱਕ ਮਾੜਾ ਮਾਡਲ ਵਧੀਆ ਦਿਖਦਾ ਹੈ। ਸਮੱਸਿਆ ਮੈਟ੍ਰਿਕ ਨਿਰਧਾਰਤ ਕਰਦੀ ਹੈ:
- ਅਸੰਤੁਲਿਤ ਵਰਗੀਕਰਨ (ਇੱਕ ਸ਼੍ਰੇਣੀ ਬਹੁਤ ਘੱਟ ਹੁੰਦੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਧੋਖਾਧੜੀ): ਸ਼ੁੱਧਤਾ ਗੁੰਮਰਾਹਕੁੰਨ ਹੈ। ਇੱਕ ਮਾਡਲ ਜੋ ਕਹਿੰਦਾ ਹੈ ਕਿ "ਹਰ ਚੀਜ਼ ਨੂੰ ਸਾਧਾਰਨ ਕਾਲ ਕਰੋ" 99% ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕਰੇਗਾ ਪਰ ਇੱਕ ਵੀ ਧੋਖਾਧੜੀ ਨਹੀਂ ਫੜੇਗਾ। ਇਸਦੀ ਬਜਾਏ, ਸ਼ੁੱਧਤਾ (ਜੋ ਮੈਂ ਫੜਿਆ ਹੈ ਅਸਲ ਵਿੱਚ ਕਿੰਨਾ ਸਕਾਰਾਤਮਕ ਹੈ), ਯਾਦ ਕਰੋ (ਜੋ ਮੈਂ ਫੜਿਆ ਹੈ ਉਸ ਵਿੱਚੋਂ ਕਿੰਨਾ ਸੱਚਾ ਸਕਾਰਾਤਮਕ ਹੈ) ਅਤੇ ਉਹਨਾਂ ਦਾ ਸੰਤੁਲਨ F1 ਜਾਂ PR-AUC ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ।
- ਸੰਤੁਲਿਤ ਵਰਗੀਕਰਨ: ਸ਼ੁੱਧਤਾ ਅਤੇ ROC-AUC ਢੁਕਵੇਂ ਹੋ ਸਕਦੇ ਹਨ।
- ਰਿਗਰੈਸ਼ਨ (ਨੰਬਰ ਅਨੁਮਾਨ): MAE (ਮਤਲਬ ਪੂਰਨ ਗਲਤੀ), RMSE (ਵੱਡੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਸਜ਼ਾ ਦਿੰਦਾ ਹੈ), MAPE (ਪ੍ਰਤੀਸ਼ਤ ਗਲਤੀ)।
- ਦਰਜਾਬੰਦੀ/ਸਿਫ਼ਾਰਸ਼: NDCG, MRR, Recall@K.
ਕੀ ਸ਼ੁੱਧਤਾ ਜਾਂ ਯਾਦ ਕਰਨਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। ਕੈਂਸਰ ਸਕਰੀਨਿੰਗ ਵਿੱਚ ਯਾਦ ਕਰਨਾ (ਕਿਸੇ ਵੀ ਮਰੀਜ਼ ਨੂੰ ਨਾ ਮਿਲਣਾ) ਇੱਕ ਤਰਜੀਹ ਹੈ; ਸਪੈਮ ਫਿਲਟਰ ਵਿੱਚ ਸ਼ੁੱਧਤਾ (ਸਪੈਮ ਨੂੰ ਮਹੱਤਵਪੂਰਨ ਈ-ਮੇਲ ਨਾ ਭੇਜਣਾ) ਮਹੱਤਵਪੂਰਨ ਹੈ। ਇਹ ਇੱਕ ਵਪਾਰਕ ਫੈਸਲਾ ਹੈ, ਤਕਨੀਕੀ ਨਹੀਂ, ਅਤੇ ਇੰਜਨੀਅਰ ਅਤੇ ਮਾਲਕ ਦੁਆਰਾ ਇਕੱਠੇ ਕੀਤਾ ਗਿਆ ਹੈ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ: "ਮੇਰੇ ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ, ਸ਼ੁੱਧਤਾ 0.97।"
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰੋਂਪਟ: "ਮੇਰੇ ਕੋਲ ਇੱਕ ਧੋਖਾਧੜੀ ਦਾ ਪਤਾ ਲਗਾਉਣ ਵਾਲਾ ਮਾਡਲ ਹੈ; ਸਕਾਰਾਤਮਕ ਸ਼੍ਰੇਣੀ ਦੀ ਦਰ 1.5% ਹੈ। ਸ਼ੁੱਧਤਾ 0.97 ਵਜੋਂ ਰਿਪੋਰਟ ਕੀਤੀ ਗਈ ਹੈ। ਦੱਸੋ ਕਿ ਇਹ ਮੈਟ੍ਰਿਕ ਗੁੰਮਰਾਹਕੁੰਨ ਕਿਉਂ ਹੋ ਸਕਦੀ ਹੈ, ਮੈਨੂੰ ਦੱਸੋ ਕਿ ਮੈਨੂੰ ਕਿਹੜੀਆਂ ਮੈਟ੍ਰਿਕਸ (ਸ਼ੁੱਧਤਾ, ਰੀਕਾਲ, PR-AUC) ਨੂੰ ਤਰਜੀਹ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ ਅਤੇ ਕਿਉਂ। ਇਹ ਵੀ ਗਣਨਾ ਕਰੋ ਕਿ ਇੱਕ 'ਕਾਲ ਲਾਈਨ' ਕਿੰਨੀ ਸਹੀ ਹੈ, ਇਸ ਮਾਡਲ 'ਤੇ ਸਭ ਕੁਝ ਨਕਾਰਾਤਮਕ ਜੋੜਿਆ ਜਾ ਸਕਦਾ ਹੈ, ਇਸ ਲਈ ਅਸਲ ਡੇਟਾ ਨੂੰ ਜੋੜਿਆ ਗਿਆ ਇੱਕ 'ਕਾਲ ਲਾਈਨ' ਮੁੱਲ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦਾ ਹੈ।
ਅੰਤਰ: ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰੋਂਪਟ ਕਲਾਸ ਅਨੁਪਾਤ ਅਤੇ ਵਪਾਰਕ ਸੰਦਰਭ ਦਿੰਦਾ ਹੈ; ਇਹ ਇੱਕ ਬੇਸਲਾਈਨ ਮਾਡਲ ਤੁਲਨਾ ਲਈ ਵੀ ਪੁੱਛਦਾ ਹੈ — ਇਹ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਐਂਕਰ ਹੈ ਕਿ ਕੀ ਇੱਕ ਮੈਟ੍ਰਿਕ ਅਰਥਪੂਰਨ ਹੈ।
ਬੇਸਲਾਈਨ: ਤੁਲਨਾ ਕੀਤੇ ਬਿਨਾਂ ਮੈਟ੍ਰਿਕ ਅਰਥਹੀਣ ਹੈ
ਇੱਕ ਮੀਟ੍ਰਿਕ ਆਪਣੇ ਆਪ ਵਿੱਚ ਚੰਗਾ ਜਾਂ ਮਾੜਾ ਨਹੀਂ ਹੁੰਦਾ; ਇਹ ਇੱਕ ਬੁਨਿਆਦੀ ਮਾਡਲ ਦੇ ਅਨੁਸਾਰ ਚੰਗਾ ਜਾਂ ਮਾੜਾ ਹੈ। ਬੁਨਿਆਦੀ ਮਾਡਲ ਸਭ ਤੋਂ ਸਰਲ ਹੱਲ ਹੈ ਜੋ ਮਨ ਵਿੱਚ ਆਉਂਦਾ ਹੈ: "ਹਮੇਸ਼ਾ ਬਹੁਗਿਣਤੀ ਵਰਗ ਨੂੰ ਦੱਸੋ", "ਪਿਛਲੇ ਹਫ਼ਤੇ ਦੇ ਮੁੱਲ ਨੂੰ ਦੁਹਰਾਓ", "ਮਤਲਬ ਦਾ ਅਨੁਮਾਨ ਲਗਾਓ"। ਜੇ ਤੁਹਾਡਾ ਮਾਡਲ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਇਸ ਸਧਾਰਨ ਹੱਲ ਨੂੰ ਪਾਸ ਨਹੀਂ ਕਰ ਸਕਦਾ ਹੈ, ਤਾਂ ਸਾਰੀ ਗੁੰਝਲਤਾ ਕੁਝ ਵੀ ਨਹੀਂ ਹੈ।
ਸਾਵਧਾਨ: ਵਾਕ "ਮੇਰਾ ਮਾਡਲ 85% ਸਹੀ ਹੈ" ਆਪਣੇ ਆਪ ਵਿੱਚ ਕੁਝ ਨਹੀਂ ਕਹਿੰਦਾ। ਜੇ ਬੇਸ ਮਾਡਲ ਪਹਿਲਾਂ ਹੀ 84% ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਤਾਂ ਤੁਹਾਡਾ ਮਾਡਲ ਲਗਭਗ ਬੇਕਾਰ ਹੈ; ਜੇਕਰ ਬੇਸ ਮਾਡਲ ਨੂੰ 50% ਮਿਲਦਾ ਹੈ, ਤਾਂ ਤੁਹਾਡਾ ਮਾਡਲ ਸੰਪੂਰਨ ਹੈ। ਹਮੇਸ਼ਾ ਬੁਨਿਆਦੀ ਮਾਡਲ ਦੇ ਰੂਪ ਵਿੱਚ ਬੋਲੋ.
ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਭਰੋਸਾ
ਇੱਕ ਸਿੰਗਲ ਸਿਖਲਾਈ/ਟੈਸਟਿੰਗ ਸਪਲਿਟ ਮੌਕਾ ਦੇ ਕਾਰਨ ਹੋ ਸਕਦਾ ਹੈ। ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ: ਡੇਟਾ ਨੂੰ k ਭਾਗਾਂ ਵਿੱਚ ਵੰਡਣਾ ਅਤੇ ਹਰੇਕ ਹਿੱਸੇ ਦੀ ਕ੍ਰਮਵਾਰ ਜਾਂਚ ਕਰਨਾ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਕਾਰਗੁਜ਼ਾਰੀ ਕਿੰਨੀ ਸਥਿਰ ਹੈ। 5-ਗੁਣਾ ਕਰਾਸ ਪ੍ਰਮਾਣਿਕਤਾ ਵਿੱਚ ਤੁਹਾਨੂੰ ਪੰਜ ਵੱਖ-ਵੱਖ ਸਕੋਰ ਮਿਲਦੇ ਹਨ; ਉਹਨਾਂ ਦਾ ਮੱਧਮਾਨ ਅਤੇ ਮਿਆਰੀ ਭਟਕਣਾ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਜੇਕਰ ਔਸਤ 80% ਹੈ ਪਰ ਭਟਕਣਾ ±12% ਹੈ, ਤਾਂ ਤੁਹਾਡਾ ਮਾਡਲ ਅਸਥਿਰ ਹੈ — ਇਹ ਡਾਟਾ ਦੇ ਅਗਲੇ ਬੈਚ ਵਿੱਚ ਬਹੁਤ ਵੱਖਰਾ ਵਿਹਾਰ ਕਰ ਸਕਦਾ ਹੈ।
ਇਹ "ਦੋ ਮਾਡਲ ਤੁਲਨਾ" ਲਈ ਵੀ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਜੇਕਰ ਮਾਡਲ A ਨੂੰ 81% ਅਤੇ ਮਾਡਲ B ਨੂੰ 82% ਮਿਲੇ, ਤਾਂ ਕੀ B ਅਸਲ ਵਿੱਚ ਬਿਹਤਰ ਹੈ? ਜੇਕਰ ਭਟਕਣਾ ±3% ਹੈ, ਤਾਂ ਇਹ ਅੰਤਰ ਸ਼ੋਰ ਹੋ ਸਕਦਾ ਹੈ। ਫੈਸਲਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਵਿਚਾਰ ਕਰੋ ਕਿ ਕੀ ਅੰਤਰ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਹਾਈਪਰਪੈਰਾਮੀਟਰ ਟਿਊਨਿੰਗ: ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨਾਲ, ਟੈਸਟਿੰਗ ਨਹੀਂ
ਹਾਈਪਰਪੈਰਾਮੀਟਰ (ਸੈਟਿੰਗਾਂ ਨੂੰ ਸਿਖਲਾਈ ਤੋਂ ਪਹਿਲਾਂ ਹੱਥੀਂ ਨਿਰਧਾਰਿਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ-ਸਿੱਖਣ ਦੀ ਦਰ, ਰੁੱਖ ਦੀ ਡੂੰਘਾਈ, ਆਦਿ) ਪ੍ਰਮਾਣਿਕਤਾ ਸੈੱਟ ਦੇ ਨਾਲ ਸੈੱਟ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਟੈਸਟ ਸੈੱਟ ਦੀ ਵਰਤੋਂ ਸਿਰਫ਼ ਇੱਕ ਵਾਰ ਅੰਤ ਵਿੱਚ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਜੇਕਰ ਤੁਸੀਂ ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਦੇਖ ਕੇ ਹਾਈਪਰਪੈਰਾਮੀਟਰ ਚੁਣਦੇ ਹੋ, ਤਾਂ ਟੈਸਟ ਸੈੱਟ ਦੂਸ਼ਿਤ ਹੋ ਜਾਵੇਗਾ ਅਤੇ ਤੁਹਾਡੇ ਦੁਆਰਾ ਰਿਪੋਰਟ ਕੀਤੀ ਗਈ ਕਾਰਗੁਜ਼ਾਰੀ ਆਸ਼ਾਵਾਦੀ ਹੋਵੇਗੀ ਜੋ ਕਿ ਅਸਲ ਵਿੱਚ ਅਜਿਹਾ ਨਹੀਂ ਹੈ।
ਨਕਲੀ ਬੁੱਧੀ ਹਾਈਪਰਪੈਰਾਮੀਟਰ ਖੋਜ ਸਪੇਸ ਨੂੰ ਡਿਜ਼ਾਈਨ ਕਰਨ ਅਤੇ ਖੋਜ ਕੋਡ (ਗਰਿੱਡ ਖੋਜ, ਬੇਤਰਤੀਬ ਖੋਜ, ਬੇਸੀਅਨ ਓਪਟੀਮਾਈਜੇਸ਼ਨ) ਨੂੰ ਲਿਖਣ ਵਿੱਚ ਇੱਕ ਵਧੀਆ ਸਹਾਇਕ ਹੈ। ਪਰ ਤੁਸੀਂ ਅਜੇ ਵੀ ਫੈਸਲਾ ਕਰਦੇ ਹੋ ਕਿ "ਅਸੀਂ ਕਿਹੜਾ ਮੈਟ੍ਰਿਕ ਅਨੁਕੂਲ ਬਣਾਵਾਂਗੇ?"
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਸ਼ੁੱਧਤਾ ਜਾਲ। ਇੱਕ ਮੈਡੀਕਲ ਟੀਮ ਨੂੰ ਇੱਕ ਮਾਡਲ 'ਤੇ ਮਾਣ ਸੀ ਜਿਸ ਨੇ ਇੱਕ ਦੁਰਲੱਭ ਬਿਮਾਰੀ ਦਾ ਪਤਾ ਲਗਾਇਆ: 98% ਸ਼ੁੱਧਤਾ। ਜਦੋਂ ਮੁਢਲੇ ਮਾਡਲ ਦੀ ਤੁਲਨਾ ਕੀਤੀ ਗਈ ਸੀ, ਤਾਂ ਸੱਚਾਈ ਸਾਹਮਣੇ ਆਈ: ਕਿਉਂਕਿ ਬਿਮਾਰੀ ਦੀ ਦਰ 2% ਸੀ, ਜਿਸ ਮਾਡਲ ਨੇ ਕਿਹਾ ਕਿ "ਹਰ ਕਿਸੇ ਨੂੰ ਸਿਹਤਮੰਦ ਕਹੋ" ਨੂੰ ਵੀ 98% ਪ੍ਰਾਪਤ ਹੋਇਆ। ਮਾਡਲ ਦੀ ਯਾਦ ਸਿਰਫ 11% ਸੀ - ਜ਼ਿਆਦਾਤਰ ਮਰੀਜ਼ ਲਾਪਤਾ ਸਨ। ਇੱਕ ਵਾਰ ਮੀਟ੍ਰਿਕ ਨੂੰ PR-AUC ਵਿੱਚ ਬਦਲਿਆ ਗਿਆ, ਅਸਲ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਮਾਪਿਆ ਗਿਆ ਅਤੇ ਮਾਡਲ ਨੂੰ ਮੁੜ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਗਿਆ।
ਕੇਸ 2 - ਤਰੱਕੀ ਲਈ ਗਲਤ ਸ਼ੋਰ। ਇੱਕ ਟੀਮ ਨੇ ਮਾਡਲ ਨੂੰ 86.2% ਤੋਂ 86.9% ਤੱਕ ਸੁਧਾਰਨ ਲਈ ਮਹੀਨੇ ਬਿਤਾਏ। ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਨੇ ਦਿਖਾਇਆ ਕਿ ਪੱਖਪਾਤ ±1.4% ਸੀ — ਇਸਲਈ 0.7 ਪੁਆਇੰਟ "ਸੁਧਾਰ" ਅੰਕੜਾ ਸ਼ੋਰ ਸੀ। ਟੀਮ ਨੇ ਅਸਲ ਕਮਾਈ 'ਤੇ ਤਿੰਨ ਹਫ਼ਤੇ ਬਰਬਾਦ ਕੀਤੇ ਸਨ. ਸਬਕ: ਇਹ ਪੁਸ਼ਟੀ ਕੀਤੇ ਬਿਨਾਂ ਜਿੱਤ ਦਾ ਐਲਾਨ ਨਾ ਕਰੋ ਕਿ ਸੁਧਾਰ ਭਟਕਣ ਨਾਲੋਂ ਵੱਡਾ ਹੈ।
ਕੇਸ 3 - ਟੈਸਟ ਸੈੱਟ ਦੀ ਗੰਦਗੀ। ਇੱਕ ਇੰਜੀਨੀਅਰ ਨੇ ਵਧੀਆ ਹਾਈਪਰਪੈਰਾਮੀਟਰਾਂ ਦੀ ਚੋਣ ਕਰਨ ਲਈ ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਵਾਰ-ਵਾਰ ਦੇਖਿਆ। 91% ਇਸ ਨੇ ਉਤਪਾਦਨ ਵਿੱਚ 83% ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ. ਕਿਉਂ: ਉਸਨੇ ਅਣਜਾਣੇ ਵਿੱਚ ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਬਾਰ ਬਾਰ ਦੇਖ ਕੇ (ਟੈਸਟ ਸੈੱਟ 'ਤੇ ਓਵਰਲਰਨਿੰਗ) ਦੇ ਅਨੁਸਾਰ ਮਾਡਲ ਦੀ ਚੋਣ ਕੀਤੀ ਸੀ। ਰਿਪੋਰਟ ਕੀਤੀ ਗਈ ਅਤੇ ਅਸਲ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਓਵਰਲੈਪ ਕੀਤਾ ਗਿਆ ਜਦੋਂ ਇੱਕ ਵੱਖਰਾ ਪ੍ਰਮਾਣਿਕਤਾ ਸੈੱਟ ਵਰਤਿਆ ਗਿਆ ਸੀ।
ਨਕਲ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟਸ
ਇਸ ਵਰਗੀਕਰਨ ਸਮੱਸਿਆ ਲਈ ਸਹੀ ਮੈਟ੍ਰਿਕ ਚੁਣਨ ਵਿੱਚ ਮੇਰੀ ਮਦਦ ਕਰੋ। ਸਮੱਸਿਆ: [ਕੀ ਭਵਿੱਖਬਾਣੀ ਕੀਤੀ ਗਈ ਹੈ] ਵਰਗ ਵੰਡ: [ਸਕਾਰਾਤਮਕ ਦਰ
ਨਿਮਨਲਿਖਤ ਦੋ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ। ਮਾਡਲ ਏ ਕਰਾਸ-ਪ੍ਰਮਾਣਿਕਤਾ: [ਸਕੋਰਾਂ ਦੀ ਸੂਚੀ]ਮਾਡਲ ਬੀ ਕਰਾਸ-ਪ੍ਰਮਾਣਿਕਤਾ: [ਸਕੋਰਾਂ ਦੀ ਸੂਚੀ] ਮੱਧਮਾਨ ਅਤੇ ਮਿਆਰੀ ਵਿਵਹਾਰ ਦੀ ਗਣਨਾ ਕਰੋ। ਕੀ ਅੰਤਰ ਅੰਕੜਾਤਮਕ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਹੈ ਜਾਂ ਕੀ ਇਹ ਭਟਕਣਾ ਦੇ ਅੰਦਰ ਸਿਰਫ ਰੌਲਾ ਹੈ? ਤੁਸੀਂ ਕਿਸ ਨੂੰ ਚੁਣਨ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰੋਗੇ ਅਤੇ ਕਿਉਂ?
ਹੇਠਾਂ ਦਿੱਤੇ ਲਈ ਇਸ ਸਿਖਲਾਈ ਕੋਡ ਦੀ ਜਾਂਚ ਕਰੋ: 1) ਕੀ ਹਾਈਪਰਪੈਰਾਮੀਟਰ ਟੈਸਟ ਸੈੱਟ ਜਾਂ ਪ੍ਰਮਾਣਿਕਤਾ ਸੈੱਟ ਦੇ ਨਾਲ ਚੁਣੇ ਗਏ ਹਨ? 2) ਕੀ ਸਹੀ ਸੈੱਟ ਦੇ ਨਾਲ ਛੇਤੀ ਰੁਕਣ ਦੀ ਨਿਗਰਾਨੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ? 3) ਕੀ ਓਵਰਲਰਨਿੰਗ (ਸਿਖਲਾਈ/ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨੁਕਸਾਨ ਦੇ ਅੰਤਰ) ਦੇ ਕੋਈ ਸੰਕੇਤ ਹਨ? ਕੋਡ: [ਕੋਡ]
ਇਸ ਰਿਗਰੈਸ਼ਨ ਸਮੱਸਿਆ ਲਈ ਮੈਨੂੰ ਕਿਸ MAE, RMSE, ਅਤੇ MAPE ਦੀ ਰਿਪੋਰਟ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ? ਟੀਚਾ ਵੇਰੀਏਬਲ ਦਾ ਸਕੇਲ: [ਰੇਂਜ] ਕੀ ਵੱਡੀਆਂ ਤਰੁੱਟੀਆਂ ਅਨੁਪਾਤਕ ਤੌਰ 'ਤੇ ਮਾੜੀਆਂ ਹਨ (RMSE), ਜਾਂ ਕੀ ਉਹ ਸਾਰੇ ਬਰਾਬਰ ਹਨ (MAE)? ਕੀ ਇੱਥੇ ਮੁੱਲ ਜ਼ੀਰੋ ਦੇ ਨੇੜੇ ਹਨ (ਕੀ ਉਹ MAPE ਨੂੰ ਵਿਗਾੜਦੇ ਹਨ)? ਸੰਖੇਪ ਜਾਇਜ਼ਤਾ ਨਾਲ ਸੁਝਾਓ।
ਮੀਟ੍ਰਿਕ ਚੋਣ ਸਾਰਣੀ
ਸਮੱਸਿਆ ਦੀ ਕਿਸਮ
ਉਚਿਤ ਮਾਪਕ
ਤੋਂ ਬਚਿਆ ਜਾਵੇ
ਕਿਉਂ
ਅਸੰਤੁਲਿਤ ਵਰਗੀਕਰਨ
PR-AUC, F1, ਯਾਦ
ਸ਼ੁੱਧਤਾ
ਬਹੁਗਿਣਤੀ ਵਰਗ ਮੈਟ੍ਰਿਕ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ
ਸੰਤੁਲਿਤ ਵਰਗੀਕਰਨ
ਸ਼ੁੱਧਤਾ, ROC-AUC
-
ਸੰਤੁਲਿਤ ਡੇਟਾ ਵਿੱਚ ਭਰੋਸੇਯੋਗ
ਰਿਗਰੈਸ਼ਨ (ਮਹੱਤਵਪੂਰਣ ਆਊਟਲੀਅਰ)
RMSE
MAPE (ਜੇ ਜ਼ੀਰੋ)
ਵੱਡੀਆਂ ਗਲਤੀਆਂ ਦੀ ਸਜ਼ਾ ਦਿੰਦਾ ਹੈ
ਰਿਗਰੈਸ਼ਨ (ਬਰਾਬਰ ਭਾਰ)
ਐਮ.ਏ.ਈ
-
ਵਿਆਖਿਆ ਕਰਨ ਲਈ ਆਸਾਨ
ਦਰਜਾਬੰਦੀ/ਸਿਫ਼ਾਰਸ਼
NDCG, Recal@K
ਸ਼ੁੱਧਤਾ
ਆਰਡਰ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਆਮ ਗਲਤੀਆਂ
- ਅਸੰਤੁਲਿਤ ਡੇਟਾ 'ਤੇ ਸ਼ੁੱਧਤਾ ਦੀ ਵਰਤੋਂ ਕਰਨਾ। ਸਭ ਤੋਂ ਆਮ ਮਾਪਕ ਗਲਤੀ।
- ਬੇਸ ਮਾਡਲ ਦੀ ਤੁਲਨਾ ਨਹੀਂ ਕਰ ਰਿਹਾ। ਇਹ ਮੈਟ੍ਰਿਕ ਨੂੰ ਇਸਦਾ ਅਰਥ ਗੁਆ ਦਿੰਦਾ ਹੈ.
- ਹਾਈਪਰਪੈਰਾਮੀਟਰਾਂ ਲਈ ਟੈਸਟ ਸੈੱਟ ਨੂੰ ਦੇਖਦੇ ਹੋਏ। ਆਸ਼ਾਵਾਦੀ, ਅਸਥਾਈ ਨਤੀਜਾ.
- ਇਕੋ ਡੱਬੇ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ. ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਬਿਨਾਂ ਤੁਸੀਂ ਪੱਖਪਾਤ ਨਹੀਂ ਦੇਖ ਸਕੋਗੇ।
- ਤਰੱਕੀ ਲਈ ਰੌਲਾ ਪਾਉਣਾ। ਭਟਕਣ ਤੋਂ ਛੋਟੇ "ਸੁਧਾਰ" ਜਿਆਦਾਤਰ ਕਿਸਮਤ ਹਨ.
- ਵਪਾਰਕ ਸੰਦਰਭ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ. ਸ਼ੁੱਧਤਾ/ਰੀਕਾਲ ਬੈਲੇਂਸ ਇੱਕ ਵਪਾਰਕ ਫੈਸਲਾ ਹੈ।
ਸੰਖੇਪ ਵਿੱਚ
ਮਾਡਲ ਸਿਖਲਾਈ ਵਿੱਚ ਅਸਲ ਹੁਨਰ ਇੱਕ ਉੱਚ ਸੰਖਿਆ ਪੈਦਾ ਕਰਨਾ ਨਹੀਂ ਹੈ, ਪਰ ਇਹ ਜਾਣਨਾ ਹੈ ਕਿ ਉਸ ਨੰਬਰ ਦਾ ਕੀ ਅਰਥ ਹੈ। ਸਮੱਸਿਆ ਅਤੇ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ ਸਹੀ ਮੈਟ੍ਰਿਕ ਨਿਰਧਾਰਤ ਕਰਦੇ ਹਨ; ਬੇਸਲਾਈਨ ਮਾਡਲ ਦੇ ਅਨੁਸਾਰ ਹਰੇਕ ਮੀਟ੍ਰਿਕ ਦੀ ਵਿਆਖਿਆ ਕਰੋ; ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਨਾਲ ਪੱਖਪਾਤ ਨੂੰ ਮਾਪੋ ਅਤੇ ਤਰੱਕੀ ਲਈ ਸ਼ੋਰ ਨੂੰ ਗਲਤੀ ਨਾ ਕਰੋ; ਟੈਸਟ ਸੈੱਟ ਦੀ ਵਰਤੋਂ ਸਿਰਫ਼ ਅੰਤ ਵਿੱਚ, ਇੱਕ ਵਾਰ ਕਰੋ। AI ਪ੍ਰਯੋਗ ਡਿਜ਼ਾਈਨ ਵਿੱਚ ਤੁਹਾਡਾ ਸਾਥੀ ਹੈ, ਪਰ "ਕਾਫ਼ੀ ਚੰਗਾ" ਦਾ ਫੈਸਲਾ ਤੁਹਾਡੇ ਅਤੇ ਤੁਹਾਡੇ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਵਰਗੀਕਰਣ ਮਾਡਲ ਲਈ: (1) ਕਲਾਸ ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ ਲਿਖੋ, (2) ਇੱਕ ਢੁਕਵਾਂ ਬੇਸ ਮਾਡਲ ਬਣਾਓ ਅਤੇ ਇਸਦੇ ਸਕੋਰ ਨੂੰ ਮਾਪੋ, (3) 5-ਗੁਣਾ ਕਰਾਸ ਪ੍ਰਮਾਣਿਕਤਾ ਨਾਲ ਆਪਣੇ ਮਾਡਲ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ ਅਤੇ ਮੱਧਮਾਨ ਅਤੇ ਮਿਆਰੀ ਵਿਵਹਾਰ ਦੀ ਰਿਪੋਰਟ ਕਰੋ, (4) ਸ਼ੁੱਧਤਾ ਦੀ ਬਜਾਏ ਸਮੱਸਿਆ ਦੇ ਅਨੁਕੂਲ ਮੈਟ੍ਰਿਕ ਦੀ ਗਣਨਾ ਕਰੋ (ਉਦਾਹਰਨ ਲਈ PR-AUC)। ਲਿਖੋ ਕਿ ਕੀ ਤੁਹਾਡਾ ਮਾਡਲ ਬੇਸਲਾਈਨ ਮਾਡਲ ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਪੱਖਪਾਤ ਦੇ ਵੱਡੇ ਫਰਕ ਨਾਲ ਹਰਾਉਂਦਾ ਹੈ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਸਮੱਸਿਆ ਦੀ ਕਿਸਮ ਅਤੇ ਕਾਰੋਬਾਰੀ ਸੰਦਰਭ ਦੇ ਆਧਾਰ 'ਤੇ ਮੈਟ੍ਰਿਕ ਚੁਣਿਆ ਹੈ।
- [ ] ਮੈਂ ਇੱਕ ਬੇਸ ਮਾਡਲ ਬਣਾਇਆ ਅਤੇ ਇਸਦੀ ਤੁਲਨਾ ਕੀਤੀ।
- [ ] ਮੈਂ ਅੰਤਰ-ਪ੍ਰਮਾਣਿਕਤਾ ਦੇ ਨਾਲ ਮੱਧਮਾਨ ਅਤੇ ਭਟਕਣ ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ ਹੈ।
- [ ] ਮੈਂ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ ਕਿ ਸੁਧਾਰ ਭਟਕਣਾ ਨਾਲੋਂ ਵੱਡਾ ਹੈ।
- [ ] ਮੈਂ ਪ੍ਰਮਾਣਿਕਤਾ ਸੈੱਟ ਦੇ ਨਾਲ ਹਾਈਪਰਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਚੁਣਿਆ ਹੈ।
- [ ] ਮੈਂ ਸਿਰਫ ਇੱਕ ਵਾਰ ਟੈਸਟ ਸੈੱਟ ਦੀ ਵਰਤੋਂ ਕੀਤੀ, ਬਿਲਕੁਲ ਅੰਤ ਵਿੱਚ।