ਲਾਭ:
- ਨੀਤੀ ਵਿੱਚ ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ, ਆਊਟਲੀਅਰਾਂ, ਐਕਸਪੋਜ਼ਰ ਅਤੇ ਡੇਟਾ ਦੀ ਗੁਣਵੱਤਾ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ ਦਾ ਪਤਾ ਲਗਾਉਣ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਨਕਲੀ ਖੁਫੀਆ ਸਹਾਇਤਾ ਨਾਲ ਡੇਟਾ ਨੂੰ ਨੁਕਸਾਨ ਪਹੁੰਚਾਉਣਾ ਅਤੇ ਇੱਕ ਸੁਧਾਰ ਡਰਾਫਟ ਤਿਆਰ ਕਰਨਾ
- ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ (ਨਵੀਂ ਵੇਰੀਏਬਲ ਡੈਰੀਵੇਸ਼ਨ, ਗਰੁੱਪਿੰਗ, ਕੋਡਿੰਗ) ਅਤੇ ਸਹੀ ਸੰਦਰਭ ਦੇ ਨਾਲ ਨਕਲੀ ਬੁੱਧੀ ਲਈ ਐਕਸਪੋਜਰ ਸਧਾਰਣਕਰਨ
- ਇਹ ਸਮਝੋ ਕਿ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਦੁਆਰਾ ਸੁਝਾਏ ਗਏ ਡੇਟਾ ਪਰਿਵਰਤਨ ਦਾ ਡੇਟਾ ਲੀਕ ਹੋਣ ਅਤੇ ਲੁਕਵੇਂ ਪੱਖਪਾਤ ਦੇ ਜੋਖਮ ਦੇ ਵਿਰੁੱਧ ਇੱਕ ਐਕਚੁਰੀ ਦੁਆਰਾ ਆਡਿਟ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।
ਸਭ ਤੋਂ ਘੱਟ ਗੱਲ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਪਰ ਅਸਲ ਕੰਮ ਦਾ ਸਭ ਤੋਂ ਵੱਧ ਸਮਾਂ ਲੈਣ ਵਾਲਾ ਹਿੱਸਾ ਡਾਟਾ ਤਿਆਰ ਕਰਨਾ ਹੈ। ਤਜਰਬੇਕਾਰ ਅਦਾਕਾਰ ਜਾਣਦੇ ਹਨ ਕਿ ਮਾਡਲਿੰਗ ਪ੍ਰੋਜੈਕਟ ਦਾ ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ ਡੇਟਾ ਨੂੰ ਸਾਫ਼ ਕਰਨ, ਜੋੜਨ ਅਤੇ ਠੀਕ ਕਰਨ ਵਿੱਚ ਬਿਤਾਇਆ ਜਾਂਦਾ ਹੈ। ਮਾਡਲ ਭਾਵੇਂ ਕਿੰਨਾ ਵੀ ਸ਼ਾਨਦਾਰ ਕਿਉਂ ਨਾ ਹੋਵੇ, ਜੇਕਰ ਇਨਪੁਟ ਡੇਟਾ ਨਿਕਾਰਾ ਹੈ, ਤਾਂ ਆਉਟਪੁੱਟ ਭ੍ਰਿਸ਼ਟ ਹੈ — ਸੰਖੇਪ ਵਿੱਚ, "ਕੂੜਾ ਅੰਦਰ, ਕੂੜਾ ਬਾਹਰ"। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਨੀਤੀ ਅਤੇ ਦਾਅਵਿਆਂ ਦੇ ਡੇਟਾ ਦੀਆਂ ਖਾਸ ਸਮੱਸਿਆਵਾਂ, AI ਨਾਲ ਉਹਨਾਂ ਨੂੰ ਕਿਵੇਂ ਖੋਜਣਾ ਅਤੇ ਠੀਕ ਕਰਨਾ ਹੈ, ਅਤੇ ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜਨੀਅਰਿੰਗ (ਨਵੇਂ ਵੇਰੀਏਬਲ ਜੋ ਮੌਜੂਦਾ ਡੇਟਾ ਤੋਂ ਵਧੇਰੇ ਜਾਣਕਾਰੀ ਭਰਪੂਰ ਹਨ) ਪਹੁੰਚ ਨੂੰ ਦੇਖਾਂਗੇ।
ਸ਼ੁਰੂਆਤ ਤੋਂ ਇੱਕ ਚੇਤਾਵਨੀ: ਡੇਟਾ ਤਿਆਰ ਕਰਨਾ ਇੱਕ ਪ੍ਰਤੀਤ ਹੁੰਦਾ ਤਕਨੀਕੀ ਅਤੇ ਨਿਰਦੋਸ਼ ਕਦਮ ਹੈ, ਪਰ ਇਹ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ ਸਭ ਤੋਂ ਖਤਰਨਾਕ ਗਲਤੀਆਂ ਛੁਪਦੀਆਂ ਹਨ। ਇੱਕ ਗਲਤ ਐਕਸਪੋਜਰ ਸਧਾਰਣਕਰਨ, ਇੱਕ ਲੁਕਿਆ ਹੋਇਆ ਡੇਟਾ ਲੀਕ, ਜਾਂ ਅਣਜਾਣੇ ਵਿੱਚ ਪੇਸ਼ ਕੀਤਾ ਗਿਆ ਪੱਖਪਾਤ ਸਾਰੇ ਅਗਲੇ ਮਾਡਲਾਂ ਨੂੰ ਚੁੱਪਚਾਪ ਵਿਗਾੜ ਦਿੰਦਾ ਹੈ। AI ਇਸ ਕਦਮ ਨੂੰ ਬਹੁਤ ਤੇਜ਼ ਕਰਦਾ ਹੈ, ਪਰ ਜੇਕਰ ਬੇਕਾਬੂ ਛੱਡਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਹ ਜੋਖਮ ਨੂੰ ਵੀ ਵਧਾ ਦਿੰਦਾ ਹੈ।
ਅਸਲ ਅੰਕੜਿਆਂ ਦੀਆਂ ਆਮ ਸਮੱਸਿਆਵਾਂ
ਨੀਤੀ ਅਤੇ ਦਾਅਵਿਆਂ ਦਾ ਡੇਟਾ ਲਗਭਗ ਕਦੇ ਵੀ ਸਾਫ਼ ਨਹੀਂ ਹੁੰਦਾ। ਸਭ ਤੋਂ ਆਮ ਸਮੱਸਿਆਵਾਂ ਹਨ: ਲੁਪਤ ਮੁੱਲ: ਕੁਝ ਨੀਤੀਆਂ ਵਿੱਚ ਵਾਹਨ ਦੀ ਉਮਰ, ਕਿੱਤਾ ਜਾਂ ਖੇਤਰ ਖਾਲੀ ਹੈ। ਅੰਨ੍ਹੇਵਾਹ ਇਹਨਾਂ ਨੂੰ ਔਸਤ ਨਾਲ ਭਰਨਾ ਪੱਖਪਾਤ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ; ਕਮੀ ਖੁਦ ਕਈ ਵਾਰ ਜਾਣਕਾਰੀ ਲੈਂਦੀ ਹੈ (ਗੁੰਮ ਇੱਕ ਵੱਖਰਾ ਸਮੂਹ ਹੈ)। ਆਊਟਲੀਅਰ: ਤਰਕਹੀਣ ਰਿਕਾਰਡ ਜਿਵੇਂ ਕਿ ਨਕਾਰਾਤਮਕ ਪ੍ਰੀਮੀਅਮ, 200-ਸਾਲ ਪੁਰਾਣਾ ਬੀਮਿਤ, ਜ਼ੀਰੋ-ਐਕਸਪੋਜ਼ਰ ਪਾਲਿਸੀ। ਇਹ ਵੱਖ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਕੀ ਇਹ ਡੇਟਾ ਤਰੁਟੀਆਂ ਹਨ ਜਾਂ ਅਸਲ ਕਿਨਾਰੇ ਦੇ ਕੇਸ ਹਨ। ਅਸੰਗਤਤਾ: ਇੱਕੋ ਖੇਤਰ ਦੇ ਵੱਖ-ਵੱਖ ਸ਼ਬਦ-ਜੋੜ ("ਇਸਤਾਂਬੁਲ", "ਇਸਤਾਂਬੁਲ", "34"), ਮਿਤੀ ਫਾਰਮੈਟ ਉਲਝਣ। ਡੁਪਲੀਕੇਟ ਐਂਟਰੀਆਂ: ਇੱਕੋ ਨੁਕਸਾਨ ਦੀ ਦੋ ਵਾਰ ਐਂਟਰੀ।
ਪਰ ਐਚੁਰੀਅਲ ਲਈ ਖਾਸ ਸਭ ਤੋਂ ਨਾਜ਼ੁਕ ਮੁੱਦਾ ਐਕਸਪੋਜਰ ਹੈ। ਜੇਕਰ ਕੋਈ ਪਾਲਿਸੀ ਸਾਲ ਦੇ ਅੱਧ ਵਿੱਚ ਸ਼ੁਰੂ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਇਹ ਉਸ ਸਾਲ ਲਈ ਇੱਕ ਫ੍ਰੈਕਸ਼ਨਲ ਐਕਸਪੋਜ਼ਰ (ਜਿਵੇਂ ਕਿ 0.5 ਸਾਲ) ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ, ਨਾ ਕਿ ਪੂਰਾ “ਪਾਲਿਸੀ-ਸਾਲ”। ਬਾਰੰਬਾਰਤਾ ਅਤੇ ਨੁਕਸਾਨ ਦੀਆਂ ਦਰਾਂ ਨੂੰ ਹਮੇਸ਼ਾ ਐਕਸਪੋਜਰ ਲਈ ਸਧਾਰਣ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ; ਨਹੀਂ ਤਾਂ ਛੋਟੀ ਮਿਆਦ ਦੀਆਂ ਨੀਤੀਆਂ ਉੱਚ ਖਤਰੇ ਵਾਲੀਆਂ ਦਿਖਾਈ ਦਿੰਦੀਆਂ ਹਨ। AI ਐਕਸਪੋਜ਼ਰ ਗਣਨਾ ਨੂੰ ਕੋਡ ਕਰ ਸਕਦਾ ਹੈ, ਪਰ ਤੁਹਾਨੂੰ ਪਰਿਭਾਸ਼ਾ ਅਤੇ ਕਾਰੋਬਾਰੀ ਨਿਯਮ ਪ੍ਰਦਾਨ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ।
ਹੇਠ ਦਿੱਤੀ ਸਾਰਣੀ ਆਮ ਸਮੱਸਿਆਵਾਂ ਅਤੇ ਸਹੀ ਪਹੁੰਚ ਦਾ ਸਾਰ ਦਿੰਦੀ ਹੈ:
ਸਮੱਸਿਆ
ਗਲਤ ਪਹੁੰਚ
ਸਹੀ ਪਹੁੰਚ
ਗੁੰਮ ਮੁੱਲ
ਔਸਤ ਨਾਲ ਸਭ ਨੂੰ ਭਰੋ
ਘਾਟ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰੋ; ਕਈ ਵਾਰ ਇੱਕ ਵੱਖਰੀ ਸ਼੍ਰੇਣੀ ਖੋਲ੍ਹੋ
ਬਾਹਰੀ
ਆਟੋ ਡਿਲੀਟ ਕਰੋ
ਡਾਟਾ ਗਲਤੀ ਅਤੇ ਅਸਲ ਲੀਡ ਵਿਚਕਾਰ ਫਰਕ ਕਰੋ
ਐਕਸਪੋਜਰ
1 ਸਾਲ ਲਈ ਸਾਰੀਆਂ ਨੀਤੀਆਂ ਦੀ ਗਿਣਤੀ ਕਰੋ
ਫਰੈਕਸ਼ਨਲ ਐਕਸਪੋਜਰ ਦੀ ਗਣਨਾ ਕਰੋ
ਸ਼੍ਰੇਣੀ ਅਸੰਗਤਤਾ
ਅਣਡਿੱਠ ਕਰੋ
ਮਿਆਰੀ ਸ਼ਬਦਕੋਸ਼ ਨਾਲ ਮੇਲ ਕਰੋ
ਆਵਰਤੀ ਨੁਕਸਾਨ
ਧਿਆਨ ਨਾ ਦਿਓ
ਕੁੰਜੀ ਖੇਤਰਾਂ ਨਾਲ ਡੁਪਲੀਕੇਟ ਕਰੋ
ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ: ਡੇਟਾ ਤੋਂ ਗਿਆਨ ਪ੍ਰਾਪਤ ਕਰਨਾ
ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜਨੀਅਰਿੰਗ ਨਵੇਂ ਵੇਰੀਏਬਲਾਂ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਕਲਾ ਹੈ ਜੋ ਮੌਜੂਦਾ ਕੱਚੇ ਵੇਰੀਏਬਲਾਂ ਤੋਂ ਮਾਡਲ ਲਈ ਵਧੇਰੇ ਉਪਯੋਗੀ ਹਨ। ਉਦਾਹਰਨਾਂ: ਜਨਮ ਮਿਤੀ ਤੋਂ "ਉਮਰ", ਉਮਰ ਤੋਂ "ਉਮਰ ਸਮੂਹ" (ਬਿਨਿੰਗ), ਵਾਹਨ ਮੇਕ-ਮਾਡਲ ਤੋਂ "ਜੋਖਮ ਭਾਗ", ਪਤਾ-ਨੀਤੀ ਦੇ ਸੁਮੇਲ ਤੋਂ "ਸਾਲਾਨਾ ਮਾਈਲੇਜ ਅਨੁਮਾਨ"। ਇੱਕ ਚੰਗੀ ਵਿਸ਼ੇਸ਼ਤਾ ਕੱਚੇ ਡੇਟਾ ਨਾਲੋਂ ਇੱਕ ਮਜ਼ਬੂਤ ਸੰਕੇਤ ਦਿੰਦੀ ਹੈ ਅਤੇ ਮਾਡਲ ਦੀ ਸ਼ੁੱਧਤਾ ਅਤੇ ਵਿਆਖਿਆਤਮਕਤਾ ਦੋਵਾਂ ਨੂੰ ਵਧਾਉਂਦੀ ਹੈ।
ਵਾਸਤਵਿਕ ਕੰਮ ਵਿੱਚ ਤਿੰਨ ਤਕਨੀਕਾਂ ਨੂੰ ਅਕਸਰ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ। ਬਾਈਡਿੰਗ: ਇੱਕ ਨਿਰੰਤਰ ਵੇਰੀਏਬਲ (ਉਮਰ) ਨੂੰ ਅਰਥਪੂਰਨ ਸਮੂਹਾਂ ਵਿੱਚ ਵੱਖ ਕਰਨਾ; ਇਹ ਗੈਰ-ਲੀਨੀਅਰ ਸਬੰਧਾਂ ਨੂੰ ਕੈਪਚਰ ਕਰਦਾ ਹੈ ਅਤੇ ਟੈਰਿਫ ਨੂੰ ਪੜ੍ਹਨਯੋਗ ਬਣਾਉਂਦਾ ਹੈ। ਏਨਕੋਡਿੰਗ: ਕੈਟੇਗਰੀਕਲ ਵੇਰੀਏਬਲ (ਖੇਤਰ) ਨੂੰ ਮਾਡਲ ਲਈ ਢੁਕਵੇਂ ਸੰਖਿਆਤਮਕ ਫਾਰਮੈਟ ਵਿੱਚ ਬਦਲਣਾ; ਜੋਖਮ-ਅਧਾਰਿਤ ਕੋਡਿੰਗ (ਹਰੇਕ ਸ਼੍ਰੇਣੀ ਨੂੰ ਇਸਦੇ ਆਪਣੇ ਨੁਕਸਾਨ ਦੀ ਦਰ ਨਾਲ ਦਰਸਾਉਣਾ) ਆਮ ਹੈ ਪਰ ਸਾਵਧਾਨੀ ਨਾਲ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਸਧਾਰਣਕਰਨ: ਹਰ ਚੀਜ਼ ਨੂੰ ਇਸਦੇ ਐਕਸਪੋਜਰ ਦੁਆਰਾ ਵੰਡ ਕੇ ਤੁਲਨਾਤਮਕ ਬਣਾਉਣਾ। AI ਇਹਨਾਂ ਤਬਦੀਲੀਆਂ ਲਈ ਤੇਜ਼ੀ ਨਾਲ ਕੋਡ ਤਿਆਰ ਕਰਦਾ ਹੈ; ਪਰ ਤੁਹਾਨੂੰ ਹਰ ਪਰਿਵਰਤਨ ਦੇ ਤਰਕ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ।
ਸੰਕੇਤ: ਟਾਰਗੇਟ ਏਨਕੋਡਿੰਗ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ ਪਰ ਡੇਟਾ ਲੀਕ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਹੈ: ਮਾਡਲ "ਚੀਟਸ" ਜੇਕਰ ਤੁਸੀਂ ਇੱਕ ਸ਼੍ਰੇਣੀ ਦੇ ਔਸਤ ਨੁਕਸਾਨ ਦੀ ਗਣਨਾ ਕਰਦੇ ਸਮੇਂ ਇੱਕ ਕਤਾਰ ਦੇ ਆਪਣੇ ਨੁਕਸਾਨ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦੇ ਹੋ। ਇਹ ਹਮੇਸ਼ਾ ਸਿਖਲਾਈ ਡੇਟਾ ਦੇ ਅੰਦਰ, ਇੱਕ ਕਰਾਸ-ਵੈਧੀਕਰਨ ਪੈਟਰਨ ਵਿੱਚ ਕਰੋ।
ਸਭ ਤੋਂ ਧੋਖੇਬਾਜ਼ ਖ਼ਤਰਾ: ਡੇਟਾ ਲੀਕ ਅਤੇ ਅਪ੍ਰਤੱਖ ਪੱਖਪਾਤ
ਡੇਟਾ ਲੀਕੇਜ ਮਾਡਲ ਵਿੱਚ ਜਾਣਕਾਰੀ ਦੀ ਜਾਣ-ਪਛਾਣ ਹੈ ਜੋ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਅਸਲ ਵਿੱਚ ਮੌਜੂਦ ਨਹੀਂ ਹੈ। ਕਲਾਸਿਕ ਉਦਾਹਰਨ: ਨਤੀਜੇ ਵਾਲੇ ਵੇਰੀਏਬਲ ਨੂੰ ਪੇਸ਼ ਕਰਨਾ, ਜਿਵੇਂ ਕਿ "ਦਾਅਵਿਆਂ ਦਾ ਭੁਗਤਾਨ ਕੀਤਾ ਗਿਆ," ਇੱਕ ਮਾਡਲ ਵਿੱਚ ਜੋ ਦਾਅਵੇ ਦੀ ਰਕਮ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ। ਮਾਡਲ ਟੈਸਟ ਡੇਟਾ ਵਿੱਚ ਸੰਪੂਰਨ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਪਰ ਅਸਲ ਸੰਸਾਰ ਵਿੱਚ ਬੇਕਾਰ ਹੈ ਕਿਉਂਕਿ ਉਹ ਜਾਣਕਾਰੀ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਉਪਲਬਧ ਨਹੀਂ ਹੁੰਦੀ ਹੈ। ਲੀਕੇਜ ਅਕਸਰ ਲੁਕਿਆ ਹੁੰਦਾ ਹੈ ਅਤੇ ਸਿਰਫ ਸਾਵਧਾਨੀਪੂਰਵਕ ਅਸਲ ਤਰਕ ਦੁਆਰਾ ਫੜਿਆ ਜਾਂਦਾ ਹੈ - AI ਆਮ ਤੌਰ 'ਤੇ ਧਿਆਨ ਨਹੀਂ ਦਿੰਦਾ, ਕਈ ਵਾਰ ਲੀਕ ਵੇਰੀਏਬਲ ਨੂੰ "ਬਹੁਤ ਸ਼ਕਤੀਸ਼ਾਲੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਵਾਲੇ" ਵਜੋਂ ਪ੍ਰਸ਼ੰਸਾ ਵੀ ਕਰਦਾ ਹੈ।
ਦੂਜਾ ਧੋਖਾਧੜੀ ਖ਼ਤਰਾ ਅਪ੍ਰਤੱਖ ਪੱਖਪਾਤ ਹੈ। ਜੇਕਰ ਇਤਿਹਾਸਕ ਡੇਟਾ ਕਿਸੇ ਵਿਸ਼ੇਸ਼ ਸਮੂਹ ਨੂੰ ਗਲਤ ਢੰਗ ਨਾਲ ਦਰਸਾਉਂਦਾ ਹੈ (ਉਦਾਹਰਨ ਲਈ, ਇੱਕ ਖੇਤਰ ਨੂੰ ਇਤਿਹਾਸਕ ਤੌਰ 'ਤੇ ਬਹੁਤ ਸਾਰੀਆਂ ਨੀਤੀਆਂ ਤੋਂ ਇਨਕਾਰ ਕੀਤਾ ਗਿਆ ਹੈ), ਤਾਂ ਉਸ ਡੇਟਾ ਤੋਂ ਪ੍ਰਾਪਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਉਸ ਪੱਖਪਾਤ ਨੂੰ ਲੈ ਕੇ ਜਾਂਦੀਆਂ ਹਨ ਅਤੇ ਮਾਡਲ ਭਵਿੱਖ ਵਿੱਚ ਇਸਨੂੰ ਦੁਹਰਾਉਂਦਾ ਹੈ। ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ ਪੜਾਅ ਸਭ ਤੋਂ ਨਾਜ਼ੁਕ ਪਲ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਇਸ ਪੱਖਪਾਤ ਨੂੰ ਪਛਾਣਿਆ ਅਤੇ ਠੀਕ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।
ਸਾਵਧਾਨ: ਇਸ ਤੋਂ ਪਹਿਲਾਂ ਕਿ ਤੁਸੀਂ ਖੁਸ਼ ਹੋਵੋ ਜਦੋਂ ਇੱਕ ਵੇਰੀਏਬਲ "ਭਵਿੱਖਬਾਣੀ ਸ਼ਕਤੀ ਵਿੱਚ ਬਹੁਤ ਸੁਧਾਰ ਕਰਦਾ ਹੈ," ਪੁੱਛੋ: ਕੀ ਇਹ ਵੇਰੀਏਬਲ ਅਸਲ ਵਿੱਚ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੌਜੂਦ ਹੈ, ਜਾਂ ਕੀ ਇਹ ਭਵਿੱਖ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ? ਇੱਕ ਨਤੀਜਾ ਜੋ ਬਹੁਤ ਵਧੀਆ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਅਕਸਰ ਇੱਕ ਲੀਕ ਦਾ ਸੰਕੇਤ ਹੁੰਦਾ ਹੈ।
ਡਾਟਾ ਤਿਆਰੀ ਵਿੱਚ AI ਦੀ ਵਰਤੋਂ ਕਿਵੇਂ ਕਰੀਏ
1) ਡਾਟਾ ਗੁਣਵੱਤਾ ਸਕ੍ਰੀਨਿੰਗ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਡਾਟਾ ਗੁਣਵੱਤਾ ਸਹਾਇਕ। ਤੁਹਾਡੇ ਕੋਲ ਵਾਸਤਵਿਕ ਨੀਤੀ ਉਪਜ ਹੈ। ਕਾਲਮ: ਪਾਲਿਸੀ_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount। ਮੈਨੂੰ ਇੱਕ ਚੈਕਲਿਸਟ ਅਤੇ Python (pandas) ਕੋਡ ਸਕੈਚ ਦਿਓ:- ਕਾਲਮ ਦੁਆਰਾ ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ ਨੂੰ ਗਿਣੋ।- ਅਣਉਚਿਤ ਮੁੱਲਾਂ ਨੂੰ ਫਲੈਗ ਕਰੋ (ਨਕਾਰਾਤਮਕ ਪ੍ਰੀਮੀਅਮ, ਉਮਰ ਦੇ ਅੰਤ, <art fraction, <art 016). ਸ਼ੁਰੂਆਤ/ਅੰਤ ਤੋਂ ਐਕਸਪੋਜਰ (ਸਾਲਾਂ ਵਿੱਚ)। ਨਾ ਮਿਟਾਓ; ਬੱਸ ਇਸਦੀ ਰਿਪੋਰਟ ਕਰੋ ਤਾਂ ਜੋ ਮੈਂ ਫੈਸਲਾ ਕਰ ਸਕਾਂ।
2) ਵਿਸ਼ੇਸ਼ਤਾ ਡੈਰੀਵੇਸ਼ਨ:
ਮੈਂ ਆਪਣੇ ਟ੍ਰੈਫਿਕ ਡੇਟਾ ਤੋਂ ਨਵੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਪ੍ਰਾਪਤ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹਾਂ। ਉਪਲਬਧ: ਉਮਰ, ਵਾਹਨ_ਉਮਰ, ਖੇਤਰ, ਸਾਲਾਨਾ_ਕਿ.ਮੀ., ਵਰਤੋਂ_ਕਿਸਮ।- ਤੁਸੀਂ ਕਿਸ ਉਮਰ ਅਤੇ ਕਿਲੋਮੀਟਰ ਸਮੂਹਾਂ (ਬਿਨਿੰਗ) ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦੇ ਹੋ, ਕਿਉਂ?- ਮੈਂ ਡੇਟਾ ਲੀਕੇਜ ਤੋਂ ਬਿਨਾਂ 'ਖੇਤਰ' ਲਈ ਜੋਖਮ-ਆਧਾਰਿਤ ਕੋਡਿੰਗ ਕਿਵੇਂ ਕਰ ਸਕਦਾ ਹਾਂ?- ਕੋਸ਼ਿਸ਼ ਕਰਨ ਯੋਗ 3 ਨਵੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦਾ ਸੁਝਾਅ ਦਿਓ ਅਤੇ ਹਰੇਕ ਲਈ ਵਾਸਤਵਿਕ ਪ੍ਰਮਾਣਿਕਤਾ ਲਿਖੋ। ਮੈਂ ਫੈਸਲਾ ਕਰਾਂਗਾ।
3) ਲੀਕ ਨਿਰੀਖਣ:
ਮੇਰਾ ਮਾਡਲ ਹੇਠਾਂ ਦਿੱਤੇ ਵੇਰੀਏਬਲਾਂ ਨਾਲ ਨੁਕਸਾਨ ਦੀ ਸੰਭਾਵਨਾ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ: ਉਮਰ, ਖੇਤਰ, ਵਾਹਨ_ਉਮਰ, PAID_CLAIM_FLAG, SETTLEMENT_DAYS। ਇਹਨਾਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਵੇਰੀਏਬਲ ਡਾਟਾ ਲੀਕ ਹੋਣ ਦਾ ਖਤਰਾ ਪੈਦਾ ਕਰਦਾ ਹੈ? ਹਰੇਕ ਲਈ, ਮੁਲਾਂਕਣ ਕਰੋ ਕਿ ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਉਪਲਬਧ ਹੋਵੇਗਾ। ਸ਼ੱਕੀ ਲੋਕਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ ਅਤੇ ਕਿਉਂ।
4) ਐਕਸਪੋਜਰ ਸਧਾਰਣਕਰਨ:
ਮੇਰੀਆਂ ਕੁਝ ਨੀਤੀਆਂ ਸਾਲ ਦੇ ਅੱਧ ਵਿੱਚ ਸ਼ੁਰੂ ਹੁੰਦੀਆਂ ਹਨ। ਬਾਰੰਬਾਰਤਾ ਦੀ ਸਹੀ ਗਣਨਾ ਕਰਨ ਲਈ ਐਕਸਪੋਜ਼ਰ ਸਧਾਰਣਕਰਨ ਦੀ ਵਿਆਖਿਆ ਕਰੋ ਅਤੇ ਕੋਡ ਕਰੋ: ਬਾਰੰਬਾਰਤਾ = ਕੁੱਲ ਦਾਅਵਾ_ਗਿਣਤੀ / ਕੁੱਲ ਐਕਸਪੋਜਰ (ਪਾਲਿਸੀ-ਸਾਲ)। ਇੱਕ ਉਦਾਹਰਨ ਦੇ ਨਾਲ ਦਿਖਾਓ ਕਿ ਸਾਲ ਦੇ ਮੱਧ ਵਿੱਚ ਸ਼ੁਰੂ ਹੋਣ ਵਾਲੀ ਪਾਲਿਸੀ ਦੇ ਐਕਸਪੋਜਰ ਦੀ ਗਣਨਾ ਕਿਵੇਂ ਕਰਨੀ ਹੈ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:
ਡੇਟਾ ਨੂੰ ਸਾਫ਼ ਕਰੋ ਅਤੇ ਇਸਨੂੰ ਮਾਡਲ ਲਈ ਤਿਆਰ ਕਰੋ।
AI ਨਹੀਂ ਜਾਣਦਾ ਕਿ ਕਿਹੜਾ ਕਾਲਮ ਹੈ, ਕਾਰੋਬਾਰੀ ਨਿਯਮ, ਐਕਸਪੋਜ਼ਰ ਪਰਿਭਾਸ਼ਾ; ਇਹ ਅੰਨ੍ਹੇਵਾਹ ਮਿਟਾ ਸਕਦਾ ਹੈ ਅਤੇ ਡੇਟਾ ਨੂੰ ਭਰ ਸਕਦਾ ਹੈ ਅਤੇ ਖਰਾਬ ਕਰ ਸਕਦਾ ਹੈ।
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਅਸਲ ਡਾਟਾ ਤਿਆਰੀ ਸਹਾਇਕ। ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ: ਪਾਲਿਸੀ_ਆਈਡੀ (ਪਛਾਣ), ਸ਼ੁਰੂਆਤ/ਅੰਤ ਦੀ ਮਿਤੀ (ਪਾਲਿਸੀ ਦੀ ਮਿਆਦ), ਉਮਰ (ਸੰਭਾਵਿਤ 16-90), ਪ੍ਰੀਮੀਅਮ (ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ >0), ਦਾਅਵਾ_ਗਿਣਤੀ (>=0), ਦਾਅਵਾ_ਮਾਮੂਟ (>=0)। ਕਾਰਜ:1) ਹਰੇਕ ਕਾਲਮ ਲਈ ਤਰਕਸ਼ੀਲਤਾ ਨਿਯਮ ਲਿਖੋ। ਫਰੈਕਸ਼ਨਲ ਐਕਸਪੋਜ਼ਰ ਦੀ ਗਣਨਾ ਕਰੋ। 3) ਗੁੰਮ 'ਉਮਰ' (ਮਿਟਾਓ) ਲਈ 3 ਵੱਖ-ਵੱਖ ਰਣਨੀਤੀਆਂ। / ਔਸਤ / ਵੱਖਰੀ ਸ਼੍ਰੇਣੀ) ਪਲੱਸ-ਮਾਇਨਸ ਦੇ ਨਾਲ ਮੌਜੂਦ; ਫੈਸਲਾ ਮੇਰੇ 'ਤੇ ਛੱਡ ਦਿਓ। 4) ਚੇਤਾਵਨੀ ਦਿਓ ਜੇਕਰ ਕੋਈ ਕਾਲਮ ਹੈ ਜੋ ਲੀਕ ਹੋਣ ਦਾ ਖਤਰਾ ਪੈਦਾ ਕਰ ਸਕਦਾ ਹੈ। ਕਿਸੇ ਵੀ ਰਿਕਾਰਡ ਨੂੰ ਆਟੋਮੈਟਿਕ ਮਿਟਾਉਣਾ; ਮੈਂ ਹਰ ਫੈਸਲੇ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦੇਵਾਂਗਾ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਐਕਸਪੋਜ਼ਰ ਗਲਤੀ। ਇੱਕ ਪੋਰਟਫੋਲੀਓ ਵਿੱਚ, ਥੋੜ੍ਹੇ ਸਮੇਂ ਦੀਆਂ (3-ਮਹੀਨੇ ਦੀਆਂ) ਯਾਤਰਾ ਨੀਤੀਆਂ ਨੂੰ ਪੂਰੇ ਸਾਲਾਂ ਵਜੋਂ ਗਿਣਿਆ ਗਿਆ ਸੀ, ਇਸਲਈ ਵਾਰਵਾਰਤਾ ਅਸਲ ਵਿੱਚ ਇਸ ਤੋਂ ਚਾਰ ਗੁਣਾ ਘੱਟ ਦਿਖਾਈ ਦਿੱਤੀ; ਕੀਮਤ ਗਲਤ ਢੰਗ ਨਾਲ ਡਿੱਗ ਗਈ. ਜਦੋਂ ਐਕਚੁਅਰੀ ਨੇ ਇੱਕ ਅੰਸ਼ (0.25 ਪਾਲਿਸੀ-ਸਾਲ) ਦੇ ਰੂਪ ਵਿੱਚ ਐਕਸਪੋਜ਼ਰ ਦੀ ਗਣਨਾ ਕੀਤੀ, ਤਾਂ ਅਸਲ ਬਾਰੰਬਾਰਤਾ ਪ੍ਰਗਟ ਕੀਤੀ ਗਈ ਅਤੇ ਟੈਰਿਫ ਨੂੰ ਠੀਕ ਕੀਤਾ ਗਿਆ। AI ਨੇ ਫਰੈਕਸ਼ਨਲ ਐਕਸਪੋਜ਼ਰ ਕੋਡ ਤਿਆਰ ਕੀਤਾ; ਅਦਾਕਾਰ ਨੇ ਪਰਿਭਾਸ਼ਾ ਦਿੱਤੀ।
ਕੇਸ 2 - ਗੁਪਤ ਲੀਕ। ਜਦੋਂ ਇੱਕ ਸਹਾਇਕ ਨੇ "ਫਾਇਲ ਬੰਦ ਹੋਣ ਦਾ ਸਮਾਂ" ਵੇਰੀਏਬਲ ਨੂੰ ਨੁਕਸਾਨ ਦੀ ਸੰਭਾਵਨਾ ਮਾਡਲ ਵਿੱਚ ਜੋੜਿਆ, ਤਾਂ ਸ਼ੁੱਧਤਾ ਵਿੱਚ ਨਾਟਕੀ ਵਾਧਾ ਹੋਇਆ। ਖੁਸ਼ੀ ਥੋੜ੍ਹੇ ਸਮੇਂ ਲਈ ਸੀ: ਇਸ ਵੇਰੀਏਬਲ ਨੂੰ ਨੁਕਸਾਨ ਹੋਣ ਤੋਂ ਬਾਅਦ ਹੀ ਜਾਣਿਆ ਜਾ ਸਕਦਾ ਸੀ, ਭਾਵ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਉਪਲਬਧ ਨਹੀਂ ਸੀ। ਜਦੋਂ ਲੀਕ ਵੇਰੀਏਬਲ ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਗਿਆ ਸੀ, ਤਾਂ ਮਾਡਲ ਇੱਕ ਯਥਾਰਥਵਾਦੀ ਪੱਧਰ ਤੱਕ ਘਟ ਗਿਆ। ਉਸਨੇ ਏਆਈ ਵੇਰੀਏਬਲ ਦੀ ਇੱਕ "ਸ਼ਕਤੀਸ਼ਾਲੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਵਾਲੇ" ਵਜੋਂ ਪ੍ਰਸ਼ੰਸਾ ਕੀਤੀ; ਅਮਲੀ ਦੇ ਨਿਰਣੇ ਨੇ ਜਾਲ ਫੜ ਲਿਆ।
ਕੇਸ 3 - ਪੱਖਪਾਤ ਦੀ ਨਕਲ। ਇੱਕ ਕੰਪਨੀ ਨੇ ਇਤਿਹਾਸਕ ਡੇਟਾ ਤੋਂ ਇੱਕ "ਐਪਲੀਕੇਸ਼ਨ ਅਸਵੀਕਾਰ" ਪੈਟਰਨ ਲਿਆ ਅਤੇ ਇਸਨੂੰ ਨਵੇਂ ਮਾਡਲ ਵਿੱਚ ਪਾ ਦਿੱਤਾ। ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਦਿਖਾਇਆ ਕਿ ਪਿਛਲੀਆਂ ਅਸਵੀਕਾਰੀਆਂ ਨੂੰ ਇੱਕ ਖਾਸ ਇਲਾਕੇ ਵਿੱਚ ਅਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਕੇਂਦ੍ਰਿਤ ਕੀਤਾ ਗਿਆ ਸੀ, ਭਾਵ ਇੱਕ ਇਤਿਹਾਸਕ ਪੱਖਪਾਤ ਸੀ। ਇਸ ਵਿਸ਼ੇਸ਼ਤਾ ਨੂੰ ਮਾਡਲ ਤੋਂ ਹਟਾ ਦਿੱਤਾ ਗਿਆ ਸੀ ਅਤੇ ਹੋਰ ਨਿਰਪੱਖ ਜੋਖਮ ਸੂਚਕਾਂ ਨਾਲ ਬਦਲ ਦਿੱਤਾ ਗਿਆ ਸੀ। AI ਨੇ ਆਂਢ-ਗੁਆਂਢ ਦੇ ਨਾਲ ਪੈਟਰਨ ਦੇ ਓਵਰਲੈਪ ਨੂੰ ਮਾਪਣ ਲਈ ਵਿਸ਼ਲੇਸ਼ਣ ਤਿਆਰ ਕੀਤਾ; ਨੈਤਿਕ ਫੈਸਲਾ ਐਕਟਚੂਰੀ ਅਤੇ ਪਾਲਣਾ ਯੂਨਿਟ ਦੁਆਰਾ ਲਿਆ ਗਿਆ ਸੀ।
ਆਮ ਗਲਤੀਆਂ
- ਬਿਨਾਂ ਸੋਚੇ ਸਮਝੇ ਗੁੰਮ ਹੋਏ ਮੁੱਲਾਂ ਨੂੰ ਮਤਲਬ ਨਾਲ ਭਰਨਾ। ਕਮੀ ਆਪਣੇ ਆਪ ਵਿੱਚ ਗਿਆਨ ਹੋ ਸਕਦੀ ਹੈ; ਇਸ ਨੂੰ ਅੰਨ੍ਹੇਵਾਹ ਭਰਨਾ ਪੱਖਪਾਤ ਪੈਦਾ ਕਰਦਾ ਹੈ।
- ਆਊਟਲੀਅਰਾਂ ਨੂੰ ਆਟੋਮੈਟਿਕਲੀ ਮਿਟਾਓ। ਕੁਝ ਸੱਚੇ ਕਿਨਾਰੇ ਕੇਸ ਹਨ; ਡੇਟਾ ਨੂੰ ਗਲਤੀਆਂ ਤੋਂ ਵੱਖ ਕੀਤੇ ਬਿਨਾਂ ਮਿਟਾਉਣਾ ਜਾਣਕਾਰੀ ਨੂੰ ਨਸ਼ਟ ਕਰਦਾ ਹੈ।
- ਐਕਸਪੋਜਰ ਨੂੰ ਸਧਾਰਣ ਨਹੀਂ ਕਰਨਾ. ਛੋਟੀਆਂ ਨੀਤੀਆਂ ਨੂੰ ਪੂਰੇ ਸਾਲਾਂ ਵਜੋਂ ਗਿਣਨਾ ਬਾਰੰਬਾਰਤਾ ਨੂੰ ਵਿਗਾੜਦਾ ਹੈ ਅਤੇ ਕੀਮਤ ਨੂੰ ਵਿਗਾੜਦਾ ਹੈ।
- ਡਾਟਾ ਲੀਕ ਹੋਣ 'ਤੇ ਧਿਆਨ ਨਹੀਂ ਦੇਣਾ। ਬਹੁਤ ਵਧੀਆ ਨਤੀਜਾ ਅਕਸਰ ਭਵਿੱਖ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨ ਵਾਲੇ ਵੇਰੀਏਬਲ ਦਾ ਸੰਕੇਤ ਹੁੰਦਾ ਹੈ; ਪੁੱਛੋ ਕਿ ਕੀ ਹਰੇਕ ਵੇਰੀਏਬਲ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੌਜੂਦ ਹੈ।
- ਭਵਿੱਖ ਵਿੱਚ ਅਪ੍ਰਤੱਖ ਪੱਖਪਾਤ ਲਿਆਉਣਾ। ਇਤਿਹਾਸਕ ਡੇਟਾ ਵਿੱਚ ਬੇਇਨਸਾਫ਼ੀ ਉਤਪੰਨ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਵਿੱਚ ਲੀਕ ਹੋ ਸਕਦੀ ਹੈ; ਵਿਸ਼ੇਸ਼ਤਾ ਪੜਾਅ 'ਤੇ ਇਸ ਦੀ ਜਾਂਚ ਕਰੋ।
ਸੰਖੇਪ ਵਿੱਚ
ਅਸਲ ਮਾਡਲਿੰਗ ਜ਼ਿਆਦਾਤਰ ਡੇਟਾ ਤਿਆਰ ਕਰਨ ਬਾਰੇ ਹੈ; ਜੇਕਰ ਇਨਪੁਟ ਖਰਾਬ ਹੈ, ਤਾਂ ਆਉਟਪੁੱਟ ਵੀ ਨਿਕਾਰਾ ਹੈ। ਖਾਸ ਸਮੱਸਿਆਵਾਂ ਮੁੱਲਾਂ, ਆਊਟਲੀਅਰਾਂ, ਅਸੰਗਤਤਾਵਾਂ, ਅਤੇ ਨਕਲਾਂ ਦੀ ਗੁੰਮਸ਼ੁਦਗੀ ਹਨ; ਨਾਜ਼ੁਕ ਅਸਲ ਮੁੱਦਾ ਐਕਸਪੋਜ਼ਰ ਸਧਾਰਣਕਰਨ ਹੈ। ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ — ਗਰੁੱਪਿੰਗ, ਕੋਡਿੰਗ, ਸਧਾਰਣਕਰਨ — ਡਾਟਾ ਤੋਂ ਮਜ਼ਬੂਤ ਸਿਗਨਲ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। ਸਭ ਤੋਂ ਵੱਧ ਧੋਖੇਬਾਜ਼ ਖ਼ਤਰੇ ਡੇਟਾ ਲੀਕੇਜ ਅਤੇ ਅਪ੍ਰਤੱਖ ਪੱਖਪਾਤ ਹਨ; ਦੋਵੇਂ ਕੇਵਲ ਵਾਸਤਵਿਕ ਤਰਕ ਦੁਆਰਾ ਫੜੇ ਗਏ ਹਨ। AI ਇਸ ਕਦਮ ਨੂੰ ਬਹੁਤ ਤੇਜ਼ ਕਰਦਾ ਹੈ: ਸਕੈਨਿੰਗ ਕੋਡ ਅਤੇ ਸਿਫ਼ਾਰਸ਼ਾਂ ਤਿਆਰ ਕਰਦੀ ਹੈ। ਪਰ ਕਿਸੇ ਵੀ ਰਿਕਾਰਡ ਨੂੰ ਆਪਣੇ ਆਪ ਨਾ ਮਿਟਾਓ, ਮਨੁੱਖਾਂ ਨੂੰ ਲੀਕ ਅਤੇ ਪੱਖਪਾਤ ਦੀ ਜਾਂਚ ਕਰਨ ਦਿਓ, ਅਤੇ ਹਰੇਕ ਪਰਿਵਰਤਨ ਨੂੰ ਮਨਜ਼ੂਰੀ ਦਿਓ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਇੱਕ ਛੋਟਾ ਅਗਿਆਤ ਨੀਤੀ ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਤਿਆਰ ਕਰੋ (5-7 ਕਾਲਮ, ਹਰੇਕ ਦੀ ਵਾਜਬ ਰੇਂਜ)। AI ਤੋਂ (a) ਹਰੇਕ ਕਾਲਮ ਲਈ ਤਰਕਸ਼ੀਲਤਾ ਨਿਯਮ ਅਤੇ ਉਲੰਘਣਾ ਰਿਪੋਰਟ ਕੋਡ, (b) ਫ੍ਰੈਕਸ਼ਨਲ ਐਕਸਪੋਜ਼ਰ ਗਣਨਾ, (c) ਕੋਸ਼ਿਸ਼ ਕਰਨ ਲਈ 3 ਨਵੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਲਈ ਸੁਝਾਵਾਂ ਲਈ ਪੁੱਛੋ। ਫਿਰ ਸੂਚੀ ਵਿੱਚ ਇੱਕ ਜਾਣਬੁੱਝ ਕੇ "ਲੀਕ ਟਰੈਪ" ਵੇਰੀਏਬਲ ਸ਼ਾਮਲ ਕਰੋ (ਜਿਵੇਂ ਕਿ "ਮੁਆਵਜ਼ੇ ਦਾ ਭੁਗਤਾਨ") ਅਤੇ ਜਾਂਚ ਕਰੋ ਕਿ ਕੀ AI ਇਸਨੂੰ ਲੀਕ ਵਜੋਂ ਫੜਦਾ ਹੈ।
ਚੈੱਕਲਿਸਟ
- [ ] ਕੀ ਮੈਂ ਵਿਸ਼ਲੇਸ਼ਣ ਕੀਤਾ ਹੈ ਕਿ ਗੁੰਮ ਅਤੇ ਆਊਟਲੀਅਰ ਨੂੰ ਮਿਟਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਕਿਉਂ?
- [ ] ਕੀ ਮੈਂ ਐਕਸਪੋਜਰ ਨੂੰ ਸਹੀ ਢੰਗ ਨਾਲ ਵੰਡਿਆ ਅਤੇ ਸਧਾਰਣ ਕੀਤਾ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਹਰੇਕ ਨਵੀਂ ਪ੍ਰਾਪਤ ਕੀਤੀ ਵਿਸ਼ੇਸ਼ਤਾ ਲਈ ਵਾਸਤਵਿਕ ਜਾਇਜ਼ਤਾ ਲਿਖੀ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਸਵਾਲ ਕੀਤਾ ਹੈ ਕਿ ਕੀ ਹਰੇਕ ਵੇਰੀਏਬਲ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਅਸਲ ਵਿੱਚ ਮੌਜੂਦ ਹੈ (ਲੀਕੇਜ)?
- [ ] ਕੀ ਮੈਂ ਉਤਪੰਨ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਵਿੱਚ ਅਪ੍ਰਤੱਖ ਪੱਖਪਾਤ ਲਈ ਸਕੈਨ ਕੀਤਾ ਹੈ?
- [ ] ਕੀ ਮੇਰੇ ਕੋਲ AI ਨੇ ਆਪਣੇ ਆਪ ਕੋਈ ਰਿਕਾਰਡ ਨਹੀਂ ਮਿਟਾਇਆ ਅਤੇ ਹਰ ਫੈਸਲੇ ਨੂੰ ਖੁਦ ਮਨਜ਼ੂਰੀ ਦਿੱਤੀ?