ਲਾਭ:
- ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਕਿਸਮਾਂ (MCAR/MAR/MNAR), ਆਊਟਲੀਅਰ, ਅਤੇ ਕੋਡਿੰਗ ਗਲਤੀਆਂ ਦੀ ਪਛਾਣ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਕਲੀਨਅਪ ਕੋਡ ਅਤੇ ਡਾਇਗਨੌਸਟਿਕਸ ਤਿਆਰ ਕਰਨ ਲਈ ਸਹੀ ਡੇਟਾ ਦੇ ਨਾਲ AI ਦੀ ਵਰਤੋਂ ਕਰੋ
- ਇਹ ਦੇਖਣ ਦੀ ਯੋਗਤਾ ਕਿ ਕਿਵੇਂ ਨਕਲੀ ਬੁੱਧੀ ਦੁਆਰਾ ਸੁਝਾਏ ਗਏ ਹਰੇਕ ਸਫਾਈ ਕਦਮ (ਮਿਟਾਉਣਾ, ਅਸਾਈਨਮੈਂਟ, ਪਰਿਵਰਤਨ) ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਨਤੀਜੇ ਨੂੰ ਪ੍ਰਭਾਵਤ ਕਰੇਗਾ ਅਤੇ ਇੱਕ ਉਲਟਾ ਅਤੇ ਦਸਤਾਵੇਜ਼ੀ ਵਰਕਫਲੋ ਸਥਾਪਤ ਕਰੇਗਾ
- ਇਹ ਬਣਾਈ ਰੱਖਣਾ ਕਿ ਸਫਾਈ ਦੇ ਫੈਸਲੇ ਉਸ ਪ੍ਰਕਿਰਿਆ ਦੇ ਗਿਆਨ 'ਤੇ ਅਧਾਰਤ ਹੁੰਦੇ ਹਨ ਜੋ ਡੇਟਾ ਤਿਆਰ ਕਰਦੀ ਹੈ, ਅਤੇ ਇਹ ਕਿ ਨਕਲੀ ਬੁੱਧੀ ਇੱਕ ਨਿਰੀਖਣ ਸਹਾਇਕ ਹੈ, ਨਾ ਕਿ ਇੱਕ ਅੰਨ੍ਹੇ ਆਟੋਮੇਟਨ
ਹਰ ਤਜਰਬੇਕਾਰ ਵਿਸ਼ਲੇਸ਼ਕ ਇੱਕ ਸੱਚਾਈ ਜਾਣਦਾ ਹੈ: ਇੱਕ ਅਨੁਭਵੀ ਪ੍ਰੋਜੈਕਟ ਦਾ ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ ਮਾਡਲਿੰਗ ਨਹੀਂ ਹੁੰਦਾ ਹੈ, ਪਰ ਡੇਟਾ ਦੀ ਸਫਾਈ (ਡਾਟਾ ਵਿੱਚ ਗਲਤੀਆਂ, ਭੁੱਲਾਂ ਅਤੇ ਅਸੰਗਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰਨ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਤਿਆਰ ਕਰਨ ਦਾ ਕੰਮ)। ਅੰਗੂਠੇ ਦੇ ਇੱਕ ਮੋਟੇ ਨਿਯਮ ਦੇ ਰੂਪ ਵਿੱਚ, ਲਗਭਗ 70-80% ਸਮਾਂ ਡੇਟਾ ਨੂੰ ਸਮਝਣ, ਸਾਫ਼ ਕਰਨ ਅਤੇ ਬਦਲਣ ਵਿੱਚ ਜਾਂਦਾ ਹੈ; ਅਸਲ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਸਿਰਫ 20-30% ਬਚਿਆ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਕਦਮ-ਦਰ-ਕਦਮ ਦੇਖਾਂਗੇ ਕਿ ਕਿਵੇਂ ਨਕਲੀ ਬੁੱਧੀ (AI) ਇਸ ਭਾਰੀ ਬੋਝ ਨੂੰ ਘੱਟ ਕਰਦੀ ਹੈ, ਪਰ ਕਿਹੜੇ ਫੈਸਲੇ ਅਜੇ ਵੀ ਤੁਹਾਡੇ ਕੋਲ ਰਹਿਣੇ ਚਾਹੀਦੇ ਹਨ ਅਤੇ ਕਿਉਂ।
ਆਉ ਪਹਿਲਾਂ ਦੋ ਬੁਨਿਆਦੀ ਤੱਥਾਂ ਨੂੰ ਰੱਖਦੇ ਹਾਂ। ਸਭ ਤੋਂ ਪਹਿਲਾਂ, ਸਫਾਈ ਦੇ ਫੈਸਲੇ ਤੁਹਾਡੇ ਡੇਟਾ ਪੈਦਾ ਕਰਨ ਵਾਲੀ ਪ੍ਰਕਿਰਿਆ ਦੇ ਗਿਆਨ 'ਤੇ ਅਧਾਰਤ ਹੁੰਦੇ ਹਨ: ਸਿਰਫ਼ ਤੁਸੀਂ ਜਾਣਦੇ ਹੋ ਕਿ ਮੁੱਲ ਕਿਉਂ ਗੁੰਮ ਹੈ, ਇੱਕ ਨੰਬਰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਕਿਉਂ ਹੈ। AI ਡਾਟਾ ਨਹੀਂ ਦੇਖਦਾ, ਸੰਦਰਭ ਨਹੀਂ ਜਾਣਦਾ; ਕੋਡ ਲਿਖਦਾ ਹੈ, ਫੈਸਲੇ ਨਹੀਂ ਕਰਦਾ। ਦੂਜਾ, ਹਰੇਕ ਸਫਾਈ ਕਦਮ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਨਤੀਜੇ ਨੂੰ ਬਦਲ ਸਕਦਾ ਹੈ. ਆਊਟਲੀਅਰ ਨੂੰ ਮਿਟਾਉਣਾ ਗੁਣਾਂਕ ਨੂੰ ਉਲਟਾ ਸਕਦਾ ਹੈ; ਗੁੰਮ ਨੂੰ ਮੱਧਮਾਨ ਨਾਲ ਭਰਨਾ ਨਕਲੀ ਤੌਰ 'ਤੇ ਵਿਭਿੰਨਤਾ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ। ਇਸ ਲਈ ਸਫ਼ਾਈ ਨੂੰ ਉਲਟਾਉਣ ਯੋਗ ਅਤੇ ਦਸਤਾਵੇਜ਼ੀ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ: ਕਦੇ ਵੀ ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਨਾ ਛੂਹੋ, ਹਰ ਕਦਮ ਕੋਡ ਵਿੱਚ ਕਰੋ, ਹਰੇਕ ਕਦਮ ਦੇ ਪ੍ਰਭਾਵ ਨੂੰ ਰਿਕਾਰਡ ਕਰੋ।
ਕਦਮ-ਦਰ-ਕਦਮ ਸਫਾਈ ਵਰਕਫਲੋ
1. ਡਾਟਾ ਜਾਣੋ। ਪਹਿਲਾਂ ਬਣਤਰ ਵੇਖੋ: ਕਤਾਰਾਂ ਦੀ ਸੰਖਿਆ (ਨਿਰੀਖਣ) ਅਤੇ ਕਾਲਮ (ਵੇਰੀਏਬਲ), ਹਰੇਕ ਵੇਰੀਏਬਲ ਦੀ ਕਿਸਮ (ਸੰਖਿਆਤਮਕ, ਸ਼੍ਰੇਣੀਬੱਧ, ਮਿਤੀ), ਸੰਖੇਪ ਅੰਕੜੇ, ਗੁੰਮ ਦੀ ਸੰਖਿਆ। ਤੁਸੀਂ ਇਸ "ਡੇਟਾ ਪ੍ਰੋਫਾਈਲ" ਕੋਡ ਲਈ AI ਨੂੰ ਪੁੱਛ ਸਕਦੇ ਹੋ; ਪਰ ਤੁਸੀਂ ਆਉਟਪੁੱਟ ਪੜ੍ਹਦੇ ਹੋ ਅਤੇ ਪ੍ਰਸ਼ਨ ਪੁੱਛਦੇ ਹੋ ਜਿਵੇਂ "ਇਹ ਵੇਰੀਏਬਲ ਟੈਕਸਟ ਦੇ ਰੂਪ ਵਿੱਚ ਕਿਉਂ ਆਇਆ?"
2. ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਨੂੰ ਸਮਝੋ ਅਤੇ ਸ਼੍ਰੇਣੀਬੱਧ ਕਰੋ। ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਨੂੰ ਤਿੰਨ ਕਿਸਮਾਂ ਵਿੱਚ ਵੰਡਿਆ ਗਿਆ ਹੈ। MCAR (ਰੈਂਡਮ ਵਿੱਚ ਪੂਰੀ ਤਰ੍ਹਾਂ ਗੁੰਮ ਹੋਣਾ): ਗੁੰਮ ਹੋਣਾ ਕਿਸੇ ਵੀ ਚੀਜ਼ ਦੇ ਕਾਰਨ ਨਹੀਂ ਹੈ, ਉਦਾਹਰਨ ਲਈ ਇੱਕ ਸੈਂਸਰ ਬੇਤਰਤੀਬੇ ਫੇਲ੍ਹ ਹੋ ਗਿਆ ਹੈ। MAR (ਮਿਸਿੰਗ ਐਟ ਰੈਂਡਮ): ਗੁੰਮ ਹੋਣਾ ਹੋਰ ਨਿਰੀਖਣ ਕੀਤੇ ਵੇਰੀਏਬਲਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ, ਉਦਾਹਰਨ ਲਈ ਵੱਡੀ ਉਮਰ ਦੇ ਲੋਕ ਇੱਕ ਸਵਾਲ ਨੂੰ ਅਕਸਰ ਖਾਲੀ ਛੱਡ ਦਿੰਦੇ ਹਨ, ਪਰ ਤੁਸੀਂ ਉਮਰ ਜਾਣਦੇ ਹੋ। MNAR (ਰੈਂਡਮ 'ਤੇ ਗੁੰਮ ਨਹੀਂ): ਲਾਪਤਾ ਹੋਣਾ ਆਪਣੇ ਆਪ 'ਤੇ ਨਿਰੀਖਣ ਕੀਤੇ ਮੁੱਲ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ, ਉਦਾਹਰਨ ਲਈ ਉੱਚ ਕਮਾਈ ਕਰਨ ਵਾਲੇ ਆਪਣੀ ਆਮਦਨ ਦੀ ਰਿਪੋਰਟ ਨਹੀਂ ਕਰਦੇ ਹਨ। ਇਹ ਅੰਤਰ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਹੱਲ ਵਿਧੀ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ ਅਤੇ AI ਤੁਹਾਡੇ ਲਈ ਇਸਦਾ ਫੈਸਲਾ ਨਹੀਂ ਕਰ ਸਕਦਾ ਹੈ।
3. ਕਮੀ ਨਾਲ ਨਜਿੱਠੋ। ਵਿਕਲਪ: ਸੂਚੀ ਅਨੁਸਾਰ ਮਿਟਾਉਣਾ, ਮੱਧਮਾਨ/ਵਿਚਕਾਰ ਦੋਸ਼, ਮਾਡਲ-ਅਧਾਰਿਤ ਮਲਟੀਪਲ ਇਮਪਿਊਟੇਸ਼ਨ। MCAR ਵਿੱਚ ਮਿਟਾਉਣਾ ਮੁਕਾਬਲਤਨ ਸੁਰੱਖਿਅਤ ਹੈ ਪਰ ਨਮੂਨੇ ਦਾ ਆਕਾਰ ਘਟਾਉਂਦਾ ਹੈ। MAR ਵਿੱਚ ਮਲਟੀਪਲ ਅਸਾਈਨਮੈਂਟ ਵਧੇਰੇ ਉਚਿਤ ਹੈ। ਕੋਈ ਸਧਾਰਨ ਤਰੀਕਾ MNAR ਵਿੱਚ ਨਿਰਪੱਖਤਾ ਦੀ ਗਰੰਟੀ ਨਹੀਂ ਦਿੰਦਾ; ਕਮੀ ਦੀ ਵਿਧੀ ਨੂੰ ਮਾਡਲ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਜਾਂ ਘੱਟੋ ਘੱਟ ਇੱਕ ਸੰਵੇਦਨਸ਼ੀਲਤਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ. ਮਤਲਬ ਭਰਨਾ ਆਸਾਨ ਪਰ ਖ਼ਤਰਨਾਕ ਹੈ: ਇਹ ਵਿਭਿੰਨਤਾ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਰਿਸ਼ਤਿਆਂ ਨੂੰ ਕਮਜ਼ੋਰ ਕਰਦਾ ਹੈ, ਅਤੇ ਅਨਿਸ਼ਚਿਤਤਾ ਨੂੰ ਛੁਪਾਉਂਦਾ ਹੈ।
4. ਬਾਹਰਲੇ ਲੋਕਾਂ ਦੀ ਜਾਂਚ ਕਰੋ। ਇੱਕ ਆਊਟਲੀਅਰ ਇੱਕ ਨਿਰੀਖਣ ਹੁੰਦਾ ਹੈ ਜੋ ਦੂਜਿਆਂ ਤੋਂ ਬਹੁਤ ਦੂਰ ਖੜ੍ਹਾ ਹੁੰਦਾ ਹੈ। ਦੋ ਸਵਾਲਾਂ ਨੂੰ ਵੱਖ ਕਰੋ: ਕੀ ਇਹ ਇੱਕ ਗਲਤੀ ਹੈ (ਡਾਟਾ ਐਂਟਰੀ ਵਿੱਚ ਉਮਰ 999 ਲਿਖੀ ਗਈ ਸੀ) ਜਾਂ ਕੀ ਇਹ ਇੱਕ ਅਸਲੀ ਪਰ ਬਾਹਰੀ ਮੁੱਲ ਹੈ (ਇੱਕ ਅਰਬਪਤੀ ਦੀ ਆਮਦਨ)? ਬੱਗ ਠੀਕ ਕਰੋ; ਸਹੀ ਆਊਟਲੀਅਰਾਂ ਨੂੰ ਨਾ ਮਿਟਾਓ ਕਿਉਂਕਿ ਉਹ ਡੇਟਾ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ। ਆਊਟਲੀਅਰ ਨੂੰ ਮਿਟਾਉਣਾ "ਕਿਉਂਕਿ ਇਹ ਪਰੇਸ਼ਾਨ ਕਰਦਾ ਹੈ" ਤੁਸੀਂ ਨਤੀਜੇ ਵੱਲ ਡੇਟਾ ਨੂੰ ਘਟਾ ਰਹੇ ਹੋ।
5. ਕੋਡਿੰਗ ਅਤੇ ਇਕਸਾਰਤਾ। ਸ਼੍ਰੇਣੀਆਂ ਨੂੰ ਮਾਨਕੀਕਰਨ ਕਰੋ ("ਪੁਰਸ਼", "ਪੁਰਸ਼", "ਈ" ਸਾਰੇ ਇੱਕ ਕੋਡ ਵਿੱਚ), ਤਾਰੀਖਾਂ ਨੂੰ ਇੱਕ ਫਾਰਮੈਟ ਵਿੱਚ ਲਿਆਓ, ਇਕਾਈਆਂ ਨੂੰ ਇੱਕ ਪੈਮਾਨੇ ਵਿੱਚ, ਡੁਪਲੀਕੇਟ ਕਤਾਰਾਂ ਦਾ ਪਤਾ ਲਗਾਓ। ਇਹ ਸਭ ਤੋਂ ਘੱਟ ਜੋਖਮ ਵਾਲਾ ਪੜਾਅ ਹੈ ਜਿੱਥੇ AI ਸਭ ਤੋਂ ਵਧੀਆ ਮਦਦ ਕਰਦਾ ਹੈ।
6. ਦਸਤਾਵੇਜ਼ ਅਤੇ ਫ੍ਰੀਜ਼. ਕੱਚੇ ਅਤੇ ਸਾਫ਼ ਕੀਤੇ ਡੇਟਾ ਨੂੰ ਵੱਖ ਰੱਖਦੇ ਹੋਏ, ਕੋਡ ਅਤੇ ਟਿੱਪਣੀ ਲਾਈਨ ਦੇ ਨਾਲ ਹਰੇਕ ਕਦਮ ਨੂੰ ਰਿਕਾਰਡ ਕਰੋ। ਇਸ ਲਈ ਜਦੋਂ ਇੱਕ ਰੈਫਰੀ ਪੁੱਛਦਾ ਹੈ "ਇਹ ਨਿਰੀਖਣ ਕਿਉਂ ਛੱਡੇ ਗਏ?" ਤੁਹਾਡੇ ਕੋਲ ਆਪਣਾ ਜਵਾਬ ਤਿਆਰ ਹੈ।
ਸਾਵਧਾਨ: ਨਤੀਜਿਆਂ ਦੇ ਆਧਾਰ 'ਤੇ ਸਫਾਈ ਦੇ ਫੈਸਲੇ ਨਾ ਕਰੋ। "ਜਦੋਂ ਤੁਸੀਂ ਇਸ ਲਾਈਨ ਨੂੰ ਮਿਟਾਉਂਦੇ ਹੋ, ਤਾਂ ਗੁਣਾਂਕ ਮਹੱਤਵਪੂਰਨ ਹੋ ਜਾਂਦਾ ਹੈ" ਕਹਿਣ ਵਾਲੀ ਇੱਕ ਲਾਈਨ ਨੂੰ ਮਿਟਾਉਣਾ ਪੀ-ਹੈਕਿੰਗ ਦਾ ਸਭ ਤੋਂ ਘਿਨਾਉਣਾ ਰੂਪ ਹੈ, ਜੋ ਅਸੀਂ ਅਗਲੀ ਇਕਾਈ ਵਿੱਚ ਦੇਖਾਂਗੇ।
ਤੁਲਨਾ ਸਾਰਣੀ: ਗੁੰਮ ਡੇਟਾ ਵਿਧੀਆਂ
ਵਿਧੀ
ਇਹ ਕਦੋਂ ਢੁਕਵਾਂ ਹੈ?
ਖਤਰਾ
ਏਆਈ ਦੀ ਭੂਮਿਕਾ
ਇੱਕ ਕਤਾਰ ਮਿਟਾਓ
MCAR, ਘੱਟ ਗੁੰਮ ਦਰ
ਨਮੂਨਾ ਛੋਟਾ ਹੋ ਜਾਂਦਾ ਹੈ, MAR/MNAR ਵਿੱਚ ਪੱਖਪਾਤ
ਕੋਡ ਲਿਖਦਾ ਹੈ; ਤੁਸੀਂ ਫੈਸਲਾ ਕਰੋ
ਔਸਤ/ਵਿਚਕਾਰ ਅਸਾਈਨਮੈਂਟ
ਤੇਜ਼ ਸ਼ੁਰੂਆਤੀ ਵਿਸ਼ਲੇਸ਼ਣ
ਵਖਰੇਵਾਂ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਰਿਸ਼ਤੇ ਨੂੰ ਛੁਪਾਉਂਦਾ ਹੈ
ਇਹ ਆਸਾਨ ਹੈ ਪਰ ਇਸਦੀ ਸਿਫ਼ਾਰਸ਼ ਨਹੀਂ ਕਰਦਾ; ਨੂੰ ਚੇਤਾਵਨੀ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ
ਮਲਟੀਪਲ ਅਸਾਈਨਮੈਂਟ (MI)
MAR, ਮਹੱਤਵਪੂਰਨ ਵੇਰੀਏਬਲ
ਜੇਕਰ ਸਹੀ ਢੰਗ ਨਾਲ ਸਥਾਪਿਤ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਤਾਂ ਇਹ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋਵੇਗਾ
ਕੋਡ ਅਤੇ ਪੈਕੇਜ (ਚੂਹੇ) ਦੀ ਸਿਫ਼ਾਰਿਸ਼ ਕਰਦਾ ਹੈ
ਮਕੈਨਿਜ਼ਮ ਮਾਡਲਿੰਗ
MNAR
ਗੁੰਝਲਦਾਰ, ਧਾਰਣਾ-ਗੁੰਝਲਦਾਰ
ਸਿਰਫ਼ ਡਰਾਫਟ; ਮਾਹਰ ਦੀ ਲੋੜ ਹੈ
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਪ੍ਰੋਂਪਟ
1. ਡੇਟਾ ਪ੍ਰੋਫਾਈਲਿੰਗ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਡਾਟਾ ਕਲੀਨਿੰਗ ਸਹਾਇਕ। ਮੈਂ ਡਾਟਾ ਸਾਂਝਾ ਨਹੀਂ ਕਰਦਾ, ਮੈਨੂੰ ਆਰ ਕੋਡ ਚਾਹੀਦਾ ਹੈ। ਮੇਰੇ ਕੋਲ ਇੱਕ ਡੇਟਾ ਫਰੇਮ ਹੈ ਜਿਸਨੂੰ 'ਅੰਕ' ਕਿਹਾ ਜਾਂਦਾ ਹੈ; ਵੇਰੀਏਬਲ: id, ਉਮਰ (ਸੰਖਿਆਤਮਕ), ਆਮਦਨ (ਸੰਖਿਆਤਮਕ), ਸਿੱਖਿਆ (ਸ਼੍ਰੇਣੀ), ਖੇਤਰ (ਸ਼੍ਰੇਣੀ), ਮਿਤੀ (ਤਾਰੀਖ)। ਕਾਰਜ: ਕੋਡ ਲਿਖੋ ਜੋ ਹਰੇਕ ਵੇਰੀਏਬਲ ਲਈ ਕਿਸਮ, ਗੁੰਮ ਸੰਖਿਆ ਅਤੇ ਦਰ, ਸੰਖਿਆਤਮਕ ਲੋਕਾਂ ਲਈ ਸੰਖੇਪ ਅੰਕੜੇ, ਅਤੇ ਸ਼੍ਰੇਣੀਬੱਧ ਲੋਕਾਂ ਲਈ ਬਾਰੰਬਾਰਤਾ ਸਾਰਣੀ ਬਣਾਉਂਦਾ ਹੈ। ਟਿੱਪਣੀ ਲਾਈਨ ਸ਼ਾਮਲ ਕਰੋ.
2. ਗੁੰਮ ਡੇਟਾ ਨਿਦਾਨ:
ਕੋਡ ਲਿਖੋ ਜੋ ਉੱਪਰ ਦਿੱਤੇ 'ਅੰਕ' ਡੇਟਾ ਲਈ ਗੁੰਮ ਹੋਏ ਪੈਟਰਨ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ: - ਹਰੇਕ ਵੇਰੀਏਬਲ ਦੀ ਗੁੰਮ ਦਰ, - ਇੱਕ ਸਧਾਰਨ ਸਾਰਣੀ/ਗ੍ਰਾਫ ਜੋ ਹੋਰ ਵੇਰੀਏਬਲਾਂ ਨਾਲ ਗੁੰਮ ਹੋਣ ਦੇ ਸਬੰਧ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਮੈਂ ਕੋਡ ਦੇ ਆਉਟਪੁੱਟ ਨੂੰ ਦੇਖਾਂਗਾ ਅਤੇ MCAR/MAR/MNAR ਨੂੰ ਅੰਤਰ ਬਣਾਵਾਂਗਾ; ਤੁਸੀਂ ਸਿਰਫ਼ ਡਾਇਗਨੌਸਟਿਕ ਟੂਲ ਤਿਆਰ ਕਰਦੇ ਹੋ, ਅਸਾਈਨਮੈਂਟ ਵਿਧੀ 'ਤੇ ਫੈਸਲਾ ਨਾ ਕਰੋ।
3. ਬਾਹਰੀ ਨਿਰੀਖਣ (ਮਿਟਾਉਣਾ ਨਹੀਂ):
ਵੇਰੀਏਬਲ 'ਆਮਦਨੀ' ਲਈ ਕੋਡ ਲਿਖੋ ਜੋ ਮਿਟਾਏ ਬਿਨਾਂ ਆਊਟਲੀਅਰਾਂ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ: ਬਾਕਸਪਲਾਟ, ਆਈਕਿਊਆਰ-ਆਧਾਰਿਤ ਸੀਮਾਵਾਂ, ਅਤੇ ਸਾਰਣੀ ਸੂਚੀ ਆਊਟਲੀਅਰ ਨਿਰੀਖਣ + ਮੁੱਲ। ਮੈਂ ਦੇਖਾਂਗਾ ਕਿ ਇਹ ਗਲਤੀਆਂ ਹਨ ਜਾਂ ਅਸਲੀ। ਆਟੋਮੈਟਿਕ ਮਿਟਾਉਣਾ ਸ਼ਾਮਲ ਕਰੋ।
4. ਕੋਡਿੰਗ ਮਾਨਕੀਕਰਨ:
'ਸਿੱਖਿਆ' ਵੇਰੀਏਬਲ ਵਿੱਚ, ਮੁੱਲਾਂ ਨੂੰ ਮਿਸ਼ਰਤ ਲਿਖਿਆ ਜਾਂਦਾ ਹੈ: "ਪ੍ਰਾਇਮਰੀ ਸਕੂਲ","ਪ੍ਰਾਇਮਰੀ ਸਕੂਲ","ਪ੍ਰਾਇਮਰੀ","ਹਾਈ ਸਕੂਲ","ਹਾਈ ਸਕੂਲ","ਯੂਨੀਵਰਸਿਟੀ","ਯੂਨੀਵ"। R ਕੋਡ ਲਿਖੋ ਜੋ ਇਹਨਾਂ ਨੂੰ ਇਕਸਾਰ ਸ਼੍ਰੇਣੀਆਂ ਵਿੱਚ ਰੀਕੋਡ ਕਰਦਾ ਹੈ; ਮੈਪਿੰਗ ਸਾਰਣੀ ਨੂੰ ਸਪਸ਼ਟ ਰੂਪ ਵਿੱਚ ਦਿਖਾਓ ਤਾਂ ਜੋ ਮੈਂ ਹਰੇਕ ਰੂਪਾਂਤਰਣ ਦੀ ਪੁਸ਼ਟੀ ਕਰ ਸਕਾਂ। ਉਹ ਮੁੱਲ ਸੈੱਟ ਕਰੋ ਜਿਸਨੂੰ ਤੁਸੀਂ "ਅਣਜਾਣ" ਵਿੱਚ ਨਹੀਂ ਪਛਾਣਦੇ.
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:
ਡੇਟਾ ਨੂੰ ਸਾਫ਼ ਕਰੋ, ਪਾੜੇ ਨੂੰ ਭਰੋ, ਆਊਟਲੀਅਰਾਂ ਨੂੰ ਰੱਦ ਕਰੋ।
ਇਹ ਮੰਗ ਖ਼ਤਰਨਾਕ ਹੈ: ਇਹ AI ਨੂੰ ਅੰਨ੍ਹੇ ਅਧਿਕਾਰ ਦਿੰਦੀ ਹੈ। ਕਿਸ ਕਿਸਮ ਦੀ ਗੁੰਮ, ਕਿਸ ਤਰ੍ਹਾਂ ਦੀ ਭਰਾਈ, ਕਿਹੜੀ ਵਿਰੋਧੀ ਸੱਚਾਈ - ਇਸ ਵਿੱਚੋਂ ਕੁਝ ਵੀ ਸਪਸ਼ਟ ਨਹੀਂ ਹੈ। ਨਤੀਜਾ ਇੱਕ ਗੁਪਤ ਪੱਖਪਾਤੀ ਡੇਟਾ ਸੈੱਟ ਹੋ ਸਕਦਾ ਹੈ।
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਸਫਾਈ ਸਹਾਇਕ, ਤੁਸੀਂ ਫੈਸਲਾ ਲੈਣ ਵਾਲੇ ਨਹੀਂ ਹੋ। ਕਦਮ-ਦਰ-ਕਦਮ ਜਾਓ ਅਤੇ ਕੋਡ ਲਿਖੋ ਜੋ ਹਰੇਕ ਪੜਾਅ ਦੇ ਪ੍ਰਭਾਵ ਦੀ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ: 1) ਗੁੰਮ ਪੈਟਰਨ ਦਿਖਾਓ (ਮਿਟਾਓ/ਫਿਲ ਨਾ ਕਰੋ), 2) ਬਾਹਰਲੇ ਉਮੀਦਵਾਰਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ (ਮਿਟਾਓ ਨਾ), 3) ਮੈਪਿੰਗ ਸਾਰਣੀ ਨਾਲ ਸ਼੍ਰੇਣੀ ਦੀਆਂ ਅਸੰਗਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰੋ। ਹਰ ਪੜਾਅ ਤੋਂ ਬਾਅਦ ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ ਅਤੇ ਸੰਖੇਪ ਅੰਕੜੇ ਛਾਪੋ ਤਾਂ ਜੋ ਮੈਂ ਤਬਦੀਲੀ ਨੂੰ ਦੇਖ ਸਕਾਂ ਅਤੇ ਪੁਸ਼ਟੀ ਕਰ ਸਕਾਂ। ਆਟੋਮੈਟਿਕ ਅਸਾਈਨਮੈਂਟ/ਮਿਟਾਉਣਾ ਸੰਮਿਲਨ।
ਫਰਕ ਸਪੱਸ਼ਟ ਹੈ: ਮਜ਼ਬੂਤ ਇੱਛਾ ਸ਼ਕਤੀ AI ਨੂੰ ਇੱਕ ਨਿਰੀਖਣ ਸਹਾਇਕ ਦੇ ਤੌਰ 'ਤੇ ਰੱਖਦੀ ਹੈ, ਉਲਟਾ ਅਤੇ ਦਸਤਾਵੇਜ਼ੀ ਕਦਮਾਂ ਦਾ ਉਤਪਾਦਨ ਕਰਦੀ ਹੈ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 — ਔਸਤ ਅਸਾਈਨਮੈਂਟ ਟਰੈਪ। 5,000 ਲੋਕਾਂ ਲਈ ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਦਾ ਆਮਦਨੀ ਡੇਟਾ 18% ਗਾਇਬ ਸੀ। ਉਸ ਨੇ ਏਆਈ ਨੂੰ "ਪਾੜੇ ਨੂੰ ਭਰਨ" ਲਈ ਕਿਹਾ; AI ਨੇ ਉਹਨਾਂ ਸਾਰਿਆਂ ਨੂੰ ਔਸਤ ਕੀਤਾ। ਨਤੀਜਾ: ਆਮਦਨੀ ਦਾ ਪਰਿਵਰਤਨ 22% ਘਟਿਆ ਹੈ, ਅਤੇ ਸਿੱਖਿਆ-ਆਮਦਨ ਸਬੰਧਾਂ ਦਾ ਗੁਣਾਂਕ ਇਸ ਨਾਲੋਂ ਕਮਜ਼ੋਰ ਨਿਕਲਿਆ ਹੈ। ਸਹੀ ਤਰੀਕਾ: ਕਮੀ MAR (ਸਿੱਖਿਆ ਦੇ ਕਾਰਨ) ਸੀ, ਮਲਟੀਪਲ ਅਸਾਈਨਮੈਂਟ (ਚੂਹੇ) ਦੁਆਰਾ ਭਰੀ ਜਾਣੀ ਸੀ। ਪਾਠ: ਭਰਨ ਦਾ ਤਰੀਕਾ ਵਿਧੀ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ।
ਕੇਸ 2 - ਬਾਹਰੀ ਸਫਾਈ ਖੋਜ ਨੂੰ ਉਲਟਾ ਦਿੰਦੀ ਹੈ। ਇੱਕ ਫਰਮ ਡੇਟਾ ਵਿੱਚ 3 ਬਹੁਤ ਵੱਡੀਆਂ ਫਰਮਾਂ (ਕੁੱਲ ਨਿਰੀਖਣ ਦਾ 0.6%) ਸਨ। ਇਹ AI ਦੇ "ਸਫ਼ਾਈ" ਸੁਝਾਅ ਦੁਆਰਾ ਮਿਟਾ ਦਿੱਤੇ ਗਏ ਸਨ; ਸਕੇਲ ਗੁਣਾਂਕ ਦੀਆਂ ਅਰਥਵਿਵਸਥਾਵਾਂ ਸਕਾਰਾਤਮਕ ਤੋਂ ਨਕਾਰਾਤਮਕ ਵਿੱਚ ਬਦਲ ਗਈਆਂ। ਹਾਲਾਂਕਿ, ਉਹ 3 ਕੰਪਨੀਆਂ ਅਸਲ ਸਨ ਅਤੇ ਉਦਯੋਗ ਦਾ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਹਿੱਸਾ ਸਨ. ਮਿਟਾਉਣ ਦੀ ਬਜਾਏ ਪੂਰੇ ਅਤੇ ਮਜ਼ਬੂਤ ਅੰਦਾਜ਼ੇ ਨਾਲ ਰਿਪੋਰਟ ਕਰਨਾ ਸਹੀ ਤਰੀਕਾ ਸੀ। ਸਬਕ: ਅਸਲ ਆਊਟਲੀਅਰ ਡੇਟਾ ਹਨ, ਰੌਲਾ ਨਹੀਂ।
ਕੇਸ 3 - ਸਾਈਲੈਂਟ ਕੋਡਿੰਗ ਗਲਤੀ। ਇੱਕ ਪੈਨਲ ਵਿੱਚ, ਮਿਤੀ ਵੇਰੀਏਬਲ ਦੋ ਵੱਖ-ਵੱਖ ਫਾਰਮੈਟਾਂ ("2020-03-01" ਅਤੇ "01/03/2020") ਵਿੱਚ ਆਇਆ। ਜਦੋਂ AI ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਗਏ ਮਿਸ਼ਰਨ ਕੋਡ ਨੇ ਉਹਨਾਂ ਨੂੰ ਵੱਖੋ-ਵੱਖਰੇ ਮੁੱਲਾਂ ਲਈ ਗਲਤ ਸਮਝਿਆ, ਤਾਂ 1,400 ਨਿਰੀਖਣ ਬੇਮੇਲ ਹੋ ਗਏ ਅਤੇ ਵਿਕਾਸ ਦਰ ਹਾਸੋਹੀਣੀ ਬਣ ਗਈ। ਇਸ ਨਾਲ ਕੋਈ ਫ਼ਰਕ ਨਹੀਂ ਪੈਂਦਾ ਜੇਕਰ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ ਦੀ ਜਾਂਚ ਨਹੀਂ ਕੀਤੀ। ਸਬਕ: ਹਰ ਕਦਮ ਦੇ ਬਾਅਦ ਨਿਰੀਖਣ ਗਿਣਤੀ ਅਤੇ ਸਵੱਛਤਾ ਜਾਂਚ ਲਾਜ਼ਮੀ ਹੈ।
ਆਮ ਗਲਤੀਆਂ
- ਅੰਨ੍ਹੇਵਾਹ ਔਸਤ ਨਾਲ ਪਾੜੇ ਨੂੰ ਭਰਨਾ। ਇਹ ਵਿਭਿੰਨਤਾ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਅਨਿਸ਼ਚਿਤਤਾ ਨੂੰ ਲੁਕਾਉਂਦਾ ਹੈ, ਅਤੇ MAR/MNAR ਵਿੱਚ ਪੱਖਪਾਤ ਬਣਾਉਂਦਾ ਹੈ। ਪਹਿਲਾਂ ਵਿਧੀ ਦਾ ਵਰਗੀਕਰਨ ਕਰੋ।
- ਆਊਟਲੀਅਰ ਨੂੰ ਮਿਟਾਉਣਾ "ਕਿਉਂਕਿ ਇਹ ਪਰੇਸ਼ਾਨ ਕਰਦਾ ਹੈ"। ਸਹੀ ਆਊਟਲੀਅਰ ਡੇਟਾ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ; ਮਿਟਾਉਣਾ ਨਤੀਜਾ ਨੂੰ ਮੋੜ ਰਿਹਾ ਹੈ। ਜੋ ਗਲਤ ਹੈ ਉਸਨੂੰ ਠੀਕ ਕਰੋ, ਜੋ ਅਸਲ ਹੈ ਉਸਨੂੰ ਰੱਖੋ।
- ਕੱਚਾ ਡਾਟਾ ਟੈਪ ਕਰਨਾ। ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਕਦੇ ਨਾ ਸੋਧੋ; ਕੋਡ ਨਾਲ ਸਾਰੀ ਸਫਾਈ ਇੱਕ ਵੱਖਰੀ ਕਾਪੀ ਵਿੱਚ ਕਰੋ ਤਾਂ ਜੋ ਇਸਨੂੰ ਵਾਪਸ ਕੀਤਾ ਜਾ ਸਕੇ।
- ਕਦਮਾਂ ਦੇ ਪ੍ਰਭਾਵ ਨੂੰ ਮਾਪਣਾ ਨਹੀਂ। ਜੇਕਰ ਹਰ ਪੜਾਅ ਤੋਂ ਬਾਅਦ ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ ਅਤੇ ਸਾਰਾਂਸ਼ ਦੇ ਅੰਕੜਿਆਂ ਦੀ ਜਾਂਚ ਨਹੀਂ ਕੀਤੀ ਜਾਂਦੀ, ਤਾਂ ਚੁੱਪ ਗਲਤੀਆਂ ਇਕੱਠੀਆਂ ਹੋ ਜਾਣਗੀਆਂ।
- ਨਤੀਜੇ ਵਜੋਂ ਸਫਾਈ. "ਜਦੋਂ ਤੁਸੀਂ ਇਸ ਲਾਈਨ ਨੂੰ ਜੋੜਦੇ ਹੋ, ਨਤੀਜਾ ਬਿਹਤਰ ਹੋ ਜਾਂਦਾ ਹੈ" ਦਾ ਤਰਕ ਪੀ-ਹੈਕਿੰਗ ਹੈ; ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਨਤੀਜੇ ਤੋਂ ਪਹਿਲਾਂ ਅਤੇ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਸਫਾਈ ਦੀ ਯੋਜਨਾ ਬਣਾਈ ਜਾਣੀ ਚਾਹੀਦੀ ਹੈ।
ਸੰਕੇਤ: ਇੱਕ "ਪਹਿਲਾਂ/ਬਾਅਦ" ਸਾਰਣੀ ਰੱਖੋ ਜੋ ਸਫਾਈ ਤੋਂ ਪਹਿਲਾਂ ਅਤੇ ਬਾਅਦ ਵਿੱਚ ਇੱਕੋ ਜਿਹੇ ਬੁਨਿਆਦੀ ਅੰਕੜੇ (ਮਤਲਬ, ਮੱਧਮਾਨ, ਨਿਰੀਖਣਾਂ ਦੀ ਗਿਣਤੀ, ਕੁਝ ਸਬੰਧ) ਨੂੰ ਨਾਲ-ਨਾਲ ਰੱਖਦਾ ਹੈ। ਇੱਕ ਅਚਾਨਕ ਛਾਲ ਇੱਕ ਲੁਕੀ ਹੋਈ ਗਲਤੀ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਹਾਰਬਿੰਗਰ ਹੈ।
ਸੰਖੇਪ ਵਿੱਚ
ਡੇਟਾ ਕਲੀਨਿੰਗ ਅਨੁਭਵੀ ਕੰਮ ਦਾ ਸਭ ਤੋਂ ਵੱਧ ਸਮਾਂ ਲੈਣ ਵਾਲਾ ਅਤੇ ਫੈਸਲਾ ਲੈਣ ਵਾਲਾ ਪੜਾਅ ਹੈ। AI ਇਸ 'ਤੇ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਕੋਡ ਜਨਰੇਟਰ ਹੈ, ਪਰ ਇਹ ਸ਼ਾਟਸ ਨੂੰ ਕਾਲ ਨਹੀਂ ਕਰ ਸਕਦਾ ਹੈ: ਤੁਸੀਂ ਗੁੰਮ ਹੋਏ ਡੇਟਾ ਕਿਸਮ (MCAR/MAR/MNAR) ਨੂੰ ਵਰਗੀਕ੍ਰਿਤ ਕਰਦੇ ਹੋ, ਇਹ ਨਿਰਧਾਰਿਤ ਕਰਦੇ ਹੋ ਕਿ ਕੀ ਆਊਟਲਾਇਰ ਇੱਕ ਗਲਤੀ ਹੈ ਜਾਂ ਅਸਲੀ, ਹਰੇਕ ਕਦਮ ਨੂੰ ਉਲਟਾ ਅਤੇ ਦਸਤਾਵੇਜ਼ੀ ਰੱਖੋ। AI ਅੰਨ੍ਹੇ "ਸਪਸ਼ਟ" ਅਧਿਕਾਰ ਦੇਣ ਦੀ ਬਜਾਏ, ਇੱਕ ਕਦਮ-ਦਰ-ਕਦਮ ਵਰਕਫਲੋ ਸਥਾਪਤ ਕਰੋ ਜਿਸਦਾ ਪ੍ਰਭਾਵ ਮਾਪਿਆ ਅਤੇ ਪ੍ਰਮਾਣਿਤ ਕੀਤਾ ਗਿਆ ਹੈ। ਹਰ ਕਦਮ ਦੇ ਬਾਅਦ ਨਿਰੀਖਣਾਂ ਅਤੇ ਸੰਖੇਪ ਅੰਕੜਿਆਂ ਦੀ ਗਿਣਤੀ ਦੀ ਜਾਂਚ ਕਰਨਾ ਚੁੱਪ ਦੀਆਂ ਗਲਤੀਆਂ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਇਲਾਜ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਘੱਟੋ-ਘੱਟ ਦੋ ਵੇਰੀਏਬਲ ਚੁਣੋ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਇੱਕ ਡਾਟਾ ਸੈੱਟ (ਤੁਹਾਡਾ ਆਪਣਾ ਡਾਟਾ ਜਾਂ ਇੱਕ ਨਮੂਨਾ ਸੈੱਟ) ਵਿੱਚ ਗੁੰਮ ਅਤੇ ਬਾਹਰਲੇ ਹਿੱਸੇ ਸ਼ਾਮਲ ਹਨ। ਉੱਪਰ ਦਿੱਤੇ "ਕਦਮ ਦਰ ਕਦਮ, ਨਾ ਮਿਟਾਓ/ਭਰੋ" ਪ੍ਰੋਂਪਟ ਰਾਹੀਂ AI ਤੋਂ ਇੱਕ ਡਾਇਗਨੌਸਟਿਕ ਕੋਡ ਦੀ ਬੇਨਤੀ ਕਰੋ ਅਤੇ ਇਸਨੂੰ ਚਲਾਓ। ਕਮੀ ਨੂੰ MCAR/MAR/MNAR ਦੇ ਰੂਪ ਵਿੱਚ ਸ਼੍ਰੇਣੀਬੱਧ ਕਰੋ ਅਤੇ ਇੱਕ ਵਾਕ ਵਿੱਚ ਆਪਣੀ ਤਰਕਸੰਗਤ ਲਿਖੋ। ਵਿਰੋਧੀ ਉਮੀਦਵਾਰਾਂ ਦੀ ਇਕ-ਇਕ ਕਰਕੇ ਜਾਂਚ ਕਰੋ ਅਤੇ ਫੈਸਲਾ ਕਰੋ ਕਿ ਕਿਹੜੀ ਗਲਤੀ ਹੈ ਅਤੇ ਕਿਹੜਾ ਅਸਲੀ ਹੈ। ਅੰਤ ਵਿੱਚ, ਸਫਾਈ ਤੋਂ ਪਹਿਲਾਂ/ਬਾਅਦ ਵਿੱਚ ਇੱਕ "ਪਹਿਲਾਂ-ਬਾਅਦ" ਸਾਰਣੀ ਬਣਾਓ ਅਤੇ ਜੇਕਰ ਕੋਈ ਅਣਕਿਆਸੀਆਂ ਤਬਦੀਲੀਆਂ ਹੋਣ ਤਾਂ ਰਿਪੋਰਟ ਕਰੋ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਬਿਨਾਂ ਬਦਲੇ ਇੱਕ ਵੱਖਰੀ ਕਾਪੀ ਵਿੱਚ ਸਾਫ਼ ਕੀਤਾ।
- [ ] ਮੈਂ ਕਮੀ ਨੂੰ MCAR/MAR/MNAR ਦੇ ਰੂਪ ਵਿੱਚ ਸ਼੍ਰੇਣੀਬੱਧ ਕੀਤਾ ਅਤੇ ਉਸ ਅਨੁਸਾਰ ਢੰਗ ਚੁਣਿਆ।
- [ ] ਮੈਂ ਇੱਕ-ਇੱਕ ਕਰਕੇ ਬਾਹਰਲੇ ਲੋਕਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ ਕਿ ਕੀ ਉਹ ਗਲਤੀਆਂ ਸਨ ਜਾਂ ਅਸਲ; ਮੈਂ ਇਸਨੂੰ ਅੰਨ੍ਹੇਵਾਹ ਨਹੀਂ ਮਿਟਾਇਆ.
- [ ] ਮੈਂ ਹਰੇਕ ਸਫਾਈ ਕਦਮ ਤੋਂ ਬਾਅਦ ਨਿਰੀਖਣਾਂ ਦੀ ਗਿਣਤੀ ਅਤੇ ਸੰਖੇਪ ਅੰਕੜਿਆਂ ਦੀ ਜਾਂਚ ਕੀਤੀ।
- [ ] ਮੈਂ ਕੋਡ ਅਤੇ ਇੱਕ ਟਿੱਪਣੀ ਲਾਈਨ ਦੇ ਨਾਲ ਸਾਰੇ ਕਦਮਾਂ ਦਾ ਦਸਤਾਵੇਜ਼ੀਕਰਨ ਕੀਤਾ ਹੈ; ਉਲਟਾਉਣਯੋਗ।
- [ ] ਮੈਂ ਉਸ ਪ੍ਰਕਿਰਿਆ ਦੇ ਗਿਆਨ 'ਤੇ ਸਫਾਈ ਨੂੰ ਆਧਾਰਿਤ ਕਰਦਾ ਹਾਂ ਜੋ ਡਾਟਾ ਪੈਦਾ ਕਰਦੀ ਹੈ, ਨਾ ਕਿ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਨਤੀਜੇ 'ਤੇ।