ਲਾਭ:
- ਢੁਕਵੇਂ ਗ੍ਰਾਫਾਂ (ਹਿਸਟੋਗ੍ਰਾਮ, ਬਾਕਸ ਪਲਾਟ, ਸਕੈਟਰ ਪਲਾਟ) ਦੇ ਨਾਲ ਵੇਰੀਏਬਲਾਂ ਦੀ ਵੰਡ, ਕੇਂਦਰ, ਫੈਲਾਅ ਅਤੇ ਵਿਗਾੜਾਂ ਦੀ ਪੜਚੋਲ ਕਰਨ ਦੀ ਸਮਰੱਥਾ।
- ਸਬੰਧਾਂ ਦੀ ਸਹੀ ਵਿਆਖਿਆ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਇਸ ਨੂੰ ਕਾਰਨਾਤਮਕਤਾ ਨਾਲ ਉਲਝਣ ਤੋਂ ਬਿਨਾਂ, ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਨਾਲ ਇਕੱਠੇ ਪੜ੍ਹਨਾ
- ਇਹ ਸਮਝਣ ਦੀ ਯੋਗਤਾ ਕਿ ਸੰਖੇਪ ਅੰਕੜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦੇ ਹਨ (Anscombe ਪਾਠ) ਅਤੇ ਅਨੁਮਾਨਾਂ ਨੂੰ ਵਿਕਸਿਤ ਕਰਦੇ ਹਨ ਜੋ ਮਾਡਲਿੰਗ ਦੀ ਦਿਸ਼ਾ ਨਿਰਧਾਰਤ ਕਰਦੇ ਹਨ।
ਇੱਕ ਮਾਡਲ ਬਣਾਉਣ ਤੋਂ ਪਹਿਲਾਂ, ਡੇਟਾ ਨੂੰ ਜਾਣਨਾ ਜ਼ਰੂਰੀ ਹੈ. ਜਿਵੇਂ ਇੱਕ ਡਾਕਟਰ ਮਰੀਜ਼ ਦੀ ਜਾਂਚ ਕੀਤੇ ਬਿਨਾਂ ਦਵਾਈ ਨਹੀਂ ਲਿਖਦਾ, ਇੱਕ ਡੇਟਾ ਵਿਗਿਆਨੀ ਡੇਟਾ ਦੀ "ਜਾਂਚ" ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਮਾਡਲ ਨਹੀਂ ਬਣਾਉਂਦਾ. ਇਸ ਇਮਤਿਹਾਨ ਨੂੰ ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (ਛੋਟੇ ਲਈ EDA) ਕਿਹਾ ਜਾਂਦਾ ਹੈ: ਇਹ ਦ੍ਰਿਸ਼ਟੀਗਤ ਅਤੇ ਗ੍ਰਾਫਿਕ ਤੌਰ 'ਤੇ ਡੇਟਾ ਦੀ ਵੰਡ, ਸਬੰਧਾਂ, ਹੈਰਾਨੀ ਅਤੇ ਜਾਲਾਂ ਨੂੰ ਖੋਜਣ ਦਾ ਪੜਾਅ ਹੈ। EDA ਦਾ ਉਦੇਸ਼ ਕਲਪਨਾ ਤਿਆਰ ਕਰਨਾ, ਗਲਤੀਆਂ ਨੂੰ ਫੜਨਾ ਅਤੇ ਮਾਡਲਿੰਗ ਦਿਸ਼ਾ ਨਿਰਧਾਰਤ ਕਰਨਾ ਹੈ। ਇਸ ਪੜਾਅ 'ਤੇ ਨਕਲੀ ਬੁੱਧੀ ਇੱਕ ਬਹੁਤ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਹਾਇਕ ਹੈ: ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਕਿਹੜਾ ਚਾਰਟ ਢੁਕਵਾਂ ਹੈ, ਇਸਦਾ ਕੋਡ ਲਿਖਦਾ ਹੈ, ਇੱਕ ਵੰਡ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ। ਪਰ ਇੱਕ ਵਿਅਕਤੀ ਆਪਣੇ ਖੇਤਰ ਦੇ ਗਿਆਨ ਨਾਲ ਫੈਸਲਾ ਕਰਦਾ ਹੈ, ਕੀ ਉਹ ਜੋ ਪੈਟਰਨ ਦੇਖਦਾ ਹੈ ਉਹ ਅਸਲ ਹੈ ਜਾਂ ਇੱਕ ਇਤਫ਼ਾਕ।
EDA ਕੀ ਲੱਭਦਾ ਹੈ?
EDA ਚਾਰ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਮੰਗਦਾ ਹੈ। ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ: ਹਰੇਕ ਵੇਰੀਏਬਲ ਨੂੰ ਕਿਵੇਂ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ—ਕੀ ਇਹ ਸਮਮਿਤੀ, ਤਿਲਕਿਆ, ਜਾਂ ਦੋ-ਸਿਖਿਆਂ ਵਾਲਾ ਹੈ? ਕੇਂਦਰੀ ਪ੍ਰਵਿਰਤੀ ਅਤੇ ਫੈਲਾਅ: ਮਤਲਬ, ਮੱਧ, ਮਿਆਰੀ ਵਿਵਹਾਰ ਕੀ ਹਨ? ਰਿਸ਼ਤੇ: ਵੇਰੀਏਬਲ ਇੱਕ ਦੂਜੇ ਨਾਲ ਕਿਵੇਂ ਸਬੰਧਤ ਹਨ? ਅਸਮਾਨਤਾਵਾਂ: ਕੀ ਇੱਥੇ ਅਚਾਨਕ ਮੁੱਲ, ਅੰਤਰ, ਸਮੂਹ ਹਨ? ਇਹ ਚਾਰ ਸਵਾਲ ਨਿਰਧਾਰਤ ਕਰਦੇ ਹਨ ਕਿ ਕਿਹੜੀ ਵਿਸ਼ੇਸ਼ਤਾ ਕੰਮ ਕਰੇਗੀ ਅਤੇ ਕਿਹੜਾ ਮਾਡਲ ਢੁਕਵਾਂ ਹੈ।
ਆਓ ਕੁਝ ਬੁਨਿਆਦੀ ਧਾਰਨਾਵਾਂ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰੀਏ। ਇੱਕ ਹਿਸਟੋਗ੍ਰਾਮ ਇੱਕ ਗ੍ਰਾਫ਼ ਹੁੰਦਾ ਹੈ ਜੋ ਇੱਕ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲ ਦੇ ਮੁੱਲਾਂ ਨੂੰ ਅੰਤਰਾਲਾਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ ਅਤੇ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਹਰੇਕ ਅੰਤਰਾਲ ਵਿੱਚ ਕਿੰਨੇ ਨਿਰੀਖਣ ਹਨ; ਇਹ ਵੰਡ ਨੂੰ ਦੇਖਣ ਦਾ ਸਭ ਤੋਂ ਤੇਜ਼ ਤਰੀਕਾ ਹੈ। skewness ਇੱਕ ਦਿਸ਼ਾ ਵਿੱਚ ਵੰਡ ਦੀ ਸ਼ਿਫਟ ਹੈ; ਵੇਰੀਏਬਲ ਜਿਵੇਂ ਕਿ ਆਮਦਨੀ ਸੱਜੇ ਪਾਸੇ ਵੱਲ ਖਿੱਚੀ ਜਾਂਦੀ ਹੈ (ਬਹੁਗਿਣਤੀ ਘੱਟ, ਕੁਝ ਬਹੁਤ ਜ਼ਿਆਦਾ)। ਇੱਕ ਬਾਕਸ ਪਲਾਟ ਇੱਕ ਨਜ਼ਰ ਵਿੱਚ ਮੱਧਮਾਨ, ਚੌਥਾਈ ਅਤੇ ਆਊਟਲੀਅਰਾਂ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਬਿੰਦੂਆਂ ਦੇ ਬੱਦਲ ਨਾਲ ਦੋ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲਾਂ ਦੇ ਸਬੰਧ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ।
ਸਬੰਧ: ਕੋਈ ਰਿਸ਼ਤਾ ਹੈ ਪਰ ਸਾਵਧਾਨ ਰਹੋ
ਸਬੰਧ — ਦੋ ਵੇਰੀਏਬਲ ਇਕੱਠੇ ਕਿਵੇਂ ਚਲਦੇ ਹਨ ਇਸ ਦਾ ਮਾਪ; -1 ਅਤੇ +1 ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਸੰਖਿਆ — EDA ਦਾ ਸਭ ਤੋਂ ਵੱਧ ਵਰਤਿਆ ਅਤੇ ਸਭ ਤੋਂ ਵੱਧ ਗਲਤ ਸਮਝਿਆ ਟੂਲ ਹੈ। +1 ਦਾ ਅਰਥ ਹੈ ਸੰਪੂਰਨ ਸਹਿ-ਵਾਧਾ, -1 ਦਾ ਅਰਥ ਹੈ ਸੰਪੂਰਨ ਉਲਟ ਸਬੰਧ, 0 ਦਾ ਮਤਲਬ ਹੈ ਕੋਈ ਰੇਖਿਕ ਸਬੰਧ ਨਹੀਂ। ਦੋ ਵੱਡੇ ਜਾਲ ਹਨ। ਪਹਿਲਾ, ਮਸ਼ਹੂਰ ਨਿਯਮ: ਸਬੰਧ ਕਾਰਨ ਨਹੀਂ ਹੈ। ਆਈਸਕ੍ਰੀਮ ਦੀ ਵਿਕਰੀ ਨਾਲ ਗਲਾ ਘੁੱਟਣ ਦੇ ਮਾਮਲੇ ਵਧੇ; ਇਸ ਲਈ ਨਹੀਂ ਕਿ ਇੱਕ ਦੂਜੇ ਵੱਲ ਲੈ ਜਾਂਦਾ ਹੈ, ਪਰ ਕਿਉਂਕਿ ਗਰਮੀਆਂ (ਲੁਕਿਆ ਤੀਜਾ ਵੇਰੀਏਬਲ) ਦੋਵਾਂ ਨੂੰ ਚਾਲੂ ਕਰਦਾ ਹੈ। ਦੂਜਾ, ਸਬੰਧ ਸਿਰਫ ਰੇਖਿਕ ਸਬੰਧਾਂ ਨੂੰ ਮਾਪਦਾ ਹੈ; ਇਹ 0 ਦੇ ਨੇੜੇ ਇੱਕ ਮਜ਼ਬੂਤ ਪਰ ਕਰਵੀਲੀਨੀਅਰ ਰਿਸ਼ਤੇ ਨੂੰ ਦਰਸਾ ਸਕਦਾ ਹੈ। ਇਸ ਲਈ ਜਦੋਂ ਆਪਸੀ ਸਬੰਧ ਨੂੰ ਦੇਖਦੇ ਹੋ, ਤਾਂ ਸਕੈਟਰ ਪਲਾਟ ਨੂੰ ਵੀ ਦੇਖਣਾ ਯਕੀਨੀ ਬਣਾਓ।
ਸਾਵਧਾਨ: ਜਦੋਂ AI ਇੱਕ ਸਬੰਧ ਨੰਬਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਇਹ ਕਾਰਣ ਵਾਲੀ ਭਾਸ਼ਾ ਵਿੱਚ ਖਿਸਕ ਸਕਦਾ ਹੈ ਜਿਵੇਂ ਕਿ "A ਵਧਾਉਂਦਾ ਹੈ B।" ਇਹ ਖ਼ਤਰਨਾਕ ਹੈ। ਆਪਸੀ ਸਬੰਧ ਕੇਵਲ ਇਕੱਠੇ ਅੰਦੋਲਨ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ; ਕੇਵਲ ਤਜਰਬਾ, ਡੋਮੇਨ ਗਿਆਨ, ਅਤੇ ਸਾਵਧਾਨ ਅਨੁਮਾਨ ਕਾਰਨ ਨੂੰ ਸਥਾਪਿਤ ਕਰਦੇ ਹਨ।
Anscombe Quartet: ਕਿਉਂ ਨਾ ਸਿਰਫ਼ ਨੰਬਰ 'ਤੇ ਨਜ਼ਰ ਮਾਰੋ
ਅੰਕੜਿਆਂ ਵਿੱਚ ਇੱਕ ਮਸ਼ਹੂਰ ਉਦਾਹਰਨ ਹੈ: Anscombe quartet. ਚਾਰ ਵੱਖ-ਵੱਖ ਡਾਟਾ ਸੈੱਟਾਂ ਦਾ ਲਗਭਗ ਇੱਕੋ ਹੀ ਮਤਲਬ, ਇੱਕੋ ਹੀ ਪਰਿਵਰਤਨ, ਅਤੇ ਇੱਕੋ ਹੀ ਸਬੰਧ (0.82); ਪਰ ਜਦੋਂ ਗ੍ਰਾਫ਼ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਉਹ ਪੂਰੀ ਤਰ੍ਹਾਂ ਵੱਖਰੇ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ - ਇੱਕ ਸਿੱਧੀ ਲਾਈਨ, ਇੱਕ ਵਕਰ, ਇੱਕ ਇੱਕ ਇੱਕਲੇ ਆਊਟਲੀਅਰ ਦੁਆਰਾ ਖਿੱਚਿਆ ਗਿਆ ਇੱਕ ਬੱਦਲ। ਸਬਕ ਸਪਸ਼ਟ ਹੈ: ਸੰਖੇਪ ਅੰਕੜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹਨ, ਗ੍ਰਾਫ ਨੂੰ ਵੇਖਣਾ ਲਾਜ਼ਮੀ ਹੈ। AI ਤੁਹਾਨੂੰ ਔਸਤ ਅਤੇ ਸਬੰਧ ਦੇ ਸਕਦਾ ਹੈ, ਪਰ ਗ੍ਰਾਫ ਨੂੰ ਦੇਖੇ ਬਿਨਾਂ ਉਹਨਾਂ ਨੰਬਰਾਂ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ Anscombe ਟ੍ਰੈਪ ਵਿੱਚ ਫਸ ਰਿਹਾ ਹੈ।
ਹੇਠਾਂ ਦਿੱਤੀ ਸਾਰਣੀ ਸੰਖੇਪ ਵਿੱਚ ਦੱਸਦੀ ਹੈ ਕਿ ਕਿਹੜਾ ਚਾਰਟ ਕਿਹੜੇ ਸਵਾਲ ਵਿੱਚ ਫਿੱਟ ਬੈਠਦਾ ਹੈ:
ਸਵਾਲ
ਅਨੁਕੂਲ ਗ੍ਰਾਫਿਕ
ਕੀ ਦਿਖਾਉਂਦਾ ਹੈ
ਇੱਕ ਸਿੰਗਲ ਵੇਰੀਏਬਲ ਦੀ ਵੰਡ
ਹਿਸਟੋਗ੍ਰਾਮ / KDE
ਆਕਾਰ, ਤਿੱਖਾਪਨ, ਸਿਰਿਆਂ ਦੀ ਗਿਣਤੀ
ਕੇਂਦਰ ਅਤੇ ਬਾਹਰੀ
ਬਾਕਸ ਪਲਾਟ
ਮਾਧਿਅਮ, ਚੌਥਾਈ, ਆਊਟਲੀਅਰ
ਦੋ ਨੰਬਰਾਂ ਦਾ ਰਿਸ਼ਤਾ
ਸਕੈਟਰ ਚਾਰਟ
ਦਿਸ਼ਾ, ਤਾਕਤ, ਵਕਰਤਾ
ਸ਼੍ਰੇਣੀ ਦੀ ਤੁਲਨਾ
ਬਾਰ ਚਾਰਟ
ਸਮੂਹਾਂ ਵਿੱਚ ਅੰਤਰ
ਸਮੇਂ ਦੇ ਨਾਲ ਬਦਲਣਾ
ਲਾਈਨ ਚਾਰਟ
ਰੁਝਾਨ, ਮੌਸਮੀ
ਬਹੁ-ਵਿਭਿੰਨ ਸਬੰਧ
ਸਬੰਧ ਗਰਮੀ ਦਾ ਨਕਸ਼ਾ
ਆਮ ਸਬੰਧ ਮੈਟ੍ਰਿਕਸ
ਸਿਮਪਸਨ ਦਾ ਵਿਰੋਧਾਭਾਸ: ਏਕੀਕ੍ਰਿਤ ਡੇਟਾ ਝੂਠ ਬੋਲ ਸਕਦਾ ਹੈ
EDA ਵਿੱਚ ਇੱਕ ਗੁਪਤ ਜਾਲ ਜਿਸ ਬਾਰੇ ਸੁਚੇਤ ਹੋਣਾ ਹੈ ਸਿਮਪਸਨ ਦਾ ਵਿਰੋਧਾਭਾਸ ਹੈ: ਇੱਕ ਪੈਟਰਨ ਇੱਕ ਦਿਸ਼ਾ ਦਿਖਾ ਸਕਦਾ ਹੈ ਜਦੋਂ ਸਾਰੇ ਡੇਟਾ ਦੀ ਇਕੱਠੇ ਜਾਂਚ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਪਰ ਜਦੋਂ ਡੇਟਾ ਨੂੰ ਅਰਥਪੂਰਨ ਉਪ ਸਮੂਹਾਂ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ ਤਾਂ ਉਲਟਾ ਹੁੰਦਾ ਹੈ। ਕਲਾਸਿਕ ਉਦਾਹਰਨ: ਇੱਕ ਯੂਨੀਵਰਸਿਟੀ ਵਿੱਚ ਔਰਤ ਬਿਨੈਕਾਰਾਂ ਲਈ ਸਮੁੱਚੀ ਸਵੀਕ੍ਰਿਤੀ ਦਰ ਮਰਦਾਂ ਨਾਲੋਂ ਘੱਟ ਜਾਪਦੀ ਹੈ; ਪਰ ਜਦੋਂ ਵਿਭਾਗ ਦੇ ਹਿਸਾਬ ਨਾਲ ਦੇਖਿਆ ਜਾਵੇ ਤਾਂ ਜ਼ਿਆਦਾਤਰ ਵਿਭਾਗਾਂ ਵਿੱਚ ਔਰਤਾਂ ਦੀ ਸਵੀਕ੍ਰਿਤੀ ਦਰ ਮਰਦਾਂ ਨਾਲੋਂ ਵੱਧ ਹੈ। ਕਿਥੋਂ ਦੀ? ਔਰਤਾਂ ਨੇ ਵਧੇਰੇ ਪ੍ਰਤੀਯੋਗੀ (ਘੱਟ ਸਵੀਕ੍ਰਿਤੀ ਦਰਾਂ) ਵਿਭਾਗਾਂ ਵਿੱਚ ਅਪਲਾਈ ਕੀਤਾ; ਸੰਯੁਕਤ ਸੰਖਿਆ ਇਸ ਲੁਕਵੇਂ ਵੇਰੀਏਬਲ ਨੂੰ ਸਟੋਰ ਕਰਦੀ ਹੈ। ਸਬਕ ਸਪਸ਼ਟ ਹੈ: ਕੁੱਲ ਜਾਂ ਔਸਤ ਨੂੰ ਦੇਖਦੇ ਸਮੇਂ, ਇਹ ਜਾਂਚ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਕੀ ਉਹ ਸੰਖਿਆ ਉਹੀ ਕਹਾਣੀ ਦੱਸਦੀ ਹੈ ਜਦੋਂ ਅਰਥਪੂਰਨ ਉਪ ਸਮੂਹਾਂ (ਖੰਡ, ਮਿਆਦ, ਚੈਨਲ) ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ। ਜਦੋਂ AI ਤੁਹਾਨੂੰ ਇੱਕ ਸੰਯੁਕਤ ਦਰ ਦਿੰਦਾ ਹੈ, ਇਹ ਪੁੱਛਣਾ ਕਿ "ਕੀ ਇਹ ਅਜੇ ਵੀ ਵੈਧ ਹੈ ਜਦੋਂ ਤੁਸੀਂ ਇਸਨੂੰ ਵੰਡਦੇ ਹੋ" ਸਭ ਤੋਂ ਗੁੰਮਰਾਹਕੁੰਨ ਨਤੀਜੇ ਛੇਤੀ ਹੀ ਫੜੇਗਾ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਦੋ ਲੁਕੀਆਂ ਪਹਾੜੀਆਂ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ ਔਸਤ ਗਾਹਕ ਦੀ ਉਮਰ 41 ਪਾਈ ਅਤੇ ਇਸਨੂੰ "ਮੱਧ-ਉਮਰ ਦੀ ਭੀੜ" ਵਜੋਂ ਰਿਪੋਰਟ ਕੀਤਾ। ਪਰ ਹਿਸਟੋਗ੍ਰਾਮ ਨੇ ਦੋ ਸਿਖਰਾਂ ਨੂੰ ਦਿਖਾਇਆ: 22-28 ਅਤੇ 55-62 ਉਮਰ ਸਮੂਹ। ਔਸਤ 41 ਅਸਲ ਵਿੱਚ ਕਿਸੇ ਦੀ ਨੁਮਾਇੰਦਗੀ ਨਹੀਂ ਕਰਦੇ ਸਨ। ਸਬਕ: ਮੱਧਮਾਨ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਵੰਡ ਨੂੰ ਪਲਾਟ ਕਰੋ।
ਕੇਸ 2 - ਨਕਲੀ ਸਬੰਧ। ਇੱਕ ਟੀਮ ਨੇ "ਵਿਗਿਆਪਨ ਖਰਚ" ਅਤੇ "ਵਿਕਰੀ" ਵਿਚਕਾਰ ਇੱਕ 0.78 ਸਬੰਧ ਪਾਇਆ ਅਤੇ ਬਜਟ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਦਿੱਤਾ। ਹਾਲਾਂਕਿ, ਜਿਸਨੇ ਦੋਵਾਂ ਨੂੰ ਚਾਲੂ ਕੀਤਾ ਉਹ ਮੌਸਮੀ ਮੁਹਿੰਮਾਂ ਸਨ; ਮੁਹਿੰਮ ਤੋਂ ਬਾਹਰ ਦੀ ਮਿਆਦ ਦੇ ਦੌਰਾਨ, ਰਿਸ਼ਤਾ 0.10 ਤੱਕ ਘੱਟ ਗਿਆ। 340 ਹਜ਼ਾਰ TL ਵਾਧੂ ਇਸ਼ਤਿਹਾਰਾਂ ਨੇ ਉਮੀਦ ਕੀਤੀ ਵਾਪਸੀ ਨਹੀਂ ਦਿੱਤੀ। ਸਬਕ: ਕਾਰਨ ਲਈ ਗਲਤ ਸਬੰਧ ਮਹਿੰਗਾ ਹੈ।
ਕੇਸ 3 - ਇਕੱਲੇ ਵਿਰੋਧੀ ਦੁਆਰਾ ਖਿੱਚੀ ਗਈ ਲਾਈਨ। ਇੱਕ ਰੀਅਲ ਅਸਟੇਟ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਵਰਗ ਫੁਟੇਜ ਅਤੇ ਕੀਮਤ (r=0.80) ਵਿਚਕਾਰ ਇੱਕ ਮਜ਼ਬੂਤ ਸਬੰਧ ਦਿਖਾਇਆ। ਜਦੋਂ ਸਕੈਟਰ ਪਲਾਟ ਖਿੱਚਿਆ ਗਿਆ ਸੀ, ਲਗਭਗ ਸਾਰਾ ਰਿਸ਼ਤਾ ਇੱਕ ਸਿੰਗਲ 12 ਮਿਲੀਅਨ TL ਲਗਜ਼ਰੀ ਵਿਲਾ ਦੁਆਰਾ ਬਣਾਇਆ ਗਿਆ ਸੀ; ਜਦੋਂ ਉਸ ਬਿੰਦੂ ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਗਿਆ, ਤਾਂ ਸਬੰਧ 0.31 ਤੱਕ ਘਟ ਗਿਆ। ਪਾਠ: ਹਮੇਸ਼ਾ ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਨਾਲ-ਨਾਲ ਸਬੰਧ ਨੂੰ ਪੜ੍ਹੋ।
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) ਆਟੋਮੈਟਿਕ EDA ਸੰਖੇਪ:
ਮੇਰੇ ਕੋਲ ਪਾਂਡਾ ਡੀ.ਐਫ. ਕੋਡ ਲਿਖੋ ਜੋ ਪੈਦਾ ਕਰਦਾ ਹੈ: (1) df.info() ਅਤੇ df.describe(), (2) ਹਰੇਕ ਅੰਕੀ ਕਾਲਮ ਲਈ ਹਿਸਟੋਗ੍ਰਾਮ, (3) ਹਰੇਕ ਸ਼੍ਰੇਣੀ ਵਾਲੇ ਕਾਲਮ ਲਈ ਗਿਣਤੀ। ਟਿੱਪਣੀ ਨਾ ਕਰੋ, ਸਿਰਫ਼ ਖੋਜ ਕੋਡ ਤਿਆਰ ਕਰੋ; ਮੈਂ ਪੈਟਰਨਾਂ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹਾਂ।
2) ਸਬੰਧ + ਵਿਜ਼ੂਅਲ (ਕਾਰਨ ਦੀ ਚੇਤਾਵਨੀ ਦੇ ਨਾਲ):
ਕੋਡ ਲਿਖੋ ਜੋ ਸੰਖਿਆਤਮਕ ਕਾਲਮਾਂ ਲਈ ਇੱਕ ਸਬੰਧ ਮੈਟ੍ਰਿਕਸ ਅਤੇ ਇੱਕ ਹੀਟ ਮੈਪ ਖਿੱਚਦਾ ਹੈ। 3 ਸਭ ਤੋਂ ਉੱਚੇ ਸੰਬੰਧਤ ਜੋੜਿਆਂ ਦਾ ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਵੀ ਖਿੱਚੋ। ਆਉਟਪੁੱਟ ਵਿੱਚ ਇੱਕ ਟਿੱਪਣੀ ਲਾਈਨ ਸ਼ਾਮਲ ਕਰੋ ਜੋ ਤੁਹਾਨੂੰ ਯਾਦ ਦਿਵਾਉਂਦਾ ਹੈ ਕਿ ਸਬੰਧ ਕਾਰਨ ਦਾ ਮਤਲਬ ਨਹੀਂ ਹੈ। ਕਾਰਨ ਦੇ ਦਾਅਵੇ ਨਾ ਕਰੋ।
3) ਵੰਡ ਨਿਦਾਨ:
"ਇਨਕਮ_ਟੀਐਲ" ਕਾਲਮ ਲਈ: ਕੋਡ ਲਿਖੋ ਜੋ ਹਿਸਟੋਗ੍ਰਾਮ, ਬਾਕਸ ਪਲਾਟ, ਸਕਿਊਨੈੱਸ ਵੈਲਯੂ ਅਤੇ ਮੱਧਮਾਨ/ਔਸਤ ਤੁਲਨਾ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਮੈਂ ਵਿਆਖਿਆ ਕਰਾਂਗਾ ਕਿ ਕੀ ਵੰਡ ਤਿੱਖੀ ਹੈ ਜਾਂ ਨਹੀਂ; ਬਸ ਕੋਡ ਦਿਓ।
4) ਹਿੱਸੇ ਦੀ ਤੁਲਨਾ:
"ਚੈਨਲ" (ਵੈੱਬ/ਮੋਬਾਈਲ) ਦੁਆਰਾ ਗਾਹਕਾਂ ਦੀ ਤੁਲਨਾ ਕਰੋ: ਕੋਡ ਲਿਖੋ ਜੋ ਔਸਤ ਰਕਮ, ਔਸਤ ਰਕਮ, ਆਰਡਰਾਂ ਦੀ ਗਿਣਤੀ, ਅਤੇ ਹਰੇਕ ਚੈਨਲ ਲਈ ਰਕਮ ਦੀ ਵੰਡ ਦਾ ਇੱਕ ਬਾਕਸਪਲਾਟ ਤਿਆਰ ਕਰਦਾ ਹੈ। ਸੁਝਾਅ ਦਿਓ ਕਿ ਦੋ ਚੈਨਲਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਦੇ ਅੰਕੜਾਤਮਕ ਮਹੱਤਤਾ ਲਈ ਕਿਹੜਾ ਟੈਸਟ ਢੁਕਵਾਂ ਹੈ, ਪਰ ਫੈਸਲਾ ਮੇਰੇ 'ਤੇ ਹੈ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:
ਇਸ ਡੇਟਾ ਵਿੱਚ ਕੁਝ ਦਿਲਚਸਪ ਲੱਭੋ.
"ਦਿਲਚਸਪ" ਪਰਿਭਾਸ਼ਿਤ ਹੈ; AI ਡਾਟਾ ਨਹੀਂ ਦੇਖਦਾ, ਇਸਲਈ ਇਹ ਜਾਂ ਤਾਂ ਇਸਨੂੰ ਬਣਾਉਂਦਾ ਹੈ ਜਾਂ ਆਮ ਬਿਆਨ ਦਿੰਦਾ ਹੈ। ਕੋਈ ਦਿਸ਼ਾ ਨਹੀਂ, ਕੋਈ ਪਰਿਵਰਤਨ ਨਹੀਂ, ਕੋਈ ਉਦੇਸ਼ ਨਹੀਂ ਹੈ।
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: EDA ਸਹਾਇਕ। df ਕਾਲਮ: ਉਮਰ (int), ਆਮਦਨ_tl (ਫਲੋਟ), ਸ਼ਹਿਰ (ਸ਼੍ਰੇਣੀ), ਚੈਨਲ (ਵੈੱਬ/ਮੋਬਾਈਲ), ਰਕਮ (ਫਲੋਟ)। ਉਦੇਸ਼: "ਰਾਤ" ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਨ ਵਾਲੇ ਕਾਰਕਾਂ ਦੀ ਖੋਜ ਕਰਨਾ। ਟਾਸਕ: (1) ਰਕਮ ਦੀ ਵੰਡ ਦਾ ਕੋਡ, (2) ਰਕਮ ਅਤੇ ਉਮਰ ਅਤੇ ਆਮਦਨ ਦੇ ਵਿਚਕਾਰ ਵੰਡ ਗ੍ਰਾਫ਼, (3) ਚੈਨਲ ਟੁੱਟਣ ਵਿੱਚ ਰਕਮ ਦਾ ਬਾਕਸ ਪਲਾਟ। ਇੱਕ ਕਾਰਣ ਦਾਅਵੇ ਦੀ ਸਥਾਪਨਾ; ਬਸ ਖੋਜ ਕੋਡ ਤਿਆਰ ਕਰੋ ਅਤੇ ਮੈਂ ਪੈਟਰਨ ਦੀ ਵਿਆਖਿਆ ਕਰਾਂਗਾ।
ਇੱਥੇ, ਉਦੇਸ਼, ਪਰਿਵਰਤਨਸ਼ੀਲਤਾ ਅਤੇ "ਦਾਅਵੇ ਦੇ ਕਾਰਨ" ਦੀ ਸੀਮਾ ਸਪਸ਼ਟ ਹੈ।
ਆਮ ਗਲਤੀਆਂ
- ਸਿਰਫ਼ ਸੰਖੇਪ ਅੰਕੜਿਆਂ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ। ਜਿਵੇਂ ਕਿ Anscombe Quartet ਦਿਖਾਉਂਦਾ ਹੈ, ਇੱਕੋ ਮਤਲਬ ਬਹੁਤ ਵੱਖਰੀਆਂ ਵੰਡਾਂ ਨੂੰ ਲੁਕਾਉਂਦਾ ਹੈ; ਚਾਰਟ ਵੇਖੋ.
- ਕਾਰਣ ਲਈ ਗਲਤ ਸੰਬੰਧ. ਸਹਿ-ਕਿਰਿਆ ਇਹ ਨਹੀਂ ਦਰਸਾਉਂਦੀ ਕਿ ਇੱਕ ਦੂਜੇ ਵੱਲ ਲੈ ਜਾਂਦਾ ਹੈ; ਲੁਕਵੇਂ ਵੇਰੀਏਬਲ ਤੋਂ ਸਾਵਧਾਨ ਰਹੋ।
- ਬਿਨਾਂ ਕਿਸੇ ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਸਬੰਧਾਂ ਨੂੰ ਦੇਖਦੇ ਹੋਏ। ਇੱਕ ਸਿੰਗਲ ਆਊਟਲੀਅਰ ਜਾਂ ਵਕਰੀਕਰਨ ਨੰਬਰ ਨੂੰ ਗੁੰਮਰਾਹ ਕਰਦਾ ਹੈ।
- ਮੱਧਮਾਨ ਦੇ ਨਾਲ ਇੱਕ ਦੋ-ਪੀਕਡ/ਸਿਕਿਊਡ ਵੰਡ ਦਾ ਸਾਰ ਦੇਣਾ। ਔਸਤ ਕਿਸੇ ਦੀ ਨੁਮਾਇੰਦਗੀ ਨਹੀਂ ਕਰ ਸਕਦਾ।
- EDA ਨੂੰ ਛੱਡਣਾ ਅਤੇ ਸਿੱਧਾ ਮਾਡਲ 'ਤੇ ਜਾਣਾ। ਅਣਪਛਾਤੇ ਡੇਟਾ ਦਾ ਅਰਥ ਹੈ ਅੰਨ੍ਹੇ ਮਾਡਲ।
ਸੁਝਾਅ: ਹਰੇਕ ਨਵੇਂ ਡੇਟਾ ਸੈੱਟ ਦੇ ਨਾਲ, ਪਹਿਲੇ 30 ਮਿੰਟਾਂ ਨੂੰ ਸਿਰਫ਼ ਗ੍ਰਾਫ਼ ਖਿੱਚਣ ਵਿੱਚ ਬਿਤਾਓ: ਹਰੇਕ ਸੰਖਿਆ ਦਾ ਹਿਸਟੋਗ੍ਰਾਮ, ਮਹੱਤਵਪੂਰਨ ਜੋੜਿਆਂ ਦਾ ਸਕੈਟਰ ਪਲਾਟ, ਸ਼੍ਰੇਣੀਆਂ ਦਾ ਬਾਰ ਚਾਰਟ। ਇਹ 30 ਮਿੰਟ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਲਈ ਭਵਿੱਖ ਦੀਆਂ ਮਾਡਲਿੰਗ ਗਲਤੀਆਂ ਨੂੰ ਰੋਕਦੇ ਹਨ।
ਸੰਖੇਪ ਵਿੱਚ
EDA ਇੱਕ ਮਾਡਲ ਬਣਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਡੇਟਾ ਨੂੰ ਜਾਣਨ ਦਾ ਪੜਾਅ ਹੈ ਅਤੇ ਚਾਰ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਮੰਗਦਾ ਹੈ: ਵੰਡ, ਕੇਂਦਰ-ਪ੍ਰਸਾਰ, ਰਿਸ਼ਤੇ ਅਤੇ ਵਿਗਾੜ। ਸੰਖੇਪ ਅੰਕੜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦੇ ਹਨ; ਗ੍ਰਾਫ ਨੂੰ ਦੇਖਣਾ ਲਾਜ਼ਮੀ ਹੈ (ਐਨਸਕੋਮਬ ਲੈਕਚਰ)। ਸਬੰਧ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਾਧਨ ਹੈ, ਪਰ ਕਾਰਣ ਨਹੀਂ ਹੈ ਅਤੇ ਯਕੀਨੀ ਤੌਰ 'ਤੇ ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਨਾਲ ਪੜ੍ਹਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। AI ਗ੍ਰਾਫਿਕਸ ਅਤੇ ਕੋਡ ਲਿਖਣ ਦਾ ਸੁਝਾਅ ਦੇਣ ਲਈ ਇੱਕ ਵਧੀਆ ਐਕਸਲੇਟਰ ਹੈ; ਪਰ ਲੋਕ ਆਪਣੇ ਖੇਤਰ ਦੇ ਗਿਆਨ ਨਾਲ ਵਿਆਖਿਆ ਕਰਦੇ ਹਨ ਕਿ ਉਹ ਜੋ ਪੈਟਰਨ ਦੇਖਦੇ ਹਨ ਉਹ ਅਸਲ ਹੈ ਜਾਂ ਇੱਕ ਇਤਫ਼ਾਕ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਇੱਕ ਡੇਟਾਸੈਟ ਚੁਣੋ ਅਤੇ ਸਿਰਫ EDA ਕਰੋ: ਘੱਟੋ-ਘੱਟ ਤਿੰਨ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲਾਂ ਦਾ ਇੱਕ ਹਿਸਟੋਗ੍ਰਾਮ, ਵੇਰੀਏਬਲਾਂ ਦੇ ਦੋ ਜੋੜਿਆਂ ਦਾ ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ, ਅਤੇ ਇੱਕ ਸਹਿ-ਸੰਬੰਧ ਹੀਟ ਮੈਪ ਕੱਢੋ। ਘੱਟੋ-ਘੱਟ ਇੱਕ "ਸਰਪ੍ਰਾਈਜ਼" ਲੱਭੋ (ਜਿਵੇਂ ਕਿ ਦੋ ਸਿਖਰਾਂ ਵਾਲੀ ਵੰਡ, ਜਾਅਲੀ ਸਬੰਧਾਂ ਲਈ ਉਮੀਦਵਾਰ, ਇੱਕ ਸਿੰਗਲ ਆਊਟਲੀਅਰ ਦੁਆਰਾ ਖਿੱਚਿਆ ਗਿਆ ਰਿਸ਼ਤਾ) ਅਤੇ ਇਸਨੂੰ ਇੱਕ ਵਾਕ ਵਿੱਚ ਵਿਆਖਿਆ ਕਰੋ। ਕੋਈ ਵੀ ਕਾਰਨਾਤਮਕ ਦਾਅਵੇ ਕੀਤੇ ਬਿਨਾਂ ਲਿਖੋ।
ਚੈੱਕਲਿਸਟ
- [ ] ਕੀ ਮੈਂ ਹਰੇਕ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲ ਦੀ ਵੰਡ ਨੂੰ ਗ੍ਰਾਫ ਕੀਤਾ ਹੈ?
- ਕੀ ਮੈਂ ਸਕੈਟਰਪਲਾਟ ਨਾਲ ਸਬੰਧਾਂ ਨੂੰ ਦੇਖਿਆ?
- ਕੀ ਮੈਂ ਕਾਰਣ ਅਤੇ ਸਬੰਧ ਨੂੰ ਵੱਖਰਾ ਰੱਖਿਆ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਤਿੱਖੇ ਜਾਂ ਦੋ-ਪੱਕੇ ਵੰਡਾਂ ਨੂੰ ਦੇਖਿਆ ਅਤੇ ਅੰਨ੍ਹੇਵਾਹ ਮਤਲਬ 'ਤੇ ਭਰੋਸਾ ਨਹੀਂ ਕੀਤਾ?
- ਕੀ ਮੈਂ ਆਪਣੇ EDA ਖੋਜਾਂ ਤੋਂ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਮਾਡਲਿੰਗ ਪਹਿਲੂ/ਕਲਪਨਾ ਲਿਆ ਹੈ?