ਇਕਾਈਆਂ
1. ਡੇਟਾ ਸਾਇੰਸ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਜਾਣ-ਪਛਾਣ: ਵਰਕਫਲੋ, ਭੂਮਿਕਾਵਾਂ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਨੈਤਿਕਤਾ 2. ਡੇਟਾ ਸੰਗ੍ਰਹਿ ਅਤੇ ਸਰੋਤ ਸਮਝ: ਸਕੀਮਾ, ਨਮੂਨਾ, ਗੁਣਵੱਤਾ ਅਤੇ ਲੀਕ ਜਾਗਰੂਕਤਾ 3. ਡੇਟਾ ਕਲੀਨਿੰਗ ਅਤੇ ਪ੍ਰੀਪ੍ਰੋਸੈਸਿੰਗ: ਗੁੰਮ ਮੁੱਲ, ਬਾਹਰੀ ਅਤੇ ਕਿਸਮ ਰੂਪਾਂਤਰਣ 4. ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (EDA): ਵੰਡ, ਰਿਸ਼ਤੇ, ਅਤੇ ਸ਼ੁਰੂਆਤੀ ਸੂਝ 5. ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ: ਵੇਰੀਐਂਟ ਤਿਆਰ ਕਰਨਾ, ਕੋਡਿੰਗ, ਸਕੇਲਿੰਗ, ਅਤੇ ਲੀਕੇਜ ਤੋਂ ਬਚਣਾ 6. ਮਾਡਲ ਬਿਲਡਿੰਗ: ਸਮੱਸਿਆ ਪਰਿਭਾਸ਼ਾ, ਐਲਗੋਰਿਦਮ ਚੋਣ, ਅਤੇ ਸਿਖਲਾਈ/ਟੈਸਟ ਸਪਲਿਟ 7. ਮਾਡਲ ਮੁਲਾਂਕਣ: ਮੈਟ੍ਰਿਕਸ, ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ, ਅਤੇ ਐਕਸਟ੍ਰੀਮ ਲਰਨਿੰਗ 8. ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਕਹਾਣੀ ਸੁਣਾਉਣਾ: ਸਹੀ ਗ੍ਰਾਫਿਕਸ, ਇਮਾਨਦਾਰ ਗ੍ਰਾਫਿਕਸ 9. ਕੋਡ ਜਨਰੇਸ਼ਨ: ਪਾਈਥਨ (ਪਾਂਡਾ) ਅਤੇ SQL ਨਾਲ AI-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਵਿਸ਼ਲੇਸ਼ਣ 10. ਡਾਟਾ ਲੀਕੇਜ ਅਤੇ ਰੀਪ੍ਰੋਡਸੀਬਿਲਟੀ: ਸਾਈਲੈਂਟ ਡਿਸਟਰਸ ਅਤੇ ਅਨੁਸ਼ਾਸਨ 11. MLOps ਫਾਊਂਡੇਸ਼ਨ, ਨੈਤਿਕਤਾ, ਗੋਪਨੀਯਤਾ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰ ਵਿਸ਼ਲੇਸ਼ਣ
ਯੂਨਿਟ 4 / 11

ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (EDA): ਵੰਡ, ਰਿਸ਼ਤੇ, ਅਤੇ ਸ਼ੁਰੂਆਤੀ ਸੂਝ

ਲਾਭ:

  • ਢੁਕਵੇਂ ਗ੍ਰਾਫਾਂ (ਹਿਸਟੋਗ੍ਰਾਮ, ਬਾਕਸ ਪਲਾਟ, ਸਕੈਟਰ ਪਲਾਟ) ਦੇ ਨਾਲ ਵੇਰੀਏਬਲਾਂ ਦੀ ਵੰਡ, ਕੇਂਦਰ, ਫੈਲਾਅ ਅਤੇ ਵਿਗਾੜਾਂ ਦੀ ਪੜਚੋਲ ਕਰਨ ਦੀ ਸਮਰੱਥਾ।
  • ਸਬੰਧਾਂ ਦੀ ਸਹੀ ਵਿਆਖਿਆ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਇਸ ਨੂੰ ਕਾਰਨਾਤਮਕਤਾ ਨਾਲ ਉਲਝਣ ਤੋਂ ਬਿਨਾਂ, ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਨਾਲ ਇਕੱਠੇ ਪੜ੍ਹਨਾ
  • ਇਹ ਸਮਝਣ ਦੀ ਯੋਗਤਾ ਕਿ ਸੰਖੇਪ ਅੰਕੜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦੇ ਹਨ (Anscombe ਪਾਠ) ਅਤੇ ਅਨੁਮਾਨਾਂ ਨੂੰ ਵਿਕਸਿਤ ਕਰਦੇ ਹਨ ਜੋ ਮਾਡਲਿੰਗ ਦੀ ਦਿਸ਼ਾ ਨਿਰਧਾਰਤ ਕਰਦੇ ਹਨ।

ਇੱਕ ਮਾਡਲ ਬਣਾਉਣ ਤੋਂ ਪਹਿਲਾਂ, ਡੇਟਾ ਨੂੰ ਜਾਣਨਾ ਜ਼ਰੂਰੀ ਹੈ. ਜਿਵੇਂ ਇੱਕ ਡਾਕਟਰ ਮਰੀਜ਼ ਦੀ ਜਾਂਚ ਕੀਤੇ ਬਿਨਾਂ ਦਵਾਈ ਨਹੀਂ ਲਿਖਦਾ, ਇੱਕ ਡੇਟਾ ਵਿਗਿਆਨੀ ਡੇਟਾ ਦੀ "ਜਾਂਚ" ਕੀਤੇ ਬਿਨਾਂ ਇੱਕ ਮਾਡਲ ਨਹੀਂ ਬਣਾਉਂਦਾ. ਇਸ ਇਮਤਿਹਾਨ ਨੂੰ ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (ਛੋਟੇ ਲਈ EDA) ਕਿਹਾ ਜਾਂਦਾ ਹੈ: ਇਹ ਦ੍ਰਿਸ਼ਟੀਗਤ ਅਤੇ ਗ੍ਰਾਫਿਕ ਤੌਰ 'ਤੇ ਡੇਟਾ ਦੀ ਵੰਡ, ਸਬੰਧਾਂ, ਹੈਰਾਨੀ ਅਤੇ ਜਾਲਾਂ ਨੂੰ ਖੋਜਣ ਦਾ ਪੜਾਅ ਹੈ। EDA ਦਾ ਉਦੇਸ਼ ਕਲਪਨਾ ਤਿਆਰ ਕਰਨਾ, ਗਲਤੀਆਂ ਨੂੰ ਫੜਨਾ ਅਤੇ ਮਾਡਲਿੰਗ ਦਿਸ਼ਾ ਨਿਰਧਾਰਤ ਕਰਨਾ ਹੈ। ਇਸ ਪੜਾਅ 'ਤੇ ਨਕਲੀ ਬੁੱਧੀ ਇੱਕ ਬਹੁਤ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਹਾਇਕ ਹੈ: ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਕਿਹੜਾ ਚਾਰਟ ਢੁਕਵਾਂ ਹੈ, ਇਸਦਾ ਕੋਡ ਲਿਖਦਾ ਹੈ, ਇੱਕ ਵੰਡ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ। ਪਰ ਇੱਕ ਵਿਅਕਤੀ ਆਪਣੇ ਖੇਤਰ ਦੇ ਗਿਆਨ ਨਾਲ ਫੈਸਲਾ ਕਰਦਾ ਹੈ, ਕੀ ਉਹ ਜੋ ਪੈਟਰਨ ਦੇਖਦਾ ਹੈ ਉਹ ਅਸਲ ਹੈ ਜਾਂ ਇੱਕ ਇਤਫ਼ਾਕ।

EDA ਕੀ ਲੱਭਦਾ ਹੈ?

EDA ਚਾਰ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਮੰਗਦਾ ਹੈ। ਡਿਸਟ੍ਰੀਬਿਊਸ਼ਨ: ਹਰੇਕ ਵੇਰੀਏਬਲ ਨੂੰ ਕਿਵੇਂ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ—ਕੀ ਇਹ ਸਮਮਿਤੀ, ਤਿਲਕਿਆ, ਜਾਂ ਦੋ-ਸਿਖਿਆਂ ਵਾਲਾ ਹੈ? ਕੇਂਦਰੀ ਪ੍ਰਵਿਰਤੀ ਅਤੇ ਫੈਲਾਅ: ਮਤਲਬ, ਮੱਧ, ਮਿਆਰੀ ਵਿਵਹਾਰ ਕੀ ਹਨ? ਰਿਸ਼ਤੇ: ਵੇਰੀਏਬਲ ਇੱਕ ਦੂਜੇ ਨਾਲ ਕਿਵੇਂ ਸਬੰਧਤ ਹਨ? ਅਸਮਾਨਤਾਵਾਂ: ਕੀ ਇੱਥੇ ਅਚਾਨਕ ਮੁੱਲ, ਅੰਤਰ, ਸਮੂਹ ਹਨ? ਇਹ ਚਾਰ ਸਵਾਲ ਨਿਰਧਾਰਤ ਕਰਦੇ ਹਨ ਕਿ ਕਿਹੜੀ ਵਿਸ਼ੇਸ਼ਤਾ ਕੰਮ ਕਰੇਗੀ ਅਤੇ ਕਿਹੜਾ ਮਾਡਲ ਢੁਕਵਾਂ ਹੈ।

ਆਓ ਕੁਝ ਬੁਨਿਆਦੀ ਧਾਰਨਾਵਾਂ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰੀਏ। ਇੱਕ ਹਿਸਟੋਗ੍ਰਾਮ ਇੱਕ ਗ੍ਰਾਫ਼ ਹੁੰਦਾ ਹੈ ਜੋ ਇੱਕ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲ ਦੇ ਮੁੱਲਾਂ ਨੂੰ ਅੰਤਰਾਲਾਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ ਅਤੇ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਹਰੇਕ ਅੰਤਰਾਲ ਵਿੱਚ ਕਿੰਨੇ ਨਿਰੀਖਣ ਹਨ; ਇਹ ਵੰਡ ਨੂੰ ਦੇਖਣ ਦਾ ਸਭ ਤੋਂ ਤੇਜ਼ ਤਰੀਕਾ ਹੈ। skewness ਇੱਕ ਦਿਸ਼ਾ ਵਿੱਚ ਵੰਡ ਦੀ ਸ਼ਿਫਟ ਹੈ; ਵੇਰੀਏਬਲ ਜਿਵੇਂ ਕਿ ਆਮਦਨੀ ਸੱਜੇ ਪਾਸੇ ਵੱਲ ਖਿੱਚੀ ਜਾਂਦੀ ਹੈ (ਬਹੁਗਿਣਤੀ ਘੱਟ, ਕੁਝ ਬਹੁਤ ਜ਼ਿਆਦਾ)। ਇੱਕ ਬਾਕਸ ਪਲਾਟ ਇੱਕ ਨਜ਼ਰ ਵਿੱਚ ਮੱਧਮਾਨ, ਚੌਥਾਈ ਅਤੇ ਆਊਟਲੀਅਰਾਂ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਬਿੰਦੂਆਂ ਦੇ ਬੱਦਲ ਨਾਲ ਦੋ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲਾਂ ਦੇ ਸਬੰਧ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ।

ਸਬੰਧ: ਕੋਈ ਰਿਸ਼ਤਾ ਹੈ ਪਰ ਸਾਵਧਾਨ ਰਹੋ

ਸਬੰਧ — ਦੋ ਵੇਰੀਏਬਲ ਇਕੱਠੇ ਕਿਵੇਂ ਚਲਦੇ ਹਨ ਇਸ ਦਾ ਮਾਪ; -1 ਅਤੇ +1 ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਸੰਖਿਆ — EDA ਦਾ ਸਭ ਤੋਂ ਵੱਧ ਵਰਤਿਆ ਅਤੇ ਸਭ ਤੋਂ ਵੱਧ ਗਲਤ ਸਮਝਿਆ ਟੂਲ ਹੈ। +1 ਦਾ ਅਰਥ ਹੈ ਸੰਪੂਰਨ ਸਹਿ-ਵਾਧਾ, -1 ਦਾ ਅਰਥ ਹੈ ਸੰਪੂਰਨ ਉਲਟ ਸਬੰਧ, 0 ਦਾ ਮਤਲਬ ਹੈ ਕੋਈ ਰੇਖਿਕ ਸਬੰਧ ਨਹੀਂ। ਦੋ ਵੱਡੇ ਜਾਲ ਹਨ। ਪਹਿਲਾ, ਮਸ਼ਹੂਰ ਨਿਯਮ: ਸਬੰਧ ਕਾਰਨ ਨਹੀਂ ਹੈ। ਆਈਸਕ੍ਰੀਮ ਦੀ ਵਿਕਰੀ ਨਾਲ ਗਲਾ ਘੁੱਟਣ ਦੇ ਮਾਮਲੇ ਵਧੇ; ਇਸ ਲਈ ਨਹੀਂ ਕਿ ਇੱਕ ਦੂਜੇ ਵੱਲ ਲੈ ਜਾਂਦਾ ਹੈ, ਪਰ ਕਿਉਂਕਿ ਗਰਮੀਆਂ (ਲੁਕਿਆ ਤੀਜਾ ਵੇਰੀਏਬਲ) ਦੋਵਾਂ ਨੂੰ ਚਾਲੂ ਕਰਦਾ ਹੈ। ਦੂਜਾ, ਸਬੰਧ ਸਿਰਫ ਰੇਖਿਕ ਸਬੰਧਾਂ ਨੂੰ ਮਾਪਦਾ ਹੈ; ਇਹ 0 ਦੇ ਨੇੜੇ ਇੱਕ ਮਜ਼ਬੂਤ ​​ਪਰ ਕਰਵੀਲੀਨੀਅਰ ਰਿਸ਼ਤੇ ਨੂੰ ਦਰਸਾ ਸਕਦਾ ਹੈ। ਇਸ ਲਈ ਜਦੋਂ ਆਪਸੀ ਸਬੰਧ ਨੂੰ ਦੇਖਦੇ ਹੋ, ਤਾਂ ਸਕੈਟਰ ਪਲਾਟ ਨੂੰ ਵੀ ਦੇਖਣਾ ਯਕੀਨੀ ਬਣਾਓ।

ਸਾਵਧਾਨ: ਜਦੋਂ AI ਇੱਕ ਸਬੰਧ ਨੰਬਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਇਹ ਕਾਰਣ ਵਾਲੀ ਭਾਸ਼ਾ ਵਿੱਚ ਖਿਸਕ ਸਕਦਾ ਹੈ ਜਿਵੇਂ ਕਿ "A ਵਧਾਉਂਦਾ ਹੈ B।" ਇਹ ਖ਼ਤਰਨਾਕ ਹੈ। ਆਪਸੀ ਸਬੰਧ ਕੇਵਲ ਇਕੱਠੇ ਅੰਦੋਲਨ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ; ਕੇਵਲ ਤਜਰਬਾ, ਡੋਮੇਨ ਗਿਆਨ, ਅਤੇ ਸਾਵਧਾਨ ਅਨੁਮਾਨ ਕਾਰਨ ਨੂੰ ਸਥਾਪਿਤ ਕਰਦੇ ਹਨ।

Anscombe Quartet: ਕਿਉਂ ਨਾ ਸਿਰਫ਼ ਨੰਬਰ 'ਤੇ ਨਜ਼ਰ ਮਾਰੋ

ਅੰਕੜਿਆਂ ਵਿੱਚ ਇੱਕ ਮਸ਼ਹੂਰ ਉਦਾਹਰਨ ਹੈ: Anscombe quartet. ਚਾਰ ਵੱਖ-ਵੱਖ ਡਾਟਾ ਸੈੱਟਾਂ ਦਾ ਲਗਭਗ ਇੱਕੋ ਹੀ ਮਤਲਬ, ਇੱਕੋ ਹੀ ਪਰਿਵਰਤਨ, ਅਤੇ ਇੱਕੋ ਹੀ ਸਬੰਧ (0.82); ਪਰ ਜਦੋਂ ਗ੍ਰਾਫ਼ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਉਹ ਪੂਰੀ ਤਰ੍ਹਾਂ ਵੱਖਰੇ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ - ਇੱਕ ਸਿੱਧੀ ਲਾਈਨ, ਇੱਕ ਵਕਰ, ਇੱਕ ਇੱਕ ਇੱਕਲੇ ਆਊਟਲੀਅਰ ਦੁਆਰਾ ਖਿੱਚਿਆ ਗਿਆ ਇੱਕ ਬੱਦਲ। ਸਬਕ ਸਪਸ਼ਟ ਹੈ: ਸੰਖੇਪ ਅੰਕੜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹਨ, ਗ੍ਰਾਫ ਨੂੰ ਵੇਖਣਾ ਲਾਜ਼ਮੀ ਹੈ। AI ਤੁਹਾਨੂੰ ਔਸਤ ਅਤੇ ਸਬੰਧ ਦੇ ਸਕਦਾ ਹੈ, ਪਰ ਗ੍ਰਾਫ ਨੂੰ ਦੇਖੇ ਬਿਨਾਂ ਉਹਨਾਂ ਨੰਬਰਾਂ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ Anscombe ਟ੍ਰੈਪ ਵਿੱਚ ਫਸ ਰਿਹਾ ਹੈ।

ਹੇਠਾਂ ਦਿੱਤੀ ਸਾਰਣੀ ਸੰਖੇਪ ਵਿੱਚ ਦੱਸਦੀ ਹੈ ਕਿ ਕਿਹੜਾ ਚਾਰਟ ਕਿਹੜੇ ਸਵਾਲ ਵਿੱਚ ਫਿੱਟ ਬੈਠਦਾ ਹੈ:

ਸਵਾਲ

ਅਨੁਕੂਲ ਗ੍ਰਾਫਿਕ

ਕੀ ਦਿਖਾਉਂਦਾ ਹੈ

ਇੱਕ ਸਿੰਗਲ ਵੇਰੀਏਬਲ ਦੀ ਵੰਡ

ਹਿਸਟੋਗ੍ਰਾਮ / KDE

ਆਕਾਰ, ਤਿੱਖਾਪਨ, ਸਿਰਿਆਂ ਦੀ ਗਿਣਤੀ

ਕੇਂਦਰ ਅਤੇ ਬਾਹਰੀ

ਬਾਕਸ ਪਲਾਟ

ਮਾਧਿਅਮ, ਚੌਥਾਈ, ਆਊਟਲੀਅਰ

ਦੋ ਨੰਬਰਾਂ ਦਾ ਰਿਸ਼ਤਾ

ਸਕੈਟਰ ਚਾਰਟ

ਦਿਸ਼ਾ, ਤਾਕਤ, ਵਕਰਤਾ

ਸ਼੍ਰੇਣੀ ਦੀ ਤੁਲਨਾ

ਬਾਰ ਚਾਰਟ

ਸਮੂਹਾਂ ਵਿੱਚ ਅੰਤਰ

ਸਮੇਂ ਦੇ ਨਾਲ ਬਦਲਣਾ

ਲਾਈਨ ਚਾਰਟ

ਰੁਝਾਨ, ਮੌਸਮੀ

ਬਹੁ-ਵਿਭਿੰਨ ਸਬੰਧ

ਸਬੰਧ ਗਰਮੀ ਦਾ ਨਕਸ਼ਾ

ਆਮ ਸਬੰਧ ਮੈਟ੍ਰਿਕਸ

ਸਿਮਪਸਨ ਦਾ ਵਿਰੋਧਾਭਾਸ: ਏਕੀਕ੍ਰਿਤ ਡੇਟਾ ਝੂਠ ਬੋਲ ਸਕਦਾ ਹੈ

EDA ਵਿੱਚ ਇੱਕ ਗੁਪਤ ਜਾਲ ਜਿਸ ਬਾਰੇ ਸੁਚੇਤ ਹੋਣਾ ਹੈ ਸਿਮਪਸਨ ਦਾ ਵਿਰੋਧਾਭਾਸ ਹੈ: ਇੱਕ ਪੈਟਰਨ ਇੱਕ ਦਿਸ਼ਾ ਦਿਖਾ ਸਕਦਾ ਹੈ ਜਦੋਂ ਸਾਰੇ ਡੇਟਾ ਦੀ ਇਕੱਠੇ ਜਾਂਚ ਕੀਤੀ ਜਾਂਦੀ ਹੈ, ਪਰ ਜਦੋਂ ਡੇਟਾ ਨੂੰ ਅਰਥਪੂਰਨ ਉਪ ਸਮੂਹਾਂ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ ਤਾਂ ਉਲਟਾ ਹੁੰਦਾ ਹੈ। ਕਲਾਸਿਕ ਉਦਾਹਰਨ: ਇੱਕ ਯੂਨੀਵਰਸਿਟੀ ਵਿੱਚ ਔਰਤ ਬਿਨੈਕਾਰਾਂ ਲਈ ਸਮੁੱਚੀ ਸਵੀਕ੍ਰਿਤੀ ਦਰ ਮਰਦਾਂ ਨਾਲੋਂ ਘੱਟ ਜਾਪਦੀ ਹੈ; ਪਰ ਜਦੋਂ ਵਿਭਾਗ ਦੇ ਹਿਸਾਬ ਨਾਲ ਦੇਖਿਆ ਜਾਵੇ ਤਾਂ ਜ਼ਿਆਦਾਤਰ ਵਿਭਾਗਾਂ ਵਿੱਚ ਔਰਤਾਂ ਦੀ ਸਵੀਕ੍ਰਿਤੀ ਦਰ ਮਰਦਾਂ ਨਾਲੋਂ ਵੱਧ ਹੈ। ਕਿਥੋਂ ਦੀ? ਔਰਤਾਂ ਨੇ ਵਧੇਰੇ ਪ੍ਰਤੀਯੋਗੀ (ਘੱਟ ਸਵੀਕ੍ਰਿਤੀ ਦਰਾਂ) ਵਿਭਾਗਾਂ ਵਿੱਚ ਅਪਲਾਈ ਕੀਤਾ; ਸੰਯੁਕਤ ਸੰਖਿਆ ਇਸ ਲੁਕਵੇਂ ਵੇਰੀਏਬਲ ਨੂੰ ਸਟੋਰ ਕਰਦੀ ਹੈ। ਸਬਕ ਸਪਸ਼ਟ ਹੈ: ਕੁੱਲ ਜਾਂ ਔਸਤ ਨੂੰ ਦੇਖਦੇ ਸਮੇਂ, ਇਹ ਜਾਂਚ ਕਰਨਾ ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਕੀ ਉਹ ਸੰਖਿਆ ਉਹੀ ਕਹਾਣੀ ਦੱਸਦੀ ਹੈ ਜਦੋਂ ਅਰਥਪੂਰਨ ਉਪ ਸਮੂਹਾਂ (ਖੰਡ, ਮਿਆਦ, ਚੈਨਲ) ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ। ਜਦੋਂ AI ਤੁਹਾਨੂੰ ਇੱਕ ਸੰਯੁਕਤ ਦਰ ਦਿੰਦਾ ਹੈ, ਇਹ ਪੁੱਛਣਾ ਕਿ "ਕੀ ਇਹ ਅਜੇ ਵੀ ਵੈਧ ਹੈ ਜਦੋਂ ਤੁਸੀਂ ਇਸਨੂੰ ਵੰਡਦੇ ਹੋ" ਸਭ ਤੋਂ ਗੁੰਮਰਾਹਕੁੰਨ ਨਤੀਜੇ ਛੇਤੀ ਹੀ ਫੜੇਗਾ।

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 - ਦੋ ਲੁਕੀਆਂ ਪਹਾੜੀਆਂ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ ਔਸਤ ਗਾਹਕ ਦੀ ਉਮਰ 41 ਪਾਈ ਅਤੇ ਇਸਨੂੰ "ਮੱਧ-ਉਮਰ ਦੀ ਭੀੜ" ਵਜੋਂ ਰਿਪੋਰਟ ਕੀਤਾ। ਪਰ ਹਿਸਟੋਗ੍ਰਾਮ ਨੇ ਦੋ ਸਿਖਰਾਂ ਨੂੰ ਦਿਖਾਇਆ: 22-28 ਅਤੇ 55-62 ਉਮਰ ਸਮੂਹ। ਔਸਤ 41 ਅਸਲ ਵਿੱਚ ਕਿਸੇ ਦੀ ਨੁਮਾਇੰਦਗੀ ਨਹੀਂ ਕਰਦੇ ਸਨ। ਸਬਕ: ਮੱਧਮਾਨ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਵੰਡ ਨੂੰ ਪਲਾਟ ਕਰੋ।

ਕੇਸ 2 - ਨਕਲੀ ਸਬੰਧ। ਇੱਕ ਟੀਮ ਨੇ "ਵਿਗਿਆਪਨ ਖਰਚ" ਅਤੇ "ਵਿਕਰੀ" ਵਿਚਕਾਰ ਇੱਕ 0.78 ਸਬੰਧ ਪਾਇਆ ਅਤੇ ਬਜਟ ਨੂੰ ਦੁੱਗਣਾ ਕਰ ਦਿੱਤਾ। ਹਾਲਾਂਕਿ, ਜਿਸਨੇ ਦੋਵਾਂ ਨੂੰ ਚਾਲੂ ਕੀਤਾ ਉਹ ਮੌਸਮੀ ਮੁਹਿੰਮਾਂ ਸਨ; ਮੁਹਿੰਮ ਤੋਂ ਬਾਹਰ ਦੀ ਮਿਆਦ ਦੇ ਦੌਰਾਨ, ਰਿਸ਼ਤਾ 0.10 ਤੱਕ ਘੱਟ ਗਿਆ। 340 ਹਜ਼ਾਰ TL ਵਾਧੂ ਇਸ਼ਤਿਹਾਰਾਂ ਨੇ ਉਮੀਦ ਕੀਤੀ ਵਾਪਸੀ ਨਹੀਂ ਦਿੱਤੀ। ਸਬਕ: ਕਾਰਨ ਲਈ ਗਲਤ ਸਬੰਧ ਮਹਿੰਗਾ ਹੈ।

ਕੇਸ 3 - ਇਕੱਲੇ ਵਿਰੋਧੀ ਦੁਆਰਾ ਖਿੱਚੀ ਗਈ ਲਾਈਨ। ਇੱਕ ਰੀਅਲ ਅਸਟੇਟ ਵਿਸ਼ਲੇਸ਼ਣ ਨੇ ਵਰਗ ਫੁਟੇਜ ਅਤੇ ਕੀਮਤ (r=0.80) ਵਿਚਕਾਰ ਇੱਕ ਮਜ਼ਬੂਤ ​​ਸਬੰਧ ਦਿਖਾਇਆ। ਜਦੋਂ ਸਕੈਟਰ ਪਲਾਟ ਖਿੱਚਿਆ ਗਿਆ ਸੀ, ਲਗਭਗ ਸਾਰਾ ਰਿਸ਼ਤਾ ਇੱਕ ਸਿੰਗਲ 12 ਮਿਲੀਅਨ TL ਲਗਜ਼ਰੀ ਵਿਲਾ ਦੁਆਰਾ ਬਣਾਇਆ ਗਿਆ ਸੀ; ਜਦੋਂ ਉਸ ਬਿੰਦੂ ਨੂੰ ਹਟਾ ਦਿੱਤਾ ਗਿਆ, ਤਾਂ ਸਬੰਧ 0.31 ਤੱਕ ਘਟ ਗਿਆ। ਪਾਠ: ਹਮੇਸ਼ਾ ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਨਾਲ-ਨਾਲ ਸਬੰਧ ਨੂੰ ਪੜ੍ਹੋ।

ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ

1) ਆਟੋਮੈਟਿਕ EDA ਸੰਖੇਪ:

ਮੇਰੇ ਕੋਲ ਪਾਂਡਾ ਡੀ.ਐਫ. ਕੋਡ ਲਿਖੋ ਜੋ ਪੈਦਾ ਕਰਦਾ ਹੈ: (1) df.info() ਅਤੇ df.describe(), (2) ਹਰੇਕ ਅੰਕੀ ਕਾਲਮ ਲਈ ਹਿਸਟੋਗ੍ਰਾਮ, (3) ਹਰੇਕ ਸ਼੍ਰੇਣੀ ਵਾਲੇ ਕਾਲਮ ਲਈ ਗਿਣਤੀ। ਟਿੱਪਣੀ ਨਾ ਕਰੋ, ਸਿਰਫ਼ ਖੋਜ ਕੋਡ ਤਿਆਰ ਕਰੋ; ਮੈਂ ਪੈਟਰਨਾਂ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹਾਂ।

2) ਸਬੰਧ + ਵਿਜ਼ੂਅਲ (ਕਾਰਨ ਦੀ ਚੇਤਾਵਨੀ ਦੇ ਨਾਲ):

ਕੋਡ ਲਿਖੋ ਜੋ ਸੰਖਿਆਤਮਕ ਕਾਲਮਾਂ ਲਈ ਇੱਕ ਸਬੰਧ ਮੈਟ੍ਰਿਕਸ ਅਤੇ ਇੱਕ ਹੀਟ ਮੈਪ ਖਿੱਚਦਾ ਹੈ। 3 ਸਭ ਤੋਂ ਉੱਚੇ ਸੰਬੰਧਤ ਜੋੜਿਆਂ ਦਾ ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਵੀ ਖਿੱਚੋ। ਆਉਟਪੁੱਟ ਵਿੱਚ ਇੱਕ ਟਿੱਪਣੀ ਲਾਈਨ ਸ਼ਾਮਲ ਕਰੋ ਜੋ ਤੁਹਾਨੂੰ ਯਾਦ ਦਿਵਾਉਂਦਾ ਹੈ ਕਿ ਸਬੰਧ ਕਾਰਨ ਦਾ ਮਤਲਬ ਨਹੀਂ ਹੈ। ਕਾਰਨ ਦੇ ਦਾਅਵੇ ਨਾ ਕਰੋ।

3) ਵੰਡ ਨਿਦਾਨ:

"ਇਨਕਮ_ਟੀਐਲ" ਕਾਲਮ ਲਈ: ਕੋਡ ਲਿਖੋ ਜੋ ਹਿਸਟੋਗ੍ਰਾਮ, ਬਾਕਸ ਪਲਾਟ, ਸਕਿਊਨੈੱਸ ਵੈਲਯੂ ਅਤੇ ਮੱਧਮਾਨ/ਔਸਤ ਤੁਲਨਾ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਮੈਂ ਵਿਆਖਿਆ ਕਰਾਂਗਾ ਕਿ ਕੀ ਵੰਡ ਤਿੱਖੀ ਹੈ ਜਾਂ ਨਹੀਂ; ਬਸ ਕੋਡ ਦਿਓ।

4) ਹਿੱਸੇ ਦੀ ਤੁਲਨਾ:

"ਚੈਨਲ" (ਵੈੱਬ/ਮੋਬਾਈਲ) ਦੁਆਰਾ ਗਾਹਕਾਂ ਦੀ ਤੁਲਨਾ ਕਰੋ: ਕੋਡ ਲਿਖੋ ਜੋ ਔਸਤ ਰਕਮ, ਔਸਤ ਰਕਮ, ਆਰਡਰਾਂ ਦੀ ਗਿਣਤੀ, ਅਤੇ ਹਰੇਕ ਚੈਨਲ ਲਈ ਰਕਮ ਦੀ ਵੰਡ ਦਾ ਇੱਕ ਬਾਕਸਪਲਾਟ ਤਿਆਰ ਕਰਦਾ ਹੈ। ਸੁਝਾਅ ਦਿਓ ਕਿ ਦੋ ਚੈਨਲਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਦੇ ਅੰਕੜਾਤਮਕ ਮਹੱਤਤਾ ਲਈ ਕਿਹੜਾ ਟੈਸਟ ਢੁਕਵਾਂ ਹੈ, ਪਰ ਫੈਸਲਾ ਮੇਰੇ 'ਤੇ ਹੈ।

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:

ਇਸ ਡੇਟਾ ਵਿੱਚ ਕੁਝ ਦਿਲਚਸਪ ਲੱਭੋ.

"ਦਿਲਚਸਪ" ਪਰਿਭਾਸ਼ਿਤ ਹੈ; AI ਡਾਟਾ ਨਹੀਂ ਦੇਖਦਾ, ਇਸਲਈ ਇਹ ਜਾਂ ਤਾਂ ਇਸਨੂੰ ਬਣਾਉਂਦਾ ਹੈ ਜਾਂ ਆਮ ਬਿਆਨ ਦਿੰਦਾ ਹੈ। ਕੋਈ ਦਿਸ਼ਾ ਨਹੀਂ, ਕੋਈ ਪਰਿਵਰਤਨ ਨਹੀਂ, ਕੋਈ ਉਦੇਸ਼ ਨਹੀਂ ਹੈ।

ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:

ਤੁਹਾਡੀ ਭੂਮਿਕਾ: EDA ਸਹਾਇਕ। df ਕਾਲਮ: ਉਮਰ (int), ਆਮਦਨ_tl (ਫਲੋਟ), ਸ਼ਹਿਰ (ਸ਼੍ਰੇਣੀ), ਚੈਨਲ (ਵੈੱਬ/ਮੋਬਾਈਲ), ਰਕਮ (ਫਲੋਟ)। ਉਦੇਸ਼: "ਰਾਤ" ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਨ ਵਾਲੇ ਕਾਰਕਾਂ ਦੀ ਖੋਜ ਕਰਨਾ। ਟਾਸਕ: (1) ਰਕਮ ਦੀ ਵੰਡ ਦਾ ਕੋਡ, (2) ਰਕਮ ਅਤੇ ਉਮਰ ਅਤੇ ਆਮਦਨ ਦੇ ਵਿਚਕਾਰ ਵੰਡ ਗ੍ਰਾਫ਼, (3) ਚੈਨਲ ਟੁੱਟਣ ਵਿੱਚ ਰਕਮ ਦਾ ਬਾਕਸ ਪਲਾਟ। ਇੱਕ ਕਾਰਣ ਦਾਅਵੇ ਦੀ ਸਥਾਪਨਾ; ਬਸ ਖੋਜ ਕੋਡ ਤਿਆਰ ਕਰੋ ਅਤੇ ਮੈਂ ਪੈਟਰਨ ਦੀ ਵਿਆਖਿਆ ਕਰਾਂਗਾ।

ਇੱਥੇ, ਉਦੇਸ਼, ਪਰਿਵਰਤਨਸ਼ੀਲਤਾ ਅਤੇ "ਦਾਅਵੇ ਦੇ ਕਾਰਨ" ਦੀ ਸੀਮਾ ਸਪਸ਼ਟ ਹੈ।

ਆਮ ਗਲਤੀਆਂ

  • ਸਿਰਫ਼ ਸੰਖੇਪ ਅੰਕੜਿਆਂ 'ਤੇ ਭਰੋਸਾ ਕਰਨਾ। ਜਿਵੇਂ ਕਿ Anscombe Quartet ਦਿਖਾਉਂਦਾ ਹੈ, ਇੱਕੋ ਮਤਲਬ ਬਹੁਤ ਵੱਖਰੀਆਂ ਵੰਡਾਂ ਨੂੰ ਲੁਕਾਉਂਦਾ ਹੈ; ਚਾਰਟ ਵੇਖੋ.
  • ਕਾਰਣ ਲਈ ਗਲਤ ਸੰਬੰਧ. ਸਹਿ-ਕਿਰਿਆ ਇਹ ਨਹੀਂ ਦਰਸਾਉਂਦੀ ਕਿ ਇੱਕ ਦੂਜੇ ਵੱਲ ਲੈ ਜਾਂਦਾ ਹੈ; ਲੁਕਵੇਂ ਵੇਰੀਏਬਲ ਤੋਂ ਸਾਵਧਾਨ ਰਹੋ।
  • ਬਿਨਾਂ ਕਿਸੇ ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਸਬੰਧਾਂ ਨੂੰ ਦੇਖਦੇ ਹੋਏ। ਇੱਕ ਸਿੰਗਲ ਆਊਟਲੀਅਰ ਜਾਂ ਵਕਰੀਕਰਨ ਨੰਬਰ ਨੂੰ ਗੁੰਮਰਾਹ ਕਰਦਾ ਹੈ।
  • ਮੱਧਮਾਨ ਦੇ ਨਾਲ ਇੱਕ ਦੋ-ਪੀਕਡ/ਸਿਕਿਊਡ ਵੰਡ ਦਾ ਸਾਰ ਦੇਣਾ। ਔਸਤ ਕਿਸੇ ਦੀ ਨੁਮਾਇੰਦਗੀ ਨਹੀਂ ਕਰ ਸਕਦਾ।
  • EDA ਨੂੰ ਛੱਡਣਾ ਅਤੇ ਸਿੱਧਾ ਮਾਡਲ 'ਤੇ ਜਾਣਾ। ਅਣਪਛਾਤੇ ਡੇਟਾ ਦਾ ਅਰਥ ਹੈ ਅੰਨ੍ਹੇ ਮਾਡਲ।
ਸੁਝਾਅ: ਹਰੇਕ ਨਵੇਂ ਡੇਟਾ ਸੈੱਟ ਦੇ ਨਾਲ, ਪਹਿਲੇ 30 ਮਿੰਟਾਂ ਨੂੰ ਸਿਰਫ਼ ਗ੍ਰਾਫ਼ ਖਿੱਚਣ ਵਿੱਚ ਬਿਤਾਓ: ਹਰੇਕ ਸੰਖਿਆ ਦਾ ਹਿਸਟੋਗ੍ਰਾਮ, ਮਹੱਤਵਪੂਰਨ ਜੋੜਿਆਂ ਦਾ ਸਕੈਟਰ ਪਲਾਟ, ਸ਼੍ਰੇਣੀਆਂ ਦਾ ਬਾਰ ਚਾਰਟ। ਇਹ 30 ਮਿੰਟ ਆਉਣ ਵਾਲੇ ਦਿਨਾਂ ਲਈ ਭਵਿੱਖ ਦੀਆਂ ਮਾਡਲਿੰਗ ਗਲਤੀਆਂ ਨੂੰ ਰੋਕਦੇ ਹਨ।

ਸੰਖੇਪ ਵਿੱਚ

EDA ਇੱਕ ਮਾਡਲ ਬਣਾਉਣ ਤੋਂ ਪਹਿਲਾਂ ਡੇਟਾ ਨੂੰ ਜਾਣਨ ਦਾ ਪੜਾਅ ਹੈ ਅਤੇ ਚਾਰ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਮੰਗਦਾ ਹੈ: ਵੰਡ, ਕੇਂਦਰ-ਪ੍ਰਸਾਰ, ਰਿਸ਼ਤੇ ਅਤੇ ਵਿਗਾੜ। ਸੰਖੇਪ ਅੰਕੜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋ ਸਕਦੇ ਹਨ; ਗ੍ਰਾਫ ਨੂੰ ਦੇਖਣਾ ਲਾਜ਼ਮੀ ਹੈ (ਐਨਸਕੋਮਬ ਲੈਕਚਰ)। ਸਬੰਧ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਾਧਨ ਹੈ, ਪਰ ਕਾਰਣ ਨਹੀਂ ਹੈ ਅਤੇ ਯਕੀਨੀ ਤੌਰ 'ਤੇ ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਦੇ ਨਾਲ ਪੜ੍ਹਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। AI ਗ੍ਰਾਫਿਕਸ ਅਤੇ ਕੋਡ ਲਿਖਣ ਦਾ ਸੁਝਾਅ ਦੇਣ ਲਈ ਇੱਕ ਵਧੀਆ ਐਕਸਲੇਟਰ ਹੈ; ਪਰ ਲੋਕ ਆਪਣੇ ਖੇਤਰ ਦੇ ਗਿਆਨ ਨਾਲ ਵਿਆਖਿਆ ਕਰਦੇ ਹਨ ਕਿ ਉਹ ਜੋ ਪੈਟਰਨ ਦੇਖਦੇ ਹਨ ਉਹ ਅਸਲ ਹੈ ਜਾਂ ਇੱਕ ਇਤਫ਼ਾਕ ਹੈ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਇੱਕ ਡੇਟਾਸੈਟ ਚੁਣੋ ਅਤੇ ਸਿਰਫ EDA ਕਰੋ: ਘੱਟੋ-ਘੱਟ ਤਿੰਨ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲਾਂ ਦਾ ਇੱਕ ਹਿਸਟੋਗ੍ਰਾਮ, ਵੇਰੀਏਬਲਾਂ ਦੇ ਦੋ ਜੋੜਿਆਂ ਦਾ ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ, ਅਤੇ ਇੱਕ ਸਹਿ-ਸੰਬੰਧ ਹੀਟ ਮੈਪ ਕੱਢੋ। ਘੱਟੋ-ਘੱਟ ਇੱਕ "ਸਰਪ੍ਰਾਈਜ਼" ਲੱਭੋ (ਜਿਵੇਂ ਕਿ ਦੋ ਸਿਖਰਾਂ ਵਾਲੀ ਵੰਡ, ਜਾਅਲੀ ਸਬੰਧਾਂ ਲਈ ਉਮੀਦਵਾਰ, ਇੱਕ ਸਿੰਗਲ ਆਊਟਲੀਅਰ ਦੁਆਰਾ ਖਿੱਚਿਆ ਗਿਆ ਰਿਸ਼ਤਾ) ਅਤੇ ਇਸਨੂੰ ਇੱਕ ਵਾਕ ਵਿੱਚ ਵਿਆਖਿਆ ਕਰੋ। ਕੋਈ ਵੀ ਕਾਰਨਾਤਮਕ ਦਾਅਵੇ ਕੀਤੇ ਬਿਨਾਂ ਲਿਖੋ।

ਚੈੱਕਲਿਸਟ

  • [ ] ਕੀ ਮੈਂ ਹਰੇਕ ਸੰਖਿਆਤਮਕ ਵੇਰੀਏਬਲ ਦੀ ਵੰਡ ਨੂੰ ਗ੍ਰਾਫ ਕੀਤਾ ਹੈ?
  • ਕੀ ਮੈਂ ਸਕੈਟਰਪਲਾਟ ਨਾਲ ਸਬੰਧਾਂ ਨੂੰ ਦੇਖਿਆ?
  • ਕੀ ਮੈਂ ਕਾਰਣ ਅਤੇ ਸਬੰਧ ਨੂੰ ਵੱਖਰਾ ਰੱਖਿਆ ਹੈ?
  • [ ] ਕੀ ਮੈਂ ਤਿੱਖੇ ਜਾਂ ਦੋ-ਪੱਕੇ ਵੰਡਾਂ ਨੂੰ ਦੇਖਿਆ ਅਤੇ ਅੰਨ੍ਹੇਵਾਹ ਮਤਲਬ 'ਤੇ ਭਰੋਸਾ ਨਹੀਂ ਕੀਤਾ?
  • ਕੀ ਮੈਂ ਆਪਣੇ EDA ਖੋਜਾਂ ਤੋਂ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਮਾਡਲਿੰਗ ਪਹਿਲੂ/ਕਲਪਨਾ ਲਿਆ ਹੈ?