ਇਕਾਈਆਂ
1. ਡੇਟਾ ਸਾਇੰਸ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਜਾਣ-ਪਛਾਣ: ਵਰਕਫਲੋ, ਭੂਮਿਕਾਵਾਂ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਨੈਤਿਕਤਾ 2. ਡੇਟਾ ਸੰਗ੍ਰਹਿ ਅਤੇ ਸਰੋਤ ਸਮਝ: ਸਕੀਮਾ, ਨਮੂਨਾ, ਗੁਣਵੱਤਾ ਅਤੇ ਲੀਕ ਜਾਗਰੂਕਤਾ 3. ਡੇਟਾ ਕਲੀਨਿੰਗ ਅਤੇ ਪ੍ਰੀਪ੍ਰੋਸੈਸਿੰਗ: ਗੁੰਮ ਮੁੱਲ, ਬਾਹਰੀ ਅਤੇ ਕਿਸਮ ਰੂਪਾਂਤਰਣ 4. ਖੋਜੀ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ (EDA): ਵੰਡ, ਰਿਸ਼ਤੇ, ਅਤੇ ਸ਼ੁਰੂਆਤੀ ਸੂਝ 5. ਵਿਸ਼ੇਸ਼ਤਾ ਇੰਜੀਨੀਅਰਿੰਗ: ਵੇਰੀਐਂਟ ਤਿਆਰ ਕਰਨਾ, ਕੋਡਿੰਗ, ਸਕੇਲਿੰਗ, ਅਤੇ ਲੀਕੇਜ ਤੋਂ ਬਚਣਾ 6. ਮਾਡਲ ਬਿਲਡਿੰਗ: ਸਮੱਸਿਆ ਪਰਿਭਾਸ਼ਾ, ਐਲਗੋਰਿਦਮ ਚੋਣ, ਅਤੇ ਸਿਖਲਾਈ/ਟੈਸਟ ਸਪਲਿਟ 7. ਮਾਡਲ ਮੁਲਾਂਕਣ: ਮੈਟ੍ਰਿਕਸ, ਕ੍ਰਾਸ-ਵੈਲੀਡੇਸ਼ਨ, ਅਤੇ ਐਕਸਟ੍ਰੀਮ ਲਰਨਿੰਗ 8. ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਅਤੇ ਕਹਾਣੀ ਸੁਣਾਉਣਾ: ਸਹੀ ਗ੍ਰਾਫਿਕਸ, ਇਮਾਨਦਾਰ ਗ੍ਰਾਫਿਕਸ 9. ਕੋਡ ਜਨਰੇਸ਼ਨ: ਪਾਈਥਨ (ਪਾਂਡਾ) ਅਤੇ SQL ਨਾਲ AI-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਵਿਸ਼ਲੇਸ਼ਣ 10. ਡਾਟਾ ਲੀਕੇਜ ਅਤੇ ਰੀਪ੍ਰੋਡਸੀਬਿਲਟੀ: ਸਾਈਲੈਂਟ ਡਿਸਟਰਸ ਅਤੇ ਅਨੁਸ਼ਾਸਨ 11. MLOps ਫਾਊਂਡੇਸ਼ਨ, ਨੈਤਿਕਤਾ, ਗੋਪਨੀਯਤਾ ਅਤੇ ਜ਼ਿੰਮੇਵਾਰ ਵਿਸ਼ਲੇਸ਼ਣ
ਯੂਨਿਟ 2 / 11

ਡੇਟਾ ਸੰਗ੍ਰਹਿ ਅਤੇ ਸਰੋਤ ਸਮਝ: ਸਕੀਮਾ, ਨਮੂਨਾ, ਗੁਣਵੱਤਾ ਅਤੇ ਲੀਕ ਜਾਗਰੂਕਤਾ

ਲਾਭ:

  • ਵੱਖ-ਵੱਖ ਡੇਟਾ ਸਰੋਤਾਂ (ਡੇਟਾਬੇਸ, API, ਫਾਈਲ, ਵੈਬ ਸਕ੍ਰੈਪਿੰਗ) ਅਤੇ ਹਰੇਕ ਦੇ ਨੁਕਸਾਨ ਨੂੰ ਪਛਾਣਨ ਅਤੇ ਸਕੀਮਾ ਨੂੰ ਸਹੀ ਤਰ੍ਹਾਂ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ
  • ਇਹ ਮੁਲਾਂਕਣ ਕਰਕੇ ਦੁਹਰਾਉਣਯੋਗ ਨਮੂਨਾ ਲੈਣ ਦੀ ਸਮਰੱਥਾ ਕਿ ਕੀ ਨਮੂਨਾ ਆਬਾਦੀ ਅਤੇ ਚੋਣ ਪੱਖਪਾਤ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ
  • ਇਕੱਠਾ ਕਰਨ ਦੇ ਪੜਾਅ 'ਤੇ ਡਾਟਾ ਲੀਕੇਜ ਨੂੰ ਖਤਮ ਕਰਨ ਅਤੇ ਹਰੇਕ ਕਾਲਮ ਵਿੱਚ 'ਕੀ ਇਹ ਮੇਰੇ ਕੋਲ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਹੋਵੇਗਾ' ਪ੍ਰਸ਼ਨ ਪੁੱਛ ਕੇ ਕਾਨੂੰਨੀ/ਨੈਤਿਕ ਸੀਮਾਵਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਦੀ ਸਮਰੱਥਾ?

ਹਰ ਵਿਸ਼ਲੇਸ਼ਣ ਤੁਹਾਡੇ ਦੁਆਰਾ ਇਕੱਤਰ ਕੀਤੇ ਗਏ ਡੇਟਾ ਦੀ ਗੁਣਵੱਤਾ ਜਿੰਨਾ ਵਧੀਆ ਹੈ। ਇੱਥੋਂ ਤੱਕ ਕਿ ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਉੱਨਤ ਮਾਡਲ ਵੀ ਭਰੋਸੇਮੰਦ ਨਤੀਜੇ ਪੈਦਾ ਕਰੇਗਾ ਜੇਕਰ ਇਹ ਉਹਨਾਂ ਡੇਟਾ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ ਜੋ ਗਲਤ ਢੰਗ ਨਾਲ ਇਕੱਤਰ ਕੀਤਾ ਗਿਆ ਹੈ, ਪੱਖਪਾਤੀ ਢੰਗ ਨਾਲ ਨਮੂਨਾ ਲਿਆ ਗਿਆ ਹੈ, ਜਾਂ ਭਵਿੱਖ ਬਾਰੇ ਜਾਣਕਾਰੀ ਰੱਖਦਾ ਹੈ। ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ ਵਿੱਚ, ਇਸ ਸਿਧਾਂਤ ਨੂੰ "ਗਾਰਬੇਜ ਇਨ, ਗਾਰਬੇਜ ਆਉਟ" (ਗਾਰਬੇਜ ਇਨ, ਗਾਰਬੇਜ ਆਊਟ) ਦੇ ਰੂਪ ਵਿੱਚ ਸੰਖੇਪ ਕੀਤਾ ਗਿਆ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਡੇਟਾ ਇਕੱਤਰ ਕਰਨ ਦੇ ਪੜਾਅ ਨੂੰ ਕਵਰ ਕਰਾਂਗੇ: ਸਰੋਤ ਨੂੰ ਸਮਝਣਾ, ਨਮੂਨਾ ਲੈਣਾ, ਗੁਣਵੱਤਾ ਦੇ ਸਵਾਲ ਪੁੱਛਣੇ, ਅਤੇ ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਡੇਟਾ ਲੀਕ ਹੋਣ ਦੇ ਜੋਖਮ ਪ੍ਰਤੀ ਸੁਚੇਤ ਰਹਿਣਾ। ਇਸ ਪੜਾਅ 'ਤੇ ਨਕਲੀ ਬੁੱਧੀ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਹਾਇਤਾ ਹੈ; SQL ਪੁੱਛਗਿੱਛ ਲਿਖਦਾ ਹੈ, API ਦਸਤਾਵੇਜ਼ ਦਾ ਸਾਰ ਦਿੰਦਾ ਹੈ, ਡਾਟਾ ਇਕਰਾਰਨਾਮੇ ਦਾ ਡਰਾਫਟ ਕਰਦਾ ਹੈ। ਪਰ ਇਹ ਮਨੁੱਖ ਹੈ ਜੋ ਫੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਕਿਹੜਾ ਡੇਟਾ ਇਕੱਠਾ ਕਰਦੇ ਹੋ ਅਤੇ ਕੀ ਉਹ ਡੇਟਾ ਤੁਹਾਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ.

ਡਾਟਾ ਸਰੋਤਾਂ ਨੂੰ ਜਾਣਨਾ

ਡੇਟਾ ਵੱਖ-ਵੱਖ ਥਾਵਾਂ ਤੋਂ ਆਉਂਦਾ ਹੈ, ਅਤੇ ਹਰੇਕ ਸਰੋਤ ਦੀਆਂ ਆਪਣੀਆਂ ਕਮੀਆਂ ਹੁੰਦੀਆਂ ਹਨ। ਡਾਟਾਬੇਸ (ਸਾਰਣੀ ਵਿੱਚ ਸਟੋਰ ਕੀਤਾ ਗਿਆ ਢਾਂਚਾਗਤ ਡੇਟਾ, ਆਮ ਤੌਰ 'ਤੇ SQL ਨਾਲ ਪੁੱਛਗਿੱਛ) ਸਭ ਤੋਂ ਆਮ ਸਰੋਤ ਹੈ; ਇਹ ਭਰੋਸੇਮੰਦ ਹੈ, ਪਰ ਇਸਦੀ ਯੋਜਨਾ ਨੂੰ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸਮਝਣਾ ਜ਼ਰੂਰੀ ਹੈ. API (ਐਪਲੀਕੇਸ਼ਨ ਪ੍ਰੋਗਰਾਮਿੰਗ ਇੰਟਰਫੇਸ) ਲਾਈਵ ਡੇਟਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਪਰ ਸਪੀਡ ਸੀਮਾਵਾਂ ਅਤੇ ਫਾਰਮੈਟ ਤਬਦੀਲੀਆਂ ਦਾ ਜੋਖਮ ਰੱਖਦਾ ਹੈ। ਫਾਈਲਾਂ (CSV, Excel, JSON) ਲਚਕਦਾਰ ਹਨ ਪਰ ਫਾਰਮੈਟ ਵਿੱਚ ਅਸੰਗਤਤਾ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਹੈ। ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ, ਪਰ ਇਸ ਦੀਆਂ ਕਾਨੂੰਨੀ ਅਤੇ ਨੈਤਿਕ ਸੀਮਾਵਾਂ ਹਨ; ਹਰ ਸਾਈਟ ਨੂੰ ਸਕ੍ਰੈਪ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ।

ਧਿਆਨ ਦਿਓ: ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ ਅਤੇ ਆਟੋਮੈਟਿਕ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਲਈ, ਸਾਈਟ ਦੀ ਵਰਤੋਂ ਦੀਆਂ ਸ਼ਰਤਾਂ, robots.txt ਫਾਈਲ ਅਤੇ KVKK/GDPR ਦੀ ਪਾਲਣਾ ਕਰੋ। ਅਣਅਧਿਕਾਰਤ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਨਾਲ ਕਾਨੂੰਨੀ ਜ਼ਿੰਮੇਵਾਰੀ ਬਣਦੀ ਹੈ। ਜਾਣਕਾਰੀ ਸੁਰੱਖਿਆ ਦੇ ਸੰਦਰਭ ਵਿੱਚ, ਸਿਰਫ਼ ਉਹਨਾਂ ਸਿਸਟਮਾਂ 'ਤੇ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਵਾਲੇ ਸਾਧਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ ਜਿਨ੍ਹਾਂ ਲਈ ਤੁਸੀਂ ਅਧਿਕਾਰਤ ਹੋ ਅਤੇ ਰੱਖਿਆ/ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਉਦੇਸ਼ਾਂ ਲਈ; ਅਣਅਧਿਕਾਰਤ ਪਹੁੰਚ ਜਾਂ ਸਕ੍ਰੈਪਿੰਗ ਦੀ ਮਨਾਹੀ ਹੈ।

ਸਕੀਮਾ ਨੂੰ ਸਮਝਣਾ: ਡੇਟਾ ਨਾਲ ਜਾਣੂ ਹੋਣਾ

ਇੱਕ ਡੇਟਾ ਸੈੱਟ ਇਕੱਠਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ, ਤੁਹਾਨੂੰ ਇਸਦੀ ਸਕੀਮਾ (ਕਾਲਮਾਂ ਦੇ ਨਾਮ, ਉਹਨਾਂ ਦੇ ਡੇਟਾ ਕਿਸਮਾਂ, ਉਹਨਾਂ ਦੇ ਅਰਥ, ਅਤੇ ਉਹਨਾਂ ਦੇ ਇੱਕ ਦੂਜੇ ਨਾਲ ਸਬੰਧ) ਨੂੰ ਸਮਝਣਾ ਚਾਹੀਦਾ ਹੈ। ਏਆਈ ਇੱਥੇ ਇੱਕ "ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ" ਬਣਾਉਣ ਵਿੱਚ ਬਹੁਤ ਉਪਯੋਗੀ ਹੈ - ਇੱਕ ਸਾਰਣੀ ਜੋ ਦੱਸਦੀ ਹੈ ਕਿ ਹਰੇਕ ਕਾਲਮ ਦਾ ਕੀ ਅਰਥ ਹੈ। ਪਰ AI ਦੁਆਰਾ ਜੋ ਵਿਆਖਿਆ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਉਹ ਭਵਿੱਖਬਾਣੀਆਂ ਹਨ; ਡੇਟਾ ਤਿਆਰ ਕਰਨ ਵਾਲੀ ਟੀਮ ਨਾਲ ਹਰੇਕ ਕਾਲਮ ਦੇ ਸਹੀ ਅਰਥ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ। ਉਦਾਹਰਨ ਲਈ, "ਸਥਿਤੀ" ਨਾਮਕ ਇੱਕ ਕਾਲਮ ਵਿੱਚ 0/1/2 ਹੋ ਸਕਦਾ ਹੈ; ਸਿਰਫ਼ ਸ਼ੁਰੂਆਤੀ ਟੀਮ ਹੀ ਜਾਣਦੀ ਹੈ ਕਿ ਇਹ "ਬਕਾਇਆ/ਪ੍ਰਵਾਨਿਤ/ਰੱਦ" ਹਨ ਜਾਂ ਕੁਝ ਹੋਰ।

ਹੇਠ ਦਿੱਤੀ ਸਾਰਣੀ ਮੂਲ ਸਰੋਤ ਕਿਸਮਾਂ ਅਤੇ ਸਾਵਧਾਨੀਆਂ ਦਾ ਸਾਰ ਦਿੰਦੀ ਹੈ:

ਸਰੋਤ

ਮਜ਼ਬੂਤ ਬਿੰਦੂ

ਜਾਲ

AI ਕਿਵੇਂ ਮਦਦ ਕਰਦਾ ਹੈ

SQL ਡਾਟਾਬੇਸ

ਢਾਂਚਾਗਤ, ਭਰੋਸੇਮੰਦ

ਕੰਪਲੈਕਸ JOINs

ਇੱਕ ਪੁੱਛਗਿੱਛ ਡਰਾਫਟ ਲਿਖਦਾ ਹੈ

API

ਲਾਈਵ ਡਾਟਾ

ਗਤੀ ਸੀਮਾ, ਸ਼ਕਲ ਤਬਦੀਲੀ

ਦਸਤਾਵੇਜ਼ ਦੇ ਸੰਖੇਪ, ਪੁੱਲ ਕੋਡ

CSV/ਐਕਸਲ

ਲਚਕਦਾਰ, ਤੇਜ਼

ਫਾਰਮੈਟ ਅਸੰਗਤਤਾ

ਕੋਡ ਪੜ੍ਹੋ/ਪਾਰਸ ਕਰੋ

ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ

ਵਿਆਪਕ ਪਹੁੰਚ

ਕਾਨੂੰਨੀ/ਨੈਤਿਕ ਸੀਮਾ

ਡਰਾਫਟ ਪਾਰਸਿੰਗ (ਅਧਿਕਾਰ ਦੇ ਅੰਦਰ)

ਲੌਗ/ਇਵੈਂਟ ਡੇਟਾ

ਵਿਸਤ੍ਰਿਤ

ਵੱਡੀ ਮਾਤਰਾ

ਫਿਲਟਰਿੰਗ ਪੁੱਛਗਿੱਛ

ਉਦਾਹਰਣ: ਕੀ ਹਿੱਸਾ ਪੂਰੇ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ?

ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ, ਤੁਸੀਂ ਪੂਰੇ ਡੇਟਾ ਦੀ ਬਜਾਏ ਇੱਕ ਨਮੂਨੇ (ਜਨਸੰਖਿਆ ਤੋਂ ਚੁਣਿਆ ਇੱਕ ਸਬਸੈੱਟ) ਨਾਲ ਕੰਮ ਕਰਦੇ ਹੋ। ਨਾਜ਼ੁਕ ਸਵਾਲ ਇਹ ਹੈ: ਕੀ ਇਹ ਨਮੂਨਾ ਆਬਾਦੀ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ? ਚੋਣ ਪੱਖਪਾਤ ਸਭ ਤੋਂ ਆਮ ਜਾਲ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਜੇਕਰ ਤੁਸੀਂ ਸਿਰਫ਼ ਮੋਬਾਈਲ ਐਪ ਤੋਂ ਵਰਤੋਂਕਾਰਾਂ ਦਾ ਨਮੂਨਾ ਲੈਂਦੇ ਹੋ, ਤਾਂ ਤੁਸੀਂ ਵੈੱਬ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਨਹੀਂ ਦੇਖ ਸਕੋਗੇ ਅਤੇ ਤੁਹਾਡੇ ਨਤੀਜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋਣਗੇ। ਬੇਤਰਤੀਬੇ ਨਮੂਨੇ (ਹਰੇਕ ਰਿਕਾਰਡ ਵਿੱਚ ਚੁਣੇ ਜਾਣ ਦੀ ਬਰਾਬਰ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ) ਜ਼ਿਆਦਾਤਰ ਮਾਮਲਿਆਂ ਵਿੱਚ ਸਭ ਤੋਂ ਸੁਰੱਖਿਅਤ ਹੈ; ਪਰ ਟਾਈਮ ਸੀਰੀਜ਼ ਡੇਟਾ ਵਿੱਚ, ਸਪਲਿਟਿੰਗ ਬੇਤਰਤੀਬੇ ਦੀ ਬਜਾਏ ਕਾਲਕ੍ਰਮਿਕ ਤੌਰ 'ਤੇ ਕੀਤੀ ਜਾਂਦੀ ਹੈ (ਅਸੀਂ ਇਸਨੂੰ ਯੂਨਿਟ 7 ਅਤੇ 10 ਵਿੱਚ ਦੇਖਾਂਗੇ)।

ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਜਾਗਰੂਕਤਾ ਲੀਕ ਕਰੋ

ਡਾਟਾ ਲੀਕੇਜ ਜ਼ਿਆਦਾਤਰ ਆਫ਼ਤਾਂ ਦਾ ਸਰੋਤ ਹੈ ਅਤੇ ਆਮ ਤੌਰ 'ਤੇ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਦੇ ਪੜਾਅ ਦੌਰਾਨ ਪੈਦਾ ਹੁੰਦਾ ਹੈ। ਉਦਾਹਰਨ: "ਕੀ ਇਹ ਰੱਦ ਕੀਤਾ ਗਿਆ ਸੀ" ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦੇ ਸਮੇਂ, ਜੇਕਰ ਤੁਸੀਂ ਡੇਟਾ ਵਿੱਚ "ਰੱਦ ਕਰਨ ਦੀ ਮਿਤੀ" ਕਾਲਮ ਜੋੜਦੇ ਹੋ, ਤਾਂ ਮਾਡਲ ਭਵਿੱਖ ਵਿੱਚ ਵੇਖਦਾ ਹੈ। ਇਕੱਤਰਤਾ ਦੇ ਪੜਾਅ ਦੌਰਾਨ, ਹਰੇਕ ਕਾਲਮ ਲਈ ਇੱਕ ਸਵਾਲ ਪੁੱਛੋ: "ਕੀ ਮੇਰੇ ਕੋਲ ਅਸਲ ਵਿੱਚ ਇਹ ਜਾਣਕਾਰੀ ਉਸ ਸਮੇਂ ਹੋਵੇਗੀ ਜਦੋਂ ਮੈਂ ਭਵਿੱਖਬਾਣੀ ਕਰਾਂਗਾ?" ਜੇਕਰ ਜਵਾਬ ਨਹੀਂ ਹੈ, ਤਾਂ ਉਹ ਕਾਲਮ ਲੀਕ ਹੋ ਰਿਹਾ ਹੈ। ਅਸੀਂ ਇਸ ਵਿਸ਼ੇ ਨੂੰ ਯੂਨਿਟ 10 ਵਿੱਚ ਡੂੰਘਾਈ ਨਾਲ ਕਵਰ ਕਰਾਂਗੇ; ਪਰ ਜਾਗਰੂਕਤਾ ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਸ਼ੁਰੂ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 - ਪ੍ਰਤੀਨਿਧਤਾ ਦੀ ਸਮੱਸਿਆ। ਇੱਕ ਬੈਂਕ ਨੇ ਆਪਣੇ ਕ੍ਰੈਡਿਟ ਜੋਖਮ ਮਾਡਲ (18,500 ਰਿਕਾਰਡ) ਲਈ ਕੇਵਲ ਪ੍ਰਵਾਨਿਤ ਕਰਜ਼ਿਆਂ 'ਤੇ ਡੇਟਾ ਇਕੱਠਾ ਕੀਤਾ। ਅਸਵੀਕਾਰ ਡੇਟਾ ਵਿੱਚ ਨਹੀਂ ਸਨ। ਮਾਡਲ ਅਸਲ ਸੰਸਾਰ ਵਿੱਚ ਗਲਤ ਸੀ ਕਿਉਂਕਿ ਇਸ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖਿਆ ਕਿ ਅਸਵੀਕਾਰ ਕਰਨ ਵਾਲੇ ਕਿਵੇਂ ਵਿਹਾਰ ਕਰਨਗੇ। ਪਾਠ: ਨਮੂਨਾ ਸਾਰੀ ਆਬਾਦੀ ਦਾ ਪ੍ਰਤੀਨਿਧ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਜਿਸ ਤੋਂ ਤੁਸੀਂ ਆਪਣਾ ਫੈਸਲਾ ਲੈ ਰਹੇ ਹੋ।

ਕੇਸ 2 - ਚੁੱਪ ਰੂਪ ਵਿੱਚ ਤਬਦੀਲੀ। ਇੱਕ ਟੀਮ ਹਰ ਰੋਜ਼ ਇੱਕ API ਤੋਂ ਕੀਮਤ ਡੇਟਾ ਖਿੱਚ ਰਹੀ ਸੀ। ਇੱਕ ਦਿਨ, API ਪ੍ਰਦਾਤਾ ਨੇ ਮੁਦਰਾ ਨੂੰ USD ਤੋਂ EUR ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ, ਪਰ ਡੋਮੇਨ ਨਾਮ ਉਹੀ ਰਿਹਾ। 12 ਦਿਨਾਂ ਲਈ ਗਲਤ ਯੂਨਿਟ ਵਿੱਚ ਡਾਟਾ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ ਸੀ; 3,200 ਲਾਈਨਾਂ ਖਰਾਬ ਸਨ। ਪਾਠ: ਨਿਯਮਤ ਤੌਰ 'ਤੇ API ਡੇਟਾ ਵਿੱਚ ਵੌਲਯੂਮ ਅਤੇ ਫਾਰਮੈਟ ਇਕਸਾਰਤਾ ਦੀ ਜਾਂਚ ਕਰੋ।

ਕੇਸ 3 - ਸ਼ੁਰੂਆਤੀ ਲੀਕੇਜ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ "ਮੰਥਨ" ਅਨੁਮਾਨ ਲਈ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨ ਵੇਲੇ "ਖਾਤਾ ਬੰਦ ਹੋਣ ਦਾ ਕਾਰਨ" ਕਾਲਮ ਸ਼ਾਮਲ ਕੀਤਾ। ਇਹ ਕਾਲਮ ਗਾਹਕ ਦੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਹੀ ਭਰਿਆ ਗਿਆ ਸੀ। ਮਾਡਲ ਨੇ ਟੈਸਟ ਸੈੱਟ 'ਤੇ 97% ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕੀਤੀ; ਇਹ ਉਤਪਾਦਨ ਵਿੱਚ ਕੰਮ ਨਹੀਂ ਕਰਦਾ ਕਿਉਂਕਿ ਉਹ ਕਾਲਮ ਪੂਰਵ ਅਨੁਮਾਨ ਸਮੇਂ ਖਾਲੀ ਸੀ। ਪਾਠ: ਹਰੇਕ ਕਾਲਮ ਤੋਂ ਇਹ ਸਵਾਲ ਪੁੱਛੋ ਕਿ "ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੇਰੇ ਕੋਲ ਹੈ?"

ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ

1) ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਐਕਸਟਰੈਕਸ਼ਨ:

ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਡਾਟਾ ਵਿਗਿਆਨੀ ਸਹਾਇਕ। ਹੇਠਾਂ ਇੱਕ ਸਾਰਣੀ ਦੇ ਕਾਲਮ ਨਾਮ ਅਤੇ ਨਮੂਨਾ (ਅਗਿਆਤ) ਮੁੱਲ ਹਨ। ਹਰੇਕ ਕਾਲਮ ਲਈ, ਇੱਕ ਸਾਰਣੀ ਵਿੱਚ ਇਸਦੇ ਅਨੁਮਾਨਿਤ ਅਰਥ, ਡੇਟਾਟਾਈਪ ਅਤੇ ਸੰਭਾਵੀ ਗੁਣਵੱਤਾ ਜੋਖਮਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ। ਉਹਨਾਂ ਕਾਲਮਾਂ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰੋ ਜਿਨ੍ਹਾਂ ਬਾਰੇ ਤੁਸੀਂ ਯਕੀਨੀ ਨਹੀਂ ਹੋ ਕਿ "ਪੁਸ਼ਟੀ ਲੋੜੀਂਦਾ" ਹੈ; ਮਤਲਬ ਬਣਾਉਣਾ। ਕਾਲਮ: [ਇੱਥੇ ਪੇਸਟ ਕਰੋ]

2) ਨਮੂਨਾ ਕੋਡ (ਬੇਤਰਤੀਬ, ਦੁਹਰਾਉਣ ਯੋਗ):

ਮੇਰੇ ਕੋਲ ਪਾਂਡਾ ਡੀ.ਐਫ. ਕੋਡ ਲਿਖੋ ਜੋ 200,000 ਕਤਾਰਾਂ ਵਿੱਚੋਂ ਇੱਕ ਪ੍ਰਤੀਨਿਧੀ 5% ਬੇਤਰਤੀਬ ਨਮੂਨਾ ਕੱਢਦਾ ਹੈ। random_state=42 (ਪ੍ਰੋਡਿਊਸੀਬਿਲਟੀ ਲਈ) ਦੀ ਵਰਤੋਂ ਕਰੋ। ਇਹ ਜਾਂਚ ਕਰਨ ਲਈ ਕੋਡ ਸ਼ਾਮਲ ਕਰੋ ਕਿ ਨਮੂਨੇ ਦੀ ਸ਼੍ਰੇਣੀ ਵੰਡ ਆਬਾਦੀ ਦੇ ਸਮਾਨ ਹੈ।

3) ਲੀਕ ਸਕੈਨਿੰਗ ਸਵਾਲ:

ਮੈਂ ਤੁਹਾਨੂੰ ਕਾਲਮਾਂ ਦੀ ਇਹ ਸੂਚੀ ਦੇਵਾਂਗਾ। ਮੇਰਾ ਟੀਚਾ "ਕੀ ਇਹ ਰੱਦ ਕੀਤਾ ਗਿਆ ਹੈ" (0/1) ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨਾ ਹੈ। ਹਰੇਕ ਕਾਲਮ ਲਈ, ਮੁਲਾਂਕਣ ਕਰੋ ਕਿ ਕੀ ਮੇਰੇ ਕੋਲ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਅਸਲ ਵਿੱਚ ਇਹ ਹੋਵੇਗਾ ਅਤੇ ਇਸਨੂੰ "ਸੁਰੱਖਿਅਤ / ਸ਼ੱਕੀ / ਲੀਕ" ਵਜੋਂ ਚਿੰਨ੍ਹਿਤ ਕਰੋ. ਆਪਣੇ ਤਰਕ ਨੂੰ ਇੱਕ ਵਾਕ ਵਿੱਚ ਲਿਖੋ। ਕਾਲਮ: [ਸੂਚੀ]

4) SQL ਪੁੱਲ ਪੁੱਛਗਿੱਛ ਡਰਾਫਟ:

ਮੇਰੇ ਕੋਲ PostgreSQL ਵਿੱਚ "ਆਰਡਰ" ਅਤੇ "ਗਾਹਕ" ਟੇਬਲ ਹਨ। ਇੱਕ JOIN ਪੁੱਛਗਿੱਛ ਲਿਖੋ ਜੋ ਗਾਹਕ ਸ਼ਹਿਰ ਦੇ ਨਾਲ ਪਿਛਲੇ 90 ਦਿਨਾਂ ਦੇ ਆਰਡਰਾਂ ਨੂੰ ਜੋੜਦੀ ਹੈ ਅਤੇ ਪ੍ਰਤੀ ਸ਼ਹਿਰ ਕੁੱਲ ਰਕਮ ਅਤੇ ਆਰਡਰਾਂ ਦੀ ਸੰਖਿਆ ਵਾਪਸ ਕਰਦੀ ਹੈ। ਮਿਤੀ ਫਿਲਟਰ ਅਤੇ NULL ਸ਼ਹਿਰਾਂ ਨੂੰ ਕਿਵੇਂ ਸੰਭਾਲਿਆ ਜਾਂਦਾ ਹੈ ਬਾਰੇ ਦੱਸੋ। ਮੈਂ ਪੁੱਛਗਿੱਛ ਚਲਾਵਾਂਗਾ ਅਤੇ ਇਸਦੀ ਪੁਸ਼ਟੀ ਕਰਾਂਗਾ।

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:

ਮੈਨੂੰ ਇਸ ਡੇਟਾਬੇਸ ਤੋਂ ਇੱਕ ਵਧੀਆ ਨਮੂਨਾ ਡੇਟਾ ਖਿੱਚੋ.

"ਚੰਗਾ" ਅਸਪਸ਼ਟ ਹੈ; ਕਿਹੜੀ ਪੇਂਟਿੰਗ, ਕਿਹੜਾ ਪੀਰੀਅਡ, ਕਿਹੜਾ ਆਕਾਰ, ਕਿਹੜਾ ਮਕਸਦ ਸਪੱਸ਼ਟ ਨਹੀਂ ਹੈ। AI ਸਿਰਫ ਇੱਕ ਆਮ, ਸੰਭਵ ਤੌਰ 'ਤੇ ਗਲਤ ਪੁੱਛਗਿੱਛ ਪੈਦਾ ਕਰੇਗਾ।

ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:

ਤੁਹਾਡੀ ਭੂਮਿਕਾ: SQL ਸਹਾਇਕ। ਮੇਰੇ ਕੋਲ ਇੱਕ "ਲੈਣ-ਦੇਣ" ਸਾਰਣੀ ਹੈ: ਕਾਲਮ id, customer_id, ਮਿਤੀ (ਟਾਈਮਸਟੈਂਪ), ਰਕਮ (ਸੰਖਿਆਤਮਕ), ਚੈਨਲ (ਟੈਕਸਟ: 'ਵੈੱਬ'/'ਮੋਬਾਈਲ')। ਕਾਰਜ: ਇੱਕ ਦੁਹਰਾਉਣਯੋਗ (ORDER BY ਨਾਲ ਨਿਰਧਾਰਿਤ) ਪੁੱਛਗਿੱਛ ਲਿਖੋ ਜੋ ਸਾਲ 2024 ਲਈ ਹਰੇਕ ਚੈਨਲ ਤੋਂ 10,000 ਪ੍ਰਤੀਨਿਧ ਕਤਾਰਾਂ ਵਾਪਸ ਕਰਦੀ ਹੈ। ਉਦੇਸ਼: ਚੈਨਲ ਤੁਲਨਾਤਮਕ ਵਿਸ਼ਲੇਸ਼ਣ। ਆਪਣੀ ਪੁੱਛਗਿੱਛ ਦੀਆਂ ਧਾਰਨਾਵਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ।

ਇੱਥੇ ਸਾਰਣੀ, ਉਦੇਸ਼, ਆਕਾਰ ਅਤੇ ਦੁਹਰਾਉਣਯੋਗਤਾ ਸਪੱਸ਼ਟ ਹੈ।

ਆਮ ਗਲਤੀਆਂ

  • ਨਮੂਨੇ ਦੀ ਪ੍ਰਤੀਨਿਧਤਾ 'ਤੇ ਸਵਾਲ ਨਹੀਂ ਉਠਾਉਣਾ. ਆਸਾਨੀ ਨਾਲ ਪਹੁੰਚਯੋਗ ਡੇਟਾ ਸਹੀ ਡੇਟਾ ਨਹੀਂ ਹੈ; ਚੋਣ ਪੱਖਪਾਤ ਨਤੀਜੇ ਨੂੰ ਵਿਗਾੜਦਾ ਹੈ।
  • AI ਲਈ ਕਾਲਮ ਦੇ ਅਰਥਾਂ ਨੂੰ ਅਨੁਕੂਲਿਤ ਕਰਨਾ। ਸਰੋਤ ਟੀਮ ਅਰਥ ਜਾਣਦੀ ਹੈ; ਇਸਦੀ ਪੁਸ਼ਟੀ ਕੀਤੇ ਬਿਨਾਂ AI ਪੂਰਵ ਅਨੁਮਾਨ ਦੀ ਵਰਤੋਂ ਨਾ ਕਰੋ।
  • API ਫਾਰਮੈਟ/ਯੂਨਿਟ ਤਬਦੀਲੀ ਨੂੰ ਟਰੈਕ ਨਹੀਂ ਕੀਤਾ ਜਾ ਰਿਹਾ। ਚੁੱਪ ਤਬਦੀਲੀ ਦਿਨਾਂ ਲਈ ਭ੍ਰਿਸ਼ਟ ਡੇਟਾ ਨੂੰ ਇਕੱਠਾ ਕਰਦੀ ਹੈ.
  • ਸੰਗ੍ਰਹਿ ਦੇ ਪੜਾਅ 'ਤੇ ਲੀਕ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ. ਜੇ ਸਵਾਲ "ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੇਰੇ ਕੋਲ ਹੈ" ਨੂੰ ਜਲਦੀ ਨਹੀਂ ਪੁੱਛਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਮਾਡਲ ਝੂਠੀ ਸਫਲਤਾ ਦੇਵੇਗਾ.
  • ਅਣਅਧਿਕਾਰਤ ਜਾਂ ਗੈਰ-ਕਾਨੂੰਨੀ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨਾ। robots.txt, ਵਰਤੋਂ ਦੀਆਂ ਸ਼ਰਤਾਂ ਅਤੇ KVKK ਦੀ ਉਲੰਘਣਾ ਇੱਕ ਗੰਭੀਰ ਖਤਰਾ ਹੈ।
ਸੁਝਾਅ: ਹਰੇਕ ਨਵੇਂ ਡੇਟਾ ਸਰੋਤ ਲਈ ਇੱਕ ਪੰਨੇ ਦਾ “ਡਾਟਾ ​​ਕਾਰਡ” ਰੱਖੋ: ਸਰੋਤ, ਪੁੱਲ ਮਿਤੀ, ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ, ਜਾਣੀਆਂ ਗਈਆਂ ਸੀਮਾਵਾਂ, ਅਤੇ ਕਾਲਮ ਲੀਕ ਹੋਣ ਦੇ ਜੋਖਮ ਵਿੱਚ। ਇਹ ਕਾਰਡ ਮਹੀਨਿਆਂ ਬਾਅਦ "ਇਹ ਡੇਟਾ ਕੀ ਸੀ" ਪ੍ਰਸ਼ਨ ਅਤੇ ਪ੍ਰਜਨਨਯੋਗਤਾ ਨੂੰ ਸੁਰੱਖਿਅਤ ਕਰਦਾ ਹੈ।

ਸੰਖੇਪ ਵਿੱਚ

ਵਿਸ਼ਲੇਸ਼ਣ ਦੀ ਗੁਣਵੱਤਾ ਇਕੱਤਰ ਕੀਤੇ ਡੇਟਾ ਦੀ ਗੁਣਵੱਤਾ ਦੁਆਰਾ ਸੀਮਿਤ ਹੈ. ਸਰੋਤ (ਡੇਟਾਬੇਸ, API, ਫਾਈਲ, ਸਕ੍ਰੈਪ) ਅਤੇ ਸਕੀਮਾ ਨੂੰ ਚੰਗੀ ਤਰ੍ਹਾਂ ਜਾਣੋ; ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਨਮੂਨਾ ਆਬਾਦੀ ਦਾ ਪ੍ਰਤੀਨਿਧ ਹੈ; ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਪੁੱਛ ਕੇ ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਲੀਕੇਜ ਨੂੰ ਖਤਮ ਕਰੋ "ਕੀ ਇਹ ਮੇਰੇ ਕੋਲ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਹੈ?" AI ਪੁੱਛਗਿੱਛ ਅਤੇ ਦਸਤਾਵੇਜ਼ ਦੇ ਕੰਮ ਲਈ ਇੱਕ ਵਧੀਆ ਐਕਸਲੇਟਰ ਹੈ, ਪਰ ਮਨੁੱਖ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਕਿਹੜਾ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨਾ ਹੈ ਅਤੇ ਇਸਦੀ ਪ੍ਰਤੀਨਿਧਤਾ ਹੈ। ਅਧਿਕਾਰ, ਕਾਨੂੰਨ ਅਤੇ ਗੁਪਤਤਾ ਦੀਆਂ ਸੀਮਾਵਾਂ ਹਮੇਸ਼ਾ ਪਹਿਲਾਂ ਆਉਂਦੀਆਂ ਹਨ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਇੱਕ ਡੇਟਾ ਸਰੋਤ ਚੁਣੋ (ਤੁਹਾਡੇ ਆਪਣੇ ਕਾਰੋਬਾਰ ਜਾਂ ਕਾਲਪਨਿਕ ਤੋਂ)। ਉੱਪਰ ਦਿੱਤੇ "ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਐਕਸਟਰੈਕਸ਼ਨ" ਟੈਮਪਲੇਟ ਦੇ ਨਾਲ AI ਤੋਂ ਇੱਕ ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਦਾ ਡਰਾਫਟ ਪ੍ਰਾਪਤ ਕਰੋ; ਫਿਰ ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਕੀ ਇਹ ਲੀਕ ਹੋ ਗਿਆ ਹੈ, ਹਰੇਕ ਕਾਲਮ ਦਾ ਹੱਥੀਂ ਮੁਲਾਂਕਣ ਕਰੋ। ਘੱਟੋ-ਘੱਟ ਇੱਕ ਸ਼ੱਕੀ/ਲੀਕ ਕਾਲਮ ਲੱਭਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ ਅਤੇ ਇੱਕ ਵਾਕ ਵਿੱਚ ਲਿਖੋ ਕਿ ਇਹ ਜੋਖਮ ਭਰਿਆ ਕਿਉਂ ਹੈ।

ਚੈੱਕਲਿਸਟ

  • [ ] ਕੀ ਮੈਂ ਸਰੋਤ ਟੀਮ ਨਾਲ ਡੇਟਾ ਸਰੋਤ ਅਤੇ ਸਕੀਮਾ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ?
  • [ ] ਕੀ ਮੈਂ ਜਾਂਚ ਕੀਤੀ ਹੈ ਕਿ ਨਮੂਨਾ ਆਬਾਦੀ ਦਾ ਪ੍ਰਤੀਨਿਧ ਹੈ?
  • [ ] ਕੀ ਮੈਂ ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਸਵਾਲ ਪੁੱਛਿਆ ਹੈ "ਕੀ ਇਹ ਮੇਰੇ ਕੋਲ ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਹੋਵੇਗਾ?"
  • ਕੀ ਮੈਂ ਨਮੂਨੇ ਨੂੰ ਦੁਹਰਾਉਣ ਯੋਗ (ਸਥਿਰ ਬੀਜ) ਬਣਾਇਆ ਹੈ?
  • [ ] ਕੀ ਮੈਂ ਸੰਗ੍ਰਹਿ ਦੀਆਂ ਕਾਨੂੰਨੀ/ਨੈਤਿਕ (ਅਥਾਰਟੀ, robots.txt, KVKK) ਸੀਮਾਵਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ?