ਲਾਭ:
- ਵੱਖ-ਵੱਖ ਡੇਟਾ ਸਰੋਤਾਂ (ਡੇਟਾਬੇਸ, API, ਫਾਈਲ, ਵੈਬ ਸਕ੍ਰੈਪਿੰਗ) ਅਤੇ ਹਰੇਕ ਦੇ ਨੁਕਸਾਨ ਨੂੰ ਪਛਾਣਨ ਅਤੇ ਸਕੀਮਾ ਨੂੰ ਸਹੀ ਤਰ੍ਹਾਂ ਸਮਝਣ ਦੀ ਸਮਰੱਥਾ
- ਇਹ ਮੁਲਾਂਕਣ ਕਰਕੇ ਦੁਹਰਾਉਣਯੋਗ ਨਮੂਨਾ ਲੈਣ ਦੀ ਸਮਰੱਥਾ ਕਿ ਕੀ ਨਮੂਨਾ ਆਬਾਦੀ ਅਤੇ ਚੋਣ ਪੱਖਪਾਤ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ
- ਇਕੱਠਾ ਕਰਨ ਦੇ ਪੜਾਅ 'ਤੇ ਡਾਟਾ ਲੀਕੇਜ ਨੂੰ ਖਤਮ ਕਰਨ ਅਤੇ ਹਰੇਕ ਕਾਲਮ ਵਿੱਚ 'ਕੀ ਇਹ ਮੇਰੇ ਕੋਲ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਹੋਵੇਗਾ' ਪ੍ਰਸ਼ਨ ਪੁੱਛ ਕੇ ਕਾਨੂੰਨੀ/ਨੈਤਿਕ ਸੀਮਾਵਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਦੀ ਸਮਰੱਥਾ?
ਹਰ ਵਿਸ਼ਲੇਸ਼ਣ ਤੁਹਾਡੇ ਦੁਆਰਾ ਇਕੱਤਰ ਕੀਤੇ ਗਏ ਡੇਟਾ ਦੀ ਗੁਣਵੱਤਾ ਜਿੰਨਾ ਵਧੀਆ ਹੈ। ਇੱਥੋਂ ਤੱਕ ਕਿ ਦੁਨੀਆ ਦਾ ਸਭ ਤੋਂ ਉੱਨਤ ਮਾਡਲ ਵੀ ਭਰੋਸੇਮੰਦ ਨਤੀਜੇ ਪੈਦਾ ਕਰੇਗਾ ਜੇਕਰ ਇਹ ਉਹਨਾਂ ਡੇਟਾ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ ਜੋ ਗਲਤ ਢੰਗ ਨਾਲ ਇਕੱਤਰ ਕੀਤਾ ਗਿਆ ਹੈ, ਪੱਖਪਾਤੀ ਢੰਗ ਨਾਲ ਨਮੂਨਾ ਲਿਆ ਗਿਆ ਹੈ, ਜਾਂ ਭਵਿੱਖ ਬਾਰੇ ਜਾਣਕਾਰੀ ਰੱਖਦਾ ਹੈ। ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ ਵਿੱਚ, ਇਸ ਸਿਧਾਂਤ ਨੂੰ "ਗਾਰਬੇਜ ਇਨ, ਗਾਰਬੇਜ ਆਉਟ" (ਗਾਰਬੇਜ ਇਨ, ਗਾਰਬੇਜ ਆਊਟ) ਦੇ ਰੂਪ ਵਿੱਚ ਸੰਖੇਪ ਕੀਤਾ ਗਿਆ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਡੇਟਾ ਇਕੱਤਰ ਕਰਨ ਦੇ ਪੜਾਅ ਨੂੰ ਕਵਰ ਕਰਾਂਗੇ: ਸਰੋਤ ਨੂੰ ਸਮਝਣਾ, ਨਮੂਨਾ ਲੈਣਾ, ਗੁਣਵੱਤਾ ਦੇ ਸਵਾਲ ਪੁੱਛਣੇ, ਅਤੇ ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਡੇਟਾ ਲੀਕ ਹੋਣ ਦੇ ਜੋਖਮ ਪ੍ਰਤੀ ਸੁਚੇਤ ਰਹਿਣਾ। ਇਸ ਪੜਾਅ 'ਤੇ ਨਕਲੀ ਬੁੱਧੀ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਹਾਇਤਾ ਹੈ; SQL ਪੁੱਛਗਿੱਛ ਲਿਖਦਾ ਹੈ, API ਦਸਤਾਵੇਜ਼ ਦਾ ਸਾਰ ਦਿੰਦਾ ਹੈ, ਡਾਟਾ ਇਕਰਾਰਨਾਮੇ ਦਾ ਡਰਾਫਟ ਕਰਦਾ ਹੈ। ਪਰ ਇਹ ਮਨੁੱਖ ਹੈ ਜੋ ਫੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਕਿਹੜਾ ਡੇਟਾ ਇਕੱਠਾ ਕਰਦੇ ਹੋ ਅਤੇ ਕੀ ਉਹ ਡੇਟਾ ਤੁਹਾਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ.
ਡਾਟਾ ਸਰੋਤਾਂ ਨੂੰ ਜਾਣਨਾ
ਡੇਟਾ ਵੱਖ-ਵੱਖ ਥਾਵਾਂ ਤੋਂ ਆਉਂਦਾ ਹੈ, ਅਤੇ ਹਰੇਕ ਸਰੋਤ ਦੀਆਂ ਆਪਣੀਆਂ ਕਮੀਆਂ ਹੁੰਦੀਆਂ ਹਨ। ਡਾਟਾਬੇਸ (ਸਾਰਣੀ ਵਿੱਚ ਸਟੋਰ ਕੀਤਾ ਗਿਆ ਢਾਂਚਾਗਤ ਡੇਟਾ, ਆਮ ਤੌਰ 'ਤੇ SQL ਨਾਲ ਪੁੱਛਗਿੱਛ) ਸਭ ਤੋਂ ਆਮ ਸਰੋਤ ਹੈ; ਇਹ ਭਰੋਸੇਮੰਦ ਹੈ, ਪਰ ਇਸਦੀ ਯੋਜਨਾ ਨੂੰ ਚੰਗੀ ਤਰ੍ਹਾਂ ਸਮਝਣਾ ਜ਼ਰੂਰੀ ਹੈ. API (ਐਪਲੀਕੇਸ਼ਨ ਪ੍ਰੋਗਰਾਮਿੰਗ ਇੰਟਰਫੇਸ) ਲਾਈਵ ਡੇਟਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਪਰ ਸਪੀਡ ਸੀਮਾਵਾਂ ਅਤੇ ਫਾਰਮੈਟ ਤਬਦੀਲੀਆਂ ਦਾ ਜੋਖਮ ਰੱਖਦਾ ਹੈ। ਫਾਈਲਾਂ (CSV, Excel, JSON) ਲਚਕਦਾਰ ਹਨ ਪਰ ਫਾਰਮੈਟ ਵਿੱਚ ਅਸੰਗਤਤਾ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਹੈ। ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ ਸ਼ਕਤੀਸ਼ਾਲੀ ਹੈ, ਪਰ ਇਸ ਦੀਆਂ ਕਾਨੂੰਨੀ ਅਤੇ ਨੈਤਿਕ ਸੀਮਾਵਾਂ ਹਨ; ਹਰ ਸਾਈਟ ਨੂੰ ਸਕ੍ਰੈਪ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ।
ਧਿਆਨ ਦਿਓ: ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ ਅਤੇ ਆਟੋਮੈਟਿਕ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਲਈ, ਸਾਈਟ ਦੀ ਵਰਤੋਂ ਦੀਆਂ ਸ਼ਰਤਾਂ, robots.txt ਫਾਈਲ ਅਤੇ KVKK/GDPR ਦੀ ਪਾਲਣਾ ਕਰੋ। ਅਣਅਧਿਕਾਰਤ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਨਾਲ ਕਾਨੂੰਨੀ ਜ਼ਿੰਮੇਵਾਰੀ ਬਣਦੀ ਹੈ। ਜਾਣਕਾਰੀ ਸੁਰੱਖਿਆ ਦੇ ਸੰਦਰਭ ਵਿੱਚ, ਸਿਰਫ਼ ਉਹਨਾਂ ਸਿਸਟਮਾਂ 'ਤੇ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਵਾਲੇ ਸਾਧਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ ਜਿਨ੍ਹਾਂ ਲਈ ਤੁਸੀਂ ਅਧਿਕਾਰਤ ਹੋ ਅਤੇ ਰੱਖਿਆ/ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਉਦੇਸ਼ਾਂ ਲਈ; ਅਣਅਧਿਕਾਰਤ ਪਹੁੰਚ ਜਾਂ ਸਕ੍ਰੈਪਿੰਗ ਦੀ ਮਨਾਹੀ ਹੈ।
ਸਕੀਮਾ ਨੂੰ ਸਮਝਣਾ: ਡੇਟਾ ਨਾਲ ਜਾਣੂ ਹੋਣਾ
ਇੱਕ ਡੇਟਾ ਸੈੱਟ ਇਕੱਠਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ, ਤੁਹਾਨੂੰ ਇਸਦੀ ਸਕੀਮਾ (ਕਾਲਮਾਂ ਦੇ ਨਾਮ, ਉਹਨਾਂ ਦੇ ਡੇਟਾ ਕਿਸਮਾਂ, ਉਹਨਾਂ ਦੇ ਅਰਥ, ਅਤੇ ਉਹਨਾਂ ਦੇ ਇੱਕ ਦੂਜੇ ਨਾਲ ਸਬੰਧ) ਨੂੰ ਸਮਝਣਾ ਚਾਹੀਦਾ ਹੈ। ਏਆਈ ਇੱਥੇ ਇੱਕ "ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ" ਬਣਾਉਣ ਵਿੱਚ ਬਹੁਤ ਉਪਯੋਗੀ ਹੈ - ਇੱਕ ਸਾਰਣੀ ਜੋ ਦੱਸਦੀ ਹੈ ਕਿ ਹਰੇਕ ਕਾਲਮ ਦਾ ਕੀ ਅਰਥ ਹੈ। ਪਰ AI ਦੁਆਰਾ ਜੋ ਵਿਆਖਿਆ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਉਹ ਭਵਿੱਖਬਾਣੀਆਂ ਹਨ; ਡੇਟਾ ਤਿਆਰ ਕਰਨ ਵਾਲੀ ਟੀਮ ਨਾਲ ਹਰੇਕ ਕਾਲਮ ਦੇ ਸਹੀ ਅਰਥ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ। ਉਦਾਹਰਨ ਲਈ, "ਸਥਿਤੀ" ਨਾਮਕ ਇੱਕ ਕਾਲਮ ਵਿੱਚ 0/1/2 ਹੋ ਸਕਦਾ ਹੈ; ਸਿਰਫ਼ ਸ਼ੁਰੂਆਤੀ ਟੀਮ ਹੀ ਜਾਣਦੀ ਹੈ ਕਿ ਇਹ "ਬਕਾਇਆ/ਪ੍ਰਵਾਨਿਤ/ਰੱਦ" ਹਨ ਜਾਂ ਕੁਝ ਹੋਰ।
ਹੇਠ ਦਿੱਤੀ ਸਾਰਣੀ ਮੂਲ ਸਰੋਤ ਕਿਸਮਾਂ ਅਤੇ ਸਾਵਧਾਨੀਆਂ ਦਾ ਸਾਰ ਦਿੰਦੀ ਹੈ:
ਸਰੋਤ
ਮਜ਼ਬੂਤ ਬਿੰਦੂ
ਜਾਲ
AI ਕਿਵੇਂ ਮਦਦ ਕਰਦਾ ਹੈ
SQL ਡਾਟਾਬੇਸ
ਢਾਂਚਾਗਤ, ਭਰੋਸੇਮੰਦ
ਕੰਪਲੈਕਸ JOINs
ਇੱਕ ਪੁੱਛਗਿੱਛ ਡਰਾਫਟ ਲਿਖਦਾ ਹੈ
API
ਲਾਈਵ ਡਾਟਾ
ਗਤੀ ਸੀਮਾ, ਸ਼ਕਲ ਤਬਦੀਲੀ
ਦਸਤਾਵੇਜ਼ ਦੇ ਸੰਖੇਪ, ਪੁੱਲ ਕੋਡ
CSV/ਐਕਸਲ
ਲਚਕਦਾਰ, ਤੇਜ਼
ਫਾਰਮੈਟ ਅਸੰਗਤਤਾ
ਕੋਡ ਪੜ੍ਹੋ/ਪਾਰਸ ਕਰੋ
ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ
ਵਿਆਪਕ ਪਹੁੰਚ
ਕਾਨੂੰਨੀ/ਨੈਤਿਕ ਸੀਮਾ
ਡਰਾਫਟ ਪਾਰਸਿੰਗ (ਅਧਿਕਾਰ ਦੇ ਅੰਦਰ)
ਲੌਗ/ਇਵੈਂਟ ਡੇਟਾ
ਵਿਸਤ੍ਰਿਤ
ਵੱਡੀ ਮਾਤਰਾ
ਫਿਲਟਰਿੰਗ ਪੁੱਛਗਿੱਛ
ਉਦਾਹਰਣ: ਕੀ ਹਿੱਸਾ ਪੂਰੇ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ?
ਜ਼ਿਆਦਾਤਰ ਸਮਾਂ, ਤੁਸੀਂ ਪੂਰੇ ਡੇਟਾ ਦੀ ਬਜਾਏ ਇੱਕ ਨਮੂਨੇ (ਜਨਸੰਖਿਆ ਤੋਂ ਚੁਣਿਆ ਇੱਕ ਸਬਸੈੱਟ) ਨਾਲ ਕੰਮ ਕਰਦੇ ਹੋ। ਨਾਜ਼ੁਕ ਸਵਾਲ ਇਹ ਹੈ: ਕੀ ਇਹ ਨਮੂਨਾ ਆਬਾਦੀ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ? ਚੋਣ ਪੱਖਪਾਤ ਸਭ ਤੋਂ ਆਮ ਜਾਲ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਜੇਕਰ ਤੁਸੀਂ ਸਿਰਫ਼ ਮੋਬਾਈਲ ਐਪ ਤੋਂ ਵਰਤੋਂਕਾਰਾਂ ਦਾ ਨਮੂਨਾ ਲੈਂਦੇ ਹੋ, ਤਾਂ ਤੁਸੀਂ ਵੈੱਬ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਨਹੀਂ ਦੇਖ ਸਕੋਗੇ ਅਤੇ ਤੁਹਾਡੇ ਨਤੀਜੇ ਗੁੰਮਰਾਹਕੁੰਨ ਹੋਣਗੇ। ਬੇਤਰਤੀਬੇ ਨਮੂਨੇ (ਹਰੇਕ ਰਿਕਾਰਡ ਵਿੱਚ ਚੁਣੇ ਜਾਣ ਦੀ ਬਰਾਬਰ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ) ਜ਼ਿਆਦਾਤਰ ਮਾਮਲਿਆਂ ਵਿੱਚ ਸਭ ਤੋਂ ਸੁਰੱਖਿਅਤ ਹੈ; ਪਰ ਟਾਈਮ ਸੀਰੀਜ਼ ਡੇਟਾ ਵਿੱਚ, ਸਪਲਿਟਿੰਗ ਬੇਤਰਤੀਬੇ ਦੀ ਬਜਾਏ ਕਾਲਕ੍ਰਮਿਕ ਤੌਰ 'ਤੇ ਕੀਤੀ ਜਾਂਦੀ ਹੈ (ਅਸੀਂ ਇਸਨੂੰ ਯੂਨਿਟ 7 ਅਤੇ 10 ਵਿੱਚ ਦੇਖਾਂਗੇ)।
ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਜਾਗਰੂਕਤਾ ਲੀਕ ਕਰੋ
ਡਾਟਾ ਲੀਕੇਜ ਜ਼ਿਆਦਾਤਰ ਆਫ਼ਤਾਂ ਦਾ ਸਰੋਤ ਹੈ ਅਤੇ ਆਮ ਤੌਰ 'ਤੇ ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ ਦੇ ਪੜਾਅ ਦੌਰਾਨ ਪੈਦਾ ਹੁੰਦਾ ਹੈ। ਉਦਾਹਰਨ: "ਕੀ ਇਹ ਰੱਦ ਕੀਤਾ ਗਿਆ ਸੀ" ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦੇ ਸਮੇਂ, ਜੇਕਰ ਤੁਸੀਂ ਡੇਟਾ ਵਿੱਚ "ਰੱਦ ਕਰਨ ਦੀ ਮਿਤੀ" ਕਾਲਮ ਜੋੜਦੇ ਹੋ, ਤਾਂ ਮਾਡਲ ਭਵਿੱਖ ਵਿੱਚ ਵੇਖਦਾ ਹੈ। ਇਕੱਤਰਤਾ ਦੇ ਪੜਾਅ ਦੌਰਾਨ, ਹਰੇਕ ਕਾਲਮ ਲਈ ਇੱਕ ਸਵਾਲ ਪੁੱਛੋ: "ਕੀ ਮੇਰੇ ਕੋਲ ਅਸਲ ਵਿੱਚ ਇਹ ਜਾਣਕਾਰੀ ਉਸ ਸਮੇਂ ਹੋਵੇਗੀ ਜਦੋਂ ਮੈਂ ਭਵਿੱਖਬਾਣੀ ਕਰਾਂਗਾ?" ਜੇਕਰ ਜਵਾਬ ਨਹੀਂ ਹੈ, ਤਾਂ ਉਹ ਕਾਲਮ ਲੀਕ ਹੋ ਰਿਹਾ ਹੈ। ਅਸੀਂ ਇਸ ਵਿਸ਼ੇ ਨੂੰ ਯੂਨਿਟ 10 ਵਿੱਚ ਡੂੰਘਾਈ ਨਾਲ ਕਵਰ ਕਰਾਂਗੇ; ਪਰ ਜਾਗਰੂਕਤਾ ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਸ਼ੁਰੂ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਪ੍ਰਤੀਨਿਧਤਾ ਦੀ ਸਮੱਸਿਆ। ਇੱਕ ਬੈਂਕ ਨੇ ਆਪਣੇ ਕ੍ਰੈਡਿਟ ਜੋਖਮ ਮਾਡਲ (18,500 ਰਿਕਾਰਡ) ਲਈ ਕੇਵਲ ਪ੍ਰਵਾਨਿਤ ਕਰਜ਼ਿਆਂ 'ਤੇ ਡੇਟਾ ਇਕੱਠਾ ਕੀਤਾ। ਅਸਵੀਕਾਰ ਡੇਟਾ ਵਿੱਚ ਨਹੀਂ ਸਨ। ਮਾਡਲ ਅਸਲ ਸੰਸਾਰ ਵਿੱਚ ਗਲਤ ਸੀ ਕਿਉਂਕਿ ਇਸ ਨੇ ਕਦੇ ਨਹੀਂ ਦੇਖਿਆ ਕਿ ਅਸਵੀਕਾਰ ਕਰਨ ਵਾਲੇ ਕਿਵੇਂ ਵਿਹਾਰ ਕਰਨਗੇ। ਪਾਠ: ਨਮੂਨਾ ਸਾਰੀ ਆਬਾਦੀ ਦਾ ਪ੍ਰਤੀਨਿਧ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਜਿਸ ਤੋਂ ਤੁਸੀਂ ਆਪਣਾ ਫੈਸਲਾ ਲੈ ਰਹੇ ਹੋ।
ਕੇਸ 2 - ਚੁੱਪ ਰੂਪ ਵਿੱਚ ਤਬਦੀਲੀ। ਇੱਕ ਟੀਮ ਹਰ ਰੋਜ਼ ਇੱਕ API ਤੋਂ ਕੀਮਤ ਡੇਟਾ ਖਿੱਚ ਰਹੀ ਸੀ। ਇੱਕ ਦਿਨ, API ਪ੍ਰਦਾਤਾ ਨੇ ਮੁਦਰਾ ਨੂੰ USD ਤੋਂ EUR ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ, ਪਰ ਡੋਮੇਨ ਨਾਮ ਉਹੀ ਰਿਹਾ। 12 ਦਿਨਾਂ ਲਈ ਗਲਤ ਯੂਨਿਟ ਵਿੱਚ ਡਾਟਾ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ ਸੀ; 3,200 ਲਾਈਨਾਂ ਖਰਾਬ ਸਨ। ਪਾਠ: ਨਿਯਮਤ ਤੌਰ 'ਤੇ API ਡੇਟਾ ਵਿੱਚ ਵੌਲਯੂਮ ਅਤੇ ਫਾਰਮੈਟ ਇਕਸਾਰਤਾ ਦੀ ਜਾਂਚ ਕਰੋ।
ਕੇਸ 3 - ਸ਼ੁਰੂਆਤੀ ਲੀਕੇਜ। ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਕ ਨੇ "ਮੰਥਨ" ਅਨੁਮਾਨ ਲਈ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨ ਵੇਲੇ "ਖਾਤਾ ਬੰਦ ਹੋਣ ਦਾ ਕਾਰਨ" ਕਾਲਮ ਸ਼ਾਮਲ ਕੀਤਾ। ਇਹ ਕਾਲਮ ਗਾਹਕ ਦੇ ਜਾਣ ਤੋਂ ਬਾਅਦ ਹੀ ਭਰਿਆ ਗਿਆ ਸੀ। ਮਾਡਲ ਨੇ ਟੈਸਟ ਸੈੱਟ 'ਤੇ 97% ਸ਼ੁੱਧਤਾ ਪ੍ਰਾਪਤ ਕੀਤੀ; ਇਹ ਉਤਪਾਦਨ ਵਿੱਚ ਕੰਮ ਨਹੀਂ ਕਰਦਾ ਕਿਉਂਕਿ ਉਹ ਕਾਲਮ ਪੂਰਵ ਅਨੁਮਾਨ ਸਮੇਂ ਖਾਲੀ ਸੀ। ਪਾਠ: ਹਰੇਕ ਕਾਲਮ ਤੋਂ ਇਹ ਸਵਾਲ ਪੁੱਛੋ ਕਿ "ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੇਰੇ ਕੋਲ ਹੈ?"
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਐਕਸਟਰੈਕਸ਼ਨ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਡਾਟਾ ਵਿਗਿਆਨੀ ਸਹਾਇਕ। ਹੇਠਾਂ ਇੱਕ ਸਾਰਣੀ ਦੇ ਕਾਲਮ ਨਾਮ ਅਤੇ ਨਮੂਨਾ (ਅਗਿਆਤ) ਮੁੱਲ ਹਨ। ਹਰੇਕ ਕਾਲਮ ਲਈ, ਇੱਕ ਸਾਰਣੀ ਵਿੱਚ ਇਸਦੇ ਅਨੁਮਾਨਿਤ ਅਰਥ, ਡੇਟਾਟਾਈਪ ਅਤੇ ਸੰਭਾਵੀ ਗੁਣਵੱਤਾ ਜੋਖਮਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ। ਉਹਨਾਂ ਕਾਲਮਾਂ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰੋ ਜਿਨ੍ਹਾਂ ਬਾਰੇ ਤੁਸੀਂ ਯਕੀਨੀ ਨਹੀਂ ਹੋ ਕਿ "ਪੁਸ਼ਟੀ ਲੋੜੀਂਦਾ" ਹੈ; ਮਤਲਬ ਬਣਾਉਣਾ। ਕਾਲਮ: [ਇੱਥੇ ਪੇਸਟ ਕਰੋ]
2) ਨਮੂਨਾ ਕੋਡ (ਬੇਤਰਤੀਬ, ਦੁਹਰਾਉਣ ਯੋਗ):
ਮੇਰੇ ਕੋਲ ਪਾਂਡਾ ਡੀ.ਐਫ. ਕੋਡ ਲਿਖੋ ਜੋ 200,000 ਕਤਾਰਾਂ ਵਿੱਚੋਂ ਇੱਕ ਪ੍ਰਤੀਨਿਧੀ 5% ਬੇਤਰਤੀਬ ਨਮੂਨਾ ਕੱਢਦਾ ਹੈ। random_state=42 (ਪ੍ਰੋਡਿਊਸੀਬਿਲਟੀ ਲਈ) ਦੀ ਵਰਤੋਂ ਕਰੋ। ਇਹ ਜਾਂਚ ਕਰਨ ਲਈ ਕੋਡ ਸ਼ਾਮਲ ਕਰੋ ਕਿ ਨਮੂਨੇ ਦੀ ਸ਼੍ਰੇਣੀ ਵੰਡ ਆਬਾਦੀ ਦੇ ਸਮਾਨ ਹੈ।
3) ਲੀਕ ਸਕੈਨਿੰਗ ਸਵਾਲ:
ਮੈਂ ਤੁਹਾਨੂੰ ਕਾਲਮਾਂ ਦੀ ਇਹ ਸੂਚੀ ਦੇਵਾਂਗਾ। ਮੇਰਾ ਟੀਚਾ "ਕੀ ਇਹ ਰੱਦ ਕੀਤਾ ਗਿਆ ਹੈ" (0/1) ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨਾ ਹੈ। ਹਰੇਕ ਕਾਲਮ ਲਈ, ਮੁਲਾਂਕਣ ਕਰੋ ਕਿ ਕੀ ਮੇਰੇ ਕੋਲ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਅਸਲ ਵਿੱਚ ਇਹ ਹੋਵੇਗਾ ਅਤੇ ਇਸਨੂੰ "ਸੁਰੱਖਿਅਤ / ਸ਼ੱਕੀ / ਲੀਕ" ਵਜੋਂ ਚਿੰਨ੍ਹਿਤ ਕਰੋ. ਆਪਣੇ ਤਰਕ ਨੂੰ ਇੱਕ ਵਾਕ ਵਿੱਚ ਲਿਖੋ। ਕਾਲਮ: [ਸੂਚੀ]
4) SQL ਪੁੱਲ ਪੁੱਛਗਿੱਛ ਡਰਾਫਟ:
ਮੇਰੇ ਕੋਲ PostgreSQL ਵਿੱਚ "ਆਰਡਰ" ਅਤੇ "ਗਾਹਕ" ਟੇਬਲ ਹਨ। ਇੱਕ JOIN ਪੁੱਛਗਿੱਛ ਲਿਖੋ ਜੋ ਗਾਹਕ ਸ਼ਹਿਰ ਦੇ ਨਾਲ ਪਿਛਲੇ 90 ਦਿਨਾਂ ਦੇ ਆਰਡਰਾਂ ਨੂੰ ਜੋੜਦੀ ਹੈ ਅਤੇ ਪ੍ਰਤੀ ਸ਼ਹਿਰ ਕੁੱਲ ਰਕਮ ਅਤੇ ਆਰਡਰਾਂ ਦੀ ਸੰਖਿਆ ਵਾਪਸ ਕਰਦੀ ਹੈ। ਮਿਤੀ ਫਿਲਟਰ ਅਤੇ NULL ਸ਼ਹਿਰਾਂ ਨੂੰ ਕਿਵੇਂ ਸੰਭਾਲਿਆ ਜਾਂਦਾ ਹੈ ਬਾਰੇ ਦੱਸੋ। ਮੈਂ ਪੁੱਛਗਿੱਛ ਚਲਾਵਾਂਗਾ ਅਤੇ ਇਸਦੀ ਪੁਸ਼ਟੀ ਕਰਾਂਗਾ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ:
ਮੈਨੂੰ ਇਸ ਡੇਟਾਬੇਸ ਤੋਂ ਇੱਕ ਵਧੀਆ ਨਮੂਨਾ ਡੇਟਾ ਖਿੱਚੋ.
"ਚੰਗਾ" ਅਸਪਸ਼ਟ ਹੈ; ਕਿਹੜੀ ਪੇਂਟਿੰਗ, ਕਿਹੜਾ ਪੀਰੀਅਡ, ਕਿਹੜਾ ਆਕਾਰ, ਕਿਹੜਾ ਮਕਸਦ ਸਪੱਸ਼ਟ ਨਹੀਂ ਹੈ। AI ਸਿਰਫ ਇੱਕ ਆਮ, ਸੰਭਵ ਤੌਰ 'ਤੇ ਗਲਤ ਪੁੱਛਗਿੱਛ ਪੈਦਾ ਕਰੇਗਾ।
ਸ਼ਕਤੀਸ਼ਾਲੀ ਪ੍ਰਾਉਟ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: SQL ਸਹਾਇਕ। ਮੇਰੇ ਕੋਲ ਇੱਕ "ਲੈਣ-ਦੇਣ" ਸਾਰਣੀ ਹੈ: ਕਾਲਮ id, customer_id, ਮਿਤੀ (ਟਾਈਮਸਟੈਂਪ), ਰਕਮ (ਸੰਖਿਆਤਮਕ), ਚੈਨਲ (ਟੈਕਸਟ: 'ਵੈੱਬ'/'ਮੋਬਾਈਲ')। ਕਾਰਜ: ਇੱਕ ਦੁਹਰਾਉਣਯੋਗ (ORDER BY ਨਾਲ ਨਿਰਧਾਰਿਤ) ਪੁੱਛਗਿੱਛ ਲਿਖੋ ਜੋ ਸਾਲ 2024 ਲਈ ਹਰੇਕ ਚੈਨਲ ਤੋਂ 10,000 ਪ੍ਰਤੀਨਿਧ ਕਤਾਰਾਂ ਵਾਪਸ ਕਰਦੀ ਹੈ। ਉਦੇਸ਼: ਚੈਨਲ ਤੁਲਨਾਤਮਕ ਵਿਸ਼ਲੇਸ਼ਣ। ਆਪਣੀ ਪੁੱਛਗਿੱਛ ਦੀਆਂ ਧਾਰਨਾਵਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ।
ਇੱਥੇ ਸਾਰਣੀ, ਉਦੇਸ਼, ਆਕਾਰ ਅਤੇ ਦੁਹਰਾਉਣਯੋਗਤਾ ਸਪੱਸ਼ਟ ਹੈ।
ਆਮ ਗਲਤੀਆਂ
- ਨਮੂਨੇ ਦੀ ਪ੍ਰਤੀਨਿਧਤਾ 'ਤੇ ਸਵਾਲ ਨਹੀਂ ਉਠਾਉਣਾ. ਆਸਾਨੀ ਨਾਲ ਪਹੁੰਚਯੋਗ ਡੇਟਾ ਸਹੀ ਡੇਟਾ ਨਹੀਂ ਹੈ; ਚੋਣ ਪੱਖਪਾਤ ਨਤੀਜੇ ਨੂੰ ਵਿਗਾੜਦਾ ਹੈ।
- AI ਲਈ ਕਾਲਮ ਦੇ ਅਰਥਾਂ ਨੂੰ ਅਨੁਕੂਲਿਤ ਕਰਨਾ। ਸਰੋਤ ਟੀਮ ਅਰਥ ਜਾਣਦੀ ਹੈ; ਇਸਦੀ ਪੁਸ਼ਟੀ ਕੀਤੇ ਬਿਨਾਂ AI ਪੂਰਵ ਅਨੁਮਾਨ ਦੀ ਵਰਤੋਂ ਨਾ ਕਰੋ।
- API ਫਾਰਮੈਟ/ਯੂਨਿਟ ਤਬਦੀਲੀ ਨੂੰ ਟਰੈਕ ਨਹੀਂ ਕੀਤਾ ਜਾ ਰਿਹਾ। ਚੁੱਪ ਤਬਦੀਲੀ ਦਿਨਾਂ ਲਈ ਭ੍ਰਿਸ਼ਟ ਡੇਟਾ ਨੂੰ ਇਕੱਠਾ ਕਰਦੀ ਹੈ.
- ਸੰਗ੍ਰਹਿ ਦੇ ਪੜਾਅ 'ਤੇ ਲੀਕ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ. ਜੇ ਸਵਾਲ "ਕੀ ਇਹ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਮੇਰੇ ਕੋਲ ਹੈ" ਨੂੰ ਜਲਦੀ ਨਹੀਂ ਪੁੱਛਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਮਾਡਲ ਝੂਠੀ ਸਫਲਤਾ ਦੇਵੇਗਾ.
- ਅਣਅਧਿਕਾਰਤ ਜਾਂ ਗੈਰ-ਕਾਨੂੰਨੀ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨਾ। robots.txt, ਵਰਤੋਂ ਦੀਆਂ ਸ਼ਰਤਾਂ ਅਤੇ KVKK ਦੀ ਉਲੰਘਣਾ ਇੱਕ ਗੰਭੀਰ ਖਤਰਾ ਹੈ।
ਸੁਝਾਅ: ਹਰੇਕ ਨਵੇਂ ਡੇਟਾ ਸਰੋਤ ਲਈ ਇੱਕ ਪੰਨੇ ਦਾ “ਡਾਟਾ ਕਾਰਡ” ਰੱਖੋ: ਸਰੋਤ, ਪੁੱਲ ਮਿਤੀ, ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ, ਜਾਣੀਆਂ ਗਈਆਂ ਸੀਮਾਵਾਂ, ਅਤੇ ਕਾਲਮ ਲੀਕ ਹੋਣ ਦੇ ਜੋਖਮ ਵਿੱਚ। ਇਹ ਕਾਰਡ ਮਹੀਨਿਆਂ ਬਾਅਦ "ਇਹ ਡੇਟਾ ਕੀ ਸੀ" ਪ੍ਰਸ਼ਨ ਅਤੇ ਪ੍ਰਜਨਨਯੋਗਤਾ ਨੂੰ ਸੁਰੱਖਿਅਤ ਕਰਦਾ ਹੈ।
ਸੰਖੇਪ ਵਿੱਚ
ਵਿਸ਼ਲੇਸ਼ਣ ਦੀ ਗੁਣਵੱਤਾ ਇਕੱਤਰ ਕੀਤੇ ਡੇਟਾ ਦੀ ਗੁਣਵੱਤਾ ਦੁਆਰਾ ਸੀਮਿਤ ਹੈ. ਸਰੋਤ (ਡੇਟਾਬੇਸ, API, ਫਾਈਲ, ਸਕ੍ਰੈਪ) ਅਤੇ ਸਕੀਮਾ ਨੂੰ ਚੰਗੀ ਤਰ੍ਹਾਂ ਜਾਣੋ; ਯਕੀਨੀ ਬਣਾਓ ਕਿ ਨਮੂਨਾ ਆਬਾਦੀ ਦਾ ਪ੍ਰਤੀਨਿਧ ਹੈ; ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਪੁੱਛ ਕੇ ਪਹਿਲੇ ਦਿਨ ਤੋਂ ਲੀਕੇਜ ਨੂੰ ਖਤਮ ਕਰੋ "ਕੀ ਇਹ ਮੇਰੇ ਕੋਲ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮੇਂ ਹੈ?" AI ਪੁੱਛਗਿੱਛ ਅਤੇ ਦਸਤਾਵੇਜ਼ ਦੇ ਕੰਮ ਲਈ ਇੱਕ ਵਧੀਆ ਐਕਸਲੇਟਰ ਹੈ, ਪਰ ਮਨੁੱਖ ਇਹ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਕਿ ਕਿਹੜਾ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨਾ ਹੈ ਅਤੇ ਇਸਦੀ ਪ੍ਰਤੀਨਿਧਤਾ ਹੈ। ਅਧਿਕਾਰ, ਕਾਨੂੰਨ ਅਤੇ ਗੁਪਤਤਾ ਦੀਆਂ ਸੀਮਾਵਾਂ ਹਮੇਸ਼ਾ ਪਹਿਲਾਂ ਆਉਂਦੀਆਂ ਹਨ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਇੱਕ ਡੇਟਾ ਸਰੋਤ ਚੁਣੋ (ਤੁਹਾਡੇ ਆਪਣੇ ਕਾਰੋਬਾਰ ਜਾਂ ਕਾਲਪਨਿਕ ਤੋਂ)। ਉੱਪਰ ਦਿੱਤੇ "ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਐਕਸਟਰੈਕਸ਼ਨ" ਟੈਮਪਲੇਟ ਦੇ ਨਾਲ AI ਤੋਂ ਇੱਕ ਡੇਟਾ ਡਿਕਸ਼ਨਰੀ ਦਾ ਡਰਾਫਟ ਪ੍ਰਾਪਤ ਕਰੋ; ਫਿਰ ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਕੀ ਇਹ ਲੀਕ ਹੋ ਗਿਆ ਹੈ, ਹਰੇਕ ਕਾਲਮ ਦਾ ਹੱਥੀਂ ਮੁਲਾਂਕਣ ਕਰੋ। ਘੱਟੋ-ਘੱਟ ਇੱਕ ਸ਼ੱਕੀ/ਲੀਕ ਕਾਲਮ ਲੱਭਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ ਅਤੇ ਇੱਕ ਵਾਕ ਵਿੱਚ ਲਿਖੋ ਕਿ ਇਹ ਜੋਖਮ ਭਰਿਆ ਕਿਉਂ ਹੈ।
ਚੈੱਕਲਿਸਟ
- [ ] ਕੀ ਮੈਂ ਸਰੋਤ ਟੀਮ ਨਾਲ ਡੇਟਾ ਸਰੋਤ ਅਤੇ ਸਕੀਮਾ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਜਾਂਚ ਕੀਤੀ ਹੈ ਕਿ ਨਮੂਨਾ ਆਬਾਦੀ ਦਾ ਪ੍ਰਤੀਨਿਧ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਸਵਾਲ ਪੁੱਛਿਆ ਹੈ "ਕੀ ਇਹ ਮੇਰੇ ਕੋਲ ਅਨੁਮਾਨ ਦੇ ਸਮੇਂ ਹੋਵੇਗਾ?"
- ਕੀ ਮੈਂ ਨਮੂਨੇ ਨੂੰ ਦੁਹਰਾਉਣ ਯੋਗ (ਸਥਿਰ ਬੀਜ) ਬਣਾਇਆ ਹੈ?
- [ ] ਕੀ ਮੈਂ ਸੰਗ੍ਰਹਿ ਦੀਆਂ ਕਾਨੂੰਨੀ/ਨੈਤਿਕ (ਅਥਾਰਟੀ, robots.txt, KVKK) ਸੀਮਾਵਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ?