ਲਾਭ:
- ਪਾਈਪਲਾਈਨ ਦੀ ਸ਼ੁਰੂਆਤ ਵਿੱਚ ਇੱਕ ਡੇਟਾ ਪਾਈਪਲਾਈਨ (ਇਕੱਠਾ ਕਰਨਾ, ਪ੍ਰਮਾਣਿਕਤਾ, ਸਾਫ਼ ਕਰਨਾ, ਪਰਿਵਰਤਨ ਕਰਨਾ, ਵੰਡਣਾ, ਸੰਸਕਰਣ) ਅਤੇ ਸਕੀਮਾ ਪ੍ਰਮਾਣਿਕਤਾ ਲਗਾਉਣ ਦੀ ਸਮਰੱਥਾ
- ਡੇਟਾ ਲੀਕੇਜ (ਸਮੂਹ ਅਤੇ ਅਸਥਾਈ) ਨੂੰ ਰੋਕਣ ਲਈ ਖੇਤਰ ਦੇ ਅਰਥ ਅਤੇ ਵੰਡ ਦੇ ਅਧਾਰ ਤੇ ਗੁੰਮ ਮੁੱਲ ਅਤੇ ਲੇਬਲਿੰਗ ਫੈਸਲੇ ਲੈਣ ਦੀ ਸਮਰੱਥਾ
- ਡੇਟਾ ਸੰਸਕਰਣ ਅਤੇ ਬੇਤਰਤੀਬੇ ਬੀਜ ਨੂੰ ਫਿਕਸ ਕਰਕੇ ਇੱਕ ਪ੍ਰਜਨਨ ਡੇਟਾ ਬੇਸ ਬਣਾਉਣ ਦੀ ਸਮਰੱਥਾ
ਹਰੇਕ ਮਸ਼ੀਨ ਸਿਖਲਾਈ ਪ੍ਰਣਾਲੀ ਦੀ ਅਸਲ ਸ਼ਕਤੀ ਡੇਟਾ ਵਿੱਚ ਹੈ, ਮਾਡਲ ਵਿੱਚ ਨਹੀਂ। ਤਜਰਬੇਕਾਰ ਇੰਜਨੀਅਰ ਜਾਣਦੇ ਹਨ: “ਕੂੜਾ ਅੰਦਰ, ਕੂੜਾ ਬਾਹਰ” — ਇੱਥੋਂ ਤੱਕ ਕਿ ਸਭ ਤੋਂ ਉੱਨਤ ਮਾਡਲ ਖਰਾਬ ਡਾਟਾ ਫੀਡ ਕਰਨ ਵਾਲੇ ਮਾੜੇ ਨਤੀਜੇ ਵੀ ਪੈਦਾ ਕਰਨਗੇ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਡਾਟਾ ਪਾਈਪਲਾਈਨ (ਡੇਟਾ ਪਾਈਪਲਾਈਨ: ਕਦਮਾਂ ਦੀ ਲੜੀ ਜੋ ਮਾਡਲ ਸਿਖਲਾਈ ਲਈ ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਤਿਆਰ ਕਰਦੇ ਹਨ) ਦੀ ਸਥਾਪਨਾ ਕਰਦੇ ਹਾਂ ਅਤੇ ਇਹ ਸਿੱਖਦੇ ਹਾਂ ਕਿ ਇਸ ਲਾਈਨ ਦੇ ਕਿਹੜੇ ਪੜਾਅ 'ਤੇ ਅਸੀਂ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਦੀ ਸੁਰੱਖਿਅਤ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹਾਂ।
ਡਾਟਾ ਲਾਈਨ ਦੇ ਕਦਮ
ਇੱਕ ਡੇਟਾ ਲਾਈਨ ਆਮ ਤੌਰ 'ਤੇ ਇਹਨਾਂ ਸਟਾਪਾਂ ਵਿੱਚੋਂ ਲੰਘਦੀ ਹੈ:
- ਸੰਗ੍ਰਹਿ (ਅੰਗ੍ਰੇਜ਼ੀ): ਸਰੋਤਾਂ (ਡੇਟਾਬੇਸ, API, ਲੌਗ ਫਾਈਲਾਂ, ਇਵੈਂਟ ਸਟ੍ਰੀਮਜ਼) ਤੋਂ ਡੇਟਾ ਖਿੱਚਣਾ।
- ਪ੍ਰਮਾਣਿਕਤਾ: ਜਾਂਚ ਕਰ ਰਿਹਾ ਹੈ ਕਿ ਡੇਟਾ ਸੰਭਾਵਿਤ ਸਕੀਮਾ, ਕਿਸਮਾਂ ਅਤੇ ਰੇਂਜਾਂ ਦੇ ਅਨੁਕੂਲ ਹੈ ਜਾਂ ਨਹੀਂ।
- ਸਫਾਈ: ਗੁੰਮ ਮੁੱਲ, ਡੁਪਲੀਕੇਟ ਰਿਕਾਰਡ, ਆਊਟਲੀਅਰ ਅਤੇ ਅਸੰਗਤਤਾਵਾਂ ਨੂੰ ਸੰਭਾਲਣਾ।
- ਪਰਿਵਰਤਨ: ਕੱਚੇ ਡੇਟਾ ਨੂੰ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਵਿੱਚ ਬਦਲਣਾ — ਜਿਵੇਂ ਕਿ ਇੱਕ ਸ਼੍ਰੇਣੀਗਤ ਵੇਰੀਏਬਲ ਨੂੰ ਇੱਕ ਨੰਬਰ ਵਿੱਚ ਬਦਲਣਾ, ਇੱਕ ਮਿਤੀ ਤੋਂ "ਹਫ਼ਤੇ ਦਾ ਦਿਨ" ਪੈਦਾ ਕਰਨਾ।
- ਵੰਡਣਾ: ਸਿਖਲਾਈ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਟੈਸਟਿੰਗ ਸੈੱਟਾਂ ਵਿੱਚ ਵੱਖ ਕਰਨਾ।
- ਸੰਸਕਰਣ: ਰਿਕਾਰਡ ਕਰਨਾ ਕਿ ਕਿਸ ਮਾਡਲ ਨੂੰ ਕਿਸ ਡੇਟਾ ਨਾਲ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ।
ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਕੋਡ ਡਰਾਫਟ ਅਤੇ ਵਿਚਾਰ ਤਿਆਰ ਕਰਕੇ ਸਮੇਂ ਦੀ ਬਚਤ ਕਰਦੀ ਹੈ, ਖਾਸ ਤੌਰ 'ਤੇ ਕਦਮ 2, 3 ਅਤੇ 4 ਵਿੱਚ। ਪਰ ਫੈਸਲੇ ਜਿਵੇਂ ਕਿ ਕਿਹੜੇ ਰਿਕਾਰਡ ਨੂੰ ਰੱਦ ਕਰਨਾ ਹੈ, ਕਿਸ ਨੂੰ ਭਰਨਾ ਹੈ ਅਤੇ ਕਿਸ ਤਰ੍ਹਾਂ ਦਾ ਮੁੱਲ ਗੁਆਉਣਾ ਹੈ, ਉਸ ਇੰਜੀਨੀਅਰ ਨਾਲ ਸਬੰਧਤ ਹੈ ਜੋ ਡੇਟਾ ਨੂੰ ਜਾਣਦਾ ਹੈ; ਕਿਉਂਕਿ ਗਲਤ ਸਫਾਈ ਮਾਡਲ ਵਿੱਚ ਇੱਕ ਲੁਕਵੇਂ ਪੱਖਪਾਤ ਨੂੰ ਇੰਜੈਕਟ ਕਰ ਸਕਦੀ ਹੈ।
ਡਾਟਾ ਤਸਦੀਕ: ਲਾਈਨ ਦੀ ਸ਼ੁਰੂਆਤੀ ਰੱਖਿਆ
ਸਭ ਤੋਂ ਮਹਿੰਗੀਆਂ ਗਲਤੀਆਂ ਉਤਪਾਦਨ ਵਿੱਚ ਨਹੀਂ ਸ਼ੁਰੂ ਹੁੰਦੀਆਂ ਹਨ, ਪਰ ਜਿੱਥੇ ਪੁਸ਼ਟੀਕਰਨ ਪੜਾਅ ਛੱਡਿਆ ਜਾਂਦਾ ਹੈ। ਸਕੀਮਾ ਪ੍ਰਮਾਣਿਕਤਾ ਸਵੈਚਲਿਤ ਤੌਰ 'ਤੇ ਜਾਂਚ ਕਰਦੀ ਹੈ ਕਿ ਕੀ ਡੇਟਾ ਦਾ ਹਰੇਕ ਆਉਣ ਵਾਲਾ ਬੈਚ ਸੰਭਾਵਿਤ ਢਾਂਚੇ ਦੇ ਅਨੁਕੂਲ ਹੈ ਜਾਂ ਨਹੀਂ। ਉਦਾਹਰਨ ਲਈ, ਕੀ 0-120 ਦੇ ਵਿਚਕਾਰ ਉਮਰ ਕਾਲਮ ਹੈ, ਕੀ ਈਮੇਲ ਖੇਤਰ ਖਾਲੀ ਹੈ, ਕੀ ਕਾਲਮਾਂ ਦੀ ਗਿਣਤੀ ਬਦਲ ਗਈ ਹੈ?
ਸੰਕੇਤ: ਲਾਈਨ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਪੁਸ਼ਟੀਕਰਨ ਪਾਓ। ਜਿੰਨੀ ਜਲਦੀ ਭ੍ਰਿਸ਼ਟ ਡੇਟਾ ਫੜਿਆ ਜਾਵੇਗਾ, ਓਨਾ ਹੀ ਸਸਤਾ ਇਸ ਨੂੰ ਠੀਕ ਕਰਨਾ ਹੈ। ਉਤਪਾਦਨ ਵਿੱਚ ਫੜੀ ਗਈ ਇੱਕ ਸਕੀਮਾ ਗਲਤੀ ਸਿਖਲਾਈ ਪੜਾਅ ਵਿੱਚ ਫੜੀ ਗਈ ਇੱਕ ਨਾਲੋਂ ਕਈ ਗੁਣਾ ਜ਼ਿਆਦਾ ਮਹਿੰਗੀ ਹੈ।
ਨਿਮਨਲਿਖਤ ਡੇਟਾ ਸਕੀਮਾ ਲਈ ਪਾਂਡੇਰਾ (ਜਾਂ ਵੱਡੀਆਂ ਉਮੀਦਾਂ) ਨਾਲ ਇੱਕ ਪ੍ਰਮਾਣਿਕਤਾ ਸਕੀਮ ਲਿਖੋ। ਕਾਲਮ ਅਤੇ ਨਿਯਮ:- user_id: ਪੂਰਨ ਅੰਕ, ਖਾਲੀ ਨਹੀਂ ਹੋ ਸਕਦਾ, ਵਿਲੱਖਣ- ਉਮਰ: ਪੂਰਨ ਅੰਕ, 0-120 ਤੋਂ ਨਹੀਂ ਹੋ ਸਕਦਾ- signup_date: ਮਿਤੀ, ਭਵਿੱਖ ਵਿੱਚ ਨਹੀਂ ਹੋ ਸਕਦਾ- ਦੇਸ਼: ਸ਼੍ਰੇਣੀ, ਸੈੱਟ {TR, DE, US, UK} ਤੋਂ - ਸੰਤੁਲਨ: ਦਸ਼ਮਲਵ, ਨਕਾਰਾਤਮਕ ਨਹੀਂ ਹੋ ਸਕਦਾ ਹਰੇਕ ਨਿਯਮ ਲਈ ਇੱਕ ਅਰਥਪੂਰਨ ਗਲਤੀ ਸੁਨੇਹਾ ਤਿਆਰ ਕਰੋ। ਕੋਡ ਦੇ ਅੰਤ ਵਿੱਚ ਟੁੱਟੀ ਹੋਈ ਲਾਈਨ ਦੀ ਉਦਾਹਰਨ ਦੇ ਨਾਲ ਟੈਸਟ ਦਿਖਾਓ।
ਸਫਾਈ: ਇਹ ਮਨੁੱਖ ਹੈ ਜੋ ਫੈਸਲਾ ਕਰਦਾ ਹੈ
ਗੁੰਮ ਮੁੱਲ ਹਰੇਕ ਡੇਟਾ ਸੈੱਟ ਦੀ ਅਸਲੀਅਤ ਹਨ। ਸੰਭਾਲਣ ਦੇ ਤਰੀਕੇ:
- ਮਿਟਾਉਣਾ: ਬਹੁਤ ਜ਼ਿਆਦਾ ਗੁੰਮ ਦਰ ਨਾਲ ਇੱਕ ਕਤਾਰ/ਕਾਲਮ ਨੂੰ ਰੱਦ ਕਰਨਾ। ਪਰ ਜਾਣਕਾਰੀ ਦੇ ਨੁਕਸਾਨ ਅਤੇ ਪੱਖਪਾਤ ਦਾ ਖਤਰਾ ਹੈ।
- ਇਮਪਿਊਟੇਸ਼ਨ: ਮੱਧਮਾਨ, ਮੱਧਮਾਨ, ਸਭ ਤੋਂ ਵੱਧ ਵਾਰ-ਵਾਰ ਮੁੱਲ, ਜਾਂ ਮਾਡਲ-ਆਧਾਰਿਤ ਪੂਰਵ-ਅਨੁਮਾਨ ਦੇ ਨਾਲ ਇਮਪਿਊਟੇਸ਼ਨ।
- ਫਲੈਗ: "ਗੁੰਮ ਸੀ" ਜਾਣਕਾਰੀ ਨੂੰ ਇੱਕ ਵੱਖਰੇ ਫਲੈਗ ਕਾਲਮ ਵਿੱਚ ਸਟੋਰ ਕਰਨਾ — ਕਈ ਵਾਰ ਗੁੰਮ ਹੋਣਾ ਹੀ ਸਿਗਨਲ ਹੁੰਦਾ ਹੈ।
ਕਿਹੜਾ ਸਹੀ ਹੈ ਇਹ ਸਮੱਸਿਆ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। ਇੱਕ ਮੈਡੀਕਲ ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ, "ਖੂਨ ਦੀ ਕੀਮਤ ਨਹੀਂ ਮਾਪੀ ਗਈ" ਜਾਣਕਾਰੀ ਨੂੰ ਮਿਟਾਉਣ ਦੀ ਬਜਾਏ ਸੁਰੱਖਿਅਤ ਰੱਖਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ; ਕਿਉਂਕਿ ਡਾਕਟਰ ਦਾ ਵੀ ਮਾਪ ਲੈਣ ਤੋਂ ਇਨਕਾਰ ਕਰਨਾ ਇੱਕ ਸੰਕੇਤ ਹੈ। AI ਤੁਹਾਨੂੰ ਵਿਕਲਪ ਅਤੇ ਕੋਡ ਦੇ ਸਕਦਾ ਹੈ; ਤੁਸੀਂ ਚੁਣਦੇ ਹੋ ਕਿ ਕਿਹੜਾ ਖੇਤਰ ਦੀ ਅਸਲੀਅਤ ਦੇ ਅਨੁਕੂਲ ਹੈ।
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ: "ਗੁੰਮ ਮੁੱਲ ਭਰੋ।"
ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ: "ਹੇਠ ਦਿੱਤੇ ਕਾਲਮਾਂ ਵਿੱਚ ਮੁੱਲ ਗੁੰਮ ਹਨ: ਆਮਦਨ (12% ਗੁੰਮ, ਸੱਜੀ-ਤਰੱਕੀ ਵੰਡ), ਲਾਸਟ_ਲੌਗਿਨ (30% ਗੁੰਮ)। ਔਸਤ ਨਾਲ ਆਮਦਨ ਭਰਨ ਦਾ ਸੁਝਾਅ ਦਿਓ, ਪਰ ਇਹ ਦੱਸੋ ਕਿ ਮੱਧਮਾਨ ਕਿਉਂ ਨਹੀਂ ਹੈ। ਆਖਰੀ_ਲੌਗਿਨ ਲਈ, ਇਹ ਮੰਨ ਲਓ ਕਿ ਗੁੰਮ ਮੁੱਲ ਮਹੱਤਵਪੂਰਨ ਹੋ ਸਕਦਾ ਹੈ (ਉਪਭੋਗਤਾ ਨੇ ਕਦੇ ਵੀ ਲੌਗਇਨ ਕਰਨ ਦੀ ਬਜਾਏ ਕਦੇ ਵੀ ਲੌਗਇਨ_ਇਨ ਕਰਨ ਬਾਰੇ ਵਿਚਾਰ ਨਹੀਂ ਕੀਤਾ); ਪੱਖਪਾਤ ਨੂੰ ਲਿਖੋ ਜਾਂ ਤਾਂ ਪਹੁੰਚ ਮਾਡਲ ਨੂੰ ਜੋੜ ਦੇਵੇਗੀ।"
ਅੰਤਰ: ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ ਵੰਡ ਦੀ ਜਾਣਕਾਰੀ ਅਤੇ ਖੇਤਰ ਦਾ ਅਰਥ ਦਿੰਦਾ ਹੈ; ਨਕਲੀ ਬੁੱਧੀ ਮਕੈਨੀਕਲ ਭਰਨ ਦੀ ਬਜਾਏ ਫੈਸਲੇ ਦਾ ਸਮਰਥਨ ਪੈਦਾ ਕਰਦੀ ਹੈ।
ਲੇਬਲਿੰਗ: ਗੁਣਵੱਤਾ ਮਾਪੀ ਜਾਂਦੀ ਹੈ
ਨਿਰੀਖਣ ਕੀਤੀ ਸਿਖਲਾਈ ਵਿੱਚ (ਸਿਖਲਾਈ ਜਿਸ ਵਿੱਚ ਸਹੀ ਜਵਾਬਾਂ ਦੇ ਨਾਲ ਉਦਾਹਰਨਾਂ ਦਿੱਤੀਆਂ ਗਈਆਂ ਹਨ), ਜੋ ਮਾਡਲ ਸਿੱਖਦਾ ਹੈ ਉਹ ਲੇਬਲ ਹੁੰਦੇ ਹਨ (ਲੇਬਲ: ਹਰੇਕ ਉਦਾਹਰਨ ਲਈ ਸਹੀ ਜਵਾਬ)। ਲੇਬਲ ਦੀ ਗੁਣਵੱਤਾ ਇੱਕ ਸੀਲਿੰਗ ਸੈੱਟ ਕਰਦੀ ਹੈ — ਜੇਕਰ ਲੋਕ ਅਸੰਗਤ ਲੇਬਲ ਕਰਦੇ ਹਨ, ਤਾਂ ਮਾਡਲ ਅਸੰਗਤ ਢੰਗ ਨਾਲ ਸਿੱਖਦਾ ਹੈ।
ਅੰਤਰ-ਐਨੋਟੇਟਰ ਸਮਝੌਤਾ ਉਸ ਦਰ ਨੂੰ ਮਾਪਦਾ ਹੈ ਜਿਸ 'ਤੇ ਵੱਖ-ਵੱਖ ਲੋਕ ਇੱਕੋ ਨਮੂਨੇ ਨੂੰ ਇੱਕੋ ਲੇਬਲ ਦਿੰਦੇ ਹਨ; ਇਹ ਕੋਹੇਨ ਦੇ ਕਪਾ ਵਰਗੇ ਗੁਣਾਂਕ ਦੁਆਰਾ ਦਰਸਾਇਆ ਗਿਆ ਹੈ। ਘੱਟ ਪਾਲਣਾ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਜਾਂ ਤਾਂ ਕੰਮ ਅਸਪਸ਼ਟ ਹੈ ਜਾਂ ਹਦਾਇਤ ਕਮਜ਼ੋਰ ਹੈ।
ਨਕਲੀ ਬੁੱਧੀ ਦੋ ਤਰੀਕਿਆਂ ਨਾਲ ਲੇਬਲਿੰਗ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ: (1) ਐਨੋਟੇਸ਼ਨ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ ਦਾ ਖਰੜਾ ਤਿਆਰ ਕਰਨਾ, (2) ਪ੍ਰੀ-ਲੇਬਲਿੰਗ ਅਤੇ ਮਨੁੱਖ ਦੁਆਰਾ ਸਿਰਫ ਇਸਨੂੰ ਠੀਕ ਕਰਨਾ। ਪਰ LLM ਨਾਲ ਪੂਰਵ-ਲੇਬਲਿੰਗ ਵਿੱਚ ਇੱਕ ਖਰਾਬੀ ਹੈ: ਮਾਡਲ ਦੀ ਯੋਜਨਾਬੱਧ ਗਲਤੀ ਪੂਰੇ ਲੇਬਲ ਸੈੱਟ ਵਿੱਚ ਲੀਕ ਹੋ ਸਕਦੀ ਹੈ। ਇਸ ਲਈ ਇਨਸਾਨ ਹਮੇਸ਼ਾ ਕੁਝ ਐਲਐਲਐਮ ਲੇਬਲਾਂ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਨ।
ਧਿਆਨ ਦਿਓ: LLM ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਲੇਬਲਾਂ ਨੂੰ "ਭੂਮੀ ਸੱਚ" ਨਾ ਸਮਝੋ। ਮਨੁੱਖ ਨਾਲ ਨਮੂਨੇ ਦੀ ਜਾਂਚ ਕਰੋ ਅਤੇ LLM-ਮਨੁੱਖੀ ਫਿਟ ਨੂੰ ਮਾਪੋ। ਜੇਕਰ ਪਾਲਣਾ ਘੱਟ ਹੈ, ਤਾਂ ਪ੍ਰੀ-ਲੇਬਲਿੰਗ ਚੰਗੇ ਨਾਲੋਂ ਜ਼ਿਆਦਾ ਨੁਕਸਾਨ ਕਰੇਗੀ।
ਡਾਟਾ ਭਾਗ: ਲੀਕੇਜ ਨੂੰ ਰੋਕਣ
ਸਿਖਲਾਈ/ਪ੍ਰਮਾਣਿਕਤਾ/ਟੈਸਟਿੰਗ ਵਿੱਚ ਡੇਟਾ ਨੂੰ ਵੰਡਣ ਵੇਲੇ ਸਭ ਤੋਂ ਖ਼ਤਰਨਾਕ ਗਲਤੀ ਡੇਟਾ ਲੀਕ ਹੈ: ਸਿਖਲਾਈ ਵਿੱਚ ਟੈਸਟ ਜਾਣਕਾਰੀ ਨੂੰ ਮਿਲਾਉਣਾ। ਉਦਾਹਰਨਾਂ:
- ਇੱਕੋ ਉਪਭੋਗਤਾ ਦੇ ਰਿਕਾਰਡ ਸਿਖਲਾਈ ਅਤੇ ਟੈਸਟਿੰਗ (ਗਰੁੱਪ ਲੀਕ) ਦੋਵਾਂ ਵਿੱਚ ਆਉਂਦੇ ਹਨ।
- ਸਿਖਲਾਈ ਵਿੱਚ ਭਵਿੱਖ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਅਤੇ ਸਮਾਂ ਲੜੀ (ਟੈਂਪੋਰਲ ਲੀਕੇਜ) ਵਿੱਚ ਟੈਸਟਿੰਗ ਵਿੱਚ ਅਤੀਤ ਦੀ ਵਰਤੋਂ ਕਰਨਾ।
- ਸਾਰੇ ਡੇਟਾ ਤੋਂ ਸਕੇਲਿੰਗ (ਸਧਾਰਨੀਕਰਨ) ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਣਨਾ ਕਰਨਾ ਅਤੇ ਫਿਰ ਵੰਡਣਾ।
ਸਮੇਂ ਨਾਲ ਜੁੜੀਆਂ ਸਮੱਸਿਆਵਾਂ ਲਈ ਅਸਥਾਈ ਵੰਡ ਜ਼ਰੂਰੀ ਹੈ: ਅਤੀਤ ਨਾਲ ਸਿਖਲਾਈ, ਭਵਿੱਖ ਵਿੱਚ ਟੈਸਟ ਕਰੋ। ਬੇਤਰਤੀਬ ਵੰਡਣਾ ਇੱਕ "ਭਵਿੱਖ ਦਾ" ਲਾਭ ਦਿੰਦਾ ਹੈ ਜੋ ਉਤਪਾਦਨ ਵਿੱਚ ਕਦੇ ਨਹੀਂ ਹੋਵੇਗਾ ਅਤੇ ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ।
ਡਾਟਾ ਸੰਸਕਰਣ ਅਤੇ ਪ੍ਰਜਨਨਯੋਗਤਾ
"ਅਸੀਂ ਇਸ ਮਾਡਲ ਨੂੰ ਕਿਸ ਡੇਟਾ ਨਾਲ ਸਿਖਲਾਈ ਦਿੱਤੀ?" ਮਹੀਨਿਆਂ ਬਾਅਦ ਸਵਾਲ ਦਾ ਜਵਾਬ ਦੇਣ ਦੇ ਯੋਗ ਹੋਣਾ ਗੰਭੀਰ ML ਇੰਜੀਨੀਅਰਿੰਗ ਦੀ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ। ਡੇਟਾ ਵਰਜਨਿੰਗ ਹਰੇਕ ਡੇਟਾ ਸਨੈਪਸ਼ਾਟ ਨੂੰ ਇੱਕ ID (ਹੈਸ਼ ਜਾਂ ਸੰਸਕਰਣ ਟੈਗ) ਨਾਲ ਸਟੋਰ ਕਰਦੀ ਹੈ। ਟੂਲ ਜਿਵੇਂ ਕਿ DVC (ਡੇਟਾ ਸੰਸਕਰਣ ਨਿਯੰਤਰਣ) ਸੰਸਕਰਣ ਡੇਟਾ ਜਿਵੇਂ ਕੋਡ।
ਇੱਕ ਮਾਡਲ ਦੇ ਨਤੀਜੇ ਨੂੰ ਦੁਬਾਰਾ ਬਣਾਉਣ ਲਈ, ਤਿੰਨ ਚੀਜ਼ਾਂ ਨੂੰ ਨਿਸ਼ਚਿਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ: ਡੇਟਾ ਸੰਸਕਰਣ, ਕੋਡ ਸੰਸਕਰਣ, ਅਤੇ ਬੇਤਰਤੀਬ ਬੀਜ। ਇਸ ਤਿਕੜੀ ਤੋਂ ਬਿਨਾਂ "ਮੈਨੂੰ ਉਹੀ ਨਤੀਜਾ ਮਿਲਿਆ" ਕਹਿਣਾ ਸੰਭਵ ਨਹੀਂ ਹੈ। ਅਸੀਂ ਯੂਨਿਟ 11 ਵਿੱਚ ਪ੍ਰਜਨਨਯੋਗਤਾ ਨੂੰ ਡੂੰਘਾ ਕਰਾਂਗੇ; ਪਰ ਡੇਟਾ ਪਾਈਪਲਾਈਨ ਵਿੱਚ ਬੀਜ ਨੂੰ ਫਿਕਸ ਕਰਨਾ ਇੱਥੋਂ ਸ਼ੁਰੂ ਹੁੰਦਾ ਹੈ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਦਿਨ ਦੀ ਸਕੀਮਾ ਪ੍ਰਮਾਣਿਕਤਾ ਸੁਰੱਖਿਅਤ ਕੀਤੀ ਗਈ। ਜਦੋਂ ਇੱਕ ਟੀਮ ਨੇ ਇੱਕ ਅੱਪਸਟ੍ਰੀਮ ਸਿਸਟਮ ਕੀਮਤ ਖੇਤਰ ਨੂੰ ਪੈਨੀਜ਼ ਤੋਂ ਲੀਰਾ ਵਿੱਚ ਬਦਲਿਆ, ਤਾਂ ਸਾਰੀਆਂ ਕੀਮਤਾਂ 100 ਗੁਣਾ ਘਟ ਗਈਆਂ। ਸਕੀਮਾ ਪ੍ਰਮਾਣਿਕਤਾ ਨੇ ਬੈਚ ਨੂੰ "ਰੇਂਜ ਤੋਂ ਬਾਹਰ ਕੀਮਤ" ਵਜੋਂ ਰੱਦ ਕਰ ਦਿੱਤਾ ਅਤੇ ਮਾਡਲ ਨੂੰ ਖਰਾਬ ਡੇਟਾ ਨਾਲ ਸਿਖਲਾਈ ਨਹੀਂ ਦਿੱਤੀ ਗਈ ਸੀ। ਤਸਦੀਕ ਕੀਤੇ ਬਿਨਾਂ, ਗਲਤ ਪੂਰਵ-ਅਨੁਮਾਨਾਂ ਦੇ ਨਾਲ, ਗਲਤੀ ਸਿਰਫ ਉਤਪਾਦਨ ਵਿੱਚ ਹੀ ਵੇਖੀ ਜਾਵੇਗੀ।
ਕੇਸ 2 - ਗਲਤ ਭਰਨ ਦਾ ਪੱਖਪਾਤ। ਇੱਕ ਕ੍ਰੈਡਿਟ ਮਾਡਲ ਵਿੱਚ, ਗੁੰਮ ਆਮਦਨੀ ਮੁੱਲ ਮੱਧਮ ਨਾਲ ਭਰੇ ਹੋਏ ਸਨ। ਪਰ ਗੁੰਮ ਆਮਦਨ ਮੁੱਖ ਤੌਰ 'ਤੇ ਘੱਟ ਆਮਦਨੀ ਵਾਲੇ ਸਮੂਹ ਵਿੱਚ ਸਨ; ਔਸਤਨ ਇਸ ਸਮੂਹ ਨੂੰ ਨਕਲੀ ਤੌਰ 'ਤੇ "ਅਨੁਕੂਲਿਤ" ਕੀਤਾ ਗਿਆ ਹੈ, ਅਤੇ ਮਾਡਲ ਨੇ ਉਹਨਾਂ ਨੂੰ ਇੱਕ ਅਨੁਚਿਤ ਉੱਚ ਸੀਮਾ ਦੀ ਪੇਸ਼ਕਸ਼ ਕੀਤੀ ਹੈ। ਔਸਤ + ਲਾਪਤਾ ਫਲੈਗ ਨਾਲ ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕੀਤਾ।
ਕੇਸ 3 - ਅਸਥਾਈ ਲੀਕੇਜ। ਇੱਕ ਮੰਗ ਪੂਰਵ ਅਨੁਮਾਨ ਮਾਡਲ ਟੈਸਟ ਸੈੱਟ (95% ਸ਼ੁੱਧਤਾ) 'ਤੇ ਬਹੁਤ ਵਧੀਆ ਦਿਖਾਈ ਦਿੱਤਾ ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਕ੍ਰੈਸ਼ ਹੋ ਗਿਆ। ਕਿਉਂ: ਬੇਤਰਤੀਬ ਵੰਡਣ ਦੇ ਕਾਰਨ, ਮਾਡਲ ਨੇ ਭਵਿੱਖ ਦੇਖਿਆ ਸੀ। ਟੈਂਪੋਰਲ ਬਿਨਿੰਗ 'ਤੇ ਜਾਣ ਨਾਲ ਟੈਸਟ ਦੀ ਸ਼ੁੱਧਤਾ 78% ਤੱਕ ਘਟ ਗਈ - ਪਰ ਇਹ ਅਸਲ ਪ੍ਰਦਰਸ਼ਨ ਸੀ ਅਤੇ ਇਸਨੂੰ ਉਤਪਾਦਨ ਵਿੱਚ ਰੱਖਿਆ ਗਿਆ।
ਨਕਲ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟਸ
ਨਿਮਨਲਿਖਤ ਡੇਟਾਸੈਟ ਨੂੰ ਤਿੰਨ ਸੈੱਟਾਂ ਵਿੱਚ ਵੰਡੋ: ਸਿਖਲਾਈ/ਪ੍ਰਮਾਣਿਕਤਾ/ਟੈਸਟਿੰਗ। ਕੰਸਟ੍ਰੈਂਟ: ਇਹ ਇੱਕ ਸਮਾਂ ਲੜੀ ਹੈ; ਟੈਂਪੋਰਲ ਸਪਲਿਟਿੰਗ (ਅਤੀਤ ਵਿੱਚ ਰੇਲਗੱਡੀ, ਭਵਿੱਖ ਵਿੱਚ ਟੈਸਟ) ਦੀ ਵਰਤੋਂ ਕਰੋ। ਬੈਚ ਲੀਕੇਜ ਨੂੰ ਰੋਕੋ: ਸਿਰਫ਼ ਇੱਕ ਕਲੱਸਟਰ ਵਿੱਚ ਇੱਕੋ ਹੀ 'ਗਾਹਕ_ਆਈਡੀ' ਰੱਖੋ। ਸਿਰਫ਼ ਸਿਖਲਾਈ ਸੈੱਟ ਤੋਂ ਸਕੇਲਿੰਗ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਣਨਾ ਕਰੋ, ਫਿਰ ਸਾਰਿਆਂ 'ਤੇ ਲਾਗੂ ਕਰੋ। ਪ੍ਰਿੰਟ ਕਰੋ ਕਿ ਹਰੇਕ ਪੜਾਅ 'ਤੇ ਕੋਡ ਵਿੱਚ ਕਿੰਨੀਆਂ ਲਾਈਨਾਂ ਬਚੀਆਂ ਹਨ ਅਤੇ ਇੱਕ ਦਾਅਵਾ ਸ਼ਾਮਲ ਕਰੋ ਜੋ ਲੀਕ ਨਾ ਹੋਣ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ।
ਇਸ ਲੇਬਲਿੰਗ ਕਾਰਜ ਲਈ ਇੱਕ ਡਰਾਫਟ ਐਨੋਟੇਸ਼ਨ ਗਾਈਡਲਾਈਨ ਲਿਖੋ। ਟਾਸਕ: [ਉਦਾ. ਲੇਬਲ ਗਾਹਕ ਸਮੀਖਿਆ ਸਕਾਰਾਤਮਕ/ਨਕਾਰਾਤਮਕ/ਨਿਰਪੱਖ] ਬਾਰਡਰਲਾਈਨ ਕੇਸਾਂ ਨੂੰ ਸਪੱਸ਼ਟ ਕਰੋ: ਵਿਅੰਗਾਤਮਕ, ਮਿਸ਼ਰਤ ਭਾਵਨਾ, ਉਤਪਾਦ ਨਾਲ ਗੈਰ-ਸੰਬੰਧਿਤ ਸਮੀਖਿਆ ਨੂੰ ਲੇਬਲ ਕਿਵੇਂ ਕਰਨਾ ਹੈ? 5 ਉਦਾਹਰਣਾਂ ਅਤੇ 3 ਮੁਸ਼ਕਲ ਕਿਨਾਰੇ ਵਾਲੇ ਕੇਸ ਦਿਓ ਜੋ ਟੈਗਰਾਂ ਵਿੱਚ ਇਕਸਾਰਤਾ ਨੂੰ ਵਧਾਏਗਾ।
ਇਸ ਡੇਟਾ ਪਾਈਪਲਾਈਨ ਲਈ ਇੱਕ ਰੀਪ੍ਰੋਡਸੀਬਿਲਟੀ ਚੈਕਲਿਸਟ ਤਿਆਰ ਕਰੋ:- ਡੇਟਾ ਸੰਸਕਰਣ ਕਿਵੇਂ ਫਿਕਸ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ?- ਕਿਹੜੇ ਬੇਤਰਤੀਬੇ ਬੀਜਾਂ ਨੂੰ ਕਿੱਥੇ ਸੈੱਟ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ?- ਕਿਹੜਾ ਮੈਟਾਡੇਟਾ (ਡੇਟਾ ਹੈਸ਼, ਕਤਾਰ ਗਿਣਤੀ, ਮਿਤੀ) ਨੂੰ ਲੌਗ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ? ਮੇਰਾ ਕੋਡਬੇਸ: [ਭਾਸ਼ਾ/ਲਾਇਬ੍ਰੇਰੀ]
ਡਾਟਾ ਲੀਕ ਹੋਣ ਲਈ ਇਸ ਕਲੀਨਅੱਪ ਕੋਡ ਦੀ ਜਾਂਚ ਕਰੋ। ਖਾਸ ਤੌਰ 'ਤੇ ਇਸ ਨੂੰ ਦੇਖੋ: ਕੀ ਸਕੇਲਿੰਗ/ਏਨਕੋਡਿੰਗ ਪੈਰਾਮੀਟਰ ਵੰਡਣ ਤੋਂ ਪਹਿਲਾਂ ਗਿਣਿਆ ਜਾਂਦਾ ਹੈ? ਕੀ ਕੋਈ ਵੀ ਅੰਕੜੇ ਸਾਰੇ ਡੇਟਾ ਜਾਂ ਸਿਰਫ਼ ਸਿਖਲਾਈ ਤੋਂ ਗਿਣਿਆ ਗਿਆ ਹੈ? ਕੋਡ: [ਕੋਡ]
ਫੈਸਲਾ ਸਾਰਣੀ: ਗੁੰਮ ਮੁੱਲ ਰਣਨੀਤੀ
ਸਥਿਤੀ
ਸਿਫਾਰਸ਼ੀ ਪਹੁੰਚ
ਕਿਉਂ
ਸੰਖਿਆਤਮਕ, ਤਿੱਖੀ ਵੰਡ
ਮੱਧਮ ਨਾਲ ਭਰੋ
ਔਸਤ ਬਾਹਰੀ ਲੋਕਾਂ ਦੁਆਰਾ ਪ੍ਰਭਾਵਿਤ ਹੁੰਦਾ ਹੈ
ਸੰਖਿਆਤਮਕ, ਸਮਰੂਪ
ਔਸਤ ਨਾਲ ਭਰੋ
ਜਾਣਕਾਰੀ ਦੀ ਰੱਖਿਆ ਕਰਦਾ ਹੈ
ਕਮੀ ਮਹੱਤਵਪੂਰਨ ਹੋ ਸਕਦੀ ਹੈ
ਫਲੈਗ ਕਾਲਮ + ਭਰੋ
ਕਮੀ ਇੱਕ ਸੰਕੇਤ ਹੈ
ਗੁੰਮ ਦਰ > 60%
ਕਾਲਮ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ/ਖਾਰਜ ਕਰੋ
ਰੌਲਾ ਬਹੁਤ ਜ਼ਿਆਦਾ ਹੈ
ਸ਼੍ਰੇਣੀਬੱਧ
"ਅਣਜਾਣ" ਸ਼੍ਰੇਣੀ
ਨਕਲੀ ਬਹੁਮਤ ਨਹੀਂ ਬਣਾਉਂਦਾ
ਆਮ ਗਲਤੀਆਂ
- ਪੁਸ਼ਟੀਕਰਨ ਛੱਡਣਾ। ਸਕੀਮਾ ਨਿਯੰਤਰਣ ਤੋਂ ਬਿਨਾਂ, ਖਰਾਬ ਡੇਟਾ ਚੁੱਪਚਾਪ ਅੰਦਰ ਆ ਜਾਂਦਾ ਹੈ।
- ਵੰਡਣ ਤੋਂ ਪਹਿਲਾਂ ਸਕੇਲਿੰਗ। ਇਹ ਸਿੱਖਿਆ ਵਿੱਚ ਪ੍ਰੀਖਿਆ ਦੇ ਅੰਕੜੇ ਲੀਕ ਕਰਦਾ ਹੈ।
- ਸਮਾਂ ਲੜੀ ਵਿੱਚ ਬੇਤਰਤੀਬ ਵੰਡ ਦੀ ਵਰਤੋਂ ਕਰਨਾ। ਇਹ ਜਾਅਲੀ ਉੱਚ ਮੈਟ੍ਰਿਕਸ ਪੈਦਾ ਕਰਦਾ ਹੈ.
- LLM ਲੇਬਲਾਂ 'ਤੇ ਅੰਨ੍ਹਾ ਭਰੋਸਾ ਕਰਨਾ। ਸਿਸਟਮੈਟਿਕ ਗਲਤੀ ਪੂਰੇ ਡੇਟਾ ਵਿੱਚ ਫੈਲਦੀ ਹੈ।
- ਡਾਟਾ ਸੰਸਕਰਣ ਨੂੰ ਸੁਰੱਖਿਅਤ ਨਹੀਂ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ। ਤੁਸੀਂ ਨਤੀਜਾ ਦੁਬਾਰਾ ਨਹੀਂ ਬਣਾ ਸਕਦੇ।
- ਔਸਤ ਨਾਲ ਮਕੈਨੀਕਲ ਭਰਾਈ. ਇਹ ਖੇਤਰ ਦੇ ਅਰਥ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦਾ ਹੈ, ਪੱਖਪਾਤ ਜੋੜਦਾ ਹੈ।
ਸੰਖੇਪ ਵਿੱਚ
ਡਾਟਾ ਪਾਈਪਲਾਈਨ ML ਸਿਸਟਮ ਦੀ ਬੁਨਿਆਦ ਹੈ ਅਤੇ ਮਾਡਲ ਨਾਲੋਂ ਜ਼ਿਆਦਾ ਮਿਹਨਤ ਦਾ ਹੱਕਦਾਰ ਹੈ। ਤਸਦੀਕ ਨੂੰ ਸਿਖਰ 'ਤੇ ਰੱਖੋ; ਡੋਮੇਨ ਗਿਆਨ ਨਾਲ ਸਫਾਈ ਅਤੇ ਲੇਬਲਿੰਗ ਦੇ ਫੈਸਲੇ ਕਰੋ; ਕੰਪਾਰਟਮੈਂਟ ਵਿੱਚ ਲੀਕ (ਸਮੂਹ ਅਤੇ ਅਸਥਾਈ) ਨੂੰ ਰੋਕਣਾ; ਡਾਟਾ ਸੰਸਕਰਣ ਅਤੇ ਬੀਜ ਨੂੰ ਠੀਕ ਕਰੋ। AI ਇਸ ਲਾਈਨ 'ਤੇ ਕੋਡ ਅਤੇ ਵਿਚਾਰ ਤਿਆਰ ਕਰਦਾ ਹੈ, ਪਰ ਇਹ ਤੁਹਾਡੇ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ ਕਿ ਕਿਹੜੇ ਡੇਟਾ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨਾ ਹੈ ਅਤੇ ਕਿਵੇਂ ਕਰਨਾ ਹੈ - ਕਿਉਂਕਿ ਇੱਥੇ ਹਰ ਗਲਤ ਫੈਸਲਾ ਮਾਡਲ ਵਿੱਚ ਲੁਕੀ ਹੋਈ ਨੁਕਸ ਵਜੋਂ ਲੰਘਦਾ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਆਪਣੇ ਖੁਦ ਦੇ ਡੇਟਾਸੈਟ 'ਤੇ ਇੱਕ ਪ੍ਰਮਾਣਿਕਤਾ ਸਕੀਮ (ਪਾਂਡੇਰਾ/ਵਧੀਆਂ ਉਮੀਦਾਂ) ਲਿਖੋ ਅਤੇ ਜਾਣਬੁੱਝ ਕੇ ਇੱਕ ਖਰਾਬ ਕਤਾਰ ਜੋੜੋ ਅਤੇ ਦਿਖਾਓ ਕਿ ਇਹ ਫੜਿਆ ਗਿਆ ਹੈ। ਫਿਰ ਡੇਟਾ ਨੂੰ ਅਸਥਾਈ ਤੌਰ 'ਤੇ ਜਾਂ ਬੈਚ ਅਨੁਸਾਰ ਵੰਡੋ, ਸਿਰਫ ਸਿਖਲਾਈ ਤੋਂ ਸਕੇਲਿੰਗ ਮਾਪਦੰਡਾਂ ਦੀ ਗਣਨਾ ਕਰੋ, ਅਤੇ ਪੁਸ਼ਟੀ ਕਰੋ ਕਿ ਦਾਅਵਾ ਨਾਲ ਕੋਈ ਲੀਕ ਨਹੀਂ ਹੈ। ਇੱਕ ਮੈਟਾਡੇਟਾ ਫਾਈਲ ਵਿੱਚ ਡੇਟਾ ਸੰਸਕਰਣ ਅਤੇ ਕਤਾਰਾਂ ਦੀ ਗਿਣਤੀ ਲਿਖੋ।
ਚੈੱਕਲਿਸਟ
- [ ] ਸਕੀਮਾ ਪ੍ਰਮਾਣਿਕਤਾ ਲਾਈਨ ਦੇ ਸਿਖਰ 'ਤੇ ਚੱਲਦੀ ਹੈ।
- [ ] ਮੈਂ ਫੀਲਡ ਅਰਥਾਂ ਦੇ ਅਧਾਰ 'ਤੇ ਗੁੰਮ ਮੁੱਲ ਦੀ ਰਣਨੀਤੀ ਚੁਣੀ, ਮੈਂ ਇਸਨੂੰ ਮਸ਼ੀਨੀ ਤੌਰ 'ਤੇ ਨਹੀਂ ਭਰਿਆ।
- [ ] ਮੈਂ ਲੇਬਲ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪਿਆ (ਪਾਲਣਾ); ਮੈਂ ਮਨੁੱਖੀ-ਚੈੱਕ ਕੀਤੇ LLM ਟੈਗਸ।
- [] ਮੈਂ ਪੈਨ ਵਿੱਚ ਸਮੂਹ ਅਤੇ ਅਸਥਾਈ ਲੀਕੇਜ ਨੂੰ ਰੋਕਿਆ।
- [ ] ਸਕੇਲਿੰਗ/ਏਨਕੋਡਿੰਗ ਦੀ ਗਣਨਾ ਸਿਰਫ਼ ਸਿਖਲਾਈ ਸੈੱਟ ਤੋਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।
- [ ] ਡੇਟਾ ਸੰਸਕਰਣ, ਕਤਾਰਾਂ ਦੀ ਸੰਖਿਆ ਅਤੇ ਬੀਜ ਦਰਜ ਕੀਤਾ ਗਿਆ।