ਲਾਭ:
- NMT ਅਤੇ LLM-ਅਧਾਰਿਤ ਅਨੁਵਾਦ ਦੀਆਂ ਸ਼ਕਤੀਆਂ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਨੂੰ ਵੱਖ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਅਤੇ ਕਾਰੋਬਾਰ ਦੀ ਕਿਸਮ ਦੇ ਅਨੁਸਾਰ ਸਹੀ ਇੰਜਣ ਚੁਣਨਾ
- ਮਸ਼ੀਨ ਲਈ ਟੈਕਸਟ ਦੀ ਅਨੁਕੂਲਤਾ ਨੂੰ ਪੂਰਵ-ਵਰਗੀਕ੍ਰਿਤ ਕਰਨ ਅਤੇ ਯਥਾਰਥਵਾਦੀ ਸਮੇਂ ਅਤੇ ਕੀਮਤ ਲਈ ਇਸਦਾ ਪੂਰਵ-ਮੁਲਾਂਕਣ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
- ਸ਼ੁੱਧਤਾ ਦੇ ਨਾਲ ਨਿਰਵਿਘਨਤਾ ਨੂੰ ਉਲਝਾਏ ਬਿਨਾਂ ਪੰਜ ਅਯਾਮਾਂ ਅਤੇ ਫਲੈਗ ਜੋਖਮਾਂ ਵਿੱਚ ਕੱਚੀ ਮਸ਼ੀਨ ਆਉਟਪੁੱਟ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਮਾਪਣ ਦੀ ਸਮਰੱਥਾ
ਇੱਕ ਅਨੁਵਾਦਕ ਵਜੋਂ ਤੁਹਾਡੇ ਕੋਲ ਸਭ ਤੋਂ ਸ਼ਕਤੀਸ਼ਾਲੀ ਐਕਸਲੇਟਰ ਹੈ ਮਸ਼ੀਨ ਅਨੁਵਾਦ (MT) — ਪਰ ਇੱਕ ਟੂਲ ਨੂੰ ਸੁਚੇਤ ਤੌਰ 'ਤੇ ਵਰਤਣ ਦਾ ਮਤਲਬ ਹੈ ਇਸਨੂੰ ਸਹੀ ਨੌਕਰੀ, ਸਹੀ ਭਾਸ਼ਾ ਦੇ ਜੋੜੇ ਵਿੱਚ, ਅਤੇ ਸਹੀ ਉਮੀਦਾਂ ਨਾਲ ਲਾਗੂ ਕਰਨਾ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਤੁਸੀਂ MT (NMT ਅਤੇ LLM-ਅਧਾਰਿਤ ਅਨੁਵਾਦ) ਦੇ ਦੋ ਪ੍ਰਮੁੱਖ ਪਰਿਵਾਰਾਂ ਬਾਰੇ ਜਾਣੂ ਹੋਵੋਗੇ, ਸਿੱਖੋਗੇ ਕਿ ਕਿਹੜੀ ਨੌਕਰੀ ਲਈ ਬਿਹਤਰ ਹੈ, ਡਿਲੀਵਰੀ ਤੋਂ ਪਹਿਲਾਂ ਅਨੁਵਾਦ ਦੀ ਕੱਚੀ ਆਉਟਪੁੱਟ ਗੁਣਵੱਤਾ ਨੂੰ ਕਿਵੇਂ ਮਾਪਣਾ ਹੈ, ਅਤੇ ਨੌਕਰੀ ਦੇ ਅਨੁਸਾਰ ਇੰਜਣ ਦੀ ਚੋਣ ਕਿਵੇਂ ਕਰਨੀ ਹੈ। ਉਦੇਸ਼ "ਸਭ ਸਮਾਨ, ਪੇਸਟ-ਅਨੁਵਾਦ" ਦੇ ਵਿਚਾਰ ਤੋਂ ਦੂਰ ਜਾਣਾ ਹੈ ਅਤੇ ਇੱਕ ਮਾਹਰ ਬਣਨਾ ਹੈ ਜੋ ਭਵਿੱਖਬਾਣੀ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਮਸ਼ੀਨ ਲਈ ਕਿਹੜਾ ਟੈਕਸਟ ਢੁਕਵਾਂ ਹੈ ਅਤੇ ਜਿਸ ਲਈ ਮਨੁੱਖੀ-ਤੀਬਰ ਮਿਹਨਤ ਦੀ ਲੋੜ ਹੈ।
ਦੋ ਪਰਿਵਾਰ: NMT ਅਤੇ LLM-ਅਧਾਰਿਤ ਅਨੁਵਾਦ
NMT (ਨਿਊਰਲ ਮਸ਼ੀਨ ਟ੍ਰਾਂਸਲੇਸ਼ਨ) ਉਹ ਪ੍ਰਣਾਲੀਆਂ ਹਨ ਜੋ ਲੱਖਾਂ ਦੋਭਾਸ਼ੀ ਵਾਕਾਂ ਤੋਂ ਸਿੱਖੀਆਂ ਹਨ ਅਤੇ ਵਾਕ ਨੂੰ ਸਮੁੱਚੇ ਤੌਰ 'ਤੇ ਅਨੁਵਾਦ ਕਰਦੀਆਂ ਹਨ; ਗੂਗਲ ਟ੍ਰਾਂਸਲੇਟ, ਡੀਪੀਐਲ, ਮਾਈਕ੍ਰੋਸਾਫਟ ਟ੍ਰਾਂਸਲੇਟਰ ਇਹਨਾਂ ਦੀਆਂ ਉਦਾਹਰਣਾਂ ਹਨ। ਤਾਕਤ: ਬਹੁਤ ਤੇਜ਼, ਇਕਸਾਰ, ਛੋਟੇ ਵਾਕਾਂ ਵਿੱਚ ਪ੍ਰਵਾਹ। ਕਮਜ਼ੋਰੀ: ਅਕਸਰ ਵਾਕ ਦੀ ਸੀਮਾ ਤੋਂ ਬਾਹਰ ਦਾ ਸੰਦਰਭ ਨਹੀਂ ਦੇਖਦਾ (ਭਾਵ ਪੂਰੇ ਪਾਠ ਤੋਂ); ਪੈਰਾਗ੍ਰਾਫ ਨੂੰ ਦੇਖ ਕੇ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਮੁਸ਼ਕਲ ਹੋ ਸਕਦਾ ਹੈ ਕਿ "ਬੈਂਕ" ਸ਼ਬਦ ਦਾ ਅਰਥ ਬੈਂਕ ਜਾਂ ਨਦੀ ਦਾ ਕਿਨਾਰਾ ਹੈ ਅਤੇ ਇਹ ਪ੍ਰਦਾਨ ਕੀਤੇ ਗਏ ਸ਼ਬਦਾਂ ਦੀ ਸੂਚੀ ਵਿੱਚ ਫਿੱਟ ਨਹੀਂ ਬੈਠਦਾ ਹੈ।
ਐਲਐਲਐਮ-ਅਧਾਰਿਤ ਅਨੁਵਾਦ (ਵੱਡਾ ਭਾਸ਼ਾ ਮਾਡਲ) ਅਨੁਵਾਦ ਲਈ ਨਿਰਦੇਸ਼-ਸੰਚਾਲਿਤ ਮਾਡਲਾਂ ਜਿਵੇਂ ਕਿ ਚੈਟਜੀਪੀਟੀ, ਕਲਾਉਡ, ਜੇਮਿਨੀ ਦੀ ਵਰਤੋਂ ਹੈ। ਤਾਕਤ: ਨਿਰਦੇਸ਼ ਲੈਂਦਾ ਹੈ — ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਸਮਝਦਾ ਹੈ ਜਿਵੇਂ ਕਿ "ਰਸਮੀ ਟੋਨ ਦੀ ਵਰਤੋਂ ਕਰੋ", "ਸ਼ਰਤਾਂ ਦੀ ਇਸ ਸੂਚੀ ਦੀ ਪਾਲਣਾ ਕਰੋ", "ਨਿਸ਼ਾਨਾ ਦਰਸ਼ਕ ਬੱਚੇ ਹਨ"; ਵਿਆਪਕ ਸੰਦਰਭ ਦੇਖਦਾ ਹੈ; ਮੁਹਾਵਰੇ ਅਤੇ ਟੋਨ ਨੂੰ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਕੈਪਚਰ ਕਰਦਾ ਹੈ। ਕਮਜ਼ੋਰੀ: ਕਈ ਵਾਰ "ਬਹੁਤ ਸਿਰਜਣਾਤਮਕ" ਹੋ ਸਕਦਾ ਹੈ ਅਤੇ ਸਰੋਤ ਵਿੱਚ ਸ਼ਾਮਲ ਹੋ ਸਕਦਾ ਹੈ (ਭਰਮ ਦਾ ਖ਼ਤਰਾ), ਲੰਬੇ ਪਾਠਾਂ ਵਿੱਚ ਤਾਲਮੇਲ ਗੁਆ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਲਾਗਤ/ਗਤੀ ਨੌਕਰੀ ਦੇ ਅਧਾਰ 'ਤੇ ਵੱਖਰੀ ਹੁੰਦੀ ਹੈ।
ਅੰਗੂਠੇ ਦਾ ਨਿਯਮ: ਸਿੱਧੇ, ਦੁਹਰਾਉਣ ਵਾਲੇ, ਤਕਨੀਕੀ ਪਾਠਾਂ ਵਿੱਚ NMT ਆਮ ਤੌਰ 'ਤੇ ਤੇਜ਼ ਅਤੇ ਲੋੜੀਂਦਾ ਹੁੰਦਾ ਹੈ; LLM ਉਹਨਾਂ ਟੈਕਸਟਾਂ ਦੇ ਨਾਲ ਵਧੇਰੇ ਲਚਕਦਾਰ ਹੈ ਜਿਹਨਾਂ ਲਈ ਟੋਨ, ਸੰਦਰਭ, ਸ਼ਬਦਾਵਲੀ, ਅਤੇ ਹਦਾਇਤਾਂ ਵਿੱਚ ਅਨੁਸ਼ਾਸਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਅੱਜ ਬਹੁਤੇ ਪੇਸ਼ੇਵਰ ਦੋਵੇਂ ਇਕੱਠੇ ਵਰਤਦੇ ਹਨ: NMT ਤੋਂ ਤੁਰੰਤ ਡਰਾਫਟ, LLM ਤੋਂ ਟੋਨ/ਮਿਆਦ ਸੁਧਾਰ।
ਸੰਕੇਤ: ਕਿਸੇ ਭਾਸ਼ਾ ਜੋੜੇ ਦੀ ਮਸ਼ੀਨ ਗੁਣਵੱਤਾ (ਜਿਵੇਂ ਕਿ ਤੁਰਕੀ→ਅੰਗਰੇਜ਼ੀ) ਉਲਟ ਦਿਸ਼ਾ (ਅੰਗਰੇਜ਼ੀ→ਤੁਰਕੀ) ਤੋਂ ਵੱਖਰੀ ਹੋ ਸਕਦੀ ਹੈ। ਸਮੂਹਿਕ, ਲਚਕਦਾਰ ਸੰਟੈਕਸ ਵਾਲੀਆਂ ਭਾਸ਼ਾਵਾਂ, ਜਿਵੇਂ ਕਿ ਤੁਰਕੀ, ਆਮ ਤੌਰ 'ਤੇ MT ਲਈ ਵਧੇਰੇ ਚੁਣੌਤੀਪੂਰਨ ਹੁੰਦੀਆਂ ਹਨ। ਆਪਣੇ ਆਪ ਲਈ ਨਿਰਣਾ ਕਰੋ ਕਿ ਕੁਝ ਨਮੂਨੇ ਦੇ ਪਾਠਾਂ ਦੇ ਨਾਲ ਤੁਹਾਡੀ ਆਪਣੀ ਜੋੜੀ ਵਿੱਚ ਕਿਹੜਾ ਇੰਜਣ ਬਿਹਤਰ ਹੈ।
ਟੈਕਸਟ ਦੀ ਮਸ਼ੀਨ ਅਨੁਕੂਲਤਾ: ਪਹਿਲਾਂ ਇਸਨੂੰ ਪੁੱਛੋ
ਹਰ ਟੈਕਸਟ ਮਸ਼ੀਨ ਲਈ ਬਰਾਬਰ ਢੁਕਵਾਂ ਨਹੀਂ ਹੈ। ਅਨੁਵਾਦ ਸ਼ੁਰੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ, ਟੈਕਸਟ ਨੂੰ "ਅਨੁਕੂਲਤਾ" ਫਿਲਟਰ ਰਾਹੀਂ ਪਾਸ ਕਰੋ:
- ਮਸ਼ੀਨ ਲਈ ਚੰਗੀ ਤਰ੍ਹਾਂ ਅਨੁਕੂਲ: ਤਕਨੀਕੀ ਮੈਨੂਅਲ, ਉਤਪਾਦ ਵੇਰਵਾ, ਦੁਹਰਾਉਣ ਵਾਲਾ ਇੰਟਰਫੇਸ ਟੈਕਸਟ, ਸਟੈਂਡਰਡ ਪੱਤਰ ਵਿਹਾਰ, ਸਾਰਣੀ/ਸੂਚੀ। ਭਾਸ਼ਾ ਸਾਦੀ ਹੈ, ਸ਼ਬਦਾਵਲੀ ਪੱਕੀ ਹੈ, ਰਚਨਾਤਮਕਤਾ ਘੱਟ ਹੈ।
- ਮਾਧਿਅਮ ਢੁਕਵਾਂ: ਖ਼ਬਰਾਂ, ਕਾਰਪੋਰੇਟ ਸਮੱਗਰੀ, ਵਿਦਿਅਕ ਸਮੱਗਰੀ। ਮਸ਼ੀਨ ਚੰਗੀ ਰੂਪਰੇਖਾ ਤਿਆਰ ਕਰਦੀ ਹੈ ਪਰ ਟੋਨ ਅਤੇ ਵਹਾਅ ਲਈ ਗੰਭੀਰ ਪੋਸਟ-ਐਡੀਟਿੰਗ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
- ਮਸ਼ੀਨ ਲਈ ਢੁਕਵਾਂ ਨਹੀਂ ਹੈ (ਉੱਚ ਜੋਖਮ): ਕਾਨੂੰਨੀ ਇਕਰਾਰਨਾਮਾ, ਮੈਡੀਕਲ ਟੈਕਸਟ, ਇਸ਼ਤਿਹਾਰ/ਸਲੋਗਨ, ਸਾਹਿਤਕ ਟੈਕਸਟ, ਹਾਸਰਸ, ਕਵਿਤਾ। ਇੱਥੇ ਮਸ਼ੀਨ ਸਿਰਫ ਵਿਚਾਰ ਦਿੰਦੀ ਹੈ; ਨੌਕਰੀ ਜ਼ਿਆਦਾਤਰ ਲੋਕਾਂ ਦੇ ਹਿੱਸੇ ਆਉਂਦੀ ਹੈ।
ਜੇਕਰ ਤੁਸੀਂ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਇਹ ਅੰਤਰ ਬਣਾਉਂਦੇ ਹੋ, ਤਾਂ ਤੁਸੀਂ ਦੋਵੇਂ ਗਾਹਕ ਨੂੰ ਸਹੀ ਸਮਾਂ/ਕੀਮਤ ਦਿਓਗੇ ਅਤੇ ਕੱਚੇ ਆਉਟਪੁੱਟ 'ਤੇ ਅੰਨ੍ਹੇਵਾਹ ਭਰੋਸਾ ਕਰਨ ਤੋਂ ਆਪਣੇ ਆਪ ਨੂੰ ਬਚਾਓਗੇ।
ਕੱਚੀ ਆਉਟਪੁੱਟ ਗੁਣਵੱਤਾ ਨੂੰ ਤੁਰੰਤ ਮਾਪੋ
ਜਦੋਂ ਤੁਸੀਂ ਇੱਕ MT ਆਉਟਪੁੱਟ ਦੇਖਦੇ ਹੋ ਤਾਂ ਤੁਸੀਂ ਹੈਰਾਨ ਹੁੰਦੇ ਹੋ "ਕੀ ਇਹ ਚੰਗਾ ਹੈ ਜਾਂ ਬੁਰਾ?" ਸਵਾਲ ਦਾ ਜਵਾਬ ਇੱਕ ਤੇਜ਼ ਚੈਕਲਿਸਟ ਨਾਲ ਦਿਓ, ਨਾ ਕਿ ਅਨੁਭਵੀ। ਇਹਨਾਂ ਪੰਜ ਮਾਪਾਂ ਨੂੰ ਦੇਖੋ: ਸ਼ੁੱਧਤਾ (ਕੀ ਮਤਲਬ ਸਰੋਤ ਪ੍ਰਤੀ ਵਫ਼ਾਦਾਰ ਹੈ?), ਸੰਪੂਰਨਤਾ (ਕੀ ਵਾਕ ਛੱਡਿਆ ਗਿਆ ਹੈ ਜਾਂ ਜੋੜਿਆ ਗਿਆ ਹੈ?), ਸ਼ਬਦਾਵਲੀ (ਕੀ ਇਹ ਸਹੀ ਅਤੇ ਇਕਸਾਰ ਹੈ?), ਰਵਾਨਗੀ (ਕੀ ਇਹ ਨਿਸ਼ਾਨਾ ਭਾਸ਼ਾ ਵਿੱਚ ਕੁਦਰਤੀ ਹੈ?), ਫਾਰਮੈਟ (ਕੀ ਟੈਗ, ਨੰਬਰ, ਫਾਰਮੈਟਿੰਗ ਸੁਰੱਖਿਅਤ ਹੈ?)। ਅਸੀਂ ਅਗਲੀ ਗੁਣਵੱਤਾ ਇਕਾਈ ਵਿੱਚ ਇਹਨਾਂ ਮਾਪਾਂ ਨੂੰ ਡੂੰਘਾ ਕਰਾਂਗੇ; ਹੁਣ ਲਈ, ਇਸਨੂੰ ਤੁਹਾਡਾ ਪ੍ਰੀ-ਡਿਲੀਵਰੀ ਪ੍ਰਤੀਬਿੰਬ ਬਣੋ।
ਸਾਵਧਾਨ: MT ਆਉਟਪੁੱਟ ਦੀਆਂ ਸਭ ਤੋਂ ਖ਼ਤਰਨਾਕ ਤਰੁਟੀਆਂ "ਪ੍ਰਵਾਹ ਪਰ ਗਲਤ" ਹਨ। ਵਾਕ ਸੰਪੂਰਨ ਤੁਰਕੀ ਵਿੱਚ ਹੋ ਸਕਦਾ ਹੈ, ਪਰ ਸਰੋਤ ਵਿੱਚ "15% ਛੂਟ" ਨੂੰ "50% ਛੋਟ" ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ ਗਿਆ ਹੈ। ਰਵਾਨਗੀ ਦੁਆਰਾ ਮੁਅੱਤਲ ਨਾ ਕਰੋ; ਹਮੇਸ਼ਾ ਸੰਖਿਆ, ਨਕਾਰਾਤਮਕ ਅਤੇ ਸਹੀ ਨਾਂਵ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਦੇਖੋ।
ਤਿੰਨ ਛੋਟੇ ਕੇਸ
ਕੇਸ 1 - ਸਹੀ ਇੰਜਣ ਸਮੇਂ ਨੂੰ ਅੱਧਾ ਕਰ ਦਿੰਦਾ ਹੈ। ਇੱਕ ਅਨੁਵਾਦਕ ਨੇ NMT ਦੇ ਨਾਲ ਇੱਕ 12,000-ਸ਼ਬਦਾਂ ਦੇ ਸੌਫਟਵੇਅਰ ਇੰਟਰਫੇਸ ਅਤੇ LLM ਦੇ ਨਾਲ ਉਸੇ ਵਾਲੀਅਮ ਦੀ ਇੱਕ ਮਾਰਕੀਟਿੰਗ ਪੁਸਤਿਕਾ ਦਾ ਅਨੁਵਾਦ ਕਰਨ ਦੀ ਚੋਣ ਕੀਤੀ। ਇੰਟਰਫੇਸ 'ਤੇ NMT ਦੀ ਇਕਸਾਰਤਾ ਨੇ ਕੰਮ ਨੂੰ ਤੇਜ਼ ਕੀਤਾ; ਪੁਸਤਿਕਾ ਵਿੱਚ LLM ਦੀ ਧੁਨੀ ਲਚਕਤਾ ਨੇ ਮੁੜ ਲਿਖਣ ਦੇ ਬੋਝ ਨੂੰ 40% ਘਟਾ ਦਿੱਤਾ। ਦੋਵੇਂ ਕੰਮ ਇੱਕੋ ਇੰਜਣ ਨੂੰ ਦੇਣ ਨਾਲ ਸਮਾਂ ਬਰਬਾਦ ਹੋਵੇਗਾ।
ਕੇਸ 2 - ਪੂਰਵ-ਮੁਲਾਂਕਣ ਨੇ ਕੀਮਤ ਬਚਾਈ। ਇੱਕ ਦਫਤਰ ਇੱਕ ਕਾਨੂੰਨੀ ਪਾਠ ਪੇਸ਼ ਕਰਨ ਜਾ ਰਿਹਾ ਸੀ ਕਿਉਂਕਿ "ਇਹ ਮਸ਼ੀਨਾਂ ਦੁਆਰਾ ਬਣਾਇਆ ਜਾ ਸਕਦਾ ਹੈ, ਇਹ ਸਸਤਾ ਹੋਵੇਗਾ"। ਪੂਰਵ-ਮੁਲਾਂਕਣ ਵਿੱਚ, ਇੱਕ 500-ਸ਼ਬਦ ਦੇ ਨਮੂਨੇ ਦਾ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਸੀ; ਮਸ਼ੀਨ ਨੇ ਗਲਤ ਸਿਸਟਮ ਦੇ ਬਰਾਬਰ ਦੇ ਨਾਲ ਦੋ ਕਾਨੂੰਨੀ ਸ਼ਰਤਾਂ ਵਾਪਸ ਕਰ ਦਿੱਤੀਆਂ। ਦਫ਼ਤਰ ਨੇ "ਭਾਰੀ ਪੋਸਟ-ਸੰਪਾਦਨ" ਵਜੋਂ ਕੰਮ ਦੀ ਕੀਮਤ ਰੱਖੀ ਅਤੇ ਇੱਕ ਯਥਾਰਥਵਾਦੀ ਸਮਾਂ ਸੀਮਾ ਦਿੱਤੀ; ਉਸ ਨੇ ਗਲਤ ਪੇਸ਼ਕਸ਼ ਕਰਕੇ ਪੈਸੇ ਗੁਆਉਣ ਤੋਂ ਬਚਿਆ।
ਕੇਸ 3 — ਭਾਸ਼ਾ ਜੋੜਾ ਅੰਤਰ। ਇੱਕ ਟੀਮ ਨੇ ਸੋਚਿਆ ਕਿ ਇੱਕ ਇੰਜਣ ਜੋ ਅੰਗਰੇਜ਼ੀ→ਜਰਮਨ ਵਿੱਚ ਵਧੀਆ ਕੰਮ ਕਰਦਾ ਹੈ, ਤੁਰਕੀ→ਅਰਬੀ ਵਿੱਚ ਉਸੇ ਗੁਣ ਦਾ ਸੀ। 300-ਸ਼ਬਦਾਂ ਦੇ ਟੈਸਟ ਨੇ ਦਿਖਾਇਆ ਕਿ ਅਰਬੀ ਆਉਟਪੁੱਟ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸੁਧਾਰ ਦੀ ਲੋੜ ਹੈ। ਟੀਮ ਨੇ ਭਾਸ਼ਾ ਦੀ ਜੋੜੀ ਦੇ ਆਧਾਰ 'ਤੇ ਵੱਖ-ਵੱਖ ਇੰਜਣਾਂ ਅਤੇ ਵੱਖ-ਵੱਖ ਪੋਸਟ-ਐਡੀਟਿੰਗ ਬਜਟ ਨਿਰਧਾਰਤ ਕੀਤੇ।
ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ
1) ਟੈਕਸਟ ਅਨੁਕੂਲਤਾ ਮੁਲਾਂਕਣ:
ਤੁਹਾਡੀ ਭੂਮਿਕਾ: ਸੀਨੀਅਰ MTPE ਮਾਹਰ। ਮਸ਼ੀਨ ਅਨੁਵਾਦ ਲਈ ਅਨੁਕੂਲਤਾ ਲਈ ਹੇਠਾਂ ਦਿੱਤੇ ਟੈਕਸਟ ਨੂੰ ਦਰਜਾ ਦਿਓ: ਸ਼ਾਬਦਿਕ/ਤਕਨੀਕੀ ਜਾਂ ਰਚਨਾਤਮਕ/ਪ੍ਰਸੰਗਿਕ? ਇਸ ਨੂੰ (1) ਬਹੁਤ ਹੀ ਮਸ਼ੀਨ-ਅਨੁਕੂਲ, (2) ਮੱਧਮ, (3) ਉੱਚ ਜੋਖਮ ਵਜੋਂ ਸ਼੍ਰੇਣੀਬੱਧ ਕਰੋ ਅਤੇ ਆਪਣੀ ਤਰਕਸੰਗਤ ਲਿਖੋ। ਅਨੁਮਾਨਿਤ ਪੋਸਟ-ਐਡੀਟਿੰਗ ਲੋਡ ਨੂੰ ਹਲਕੇ/ਦਰਮਿਆਨੇ/ਭਾਰੀ ਵਜੋਂ ਅਨੁਮਾਨਿਤ ਕਰੋ। ਟੈਕਸਟ ਉਦਾਹਰਨ: [200-300 ਸ਼ਬਦਾਂ ਨੂੰ ਪੇਸਟ ਕਰੋ]
2) ਨਿਰਦੇਸ਼ਿਤ LLM ਅਨੁਵਾਦ (ਪਰਿਭਾਸ਼ਾ ਅਤੇ ਟੋਨ ਨਿਯੰਤਰਣ ਦੇ ਨਾਲ):
ਇਸ ਟੈਕਸਟ ਦਾ ਅਨੁਵਾਦ ਕਰੋ [ਸਰੋਤ]→[ਨਿਸ਼ਾਨਾ]।ਦਰਸ਼ਕ: [ਕੌਣ]। ਟੋਨ: [ਉਦਾ. ਅਧਿਕਾਰੀ]। ਖੇਤਰ: [ਉਦਾ. ਵਿੱਤ]।ਸ਼ਬਦਾਂ ਦੀ ਸੂਚੀ (ਵਰਤਣਾ ਯਕੀਨੀ ਬਣਾਓ): [A→a, B→b]।ਨਿਯਮ: ਜੋ ਸਰੋਤ ਵਿੱਚ ਨਹੀਂ ਹੈ ਉਹ ਨਾ ਜੋੜੋ, ਨੰਬਰ/ਤਰੀਕ/ਨਾਮ ਰੱਖੋ, ਹਰੇਕ ਵਾਕ ਨੂੰ ਇੱਕ ਵਾਕ ਨਾਲ ਬਦਲੋ। ਜਿੱਥੇ ਤੁਸੀਂ [?] ਨਾਲ ਯਕੀਨੀ ਨਹੀਂ ਹੋ, ਉੱਥੇ ਨਿਸ਼ਾਨ ਲਗਾਓ। ਪਾਠ: [...]
3) ਦੋ ਇੰਜਣ ਦੀ ਤੁਲਨਾ:
ਹੇਠਾਂ ਇੱਕੋ ਸਰੋਤ ਵਾਕ (A ਅਤੇ B) ਦੇ ਦੋ ਵੱਖ-ਵੱਖ ਅਨੁਵਾਦ ਹਨ। ਸ਼ੁੱਧਤਾ, ਸ਼ਬਦਾਵਲੀ ਅਤੇ ਸੁਭਾਵਿਕਤਾ ਦੇ ਰੂਪ ਵਿੱਚ ਹਰੇਕ ਦੀ ਤੁਲਨਾ ਕਰੋ, ਅਤੇ ਮੈਨੂੰ ਦੱਸੋ ਕਿ ਕਿਸ ਨੂੰ ਘੱਟ ਸੁਧਾਰ ਦੀ ਲੋੜ ਹੋਵੇਗੀ, ਜਾਇਜ਼ਤਾ ਦੇ ਨਾਲ। ਸਰੋਤ: [...] | ਅਨੁਵਾਦ ਏ: [...] | ਅਨੁਵਾਦ ਬੀ: [...]
4) ਕੱਚਾ ਆਉਟਪੁੱਟ ਤੇਜ਼ ਨਿਰੀਖਣ:
ਹੇਠਾਂ ਸਰੋਤ ਅਤੇ ਮਸ਼ੀਨ ਅਨੁਵਾਦ ਹੈ। ਸਿਰਫ਼ ਹੇਠਾਂ ਦਿੱਤੇ 'ਤੇ ਨਿਸ਼ਾਨ ਲਗਾਓ: (1) ਛੱਡੀ/ਜੋੜੀ ਗਈ ਜਾਣਕਾਰੀ, (2) ਗਲਤ ਨੰਬਰ/ਤਾਰੀਖ/ਨਾਮ, (3) ਨਕਾਰਾਤਮਕ ਗਲਤੀ, (4) ਅਸੰਗਤ ਸ਼ਬਦ। ਕੋਈ ਵੀ ਸੋਧ ਨਾ ਲਿਖੋ, ਸਿਰਫ ਜੋਖਮ ਵਾਲੇ ਖੇਤਰਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ। ਸਰੋਤ: [...] | ਅਨੁਵਾਦ: [...]
ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ
ਕਮਜ਼ੋਰ: "ਇਸ ਪਾਠ ਦਾ ਅਨੁਵਾਦ ਕਰੋ ਅਤੇ ਇਹ ਚੰਗਾ ਹੋਵੇਗਾ।" (ਇੰਜਣ ਲਈ, "ਚੰਗਾ" ਪਰਿਭਾਸ਼ਿਤ ਨਹੀਂ ਹੈ; ਕੋਈ ਟੋਨ, ਕੋਈ ਸ਼ਬਦ ਨਹੀਂ, ਕੋਈ ਪੁੰਜ ਨਹੀਂ।)
Güçlü: "ਇਸ ਉਤਪਾਦ ਦੇ ਵਰਣਨ ਦਾ ਅੰਗਰੇਜ਼ੀ ਤੋਂ ਤੁਰਕੀ ਵਿੱਚ ਅਨੁਵਾਦ ਕਰੋ। ਖੇਤਰ: ਈ-ਕਾਮਰਸ। ਦਰਸ਼ਕ: ਨੌਜਵਾਨ ਖਪਤਕਾਰ। ਟੋਨ: ਦੋਸਤਾਨਾ ਪਰ ਭਰੋਸਾ ਦੇਣ ਵਾਲਾ। 'ਚੈੱਕਆਉਟ' → 'ਚੈੱਕਆਊਟ ਸਟੈਪ', 'ਵਿਸ਼ਲਿਸਟ' → 'ਇੱਛਾ ਸੂਚੀ'। ਨੰਬਰ ਅਤੇ ਬ੍ਰਾਂਡ ਨਾਮ ਬਦਲੋ। ਬਿਨਾਂ ਕਿਸੇ ਅਨੁਵਾਦ ਦੇ ਤਰਕਸ਼ੀਲ ਤੁਰਕੀ।"
ਅੰਤਰ: ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ ਇੰਜਣ ਨੂੰ ਇੱਕ ਮਾਪਣਯੋਗ ਟੀਚਾ ਦਿੰਦਾ ਹੈ; ਆਉਟਪੁੱਟ ਸਿੱਧੇ ਪੋਸਟ-ਸੰਪਾਦਿਤ ਡਰਾਫਟ ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਂਦੀ ਹੈ।
NMT ਬਨਾਮ LLM ਤੁਲਨਾ ਚਾਰਟ
ਆਕਾਰ
NMT (Google, DeepL)
ਐਲਐਲਐਮ (ਚੈਟਜੀਪੀਟੀ, ਕਲਾਉਡ)
ਗਤੀ
ਬਹੁਤ ਤੇਜ਼
ਮੱਧਮ
ਹਦਾਇਤ/ਟੋਨ ਪ੍ਰਾਪਤ ਕਰੋ
ਕਮਜ਼ੋਰ
ਮਜ਼ਬੂਤ
ਮਿਆਦ ਸੂਚੀ ਦੀ ਪਾਲਣਾ ਕਰੋ
ਸੀਮਿਤ
ਚੰਗਾ (ਉਤਸ਼ਾਹ ਨਾਲ)
ਵਿਆਪਕ ਸੰਦਰਭ
ਕਮਜ਼ੋਰ
ਚੰਗਾ
ਭਰਮ ਦਾ ਖ਼ਤਰਾ
ਘੱਟ
ਮੱਧਮ (ਨਿਯੰਤਰਣ ਦੀ ਲੋੜ ਹੈ)
ਸਭ ਤੋਂ ਢੁਕਵੀਂ ਨੌਕਰੀ
ਸਿੱਧਾ/ਤਕਨੀਕੀ/ਦੁਹਰਾਉਣ ਵਾਲਾ
ਟੋਨ/ਪ੍ਰਸੰਗ/ਰਚਨਾਤਮਕ
ਆਮ ਗਲਤੀਆਂ
- ਹਰ ਕੰਮ ਲਈ ਇੱਕੋ ਇੰਜਣ ਦੀ ਵਰਤੋਂ ਕਰਨਾ। ਕੰਮ ਦੀ ਕਿਸਮ ਦੇ ਅਨੁਸਾਰ ਇੰਜਣ ਦੀ ਚੋਣ ਨਾ ਕਰਨ ਨਾਲ ਸਮਾਂ ਅਤੇ ਗੁਣਵੱਤਾ ਦਾ ਨੁਕਸਾਨ ਹੁੰਦਾ ਹੈ।
- ਪੂਰਵ-ਮੁਲਾਂਕਣ ਤੋਂ ਬਿਨਾਂ ਕੀਮਤ/ਸਮਾਂ ਦੇਣਾ। 200-300 ਸ਼ਬਦਾਂ ਦਾ ਟੈਸਟ ਸ਼ੁਰੂ ਤੋਂ ਹੀ ਹੈਰਾਨੀ ਪ੍ਰਗਟ ਕਰਦਾ ਹੈ।
- ਸ਼ੁੱਧਤਾ ਲਈ ਰਵਾਨਗੀ ਨੂੰ ਭੁਲਾਉਣਾ। ਇੱਕ ਸੁੰਦਰ ਵਾਕ ਦਾ ਮਤਲਬ ਇੱਕ ਸਹੀ ਵਾਕ ਨਹੀਂ ਹੁੰਦਾ.
- ਭਾਸ਼ਾ ਦੀ ਜੋੜੀ ਅਤੇ ਦਿਸ਼ਾ ਦੇ ਅੰਤਰ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਨਾ। ਇੱਕ ਜੋੜਾ ਵਿੱਚ ਇੱਕ ਚੰਗਾ ਇੰਜਣ ਦੂਜੇ ਵਿੱਚ ਕਮਜ਼ੋਰ ਹੋ ਸਕਦਾ ਹੈ।
- LLM ਦੇ ਵਾਧੇ ਵੱਲ ਧਿਆਨ ਨਹੀਂ ਦਿੱਤਾ ਜਾ ਰਿਹਾ। LLM ਕਈ ਵਾਰ "ਮਦਦ ਕਰਨ ਲਈ" ਸਰੋਤ ਵਿੱਚ ਵਾਕ ਜੋੜਦਾ ਹੈ; ਇਸ ਦੀ ਜਾਂਚ ਕਰੋ।
ਸੰਦਰਭ ਵਿੰਡੋ ਅਤੇ ਇਕਸਾਰਤਾ
LLM ਦੇ ਨਾਲ ਲੰਬੇ ਟੈਕਸਟ ਦਾ ਅਨੁਵਾਦ ਕਰਦੇ ਸਮੇਂ, ਇੱਕ ਤਕਨੀਕੀ ਸੀਮਾ ਨੂੰ ਜਾਣਨਾ ਜ਼ਰੂਰੀ ਹੈ: ਸੰਦਰਭ ਵਿੰਡੋ — ਟੈਕਸਟ ਦੀ ਮਾਤਰਾ ਜੋ ਮਾਡਲ "ਦੇਖ" ਸਕਦਾ ਹੈ ਅਤੇ ਇੱਕ ਸਮੇਂ ਵਿੱਚ ਧਿਆਨ ਵਿੱਚ ਰੱਖ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਟੈਕਸਟ ਇਸ ਵਿੰਡੋ ਤੋਂ ਵੱਡਾ ਹੈ, ਤਾਂ ਤੁਹਾਨੂੰ ਇਸ ਨੂੰ ਟੁਕੜਿਆਂ ਵਿੱਚ ਵੰਡਣਾ ਪਵੇਗਾ, ਅਤੇ ਮਾਡਲ ਅਗਲੇ ਹਿੱਸੇ ਵਿੱਚ "ਭੁੱਲ" ਸਕਦਾ ਹੈ, ਜਿਸ ਨੂੰ ਤੁਸੀਂ ਪਿਛਲੇ ਭਾਗਾਂ ਵਿੱਚ ਕੀਤਾ ਸੀ। ਇਸ ਲਈ, ਇੱਕ ਲੰਮੀ ਕਿਤਾਬ ਜਾਂ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਇੱਕ ਟੁਕੜੇ ਵਿੱਚ ਅਨੁਵਾਦ ਕਰਨ ਦੀ ਬਜਾਏ, ਟਰਮਬੇਸ ਅਤੇ ਸ਼ੈਲੀ ਦੇ ਸੰਖੇਪ ਦੇ ਹਰੇਕ ਹਿੱਸੇ ਨੂੰ ਯਾਦ ਕਰਾਉਣਾ ਇਕਸਾਰਤਾ ਨੂੰ ਕਾਇਮ ਰੱਖਦਾ ਹੈ। ਛੋਟੀਆਂ ਲਿਖਤਾਂ ਵਿੱਚ ਇਹ ਸਮੱਸਿਆ ਨਹੀਂ ਆਉਂਦੀ; ਹਾਲਾਂਕਿ, ਲੰਬੇ ਕੰਮਾਂ ਜਿਵੇਂ ਕਿ ਨਾਵਲਾਂ ਅਤੇ ਮੈਨੂਅਲਾਂ ਵਿੱਚ, ਇਸ ਤੋਂ ਇਲਾਵਾ ਪੈਸਿਆਂ ਵਿੱਚ ਇਕਸਾਰਤਾ ਦੀ ਜਾਂਚ ਕਰਨੀ ਜ਼ਰੂਰੀ ਹੈ। ਵਿਹਾਰਕ ਹੱਲ: ਇੱਕ "ਪ੍ਰੋਜੈਕਟ ਮੈਮੋਰੀ" (ਸ਼ਰਤਾਂ + ਅੱਖਰ + ਟੋਨ ਫੈਸਲੇ) ਤਿਆਰ ਕਰਨ ਲਈ ਅਤੇ ਇਸਨੂੰ ਹਰੇਕ ਟੁਕੜੇ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਜੋੜੋ ਅਤੇ ਅਨੁਵਾਦ ਦੇ ਅੰਤ ਵਿੱਚ ਟੁਕੜਿਆਂ ਵਿਚਕਾਰ ਇਕਸਾਰਤਾ ਲਈ ਸਕੈਨ ਕਰੋ। NMT ਵਿੱਚ, ਇਹ ਸਮੱਸਿਆ ਇੱਕ ਵੱਖਰੇ ਤਰੀਕੇ ਨਾਲ ਅਨੁਭਵ ਕੀਤੀ ਜਾਂਦੀ ਹੈ: ਕਿਉਂਕਿ NMT ਵਾਕ ਦੁਆਰਾ ਵਾਕ ਦਾ ਅਨੁਵਾਦ ਕਰਦਾ ਹੈ, ਪੈਰੇ ਦੀ ਲੰਬਾਈ ਦੀ ਇਕਸਾਰਤਾ ਪਹਿਲਾਂ ਹੀ ਕਮਜ਼ੋਰ ਹੈ, ਇਸਲਈ ਟਰਮਬੇਸ ਅਨੁਸ਼ਾਸਨ ਦੀ ਮਿਆਦ ਨੂੰ ਅੰਜਾਮ ਦਿੰਦਾ ਹੈ।
ਸਾਰੰਸ਼ ਵਿੱਚ
ਮਸ਼ੀਨ ਅਨੁਵਾਦ ਦੇ ਦੋ ਪਰਿਵਾਰ ਹਨ: NMT, ਜੋ ਕਿ ਤੇਜ਼ ਅਤੇ ਇਕਸਾਰ ਹੈ, ਅਤੇ LLM, ਜੋ ਸਿੱਖਿਆ ਲੈਂਦਾ ਹੈ ਅਤੇ ਸੰਦਰਭ ਅਤੇ ਟੋਨ ਨੂੰ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਦੇਖਦਾ ਹੈ। ਮਾਸਟਰ ਅਨੁਵਾਦਕ ਮਸ਼ੀਨ ਲਈ ਟੈਕਸਟ ਦੀ ਅਨੁਕੂਲਤਾ ਨੂੰ ਪਹਿਲਾਂ ਤੋਂ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ, ਕੰਮ ਦੇ ਅਨੁਸਾਰ ਇੰਜਣ ਦੀ ਚੋਣ ਕਰਦਾ ਹੈ, ਡਿਲੀਵਰੀ ਤੋਂ ਪਹਿਲਾਂ ਕੱਚੇ ਆਉਟਪੁੱਟ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਮਾਪਦਾ ਹੈ, ਅਤੇ ਕਦੇ ਵੀ ਸ਼ੁੱਧਤਾ ਨਾਲ ਰਵਾਨਗੀ ਨੂੰ ਉਲਝਾਉਂਦਾ ਨਹੀਂ ਹੈ। ਇਹ ਪੂਰਵ-ਮੁਲਾਂਕਣ ਪ੍ਰਤੀਬਿੰਬ ਤੁਹਾਨੂੰ ਇੱਕ ਯਥਾਰਥਵਾਦੀ ਸਮਾਂ/ਕੀਮਤ ਦੇਣ ਅਤੇ ਅੰਨ੍ਹੇ ਭਰੋਸੇ ਤੋਂ ਆਪਣੇ ਆਪ ਨੂੰ ਬਚਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
NMT ਟੂਲ ਅਤੇ LLM ਦੋਵਾਂ ਨਾਲ ਇੱਕੋ 200-ਸ਼ਬਦਾਂ ਦੇ ਟੈਕਸਟ ਦਾ ਅਨੁਵਾਦ ਕਰੋ। ਪੰਜ ਆਯਾਮਾਂ (ਸ਼ੁੱਧਤਾ, ਸੰਪੂਰਨਤਾ, ਸ਼ਬਦਾਵਲੀ, ਰਵਾਨਗੀ, ਫਾਰਮੈਟ) 'ਤੇ ਦੋ ਆਉਟਪੁੱਟਾਂ ਦੀ ਤੁਲਨਾ ਕਰੋ ਅਤੇ ਅਜਿਹੇ ਕਾਰਨ ਲਿਖੋ ਜਿਨ੍ਹਾਂ ਲਈ ਇਸ ਟੈਕਸਟ ਲਈ ਘੱਟ ਪੋਸਟ-ਐਡੀਟਿੰਗ ਦੀ ਲੋੜ ਹੈ। ਫਿਰ "ਕੱਚਾ ਆਉਟਪੁੱਟ ਤੇਜ਼ ਜਾਂਚ" ਟੈਮਪਲੇਟ ਨਾਲ ਦੋਵਾਂ 'ਤੇ ਫਲੈਗ ਮੁੱਦੇ/ਅਚਨਚੇਤ/ਮਿਆਦ ਦੇ ਜੋਖਮਾਂ ਨੂੰ.
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਮਸ਼ੀਨ ਲਈ ਟੈਕਸਟ ਦੀ ਅਨੁਕੂਲਤਾ ਨੂੰ ਸ਼੍ਰੇਣੀਬੱਧ ਕੀਤਾ (ਘੱਟ/ਮੱਧਮ/ਉੱਚ ਜੋਖਮ)।
- [ ] ਨੌਕਰੀ ਦੀ ਕਿਸਮ 'ਤੇ ਨਿਰਭਰ ਕਰਦਿਆਂ, ਮੈਂ ਫੈਸਲਾ ਕੀਤਾ ਕਿ ਕੀ NMT ਜਾਂ LLM ਦੀ ਵਰਤੋਂ ਕਰਨੀ ਹੈ।
- [ ] ਮੈਂ ਇੱਕ ਛੋਟੇ ਨਮੂਨੇ ਨਾਲ ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਮੁਲਾਂਕਣ ਕੀਤਾ ਅਤੇ ਉਸ ਅਨੁਸਾਰ ਮਿਆਦ/ਕੀਮਤ ਨਿਰਧਾਰਤ ਕੀਤੀ।
- [ ] ਮੈਂ ਤੇਜ਼ੀ ਨਾਲ ਪੰਜ ਅਯਾਮਾਂ ਵਿੱਚ ਕੱਚੇ ਆਉਟਪੁੱਟ ਦਾ ਨਿਰੀਖਣ ਕੀਤਾ।
- [ ] ਮੈਂ ਰਵਾਨਗੀ ਦੁਆਰਾ ਮੂਰਖ ਬਣਾਏ ਬਿਨਾਂ ਨੰਬਰ, ਮਿਤੀ, ਨਾਮ ਅਤੇ ਨਕਾਰਾਤਮਕ ਦੀ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਜਾਂਚ ਕੀਤੀ।