ਲਾਭ:
- ਸੰਖਿਆਤਮਕ ਤੌਰ 'ਤੇ ਚੰਕ ਸਾਈਜ਼, ਓਵਰਲੈਪ ਅਤੇ ਸਿਮੈਂਟਿਕ ਚੰਕਿੰਗ ਟ੍ਰੇਡਆਫ ਦਾ ਮੁਲਾਂਕਣ ਕਰੋ
- ਵੱਖ-ਵੱਖ ਦਸਤਾਵੇਜ਼ ਕਿਸਮਾਂ (PDF, ਟੇਬਲ, ਕੋਡ, ਚੈਟ ਲੌਗ) ਲਈ ਢੁਕਵੀਂ ਚੰਕਿੰਗ ਰਣਨੀਤੀ ਚੁਣਨਾ
- ਹਰੇਕ ਹਿੱਸੇ ਵਿੱਚ ਮੈਟਾਡੇਟਾ ਜੋੜ ਕੇ ਪ੍ਰਾਪਤੀ ਗੁਣਵੱਤਾ ਅਤੇ ਫਿਲਟਰਿੰਗ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰੋ
ਇਹ RAG ਵਿੱਚ ਸਭ ਤੋਂ ਨਜ਼ਰਅੰਦਾਜ਼ ਪਰ ਸਭ ਤੋਂ ਨਿਰਣਾਇਕ ਕਦਮ ਹੈ: ਤੁਸੀਂ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਕਿਵੇਂ ਤੋੜਦੇ ਹੋ। ਇਸ ਨੂੰ ਚੰਕਿੰਗ ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਭਾਵੇਂ ਤੁਸੀਂ ਉਸੇ ਮਾਡਲ ਨੂੰ ਉਹੀ ਦਸਤਾਵੇਜ਼ ਦਿੰਦੇ ਹੋ, ਖਰਾਬ ਚੰਕਿੰਗ ਕਾਰਨ ਮੁੜ ਪ੍ਰਾਪਤੀ ਗਲਤ ਟੁਕੜਾ ਵਾਪਸ ਕਰ ਦਿੰਦੀ ਹੈ ਅਤੇ ਮਾਡਲ ਕਦੇ ਵੀ ਵਧੀਆ ਜਵਾਬ ਨਹੀਂ ਦੇਵੇਗਾ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਅਸੀਂ ਫ੍ਰੈਗਮੈਂਟੇਸ਼ਨ ਰਣਨੀਤੀਆਂ ਨੂੰ ਕਵਰ ਕਰਦੇ ਹਾਂ, ਉਹਨਾਂ ਨੂੰ ਦਸਤਾਵੇਜ਼ ਦੀ ਕਿਸਮ ਦੇ ਅਨੁਸਾਰ ਕਿਵੇਂ ਢਾਲਣਾ ਹੈ, ਅਤੇ ਹਰੇਕ ਟੁਕੜੇ ਵਿੱਚ ਅਰਥਪੂਰਨ ਮੈਟਾਡੇਟਾ ਕਿਵੇਂ ਜੋੜਨਾ ਹੈ।
ਅਸੀਂ ਕਿਉਂ ਕੱਟਦੇ ਹਾਂ?
ਤਿੰਨ ਕਾਰਨ ਹਨ। ਪਹਿਲਾਂ, ਏਮਬੈਡਿੰਗ ਮਾਡਲ ਇੱਕ ਖਾਸ ਲੰਬਾਈ ਤੱਕ ਟੈਕਸਟ ਨੂੰ ਇੱਕ ਅਰਥਪੂਰਨ ਵੈਕਟਰ ਵਿੱਚ ਬਦਲਦੇ ਹਨ; ਜੇਕਰ ਪੂਰੇ 40-ਪੰਨਿਆਂ ਦੇ ਅਧਿਆਇ ਨੂੰ ਇੱਕ ਵੈਕਟਰ ਵਿੱਚ ਕ੍ਰੈਮ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਅਰਥ "ਧੁੰਦਲਾ" ਹੋ ਜਾਂਦਾ ਹੈ। ਦੂਜਾ, ਅਸੀਂ ਮਾਡਲ ਨੂੰ ਸਿਰਫ ਉਹ ਹਿੱਸਾ ਦੇਣਾ ਚਾਹੁੰਦੇ ਹਾਂ ਜਿਸਦੀ ਸੰਦਰਭ ਵਜੋਂ ਲੋੜ ਹੈ; ਪੂਰੇ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਸੌਂਪਣਾ ਮਹਿੰਗਾ ਅਤੇ ਧਿਆਨ ਭਟਕਾਉਣ ਵਾਲਾ ਹੈ। ਤੀਜਾ, ਸਟੀਕ ਹੋਣ ਲਈ ਮੁੜ ਪ੍ਰਾਪਤੀ ਲਈ, ਖੋਜ ਇਕਾਈ ਛੋਟੀ ਅਤੇ ਫੋਕਸ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ।
ਇਸ ਲਈ ਹਿੱਸਾ ਪ੍ਰਾਪਤੀ ਦੀ ਸਭ ਤੋਂ ਛੋਟੀ ਇਕਾਈ ਹੈ। ਇਹ ਬਹੁਤ ਵੱਡਾ ਜਾਂ ਬਹੁਤ ਛੋਟਾ ਨਹੀਂ ਹੋਣਾ ਚਾਹੀਦਾ - ਬਿਲਕੁਲ ਸਹੀ।
ਚੰਕ ਦਾ ਆਕਾਰ ਅਤੇ ਓਵਰਲੈਪ ਬੈਲੇਂਸ
ਇੱਥੇ ਦੋ ਮੁੱਖ ਸੈਟਿੰਗਾਂ ਹਨ: ਟੁਕੜੇ ਦਾ ਆਕਾਰ (ਇੱਕ ਹਿੱਸੇ ਵਿੱਚ ਕਿੰਨੇ ਟੋਕਨ/ਸ਼ਬਦ ਹੋਣਗੇ) ਅਤੇ ਓਵਰਲੈਪ (ਗੁਆਂਢੀ ਭਾਗਾਂ ਦੁਆਰਾ ਸਾਂਝਾ ਕੀਤਾ ਗਿਆ ਹਿੱਸਾ)।
ਬਹੁਤ ਛੋਟੇ ਭਾਗ (ਜਿਵੇਂ ਕਿ 100 ਟੋਕਨ): ਫੋਕਸ ਕੀਤਾ ਗਿਆ ਪਰ ਸੰਦਰਭ ਤੋਂ ਡਿਸਕਨੈਕਟ ਕੀਤਾ ਗਿਆ। ਉਹ ਕਹਿੰਦਾ ਹੈ "14 ਦਿਨਾਂ ਲਈ", ਪਰ ਜੋ 14 ਦਿਨ ਬਚੇ ਹਨ ਉਹ ਪਿਛਲੇ ਵਾਕ ਵਿੱਚ ਹਨ। ਬਹੁਤ ਵੱਡੇ ਟੁਕੜੇ (ਜਿਵੇਂ ਕਿ 2000 ਟੋਕਨ): ਸੰਦਰਭ ਨੂੰ ਸੁਰੱਖਿਅਤ ਰੱਖਦਾ ਹੈ ਪਰ ਬਹੁਤ ਸਾਰੇ ਥ੍ਰੈੱਡ ਇਸ ਵਿੱਚ ਮਿਲਾਏ ਜਾਂਦੇ ਹਨ; ਏਮਬੈਡਿੰਗ ਉਲਝ ਜਾਂਦੀ ਹੈ ਅਤੇ ਅਪ੍ਰਸੰਗਿਕ ਵਿਸ਼ੇ ਇਕੱਠੇ ਹੋ ਜਾਂਦੇ ਹਨ।
ਓਵਰਲੈਪ ਸੀਮਾ ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ. ਜੇਕਰ ਕੋਈ ਵਾਕ ਦੋ ਹਿੱਸਿਆਂ ਦੀ ਸੀਮਾ 'ਤੇ ਬਿਲਕੁਲ ਡਿੱਗਦਾ ਹੈ, ਤਾਂ ਇਹ ਓਵਰਲੈਪਿੰਗ ਤੋਂ ਬਿਨਾਂ ਦੋ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਇਸਦਾ ਅਰਥ ਗੁਆਚ ਜਾਂਦਾ ਹੈ। 50-100 ਟੋਕਨਾਂ ਦਾ ਓਵਰਲੈਪ ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦਾ ਹੈ ਕਿ ਸੀਮਾ ਦੇ ਅੰਦਰ ਆਉਣ ਵਾਲੀ ਜਾਣਕਾਰੀ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਹਿੱਸੇ ਵਿੱਚ ਬਰਕਰਾਰ ਰਹੇ।
ਟੁਕੜੇ ਦਾ ਆਕਾਰ
ਫਾਇਦਾ
ਨੁਕਸਾਨ
ਉਚਿਤ ਸਮੱਗਰੀ
ਛੋਟਾ (100-250 ਟੋਕਨ)
ਉੱਚ ਸੰਵੇਦਨਸ਼ੀਲਤਾ, ਫੋਕਸ
ਸੰਦਰਭ ਟੁੱਟ ਸਕਦਾ ਹੈ
FAQ, ਛੋਟੇ ਲੇਖ, ਪਰਿਭਾਸ਼ਾਵਾਂ
ਮੱਧਮ (300-600 ਟੋਕਨ)
ਸੰਤੁਲਨ; ਜ਼ਿਆਦਾਤਰ ਦ੍ਰਿਸ਼
-
ਪ੍ਰਕਿਰਿਆਵਾਂ, ਨੀਤੀ ਦੇ ਹਵਾਲੇ
ਵੱਡਾ (800-1500 ਟੋਕਨ)
ਸੰਦਰਭ ਇਕਸਾਰਤਾ
ਧੁੰਦਲਾ ਏਮਬੈਡਿੰਗ
ਬਿਰਤਾਂਤ, ਲੰਮੀ ਵਿਆਖਿਆ
ਸੁਝਾਅ: ਜੇਕਰ ਤੁਸੀਂ ਨਹੀਂ ਜਾਣਦੇ ਕਿ ਕਿੱਥੋਂ ਸ਼ੁਰੂ ਕਰਨਾ ਹੈ, ਤਾਂ 400-500 ਟੋਕਨ ਟੁਕੜੇ ਅਤੇ 50-80 ਟੋਕਨ ਓਵਰਲੈਪ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ; ਫਿਰ ਆਪਣੇ ਖੁਦ ਦੇ ਡੇਟਾ ਨਾਲ ਮਾਪੋ ਅਤੇ ਵਿਵਸਥਿਤ ਕਰੋ। "ਸਹੀ" ਆਕਾਰ ਸਰਵ ਵਿਆਪਕ ਨਹੀਂ ਹੈ, ਇਹ ਸੰਦਰਭ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ।
ਚੰਕਿੰਗ ਰਣਨੀਤੀਆਂ
ਸਥਿਰ-ਆਕਾਰ: ਹਰੇਕ N ਟੋਕਨਾਂ 'ਤੇ ਟੈਕਸਟ ਨੂੰ ਟ੍ਰਿਮ ਕਰਦਾ ਹੈ। ਇਹ ਸਧਾਰਨ ਅਤੇ ਤੇਜ਼ ਹੈ, ਪਰ ਮੱਧ-ਵਾਕ ਵਿੱਚ ਵਿਘਨ ਪਾ ਸਕਦਾ ਹੈ।
ਵਿਭਾਜਕ-ਆਧਾਰਿਤ (ਆਵਰਤੀ/ਵਿਭਾਜਕ): ਪੈਰਾਗ੍ਰਾਫ ਅਤੇ ਫਿਰ ਵਾਕ ਸੀਮਾਵਾਂ ਦੇ ਅਨੁਸਾਰ ਵੰਡਦਾ ਹੈ; ਇਹ ਅਰਥ ਦੀ ਇਕਸਾਰਤਾ ਨੂੰ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਸੁਰੱਖਿਅਤ ਰੱਖਦਾ ਹੈ। ਜ਼ਿਆਦਾਤਰ ਉਤਪਾਦਨ ਪ੍ਰਣਾਲੀਆਂ ਇਸ ਨਾਲ ਸ਼ੁਰੂ ਹੁੰਦੀਆਂ ਹਨ।
ਸਿਮੈਂਟਿਕ ਚੰਕਿੰਗ: ਇਹ ਵਾਕਾਂ ਦੇ ਏਮਬੈਡਿੰਗਾਂ ਨੂੰ ਵੇਖਦਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਵੰਡਦਾ ਹੈ ਜਿੱਥੇ ਵਿਸ਼ਾ ਤਬਦੀਲੀ ਹੁੰਦੀ ਹੈ। ਇਹ ਉੱਚ ਗੁਣਵੱਤਾ ਪਰ ਸਭ ਤੋਂ ਮਹਿੰਗਾ ਤਰੀਕਾ ਹੈ; ਵੱਡੀ ਮਾਤਰਾ ਦੇ ਨਾਲ, ਲੈਣ-ਦੇਣ ਦੀ ਲਾਗਤ ਵਧ ਜਾਂਦੀ ਹੈ।
ਢਾਂਚਾ-ਜਾਣੂ: ਦਸਤਾਵੇਜ਼ ਬਣਤਰ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ ਜਿਵੇਂ ਕਿ ਸਿਰਲੇਖ, ਭਾਗ, ਟੇਬਲ। ਉਦਾਹਰਨ ਲਈ, ਸਿਰਲੇਖਾਂ ਦੁਆਰਾ ਇੱਕ ਮਾਰਕਡਾਊਨ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਵੰਡਣਾ ਯਕੀਨੀ ਬਣਾਉਂਦਾ ਹੈ ਕਿ ਹਰੇਕ ਹਿੱਸੇ ਦਾ ਆਪਣਾ ਸਿਰਲੇਖ ਹੈ।
ਦਸਤਾਵੇਜ਼ ਦੀ ਕਿਸਮ ਦੁਆਰਾ ਅਨੁਕੂਲਨ
ਹਰ ਦਸਤਾਵੇਜ਼ ਇੱਕੋ ਜਿਹਾ ਨਹੀਂ ਹੁੰਦਾ। ਰਣਨੀਤੀ ਕਿਸਮ ਅਨੁਸਾਰ ਵੱਖਰੀ ਹੁੰਦੀ ਹੈ:
- PDF/ਪਾਲਿਸੀ ਟੈਕਸਟ: ਬੁੱਕਮਾਰਕ-ਆਧਾਰਿਤ, ਮੱਧਮ ਆਕਾਰ। ਪੰਨੇ ਦੇ ਉੱਪਰ/ਹੇਠਲੇ ਦੁਹਰਾਓ (ਸਿਰਲੇਖ/ਪਦਲੇਖ) ਨੂੰ ਸਾਫ਼ ਕਰੋ।
- ਟੇਬਲ: ਲਾਈਨ ਨੂੰ ਪ੍ਰਸੰਗ ਤੋਂ ਬਾਹਰ ਨਾ ਲਓ; ਹਰ ਕਤਾਰ ਨੂੰ ਸਿਰਲੇਖ ਜਾਣਕਾਰੀ ਨਾਲ ਰੱਖੋ ("ਆਈਟਮ: X, ਕੀਮਤ: Y, ਸਟਾਕ: Z")। ਕੱਚੀ ਸਾਰਣੀ ਨੂੰ ਸਾਦੇ ਪਾਠ ਵਿੱਚ ਬਦਲਣਾ ਅਕਸਰ ਜ਼ਰੂਰੀ ਹੁੰਦਾ ਹੈ।
- ਕੋਡ: ਫੰਕਸ਼ਨ/ਕਲਾਸ ਸੀਮਾਵਾਂ ਦੁਆਰਾ ਵੰਡੋ; ਕਿਸੇ ਫੰਕਸ਼ਨ ਨੂੰ ਰਸਤੇ ਤੋਂ ਬਾਹਰ ਨਾ ਕਰੋ।
- ਚੈਟ/ਟਿਕਟ ਰਿਕਾਰਡਿੰਗ: ਸੰਦੇਸ਼ ਜਾਂ ਗੱਲਬਾਤ ਦੌਰ ਦੁਆਰਾ ਵੰਡੋ; ਕਿਸਨੇ ਕੀ ਕਿਹਾ ਇਸ ਬਾਰੇ ਗਿਆਨ ਨੂੰ ਬਣਾਈ ਰੱਖੋ।
# ਬਰੈਕਟ-ਅਧਾਰਿਤ ਚੰਕਿੰਗ (ਸੰਕਲਪਿਕ) ਚੰਕਸ = ਬੋਲ (ਟੈਕਸਟ, ਟਾਰਗਿਟ_ਸਾਈਜ਼=450, # ਟੋਕਨ ਓਵਰਲੈਪ=70, # ਟੋਕਨ ਬਰੈਕਟਸ=["\n\n", "\n", ".", ""] # ਪੈਰਾਗ੍ਰਾਫ ਪਹਿਲਾ, ਸ਼ਬਦ ਆਖਰੀ)
ਹਰੇਕ ਟਰੈਕ ਵਿੱਚ ਮੈਟਾਡੇਟਾ ਸ਼ਾਮਲ ਕਰੋ
ਚੁੰਨੀ ਸਿਰਫ਼ "ਵੰਡ" ਨਹੀਂ ਹੈ; ਹਰੇਕ ਟੁਕੜੇ ਨੂੰ ਅਮੀਰ ਬਣਾਉਣਾ ਹੈ. ਹਰ ਟੈਗ ਜੋ ਤੁਸੀਂ ਟ੍ਰੈਕ ਨਾਲ ਜੋੜਦੇ ਹੋ, ਭਵਿੱਖ ਵਿੱਚ ਫਿਲਟਰਿੰਗ ਅਤੇ ਸਰੋਤ ਦੇ ਹਵਾਲੇ ਲਈ ਸੋਨੇ ਵਿੱਚ ਇਸਦੇ ਭਾਰ ਦੇ ਬਰਾਬਰ ਹੈ।
# ਸੰਪੂਰਨ ਹਿੱਸਾ (ਸੰਕਲਪਿਕ){ "ਟੈਕਸਟ": "1-5 ਸਾਲਾਂ ਦੀ ਸੇਵਾ ਦੇ ਨਾਲ ਸਲਾਨਾ ਅਦਾਇਗੀ ਛੁੱਟੀ 14 ਦਿਨ ਹੈ...", "ਮੈਟਾਡਾਟਾ": { "ਸਰੋਤ": "ik_el_kitabi_v7.pdf", "ਸੈਕਸ਼ਨ": "5.2 ਸਾਲਾਨਾ ਛੁੱਟੀ", "ਪੰਨਾ": 23, "ਤਾਰੀਖ": "6-5 ਸਾਲ", "2002" "privacy": "ਅੰਦਰੂਨੀ" }}
ਇੱਕ ਹੋਰ ਸ਼ਕਤੀਸ਼ਾਲੀ ਤਕਨੀਕ ਇੱਕ ਪ੍ਰਸੰਗਿਕ ਸਿਰਲੇਖ ਨੂੰ ਜੋੜ ਰਹੀ ਹੈ: ਅਧਿਆਇ ਦਾ ਸਿਰਲੇਖ ਲਿਖਣਾ ਜਿਸ ਨਾਲ ਇਹ ਹਰੇਕ ਟੁਕੜੇ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਹੈ। ਇਸ ਤਰ੍ਹਾਂ, "14 ਦਿਨਾਂ ਲਈ" ਵਰਗਾ ਇੱਕ ਟੁੱਟਿਆ ਹੋਇਆ ਟੁਕੜਾ ਵੀ "ਸਾਲਾਨਾ ਛੁੱਟੀ - 14 ਦਿਨ" ਦੇ ਰੂਪ ਵਿੱਚ ਬਿਹਤਰ ਏਮਬੇਡ ਅਤੇ ਵਧੇਰੇ ਅਰਥਪੂਰਨ ਹੈ।
ਕਮਜ਼ੋਰ ਚੰਕਿੰਗ / ਮਜ਼ਬੂਤ ਚੰਕਿੰਗ
ਕਮਜ਼ੋਰ (ਅੰਨ੍ਹੇ ਹਾਰਡਕਟ, ਕੋਈ ਮੈਟਾਡੇਟਾ ਨਹੀਂ):
ਹਰ 1000 ਅੱਖਰਾਂ ਵਿੱਚ ਟੈਕਸਟ ਨੂੰ ਕੱਟੋ। ਸਿਰਫ਼ ਟੈਕਸਟ ਰੱਖੋ। # ਨਤੀਜਾ: ਟੇਬਲਾਂ ਵਿਚਕਾਰ ਵੰਡੀਆਂ ਗਈਆਂ ਹਨ, "14 ਦਿਨ" ਬਿਨਾਂ ਪ੍ਰਸੰਗ ਦੇ ਰਹਿ ਗਏ ਹਨ, # ਇਹ ਪਤਾ ਨਹੀਂ ਹੈ ਕਿ ਇਹ ਕਿਸ ਦਸਤਾਵੇਜ਼ ਤੋਂ ਆਇਆ ਹੈ, ਕੋਈ ਫਿਲਟਰ ਨਹੀਂ ਬਣਾਇਆ ਜਾ ਸਕਦਾ ਹੈ।
ਸ਼ਕਤੀਸ਼ਾਲੀ (ਢਾਂਚਾ-ਜਾਗਰੂਕ + ਸਿਰਲੇਖ + ਮੈਟਾਡੇਟਾ):
ਦਸਤਾਵੇਜ਼ ਨੂੰ ਸਿਰਲੇਖਾਂ ਦੁਆਰਾ ਵੰਡੋ; ਹਰੇਕ ਹਿੱਸੇ ਵਿੱਚ ਭਾਗ ਦਾ ਸਿਰਲੇਖ ਸ਼ਾਮਲ ਕਰੋ; ਸਰੋਤ, ਪੰਨਾ, ਮਿਤੀ ਅਤੇ ਗੋਪਨੀਯਤਾ ਮੈਟਾਡੇਟਾ ਨੱਥੀ ਕਰੋ; ਟੇਬਲਰੋਜ਼ ਨੂੰ ਉਹਨਾਂ ਦੇ ਸਿਰਲੇਖਾਂ ਨਾਲ ਪਲੇਨ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲੋ। # ਨਤੀਜਾ: ਫੋਕਸਡ, ਪ੍ਰਸੰਗਿਕ, ਫਿਲਟਰ ਕਰਨ ਯੋਗ, ਸਰੋਤਯੋਗ।
ਤਿੰਨ ਮਿੰਨੀ ਕੇਸ
ਕੇਸ 1 - ਪੇਂਟਿੰਗ ਆਫ਼ਤ। ਇੱਕ ਵਿੱਤ ਟੀਮ ਨੇ 200 ਪੰਨਿਆਂ ਦੀ ਕੀਮਤ ਸੂਚੀ ਨੂੰ ਅੰਨ੍ਹੇ ਹਾਰਡ ਕੱਟਣ ਨਾਲ ਵੰਡਿਆ; ਸਾਰਣੀ ਦੀਆਂ ਕਤਾਰਾਂ ਬੇਤਰਤੀਬੇ ਵੰਡੀਆਂ ਗਈਆਂ ਸਨ। "ਉਤਪਾਦ X ਦੀ ਕੀਮਤ ਕੀ ਹੈ?" ਮਾਡਲ ਨੇ ਗਲਤ ਲਾਈਨ ਪੜ੍ਹੀ ਅਤੇ ਗਲਤ ਕੀਮਤ ਦਿੱਤੀ (12 ਵਿੱਚੋਂ 9 ਕੇਸ ਗਲਤ ਹਨ)। ਜਦੋਂ ਮੈਂ ਸਾਰਣੀ ਦੀਆਂ ਕਤਾਰਾਂ ਨੂੰ "ਉਤਪਾਦ: ... | ਕੀਮਤ: ... | ਯੂਨਿਟ: ..." ਫਾਰਮੈਟ ਵਿੱਚ ਸਾਦੇ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲਿਆ ਤਾਂ ਗਲਤੀ 12 ਵਿੱਚੋਂ 0 ਤੱਕ ਘਟ ਗਈ।
ਕੇਸ 2 - ਬਹੁਤ ਵੱਡਾ ਹਿੱਸਾ। ਵਿਕੀ ਵਿੱਚ, ਹਰੇਕ ਪੰਨਾ ਇੱਕ ਟੁਕੜੇ ਦਾ ਬਣਿਆ ਹੁੰਦਾ ਹੈ (ਕੁਝ ਕਹਿੰਦੇ ਹਨ ਕਿ 3,000 ਟੋਕਨ ਹਨ)। ਏਮਬੈਡਿੰਗ ਧੁੰਦਲੀ ਹੈ ਕਿਉਂਕਿ ਇੱਕ ਪੰਨੇ 'ਤੇ "ਛੁੱਟੀ", "ਓਵਰਟਾਈਮ" ਅਤੇ "ਪੇਰੋਲ" ਹੈ; ਛੁੱਟੀ ਦੇ ਸਵਾਲ ਨੂੰ ਲੈ ਕੇ ਕੰਮਕਾਜੀ ਘੰਟਿਆਂ ਦਾ ਸੈਕਸ਼ਨ ਵੀ ਲਾਗੂ ਹੋਇਆ। ਜਦੋਂ ਪੰਨਿਆਂ ਨੂੰ ਸਿਰਲੇਖ ਦੁਆਰਾ ਮੱਧਮ ਆਕਾਰ ਵਿੱਚ ਵੰਡਿਆ ਗਿਆ ਸੀ, ਤਾਂ recall@5 64% ਤੋਂ ਵਧ ਕੇ 91% ਹੋ ਗਿਆ।
ਕੇਸ 3 — ਬਿਨਾਂ ਓਵਰਲੈਪ ਦੇ ਕੱਟਿਆ ਹੋਇਆ ਵਾਕ। ਕਾਨੂੰਨੀ ਟੀਮ ਲਈ 250 ਟੋਕਨ ਫਿਕਸਡ ਕੱਟ, ਕੋਈ ਓਵਰਲੈਪ ਨਹੀਂ। ਇੱਕ ਆਲੋਚਨਾਤਮਕ ਪਰਿਭਾਸ਼ਾ ਦੋ ਹਿੱਸਿਆਂ ਦੀ ਸਰਹੱਦ 'ਤੇ ਡਿੱਗ ਗਈ ਅਤੇ ਦੋ ਵਿੱਚ ਵੰਡੀ ਗਈ; ਨਾ ਤਾਂ ਇੱਕ ਅਤੇ ਨਾ ਹੀ ਦੂਜੇ ਵਿੱਚ ਪੂਰਾ ਜਵਾਬ ਸ਼ਾਮਲ ਹੈ। ਜਦੋਂ 60 ਟੋਕਨ ਓਵਰਲੈਪ ਜੋੜਿਆ ਗਿਆ ਸੀ, ਤਾਂ ਉਹੀ ਪਰਿਭਾਸ਼ਾ ਇੱਕ ਟੁਕੜੇ ਵਿੱਚ ਬਰਕਰਾਰ ਰਹੀ ਅਤੇ ਸਹੀ ਜਵਾਬ ਵਾਪਸ ਕਰ ਦਿੱਤਾ ਗਿਆ।
ਆਮ ਗਲਤੀਆਂ
- ਬਲਾਇੰਡ ਫਿਕਸਡ ਕੱਟ: ਮੱਧ ਵਿੱਚ ਵਾਕਾਂ ਅਤੇ ਟੇਬਲਾਂ ਨੂੰ ਵੰਡਦਾ ਹੈ; ਅਰਥ ਖਤਮ ਹੋ ਗਿਆ ਹੈ।
- ਓਵਰਲੈਪ ਨੂੰ ਜ਼ੀਰੋ 'ਤੇ ਛੱਡਣਾ: ਸੀਮਾ 'ਤੇ ਆਉਣ ਵਾਲੀ ਜਾਣਕਾਰੀ ਵੰਡੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਗੁਆਚ ਜਾਂਦੀ ਹੈ।
- ਮੈਟਾਡੇਟਾ ਨਹੀਂ ਜੋੜਨਾ: ਫਿਲਟਰਿੰਗ ਅਤੇ ਸਰੋਤ ਡਿਸਪਲੇ ਅਸੰਭਵ ਹੋ ਜਾਂਦੇ ਹਨ।
- ਟੇਬਲਾਂ ਨੂੰ ਕੱਚਾ ਛੱਡਣਾ: ਮਾਡਲ ਟੇਬਲ ਬਣਤਰ ਨੂੰ ਹੱਲ ਨਹੀਂ ਕਰ ਸਕਦਾ; ਲਾਈਨਾਂ ਨੂੰ ਸਾਦੇ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲੋ।
- ਇੱਕ ਰਣਨੀਤੀ ਲਾਗੂ ਕਰਨਾ: ਪੀਡੀਐਫ, ਕੋਡ ਅਤੇ ਟੇਬਲ ਨੂੰ ਇੱਕੋ ਢੰਗ ਨਾਲ ਵੰਡਿਆ ਨਹੀਂ ਜਾਂਦਾ ਹੈ; ਸ਼ੈਲੀ ਦੇ ਅਨੁਕੂਲ.
ਸਾਵਧਾਨ: ਇੱਕ ਵਾਰ ਚੰਕਿੰਗ ਨੂੰ ਸੈੱਟ ਨਾ ਕਰੋ ਅਤੇ ਇਸਨੂੰ ਭੁੱਲ ਜਾਓ। ਨਵੇਂ ਦਸਤਾਵੇਜ਼ ਕਿਸਮਾਂ ਦੇ ਆਉਣ 'ਤੇ ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਮਾਪੋ (ਇੱਕ ਨਵੇਂ ਸਿਸਟਮ ਤੋਂ ਟਿਕਟਾਂ, ਸਕੈਨ ਕੀਤੀਆਂ PDF)। ਖਰਾਬ ਇਨਪੁਟ ਡੇਟਾ ਦਾ ਮਤਲਬ ਹੈ ਮਾੜਾ ਜਵਾਬ ("ਕੂੜਾ ਅੰਦਰ, ਕੂੜਾ ਬਾਹਰ")।
ਸੰਖੇਪ ਵਿੱਚ
- ਚੰਕ ਮੁੜ ਪ੍ਰਾਪਤੀ ਦੀ ਸਭ ਤੋਂ ਛੋਟੀ ਇਕਾਈ ਹੈ; ਨਾ ਬਹੁਤ ਵੱਡਾ ਅਤੇ ਨਾ ਹੀ ਬਹੁਤ ਛੋਟਾ - ਇਹ ਸਮੱਗਰੀ ਦੇ ਅਨੁਸਾਰ ਸੰਤੁਲਿਤ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ.
- ਚੰਕ ਦਾ ਆਕਾਰ ਫੋਕਸ-ਪ੍ਰਸੰਗ ਸੰਤੁਲਨ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ; ਓਵਰਲੈਪ ਸੀਮਾ ਦੇ ਨੁਕਸਾਨ ਦਾ ਪ੍ਰਬੰਧਨ ਕਰਦਾ ਹੈ।
- ਬਰੈਕਟ-ਅਧਾਰਿਤ ਅਤੇ ਬਣਤਰ-ਜਾਗਰੂਕ ਚੰਕਿੰਗ ਜ਼ਿਆਦਾਤਰ ਪੀੜ੍ਹੀ ਪ੍ਰਣਾਲੀਆਂ ਦਾ ਸ਼ੁਰੂਆਤੀ ਬਿੰਦੂ ਹੈ; ਸਿਮੈਂਟਿਕ ਚੰਕਿੰਗ ਚੰਗੀ ਕੁਆਲਿਟੀ ਪਰ ਮਹਿੰਗੀ ਹੈ।
- ਟੇਬਲ, ਸਕ੍ਰਿਪਟ ਅਤੇ ਚੈਟ ਵਰਗੀਆਂ ਕਿਸਮਾਂ ਲਈ ਉਹਨਾਂ ਦੀਆਂ ਆਪਣੀਆਂ ਰਣਨੀਤੀਆਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਟੇਬਲ ਨੂੰ ਪਲੇਨ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲੋ।
- ਹਰੇਕ ਟਰੈਕ ਵਿੱਚ ਸਰੋਤ/ਤਾਰੀਖ/ਅਧਿਆਇ/ਗੋਪਨੀਯਤਾ ਮੈਟਾਡੇਟਾ ਅਤੇ ਭਾਗ ਸਿਰਲੇਖ ਸ਼ਾਮਲ ਕਰੋ; ਇਹ ਫਿਲਟਰਿੰਗ ਅਤੇ ਹਵਾਲੇ ਦਾ ਆਧਾਰ ਹੈ.
ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ
ਦਸਤਾਵੇਜ਼ ਦੇ ਇੱਕ ਭਾਗ ਨੂੰ ਤਿੰਨ ਵੱਖ-ਵੱਖ ਤਰੀਕਿਆਂ ਨਾਲ ਤੋੜੋ: (1) 200 ਟੋਕਨਾਂ ਦੇ ਛੋਟੇ ਟੁਕੜੇ, (2) 500 ਟੋਕਨਾਂ ਦੇ ਦਰਮਿਆਨੇ ਟੁਕੜੇ (70 ਟੋਕਨ ਓਵਰਲੈਪ), (3) ਇੱਕਲੇ ਵੱਡੇ ਟੁਕੜੇ। ਹਰੇਕ ਰਣਨੀਤੀ ਲਈ ਉਹੀ 3 ਸਵਾਲ ਪੁੱਛੋ, ਹੱਥੀਂ ਨਿਸ਼ਾਨ ਲਗਾਓ ਕਿ ਕਿਹੜਾ ਟੁਕੜਾ ਲਿਆਉਣਾ ਹੈ, ਅਤੇ ਉਸ ਦਸਤਾਵੇਜ਼ ਲਈ ਕਿਹੜੀ ਰਣਨੀਤੀ ਸਭ ਤੋਂ ਵਧੀਆ ਕੰਮ ਕਰਦੀ ਹੈ, ਇਸ ਬਾਰੇ ਤਰਕ ਲਿਖੋ। ਫਿਰ ਹਰੇਕ ਟਰੈਕ ਵਿੱਚ ਘੱਟੋ-ਘੱਟ ਚਾਰ ਮੈਟਾਡੇਟਾ ਖੇਤਰ ਅਤੇ ਇੱਕ “ਅਧਿਆਇ ਸਿਰਲੇਖ” ਸ਼ਾਮਲ ਕਰੋ। ਜੇਕਰ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਇੱਕ ਸਾਰਣੀ ਹੈ, ਤਾਂ ਇੱਕ ਸਾਰਣੀ ਕਤਾਰ ਨੂੰ "ਫੀਲਡ: ਮੁੱਲ" ਫਾਰਮੈਟ ਵਿੱਚ ਸਾਦੇ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲੋ।
ਚੈੱਕਲਿਸਟ
- [ ] ਮੈਂ ਦੱਸ ਸਕਦਾ ਹਾਂ ਕਿ ਹਿੱਸਾ ਪ੍ਰਾਪਤੀ ਦੀ ਸਭ ਤੋਂ ਛੋਟੀ ਇਕਾਈ ਹੈ ਅਤੇ ਆਕਾਰ ਫੋਕਸ-ਸੰਦਰਭ ਸੰਤੁਲਨ ਹੈ।
- [ ] ਮੈਨੂੰ ਪਤਾ ਹੈ ਕਿ ਓਵਰਲੈਪ ਸੀਮਾ ਦੇ ਨੁਕਸਾਨ ਨੂੰ ਕਿਉਂ ਰੋਕਦਾ ਹੈ।
- [ ] ਮੈਂ ਬਰੈਕਟ-ਅਧਾਰਿਤ, ਅਰਥ-ਵਿਵਸਥਾ ਅਤੇ ਬਣਤਰ-ਜਾਗਰੂਕ ਚੰਕਿੰਗ ਵਿਚਕਾਰ ਫਰਕ ਕਰ ਸਕਦਾ ਹਾਂ।
- [ ] ਮੈਂ ਟੇਬਲ, ਕੋਡ ਅਤੇ ਚੈਟ ਲਈ ਰਣਨੀਤੀ ਨੂੰ ਅਨੁਕੂਲ ਬਣਾ ਸਕਦਾ ਹਾਂ।
- [ ] ਮੈਂ ਹਰੇਕ ਟਰੈਕ ਵਿੱਚ ਮੈਟਾਡੇਟਾ ਅਤੇ ਅਧਿਆਇ ਸਿਰਲੇਖ ਜੋੜ ਕੇ ਪ੍ਰਾਪਤੀ ਨੂੰ ਮਜ਼ਬੂਤ ਕਰਦਾ ਹਾਂ।