ਇਕਾਈਆਂ
1. ਇਤਿਹਾਸ ਅਤੇ ਪੁਰਾਲੇਖ ਵਿੱਚ ਨਕਲੀ ਬੁੱਧੀ ਦੀ ਜਾਣ-ਪਛਾਣ: ਭੂਮਿਕਾਵਾਂ, ਸੀਮਾਵਾਂ, ਪ੍ਰਮਾਣਿਕਤਾ ਅਤੇ ਨੈਤਿਕਤਾ 2. ਦਸਤਾਵੇਜ਼ ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਅਤੇ OCR: ਪ੍ਰਿੰਟ ਕੀਤੇ ਟੈਕਸਟ ਨੂੰ ਮਸ਼ੀਨ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲਣਾ 3. ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ: ਓਟੋਮੈਨ ਤੁਰਕੀ ਅਤੇ ਹੱਥ-ਲਿਖਤਾਂ 4. ਮੈਟਾਡੇਟਾ, ਕੈਟਾਲਾਗਿੰਗ ਅਤੇ ਵਰਗੀਕਰਨ 5. ਸਰੋਤ ਸਕੈਨਿੰਗ, ਖੋਜ ਅਤੇ ਸੰਖੇਪ 6. ਇਤਿਹਾਸਕ ਅਨੁਵਾਦ ਅਤੇ ਸਰਲੀਕਰਨ 7. ਸਰੋਤ ਤਸਦੀਕ, ਐਨਾਕ੍ਰੋਨਿਜ਼ਮ, ਅਤੇ ਭਰਮ 8. ਸਮੱਗਰੀ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਪੈਟਰਨ ਖੋਜ 9. ਪੁਰਾਲੇਖ ਪਹੁੰਚ, ਵਰਣਨ ਅਤੇ ਉਪਭੋਗਤਾ ਸੇਵਾਵਾਂ 10. ਸੰਭਾਲ, ਬਹਾਲੀ ਅਤੇ ਡਿਜੀਟਲ ਸੰਭਾਲ 11. ਨੈਤਿਕਤਾ, ਕਾਪੀਰਾਈਟ, ਗੋਪਨੀਯਤਾ ਅਤੇ ਸੱਭਿਆਚਾਰਕ ਸੰਵੇਦਨਸ਼ੀਲਤਾ 12. ਐਂਡ-ਟੂ-ਐਂਡ ਪ੍ਰੋਜੈਕਟ: ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ ਦੇ ਨਾਲ ਇੱਕ ਪੁਰਾਲੇਖ ਸੰਗ੍ਰਹਿ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਨਾ
ਯੂਨਿਟ 2 / 12

ਦਸਤਾਵੇਜ਼ ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਅਤੇ OCR: ਪ੍ਰਿੰਟ ਕੀਤੇ ਟੈਕਸਟ ਨੂੰ ਮਸ਼ੀਨ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲਣਾ

ਲਾਭ:

  • ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਅਤੇ OCR ਵਰਕਫਲੋ (ਸਕੈਨਿੰਗ, ਪ੍ਰੀ-ਪ੍ਰੋਸੈਸਿੰਗ, ਮਾਨਤਾ, ਸੁਧਾਰ, ਤਸਦੀਕ) ਨੂੰ ਕਦਮ ਦਰ ਕਦਮ ਸੈੱਟ ਕਰਨ ਦੀ ਸਮਰੱਥਾ
  • ਸੰਦਰਭ ਦੇ ਨਾਲ ਓਸੀਆਰ ਗਲਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰਨ ਲਈ ਏਆਈ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਸਮਰੱਥਾ, ਸੁਧਾਰ ਅਤੇ ਮੁੜ-ਲਿਖਤ ਲਾਈਨ ਅਤੇ [?] ਨਾਲ ਅਸਪਸ਼ਟਤਾ ਨੂੰ ਮਾਰਕ ਕਰਦੇ ਹੋਏ
  • ਇਹ ਸਮਝੋ ਕਿ ਨੰਬਰਾਂ, ਤਾਰੀਖਾਂ ਅਤੇ ਸਹੀ ਨਾਮਾਂ ਦੀ ਦ੍ਰਿਸ਼ਟੀ ਨਾਲ ਪੁਸ਼ਟੀ ਕਿਉਂ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ ਅਤੇ ਗੁਣਵੱਤਾ ਨਿਯੰਤਰਣ ਦੀ ਭੂਮਿਕਾ ਹੈ।

ਕਿਸੇ ਆਰਕਾਈਵ ਜਾਂ ਲਾਇਬ੍ਰੇਰੀ ਦੀਆਂ ਭੌਤਿਕ ਸ਼ੈਲਫਾਂ 'ਤੇ ਲੱਖਾਂ ਪੰਨੇ ਖੋਜਕਰਤਾ ਲਈ ਉਦੋਂ ਹੀ ਖੁੱਲ੍ਹਦੇ ਹਨ ਜਦੋਂ ਉਹ ਡਿਜੀਟਾਈਜ਼ਡ ਅਤੇ ਖੋਜਯੋਗ ਬਣ ਜਾਂਦੇ ਹਨ। ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਇੱਕ ਭੌਤਿਕ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਸਕੈਨ ਕਰਕੇ ਜਾਂ ਫੋਟੋ ਖਿੱਚ ਕੇ ਇੱਕ ਡਿਜੀਟਲ ਚਿੱਤਰ ਵਿੱਚ ਬਦਲ ਰਿਹਾ ਹੈ। ਪਰ ਇੱਕ ਪੰਨੇ ਦੀ ਫੋਟੋ ਅਜੇ "ਟੈਕਸਟ" ਨਹੀਂ ਹੈ; ਕੰਪਿਊਟਰ ਲਈ ਇਹ ਅਜੇ ਵੀ ਇੱਕ ਚਿੱਤਰ ਹੈ, ਤੁਸੀਂ ਇਸ ਵਿੱਚ ਖੋਜ ਨਹੀਂ ਕਰ ਸਕਦੇ। ਇਹ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ OCR ਖੇਡ ਵਿੱਚ ਆਉਂਦਾ ਹੈ।

OCR (ਆਪਟੀਕਲ ਅੱਖਰ ਪਛਾਣ) ਇੱਕ ਤਕਨਾਲੋਜੀ ਹੈ ਜੋ ਇੱਕ ਦਸਤਾਵੇਜ਼ ਚਿੱਤਰ ਵਿੱਚ ਪ੍ਰਿੰਟ ਕੀਤੇ ਅੱਖਰਾਂ ਨੂੰ ਪਛਾਣਦੀ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਮਸ਼ੀਨ ਦੁਆਰਾ ਪੜ੍ਹਨਯੋਗ, ਖੋਜਯੋਗ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲਦੀ ਹੈ। ਇਸ ਯੂਨਿਟ ਵਿੱਚ, ਤੁਸੀਂ ਸਿੱਖੋਗੇ ਕਿ ਇਤਿਹਾਸਕ ਪ੍ਰਿੰਟ ਕੀਤੇ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ OCR ਨਾਲ ਕਿਵੇਂ ਡਿਜੀਟਾਈਜ਼ ਕਰਨਾ ਹੈ, ਕਿਵੇਂ AI ਇਸ ਪ੍ਰਕਿਰਿਆ ਵਿੱਚ OCR ਗਲਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ, ਅਤੇ ਮਨੁੱਖੀ ਅੱਖ ਕਿੱਥੇ ਜ਼ਰੂਰੀ ਹੈ। (ਹੱਥ ਲਿਖਤ ਟੈਕਸਟ ਲਈ ਇੱਕ ਵੱਖਰੀ ਤਕਨੀਕ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; ਅਸੀਂ ਇਸਨੂੰ ਅਗਲੀ ਇਕਾਈ ਵਿੱਚ ਕਵਰ ਕਰਾਂਗੇ।)

ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਵਰਕਫਲੋ: ਕਦਮ ਦਰ ਕਦਮ

1. ਤਿਆਰੀ ਅਤੇ ਸਕ੍ਰੀਨਿੰਗ। ਦਸਤਾਵੇਜ਼ ਨੂੰ ਉੱਚਤਮ ਗੁਣਵੱਤਾ 'ਤੇ ਸਕੈਨ ਕਰੋ। ਇਤਿਹਾਸਕ ਖੋਜ ਲਈ ਅੰਗੂਠੇ ਦਾ ਇੱਕ ਆਮ ਨਿਯਮ ਘੱਟੋ-ਘੱਟ 300-400 DPI (ਡੌਟਸ ਪ੍ਰਤੀ ਇੰਚ) ਦਾ ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਹੈ। ਘੱਟ ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਅਗਲੇ OCR ਪੜਾਅ ਵਿੱਚ ਗਲਤੀ ਦਰ ਨੂੰ ਵਧਾ ਦਿੰਦਾ ਹੈ।

2. ਚਿੱਤਰ ਪ੍ਰੀਪ੍ਰੋਸੈਸਿੰਗ। OCR ਤੋਂ ਪਹਿਲਾਂ ਚਿੱਤਰ ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣਾ ਸਫਲਤਾ ਨੂੰ ਬਹੁਤ ਵਧਾਉਂਦਾ ਹੈ: ਸਕੈਨ ਕੀਤੇ ਪੰਨੇ ਨੂੰ ਡਿਸਕ ਕਰਨਾ, ਧੱਬਿਆਂ ਨੂੰ ਹਟਾਉਣਾ, ਵਿਪਰੀਤਤਾ ਵਧਾਉਣਾ, ਕਾਲੇ ਅਤੇ ਚਿੱਟੇ ਵਿੱਚ ਬਦਲਣਾ। ਆਧੁਨਿਕ AI-ਅਧਾਰਿਤ ਟੂਲ ਇਸ ਕਦਮ ਨੂੰ ਸਵੈਚਲਿਤ ਕਰ ਸਕਦੇ ਹਨ।

3. OCR ਐਪਲੀਕੇਸ਼ਨ। ਤੁਸੀਂ ਚਿੱਤਰ ਨੂੰ OCR ਇੰਜਣ ਨੂੰ ਫੀਡ ਕਰਦੇ ਹੋ; ਇੰਜਣ ਅੱਖਰਾਂ ਨੂੰ ਪਛਾਣਦਾ ਹੈ ਅਤੇ ਟੈਕਸਟ ਬਣਾਉਂਦਾ ਹੈ। ਆਉਟਪੁੱਟ ਵਿੱਚ ਆਮ ਤੌਰ 'ਤੇ ਦੋ ਪਰਤਾਂ ਹੁੰਦੀਆਂ ਹਨ: ਦਿਖਾਈ ਦੇਣ ਵਾਲਾ ਦਸਤਾਵੇਜ਼ ਚਿੱਤਰ ਅਤੇ ਹੇਠਾਂ ਇੱਕ "ਖੋਜਣਯੋਗ ਲੁਕਵੀਂ ਟੈਕਸਟ ਲੇਅਰ"।

4. ਸੁਧਾਰ (ਪੋਸਟ-ਸੁਧਾਰ)। ਕੱਚਾ OCR ਆਉਟਪੁੱਟ ਕਦੇ ਵੀ ਸੰਪੂਰਨ ਨਹੀਂ ਹੁੰਦਾ। ਪੁਰਾਣੇ ਫੌਂਟਾਂ, ਪੀਲੇ ਹੋਏ ਕਾਗਜ਼, ਸਿਆਹੀ ਦਾ ਰੰਗ, ਅਤੇ ਸਕੈਨਿੰਗ ਗਲਤੀਆਂ ਕਾਰਨ ਅੱਖਰ ਗਲਤ ਪੜ੍ਹੇ ਜਾਂਦੇ ਹਨ। ਇਹ ਉਹ ਥਾਂ ਹੈ ਜਿੱਥੇ AI ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਹਾਇਕ ਹੈ: ਇਹ ਸੰਦਰਭ ਦੀ ਵਰਤੋਂ ਕਰਕੇ OCR ਗਲਤੀਆਂ ਦਾ ਸੁਝਾਅ ਅਤੇ ਸੁਧਾਰ ਕਰਦਾ ਹੈ।

5. ਪੁਸ਼ਟੀਕਰਨ ਅਤੇ ਗੁਣਵੱਤਾ ਨਿਯੰਤਰਣ। ਸਹੀ ਕੀਤੇ ਟੈਕਸਟ ਦੀ ਜਾਂਚ ਮਨੁੱਖ ਦੁਆਰਾ ਨਮੂਨੇ ਦੇ ਅਧਾਰ 'ਤੇ ਜਾਂ ਪੂਰੀ ਤਰ੍ਹਾਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਖਾਸ ਤੌਰ 'ਤੇ ਨਾਜ਼ੁਕ ਖੇਤਰਾਂ ਜਿਵੇਂ ਕਿ ਨਾਮ, ਮਿਤੀਆਂ ਅਤੇ ਸੰਖਿਆਵਾਂ ਨੂੰ ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਤਸਦੀਕ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

OCR ਗਲਤੀਆਂ ਕਿਉਂ ਕਰਦਾ ਹੈ, AI ਕਿਵੇਂ ਮਦਦ ਕਰਦਾ ਹੈ

ਖਾਸ ਸਮੱਸਿਆਵਾਂ ਜੋ ਇਤਿਹਾਸਕ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ OCR ਨੂੰ ਚੁਣੌਤੀ ਦਿੰਦੀਆਂ ਹਨ: ਪੁਰਾਣੇ ਅਤੇ ਫੈਂਸੀ ਫੌਂਟ, ਪੁਰਾਣੇ ਅੱਖਰ ਫਾਰਮ ਜਿਵੇਂ ਕਿ ਲੰਬੇ "s" (ſ), ਦੋ-ਕਾਲਮ ਪੰਨੇ ਦਾ ਲੇਆਉਟ, ਫੁਟਨੋਟ, ਹੱਥ ਲਿਖਤ ਸੰਮਿਲਨ, ਸੀਲਾਂ, ਅਤੇ ਫਿੱਕੀ ਸਿਆਹੀ। ਕਿਉਂਕਿ ਇੱਕ OCR ਇੰਜਣ ਇੱਕ-ਇੱਕ ਕਰਕੇ ਅੱਖਰਾਂ ਨੂੰ "ਵੇਖਦਾ" ਹੈ, ਇਹ ਅਕਸਰ ਬਾਈਨਰੀ "rn" ਨੂੰ "m" ਵਜੋਂ, ਅੱਖਰ "l" ਨੂੰ ਨੰਬਰ "1" ਵਜੋਂ ਅਤੇ ਅੱਖਰ "O" ਨੂੰ "0" ਵਜੋਂ ਉਲਝਾਉਂਦਾ ਹੈ।

ਏਆਈ ਭਾਸ਼ਾ ਦੇ ਮਾਡਲ ਇੱਥੇ ਇੱਕ ਵੱਖਰੀ ਸ਼ਕਤੀ ਪੇਸ਼ ਕਰਦੇ ਹਨ: ਉਹ ਸੰਦਰਭ ਨੂੰ ਸਮਝਦੇ ਹਨ। ਜੇਕਰ ਇੱਕ OCR ਇੰਜਣ ਨੇ "1stanbu1" ਲਿਖਿਆ ਹੈ, ਤਾਂ AI ਸੰਦਰਭ ਤੋਂ ਇਹ ਅਨੁਮਾਨ ਲਗਾ ਸਕਦਾ ਹੈ ਕਿ ਇਹ "ਇਸਤਾਂਬੁਲ" ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਪਰ ਇੱਥੇ ਇੱਕ ਵੱਡਾ ਖ਼ਤਰਾ ਹੈ: "ਸਹੀ" ਕਰਨ ਵੇਲੇ AI ਟੈਕਸਟ ਨੂੰ ਵੀ ਬਦਲ ਸਕਦਾ ਹੈ. ਉਹ "ਮੈਂ ਠੀਕ ਕੀਤਾ" ਇੱਕ ਗੈਰ-ਮੌਜੂਦ ਸ਼ਬਦ ਜੋੜ ਸਕਦਾ ਹੈ ਜਾਂ ਆਪਣੇ ਖੁਦ ਦੇ ਅੰਦਾਜ਼ੇ ਨਾਲ ਇੱਕ ਅਸਪਸ਼ਟ ਥਾਂ ਭਰ ਸਕਦਾ ਹੈ। ਇਹ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਦੀ ਵਫ਼ਾਦਾਰੀ ਵਿੱਚ ਵਿਘਨ ਪਾਉਂਦਾ ਹੈ।

ਸਾਵਧਾਨ: OCR ਸੁਧਾਰ ਵਿੱਚ ਸੁਨਹਿਰੀ ਨਿਯਮ ਇਹ ਹੈ: AI ਨੂੰ ਸਿਰਫ ਸਪੱਸ਼ਟ ਪਛਾਣ ਦੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ, ਨਾ ਕਿ ਟੈਕਸਟ ਦੀ ਸਮੱਗਰੀ ਦੀ ਵਿਆਖਿਆ ਜਾਂ ਪੂਰਕ। "1stanbu1 → Istanbul" ਜਾਇਜ਼ ਹੈ; ਇਹ ਅੰਦਾਜ਼ਿਆਂ ਨਾਲ ਨਾ ਪੜ੍ਹੇ ਜਾਣ ਵਾਲੇ ਸ਼ਬਦ ਨੂੰ ਭਰਨ ਬਾਰੇ ਨਹੀਂ ਹੈ। ਅਨਿਸ਼ਚਿਤ ਸਥਾਨਾਂ ਨੂੰ [?] ਨਾਲ ਚਿੰਨ੍ਹਿਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਨਹੀਂ ਬਣਾਇਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ।

OCR ਗਲਤੀ ਕਿਸਮ ਅਤੇ ਇੱਕ ਸਾਰਣੀ ਦੇ ਨਾਲ ਪਹੁੰਚ

ਗਲਤੀ ਦੀ ਕਿਸਮ

ਉਦਾਹਰਨ

ਕੀ AI ਇਸਨੂੰ ਠੀਕ ਕਰ ਸਕਦਾ ਹੈ?

ਮਨੁੱਖੀ ਕੰਟਰੋਲ

ਅੱਖਰ ਮਿਸ਼ਰਣ

rn↔m, l↔1, O↔0

ਹਾਂ, ਇਹ ਸੁਰੱਖਿਅਤ ਹੈ

ਨਮੂਨਾ

ਪੁਰਾਣੇ ਅੱਖਰ ਫਾਰਮ

ਲੰਬਾ ſ → s

ਹਾਂ, ਇਹ ਸੁਰੱਖਿਅਤ ਹੈ

ਨਮੂਨਾ

ਫਿੱਕਾ/ਪੜ੍ਹਨਯੋਗ ਸ਼ਬਦ

"ਕਾ___ਨ"

ਨਹੀਂ, ਲਗਾਉਣਾ ਚਾਹੀਦਾ ਹੈ [?]

ਲਾਜ਼ਮੀ

ਸਹੀ ਨਾਮ/ਸਥਾਨ ਦਾ ਨਾਮ

"ਕਾਂਸਟੈਂਟੀਨੀਏ"

ਸਾਵਧਾਨ

ਲਾਜ਼ਮੀ

ਨੰਬਰ/ਤਾਰੀਖ

"1867" ਬਨਾਮ "1857"

ਖ਼ਤਰਨਾਕ

ਲਾਜ਼ਮੀ

ਪੰਨਾ ਖਾਕਾ (ਕਾਲਮ/ਫੁਟਨੋਟ)

ਮਿਸ਼ਰਤ ਵਹਾਅ

ਅੰਸ਼ਕ ਤੌਰ 'ਤੇ

ਲਾਜ਼ਮੀ

ਤਸਵੀਰ ਨੂੰ ਇੱਕ ਵਾਕ ਵਿੱਚ ਸੰਖੇਪ ਕਰਨ ਲਈ: AI ਭਰੋਸੇਯੋਗ ਤੌਰ 'ਤੇ ਆਮ ਅੱਖਰ ਗਲਤੀਆਂ ਨੂੰ ਸਾਫ਼ ਕਰਦਾ ਹੈ; ਪਰ ਖਾਸ ਨਾਵਾਂ, ਸੰਖਿਆਵਾਂ, ਮਿਤੀਆਂ ਅਤੇ ਨਾ ਪੜ੍ਹੇ ਜਾਣ ਵਾਲੇ ਸਥਾਨਾਂ ਲਈ ਮਨੁੱਖੀ ਅੱਖਾਂ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਤਿੰਨ ਛੋਟੇ ਕੇਸ

ਕੇਸ 1 - ਅਖਬਾਰਾਂ ਦੇ ਪੁਰਾਲੇਖ ਖੋਜਣਯੋਗ ਬਣ ਗਏ। ਇੱਕ ਯੂਨੀਵਰਸਿਟੀ ਲਾਇਬ੍ਰੇਰੀ ਨੇ 1930 ਦੇ ਦਹਾਕੇ ਤੋਂ ਸਥਾਨਕ ਅਖ਼ਬਾਰਾਂ ਦੇ 12,000 ਪੰਨਿਆਂ ਨੂੰ ਡਿਜੀਟਾਈਜ਼ ਕੀਤਾ ਹੈ। ਕੱਚੀ OCR ਸ਼ੁੱਧਤਾ ਇੱਕ ਅੰਦਾਜ਼ਨ 82% ਸੀ (ਹਰੇਕ 100 ਵਿੱਚੋਂ 18 ਅੱਖਰ ਗਲਤ ਸਨ)। AI-ਅਧਾਰਿਤ ਸੁਧਾਰ ਨੇ ਇੱਕ ਅਖਬਾਰ ਭਾਸ਼ਾ-ਉਚਿਤ ਸ਼ਬਦਕੋਸ਼ ਅਤੇ ਸੰਦਰਭ ਦੇ ਨਾਲ ਸ਼ੁੱਧਤਾ ਨੂੰ 96% ਤੱਕ ਵਧਾ ਦਿੱਤਾ ਹੈ। ਬਾਕੀ ਦੀਆਂ ਗਲਤੀਆਂ ਲਈ, ਪੂਰੇ ਟੈਕਸਟ ਦੀ ਬਜਾਏ ਇੱਕ ਨਮੂਨਾ ਜਾਂਚ ਕੀਤੀ ਗਈ ਸੀ; ਸੰਗ੍ਰਹਿ 3 ਹਫ਼ਤਿਆਂ ਵਿੱਚ ਖੋਜਣਯੋਗ ਬਣ ਗਿਆ।

ਕੇਸ 2 - AI "ਸਹੀ" ਅਤੇ ਵਿਗਾੜਿਆ ਇਤਿਹਾਸ। ਇੱਕ ਪੁਰਾਲੇਖ-ਵਿਗਿਆਨੀ ਨੇ OCR ਪ੍ਰਿੰਟਆਉਟ 'ਤੇ AI ਨੂੰ "1863" ਤਾਰੀਖ ਨੂੰ ਠੀਕ ਕੀਤਾ ਸੀ। AI ਨੇ ਸੰਦਰਭ ਵਿੱਚ ਇੱਕ ਹੋਰ ਘਟਨਾ ਨੂੰ ਦੇਖ ਕੇ ਮਿਤੀ ਨੂੰ "1868" ਵਿੱਚ "ਸਹੀ" ਕਰ ਦਿੱਤਾ - ਭਾਵੇਂ ਕਿ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ 1863 ਕਿਹਾ ਗਿਆ ਹੈ। ਜੇਕਰ ਪੁਰਾਲੇਖ-ਵਿਗਿਆਨੀ ਨੇ ਅਸਲ ਚਿੱਤਰ ਨੂੰ ਨਾ ਦੇਖਿਆ ਹੁੰਦਾ, ਤਾਂ ਕੈਟਾਲਾਗ ਗਲਤ ਮਿਤੀ ਦੇ ਨਾਲ ਦਾਖਲ ਹੁੰਦਾ। ਸਬਕ: ਸੰਖਿਆਵਾਂ ਅਤੇ ਮਿਤੀਆਂ ਨੂੰ ਕਦੇ ਵੀ AI 'ਤੇ ਨਹੀਂ ਛੱਡਿਆ ਜਾਂਦਾ, ਉਹ ਚਿੱਤਰ ਨਾਲ ਪ੍ਰਮਾਣਿਤ ਹੁੰਦੇ ਹਨ।

ਕੇਸ 3 - ਦੋ-ਕਾਲਮ ਪੰਨਾ ਉਲਝਣ ਵਿੱਚ ਹੈ। 19ਵੀਂ ਸਦੀ ਦੀ ਸਾਲਾਨਾ ਪੁਸਤਕ ਦੇ ਦੋ-ਕਾਲਮ ਪੰਨਿਆਂ ਨੂੰ OCR ਵਿੱਚ ਇੱਕ ਸਿੰਗਲ ਸਟ੍ਰੀਮ ਵਿੱਚ ਮਿਲਾਇਆ ਗਿਆ ਸੀ ਅਤੇ ਵਾਕਾਂ ਨੂੰ ਆਪਸ ਵਿੱਚ ਜੋੜਿਆ ਗਿਆ ਸੀ। ਕੱਚੀ ਆਉਟਪੁੱਟ ਪੜ੍ਹਨਯੋਗ ਨਹੀਂ ਸੀ। ਟੈਕਸਟ ਵਿੱਚ ਸੁਧਾਰ ਹੋਇਆ ਜਦੋਂ ਮੈਂ ਪਹਿਲੀ ਵਾਰ ਪੇਜ ਲੇਆਉਟ ਨੂੰ ਖੇਤਰਾਂ (ਸੈਗਮੈਂਟੇਸ਼ਨ) ਵਿੱਚ ਵੰਡਿਆ ਅਤੇ ਹਰੇਕ ਕਾਲਮ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਪ੍ਰੋਸੈਸ ਕੀਤਾ। ਪਾਠ: ਗੁੰਝਲਦਾਰ ਪੇਜ ਲੇਆਉਟ ਵਿੱਚ, ਬਣਤਰ ਪਹਿਲਾਂ, ਟੈਕਸਟ ਦੂਜਾ।

ਚਾਰ ਕਾਪੀ ਕਰਨ ਯੋਗ ਟੈਂਪਲੇਟ

1) ਸੁਰੱਖਿਅਤ OCR ਸੁਧਾਰ:

ਹੇਠਾਂ ਇੱਕ ਇਤਿਹਾਸਕ ਦਸਤਾਵੇਜ਼ ਦਾ ਕੱਚਾ OCR ਆਉਟਪੁੱਟ ਹੈ। ਤੁਹਾਡਾ ਕੰਮ ਸਿਰਫ ਸਪੱਸ਼ਟ ਆਪਟੀਕਲ ਪਛਾਣ ਦੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰਨਾ ਹੈ (ਜਿਵੇਂ ਕਿ rn→m,1→l, 0→O, ਲੰਬੀ ſ→s)। ਨਿਯਮ: (1) ਪਾਠ ਦੇ ਅਰਥ ਦੀ ਵਿਆਖਿਆ ਕਰੋ। (2) ਨਾ-ਪੜ੍ਹਨਯੋਗ/ਅਸਪੱਸ਼ਟ ਸ਼ਬਦਾਂ ਨੂੰ ਠੀਕ ਕਰੋ, ਜਿਵੇਂ ਹੈ ਛੱਡੋ ਅਤੇ [?] ਨਾਲ ਚਿੰਨ੍ਹਿਤ ਕਰੋ। (3) ਵਾਕਾਂ ਨੂੰ ਜੋੜਨਾ, ਹਟਾਉਣਾ ਜਾਂ ਪੂਰਾ ਕਰਨਾ ਨਹੀਂ। (4) ਨੰਬਰ ਅਤੇ ਮਿਤੀਆਂ ਬਦਲੋ; ਜੇਕਰ ਸ਼ੱਕ ਹੈ ਤਾਂ [ਨੰਬਰ?] 'ਤੇ ਨਿਸ਼ਾਨ ਲਗਾਓ। ਕੱਚਾ OCR: [ਇੱਥੇ]

2) OCR ਗੁਣਵੱਤਾ ਰਿਪੋਰਟ:

ਹੇਠਾਂ ਦਿੱਤੇ OCR ਆਉਟਪੁੱਟ ਦੀ ਜਾਂਚ ਕਰੋ ਅਤੇ ਇੱਕ ਗੁਣਵੱਤਾ ਰਿਪੋਰਟ ਤਿਆਰ ਕਰੋ: (1) ਸੰਭਾਵਿਤ ਮਾਨਤਾ ਗਲਤੀਆਂ ਵਾਲੇ ਸ਼ਬਦਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ, (2) ਉਹਨਾਂ ਖੇਤਰਾਂ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕਰੋ ਜੋ ਪੜ੍ਹਨਯੋਗ/ਅਸਪਸ਼ਟ ਦਿਖਾਈ ਦਿੰਦੇ ਹਨ, (3) ਖਾਸ ਨਾਮ, ਮਿਤੀਆਂ ਅਤੇ ਸੰਖਿਆਵਾਂ ਦੀ ਸੂਚੀ ਬਣਾਓ ਜਿਨ੍ਹਾਂ ਲਈ ਮਨੁੱਖੀ ਜਾਂਚ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਠੀਕ ਨਾ ਕਰੋ; ਸਿਰਫ਼ ਚੈੱਕਲਿਸਟ ਤਿਆਰ ਕਰੋ। ਟੈਕਸਟ: [ਇੱਥੇ]

3) ਕਾਲਮ/ਸਟ੍ਰਕਚਰ ਪਾਰਸਿੰਗ ਮਦਦ:

ਕਿਉਂਕਿ ਹੇਠਾਂ ਦਿੱਤਾ OCR ਟੈਕਸਟ ਦੋ-ਕਾਲਮ ਪੰਨੇ ਤੋਂ ਆਉਂਦਾ ਹੈ, ਪ੍ਰਵਾਹ ਉਲਝਣ ਵਿੱਚ ਹੋ ਸਕਦਾ ਹੈ। ਪਾਠ ਨੂੰ ਲਾਜ਼ੀਕਲ ਪੈਰਿਆਂ ਵਿੱਚ ਮੁੜ ਵਿਵਸਥਿਤ ਕਰੋ ਪਰ ਕਿਸੇ ਵੀ ਸ਼ਬਦ ਨੂੰ ਨਾ ਬਦਲੋ, ਜੋੜੋ ਜਾਂ ਮਿਟਾਓ। ਬਸ ਆਰਡਰ ਠੀਕ ਕਰੋ। ਉਸ ਆਰਡਰ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕਰੋ ਜਿਸ ਬਾਰੇ ਤੁਸੀਂ ਯਕੀਨੀ ਨਹੀਂ ਹੋ [ਆਰਡਰ?]। ਟੈਕਸਟ: [ਇੱਥੇ]

4) ਮਿਆਰੀ ਭਾਸ਼ਾ ਲਈ ਸਧਾਰਨਕਰਨ (ਵਿਕਲਪਿਕ, ਵੱਖਰੀ ਪਰਤ):

ਅੱਜ ਦੇ ਸਪੈਲਿੰਗ ਵਿੱਚ ਇੱਕ ਸਰਲ ਰੀਡਿੰਗ ਸੰਸਕਰਣ ਤਿਆਰ ਕਰੋ, ਇੱਕ ਵੱਖਰੇ ਕਾਲਮ ਵਿੱਚ, ਹੇਠਾਂ ਸਹੀ ਕੀਤੇ ਇਤਿਹਾਸਕ ਪਾਠ ਦੇ ਉੱਪਰ। ਮੂਲ ਪਾਠ ਨੂੰ ਕਦੇ ਨਾ ਬਦਲੋ; ਸਰਲੀਕਰਨ ਨੂੰ ਇੱਕ ਵੱਖਰੀ ਪਰਤ ਹੋਣ ਦਿਓ। ਸਿਰਫ਼ ਅਰਥ ਸ਼ਾਮਲ ਕੀਤੇ ਬਿਨਾਂ ਸਪੈਲਿੰਗ/ਉਚਾਰਨ ਨੂੰ ਅੱਪਡੇਟ ਕਰੋ। ਮੂਲ: [ਇੱਥੇ]

ਕਮਜ਼ੋਰ ਪ੍ਰੋਂਪਟ / ਮਜ਼ਬੂਤ ਪ੍ਰੋਂਪਟ

ਕਮਜ਼ੋਰ:

ਇਸ OCR ਟੈਕਸਟ ਨੂੰ ਸਹੀ ਅਤੇ ਸੁੰਦਰ ਬਣਾਓ।

“ਸੁੰਦਰ ਬਣਾਉਣਾ” ਏਆਈ ਨੂੰ ਟੈਕਸਟ ਨੂੰ ਦੁਬਾਰਾ ਲਿਖਣ, ਭੁੱਲਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਅਤੇ ਸਮੱਗਰੀ ਦੀ ਵਿਆਖਿਆ ਕਰਨ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ; ਵਫ਼ਾਦਾਰੀ ਤੋੜਦੀ ਹੈ।

ਮਜ਼ਬੂਤ:

ਇਸ ਕੱਚੇ OCR ਆਉਟਪੁੱਟ ਵਿੱਚ ਸਿਰਫ ਆਪਟੀਕਲ ਪਛਾਣ ਦੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰੋ। ਅਰਥਾਂ ਦੀ ਵਿਆਖਿਆ ਨਾ ਕਰੋ, ਸ਼ਬਦਾਂ ਨੂੰ ਜੋੜੋ/ਹਟਾਓ, [?] ਨਾਲ ਨਾ ਪੜ੍ਹੇ ਜਾਣ ਵਾਲੇ ਹਿੱਸੇ ਛੱਡੋ, ਨੰਬਰ ਅਤੇ ਮਿਤੀਆਂ ਬਦਲੋ। ਤੁਹਾਡੇ ਵੱਲੋਂ ਕੀਤੀ ਗਈ ਹਰੇਕ ਸੋਧ ਨੂੰ "ਅਸਲ → ਸੁਧਾਰ" ਫਾਰਮੈਟ ਵਿੱਚ ਇੱਕ ਵੱਖਰੀ ਸੂਚੀ ਵਿੱਚ ਦਿਖਾਓ ਤਾਂ ਜੋ ਮੈਂ ਇਸਦੀ ਪੁਸ਼ਟੀ ਕਰ ਸਕਾਂ। ਟੈਕਸਟ: [ਇੱਥੇ]

ਅੰਤਰ: ਸੀਮਾਬੱਧ ਡਿਊਟੀ, ਬਨਾਵਟ 'ਤੇ ਪਾਬੰਦੀ, ਅਸਪਸ਼ਟਤਾ ਨੂੰ ਚਿੰਨ੍ਹਿਤ ਕਰਨਾ, ਅਤੇ ਸੁਧਾਰਾਂ ਦੀ ਖੋਜਣ ਯੋਗ ਸੂਚੀ ਆਉਟਪੁੱਟ ਨੂੰ ਆਡਿਟ ਕਰਨ ਯੋਗ ਬਣਾਉਂਦੀ ਹੈ।

ਆਮ ਗਲਤੀਆਂ

  • ਘੱਟ ਰੈਜ਼ੋਲਿਊਸ਼ਨ 'ਤੇ ਸਕੈਨਿੰਗ। ਜ਼ਿਆਦਾਤਰ OCR ਗਲਤੀਆਂ ਖਰਾਬ ਤਸਵੀਰਾਂ ਕਾਰਨ ਹੁੰਦੀਆਂ ਹਨ; ਕੁਆਲਿਟੀ ਸਕੈਨਿੰਗ ਸਭ ਤੋਂ ਸਸਤਾ ਨਿਵੇਸ਼ ਹੈ।
  • AI ਨੂੰ "ਸੁੰਦਰ ਬਣਾਓ" ਕਹਿੰਦੇ ਹੋਏ। ਇਹ ਵਫ਼ਾਦਾਰੀ ਦੀ ਬਜਾਏ ਰਵਾਨੀ ਪੈਦਾ ਕਰਦਾ ਹੈ; ਦਸਤਾਵੇਜ਼ ਨੂੰ ਮੁੜ ਲਿਖਿਆ ਗਿਆ ਹੈ.
  • ਨੰਬਰਾਂ ਅਤੇ ਤਾਰੀਖਾਂ ਨੂੰ AI 'ਤੇ ਛੱਡਣਾ। ਇਹ ਸੰਦਰਭ ਤੋਂ "ਸਹੀ" ਹੋਣ 'ਤੇ ਚੁੱਪਚਾਪ ਵਿਗੜ ਜਾਂਦੇ ਹਨ; ਚਿੱਤਰ ਦੁਆਰਾ ਤਸਦੀਕ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ.
  • ਇੱਕ ਅੰਦਾਜ਼ੇ ਨਾਲ ਨਾ-ਪੜ੍ਹਨਯੋਗ ਖੇਤਰ ਨੂੰ ਭਰਨਾ। ਇਸ ਨੂੰ ਅਨਿਸ਼ਚਿਤਤਾ [?] ਦੁਆਰਾ ਸੁਰੱਖਿਅਤ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ, ਨਾ ਕਿ ਬਣਾਇਆ ਗਿਆ।
  • ਨਮੂਨੇ ਲੈਣ ਦੀ ਬਜਾਏ ਬਿਲਕੁਲ ਵੀ ਕੰਟਰੋਲ ਨਹੀਂ ਕਰ ਰਿਹਾ। ਇੱਥੋਂ ਤੱਕ ਕਿ 96% ਸ਼ੁੱਧਤਾ ਦਾ ਮਤਲਬ ਹੈ 12,000 ਪੰਨਿਆਂ ਵਿੱਚ ਹਜ਼ਾਰਾਂ ਗਲਤੀਆਂ; ਨਾਜ਼ੁਕ ਖੇਤਰਾਂ ਨੂੰ ਸਕੈਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।

ਸੰਖੇਪ ਵਿੱਚ

OCR ਪ੍ਰਿੰਟ ਕੀਤੇ ਇਤਿਹਾਸਕ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਖੋਜਣਯੋਗ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲ ਕੇ ਖੋਜਕਰਤਾਵਾਂ ਲਈ ਪੁਰਾਲੇਖ ਖੋਲ੍ਹਦਾ ਹੈ। AI ਸੰਦਰਭ ਦੇ ਨਾਲ ਕੱਚੇ OCR ਆਉਟਪੁੱਟ ਵਿੱਚ ਅੱਖਰ ਦੀਆਂ ਗਲਤੀਆਂ ਨੂੰ ਠੀਕ ਕਰਨ ਵਿੱਚ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸਹਾਇਤਾ ਹੈ; ਪਰ ਤੁਹਾਨੂੰ ਸੰਪਾਦਨ ਅਤੇ ਮੁੜ ਲਿਖਣ ਦੇ ਵਿਚਕਾਰ ਲਾਈਨ ਖਿੱਚਣੀ ਚਾਹੀਦੀ ਹੈ। ਉੱਚ-ਗੁਣਵੱਤਾ ਸਕੈਨਿੰਗ, ਸੁਰੱਖਿਅਤ ਸੁਧਾਰ ਨਿਰਦੇਸ਼, [?] ਨਾਲ ਅਸਪਸ਼ਟਤਾ ਦੀ ਸੰਭਾਲ, ਅਤੇ ਨਾਮ/ਤਰੀਕ/ਨੰਬਰਾਂ ਦੀ ਮਨੁੱਖੀ-ਅੱਖਾਂ ਦੀ ਤਸਦੀਕ ਡਿਜੀਟਾਈਜ਼ੇਸ਼ਨ ਨੂੰ ਤੇਜ਼ ਅਤੇ ਭਰੋਸੇਮੰਦ ਬਣਾਉਂਦੀ ਹੈ। AI ਟੈਕਸਟ ਨੂੰ ਸਾਫ਼ ਕਰਦਾ ਹੈ; ਤੂੰ ਵਫ਼ਾਦਾਰੀ ਦਾ ਰਾਖਾ ਹੈਂ।

ਐਪਲੀਕੇਸ਼ਨ ਦਾ ਕੰਮ

ਇੱਕ ਪ੍ਰਿੰਟ ਕੀਤੇ ਇਤਿਹਾਸਕ ਦਸਤਾਵੇਜ਼ (ਪੁਰਾਣਾ ਅਖਬਾਰ, ਅਧਿਕਾਰਤ ਪੱਤਰ, ਕਿਤਾਬ ਦਾ ਪੰਨਾ) ਸਕੈਨ ਕਰੋ ਜਾਂ ਇੱਕ OCR ਪ੍ਰਿੰਟਆਊਟ ਲਓ। "ਸੁਰੱਖਿਅਤ OCR ਸੁਧਾਰ" ਟੈਮਪਲੇਟ ਨਾਲ ਟੈਕਸਟ ਨੂੰ ਠੀਕ ਕਰੋ ਅਤੇ "ਮੂਲ → ਸੁਧਾਰ" ਸੂਚੀ ਰਾਹੀਂ ਸੁਧਾਰਾਂ ਦੀ ਬੇਨਤੀ ਕਰੋ। ਫਿਰ, "OCR ਕੁਆਲਿਟੀ ਰਿਪੋਰਟ" ਦੇ ਨਾਲ ਮਨੁੱਖੀ ਨਿਯੰਤਰਣ ਦੀ ਲੋੜ ਵਾਲੇ ਖੇਤਰਾਂ ਨੂੰ ਹਟਾਓ। ਸੂਚੀ ਵਿੱਚ ਹਰੇਕ ਮਿਤੀ ਅਤੇ ਸਹੀ ਨਾਮ ਦੀ ਅਸਲ ਚਿੱਤਰ ਨਾਲ ਤੁਲਨਾ ਕਰੋ; ਨੋਟ ਕਰੋ ਕਿ ਕਿੰਨੇ "ਸਹੀ" ਗਲਤ ਸਨ.

ਚੈੱਕਲਿਸਟ

  • [ ] ਮੈਂ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਘੱਟੋ-ਘੱਟ 300 DPI ਅਤੇ ਚੰਗੇ ਕੰਟ੍ਰਾਸਟ ਨਾਲ ਸਕੈਨ ਕੀਤਾ ਹੈ।
  • [ ] ਮੈਂ ਸਿਰਫ AI ਨੂੰ ਆਪਟੀਕਲ ਗਲਤੀ ਸੁਧਾਰ ਲਈ ਕਿਹਾ ਸੀ, ਮੁੜ ਲਿਖਣ ਲਈ ਨਹੀਂ।
  • [ ] ਮੈਂ ਨਾ ਪੜ੍ਹੇ ਜਾਣ ਵਾਲੇ ਹਿੱਸਿਆਂ ਨੂੰ [?] ਨਾਲ ਸੁਰੱਖਿਅਤ ਕੀਤਾ।
  • [ ] ਮੈਂ ਚਿੱਤਰ ਦੇ ਨਾਲ ਸਾਰੇ ਨੰਬਰਾਂ, ਮਿਤੀਆਂ ਅਤੇ ਸਹੀ ਨਾਵਾਂ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ ਹੈ।
  • [ ] ਮੈਂ ਨਾਜ਼ੁਕ ਖੇਤਰਾਂ ਵਿੱਚ ਇੱਕ ਨਮੂਨਾ ਜਾਂ ਪੂਰੀ ਜਾਂਚ ਕੀਤੀ।