ಘಟಕಗಳು
1. ಇತಿಹಾಸ ಮತ್ತು ಆರ್ಕೈವಿಂಗ್‌ನಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಪರಿಚಯ: ಪಾತ್ರಗಳು, ಗಡಿಗಳು, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ನೀತಿಶಾಸ್ತ್ರ 2. ಡಾಕ್ಯುಮೆಂಟ್ ಡಿಜಿಟೈಸೇಶನ್ ಮತ್ತು OCR: ಮುದ್ರಿತ ಪಠ್ಯವನ್ನು ಯಂತ್ರ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು 3. ಪ್ರತಿಲೇಖನ: ಒಟ್ಟೋಮನ್ ಟರ್ಕಿಶ್ ಮತ್ತು ಹಸ್ತಪ್ರತಿಗಳು 4. ಮೆಟಾಡೇಟಾ, ಕ್ಯಾಟಲಾಗ್ ಮತ್ತು ವರ್ಗೀಕರಣ 5. ಮೂಲ ಸ್ಕ್ಯಾನಿಂಗ್, ಡಿಸ್ಕವರಿ ಮತ್ತು ಸಾರಾಂಶ 6. ಐತಿಹಾಸಿಕ ಅನುವಾದ ಮತ್ತು ಸರಳೀಕರಣ 7. ಮೂಲ ಪರಿಶೀಲನೆ, ಅನಾಕ್ರೊನಿಸಂ ಮತ್ತು ಭ್ರಮೆ 8. ವಿಷಯ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಪ್ಯಾಟರ್ನ್ ಡಿಸ್ಕವರಿ 9. ಆರ್ಕೈವ್ ಪ್ರವೇಶ, ವಿವರಣೆ ಮತ್ತು ಬಳಕೆದಾರ ಸೇವೆಗಳು 10. ಸಂರಕ್ಷಣೆ, ಮರುಸ್ಥಾಪನೆ ಮತ್ತು ಡಿಜಿಟಲ್ ಸಂರಕ್ಷಣೆ 11. ನೀತಿಶಾಸ್ತ್ರ, ಹಕ್ಕುಸ್ವಾಮ್ಯ, ಗೌಪ್ಯತೆ ಮತ್ತು ಸಾಂಸ್ಕೃತಿಕ ಸೂಕ್ಷ್ಮತೆ 12. ಎಂಡ್-ಟು-ಎಂಡ್ ಪ್ರಾಜೆಕ್ಟ್: ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್‌ನೊಂದಿಗೆ ಆರ್ಕೈವ್ ಸಂಗ್ರಹವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದು
ಘಟಕ 2 / 12

ಡಾಕ್ಯುಮೆಂಟ್ ಡಿಜಿಟೈಸೇಶನ್ ಮತ್ತು OCR: ಮುದ್ರಿತ ಪಠ್ಯವನ್ನು ಯಂತ್ರ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು

ಲಾಭಗಳು:

  • ಡಿಜಿಟೈಸೇಶನ್ ಮತ್ತು OCR ವರ್ಕ್‌ಫ್ಲೋ (ಸ್ಕ್ಯಾನಿಂಗ್, ಪೂರ್ವ-ಸಂಸ್ಕರಣೆ, ಗುರುತಿಸುವಿಕೆ, ತಿದ್ದುಪಡಿ, ಪರಿಶೀಲನೆ) ಹಂತ ಹಂತವಾಗಿ ಹೊಂದಿಸುವ ಸಾಮರ್ಥ್ಯ
  • ತಿದ್ದುಪಡಿಯನ್ನು ನಿರ್ವಹಿಸುವಾಗ ಮತ್ತು ರೇಖೆಯನ್ನು ಪುನಃ ಬರೆಯುವಾಗ ಮತ್ತು [?] ಜೊತೆಗೆ ಅಸ್ಪಷ್ಟತೆಯನ್ನು ಗುರುತಿಸುವಾಗ ಸಂದರ್ಭದೊಂದಿಗೆ OCR ದೋಷಗಳನ್ನು ಸರಿಪಡಿಸಲು AI ಅನ್ನು ಬಳಸುವ ಸಾಮರ್ಥ್ಯ
  • ಸಂಖ್ಯೆಗಳು, ದಿನಾಂಕಗಳು ಮತ್ತು ಸರಿಯಾದ ಹೆಸರುಗಳನ್ನು ಏಕೆ ದೃಷ್ಟಿಗೋಚರವಾಗಿ ಪರಿಶೀಲಿಸಬೇಕು ಮತ್ತು ಗುಣಮಟ್ಟದ ನಿಯಂತ್ರಣದ ಪಾತ್ರವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಿ.

ಆರ್ಕೈವ್ ಅಥವಾ ಲೈಬ್ರರಿಯ ಭೌತಿಕ ಕಪಾಟಿನಲ್ಲಿರುವ ಲಕ್ಷಾಂತರ ಪುಟಗಳು ಡಿಜಿಟಲೀಕರಣಗೊಂಡಾಗ ಮತ್ತು ಹುಡುಕಬಹುದಾದಾಗ ಮಾತ್ರ ಸಂಶೋಧಕರಿಗೆ ನಿಜವಾಗಿಯೂ ತೆರೆದುಕೊಳ್ಳುತ್ತವೆ. ಡಿಜಿಟೈಸೇಶನ್ ಎಂದರೆ ಭೌತಿಕ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಸ್ಕ್ಯಾನ್ ಮಾಡುವ ಅಥವಾ ಛಾಯಾಚಿತ್ರ ಮಾಡುವ ಮೂಲಕ ಡಿಜಿಟಲ್ ಇಮೇಜ್ ಆಗಿ ಪರಿವರ್ತಿಸುವುದು. ಆದರೆ ಪುಟದ ಛಾಯಾಚಿತ್ರವು ಇನ್ನೂ "ಪಠ್ಯ" ಆಗಿಲ್ಲ; ಕಂಪ್ಯೂಟರ್‌ಗೆ ಇದು ಇನ್ನೂ ಚಿತ್ರವಾಗಿದೆ, ನೀವು ಅದರಲ್ಲಿ ಹುಡುಕಲು ಸಾಧ್ಯವಿಲ್ಲ. ಇಲ್ಲಿ OCR ಕಾರ್ಯರೂಪಕ್ಕೆ ಬರುತ್ತದೆ.

OCR (ಆಪ್ಟಿಕಲ್ ಕ್ಯಾರೆಕ್ಟರ್ ರೆಕಗ್ನಿಷನ್) ಎನ್ನುವುದು ಡಾಕ್ಯುಮೆಂಟ್ ಇಮೇಜ್‌ನಲ್ಲಿ ಮುದ್ರಿತ ಅಕ್ಷರಗಳನ್ನು ಗುರುತಿಸುವ ತಂತ್ರಜ್ಞಾನವಾಗಿದೆ ಮತ್ತು ಅವುಗಳನ್ನು ಯಂತ್ರ-ಓದಬಲ್ಲ, ಹುಡುಕಬಹುದಾದ ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ. ಈ ಘಟಕದಲ್ಲಿ, OCR ನೊಂದಿಗೆ ಐತಿಹಾಸಿಕ ಮುದ್ರಿತ ದಾಖಲೆಗಳನ್ನು ಡಿಜಿಟೈಸ್ ಮಾಡುವುದು ಹೇಗೆ, ಈ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ OCR ದೋಷಗಳನ್ನು ಸರಿಪಡಿಸಲು AI ಹೇಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ ಮತ್ತು ಮಾನವನ ಕಣ್ಣು ಅಗತ್ಯವಾಗಿರುವಲ್ಲಿ ನೀವು ಕಲಿಯುವಿರಿ. (ಕೈಬರಹದ ಪಠ್ಯಗಳಿಗೆ ವಿಭಿನ್ನ ತಂತ್ರಜ್ಞಾನದ ಅಗತ್ಯವಿದೆ; ನಾವು ಅದನ್ನು ಮುಂದಿನ ಘಟಕದಲ್ಲಿ ಕವರ್ ಮಾಡುತ್ತೇವೆ.)

ಡಿಜಿಟೈಸೇಶನ್ ಕೆಲಸದ ಹರಿವು: ಹಂತ ಹಂತವಾಗಿ

1. ತಯಾರಿ ಮತ್ತು ಸ್ಕ್ರೀನಿಂಗ್. ಸಾಧ್ಯವಾದಷ್ಟು ಹೆಚ್ಚಿನ ಗುಣಮಟ್ಟದಲ್ಲಿ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಸ್ಕ್ಯಾನ್ ಮಾಡಿ. ಐತಿಹಾಸಿಕ ಸಂಶೋಧನೆಗಾಗಿ ಹೆಬ್ಬೆರಳಿನ ಸಾಮಾನ್ಯ ನಿಯಮವು ಕನಿಷ್ಟ 300-400 DPI (ಪ್ರತಿ ಇಂಚಿಗೆ ಚುಕ್ಕೆಗಳು) ರೆಸಲ್ಯೂಶನ್ ಆಗಿದೆ. ಕಡಿಮೆ ರೆಸಲ್ಯೂಶನ್ ನಂತರದ OCR ಹಂತದಲ್ಲಿ ದೋಷದ ಪ್ರಮಾಣವನ್ನು ಗಗನಕ್ಕೇರಿಸುತ್ತದೆ.

2. ಇಮೇಜ್ ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್. OCR ಗಿಂತ ಮೊದಲು ಚಿತ್ರವನ್ನು ಸುಧಾರಿಸುವುದು ಯಶಸ್ಸನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ: ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ ಪುಟವನ್ನು deskewing, ಕಲೆಗಳನ್ನು ತೆಗೆದುಹಾಕುವುದು, ವ್ಯತಿರಿಕ್ತತೆಯನ್ನು ಹೆಚ್ಚಿಸುವುದು, ಕಪ್ಪು ಮತ್ತು ಬಿಳಿಗೆ ಪರಿವರ್ತಿಸುವುದು. ಆಧುನಿಕ AI-ಆಧಾರಿತ ಉಪಕರಣಗಳು ಈ ಹಂತವನ್ನು ಸ್ವಯಂಚಾಲಿತಗೊಳಿಸಬಹುದು.

3. OCR ಅಪ್ಲಿಕೇಶನ್. ನೀವು ಚಿತ್ರವನ್ನು OCR ಎಂಜಿನ್‌ಗೆ ಫೀಡ್ ಮಾಡಿ; ಎಂಜಿನ್ ಅಕ್ಷರಗಳನ್ನು ಗುರುತಿಸುತ್ತದೆ ಮತ್ತು ಪಠ್ಯವನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. ಔಟ್‌ಪುಟ್ ಸಾಮಾನ್ಯವಾಗಿ ಎರಡು ಲೇಯರ್‌ಗಳನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ: ಗೋಚರ ಡಾಕ್ಯುಮೆಂಟ್ ಇಮೇಜ್ ಮತ್ತು ಕೆಳಗೆ "ಹುಡುಕಬಹುದಾದ ಗುಪ್ತ ಪಠ್ಯ ಪದರ".

4. ತಿದ್ದುಪಡಿ (ತಿದ್ದುಪಡಿ ನಂತರ). ಕಚ್ಚಾ OCR ಔಟ್‌ಪುಟ್ ಎಂದಿಗೂ ಪರಿಪೂರ್ಣವಲ್ಲ. ಹಳೆಯ ಫಾಂಟ್‌ಗಳು, ಹಳದಿ ಬಣ್ಣದ ಕಾಗದ, ಇಂಕ್ ಸ್ಮೀಯರಿಂಗ್ ಮತ್ತು ಸ್ಕ್ಯಾನಿಂಗ್ ದೋಷಗಳಿಂದ ಅಕ್ಷರಗಳನ್ನು ತಪ್ಪಾಗಿ ಓದಲಾಗುತ್ತದೆ. ಇಲ್ಲಿ AI ಪ್ರಬಲ ಸಹಾಯಕವಾಗಿದೆ: ಇದು ಸಂದರ್ಭವನ್ನು ಬಳಸಿಕೊಂಡು OCR ದೋಷಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ ಮತ್ತು ಸರಿಪಡಿಸುತ್ತದೆ.

5. ಪರಿಶೀಲನೆ ಮತ್ತು ಗುಣಮಟ್ಟ ನಿಯಂತ್ರಣ. ಸರಿಪಡಿಸಿದ ಪಠ್ಯವನ್ನು ಮಾನವರು ಮಾದರಿ ಆಧಾರದ ಮೇಲೆ ಅಥವಾ ಸಂಪೂರ್ಣವಾಗಿ ಪರಿಶೀಲಿಸುತ್ತಾರೆ. ಹೆಸರುಗಳು, ದಿನಾಂಕಗಳು ಮತ್ತು ಸಂಖ್ಯೆಗಳಂತಹ ವಿಶೇಷವಾಗಿ ನಿರ್ಣಾಯಕ ಪ್ರದೇಶಗಳನ್ನು ದೃಷ್ಟಿಗೋಚರವಾಗಿ ಪರಿಶೀಲಿಸಬೇಕು.

OCR ಏಕೆ ತಪ್ಪುಗಳನ್ನು ಮಾಡುತ್ತದೆ, AI ಹೇಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ

ಐತಿಹಾಸಿಕ ದಾಖಲೆಗಳಲ್ಲಿ OCR ಗೆ ಸವಾಲು ಹಾಕುವ ವಿಶಿಷ್ಟ ಸಮಸ್ಯೆಗಳು: ಹಳೆಯ ಮತ್ತು ಅಲಂಕಾರಿಕ ಫಾಂಟ್‌ಗಳು, ದೀರ್ಘವಾದ "s" (ſ), ಎರಡು-ಕಾಲಮ್ ಪುಟ ವಿನ್ಯಾಸ, ಅಡಿಟಿಪ್ಪಣಿಗಳು, ಕೈಬರಹದ ಒಳಸೇರಿಸುವಿಕೆಗಳು, ಸೀಲುಗಳು ಮತ್ತು ಮರೆಯಾದ ಶಾಯಿಯಂತಹ ಬಳಕೆಯಲ್ಲಿಲ್ಲದ ಅಕ್ಷರ ರೂಪಗಳು. OCR ಇಂಜಿನ್ ಅಕ್ಷರಗಳನ್ನು ಒಂದೊಂದಾಗಿ "ನೋಡುತ್ತದೆ", ಇದು ಆಗಾಗ್ಗೆ ಬೈನರಿ "rn" ಅನ್ನು "m" ಎಂದು, "l" ಅಕ್ಷರವನ್ನು "1" ಎಂದು ಮತ್ತು "O" ಅಕ್ಷರವನ್ನು "0" ಎಂದು ಗೊಂದಲಗೊಳಿಸುತ್ತದೆ.

AI ಭಾಷಾ ಮಾದರಿಗಳು ಇಲ್ಲಿ ವಿಭಿನ್ನ ಶಕ್ತಿಯನ್ನು ನೀಡುತ್ತವೆ: ಅವು ಸಂದರ್ಭವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುತ್ತವೆ. OCR ಎಂಜಿನ್ "1stanbu1" ಎಂದು ಬರೆದರೆ, AI ಅದು "ಇಸ್ತಾನ್‌ಬುಲ್" ಆಗಿರಬೇಕು ಎಂದು ಸನ್ನಿವೇಶದಿಂದ ಊಹಿಸಬಹುದು. ಆದರೆ ಇಲ್ಲಿ ದೊಡ್ಡ ಅಪಾಯವಿದೆ: "ಸರಿಪಡಿಸುವಾಗ" AI ಪಠ್ಯವನ್ನು ಸಹ ಬದಲಾಯಿಸಬಹುದು. ಅವನು ಅಸ್ತಿತ್ವದಲ್ಲಿಲ್ಲದ ಪದವನ್ನು "ನಾನು ಸರಿಪಡಿಸಿದ್ದೇನೆ" ಅನ್ನು ಸೇರಿಸಬಹುದು ಅಥವಾ ಅವನ ಸ್ವಂತ ಊಹೆಯೊಂದಿಗೆ ಅಸ್ಪಷ್ಟ ಸ್ಥಳವನ್ನು ತುಂಬಬಹುದು. ಇದು ಪ್ರತಿಲೇಖನದ ನಿಷ್ಠೆಯನ್ನು ಅಡ್ಡಿಪಡಿಸುತ್ತದೆ.

ಎಚ್ಚರಿಕೆ: OCR ತಿದ್ದುಪಡಿಯಲ್ಲಿನ ಗೋಲ್ಡನ್ ರೂಲ್ ಇದು: AI ಸ್ಪಷ್ಟವಾದ ಗುರುತಿಸುವಿಕೆ ದೋಷಗಳನ್ನು ಮಾತ್ರ ಸರಿಪಡಿಸಬೇಕು, ಪಠ್ಯದ ವಿಷಯವನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಬಾರದು ಅಥವಾ ಪೂರಕವಾಗಿರಬಾರದು. "1stanbu1 → ಇಸ್ತಾಂಬುಲ್" ನ್ಯಾಯಸಮ್ಮತವಾಗಿದೆ; ಓದಲಾಗದ ಪದವನ್ನು ಊಹೆಗಳೊಂದಿಗೆ ತುಂಬುವುದು ಅಲ್ಲ. ಅನಿಶ್ಚಿತ ಸ್ಥಳಗಳನ್ನು [?] ಎಂದು ಗುರುತಿಸಬೇಕು ಮತ್ತು ಅದನ್ನು ರೂಪಿಸಬಾರದು.

OCR ದೋಷದ ಪ್ರಕಾರಗಳು ಮತ್ತು ಟೇಬಲ್‌ನೊಂದಿಗೆ ವಿಧಾನ

ದೋಷದ ಪ್ರಕಾರ

ಉದಾಹರಣೆ

AI ಅದನ್ನು ಸರಿಪಡಿಸಬಹುದೇ?

ಮಾನವ ನಿಯಂತ್ರಣ

ಪಾತ್ರ ಮಿಶ್ರಣ

rn↔m, l↔1, O↔0

ಹೌದು, ಇದು ಸುರಕ್ಷಿತವಾಗಿದೆ

ಮಾದರಿ

ಹಳೆಯ ಅಕ್ಷರ ರೂಪ

ಉದ್ದ ſ → ರು

ಹೌದು, ಇದು ಸುರಕ್ಷಿತವಾಗಿದೆ

ಮಾದರಿ

ಮರೆಯಾದ/ಓದಲಾಗದ ಪದ

"ಕಾ___ನ್"

ಇಲ್ಲ, ಹಾಕಬೇಕು [?]

ಕಡ್ಡಾಯ

ಸರಿಯಾದ ಹೆಸರು/ಸ್ಥಳದ ಹೆಸರು

"ಕಾನ್ಸ್ಟಾಂಟಿನಿಯೆ"

ಎಚ್ಚರಿಕೆಯಿಂದ

ಕಡ್ಡಾಯ

ಸಂಖ್ಯೆ/ದಿನಾಂಕ

"1867" ವಿರುದ್ಧ "1857"

ಅಪಾಯಕಾರಿ

ಕಡ್ಡಾಯ

ಪುಟ ವಿನ್ಯಾಸ (ಕಾಲಮ್/ಅಡಿಟಿಪ್ಪಣಿ)

ಮಿಶ್ರ ಹರಿವು

ಭಾಗಶಃ

ಕಡ್ಡಾಯ

ಒಂದು ವಾಕ್ಯದಲ್ಲಿ ಚಿತ್ರವನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸಲು: AI ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಸಾಮಾನ್ಯ ಅಕ್ಷರ ದೋಷಗಳನ್ನು ಸ್ವಚ್ಛಗೊಳಿಸುತ್ತದೆ; ಆದರೆ ವಿಶೇಷ ಹೆಸರುಗಳು, ಸಂಖ್ಯೆಗಳು, ದಿನಾಂಕಗಳು ಮತ್ತು ಓದಲಾಗದ ಸ್ಥಳಗಳಿಗೆ ಮಾನವ ಕಣ್ಣುಗಳು ಬೇಕಾಗುತ್ತವೆ.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ವೃತ್ತಪತ್ರಿಕೆ ಆರ್ಕೈವ್‌ಗಳನ್ನು ಹುಡುಕಬಹುದಾಗಿದೆ. ವಿಶ್ವವಿದ್ಯಾನಿಲಯದ ಗ್ರಂಥಾಲಯವು 1930 ರ ದಶಕದಿಂದ ಸ್ಥಳೀಯ ಪತ್ರಿಕೆಗಳ 12,000 ಪುಟಗಳನ್ನು ಡಿಜಿಟೈಸ್ ಮಾಡಿದೆ. ಕಚ್ಚಾ OCR ನಿಖರತೆಯು ಅಂದಾಜು 82% ಆಗಿತ್ತು (ಪ್ರತಿ 100 ಅಕ್ಷರಗಳಲ್ಲಿ 18 ತಪ್ಪಾಗಿದೆ). AI-ಆಧಾರಿತ ತಿದ್ದುಪಡಿಯು ವೃತ್ತಪತ್ರಿಕೆ ಭಾಷೆ-ಸೂಕ್ತವಾದ ನಿಘಂಟು ಮತ್ತು ಸಂದರ್ಭದೊಂದಿಗೆ 96% ಗೆ ನಿಖರತೆಯನ್ನು ಹೆಚ್ಚಿಸಿತು. ಉಳಿದ ದೋಷಗಳಿಗಾಗಿ, ಪೂರ್ಣ ಪಠ್ಯದ ಬದಲಿಗೆ ಮಾದರಿ ಪರಿಶೀಲನೆಯನ್ನು ನಡೆಸಲಾಯಿತು; ಸಂಗ್ರಹಣೆಯನ್ನು 3 ವಾರಗಳಲ್ಲಿ ಹುಡುಕಬಹುದಾಗಿದೆ.

ಪ್ರಕರಣ 2 - AI "ಸರಿಪಡಿಸಲಾಗಿದೆ" ಮತ್ತು ವಿಕೃತ ಇತಿಹಾಸ. ಆರ್ಕೈವಿಸ್ಟ್ ಒಸಿಆರ್ ಪ್ರಿಂಟ್‌ಔಟ್‌ನಲ್ಲಿ "1863" ದಿನಾಂಕವನ್ನು AI ಸರಿಪಡಿಸಿದ್ದರು. ಸಂದರ್ಭದಲ್ಲಿ ಮತ್ತೊಂದು ಘಟನೆಯನ್ನು ನೋಡುವ ಮೂಲಕ AI ದಿನಾಂಕವನ್ನು "1868" ಗೆ "ಸರಿಪಡಿಸಿದೆ" - ಡಾಕ್ಯುಮೆಂಟ್ ಸ್ಪಷ್ಟವಾಗಿ 1863 ಎಂದು ಹೇಳಿದ್ದರೂ ಸಹ. ಆರ್ಕೈವಿಸ್ಟ್ ಮೂಲ ಚಿತ್ರವನ್ನು ನೋಡದಿದ್ದರೆ, ಕ್ಯಾಟಲಾಗ್ ತಪ್ಪಾದ ದಿನಾಂಕದೊಂದಿಗೆ ನಮೂದಿಸಲ್ಪಡುತ್ತದೆ. ಪಾಠ: ಸಂಖ್ಯೆಗಳು ಮತ್ತು ದಿನಾಂಕಗಳನ್ನು ಎಂದಿಗೂ AI ಗೆ ಬಿಡಲಾಗುವುದಿಲ್ಲ, ಅವುಗಳನ್ನು ಚಿತ್ರದೊಂದಿಗೆ ಪರಿಶೀಲಿಸಲಾಗುತ್ತದೆ.

ಪ್ರಕರಣ 3 - ಎರಡು-ಕಾಲಮ್ ಪುಟ ಗೊಂದಲಕ್ಕೊಳಗಾಗಿದೆ. 19 ನೇ ಶತಮಾನದ ವಾರ್ಷಿಕ ಪುಸ್ತಕದ ಎರಡು-ಕಾಲಮ್ ಪುಟಗಳನ್ನು OCR ನಲ್ಲಿ ಒಂದೇ ಸ್ಟ್ರೀಮ್‌ಗೆ ಬೆರೆಸಲಾಗಿದೆ ಮತ್ತು ವಾಕ್ಯಗಳನ್ನು ಹೆಣೆದುಕೊಂಡಿದೆ. ಕಚ್ಚಾ ಔಟ್‌ಪುಟ್ ಓದಲಾಗಲಿಲ್ಲ. ನಾನು ಮೊದಲು ಪುಟದ ವಿನ್ಯಾಸವನ್ನು ಪ್ರದೇಶಗಳಾಗಿ (ವಿಭಾಗ) ವಿಂಗಡಿಸಿದಾಗ ಮತ್ತು ಪ್ರತಿ ಕಾಲಮ್ ಅನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಿದಾಗ ಪಠ್ಯವು ಸುಧಾರಿಸಿತು. ಪಾಠ: ಸಂಕೀರ್ಣ ಪುಟ ವಿನ್ಯಾಸದಲ್ಲಿ, ರಚನೆ ಮೊದಲ, ಪಠ್ಯ ಎರಡನೇ.

ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

1) ಸುರಕ್ಷಿತ OCR ತಿದ್ದುಪಡಿ:

ಐತಿಹಾಸಿಕ ಡಾಕ್ಯುಮೆಂಟ್‌ನ ಕಚ್ಚಾ OCR ಔಟ್‌ಪುಟ್ ಕೆಳಗೆ ಇದೆ. ನಿಮ್ಮ ಕಾರ್ಯವು ಸ್ಪಷ್ಟವಾದ ಆಪ್ಟಿಕಲ್ ಗುರುತಿಸುವಿಕೆ ದೋಷಗಳನ್ನು ಮಾತ್ರ ಸರಿಪಡಿಸುವುದು (ಉದಾ. rn→m,1→l, 0→O, ದೀರ್ಘ ſ→s). ನಿಯಮಗಳು: (1) ಪಠ್ಯದ ಅರ್ಥವನ್ನು ಅರ್ಥೈಸಿಕೊಳ್ಳಿ. (2) ಓದಲಾಗದ/ಅಸ್ಪಷ್ಟ ಪದಗಳನ್ನು ಸರಿಪಡಿಸಿ, ಹಾಗೆಯೇ ಬಿಟ್ಟು [?] ಎಂದು ಗುರುತಿಸಿ. (3) ಯಾವುದೇ ವಾಕ್ಯಗಳನ್ನು ಸೇರಿಸುವುದು, ತೆಗೆದುಹಾಕುವುದು ಅಥವಾ ಪೂರ್ಣಗೊಳಿಸುವುದು. (4) ಸಂಖ್ಯೆಗಳು ಮತ್ತು ದಿನಾಂಕಗಳನ್ನು ಬದಲಾಯಿಸಿ; ಸಂದೇಹವಿದ್ದರೆ [ಸಂಖ್ಯೆ?] ಗುರುತಿಸಿ. ರಾ OCR: [ಇಲ್ಲಿ]

2) OCR ಗುಣಮಟ್ಟದ ವರದಿ:

ಕೆಳಗಿನ OCR ಔಟ್‌ಪುಟ್ ಅನ್ನು ಪರೀಕ್ಷಿಸಿ ಮತ್ತು ಗುಣಮಟ್ಟದ ವರದಿಯನ್ನು ತಯಾರಿಸಿ: (1) ಸಂಭವನೀಯ ಗುರುತಿಸುವಿಕೆ ದೋಷಗಳೊಂದಿಗೆ ಪದಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ, (2) ಓದಲಾಗದ/ಅಸ್ಪಷ್ಟವಾಗಿ ಕಂಡುಬರುವ ಪ್ರದೇಶಗಳನ್ನು ಗುರುತಿಸಿ, (3) ಮಾನವ ತಪಾಸಣೆ ಅಗತ್ಯವಿರುವ ನಿರ್ದಿಷ್ಟ ಹೆಸರುಗಳು, ದಿನಾಂಕಗಳು ಮತ್ತು ಸಂಖ್ಯೆಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ. ಸರಿಪಡಿಸಬೇಡಿ; ಪರಿಶೀಲನಾಪಟ್ಟಿಯನ್ನು ಮಾತ್ರ ರಚಿಸಿ.ಪಠ್ಯ: [ಇಲ್ಲಿ]

3) ಕಾಲಮ್/ಸ್ಟ್ರಕ್ಚರ್ ಪಾರ್ಸಿಂಗ್ ಸಹಾಯ:

ಕೆಳಗಿನ OCR ಪಠ್ಯವು ಎರಡು-ಕಾಲಮ್ ಪುಟದಿಂದ ಬಂದಿರುವುದರಿಂದ, ಹರಿವು ಗೊಂದಲಕ್ಕೊಳಗಾಗಬಹುದು. ಪಠ್ಯವನ್ನು ತಾರ್ಕಿಕ ಪ್ಯಾರಾಗಳಿಗೆ ಮರುಹೊಂದಿಸಿ ಆದರೆ ಯಾವುದೇ ಪದಗಳನ್ನು ಬದಲಾಯಿಸಬೇಡಿ, ಸೇರಿಸಬೇಡಿ ಅಥವಾ ಅಳಿಸಬೇಡಿ. ಕೇವಲ ಆದೇಶವನ್ನು ಸರಿಪಡಿಸಿ. ನೀವು ಖಚಿತವಾಗಿರದ ಆದೇಶವನ್ನು [ಆರ್ಡರ್?] ಜೊತೆಗೆ ಗುರುತಿಸಿ. ಪಠ್ಯ: [ಇಲ್ಲಿ]

4) ಪ್ರಮಾಣಿತ ಭಾಷೆಗೆ ಸಾಮಾನ್ಯೀಕರಣ (ಐಚ್ಛಿಕ, ಪ್ರತ್ಯೇಕ ಪದರ):

ಇಂದಿನ ಕಾಗುಣಿತದಲ್ಲಿ ಸರಳೀಕೃತ ಓದುವ ಆವೃತ್ತಿಯನ್ನು ತಯಾರಿಸಿ, ಪ್ರತ್ಯೇಕ ಕಾಲಮ್‌ನಲ್ಲಿ, ಕೆಳಗಿನ ಸರಿಪಡಿಸಿದ ಐತಿಹಾಸಿಕ ಪಠ್ಯದ ಮೇಲೆ. ಮೂಲ ಪಠ್ಯವನ್ನು ಎಂದಿಗೂ ಬದಲಾಯಿಸಬೇಡಿ; ಸರಳೀಕರಣವು ಪ್ರತ್ಯೇಕ ಪದರವಾಗಿರಲಿ. ಅರ್ಥವನ್ನು ಸೇರಿಸದೆಯೇ ಕಾಗುಣಿತ/ಉಚ್ಚಾರಣೆಯನ್ನು ನವೀಕರಿಸಿ. ಮೂಲ: [ಇಲ್ಲಿ]

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ:

ಈ OCR ಪಠ್ಯವನ್ನು ಸರಿಪಡಿಸಿ ಮತ್ತು ಸುಂದರಗೊಳಿಸಿ.

"ಸುಂದರಗೊಳಿಸು" AI ಗೆ ಪಠ್ಯವನ್ನು ಪುನಃ ಬರೆಯಲು, ಲೋಪಗಳನ್ನು ಮಾಡಲು ಮತ್ತು ವಿಷಯವನ್ನು ಅರ್ಥೈಸಲು ಅನುಮತಿಸುತ್ತದೆ; ನಿಷ್ಠೆಯನ್ನು ಮುರಿಯುತ್ತದೆ.

ಪ್ರಬಲ:

ಈ ಕಚ್ಚಾ OCR ಔಟ್‌ಪುಟ್‌ನಲ್ಲಿ ಆಪ್ಟಿಕಲ್ ಗುರುತಿಸುವಿಕೆ ದೋಷಗಳನ್ನು ಮಾತ್ರ ಸರಿಪಡಿಸಿ. ಅರ್ಥವನ್ನು ಅರ್ಥೈಸಬೇಡಿ, ಪದಗಳನ್ನು ಸೇರಿಸಿ/ಅಳಿಸಬೇಡಿ, [?] ಓದಲಾಗದ ಭಾಗಗಳನ್ನು ಬಿಡಿ, ಸಂಖ್ಯೆಗಳು ಮತ್ತು ದಿನಾಂಕಗಳನ್ನು ಬದಲಾಯಿಸಿ. ನೀವು ಮಾಡುವ ಪ್ರತಿಯೊಂದು ತಿದ್ದುಪಡಿಯನ್ನು "ಮೂಲ → ತಿದ್ದುಪಡಿ" ಸ್ವರೂಪದಲ್ಲಿ ಪ್ರತ್ಯೇಕ ಪಟ್ಟಿಯಲ್ಲಿ ತೋರಿಸಿ ಇದರಿಂದ ನಾನು ಅದನ್ನು ಪರಿಶೀಲಿಸಬಹುದು. ಪಠ್ಯ: [ಇಲ್ಲಿ]

ವ್ಯತ್ಯಾಸ: ಬೌಂಟೆಡ್ ಡ್ಯೂಟಿ, ಫ್ಯಾಬ್ರಿಕೇಶನ್ ಮೇಲೆ ನಿಷೇಧ, ಅಸ್ಪಷ್ಟತೆಯನ್ನು ಗುರುತಿಸುವುದು ಮತ್ತು ತಿದ್ದುಪಡಿಗಳ ಪತ್ತೆಹಚ್ಚಬಹುದಾದ ಪಟ್ಟಿಯು ಔಟ್‌ಪುಟ್ ಅನ್ನು ಆಡಿಟ್ ಮಾಡುವಂತೆ ಮಾಡುತ್ತದೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಕಡಿಮೆ ರೆಸಲ್ಯೂಶನ್‌ನಲ್ಲಿ ಸ್ಕ್ಯಾನ್ ಮಾಡಲಾಗುತ್ತಿದೆ. ಹೆಚ್ಚಿನ OCR ದೋಷಗಳು ಕೆಟ್ಟ ಚಿತ್ರಗಳಿಂದ ಉಂಟಾಗುತ್ತವೆ; ಗುಣಮಟ್ಟದ ಸ್ಕ್ಯಾನಿಂಗ್ ಅಗ್ಗದ ಹೂಡಿಕೆಯಾಗಿದೆ.
  • AI ಅನ್ನು "ಸುಂದರಗೊಳಿಸಿ" ಎಂದು ಕರೆಯುವುದು. ಇದು ನಿಷ್ಠೆಗಿಂತ ನಿರರ್ಗಳತೆಯನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ; ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಪುನಃ ಬರೆಯಲಾಗಿದೆ.
  • ಸಂಖ್ಯೆಗಳು ಮತ್ತು ದಿನಾಂಕಗಳನ್ನು AI ಗೆ ಬಿಡುವುದು. ಸಂದರ್ಭದಿಂದ "ಸರಿಪಡಿಸಿದಾಗ" ಇವು ಮೌನವಾಗಿ ಭ್ರಷ್ಟಗೊಳ್ಳುತ್ತವೆ; ಚಿತ್ರದ ಮೂಲಕ ಪರಿಶೀಲಿಸಬೇಕು.
  • ಓದಲಾಗದ ಜಾಗವನ್ನು ಊಹೆಯೊಂದಿಗೆ ತುಂಬುವುದು. ಇದನ್ನು ಅನಿಶ್ಚಿತತೆಯಿಂದ ರಕ್ಷಿಸಬೇಕು [?], ಮಾಡಲಾಗಿಲ್ಲ.
  • ಮಾದರಿಯ ಬದಲಿಗೆ ನಿಯಂತ್ರಿಸುವುದಿಲ್ಲ. 96% ನಿಖರತೆ ಎಂದರೆ 12,000 ಪುಟಗಳಲ್ಲಿ ಸಾವಿರಾರು ದೋಷಗಳು; ನಿರ್ಣಾಯಕ ಪ್ರದೇಶಗಳನ್ನು ಸ್ಕ್ಯಾನ್ ಮಾಡಲಾಗುತ್ತದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

OCR ಮುದ್ರಿತ ಐತಿಹಾಸಿಕ ದಾಖಲೆಗಳನ್ನು ಹುಡುಕಬಹುದಾದ ಪಠ್ಯವನ್ನಾಗಿ ಪರಿವರ್ತಿಸುವ ಮೂಲಕ ಸಂಶೋಧಕರಿಗೆ ಆರ್ಕೈವ್‌ಗಳನ್ನು ತೆರೆಯುತ್ತದೆ. AI ಎಂಬುದು ಸನ್ನಿವೇಶದೊಂದಿಗೆ ಕಚ್ಚಾ OCR ಔಟ್‌ಪುಟ್‌ನಲ್ಲಿ ಅಕ್ಷರ ದೋಷಗಳನ್ನು ಸರಿಪಡಿಸಲು ಪ್ರಬಲ ಸಹಾಯವಾಗಿದೆ; ಆದರೆ ನೀವು ಸಂಪಾದನೆ ಮತ್ತು ಪುನಃ ಬರೆಯುವ ನಡುವಿನ ಗೆರೆಯನ್ನು ಎಳೆಯಬೇಕು. ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಸ್ಕ್ಯಾನಿಂಗ್, ಸುರಕ್ಷಿತ ತಿದ್ದುಪಡಿ ಸೂಚನೆ, [?] ನೊಂದಿಗೆ ಅಸ್ಪಷ್ಟತೆಯ ಸಂರಕ್ಷಣೆ, ಮತ್ತು ಹೆಸರುಗಳು/ದಿನಾಂಕಗಳು/ಸಂಖ್ಯೆಗಳ ಮಾನವ-ಕಣ್ಣಿನ ಪರಿಶೀಲನೆಯು ಡಿಜಿಟಲೀಕರಣವನ್ನು ವೇಗವಾಗಿ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಮಾಡುತ್ತದೆ. AI ಪಠ್ಯವನ್ನು ಸ್ವಚ್ಛಗೊಳಿಸುತ್ತದೆ; ನೀವು ನಿಷ್ಠೆಯ ರಕ್ಷಕರು.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಮುದ್ರಿತ ಐತಿಹಾಸಿಕ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಸ್ಕ್ಯಾನ್ ಮಾಡಿ (ಹಳೆಯ ವೃತ್ತಪತ್ರಿಕೆ, ಅಧಿಕೃತ ಪತ್ರ, ಪುಸ್ತಕ ಪುಟ) ಅಥವಾ OCR ಮುದ್ರಣವನ್ನು ತೆಗೆದುಕೊಳ್ಳಿ. "ಸುರಕ್ಷಿತ OCR ತಿದ್ದುಪಡಿ" ಟೆಂಪ್ಲೇಟ್‌ನೊಂದಿಗೆ ಪಠ್ಯವನ್ನು ಸರಿಪಡಿಸಿ ಮತ್ತು "ಮೂಲ → ತಿದ್ದುಪಡಿ" ಪಟ್ಟಿಯ ಮೂಲಕ ತಿದ್ದುಪಡಿಗಳನ್ನು ವಿನಂತಿಸಿ. ನಂತರ, "OCR ಗುಣಮಟ್ಟದ ವರದಿ" ಯೊಂದಿಗೆ ಮಾನವ ನಿಯಂತ್ರಣದ ಅಗತ್ಯವಿರುವ ಪ್ರದೇಶಗಳನ್ನು ತೆಗೆದುಹಾಕಿ. ಪಟ್ಟಿಯಲ್ಲಿರುವ ಪ್ರತಿ ದಿನಾಂಕ ಮತ್ತು ಸರಿಯಾದ ಹೆಸರನ್ನು ನಿಜವಾದ ಚಿತ್ರಕ್ಕೆ ಹೋಲಿಸಿ; ಎಷ್ಟು ತಪ್ಪಾಗಿ "ಸರಿಪಡಿಸಲಾಗಿದೆ" ಎಂಬುದನ್ನು ಗಮನಿಸಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಕನಿಷ್ಠ 300 DPI ಮತ್ತು ಉತ್ತಮ ಕಾಂಟ್ರಾಸ್ಟ್‌ನೊಂದಿಗೆ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಆಪ್ಟಿಕಲ್ ದೋಷ ತಿದ್ದುಪಡಿಗಾಗಿ ಮಾತ್ರ AI ಅನ್ನು ಕೇಳಿದೆ, ಪುನಃ ಬರೆಯಲು ಅಲ್ಲ.
  • [?] ನಾನು ಓದಲಾಗದ ಭಾಗಗಳನ್ನು ರಕ್ಷಿಸಿದೆ.
  • [ ] ನಾನು ಚಿತ್ರದೊಂದಿಗೆ ಎಲ್ಲಾ ಸಂಖ್ಯೆಗಳು, ದಿನಾಂಕಗಳು ಮತ್ತು ಸರಿಯಾದ ಹೆಸರುಗಳನ್ನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ನಿರ್ಣಾಯಕ ಪ್ರದೇಶಗಳಲ್ಲಿ ಮಾದರಿ ಅಥವಾ ಪೂರ್ಣ ಪರಿಶೀಲನೆಯನ್ನು ಮಾಡಿದ್ದೇನೆ.