యూనిట్లు
1. చరిత్ర మరియు ఆర్కైవింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డాక్యుమెంట్ డిజిటలైజేషన్ మరియు OCR: ప్రింటెడ్ టెక్స్ట్‌ను మెషిన్ టెక్స్ట్‌గా మార్చడం 3. లిప్యంతరీకరణ: ఒట్టోమన్ టర్కిష్ మరియు మాన్యుస్క్రిప్ట్స్ 4. మెటాడేటా, కేటలాగింగ్ మరియు వర్గీకరణ 5. సోర్స్ స్కానింగ్, డిస్కవరీ మరియు సారాంశం 6. హిస్టారికల్ ట్రాన్స్లేషన్ అండ్ సింప్లిఫికేషన్ 7. మూల ధృవీకరణ, అనాక్రోనిజం మరియు భ్రాంతి 8. కంటెంట్ విశ్లేషణ మరియు నమూనా ఆవిష్కరణ 9. ఆర్కైవ్ యాక్సెస్, వివరణ మరియు వినియోగదారు సేవలు 10. సంరక్షణ, పునరుద్ధరణ మరియు డిజిటల్ సంరక్షణ 11. నీతి, కాపీరైట్, గోప్యత మరియు సాంస్కృతిక సున్నితత్వం 12. ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ఆర్టిఫిషియల్ ఇంటెలిజెన్స్‌తో ఆర్కైవ్ కలెక్షన్‌ను ప్రాసెస్ చేయడం
యూనిట్ 2 / 12

డాక్యుమెంట్ డిజిటలైజేషన్ మరియు OCR: ప్రింటెడ్ టెక్స్ట్‌ను మెషిన్ టెక్స్ట్‌గా మార్చడం

లాభాలు:

  • డిజిటలైజేషన్ మరియు OCR వర్క్‌ఫ్లో (స్కానింగ్, ప్రీ-ప్రాసెసింగ్, రికగ్నిషన్, కరెక్షన్, వెరిఫికేషన్) దశలవారీగా సెటప్ చేయగల సామర్థ్యం
  • దిద్దుబాటును కొనసాగిస్తూ మరియు పంక్తిని తిరిగి వ్రాసేటప్పుడు మరియు [?]తో సందిగ్ధతను గుర్తించేటప్పుడు సందర్భానుసారంగా OCR లోపాలను సరిచేయడానికి AIని ఉపయోగించగల సామర్థ్యం
  • సంఖ్యలు, తేదీలు మరియు సరైన పేర్లు ఎందుకు దృశ్యమానంగా ధృవీకరించబడాలి మరియు నాణ్యత నియంత్రణ పాత్రను అర్థం చేసుకోండి.

ఆర్కైవ్ లేదా లైబ్రరీ యొక్క ఫిజికల్ షెల్ఫ్‌లలోని మిలియన్ల పేజీలు డిజిటలైజ్ చేయబడినప్పుడు మరియు శోధించదగినవి అయినప్పుడు మాత్రమే పరిశోధకుడికి నిజంగా తెరవబడతాయి. డిజిటలైజేషన్ అనేది భౌతిక పత్రాన్ని స్కాన్ చేయడం లేదా ఫోటోగ్రాఫ్ చేయడం ద్వారా డిజిటల్ ఇమేజ్‌గా మార్చడం. కానీ పేజీ యొక్క ఛాయాచిత్రం ఇంకా "టెక్స్ట్" కాదు; కంప్యూటర్‌కు ఇది ఇప్పటికీ ఒక చిత్రం, మీరు దానిలో శోధించలేరు. ఇక్కడే OCR అమలులోకి వస్తుంది.

OCR (ఆప్టికల్ క్యారెక్టర్ రికగ్నిషన్) అనేది డాక్యుమెంట్ ఇమేజ్‌లో ముద్రించిన అక్షరాలను గుర్తించి వాటిని మెషీన్-రీడబుల్, శోధించదగిన టెక్స్ట్‌గా మార్చే సాంకేతికత. ఈ యూనిట్‌లో, OCRతో చారిత్రక ముద్రిత పత్రాలను ఎలా డిజిటలైజ్ చేయాలో, ఈ ప్రక్రియలో OCR లోపాలను సరిదిద్దడానికి AI ఎలా సహాయపడుతుంది మరియు మానవ కన్ను అవసరమైన చోట నేర్చుకుంటారు. (చేతితో వ్రాసిన వచనాలకు వేరే సాంకేతికత అవసరం; మేము దానిని తదుపరి యూనిట్‌లో కవర్ చేస్తాము.)

డిజిటలైజేషన్ వర్క్‌ఫ్లో: స్టెప్ బై స్టెప్

1. తయారీ మరియు స్క్రీనింగ్. సాధ్యమైనంత ఎక్కువ నాణ్యతతో పత్రాన్ని స్కాన్ చేయండి. చారిత్రక పరిశోధన కోసం ఒక సాధారణ నియమం కనీసం 300-400 DPI (అంగుళానికి చుక్కలు) రిజల్యూషన్. తక్కువ రిజల్యూషన్ తదుపరి OCR దశలో లోపం రేటును ఆకాశాన్ని తాకుతుంది.

2. ఇమేజ్ ప్రిప్రాసెసింగ్. OCRకి ముందు ఇమేజ్‌ని మెరుగుపరచడం విజయాన్ని బాగా పెంచుతుంది: స్కాన్ చేసిన పేజీని deskewing చేయడం, మచ్చలను తొలగించడం, కాంట్రాస్ట్‌ను పెంచడం, నలుపు మరియు తెలుపుగా మార్చడం. ఆధునిక AI-ఆధారిత సాధనాలు ఈ దశను ఆటోమేట్ చేయగలవు.

3. OCR అప్లికేషన్. మీరు చిత్రాన్ని OCR ఇంజిన్‌కి ఫీడ్ చేయండి; ఇంజిన్ అక్షరాలను గుర్తిస్తుంది మరియు వచనాన్ని ఉత్పత్తి చేస్తుంది. అవుట్‌పుట్ సాధారణంగా రెండు లేయర్‌లను కలిగి ఉంటుంది: కనిపించే డాక్యుమెంట్ ఇమేజ్ మరియు కింద "శోధించదగిన దాచిన టెక్స్ట్ లేయర్".

4. దిద్దుబాటు (పోస్ట్-కరెక్షన్). ముడి OCR అవుట్‌పుట్ ఎప్పుడూ పరిపూర్ణంగా ఉండదు. పాత ఫాంట్‌లు, పసుపు రంగు కాగితం, ఇంక్ స్మెరింగ్ మరియు స్కానింగ్ లోపాల కారణంగా అక్షరాలు తప్పుగా చదవబడతాయి. ఇక్కడే AI శక్తివంతమైన సహాయకుడు: ఇది సందర్భాన్ని ఉపయోగించి OCR లోపాలను సూచిస్తుంది మరియు సరిచేస్తుంది.

5. ధృవీకరణ మరియు నాణ్యత నియంత్రణ. సరిదిద్దబడిన వచనం నమూనా ఆధారంగా లేదా పూర్తిగా మానవునిచే తనిఖీ చేయబడుతుంది. పేర్లు, తేదీలు మరియు సంఖ్యలు వంటి ముఖ్యంగా క్లిష్టమైన ప్రాంతాలు తప్పనిసరిగా దృశ్యమానంగా ధృవీకరించబడాలి.

OCR ఎందుకు తప్పులు చేస్తుంది, AI ఎలా సహాయపడుతుంది

చారిత్రక పత్రాలలో OCRని సవాలు చేసే సాధారణ సమస్యలు: పాత మరియు ఫ్యాన్సీ ఫాంట్‌లు, పొడవైన "s" (ſ), రెండు-నిలువు వరుసల పేజీ లేఅవుట్, ఫుట్‌నోట్‌లు, చేతితో రాసిన ఇన్‌సర్ట్‌లు, సీల్స్ మరియు ఫేడెడ్ ఇంక్ వంటి వాడుకలో లేని అక్షర రూపాలు. OCR ఇంజిన్ అక్షరాలను ఒక్కొక్కటిగా "చూస్తుంది" కాబట్టి, ఇది తరచుగా బైనరీ "rn"ని "m"గా, "l" అక్షరాన్ని సంఖ్య "1"గా మరియు "O" అక్షరాన్ని "0"గా భ్రమింపజేస్తుంది.

AI భాషా నమూనాలు ఇక్కడ విభిన్న శక్తిని అందిస్తాయి: అవి సందర్భాన్ని అర్థం చేసుకుంటాయి. ఒక OCR ఇంజిన్ "1stanbu1" అని వ్రాసినట్లయితే, AI అది "ఇస్తాంబుల్"గా ఉండాలనే విషయాన్ని సందర్భం నుండి ఊహించగలదు. కానీ ఇక్కడ పెద్ద ప్రమాదం ఉంది: "సరిదిద్దేటప్పుడు" AI వచనాన్ని కూడా మార్చగలదు. అతను ఉనికిలో లేని పదాన్ని "నేను సరిదిద్దాను" అని జోడించవచ్చు లేదా తన స్వంత అంచనాతో అస్పష్టమైన స్థలాన్ని పూరించవచ్చు. ఇది లిప్యంతరీకరణ యొక్క విశ్వసనీయతకు భంగం కలిగిస్తుంది.

హెచ్చరిక: OCR దిద్దుబాటులో గోల్డెన్ రూల్ ఇది: AI స్పష్టమైన గుర్తింపు లోపాలను మాత్రమే సరిదిద్దాలి, టెక్స్ట్ యొక్క కంటెంట్‌ను అన్వయించడం లేదా అనుబంధించడం కాదు. "1stanbu1 → ఇస్తాంబుల్" చట్టబద్ధమైనది; చదవలేని పదాన్ని అంచనాలతో నింపడం కాదు. అనిశ్చిత స్థలాలను [?]తో గుర్తించాలి మరియు వాటిని తయారు చేయకూడదు.

OCR ఎర్రర్ రకాలు మరియు పట్టికతో విధానం

లోపం రకం

ఉదాహరణ

AI దాన్ని పరిష్కరించగలదా?

మానవ నియంత్రణ

పాత్ర మిక్సింగ్

rn↔m, l↔1, O↔0

అవును, ఇది సురక్షితమైనది

నమూనా

పాత అక్షర రూపం

దీర్ఘ ſ → లు

అవును, ఇది సురక్షితమైనది

నమూనా

క్షీణించిన/చదవలేని పదం

"క___న్"

లేదు, పెట్టాలి [?]

తప్పనిసరి

సరైన పేరు/స్థలం పేరు

"కాన్స్టాంటినియే"

జాగ్రత్తగా

తప్పనిసరి

సంఖ్య/తేదీ

"1867" vs "1857"

ప్రమాదకరం

తప్పనిసరి

పేజీ లేఅవుట్ (కాలమ్/ఫుట్‌నోట్)

మిశ్రమ ప్రవాహం

పాక్షికంగా

తప్పనిసరి

చిత్రాన్ని ఒక వాక్యంలో సంగ్రహించేందుకు: AI విశ్వసనీయంగా సాధారణ అక్షర దోషాలను శుభ్రపరుస్తుంది; కానీ ప్రత్యేక పేర్లు, సంఖ్యలు, తేదీలు మరియు చదవలేని ప్రదేశాలకు మానవ కళ్ళు అవసరం.

మూడు చిన్న కేసులు

కేసు 1 — వార్తాపత్రిక ఆర్కైవ్‌లు శోధించదగినవిగా మారాయి. ఒక యూనివర్సిటీ లైబ్రరీ 1930ల నుండి 12,000 పేజీల స్థానిక వార్తాపత్రికలను డిజిటలైజ్ చేసింది. ముడి OCR ఖచ్చితత్వం 82%గా అంచనా వేయబడింది (ప్రతి 100 అక్షరాలలో 18 తప్పులు). వార్తాపత్రిక భాష-తగిన నిఘంటువు మరియు సందర్భంతో AI-ఆధారిత దిద్దుబాటు ఖచ్చితత్వాన్ని 96%కి పెంచింది. మిగిలిన లోపాల కోసం, పూర్తి టెక్స్ట్ కాకుండా నమూనా తనిఖీ నిర్వహించబడింది; సేకరణ 3 వారాల్లో శోధించదగినదిగా మారింది.

కేసు 2 — AI “సరిదిద్దబడింది” మరియు వక్రీకరించిన చరిత్ర. ఆర్కైవిస్ట్ OCR ప్రింట్‌అవుట్‌లో AI "1863" తేదీని సరిదిద్దారు. AI సందర్భానుసారంగా మరొక ఈవెంట్‌ను చూడటం ద్వారా తేదీని "1868"కి "సరిదిద్దింది" — పత్రం 1863 అని స్పష్టంగా పేర్కొన్నప్పటికీ. ఆర్కైవిస్ట్ అసలు చిత్రాన్ని చూడకపోతే, కేటలాగ్ తప్పు తేదీతో నమోదు చేయబడి ఉండేది. పాఠం: సంఖ్యలు మరియు తేదీలు ఎప్పటికీ AIకి వదిలివేయబడవు, అవి చిత్రంతో ధృవీకరించబడతాయి.

కేస్ 3 — రెండు కాలమ్ పేజీ గందరగోళంగా ఉంది. 19వ శతాబ్దపు ఇయర్‌బుక్‌లోని రెండు నిలువు వరుసల పేజీలు OCRలో ఒకే స్ట్రీమ్‌లో మిళితం చేయబడ్డాయి మరియు వాక్యాలు ఒకదానితో ఒకటి ముడిపడి ఉన్నాయి. ముడి అవుట్‌పుట్ చదవలేకపోయింది. నేను మొదట పేజీ లేఅవుట్‌ను ప్రాంతాలుగా (విభజన) విభజించి, ప్రతి నిలువు వరుసను విడిగా ప్రాసెస్ చేసినప్పుడు వచనం మెరుగుపడింది. పాఠం: సంక్లిష్టమైన పేజీ లేఅవుట్‌లో, మొదట నిర్మాణం, రెండవ టెక్స్ట్.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) సురక్షితమైన OCR దిద్దుబాటు:

దిగువన చారిత్రక పత్రం యొక్క ముడి OCR అవుట్‌పుట్ ఉంది. మీ పని స్పష్టమైన ఆప్టికల్ రికగ్నిషన్ లోపాలను మాత్రమే సరిచేయడం (ఉదా. rn→m,1→l, 0→O, పొడవైన ſ→s). నియమాలు: (1) టెక్స్ట్ యొక్క అర్థాన్ని వివరించండి. (2) చదవలేని/అస్పష్టమైన పదాలను సరిదిద్దండి, అలాగే వదిలి [?]తో గుర్తు పెట్టండి. (3) వాక్యాలను జోడించడం, తీసివేయడం లేదా పూర్తి చేయడం లేదు. (4) సంఖ్యలు మరియు తేదీలను మార్చండి; అనుమానం ఉంటే [సంఖ్య?] గుర్తు పెట్టండి. రా OCR: [ఇక్కడ]

2) OCR నాణ్యత నివేదిక:

దిగువ OCR అవుట్‌పుట్‌ను పరిశీలించి, నాణ్యమైన నివేదికను రూపొందించండి: (1) సాధ్యమైన గుర్తింపు లోపాలతో పదాలను జాబితా చేయండి, (2) చదవలేని/అస్పష్టంగా కనిపించే ప్రాంతాలను గుర్తించండి, (3) మానవ తనిఖీ అవసరమయ్యే నిర్దిష్ట పేర్లు, తేదీలు మరియు సంఖ్యలను జాబితా చేయండి. సరి చేయవద్దు; చెక్‌లిస్ట్‌ని మాత్రమే రూపొందించండి. వచనం: [ఇక్కడ]

3) కాలమ్/స్ట్రక్చర్ పార్సింగ్ సహాయం:

దిగువ OCR వచనం రెండు నిలువు వరుసల పేజీ నుండి వచ్చినందున, ప్రవాహం గందరగోళంగా ఉండవచ్చు. వచనాన్ని తార్కిక పేరాగ్రాఫ్‌లుగా మార్చండి కానీ ఏ పదాలను మార్చవద్దు, జోడించవద్దు లేదా తొలగించవద్దు. క్రమాన్ని సరిచేయండి. మీకు ఖచ్చితంగా తెలియని క్రమాన్ని [ఆర్డర్?]తో గుర్తు పెట్టండి. వచనం: [ఇక్కడ]

4) ప్రామాణిక భాషకు సాధారణీకరణ (ఐచ్ఛికం, ప్రత్యేక లేయర్):

దిగువ సరిదిద్దబడిన చారిత్రక వచనం పైన, ప్రత్యేక కాలమ్‌లో నేటి స్పెల్లింగ్‌లో సరళీకృత పఠన సంస్కరణను రూపొందించండి. అసలు వచనాన్ని ఎప్పుడూ మార్చవద్దు; సరళీకరణ ప్రత్యేక పొరగా ఉండనివ్వండి. అర్థాన్ని జోడించకుండా స్పెల్లింగ్/ఉచ్చారణను నవీకరించండి. అసలు: [ఇక్కడ]

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనం:

ఈ OCR వచనాన్ని సరిదిద్దండి మరియు అందంగా చేయండి.

"బ్యూటిఫై" AIని వచనాన్ని తిరిగి వ్రాయడానికి, లోపాలను రూపొందించడానికి మరియు కంటెంట్‌ను అర్థం చేసుకోవడానికి అనుమతిస్తుంది; విధేయతను విచ్ఛిన్నం చేస్తుంది.

బలమైన:

ఈ ముడి OCR అవుట్‌పుట్‌లో కేవలం ఆప్టికల్ రికగ్నిషన్ లోపాలను మాత్రమే పరిష్కరించండి. అర్థాన్ని అన్వయించవద్దు, పదాలను జోడించవద్దు/తొలగించవద్దు, చదవలేని భాగాలను [?]తో వదిలివేయవద్దు, సంఖ్యలు మరియు తేదీలను మార్చవద్దు. మీరు చేసే ప్రతి దిద్దుబాటును "ఒరిజినల్ → దిద్దుబాటు" ఫార్మాట్‌లో ప్రత్యేక జాబితాలో చూపండి, తద్వారా నేను దానిని ధృవీకరించగలను. వచనం: [ఇక్కడ]

వ్యత్యాసం: పరిమిత విధి, కల్పనపై నిషేధం, సందిగ్ధతను గుర్తించడం మరియు దిద్దుబాటుల యొక్క గుర్తించదగిన జాబితా అవుట్‌పుట్‌ను ఆడిట్ చేయగలిగేలా చేస్తాయి.

సాధారణ తప్పులు

  • తక్కువ రిజల్యూషన్‌తో స్కాన్ చేస్తోంది. చాలా OCR లోపాలు చెడ్డ చిత్రాల వల్ల సంభవిస్తాయి; నాణ్యమైన స్కానింగ్ చౌకైన పెట్టుబడి.
  • AIని "అందంగా చేయండి" అని పిలవడం. ఇది విశ్వసనీయత కంటే పటిమను ఉత్పత్తి చేస్తుంది; పత్రం తిరిగి వ్రాయబడింది.
  • సంఖ్యలు మరియు తేదీలను AIకి వదిలివేయడం. సందర్భం నుండి "సరిదిద్దినప్పుడు" ఇవి నిశ్శబ్దంగా పాడైపోతాయి; చిత్రం ద్వారా ధృవీకరించబడాలి.
  • చదవలేని ప్రాంతాన్ని అంచనాతో నింపడం. ఇది అనిశ్చితి [?] ద్వారా రక్షించబడాలి, రూపొందించబడలేదు.
  • నమూనాకు బదులుగా అస్సలు నియంత్రించడం లేదు. 96% ఖచ్చితత్వం అంటే 12,000 పేజీలలో వేలాది లోపాలు ఉన్నాయి; క్లిష్టమైన ప్రాంతాలు స్కాన్ చేయబడతాయి.

సారాంశంలో

OCR ప్రింటెడ్ హిస్టారికల్ డాక్యుమెంట్‌లను శోధించదగిన టెక్స్ట్‌గా మార్చడం ద్వారా పరిశోధకులకు ఆర్కైవ్‌లను తెరుస్తుంది. AI అనేది సందర్భానుసారంగా ముడి OCR అవుట్‌పుట్‌లో అక్షర దోషాలను సరిదిద్దడంలో శక్తివంతమైన సహాయం; కానీ మీరు సవరించడం మరియు తిరిగి వ్రాయడం మధ్య గీతను గీయాలి. అధిక-నాణ్యత స్కానింగ్, సురక్షితమైన దిద్దుబాటు సూచన, [?]తో సందిగ్ధతను కాపాడుకోవడం మరియు పేర్లు/తేదీలు/సంఖ్యల యొక్క మానవ-కంటి ధృవీకరణ డిజిటలైజేషన్‌ను వేగంగా మరియు నమ్మదగినదిగా చేస్తుంది. AI వచనాన్ని శుభ్రపరుస్తుంది; మీరు విశ్వసనీయతకు సంరక్షకులు.

అప్లికేషన్ టాస్క్

ముద్రించిన చారిత్రక పత్రాన్ని (పాత వార్తాపత్రిక, అధికారిక లేఖ, పుస్తక పేజీ) స్కాన్ చేయండి లేదా OCR ప్రింటవుట్ తీసుకోండి. “సురక్షిత OCR దిద్దుబాటు” టెంప్లేట్‌తో వచనాన్ని సరిదిద్దండి మరియు “ఒరిజినల్ → దిద్దుబాటు” జాబితా ద్వారా సవరణలను అభ్యర్థించండి. ఆపై, "OCR నాణ్యత నివేదిక"తో మానవ నియంత్రణ అవసరమయ్యే ప్రాంతాలను తీసివేయండి. జాబితాలోని ప్రతి తేదీ మరియు సరైన పేరును వాస్తవ చిత్రంతో సరిపోల్చండి; ఎన్ని తప్పుగా "సరిదిద్దబడ్డాయి" అని గమనించండి.

చెక్లిస్ట్

  • [ ] నేను పత్రాన్ని కనీసం 300 DPI మరియు మంచి కాంట్రాస్ట్‌తో స్కాన్ చేసాను.
  • [ ] నేను ఆప్టికల్ ఎర్రర్ దిద్దుబాటు కోసం మాత్రమే AIని అడిగాను, తిరిగి వ్రాయడం కాదు.
  • [?] చదవలేని భాగాలను నేను రక్షించాను.
  • [ ] నేను చిత్రంతో అన్ని సంఖ్యలు, తేదీలు మరియు సరైన పేర్లను ధృవీకరించాను.
  • [ ] నేను క్లిష్టమైన ప్రాంతాల్లో ఒక నమూనా లేదా పూర్తి తనిఖీ చేసాను.