ஆதாயங்கள்:
- டிஜிட்டல் மயமாக்கல் மற்றும் OCR பணிப்பாய்வு (ஸ்கேனிங், முன் செயலாக்கம், அங்கீகாரம், திருத்தம், சரிபார்ப்பு) படிப்படியாக அமைக்கும் திறன்
- AI ஐப் பயன்படுத்தி OCR பிழைகளை சூழலுடன் சரிசெய்து, திருத்தம் மற்றும் வரியை மீண்டும் எழுதுதல் மற்றும் தெளிவின்மையைக் குறிப்பது [?]
- எண்கள், தேதிகள் மற்றும் சரியான பெயர்கள் ஏன் பார்வைக்கு சரிபார்க்கப்பட வேண்டும் மற்றும் தரக் கட்டுப்பாட்டின் பங்கைப் புரிந்து கொள்ளுங்கள்.
ஒரு காப்பகம் அல்லது நூலகத்தின் இயற்பியல் அலமாரிகளில் உள்ள மில்லியன் கணக்கான பக்கங்கள், அவை டிஜிட்டல் மயமாக்கப்பட்டு தேடக்கூடியதாக மாறும்போது மட்டுமே ஆராய்ச்சியாளருக்கு உண்மையிலேயே திறக்கப்படும். டிஜிட்டல் மயமாக்கல் என்பது ஒரு இயற்பியல் ஆவணத்தை ஸ்கேன் அல்லது புகைப்படம் எடுப்பதன் மூலம் டிஜிட்டல் படமாக மாற்றுவதாகும். ஆனால் ஒரு பக்கத்தின் புகைப்படம் இன்னும் "உரை" ஆகவில்லை; கம்ப்யூட்டருக்கு இது இன்னும் ஒரு படம், நீங்கள் அதில் தேட முடியாது. இங்குதான் OCR செயல்பாட்டுக்கு வருகிறது.
OCR (Optical Character Recognition) என்பது ஒரு ஆவணப் படத்தில் அச்சிடப்பட்ட எழுத்துக்களை அங்கீகரித்து அவற்றை இயந்திரத்தில் படிக்கக்கூடிய, தேடக்கூடிய உரையாக மாற்றும் தொழில்நுட்பமாகும். இந்த யூனிட்டில், OCR மூலம் வரலாற்று அச்சிடப்பட்ட ஆவணங்களை டிஜிட்டல் மயமாக்குவது எப்படி, இந்த செயல்பாட்டில் AI எவ்வாறு OCR பிழைகளை சரிசெய்கிறது, மற்றும் மனிதனின் கண் அவசியம் எங்கே என்பதை நீங்கள் கற்றுக் கொள்வீர்கள். (கையால் எழுதப்பட்ட உரைகளுக்கு வேறு தொழில்நுட்பம் தேவை; அதை அடுத்த அலகில் விவரிப்போம்.)
டிஜிட்டல் மயமாக்கல் பணிப்பாய்வு: படிப்படியாக
1. தயாரிப்பு மற்றும் திரையிடல். ஆவணத்தை மிக உயர்ந்த தரத்தில் ஸ்கேன் செய்யவும். வரலாற்று ஆராய்ச்சிக்கான பொதுவான விதியானது குறைந்தபட்சம் 300-400 DPI (ஒரு அங்குலத்திற்கு புள்ளிகள்) தீர்மானம் ஆகும். குறைந்த தெளிவுத்திறன் அடுத்த OCR கட்டத்தில் பிழை விகிதத்தை உயர்த்துகிறது.
2. பட முன் செயலாக்கம். OCR க்கு முன் படத்தை மேம்படுத்துவது வெற்றியை பெரிதும் அதிகரிக்கிறது: ஸ்கேன் செய்யப்பட்ட பக்கத்தை டெஸ்கேயிங் செய்தல், கறைகளை நீக்குதல், மாறுபாட்டை அதிகரித்தல், கருப்பு மற்றும் வெள்ளைக்கு மாற்றுதல். நவீன AI- அடிப்படையிலான கருவிகள் இந்த படிநிலையை தானியங்குபடுத்த முடியும்.
3. OCR விண்ணப்பம். நீங்கள் படத்தை OCR இன்ஜினுக்கு ஊட்டுகிறீர்கள்; இயந்திரம் எழுத்துக்களை அடையாளம் கண்டு உரையை உருவாக்குகிறது. வெளியீடு பொதுவாக இரண்டு அடுக்குகளைக் கொண்டிருக்கும்: காணக்கூடிய ஆவணப் படம் மற்றும் கீழே "தேடக்கூடிய மறைக்கப்பட்ட உரை அடுக்கு".
4. திருத்தம் (பிந்தைய திருத்தம்). மூல OCR வெளியீடு ஒருபோதும் சரியானதாக இருக்காது. பழைய எழுத்துருக்கள், மஞ்சள் நிற காகிதம், மை தடவுதல் மற்றும் ஸ்கேனிங் பிழைகள் காரணமாக எழுத்துகள் தவறாகப் படிக்கப்படுகின்றன. இங்குதான் AI ஒரு சக்திவாய்ந்த உதவியாளராக உள்ளது: இது சூழலைப் பயன்படுத்தி OCR பிழைகளை பரிந்துரைக்கிறது மற்றும் சரிசெய்கிறது.
5. சரிபார்ப்பு மற்றும் தரக் கட்டுப்பாடு. திருத்தப்பட்ட உரை மனிதனால் மாதிரி அடிப்படையில் அல்லது முழுமையாக சரிபார்க்கப்படுகிறது. குறிப்பாக முக்கியமான பகுதிகளான பெயர்கள், தேதிகள் மற்றும் எண்கள் பார்வைக்கு சரிபார்க்கப்பட வேண்டும்.
OCR ஏன் தவறு செய்கிறது, AI எவ்வாறு உதவுகிறது
வரலாற்று ஆவணங்களில் OCR க்கு சவால் விடும் வழக்கமான சிக்கல்கள்: பழைய மற்றும் ஆடம்பரமான எழுத்துருக்கள், நீண்ட "s" (ſ), இரண்டு நெடுவரிசை பக்க அமைப்பு, அடிக்குறிப்புகள், கையால் எழுதப்பட்ட செருகல்கள், முத்திரைகள் மற்றும் மங்கலான மை போன்ற வழக்கற்றுப் போன எழுத்து வடிவங்கள். OCR இன்ஜின் எழுத்துக்களை ஒவ்வொன்றாக "பார்ப்பதால்", அது பைனரி "rn" ஐ "m" என்றும், "l" எழுத்தை "1" என்றும், "O" என்ற எழுத்தை "0" என்றும் அடிக்கடி குழப்புகிறது.
AI மொழி மாதிரிகள் இங்கே வேறுபட்ட சக்தியை வழங்குகின்றன: அவை சூழலைப் புரிந்துகொள்கின்றன. ஒரு OCR இன்ஜின் "1stanbu1" என்று எழுதினால், அது "Istanbul" ஆக இருக்க வேண்டும் என்று AI ஆல் ஊகிக்க முடியும். ஆனால் இங்கே ஒரு பெரிய ஆபத்து உள்ளது: "சரிசெய்யும்" போது AI உரையையும் மாற்றலாம். அவர் "நான் சரிசெய்தேன்" இல்லாத வார்த்தையைச் சேர்க்கலாம் அல்லது தெளிவற்ற இடத்தில் தனது சொந்த யூகத்துடன் நிரப்பலாம். இது டிரான்ஸ்கிரிப்ஷனின் நம்பகத்தன்மையை சீர்குலைக்கிறது.
எச்சரிக்கை: OCR திருத்தத்தில் உள்ள தங்க விதி இதுதான்: AI வெளிப்படையான அங்கீகார பிழைகளை மட்டுமே சரிசெய்ய வேண்டும், உரையின் உள்ளடக்கத்தை விளக்கவோ அல்லது கூடுதலாகவோ செய்யக்கூடாது. "1stanbu1 → இஸ்தான்புல்" முறையானது; படிக்க முடியாத வார்த்தையை யூகங்களால் நிரப்புவது அல்ல. நிச்சயமற்ற இடங்கள் [?] என்று குறிக்கப்பட வேண்டும் மற்றும் உருவாக்கப்படக்கூடாது.
OCR பிழை வகைகள் மற்றும் அட்டவணையுடன் அணுகுமுறை
பிழை வகை
உதாரணம்
AI அதை சரிசெய்ய முடியுமா?
மனித கட்டுப்பாடு
பாத்திரம் கலவை
rn↔m, l↔1, O↔0
ஆம், பாதுகாப்பானது
மாதிரி
பழைய எழுத்து வடிவம்
நீண்ட ſ → கள்
ஆம், பாதுகாப்பானது
மாதிரி
மங்கிப்போன/படிக்க முடியாத வார்த்தை
"க___ன்"
இல்லை, போட வேண்டும் [?]
கட்டாயம்
சரியான பெயர்/இடப்பெயர்
"கான்ஸ்டான்டினியே"
கவனமாக
கட்டாயம்
எண்/தேதி
"1867" எதிராக "1857"
ஆபத்தானது
கட்டாயம்
பக்க தளவமைப்பு (நெடுவரிசை/அடிக்குறிப்பு)
கலப்பு ஓட்டம்
ஓரளவு
கட்டாயம்
ஒரு வாக்கியத்தில் படத்தைச் சுருக்கமாகக் கூறுவது: சாதாரண எழுத்துப் பிழைகளை AI நம்பகமான முறையில் சுத்தம் செய்கிறது; ஆனால் சிறப்புப் பெயர்கள், எண்கள், தேதிகள் மற்றும் படிக்க முடியாத இடங்களுக்கு மனிதக் கண்கள் தேவை.
மூன்று சிறிய வழக்குகள்
வழக்கு 1 - செய்தித்தாள் காப்பகங்கள் தேடக்கூடியதாக மாறியது. ஒரு பல்கலைக்கழக நூலகம் 1930களில் இருந்து உள்ளூர் செய்தித்தாள்களின் 12,000 பக்கங்களை டிஜிட்டல் மயமாக்கியுள்ளது. மூல OCR துல்லியம் 82% என மதிப்பிடப்பட்டுள்ளது (ஒவ்வொரு 100 எழுத்துகளில் 18 எழுத்துகளும் தவறானவை). AI-அடிப்படையிலான திருத்தம் செய்தித்தாள் மொழி-பொருத்தமான அகராதி மற்றும் சூழலுடன் 96% துல்லியத்தை அதிகரித்தது. மீதமுள்ள பிழைகளுக்கு, முழு உரைக்கு பதிலாக மாதிரி சரிபார்ப்பு செய்யப்பட்டது; சேகரிப்பு 3 வாரங்களில் தேடக்கூடியதாக மாறியது.
வழக்கு 2 - AI "சரிசெய்யப்பட்டது" மற்றும் சிதைந்த வரலாறு. OCR அச்சுப்பொறியில் "1863" என்ற தேதியை AI சரிசெய்துள்ளார். AI ஆனது சூழலில் மற்றொரு நிகழ்வைப் பார்த்து "1868" என்று தேதியை "திருத்தியது" - ஆவணம் 1863 என்று தெளிவாகக் கூறியிருந்தாலும். காப்பகக்காரர் அசல் படத்தைப் பார்க்காமல் இருந்திருந்தால், அட்டவணை தவறான தேதியுடன் உள்ளிடப்பட்டிருக்கும். பாடம்: எண்கள் மற்றும் தேதிகள் AIக்கு விடப்படாது, அவை படத்துடன் சரிபார்க்கப்படும்.
வழக்கு 3 - இரண்டு நெடுவரிசைப் பக்கம் குழப்பம். 19 ஆம் நூற்றாண்டின் ஆண்டு புத்தகத்தின் இரண்டு நெடுவரிசைப் பக்கங்கள் OCR இல் ஒரே ஸ்ட்ரீமில் கலக்கப்பட்டு வாக்கியங்கள் பின்னிப்பிணைந்தன. மூல வெளியீடு படிக்க முடியாததாக இருந்தது. நான் முதலில் பக்க தளவமைப்பை பகுதிகளாக (பிரிவு) பிரித்து ஒவ்வொரு நெடுவரிசையையும் தனித்தனியாக செயலாக்கியபோது உரை மேம்பட்டது. பாடம்: சிக்கலான பக்க அமைப்பில், அமைப்பு முதலில், உரை இரண்டாவது.
நகலெடுக்கக்கூடிய நான்கு வார்ப்புருக்கள்
1) பாதுகாப்பான OCR திருத்தம்:
ஒரு வரலாற்று ஆவணத்தின் மூல OCR வெளியீடு கீழே உள்ளது. உங்கள் பணி வெளிப்படையான ஆப்டிகல் அறிதல் பிழைகளை மட்டும் சரிசெய்வதாகும் (எ.கா. rn→m,1→l, 0→O, நீண்ட ſ→s). விதிகள்: (1) உரையின் பொருளை விளக்கவும். (2) படிக்க முடியாத/தெளிவற்ற வார்த்தைகளைச் சரிசெய்து, அப்படியே விட்டுவிட்டு [?] என்று குறிக்கவும். (3) வாக்கியங்களைச் சேர்ப்பது, நீக்குவது அல்லது நிறைவு செய்வது இல்லை. (4) எண்கள் மற்றும் தேதிகளை மாற்றவும்; சந்தேகம் இருந்தால் [எண்?] குறிக்கவும். ரா OCR: [இங்கே]
2) OCR தர அறிக்கை:
கீழே உள்ள OCR வெளியீட்டை ஆராய்ந்து தர அறிக்கையை உருவாக்கவும்: (1) சாத்தியமான அங்கீகார பிழைகள் உள்ள வார்த்தைகளை பட்டியலிடுங்கள், (2) படிக்க முடியாத/தெளிவாகத் தோன்றும் பகுதிகளைக் குறிக்கவும், (3) மனிதர்கள் சரிபார்க்க வேண்டிய குறிப்பிட்ட பெயர்கள், தேதிகள் மற்றும் எண்களைப் பட்டியலிடவும். சரி செய்யாதே; சரிபார்ப்பு பட்டியலை மட்டும் உருவாக்கவும்.உரை: [இங்கே]
3) நெடுவரிசை/கட்டமைப்பு பாகுபடுத்தும் உதவி:
கீழே உள்ள OCR உரை இரண்டு நெடுவரிசைப் பக்கத்திலிருந்து வருவதால், ஓட்டம் குழப்பமாக இருக்கலாம். உரையை தருக்க பத்திகளாக மறுசீரமைக்கவும் ஆனால் எந்த வார்த்தைகளையும் மாற்றவோ, சேர்க்கவோ அல்லது நீக்கவோ வேண்டாம். ஒழுங்கை மட்டும் சரி செய். உங்களுக்கு உறுதியாகத் தெரியாத வரிசையை [ஆர்டர்?] மூலம் குறிக்கவும். உரை: [இங்கே]
4) நிலையான மொழிக்கு இயல்பாக்குதல் (விரும்பினால், தனி அடுக்கு):
இன்றைய எழுத்துப்பிழையில் எளிமைப்படுத்தப்பட்ட வாசிப்பு பதிப்பை, ஒரு தனி நெடுவரிசையில், கீழே சரி செய்யப்பட்ட வரலாற்று உரைக்கு மேலே உருவாக்கவும். அசல் உரையை ஒருபோதும் மாற்ற வேண்டாம்; எளிமைப்படுத்தல் ஒரு தனி அடுக்காக இருக்கட்டும். அர்த்தம் சேர்க்காமல் எழுத்துப்பிழை/உச்சரிப்பை மட்டும் புதுப்பிக்கவும். அசல்: [இங்கே]
பலவீனமான வரியில் / வலுவான வரியில்
பலவீனமான:
இந்த OCR உரையை சரிசெய்து அழகுபடுத்தவும்.
"அழகாடு" என்பது AI ஐ உரையை மீண்டும் எழுதவும், குறைபாடுகளை உருவாக்கவும் மற்றும் உள்ளடக்கத்தை விளக்கவும் அனுமதிக்கிறது; விசுவாசத்தை உடைக்கிறது.
வலுவான:
இந்த மூல OCR வெளியீட்டில் ஆப்டிகல் அறிதல் பிழைகளை மட்டும் சரிசெய்யவும். அர்த்தத்தை விளக்காதீர்கள், வார்த்தைகளைச் சேர்க்கவும்/நீக்கவும், படிக்க முடியாத பகுதிகளை [?] உடன் விடவும், எண்கள் மற்றும் தேதிகளை மாற்றவும். நீங்கள் செய்யும் ஒவ்வொரு திருத்தத்தையும் தனித்தனி பட்டியலில் "அசல் → திருத்தம்" வடிவத்தில் காட்டுங்கள், அதனால் நான் அதை சரிபார்க்க முடியும். உரை: [இங்கே]
வித்தியாசம்: வரம்புக்குட்பட்ட கடமை, புனையப்படுதலுக்கான தடை, தெளிவின்மையைக் குறிப்பது மற்றும் கண்டறியக்கூடிய திருத்தங்களின் பட்டியல் ஆகியவை வெளியீட்டைத் தணிக்கை செய்யக்கூடியதாக ஆக்குகின்றன.
பொதுவான தவறுகள்
- குறைந்த தெளிவுத்திறனில் ஸ்கேன் செய்கிறது. பெரும்பாலான OCR பிழைகள் மோசமான படங்களால் ஏற்படுகின்றன; தரமான ஸ்கேனிங் மலிவான முதலீடு.
- AI ஐ "அழகாடு" என்று அழைப்பது. இது நம்பகத்தன்மையை விட சரளத்தை உருவாக்குகிறது; ஆவணம் மீண்டும் எழுதப்பட்டது.
- எண்கள் மற்றும் தேதிகளை AIக்கு விட்டுவிடுங்கள். சூழலில் இருந்து "திருத்தப்படும்" போது இவை அமைதியாக சிதைந்துவிடும்; படம் மூலம் சரிபார்க்கப்பட வேண்டும்.
- படிக்க முடியாத பகுதியை யூகத்துடன் நிரப்புதல். இது நிச்சயமற்ற [?] மூலம் பாதுகாக்கப்பட வேண்டும், உருவாக்கப்படவில்லை.
- மாதிரிக்கு பதிலாக கட்டுப்படுத்தவே இல்லை. 96% துல்லியம் கூட 12,000 பக்கங்களில் ஆயிரக்கணக்கான பிழைகள்; முக்கியமான பகுதிகள் ஸ்கேன் செய்யப்படுகின்றன.
சுருக்கமாக
அச்சிடப்பட்ட வரலாற்று ஆவணங்களை தேடக்கூடிய உரையாக மாற்றுவதன் மூலம் OCR காப்பகங்களை ஆராய்ச்சியாளர்களுக்கு திறக்கிறது. AI என்பது மூல OCR வெளியீட்டில் உள்ள எழுத்துப் பிழைகளை சூழலுடன் சரிசெய்வதில் ஒரு சக்திவாய்ந்த உதவியாகும்; ஆனால் நீங்கள் திருத்துவதற்கும் மீண்டும் எழுதுவதற்கும் இடையே ஒரு கோட்டை வரைய வேண்டும். உயர்தர ஸ்கேனிங், பாதுகாப்பான திருத்தம் அறிவுறுத்தல், [?] உடன் தெளிவின்மையைப் பாதுகாத்தல் மற்றும் பெயர்கள்/தேதிகள்/எண்களின் மனித கண் சரிபார்ப்பு ஆகியவை டிஜிட்டல் மயமாக்கலை வேகமாகவும் நம்பகமானதாகவும் ஆக்குகின்றன. AI உரையை சுத்தம் செய்கிறது; நீங்கள் விசுவாசத்தின் பாதுகாவலர்.
விண்ணப்ப பணி
அச்சிடப்பட்ட வரலாற்று ஆவணத்தை (பழைய செய்தித்தாள், அதிகாரப்பூர்வ கடிதம், புத்தகப் பக்கம்) ஸ்கேன் செய்யவும் அல்லது OCR பிரிண்ட்அவுட்டை எடுக்கவும். "பாதுகாப்பான OCR திருத்தம்" டெம்ப்ளேட்டுடன் உரையை சரிசெய்து, "அசல் → திருத்தம்" பட்டியல் மூலம் திருத்தங்களைக் கோரவும். பின்னர், "OCR தர அறிக்கை" மூலம் மனிதக் கட்டுப்பாடு தேவைப்படும் பகுதிகளை அகற்றவும். பட்டியலில் உள்ள ஒவ்வொரு தேதியையும் சரியான பெயரையும் உண்மையான படத்துடன் ஒப்பிடுக; எத்தனை தவறாக "திருத்தப்பட்டது" என்பதைக் கவனியுங்கள்.
சரிபார்ப்பு பட்டியல்
- [ ] நான் ஆவணத்தை குறைந்தது 300 DPI மற்றும் நல்ல மாறுபாடுடன் ஸ்கேன் செய்தேன்.
- [ ] நான் AI யிடம் ஆப்டிகல் பிழை திருத்தத்தை மட்டுமே கேட்டேன், மீண்டும் எழுதவில்லை.
- [?] படிக்க முடியாத பகுதிகளை நான் பாதுகாத்தேன்.
- [ ] படத்துடன் அனைத்து எண்கள், தேதிகள் மற்றும் சரியான பெயர்களை சரிபார்த்தேன்.
- [ ] நான் முக்கியமான பகுதிகளில் ஒரு மாதிரி அல்லது முழு சோதனை செய்தேன்.