Табыстар:
- Цифрландыру және OCR жұмыс процесін кезең-кезеңмен орнату мүмкіндігі (сканерлеу, алдын ала өңдеу, тану, түзету, тексеру)
- Түзету және қайта жазу жолын сақтай отырып және [?] арқылы белгісіздікті белгілей отырып, мәтінмәнмен OCR қателерін түзету үшін AI пайдалану мүмкіндігі.
- Неліктен сандарды, күндерді және тиісті атауларды көзбен тексеру керек екенін және сапаны бақылау рөлін түсініңіз.
Мұрағаттың немесе кітапхананың физикалық сөрелеріндегі миллиондаған беттер цифрланған және іздеуге болатын кезде ғана зерттеушіге шынымен ашылады. Цифрландыру - бұл сканерлеу немесе суретке түсіру арқылы физикалық құжатты цифрлық кескінге түрлендіру. Бірақ беттің фотосуреті әлі «мәтін» емес; Компьютер үшін бұл әлі де сурет, оны іздеу мүмкін емес. Бұл жерде OCR ойнайды.
OCR (Optical Character Recognition) – құжат кескініндегі басып шығарылған әріптерді танитын және оларды машина оқылатын, іздеуге болатын мәтінге түрлендіретін технология. Бұл бөлімде сіз тарихи басып шығарылған құжаттарды OCR көмегімен қалай цифрлау керектігін, AI осы процесте OCR қателерін түзетуге қалай көмектесетінін және адам көзі қай жерде маңызды екенін үйренесіз. (Қолжазба мәтіндер басқа технологияны қажет етеді; біз оны келесі бөлімде қарастырамыз.)
Цифрландыру жұмыс барысы: кезең-кезеңімен
1. Дайындық және скрининг. Құжатты мүмкіндігінше жоғары сапамен сканерлеңіз. Тарихи зерттеулердің жалпы ережесі кем дегенде 300-400 DPI (дюймдегі нүктелер) ажыратымдылығы болып табылады. Төмен ажыратымдылық келесі OCR сатысында қателік жылдамдығын арттырады.
2. Кескінді алдын ала өңдеу. OCR алдында кескінді жақсарту жетістікті айтарлықтай арттырады: сканерленген беттің бұрмалануын жою, дақтарды кетіру, контрастты арттыру, ақ-қара түске түрлендіру. Қазіргі заманғы AI негізіндегі құралдар бұл қадамды автоматтандыруы мүмкін.
3. OCR қолданбасы. Сіз кескінді OCR қозғалтқышына бересіз; Қозғалтқыш әріптерді таниды және мәтін шығарады. Шығару әдетте екі қабаттан тұрады: көрінетін құжат кескіні және астындағы «ізделетін жасырын мәтін қабаты».
4. Түзету (түзетуден кейінгі). Raw OCR шығысы ешқашан мінсіз болмайды. Таңбалар ескі қаріптерге, сарғайған қағазға, сия жағылуына және сканерлеу қателеріне байланысты қате оқылады. Дәл осы жерде AI күшті көмекші болып табылады: ол контекст арқылы OCR қателерін ұсынады және түзетеді.
5. Тексеру және сапаны бақылау. Түзетілген мәтінді адам үлгі негізінде немесе толығымен тексереді. Атаулар, күндер және нөмірлер сияқты әсіресе маңызды аймақтар көзбен тексерілуі керек.
Неліктен OCR қателеседі, AI қалай көмектеседі
Тарихи құжаттарда OCR-ге қарсы болатын типтік мәселелер: ескі және сәнді қаріптер, ұзын «s» (ſ) сияқты ескірген әріптік пішіндер, екі бағанды бет орналасуы, түсіндірмелер, қолжазба кірістірулер, мөрлер және бозарған сия. OCR қозғалтқышы әріптерді бір-бірлеп «көретіндіктен» ол екілік «rn» әрпін «m», «l» әрпін «1» санымен және «O» әрпін «0» деп шатастырады.
AI тіл үлгілері мұнда басқа күш ұсынады: олар контекстті түсінеді. Егер OCR қозғалтқышы «1stanbu1» деп жазса, AI контекстен оның «Стамбул» болуы керек деген қорытындыға келуі мүмкін. Бірақ бұл жерде үлкен қауіп бар: «түзету» кезінде AI мәтінді де өзгерте алады. Ол жоқ сөзді «түзетдім» деп қосып немесе түсініксіз жерді өз болжамымен толтыра алады. Бұл транскрипцияның дұрыстығын бұзады.
Абайлаңыз: OCR түзетуіндегі алтын ереже мынада: AI тек айқын тану қателерін түзетуі керек, мәтін мазмұнын түсіндірмеуі немесе толықтырмауы керек. "1stanbu1 → Стамбул" заңды; Бұл оқылмайтын сөзді болжаммен толтыру емес. Белгісіз жерлерді [?] белгісімен белгілеу керек және оларды толтырмау керек.
OCR қателерінің түрлері және кестемен тәсіл
Қате түрі
мысал
AI оны түзете ала ма?
адам бақылауы
кейіпкерлердің араласуы
rn↔m, l↔1, O↔0
Иә, қауіпсіз
үлгі
ескі хат формасы
ұзақ ſ → с
Иә, қауіпсіз
үлгі
Өңделген/оқылмаған сөз
"ка___н"
Жоқ, қою керек [?]
міндетті
тиісті атау/жер аты
«Константиния»
сақ
міндетті
Нөмір/күн
«1867» қарсы «1857»
тәуекелді
міндетті
Беттің орналасуы (баған/ескерту)
аралас ағын
ішінара
міндетті
Суретті бір сөйлеммен қорытындылау үшін: AI қарапайым кейіпкер қателерін сенімді түрде тазартады; Бірақ адамның көзі арнайы атаулар, сандар, күндер және оқылмайтын орындар үшін қажет.
үш шағын іс
1-жағдай — Газет мұрағаты іздеуге болатын болды. Университет кітапханасы 1930 жылдардағы жергілікті газеттердің 12 000 бетін цифрлық форматқа көшірді. Raw OCR дәлдігі шамамен 82% құрады (әр 100 таңбаның 18-і дұрыс емес). AI негізіндегі түзету газет тіліне сәйкес сөздік пен контекст арқылы дәлдікті 96%-ға дейін арттырды. Қалған қателер үшін толық мәтіннен гөрі үлгі тексеру орындалды; Жинақ 3 аптадан кейін іздеуге жарамды болды.
2-жағдай — AI «түзетілген» және бұрмаланған тарих. Мұрағатшы AI OCR басып шығаруда «1863» күнін түзетті. AI мәтінмәндегі басқа оқиғаны қарастыру арқылы күнді «1868» деп «түзетеді», тіпті құжатта 1863 жылы деп анық көрсетілген. Егер мұрағатшы түпнұсқа суретке қарамаса, каталог қате күнмен енгізілген болар еді. Сабақ: сандар мен күндер ешқашан АИ-ге қалдырылмайды, олар суретпен тексеріледі.
3-жағдай — Шатастырылған екі бағанды бет. 19-ғасырдың жылнамасының екі бағаналы беттері OCR-де бір ағымға араласып, сөйлемдер бір-бірімен тоғысқан. Шикізатты оқу мүмкін болмады. Бет макетін аймақтарға (сегментация) бірінші рет бөліп, әр бағанды бөлек өңдеген кезде мәтін жақсарды. Сабақ: күрделі бет макетінде бірінші құрылым, екінші мәтін.
Көшірілетін төрт үлгі
1) Қауіпсіз OCR түзетуі:
Төменде тарихи құжаттың өңделмеген OCR шығысы берілген. Сіздің міндетіңіз ТЕК айқын оптикалық тану қателерін түзету (мысалы: rn→m,1→l, 0→O, long ſ→s). Ережелер: (1) Мәтіннің мағынасын түсіндіріңіз. (2) Оқылмаған/көп мағыналы сөздерді түзетіп, сол күйінде қалдырыңыз және [?] белгісін қойыңыз. (3) Сөйлемдерді қосуға, алып тастауға немесе аяқтауға ЖОҚ. (4) Нөмірлер мен күндерді ӨЗГЕРТУ; Егер күмәніңіз болса [сан?] белгілеңіз. Raw OCR: [мұнда]
2) OCR сапасы туралы есеп:
Төмендегі OCR шығысын қарап шығыңыз және сапалы есеп жасаңыз: (1) ықтимал тану қателері бар сөздерді тізімдеңіз, (2) оқылмайтын/түсініксіз болып көрінетін аумақтарды белгілеңіз, (3) адам тексеруін қажет ететін нақты атауларды, күндерді және сандарды тізімдеңіз. түзетпеңіз; Тек бақылау парағын жасау. Мәтін: [мұнда]
3) Бағанды/құрылымды талдау анықтамасы:
Төмендегі OCR мәтіні екі бағанды беттен шыққандықтан, ағын шатастырылуы мүмкін. Мәтінді логикалық абзацтарға қайта реттеңіз, БІРАҚ ешбір сөзді өзгертпеңіз, қоспаңыз немесе жоймаңыз. Тек ретті түзетіңіз. Сіз сенімді емес тапсырысты [заказ?] арқылы белгілеңіз. Мәтін: [мұнда]
4) Стандартты тілге нормалау (міндетті емес, бөлек қабат):
Төмендегі түзетілген тарихи мәтіннің ҮСТІНДЕ, жеке бағанда бүгінгі емле бойынша жеңілдетілген оқу нұсқасын жасаңыз. Түпнұсқа мәтінді ЕШҚАШАН өзгертпеңіз; Жеңілдету бөлек қабат болсын. Емлені/айтылуын мағынасын қоспай жаңартыңыз. Түпнұсқа: [мұнда]
Әлсіз шақыру / Күшті шақыру
Әлсіз:
Осы OCR мәтінін түзетіңіз және әдемілендіріңіз.
«Әдемілеу» AI-ға мәтінді қайта жазуға, кемшіліктерді жоюға және мазмұнды түсіндіруге мүмкіндік береді; адалдықты бұзады.
Күшті:
Осы өңделмеген OCR шығысындағы ТЕК оптикалық тану қателерін түзетіңіз. Мағынаны түсіндірмеңіз, сөздерді қоспаңыз/өшірмеңіз, оқылмайтын бөліктерін [?] белгісімен қалдырмаңыз, сандар мен күндерді өзгертпеңіз. Мен оны тексере алуым үшін сіз жасаған әрбір түзетуді «түпнұсқа → түзету» пішімінде бөлек тізімде көрсетіңіз. Мәтін: [мұнда]
Айырмашылық: шектеулі баж, өндіруге тыйым салу, таңбалаудың анық еместігі және түзетулердің қадағаланатын тізімі шығысты тексерілетін етеді.
Жалпы қателер
- Төмен ажыратымдылықта сканерлеу. OCR қателерінің көпшілігі нашар кескіндерден туындайды; Сапалы сканерлеу - ең арзан инвестиция.
- AI «әдемі ету» деп атайды. Бұл адалдықты емес, еркін сөйлеуді тудырады; Құжат қайта жазылады.
- Сандар мен күндерді АИ-ге қалдыру. Бұл контекстен «түзетілгенде» үнсіз бұзылады; сурет арқылы расталуы керек.
- Оқымайтын жерді болжаммен толтыру. Ол белгісіздікпен [?] қорғалуы керек, ойлап табылмайды.
- Сынама алудың орнына мүлде бақылау емес. Тіпті 96% дәлдік 12 000 бетте мыңдаған қателерді білдіреді; маңызды аймақтар сканерленеді.
Қысқаша айтқанда
OCR басып шығарылған тарихи құжаттарды іздеуге болатын мәтінге түрлендіру арқылы зерттеушілерге мұрағатты ашады. AI мәтінмәнмен өңделмеген OCR шығысындағы таңба қателерін түзетуге арналған қуатты көмекші құрал; Бірақ өңдеу мен қайта жазудың арасындағы сызықты сызу керек. Жоғары сапалы сканерлеу, қауіпсіз түзету нұсқауы, [?] көмегімен белгісіздікті сақтау және атауларды/күндерді/сандарды адам көзімен тексеру цифрландыруды жылдам әрі сенімді етеді. AI мәтінді тазартады; Сен адалдықтың сақшысысың.
Қолданбалы тапсырма
Басып шығарылған тарихи құжатты (ескі газет, ресми хат, кітап беті) сканерлеңіз немесе OCR басып шығарыңыз. Мәтінді «Қауіпсіз OCR түзету» үлгісімен түзетіңіз және «түпнұсқа → түзету» тізімі арқылы түзетулерді сұраңыз. Содан кейін "OCR сапа есебі" арқылы адам бақылауын қажет ететін аймақтарды алып тастаңыз. Тізімдегі әрбір күн мен нақты атауды нақты суретпен салыстырыңыз; Қаншалықты қате «түзетілгенін» ескеріңіз.
бақылау парағы
- [ ] Мен құжатты кемінде 300 DPI және жақсы контрастпен сканерледім.
- [ ] Мен AI-дан қайта жазуды емес, оптикалық қатені түзетуді ғана сұрадым.
- [ ] Мен оқылмайтын бөліктерді [?] арқылы қорғадым.
- [ ] Мен барлық сандарды, күндерді және тиісті атауларды суретпен растадым.
- [ ] Мен сыни аймақтарда үлгі немесе толық тексеру жасадым.