단위 2 / 12

문서 디지털화 및 OCR: 인쇄된 텍스트를 기계 텍스트로 변환

이득:

  • 디지털화 및 OCR 워크플로우(스캔, 전처리, 인식, 수정, 확인)를 단계별로 설정하는 기능
  • AI를 사용하여 문맥에 따라 OCR 오류를 수정하는 동시에 수정 내용을 유지하고 라인을 다시 작성하고 [?]로 모호성을 표시하는 기능
  • 숫자, 날짜, 고유명사를 시각적으로 확인해야 하는 이유와 품질 관리의 역할을 이해합니다.

아카이브나 도서관의 물리적 선반에 있는 수백만 페이지는 디지털화되고 검색 가능해질 때만 연구원에게 진정으로 공개됩니다. 디지털화는 실제 문서를 스캔하거나 사진을 찍어 디지털 이미지로 변환하는 것입니다. 그러나 페이지의 사진은 아직 "텍스트"가 아닙니다. 컴퓨터에는 여전히 이미지이므로 검색할 수 없습니다. OCR이 작동하는 곳입니다.

OCR(Optical Character Recognition)은 문서 이미지에 인쇄된 문자를 인식하여 기계가 읽을 수 있고 검색 가능한 텍스트로 변환하는 기술입니다. 이 단원에서는 OCR을 사용하여 과거 인쇄 문서를 디지털화하는 방법, AI가 이 과정에서 OCR 오류를 수정하는 데 어떻게 도움이 되는지, 인간의 눈이 필수적인 부분에 대해 알아봅니다. (손으로 쓴 텍스트에는 다른 기술이 필요합니다. 이에 대해서는 다음 단원에서 다루겠습니다.)

디지털화 작업 흐름: 단계별

1. 준비 및 심사. 가능한 최고 품질로 문서를 스캔하세요. 역사 연구의 일반적인 경험 법칙은 최소 300-400 DPI(인치당 도트 수)의 해상도입니다. 해상도가 낮으면 후속 OCR 단계에서 오류율이 급등합니다.

2. 이미지 전처리. OCR 이전에 이미지를 개선하면 스캔한 페이지 기울기 조정, 결점 제거, 대비 증가, 흑백으로 변환 등 성공률이 크게 높아집니다. 최신 AI 기반 도구는 이 단계를 자동화할 수 있습니다.

3. OCR 적용. 이미지를 OCR 엔진에 공급합니다. 엔진은 문자를 인식하고 텍스트를 생성합니다. 출력은 일반적으로 표시되는 문서 이미지와 그 아래의 "검색 가능한 숨겨진 텍스트 레이어"라는 두 개의 레이어로 구성됩니다.

4. 수정(사후 수정). 원시 OCR 출력은 결코 완벽하지 않습니다. 오래된 글꼴, 누렇게 변한 종이, 잉크 번짐, 스캔 오류로 인해 문자가 잘못 읽혀집니다. AI는 맥락을 사용하여 OCR 오류를 제안하고 수정하는 강력한 도우미입니다.

5. 검증 및 품질 관리. 수정된 텍스트는 샘플을 기준으로 또는 완전히 사람이 확인합니다. 특히 이름, 날짜, 숫자 등 중요한 부분은 육안으로 확인해야 합니다.

OCR이 실수하는 이유, AI가 돕는 방법

기록 문서에서 OCR에 문제가 되는 일반적인 문제: 오래되고 화려한 글꼴, 긴 "s"(ſ)와 같은 쓸모없는 문자 형식, 2열 페이지 레이아웃, 각주, 손으로 쓴 삽입물, 봉인 및 희미한 잉크. OCR 엔진은 문자를 하나씩 "보기" 때문에 이진수 "rn"을 "m"으로, 문자 "l"을 숫자 "1"로, 문자 "O"를 "0"으로 혼동하는 경우가 많습니다.

AI 언어 모델은 여기에서 다른 기능을 제공합니다. 즉, 맥락을 이해합니다. OCR 엔진이 "1stanbu1"이라고 썼다면 AI는 문맥을 통해 "이스탄불"이어야 한다고 추론할 수 있습니다. 그러나 여기에는 큰 위험이 있습니다. AI가 "수정"할 때 텍스트도 변경할 수 있습니다. 그는 존재하지 않는 단어를 "수정했습니다"라고 추가하거나 자신의 추측으로 불분명한 부분을 채울 수 있습니다. 이는 전사의 충실도를 방해합니다.

주의: OCR 수정의 황금률은 다음과 같습니다. AI는 명백한 인식 오류만 수정해야 하며 텍스트 내용을 해석하거나 보완해서는 안 됩니다. "1stanbu1 → 이스탄불"은 합법적입니다. 읽을 수 없는 단어를 추측으로 채우는 것이 아닙니다. 불확실한 부분은 [?]로 표시하고, 꾸며서는 안 됩니다.

OCR 오류 유형 및 표를 이용한 접근 방식

오류 유형

AI가 고칠 수 있을까?

인간의 통제

캐릭터 믹싱

rn←m, l⇔1, O⇔0

네, 안전해요

샘플

오래된 글자체

긴 ſ → s

네, 안전해요

샘플

희미하거나 읽을 수 없는 단어

"카___엔"

아니, [?]를 넣어야 할까요?

필수

고유명/지명

"콘스탄티니예"

조심하다

필수

번호/날짜

"1867" 대 "1857"

위험한

필수

페이지 레이아웃(열/각주)

혼합 흐름

부분적으로

필수

그림을 한 문장으로 요약하면 다음과 같습니다. AI는 일반적인 문자 오류를 안정적으로 정리합니다. 그러나 특별한 이름, 숫자, 날짜 및 읽을 수 없는 장소에는 사람의 눈이 필요합니다.

세 개의 미니 케이스

사례 1 - 신문 아카이브를 검색할 수 있게 되었습니다. 한 대학 도서관은 1930년대 지역 신문 12,000페이지를 디지털화했습니다. 원시 OCR 정확도는 약 82%였습니다(100자 중 18자가 부정확함). AI 기반 교정은 신문 언어에 맞는 사전과 문맥으로 정확도를 96%까지 높였습니다. 나머지 오류에 대해서는 원문 확인이 아닌 샘플 확인을 실시하였습니다. 컬렉션은 3주 만에 검색 가능해졌습니다.

사례 2 — AI가 역사를 "수정"하고 왜곡했습니다. 한 기록 보관인이 AI에게 OCR 인쇄물의 날짜 "1863"을 수정하도록 했습니다. AI는 문맥에서 다른 사건을 살펴봄으로써 날짜를 "1868"로 "수정"했습니다. 비록 문서에는 분명히 1863년이라고 나와 있었지만, 기록 보관인이 원본 이미지를 보지 않았다면 카탈로그에는 잘못된 날짜가 입력되었을 것입니다. 교훈: 숫자와 날짜는 AI에 맡겨지지 않으며 이미지를 통해 확인됩니다.

사례 3 - 2열로 구성된 페이지가 혼란스럽습니다. 19세기 연감의 2단 페이지가 OCR에서 하나의 흐름으로 뒤섞여 문장이 얽혀 있었습니다. 원시 출력을 읽을 수 없습니다. 처음 페이지 레이아웃을 영역(분할)으로 나누고 각 열을 별도로 처리했을 때 텍스트가 개선되었습니다. 교훈: 복잡한 페이지 레이아웃에서는 구조가 먼저이고 텍스트가 두 번째입니다.

복사 가능한 템플릿 4개

1) 보안 OCR 수정:

다음은 기록 문서의 원시 OCR 출력입니다. 귀하의 임무는 명백한 광학 인식 오류(예: rn→m,1→l, 0→O, 긴 ſ→s)만 수정하는 것입니다. 규칙: (1) 본문의 의미를 해석하십시오. (2) 읽을 수 없거나 모호한 단어를 수정하고 그대로 두고 [?]로 표시합니다. (3) 문장을 추가하거나 제거하거나 완성하지 마세요. (4) 숫자와 날짜를 변경합니다. 의심스러우면 [숫자?]를 표시하십시오.원시 OCR: [여기]

2) OCR 품질 보고서:

아래 OCR 출력을 검사하고 품질 보고서를 생성합니다. (1) 인식 오류가 있을 수 있는 단어를 나열합니다. (2) 읽을 수 없거나 명확하지 않은 영역을 표시합니다. (3) 사람이 확인해야 하는 특정 이름, 날짜 및 숫자를 나열합니다. 수정하지 마십시오. 체크리스트만 생성하세요.텍스트: [여기]

3) 열/구조 분석 도움말:

아래 OCR 텍스트는 2열 페이지에서 나온 것이므로 흐름이 혼란스러울 수 있습니다. 텍스트를 논리적인 단락으로 재배열하되 단어를 변경, 추가 또는 삭제하지 마십시오. 순서를 수정하면 됩니다. 확실하지 않은 주문은 [주문?]으로 표시해 주세요. 텍스트: [여기]

4) 표준 언어로 정규화(선택 사항, 별도 레이어):

아래의 수정된 역사적 텍스트 위에 별도의 열에 오늘의 철자로 단순화된 읽기 버전을 작성하세요. 원본 텍스트를 절대 변경하지 마세요. 단순화를 별도의 레이어로 둡니다. 의미를 추가하지 않고 철자/발음만 업데이트하세요.원본: [여기]

약한 프롬프트 / 강한 프롬프트

약함:

이 OCR 텍스트를 수정하고 아름답게 만드세요.

"Beautify"를 사용하면 AI가 텍스트를 다시 작성하고, 누락된 부분을 보완하고, 내용을 해석할 수 있습니다. 충성심을 깨뜨립니다.

강한:

이 원시 OCR 출력에서 광학 인식 오류만 수정하세요. 의미해석 금지, 단어 추가/삭제, 읽을 수 없는 부분은 [?]로 남겨두기, 숫자 및 날짜 변경 등을 하지 마세요. 제가 확인할 수 있도록 각 수정사항을 '원본 → 수정사항' 형식으로 별도의 목록에 표시해 주세요. 텍스트: [여기]

차이점: 제한된 의무, 제작 금지, 모호성 표시 및 추적 가능한 수정 목록으로 인해 출력을 감사할 수 있습니다.

일반적인 실수

  • 낮은 해상도로 스캔 중입니다. 대부분의 OCR 오류는 잘못된 이미지로 인해 발생합니다. 고품질 스캐닝은 가장 저렴한 투자입니다.
  • AI를 '아름답게 만드세요'라고 부릅니다. 이는 충실도보다는 유창함을 낳습니다. 문서가 다시 작성되었습니다.
  • 숫자와 날짜는 AI에게 맡깁니다. 이는 컨텍스트에서 "수정"될 때 자동으로 손상됩니다. 이미지로 확인해야 합니다.
  • 읽을 수 없는 부분을 추측으로 채웁니다. 꾸며낸 것이 아니라 불확실성(?)으로 보호해야 한다.
  • 샘플링 대신 전혀 제어하지 않습니다. 96%의 정확도라도 12,000페이지에 수천 개의 오류가 있음을 의미합니다. 중요한 영역을 스캔합니다.

요약하면

OCR은 인쇄된 역사적 문서를 검색 가능한 텍스트로 변환하여 연구자에게 아카이브를 공개합니다. AI는 원시 OCR 출력의 문자 오류를 컨텍스트와 함께 수정하는 데 강력한 도움이 됩니다. 하지만 편집과 재작성 사이에 선을 그어야 합니다. 고품질 스캐닝, 안전한 수정 지침, [?]를 사용한 모호성 보존, 이름/날짜/번호의 육안 확인을 통해 빠르고 안정적인 디지털화가 가능합니다. AI는 텍스트를 정리합니다. 당신은 충실함의 수호자입니다.

응용과제

인쇄된 역사 문서(오래된 신문, 공식 편지, 책 페이지)를 스캔하거나 OCR 인쇄물을 가져옵니다. “보안 OCR 수정” 템플릿으로 텍스트를 수정하고, “원본 → 수정” 목록을 통해 수정을 요청하세요. 그런 다음 "OCR 품질 보고서"를 통해 사람의 제어가 필요한 영역을 제거하십시오. 목록에 있는 각 날짜와 고유명칭을 실제 이미지와 비교하세요. 얼마나 많은 부분이 잘못 "수정"되었는지 확인하세요.

체크리스트

  • [ ] 최소 300 DPI 및 양호한 대비로 문서를 스캔했습니다.
  • [ ] AI에게 다시 쓰기가 아닌 광학적 오류 수정만 요청했습니다.
  • [ ] 읽을 수 없는 부분을 [?]로 보호했습니다.
  • [ ] 이미지를 통해 모든 숫자, 날짜, 고유명칭을 확인했습니다.
  • [ ] 중요한 부분에 대해 샘플 또는 전체 점검을 수행했습니다.