단위 6 / 11

디지털 아카이브, 디지털화, OCR 및 장기 보존

이득:

  • 스캔한 문서를 OCR 및 HTR을 사용하여 텍스트로 변환하고 출력을 실제 이미지와 비교하여 수정하는 기능
  • 아카이브 문서의 독창성과 무결성을 보존하고, AI가 내용을 변경하고 복원하는 것을 방지하는 기능
  • 출처 정보와 내구성 있는 형식을 통해 장기적인 디지털 보존을 계획하는 능력

기록 보관자는 50년 된 신문, 손으로 쓴 편지, 오래된 사진 등을 미래로 옮기는 임무를 맡고 있습니다. 이러한 문서는 시간이 지남에 따라 낡아집니다. 문서를 보존하고 접근 가능하게 만들기 위해 디지털화가 수행됩니다. 즉, 실제 문서를 스캔하여 디지털 사본으로 변환하는 작업입니다. 그러나 검사만으로는 충분하지 않습니다. 디지털 개체는 장기적으로 검색, 읽기 및 유지 관리가 가능해야 합니다. 이 단원에서는 디지털화, 전사 및 디지털 보존 작업 흐름에서 인공 지능을 사용하는 방법을 배웁니다. 그러나 독창성과 정확성에 대한 책임을 져야 하는 이유를 알게 될 것입니다.

몇 가지 개념. OCR(광학 문자 인식)은 문서 이미지의 텍스트를 기계 편집이 가능한 텍스트로 변환하는 기술입니다. HTR(손으로 쓴 텍스트 인식)은 손으로 쓴 문서에 대해 동일한 작업을 수행하며 훨씬 더 어렵습니다. 디지털 보존은 파일 형식이 더 이상 사용되지 않고 소프트웨어가 변경되더라도 디지털 개체를 수십 년 동안 읽을 수 있도록 보장하기 위한 계획된 노력입니다. AI는 세 가지 영역 모두에서 강력하지만 결함이 있는 보조자입니다.

단계별: 디지털화부터 보존까지

1. 우선순위를 정하세요. 모든 것을 한 번에 디지털화할 수는 없습니다. 가장 취약하고, 가장 많이 요청되고, 가장 독특한 문서가 우선적으로 처리됩니다. 이는 사법적 결정입니다. AI는 목록 편집을 도와주지만 우선순위는 기관이 결정한다.

2. OCR/HTR을 스캔하고 적용합니다. 문서를 고해상도로 스캔한 다음 OCR 또는 HTR을 사용하여 텍스트를 추출합니다. 오래되고 어려운 텍스트에서도 AI 기반 도구가 점점 더 좋아지고 있습니다.

3. 텍스트를 수정하고 확인하세요. OCR/HTR 출력은 결코 완벽하지 않습니다. 특히 오래된 글, 얼룩진 페이지 또는 원고가 있는 경우 오류가 자주 발생합니다. 출력물을 실제 이미지와 비교하고 수정하는 것이 중요합니다.

4. 메타데이터 및 보호 정보를 추가합니다. 디지털 개체에 출처, 스캔 조건, 형식 정보, 출처(문서의 출처 및 처리 방법)를 추가합니다. 이 정보는 향후 확인 및 보호에 매우 중요합니다.

5. 장기적인 보호를 위한 계획. 개방적이고 일반적이며 내구성이 있는 파일 형식을 선택하십시오. 백업; 형식이 더 이상 사용되지 않을 경우를 대비하여 마이그레이션 계획을 세우세요.

팁: OCR 출력을 "일반 텍스트"로 받아들이지 마십시오. 검색 시스템이 이 텍스트를 통해 작동하는 경우 잘못 인식된 단어로 인해 소스를 찾을 수 없습니다. 중요한 컬렉션의 경우 사람의 눈으로 OCR 출력을 수정하면 이후의 모든 액세스 품질이 결정됩니다.

디지털 객체의 진정성과 무결성

아카이브 작업의 핵심은 진정성과 완전성입니다. 즉, 문서가 실제로 주장된 출처에서 왔으며 그 내용이 변경되지 않았다는 확신입니다. 이 시점에서 AI는 두 가지 측면의 위협을 생성합니다. 첫째, OCR/HTR 수정 또는 '강화' 중에 AI가 자동으로 텍스트를 수정할 수 있습니다. "수정"이라는 이름 아래에 존재하지 않는 단어를 추가할 수 있습니다. 둘째, 이미지 '수리'나 '복원'을 AI로 수행하면 원본이 아닌 디테일이 생성될 수 있습니다.

기록 보관인의 규칙은 분명합니다. 디지털 보존 사본은 원본에 충실해야 합니다. AI를 통해 이루어진 모든 개선 사항은 문서화되어야 하며 실제(원시) 스캔은 항상 보존되어야 합니다. 문서를 "미화"하는 것은 문서의 역사적 증거 가치를 파괴할 수 있습니다.

주의: 오래된 사진이나 문서를 AI로 "개선"하고 싶은 유혹을 느낄 수 있습니다. 하지만 AI는 부족한 부분을 보완해 채워줍니다. 보관 문서에서 이는 잘못된 역사적 증거를 만드는 것을 의미합니다. 복원 출력은 원본 소스를 대체하지 않습니다. 별도의 명확하게 라벨이 지정된 변형으로 저장됩니다.

세 개의 미니 케이스

사례 1 - 신문 아카이브를 검색할 수 있게 되었습니다. 한 도서관이 30년 된 지역 신문 컬렉션을 디지털화했습니다. OCR을 사용하면 90,000페이지가 복사되어 검색 가능해졌습니다. 이전에는 며칠이 걸렸던 주제 검색이 이제 몇 초로 단축되었습니다. 그러나 팀은 오래되고 얼룩진 페이지에서 OCR 정확도가 80%로 떨어지는 것을 발견하고 사람의 눈으로 상위 연도를 수정하는 데 우선순위를 두었습니다.

사례 2 - HTR이 원고를 열었습니다. 읽기 어려운 19세기 편지 모음집에 HTR을 적용한 아카이브입니다. 전문가들이 몇 달 동안 읽은 결과 시스템은 엄청난 속도를 얻었습니다. 그러나 인명과 지명에 오류가 있었기 때문에 인쇄물의 각 페이지를 전문 고문서학자(고대 문자 전문가)가 원본과 비교했습니다.

사례 3 - 가짜 "복원"이 거부되었습니다. 한 팀은 찢어진 역사 사진을 AI로 '수리'하는 것을 고려했습니다. AI는 누락된 얼굴 부위를 피팅하여 완성했습니다. 기록 보관인은 이러한 조작된 세부 사항이 역사적 증거를 왜곡할 것이라는 점을 깨달았습니다. 복구된 이미지는 원본과 별도로 저장되었으며 "AI 파생물"이라는 라벨만 명확하게 표시되었습니다.

접근복사, 보존복사 및 형식결정

디지털화의 좋은 방법은 동일한 객체의 복사본을 다른 목적으로 분리하는 것입니다. 보존 마스터는 미래에 전달될 실제 디지털 객체로, 최고 해상도, 비압축 또는 무손실 형식으로 저장됩니다. 거의 만지지 않습니다. 액세스 사본은 사용자에게 제공되는 더 작고 쉽게 열리는 변형입니다. 사용하기에 실용적인 형식(소형, 압축)이 장기 보존에는 적합하지 않을 수 있으므로 이러한 구별이 중요합니다. 보존을 위한 이상적인 형식(대형, 무손실)은 매일 사용하기에는 번거롭습니다. 이 워크플로에서 AI는 파일 목록을 작성하고, 누락된 변형을 감지하고, 두 복사본 간에 메타데이터 일관성을 유지하는 데 도움을 줄 수 있습니다. 그러나 형식 선택은 보존 결정입니다. 개방적이고 광범위하게 문서화되었으며 내구성이 뛰어난 형식이 선호되어야 하며(독점적이고 폐쇄적인 형식보다는) 시간이 지남에 따라 해당 형식이 더 이상 사용되지 않을 경우를 대비하여 마이그레이션 계획을 준비해야 합니다. AI가 형식을 제안하더라도 기관의 장기 보존 정책이 최종 결정권을 갖습니다.

팁: 각 디지털 개체에 대해 "원본 소스는 어디에 있는지, 보존 복사본은 어떤 형식으로, 액세스 복사본은 어떤 형식으로, 사용자에게 제공되는 형식은 무엇입니까?"라는 질문에 답하는 간략한 기록을 유지하십시오. 이 세 가지 레이어를 혼합하면 앞으로 어떤 파일이 신뢰할 수 있는 마스터인지 불분명해집니다.

복사 가능한 템플릿 4개

1) OCR 출력 수정 도움말:

아래는 실제 페이지에 대한 OCR 텍스트와 설명입니다. openOCR 오류(잘못된 문자, 복합어/분할어)만 수정하세요. 내용을 변경하거나 단어를 추가하거나 제거하지 마세요. 확실하지 않은 경우에는 "[?]"로 표시하세요. OCR 텍스트: [여기]

2) 텍스트-이미지 일관성 확인:

아래의 수정된 텍스트에 원래 문서에 있을 것으로 예상되지 않은 추가 사항이 있습니까(만들어졌을 수 있음)? 의심스러운 부분을 각각 표시하고 의심스러운 이유를 적어보세요. 텍스트: [여기]

3) 보호 메타데이터 초안:

소스, 출처, 스캔 날짜/해상도, 파일 형식, 거래 내역 등 디지털화된 개체에 대한 보존 메타데이터 개요를 생성합니다. 제가 제공한 정보를 사용하고 누락된 필드를 비워두세요. 정보: [여기]

4) 우선순위 지정 도움말:

다음은 디지털화를 기다리는 컬렉션 목록입니다. 취약성, 수요, 고유성을 기준으로 우선순위를 정하는 데 도움을 줍니다. 각 자원에 대한 간략한 근거를 제시하세요. 최종 결정은 나에게 맡기세요.목록: [여기]

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

스캔한 텍스트를 수정하고 아름답게 만드세요.

"Beautify"는 AI를 초대하여 콘텐츠를 변경하고 누락된 부분을 보완합니다. 보관문서의 독창성이 손상되었습니다.

강력한 프롬프트:

귀하의 역할: 디지털화 편집 보조원. 다음 OCR 텍스트에서 명시적인 인식 오류(잘못된 문자, 잘못 분할된 단어)만 수정하세요. 단어를 추가, 제거 또는 변경하지 마십시오. 확실하지 않은 부분은 "[?]"로 남겨두세요. 별도의 목록에 수정한 각 항목을 표시합니다. 텍스트: [여기]

강력한 프롬프트는 AI가 오류만 인식하도록 제한하고 콘텐츠에 접근하는 것을 금지하며 수정 사항을 추적 가능하게 만듭니다.

워크플로 및 위험 표

무대

AI의 투고

주요 위험

보호 조치

스캔

품질이 좋지 않음

고해상도

OCR/HTR

텍스트로 변환

인식 오류

인간 교정

교정

오류 제안

콘텐츠 변경

원본과의 비교

복원

이미지 파생물

피팅 디테일

원시 원본을 보관하고 라벨을 붙입니다.

보호

메타데이터 초안

원산지 상실

출처 기록

일반적인 실수

  • 수정 없이 OCR 출력을 수락합니다. 오류는 검색 및 액세스를 방해합니다.
  • AI를 '아름답게 만드세요'라고 부릅니다. 내용을 변경하고 독창성을 파괴합니다.
  • 실제 증거를 AI 복원으로 대체합니다. 조작된 세부 사항은 잘못된 역사를 만듭니다.
  • 원시 스캔을 저장하지 않습니다. 원본이 없으면 수정사항을 확인할 수 없습니다.
  • 출처 정보를 생략합니다. 문서의 신뢰성이 추적 불가능해집니다.

요약하면

디지털 아카이브 및 디지털화 분야의 AI; 이는 OCR/HTR 전사, 메타데이터 초안 작성 및 우선순위 지정 속도를 높이는 귀중한 도구입니다. 그러나 보관 작업의 본질은 진정성과 무결성입니다. OCR 출력은 인간의 눈으로 수정되어야 하며, AI는 절대로 콘텐츠를 자동으로 대체해서는 안 되며, 복원 파생물은 원본 증거를 대체해서는 안 되며, 원시 스캔 및 출처 정보는 항상 보존되어야 합니다. 문서를 "개선"하는 것이 아니라 문서에 충실하면서 액세스할 수 있게 만드는 도구로 AI를 사용하세요.

응용과제

OCR 출력의 짧은 샘플을 얻으십시오(자체 제작 또는 실제 스캔에서). "OCR 출력 수정 도움말" 템플릿으로 인식 오류만 수정한 뒤, "텍스트-이미지 일관성 확인" 템플릿으로 AI가 콘텐츠를 추가했는지 확인해보세요. 그런 다음 "보존 메타데이터 초안" 템플릿을 사용하여 개체에 대한 출처 및 형식 정보가 포함된 레코드를 만듭니다.

체크리스트

  • [ ] OCR/HTR 출력을 실제 이미지와 비교하여 수정하였습니다.
  • [ ] AI가 콘텐츠를 추가/변경하지 않는 것을 확인했습니다.
  • [ ] 원시(마스터) 스캔을 별도로 유지하고 변경하지 않았습니다.
  • [ ] 메타데이터에 출처 및 형식 정보를 추가했습니다.
  • [ ] 복원 변형을 "AI 파생물"로 명확하게 표시했습니다.