단위 6 / 11

금석문, 고대 사본 및 텍스트 읽기 및 번역

이득:

  • OCR/HTR을 사용하여 비문 및 원고를 초안 텍스트로 전사할 때 읽은 문자와 예상 완료를 별도로 표시하여 유지하는 기능
  • 흐릿한 텍스트 완성, 잘못된 번역, 조작된 속성 등 환각의 형태를 인식하고 원본 및 역번역과 비교하여 번역을 확인하는 능력.
  • 언어, 글쓰기, 장르의 맥락이 어떻게 인공지능의 신뢰성을 결정하는지, 최종 읽기와 해석은 전문 문헌학자의 몫임을 이해하는 능력

과거로부터 우리에게 남겨진 가장 직접적인 소리 중 하나는 돌에 새겨진 비문, 점토판, 파피루스, 양피지 사본, 묘비 및 인장과 같은 기록된 출처입니다. 이 단원에서는 금석학(돌, 금속, 도자기와 같은 단단한 표면에 새겨진 비문을 연구하는 과학), 고문서학(고대 필기체를 읽고 연대를 측정하는 전문 기술) 및 AI가 이러한 텍스트의 읽기, 번역 및 편집을 어떻게 가속화하지만 모든 읽기를 전문 문헌학자의 확인을 받아야 하는 이유를 살펴보겠습니다.

기본 원리: AI는 희미한 텍스트를 읽고, 언어를 번역하고, 가능한 보완 사항을 제안하는 데 도움을 줍니다. 그러나 비문의 최종 판독, 누락된 문자의 완성 및 의미는 언어와 기간을 아는 전문가의 결정입니다. AI가 환각의 위험이 가장 큰 곳은 바로 이 영역입니다. 모델이 누락되거나 희미한 텍스트를 "그럴 듯한" 그러나 꾸며낸 내용으로 채울 가능성이 매우 높기 때문입니다.

서면 소스로 작업하는 단계

1. 문서. 비문이나 원고는 고해상도, 대비가 강화된 형식으로 표시됩니다. 불분명한 표면의 경우 특수 조명(측면 조명)과 RTI와 같은 기술이 사용됩니다. AI는 대비와 문자 가장자리를 선명하게 하는 데 도움이 됩니다.

2. 문자 인식. 인쇄된 텍스트에는 OCR(Optical Character Recognition)이 사용되고 필기에는 HTR(Handwriting Text Recognition)이 사용됩니다. AI 기반 HTR은 오래된 원고를 복사하는 데 강력합니다.

3. 전사 및 완성. 색이 바래거나 파손된 부분의 경우 전문가는 문법과 평행 텍스트를 기반으로 가능한 복원을 제안합니다. 완성된 문자는 항상 대괄호와 같은 기호로 표시됩니다. 읽은 것과 예측한 것은 결코 혼동되지 않습니다.

4. 번역. 텍스트는 원어(라틴어, 고대 그리스어, 오스만어, 설형 문자 등)에서 번역됩니다. AI가 초안 번역을 제공합니다. 전문가의 뉘앙스가 용어와 역사적 맥락을 수정합니다.

5. 댓글. 본문이 말하는 내용, 쓴 사람, 어떤 사건을 언급하는지는 역사적 해석이며 전문가의 몫입니다.

팁: AI에게 난해한 텍스트를 "읽고 완성"하라고 지시하면 빈칸을 안전하게 채워줍니다. 대신, "명확하게 읽을 수 있는 문자만 제공하고, 공백으로 두고 확실하지 않은 부분은 표시하세요"라고 말하세요. 정당한 사유와 함께 별도의 단계로 완료를 요청하고 반드시 전문가의 확인을 받으세요.

환각: 이 지역의 가장 큰 위험

인문학에서 AI가 저지르는 가장 치명적인 실수는 조작이다. 이 분야에는 네 가지 일반적인 형태가 있습니다.

  • 텍스트 제작: 존재하지 않는 단어를 추가하여 희미한 비문의 존재하지 않는 부분을 "완성"합니다.
  • 가짜 번역: 자신이 이해하지 못하는 단어를 유창하게 번역하지만 부정확하게 번역합니다. 독자는 출처를 모르기 때문에 알아차릴 수 없습니다.
  • 조작된 참조: "이 비문은 해당 출판물에 출판되었습니다"라고 적혀 있지만 해당 출판물은 존재하지 않습니다.
  • 잘못된 날짜 지정/귀속: 자신있게 글쓰기 스타일을 잘못된 기간에 배치합니다.

이들 모두는 출처를 보고 해당 언어를 아는 전문가의 확인 없이는 절대로 사용할 수 없습니다.

주의: 번역이 유창하고 설득력이 있다고 해서 그것이 정확하다는 의미는 아닙니다. AI는 이해하지 못하는 설형 문자 기호를 자신감 있는 문장으로 변환할 수도 있습니다. 원문을 읽지 못하는 사람은 결코 AI 번역의 정확성을 스스로 확인할 수 없습니다.

세 개의 미니 케이스

사례 1 - HTR이 아카이브를 열었습니다. 한 기록 보관소에서는 수천 페이지에 달하는 오스만 사본을 연구자들에게 공개하지 않았습니다. 왜냐하면 이를 읽으려면 전문성과 시간이 필요했기 때문입니다. AI 기반 HTR은 노트북을 검색 가능한 초안 텍스트로 복사합니다. 전문가들이 초안을 수정하고 읽을 수 없는 부분을 표시했습니다. 전문은 아니지만 강력한 스캐닝 도구가 등장했습니다.

사례 2 - 조작된 완료가 발견되었습니다. 한 학생이 AI에게 깨진 라틴어 묘비를 읽도록 했습니다. AI는 유창한 문장으로 빠진 줄을 '완성'했다. 금석자는 돌에 공간이 남아 있지 않기 때문에 제안된 완성이 물리적으로 불가능하다는 것을 보여주었습니다. 완성은 평행 비문을 기반으로 재구성되고 표시되었습니다.

사례 3 — 가짜 번역이 수정되었습니다. 한 팀은 AI가 고대 그리스 비문을 번역한 것을 보고합니다. 문헌학자가 확인한 결과, AI가 동사를 잘못된 시제로 번역하여 텍스트의 의미(제물인지 추모인지)를 뒤집어 놓은 것을 발견했습니다. 출처로 돌아가면 댓글이 저장되었습니다.

복사 가능한 템플릿 4개

1) 보수적 전사:

귀하의 역할: 전사 도우미. 이 비문/원고 이미지에는 명확하게 읽을 수 있는 문자만 제공하십시오. 불분명하거나 깨졌거나 확실하지 않은 부분은 읽지 마십시오. "[읽을 수 없음]"으로 표시합니다. 누락된 부분을 완성하세요. 또한 의심되는 문자를 기록해 두십시오.

2) 합리적인 완성 제안:

아래는 정확한 읽는 부분과 [공백]이 있는 텍스트입니다. 공백에 대해 가능한 보완을 제안하되 각 제안에 대해: (a) 정당성(문법, 평행 텍스트), (b) 공백이 문자 수에 맞는지 여부, (c) 대안. 이는 제안 사항입니다. 확정적으로 읽은 것은 아닙니다. 전문가의 승인이 필요함을 명시합니다.

3) 초안 번역(소스 보호):

아래의 [언어] 텍스트를 번역하세요. 각 문장 옆에 원본 텍스트를 유지합니다(한 줄씩 정렬). 확실하지 않은 단어에 표시하고 대체 번역을 제공하십시오. 조건을 구성하지 마십시오. 모르신다면 "불확실"이라고 적어주세요. 이것은 초안입니다. 전문 문헌학자가 확인합니다.

4) 번역 검증(역번역):

이 번역을 원어로 다시 번역하고 원본 원문과 비교합니다. 의미가 변경되거나 추가되거나 삭제된 부분을 표시해 보세요. 특히 시제, 주어, 숫자를 확인하세요.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 고대 비문을 읽고 그 내용이 무엇인지 말해 보십시오.

희미한 비문에 AI가 공백을 메워주고, 언어를 잘못 번역할 수도 있는데, 출처를 보지 않는 사람은 이를 눈치채지 못할 것이다.

강력한 프롬프트:

이 비문 이미지에서는 먼저 명확하게 읽을 수 있는 문자만 표기하고, 가려진 부분은 "[읽을 수 없음]"으로 남겨둡니다. 그런 다음 별도로 정당성과 격차에 대한 가능한 보완책을 제안하지만 명확한 내용은 제공하지 않습니다. 마지막으로 번역 초안을 제공하고 확실하지 않은 단어를 표시하세요. 모두 전문가의 승인을 받아야 합니다.

차이점: 첫 번째는 가상의 "읽기"를 제공합니다. 후자는 읽기, 예측 및 번역된 레이어를 별도로 유지하고 검증 가능하게 유지합니다.

AI의 언어, 스크립트 및 지식 경계

고고학 문헌은 라틴어 및 고대 그리스어 비문, 오스만 및 아랍어 사본, 설형 문자판, 이집트 상형 문자, 룬문자 비문 등 광범위한 언어 및 문자에 걸쳐 있습니다. 이러한 언어와 스크립트에 대한 AI 숙련도는 매우 고르지 않습니다. 라틴어, 고대 그리스어 등 디지털 텍스트가 풍부한 언어의 경우 초안 번역이 합리적일 수 있지만 문서화가 적거나 해독되거나 소수의 전문가만 읽는 텍스트의 경우 AI는 거의 전적으로 신뢰할 수 없습니다. 이러한 영역에서는 설득력 있지만 완전히 조작된 "번역"을 생성합니다.

맥락과 장르의 문제도 있다. 같은 단어라도 법적 문서, 기도문, 묘비에서는 다른 의미를 가질 수 있습니다. 전문 문헌학자는 텍스트의 유형(헌신, 기념비, 계약, 편지)을 인식하고 올바른 문맥에서 단어를 읽습니다. AI에는 이러한 일반적인 민감성이 부족하고 가장 일반적인 의미를 부여합니다. 약어, 공식 및 주식 표현(특히 비문에서 매우 일반적임)은 AI를 쉽게 오도합니다.

따라서 황금률은 다음과 같습니다. AI를 자신이 알고 있는 언어, 제어할 수 있는 언어에 대한 가속기로 사용합니다. 읽을 수 없는 언어는 절대로 AI 번역에만 의존하지 마세요. 출처를 읽을 수 없는 사람은 번역의 정확성을 확인할 수 없으므로 해당 번역을 과학적 주장으로 전환할 수 없습니다.

팁: AI에게 텍스트를 줄 때 언어, 예상 기간, 유형(비문/편지/문서)을 지정하세요. 상황 지식은 가장 일반적이지만 잘못된 읽기로 향하는 AI의 표류를 부분적으로 줄이지만 확인의 필요성을 제거하지는 않습니다.

서면 자원 작업 테이블

퀘스트

AI의 역할

인간의 결정

확인

이미지 향상

대비/가장자리

기준 선택

원본과의 비교

OCR/HTR

초안 텍스트

불확실한 성격

전문가 교정

완성

추천(합리적)

수락/거절

평행 텍스트, 위치 제어

번역

초안

뉘앙스, 용어

역번역, 출처

코멘트

컨텍스트 요약

역사적 의미

전문가, 문학

일반적인 실수

  • 희미한 텍스트를 완성합니다. AI는 격차를 해소합니다. 읽기와 예측을 분리하여 표시해야 합니다.
  • 출처를 보지 않고도 번역을 신뢰합니다. 유창한 번역은 올바른 번역이 아닙니다.
  • 구성된 귀속을 수락합니다. "그 방송에 있어요"라고 말하면 확인이 필요합니다.
  • 실제 완료 위치를 확인하지 않습니다. 제안서는 깨진 공간에 맞아야 합니다.
  • 해석은 AI에게 맡깁니다. 본문의 역사적 의미는 전문 언어학자의 문제입니다.

요약하면

비석 및 고대 텍스트의 AI; 이미지 개선, HTR/OCR 초안, 완성 제안 및 초안 번역 속도를 크게 높이고 연구를 위해 비공개 아카이브를 엽니다. 그러나 이것은 환각의 위험이 가장 높은 영역입니다. 읽기는 예측과 분리되고, 보충어가 표시되고, 번역은 원본 및 역번역과 비교하여 확인되며, 최종 읽기와 해석은 전문 문헌학자의 몫입니다.

응용과제

비문 또는 원고 이미지를 선택하세요(오픈 액세스 컬렉션에서). "보수적 표기" 템플릿을 사용하여 명확한 문자만 추출한 다음 "합리적인 완성 제안"을 사용하여 공백에 대한 제안을 받으세요. 초안 번역을 생성하고 "번역 확인" 템플릿을 사용하여 역번역하고 의미가 바뀐 위치를 표시합니다. 가능하다면 출판된 독서와 비교하십시오.

체크리스트

  • [ ] 읽은 문자와 예측 완료를 별도로 표시해 두었습니다.
  • [ ] 깨진 부분에 완성품이 맞는지 확인했어요.
  • [ ] 원문과 역번역을 대조하여 번역을 확인했습니다.
  • [ ] 실제 카탈로그에서 YZ가 제공한 간행물/인용을 확인했습니다.
  • [ ] 최종 낭독과 해석은 전문가의 승인에 맡겼습니다.