단위 5 / 11

발굴 기록, 데이터베이스 및 데이터 표준

이득:

  • 문맥/위치, 층위학, 해리스 매트릭스 등 기록 단위를 인공지능으로 디지털화, 표준화하면서 데이터 무결성을 유지하는 능력
  • 인공 지능이 누락된 데이터를 완성하고 자동으로 변경하는 위험으로부터 원시 데이터를 보호하고 각 변환을 추적 가능한 상태로 유지하는 기능
  • 통제된 사전, 메타데이터, 개방형/FAIR 원칙이 향후 데이터 가용성에 필수적인 이유를 이해하세요.

발굴의 과학적 가치는 그곳에서 발견된 금이 아니라 기록의 질에 있습니다. 잘 문서화되지 않은 발견은 과학과 거의 관련이 없습니다. 어디서, 어느 층에서, 무엇으로 발견되었는지 알 수 없는 오브제이기 때문에 그저 아름다운 오브제일 뿐이다. 이 단원에서는 발굴 로깅(모든 컨텍스트, 발견 및 관찰에 대한 체계적인 기록 및 데이터베이스)과 AI가 데이터 입력, 구성 및 표준화 속도를 어떻게 높일 수 있는지, 그리고 데이터 무결성에 대한 책임이 인간에게 남아 있는 이유를 살펴보겠습니다.

기본 원칙: AI는 흩어져 있는 기록을 정리하고 표준화하며 불일치를 찾는 데 도움을 줍니다. 그러나 어떤 데이터가 정확한지, 기록이 진실을 반영하는지, 데이터의 무결성은 인간의 책임입니다. AI는 데이터의 형태를 수정하지만 정확성을 보장하지는 않습니다.

고고학 기록의 기본 단위

컨텍스트/소재. 각 발굴은 현장을 맥락 단위(맥락/장소 - 개별 퇴적물, 층, 구덩이 또는 벽, 발굴 의미의 가장 작은 단위)로 나눕니다. 각 컨텍스트는 고유한 번호를 받으며 모든 검색 결과는 해당 번호와 연결됩니다.

층서학 및 해리스 매트릭스. 층서학(서로에 대한 층의 전후 관계)은 상대 연대 측정의 기초입니다. 해리스 매트릭스(서로 상대적인 컨텍스트 순서를 보여주는 다이어그램)는 이러한 관계를 시각화합니다. AI는 일관되지 않은 층서학적 관계(예: 순환적인 “A는 B 위와 아래에 있습니다” 오류)를 감지하는 데 도움이 됩니다.

재고를 찾아보세요. 모든 발견; 문맥은 번호, 종류, 크기, 재질, 상태, 사진으로 기록됩니다.

데이터 표준. 기록을 공유하고 비교할 수 있도록 하기 위해 공통 표준이 사용됩니다. CIDOC-CRM(문화유산 데이터를 설명하기 위해 개발된 국제 개념 프레임워크/온톨로지)은 다양한 기관의 데이터가 서로 통신할 수 있도록 해줍니다. 통제된 용어 사전(모든 사람이 동일한 개념에 대해 동일한 용어를 사용하도록 보장하는 승인된 목록)이 사용됩니다.

팁: AI를 사용하여 데이터를 "해석"하는 것이 아니라 "정리하고 감사"하십시오. “이 기록에서 모순되는 문맥 번호는 무엇입니까?” 좋은 질문입니다. "이 컨텍스트는 어느 시대에 속합니까?" 전문가의 결정입니다. AI가 가장 강력한 부분은 일관성 확인입니다.

등록 및 데이터베이스에서 AI의 역할

  • 디지털화. 손으로 쓴 발굴 노트, 재고 카드 및 오래된 도면은 AI 기반 텍스트 인식을 통해 데이터베이스로 가져옵니다(이 링크는 6단원의 HTR에 연결됨).
  • 표준화. 다양한 철자("byzantium", "Byzantium", "byz.")가 제어 사전에 매핑됩니다. 날짜와 측정값이 동일한 형식으로 표시됩니다.
  • 일관성 검사. 문맥 번호 누락, 층위 모순, 두 개의 다른 발견에서 동일한 번호 사용과 같은 오류가 표시됩니다.
  • 쿼리 및 요약. "다음 컨텍스트에서 모든 유리가 발견되었습니다"와 같은 쿼리 및 요약 테이블이 빠르게 생성됩니다.
주의: 표준화할 때 AI는 데이터를 "수정"하려고 시도하면서 자동으로 데이터를 수정할 수 있습니다. 예를 들어 측정값을 "합리적인" 값으로 반올림하거나 불확실한 판독값을 자신의 추정치로 채울 수 있습니다. 모든 자동 변경 사항은 추적 가능해야 하며 원본 기록은 보존되어야 합니다. 원시 데이터는 덮어쓰지 않습니다.

세 개의 미니 케이스

사례 1 - 디지털화로 아카이브가 저장되었습니다. 한 박물관에서는 40년간 손으로 쓴 재고 카드(약 22,000장)를 분실 위험에 처해 보관하고 있었습니다. AI 기반 텍스트 인식 및 표준화를 통해 카드를 검색 가능한 데이터베이스로 가져왔습니다. 각 카드는 인간 조사관에 의해 샘플 기반으로 확인되었으며 읽을 수 없는 부분은 "불분명"으로 표시되었습니다.

사례 2 - 불일치 검사에서 오류가 발견되었습니다. 발굴 팀은 시즌이 끝날 때 AI가 데이터베이스를 감사하도록 했습니다. YZ는 세 개의 발견 항목이 동일한 컨텍스트 번호를 가지고 있지만 레이어 정보가 충돌함을 표시했습니다. 검토 결과 데이터 입력 오류가 드러났습니다. 수정하지 않으면 층위학적 해석이 왜곡되었을 것입니다.

사례 3 — 자동 변경이 발견되었습니다. 측정값을 표준화하는 동안 보조자는 AI가 일부 "0" 값을 "누락"이 아닌 "0"으로 해석하고 있음을 발견했습니다. 이로 인해 깨진 조각 길이가 왜곡되었습니다. 원래 데이터를 유지하면서 변경 사항을 별도의 열에 유지하기 위해 프로세스가 다시 구축되었습니다.

복사 가능한 템플릿 4개

1) 표준화(통제 사전):

귀하의 역할: 데이터 랭글링 도우미. 다음 레코드의 [필드:재료/기간/유형] 값을 다음 제어 사전: [사전 목록]에 매핑합니다. 사전에 상응하는 값이 없는 CHANGE 값 "일치하지 않음"으로 표시하십시오. 각 변경 사항을 원본-새 쌍으로 보고합니다. 원시 데이터를 삭제합니다.

2) 일관성 확인:

다음 발굴 기록에서 불일치를 찾으십시오: 반복되는 문맥 번호, 누락된 필수 필드, 충돌하는 층위 관계, 어색한 날짜/측정. 등록번호로 각 문제를 나열하고 수정은 나에게 맡기세요. 스스로 바꾸지 마십시오.

3) 해리스 매트릭스 논리 제어:

다음은 컨텍스트(B 위/아래 A) 간의 층위학적 관계입니다. 논리적 모순(루프, 양방향 관계)이 있습니까? 어떤 컨텍스트가 있는지 표시합니다. 댓글을 달지 마세요. 논리적 일관성만 확인하세요.

4) 쿼리 및 요약 테이블:

아래 데이터베이스 덤프에서 다음 내용을 추출합니다. 상황별 유형 분포 찾기]. 각 행이 파생되는 레코드를 지정하여 결과를 테이블로 제공합니다. 데이터에 존재하지 않는 값을 추가하지 마십시오. 비어 있으면 "데이터 없음"이라고 씁니다.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 발굴 데이터를 수정하고 누락된 항목을 채우십시오.

"틈 채우기"를 통해 AI가 데이터를 맞출 수 있습니다. 그 결과 사실과 허구가 뒤섞인 신뢰할 수 없는 데이터베이스가 탄생했습니다.

강력한 프롬프트:

아래 발굴 데이터에는 형식적인 불일치(철자법, 날짜 형식, 중복 ID)만 표시하세요. 완전한 누락값; "미완성"으로 두십시오. 원본과 함께 제안된 각 변경 사항을 나열합니다. 승인하겠습니다. 원시 데이터 변경.

차이점: 전자는 자동으로 데이터를 손상시킵니다. 두 번째 사람은 결정을 통제하고 인간에게 맡깁니다.

좋은 데이터 모델: 필드, 관계 및 메타데이터

고고학 데이터베이스는 임의의 테이블이 아니라 사려 깊은 데이터 모델(어떤 테이블, 어떤 필드, 데이터가 어떤 관계로 구성될 것인지에 대한 청사진)입니다. 기본 원칙은 모든 것이 맥락에 달려 있다는 것입니다. 즉, 맥락을 찾고, 서로의 맥락(층서학)과 현장을 찾습니다. 각 레코드에는 고유한 ID(ID)가 있으며 이러한 ID를 통해 관계가 설정됩니다. 찾기는 단일 컨텍스트를 참조하며 컨텍스트에는 여러 찾기가 포함될 수 있습니다.

녹음만큼 중요한 것은 메타데이터(데이터 자체에 대한 데이터: 누가, 언제, 어떤 방법으로, 어떤 버전으로 녹음했는지)입니다. 누가, 언제, 어떤 비밀로 입력했는지 알 수 없는 기록은 앞으로도 문제 삼을 수 없다. AI는 메타데이터 필드의 일관된 채우기를 확인하고 누락된 메타데이터에 플래그를 지정하는 데 도움이 됩니다.

또 다른 중요한 원칙은 개방적이고 지속 가능한 형식입니다. 데이터를 독점적인 폐쇄형 소프트웨어에 고정하는 대신 개방형 표준(텍스트 기반 테이블, 문서화된 스키마)에 가깝게 유지하면 수십 년 후에도 데이터를 읽을 수 있습니다. 고고학 데이터는 단일 출판물이 아닌 미래 세대를 위해 생산됩니다. 이것이 바로 FAIR 원칙(데이터 찾기, 접근 가능, 상호 운용 가능 및 재사용 가능)이 점차 표준이 된 이유입니다. AI는 이러한 원칙에 따라 데이터에 라벨을 지정하고 결함을 찾는 데 유용합니다. 그러나 어떤 데이터를 공개하고 어떤 데이터를 민감한(기밀) 상태로 유지할 것인지 결정하는 것은 귀하에게 달려 있습니다.

팁: 데이터베이스를 설정할 때 "이것을 모르는 사람이 10년 후에 열어서 이해할 수 있을까?"라고 자문해 보세요. 묻다. 용어집에서 약어를 설명하고, 메타데이터 필드를 채우고, 원시 데이터를 공개 형식으로 백업하세요.

기록/데이터베이스 작업 테이블

퀘스트

AI의 역할

인간의 결정

보호 규칙

디지털화

텍스트 인식

막연한 판독 확인

원시 스캔이 저장되었습니다.

표준화

사전에 매핑

일치하지 않는 가치 결정

원본은 보존되어 있습니다

일관성

모순 표시

교정

변경 사항이 추적됩니다.

층서학

논리 제어

코멘트

매트릭스 전문가 승인

쿼리/요약

테이블 제작

코멘트, 선택

데이터에 대한 충실도

일반적인 실수

  • 누락된 데이터를 완성합니다. AI가 구성합니다. 누락된 부분은 "불완전" 상태로 유지되어야 합니다.
  • 원시 데이터를 덮어씁니다. 원본은 항상 보존됩니다. 변경 사항은 별도로 유지됩니다.
  • 조용한 변화를 알아차리지 못합니다. 모든 자동 전환은 보고되고 감사되어야 합니다.
  • 표준을 건너뛰는 중입니다. 통제된 사전과 공통 모델이 없으면 데이터를 공유할 수 없습니다.
  • AI가 층위학적 해석을 수행하도록 합니다. AI는 논리적 모순을 찾아냅니다. 댓글은 전문가를 위한 것입니다.

요약하면

발굴 기록 및 데이터베이스의 AI; 디지털화, 표준화, 일관성 확인 및 쿼리 작업에 뛰어난 속도를 제공합니다. 그러나 데이터 무결성은 신성합니다. 누락된 부분이 그대로 남아 있지 않고, 원시 데이터가 보존되고, 모든 변경 사항이 추적되며, 층위학적 해석은 전문가의 몫입니다. 좋은 기록은 발굴이 미래에 남기는 가장 귀중한 유산입니다.

응용과제

작은 샘플 발굴 데이터 테이블(10-20개 기록)을 준비합니다. 의도적으로 거기에 몇 가지 불일치(중복 ID, 기형 날짜, 충돌하는 레이어)를 넣었습니다. AI가 "일관성 확인" 및 "해리스 매트릭스 논리 확인" 패턴을 통해 이를 찾도록 합니다. 그런 다음 제어된 사전을 작성하고 재료 필드를 "표준화" 템플릿에 매핑하고 원시 데이터를 보존하십시오.

체크리스트

  • [ ] 원시 데이터를 수정하지 않고 별도로 저장했습니다.
  • [ ] 부족한 부분을 AI가 완성하도록 만들지 않았습니다. 나는 그것을 "미완성"으로 남겨 두었습니다.
  • [ ] 각 자동 변경 사항을 원본과 함께 확인했습니다.
  • [ ] 통제된 사전과 데이터 표준을 사용했습니다.
  • [ ] 층서학적 해석은 전문가의 판단을 바탕으로 작성하였습니다.