单位 5 / 11

发掘记录、数据库和数据标准

收益:

  • 能够保持数据完整性,同时利用人工智能对背景/轨迹、地层学和哈里斯矩阵等记录单元进行数字化和标准化
  • 能够保护原始数据并保持每次转换的可追溯性,避免人工智能完成缺失数据和进行静默更改的风险
  • 了解为什么受控字典、元数据和开放/公平原则对于数据的未来可用性至关重要。

发掘的科学价值不在于从中发现的金子,而在于其记录的质量。没有充分记录的发现几乎与科学无关。因为它是一个未知的物体,不知道在哪里、在哪一层、以及在什么情况下发现的,所以它只是一个美丽的物体。在本单元中,我们将研究挖掘记录(每个上下文、发现和观察的系统转录和数据库)以及人工智能如何加速数据输入、组织和标准化,但为什么数据完整性的责任仍然由人类承担。

基本原理:人工智能帮助整理分散的记录,标准化它们并发现不一致的地方;但哪些数据准确、记录是否反映真实情况以及数据的完整性是人类的责任。人工智能会纠正数据的形状,但不保证其准确性。

考古记录的基本单位

上下文/轨迹。每次发掘都将遗址划分为上下文单元(上下文/地点——单个矿床、层、坑或墙;挖掘意义的最小单元)。每个上下文都会收到一个唯一的编号,并且所有发现都与该编号相关联。

地层学和哈里斯矩阵。地层学(各层之间相对的前后关系)是相对年代测定的基础。哈里斯矩阵(显示上下文相对顺序的图表)将这些关系可视化。人工智能有助于检测不一致的地层关系(例如循环“A 既高于又低于 B”错误)。

查找库存。每一个发现;上下文记录有数量、类型、尺寸、材料、状况​​和照片。

数据标准。使用通用标准使记录可共享和可比较。 CIDOC-CRM(为描述文化遗产数据而开发的国际概念框架/本体)使来自不同机构的数据能够相互交流。使用受控术语词典(经批准的列表,确保每个人对同一概念使用相同的术语)。

提示:使用人工智能“组织和审核”数据,而不是“解释”数据。 “这些记录中哪些上下文数字是矛盾的?”这是一个好问题; “这个上下文属于什么时期?”这是一个专家的决定。人工智能最强大的地方在于一致性检查。

人工智能在登记和数据库中的作用

  • 数字化。手写的挖掘笔记本、库存卡和旧图纸通过人工智能驱动的文本识别导入到数据库中(这链接到第 6 单元中的 HTR)。
  • 标准化。不同的拼写(“byzantium”、“Byzantium”、“byz.”)被映射到受控字典中;日期和测量结果采用统一形式。
  • 一致性检查。诸如缺失上下文编号、矛盾地层、在两个不同发现中使用相同编号等错误均被标记。
  • 查询与总结。快速生成诸如“在以下上下文中找到的所有玻璃”和汇总表之类的查询。
注意:标准化时,AI 可能会在尝试“修复”数据的同时悄悄修改数据;例如,他可能将测量结果舍入为“合理”值,或者用自己的估计填写不确定的读数。每一次自动变更都必须可追溯,并且必须保存原始记录。原始数据永远不会被覆盖。

三个迷你箱子

案例 1 — 数字化保存了档案。一家博物馆保存了 40 年的手写库存卡(约 22,000 张卡),面临丢失的风险。人工智能驱动的文本识别和标准化将卡片导入可搜索的数据库中;每张卡片都由人工检查员进行抽样检查,不可读的区域被标记为“不清楚”。

情况 2 — 不一致检查发现错误。挖掘团队在赛季结束时让人工智能审核了数据库; YZ 标记三个发现具有相同的上下文编号,但层信息存在冲突。审查发现数据输入错误;如果不加以纠正,就会扭曲地层解释。

案例 3 — 发现无声的变化。在标准化测量时,一名助手注意到人工智能将一些“0”值解释为“零”而不是“缺失”;这会扭曲碎片的长度。重建流程以保留原始数据,但将更改保留在单独的列中。

四个可复制模板

1)标准化(受控字典):

您的角色:数据整理助手。将以下记录中[field:material/period/type]的值映射到以下受控字典:[dictionarylist]。更改字典中没有对应项的值;将其标记为“不匹配”。将每个更改报告为原始-新对;删除原始数据。

2)一致性检查:

查找以下挖掘记录中的不一致之处:重复的上下文编号、缺少必填字段、冲突的地层关系、尴尬的日期/测量。列出每个问题并附上注册号,交给我来解决;不要自己改变它。

3)Harris矩阵逻辑控制:

以下是背景之间的地层关系(A 高于/低于 B)。是否存在逻辑矛盾(循环、双向关系)?显示哪些上下文(如果有)。请勿评论;只需检查逻辑一致性。

4)查询及汇总表:

以下是从下面的数据库转储中摘录的内容:[例如查找每个上下文的类型分布]。以表格形式提供结果,指定每行源自哪些记录。不要添加数据中不存在的任何值;如果为空,则写“无数据”。

弱提示/强提示

弱提示:

更正此挖掘数据并填写缺失的项目。

“填补空白”让AI能够拟合数据;结果是一个事实与虚构混合在一起的不可靠的数据库。

强力提示:

仅在下面的挖掘数据中标记形式上的不一致之处(拼写、日期格式、重复 ID)。完整缺失值;将其保留为“不完整”。列出每项提议的变更以及原始变更;我会给予批准。更改原始数据。

区别:前者默默地破坏数据;第二个控制并将决定权留给人类。

良好的数据模型:字段、关系和元数据

考古数据库不是一个任意的表,而是一个深思熟虑的数据模型(哪些表、哪些字段以及数据将被组织成什么关系的蓝图)。基本原则是一切都取决于背景:发现与背景、彼此(地层学)和现场的背景。每条记录都带有唯一的身份(ID),并且通过这些身份建立关系;一个查找指的是单个上下文,一个上下文可能包含多个查找。

与记录一样重要的是元数据(有关数据本身的数据:谁记录的、何时记录的、通过什么方法记录的、什么版本)。不知道由谁、何时、以什么信心输入的记录将来不能受到质疑。人工智能有助于检查元数据字段的一致填充并标记丢失的元数据。

另一个关键原则是开放且可持续的形式。与其将数据锁定在专有的、封闭的软件中,不如使其接近开放标准(基于文本的表格、记录的模式),从而确保数据在几十年后仍可被读取。考古数据的产生不是为了单一出版物,而是为了子孙后代;这就是为什么公平原则(数据的查找、可访问、可互操作和可重用)变得越来越标准。人工智能有助于根据这些原则标记数据并发现缺陷;但哪些数据将保持开放,哪些数据将保持敏感(机密),由您决定。

提示:当您设置数据库时,问问自己:“不知道这一点的人可以在 10 年内打开并理解它吗?”问。解释术语表中的缩写,填写元数据字段,并以开放格式备份原始数据。

记录/数据库任务表

任务

人工智能的作用

人类的决定

保护规则

数字化

文字识别

模糊读数确认

原始扫描已存储

标准化

映射到字典

价值决策不匹配

原件被保留

一致性

矛盾标记

修正

更改被跟踪

地层学

逻辑控制

评论

矩阵专家认可

查询/汇总

桌子制作

评论、选择

对数据的保真度

常见错误

  • 补全缺失数据。 AI补妆;缺失的部分必须保持“不完整”。
  • 覆盖原始数据。始终保留原件;更改是分开保存的。
  • 没有注意到无声的变化。每次自动转换都应进行报告和审核。
  • 跳过标准。如果没有受控字典和通用模型,数据就无法共享。
  • 让人工智能执行地层解释。 AI发现逻辑矛盾;评论是给专家的。

综上所述

挖掘记录和数据库中的人工智能;它在数字化、标准化、一致性检查和查询工作中提供了极快的速度。但数据完整性是神圣的:没有遗漏的部分完好无损,原始数据得到保留,每一个变化都被跟踪,地层解释属于专家。良好的记录是发掘留给未来的最有价值的遗产。

应用任务

准备小样本挖掘数据表(10-20条记录);故意在其中添加一些不一致的内容(重复的 ID、畸形的日期、冲突的图层)。让AI通过“一致性检查”和“哈里斯矩阵逻辑检查”模式找到这些;然后编写受控字典并将材料字段映射到“标准化”模板,并确保保留原始数据。

清单

  • [ ] 我单独存储了原始数据,未修改。
  • [ ]我没有让AI补齐缺失的部分;我将其保留为“不完整”。
  • [ ] 我已经将每个自动更改与原始版本进行了检查。
  • [ ] 我使用了受控字典和数据标准。
  • [ ]我根据专家判断做出了地层解释。