收益:
- 能够保持数据完整性,同时利用人工智能对背景/轨迹、地层学和哈里斯矩阵等记录单元进行数字化和标准化
- 能够保护原始数据并保持每次转换的可追溯性,避免人工智能完成缺失数据和进行静默更改的风险
- 了解为什么受控字典、元数据和开放/公平原则对于数据的未来可用性至关重要。
发掘的科学价值不在于从中发现的金子,而在于其记录的质量。没有充分记录的发现几乎与科学无关。因为它是一个未知的物体,不知道在哪里、在哪一层、以及在什么情况下发现的,所以它只是一个美丽的物体。在本单元中,我们将研究挖掘记录(每个上下文、发现和观察的系统转录和数据库)以及人工智能如何加速数据输入、组织和标准化,但为什么数据完整性的责任仍然由人类承担。
基本原理:人工智能帮助整理分散的记录,标准化它们并发现不一致的地方;但哪些数据准确、记录是否反映真实情况以及数据的完整性是人类的责任。人工智能会纠正数据的形状,但不保证其准确性。
考古记录的基本单位
上下文/轨迹。每次发掘都将遗址划分为上下文单元(上下文/地点——单个矿床、层、坑或墙;挖掘意义的最小单元)。每个上下文都会收到一个唯一的编号,并且所有发现都与该编号相关联。
地层学和哈里斯矩阵。地层学(各层之间相对的前后关系)是相对年代测定的基础。哈里斯矩阵(显示上下文相对顺序的图表)将这些关系可视化。人工智能有助于检测不一致的地层关系(例如循环“A 既高于又低于 B”错误)。
查找库存。每一个发现;上下文记录有数量、类型、尺寸、材料、状况和照片。
数据标准。使用通用标准使记录可共享和可比较。 CIDOC-CRM(为描述文化遗产数据而开发的国际概念框架/本体)使来自不同机构的数据能够相互交流。使用受控术语词典(经批准的列表,确保每个人对同一概念使用相同的术语)。
提示:使用人工智能“组织和审核”数据,而不是“解释”数据。 “这些记录中哪些上下文数字是矛盾的?”这是一个好问题; “这个上下文属于什么时期?”这是一个专家的决定。人工智能最强大的地方在于一致性检查。
人工智能在登记和数据库中的作用
- 数字化。手写的挖掘笔记本、库存卡和旧图纸通过人工智能驱动的文本识别导入到数据库中(这链接到第 6 单元中的 HTR)。
- 标准化。不同的拼写(“byzantium”、“Byzantium”、“byz.”)被映射到受控字典中;日期和测量结果采用统一形式。
- 一致性检查。诸如缺失上下文编号、矛盾地层、在两个不同发现中使用相同编号等错误均被标记。
- 查询与总结。快速生成诸如“在以下上下文中找到的所有玻璃”和汇总表之类的查询。
注意:标准化时,AI 可能会在尝试“修复”数据的同时悄悄修改数据;例如,他可能将测量结果舍入为“合理”值,或者用自己的估计填写不确定的读数。每一次自动变更都必须可追溯,并且必须保存原始记录。原始数据永远不会被覆盖。
三个迷你箱子
案例 1 — 数字化保存了档案。一家博物馆保存了 40 年的手写库存卡(约 22,000 张卡),面临丢失的风险。人工智能驱动的文本识别和标准化将卡片导入可搜索的数据库中;每张卡片都由人工检查员进行抽样检查,不可读的区域被标记为“不清楚”。
情况 2 — 不一致检查发现错误。挖掘团队在赛季结束时让人工智能审核了数据库; YZ 标记三个发现具有相同的上下文编号,但层信息存在冲突。审查发现数据输入错误;如果不加以纠正,就会扭曲地层解释。
案例 3 — 发现无声的变化。在标准化测量时,一名助手注意到人工智能将一些“0”值解释为“零”而不是“缺失”;这会扭曲碎片的长度。重建流程以保留原始数据,但将更改保留在单独的列中。
四个可复制模板
1)标准化(受控字典):
您的角色:数据整理助手。将以下记录中[field:material/period/type]的值映射到以下受控字典:[dictionarylist]。更改字典中没有对应项的值;将其标记为“不匹配”。将每个更改报告为原始-新对;删除原始数据。
2)一致性检查:
查找以下挖掘记录中的不一致之处:重复的上下文编号、缺少必填字段、冲突的地层关系、尴尬的日期/测量。列出每个问题并附上注册号,交给我来解决;不要自己改变它。
3)Harris矩阵逻辑控制:
以下是背景之间的地层关系(A 高于/低于 B)。是否存在逻辑矛盾(循环、双向关系)?显示哪些上下文(如果有)。请勿评论;只需检查逻辑一致性。
4)查询及汇总表:
以下是从下面的数据库转储中摘录的内容:[例如查找每个上下文的类型分布]。以表格形式提供结果,指定每行源自哪些记录。不要添加数据中不存在的任何值;如果为空,则写“无数据”。
弱提示/强提示
弱提示:
更正此挖掘数据并填写缺失的项目。
“填补空白”让AI能够拟合数据;结果是一个事实与虚构混合在一起的不可靠的数据库。
强力提示:
仅在下面的挖掘数据中标记形式上的不一致之处(拼写、日期格式、重复 ID)。完整缺失值;将其保留为“不完整”。列出每项提议的变更以及原始变更;我会给予批准。更改原始数据。
区别:前者默默地破坏数据;第二个控制并将决定权留给人类。
良好的数据模型:字段、关系和元数据
考古数据库不是一个任意的表,而是一个深思熟虑的数据模型(哪些表、哪些字段以及数据将被组织成什么关系的蓝图)。基本原则是一切都取决于背景:发现与背景、彼此(地层学)和现场的背景。每条记录都带有唯一的身份(ID),并且通过这些身份建立关系;一个查找指的是单个上下文,一个上下文可能包含多个查找。
与记录一样重要的是元数据(有关数据本身的数据:谁记录的、何时记录的、通过什么方法记录的、什么版本)。不知道由谁、何时、以什么信心输入的记录将来不能受到质疑。人工智能有助于检查元数据字段的一致填充并标记丢失的元数据。
另一个关键原则是开放且可持续的形式。与其将数据锁定在专有的、封闭的软件中,不如使其接近开放标准(基于文本的表格、记录的模式),从而确保数据在几十年后仍可被读取。考古数据的产生不是为了单一出版物,而是为了子孙后代;这就是为什么公平原则(数据的查找、可访问、可互操作和可重用)变得越来越标准。人工智能有助于根据这些原则标记数据并发现缺陷;但哪些数据将保持开放,哪些数据将保持敏感(机密),由您决定。
提示:当您设置数据库时,问问自己:“不知道这一点的人可以在 10 年内打开并理解它吗?”问。解释术语表中的缩写,填写元数据字段,并以开放格式备份原始数据。
记录/数据库任务表
任务
人工智能的作用
人类的决定
保护规则
数字化
文字识别
模糊读数确认
原始扫描已存储
标准化
映射到字典
价值决策不匹配
原件被保留
一致性
矛盾标记
修正
更改被跟踪
地层学
逻辑控制
评论
矩阵专家认可
查询/汇总
桌子制作
评论、选择
对数据的保真度
常见错误
- 补全缺失数据。 AI补妆;缺失的部分必须保持“不完整”。
- 覆盖原始数据。始终保留原件;更改是分开保存的。
- 没有注意到无声的变化。每次自动转换都应进行报告和审核。
- 跳过标准。如果没有受控字典和通用模型,数据就无法共享。
- 让人工智能执行地层解释。 AI发现逻辑矛盾;评论是给专家的。
综上所述
挖掘记录和数据库中的人工智能;它在数字化、标准化、一致性检查和查询工作中提供了极快的速度。但数据完整性是神圣的:没有遗漏的部分完好无损,原始数据得到保留,每一个变化都被跟踪,地层解释属于专家。良好的记录是发掘留给未来的最有价值的遗产。
应用任务
准备小样本挖掘数据表(10-20条记录);故意在其中添加一些不一致的内容(重复的 ID、畸形的日期、冲突的图层)。让AI通过“一致性检查”和“哈里斯矩阵逻辑检查”模式找到这些;然后编写受控字典并将材料字段映射到“标准化”模板,并确保保留原始数据。
清单
- [ ] 我单独存储了原始数据,未修改。
- [ ]我没有让AI补齐缺失的部分;我将其保留为“不完整”。
- [ ] 我已经将每个自动更改与原始版本进行了检查。
- [ ] 我使用了受控字典和数据标准。
- [ ]我根据专家判断做出了地层解释。