收益:
- 在将敏感个人数据上传到基于云的工具之前能够扫描隐私并选择适当的方法(匿名化、封闭工具)
- 能够在使用前澄清材料的版权状况和文化敏感性
- 能够认识到人工智能会重现来源的偏见,添加关键框架并透明地声明人工智能的使用
历史和档案材料并不是中立的大量数据。民事登记处可能包含在世人员的个人信息,法庭档案可能包含敏感的私人生活、被社区视为神圣的文化材料、仍受版权保护的作品。随着人工智能使操纵这种材料变得更加容易,滥用它的后果也越来越严重。本单元深化了围绕整个模块的道德框架:隐私、版权、文化敏感性以及人工智能使用的透明度和真实性。
这些问题不是技术问题,但至少与技术问题一样重要;因为侵犯隐私、侵犯版权或忽视社区的敏感性会造成法律后果和不可挽回的信任损失。
隐私:生者和死者的权利
档案文件通常包含个人数据:姓名、地址、健康信息、法庭记录、宗教/种族起源。其中一些属于活着的人,并受到个人数据保护立法的约束(例如土耳其的 KVKK、欧洲的 GDPR)。
- 活着的人:将包含可识别敏感数据的文档上传到基于云的公共人工智能工具可能会构成严重违规。这些工具可以存储数据、在教育中使用数据或披露数据。
- 死者:即使法律保护减弱,道德责任仍然存在;不必要地透露一个人敏感的过去可能会损害他们及其家人的尊严。
- 访问限制:许多档案馆对敏感文档施加一定时间的访问限制。人工智能的“效率”不能成为克服这些限制的理由。
注意:在将文档上传到基于云的人工智能工具之前,请务必询问:“如果此内容泄露到互联网上,谁会受到伤害?”如果答案是“其中一个”,请首先寻求公司批准、数据匿名化以及本地/封闭工具(如果可能)。随意上传个人数据是不可逆转的。
版权:并非所有文件都是公开的
文档实际存在于存档中并不意味着您可以自由使用它。版权是属于作品创作者的权利,并在一定期限内提供保护。
- 公共领域:版权到期的作品可以自由使用。持续时间因国家和工作而异。
- 受版权保护的作品:信件、照片、未发表的文章可能受版权保护;将它们提供给 AI 或发布它们可能会构成侵犯权利。
- AI与版权:让AI处理受版权保护的文本意味着将其转移到第三方(工具提供商)的系统;这可能会导致版权和合同方面的问题。
文化敏感性和社区权利
一些历史材料触及某些群体的记忆、信仰或身份。这包括殖民时期的记录、属于土著/少数民族社区的材料以及被视为神圣的文件。这里的指导原则是尊重制作材料或其代表的社区的声音和权利。人工智能的“最有效”建议不能忽视社区对其自身历史的发言权。此外,人工智能可能会在不知不觉中复制历史资料中的偏见、贬损或排他性语言;有必要对这种语言保持警惕。
透明度和真实性
在人文学科中,原创性(作品确实是你自己劳动的产物)和透明度(清楚地传达你的方法)是核心价值观。
- 声明人工智能的使用:如果转录、元数据或翻译是在人工智能的帮助下生成的,请记录下来。后续的研究人员应该能够验证。
- 劳动所有权的限制:将人工智能产生的评论或文本作为自己的原创想法呈现是违反学术诚实的。
- 遵循机构和出版指南:许多机构和期刊都制定了如何声明人工智能使用的规则。
主题
基本问题
如果出错的后果
隐私
这些数据可以识别谁的身份?
违法、侵犯隐私
版权
我有权利使用这个吗?
侵权、诉讼
文化敏感性
这是谁的记忆?
失去信任和尊重
透明度
我有没有提到我使用人工智能?
学术诚信违规
偏见
谁的声音失真/缺失?
歪曲历史
三个迷你箱子
案例 1 — 上传健康记录。一名研究人员将一份 20 世纪的医院记录(包括识别活着的人后代的信息)直接加载并转录到公开可用的人工智能工具中。该机构的数据保护官员注意到了这一情况;该文件包含敏感个人数据,上传属于违规行为。教训:如果没有封闭/批准的工具,敏感的个人数据不会上传。
案例 2 — 受版权保护的照片。对于出版物,来自档案馆的受版权保护的照片经过人工智能增强并发布。摄影师的继承人举报了侵犯权利的行为。进入档案并不授予使用权。教训:每种材料的版权状况在使用前都应明确。
案例 3——偏见的再现。一名学生让 YZ 总结了一份殖民时代的记录。摘要毫无疑问地转载了贬义性语言和来源的片面观点;该社区的观点完全不存在。在导师的警告下,该学生用关键框架重新检查了来源,并添加了缺失的音频。教训:人工智能复制了来源的偏见;添加关键框架和缺失的声音是研究人员的工作。
四个可复制模板
1)安装前隐私检查:
在将以下文档文本加载到 AI 工具之前执行隐私检查: (1) 是否存在可识别当前或近期个人身份的敏感数据(健康、宗教、种族、地址)? (2) 如果有,是哪些部分? (3) 可以匿名吗?最终决定权在我;您标记危险区域。文本:[此处]
2)版权状况评估:
有关以下材料的类型、预计日期和创建者的信息如下:[信息]。列出我应该提出哪些版权问题以及在使用前我应该澄清哪些内容。作出最终的法律判决;提供检查点。
3)偏差和缺少音量控制:
在下面的历史来源摘要中:(1)来源自己的偏见/贬义语言在哪里再现,(2)缺少哪个群体/观点的声音?突出这些并建议如何批判性地构建它们。摘要:[此处]
4)人工智能使用声明草案:
在一项研究中,我将人工智能用于:[转录/翻译/元数据/摘要]。撰写一份可用于学术透明度的“人工智能使用声明”草案:在什么工作中,使用什么工具,如何进行人工验证。夸张;诚实、清晰。
弱提示/强提示
弱:
为我处理此存档文档并提取其内容。
文件的机密性、版权和敏感度状态直接提供给AI,不受质疑;违规风险仍然是看不见的。
强的:
在处理本文档之前:标记可能在敏感个人数据、版权和文化敏感性方面构成风险的任何区域。如果有风险的部分,我会审查我的处理方法(匿名化、确认、封闭工具)。仅提取批准的内容。文档:[此处]
区别在于:在处理之前进行风险筛查,标记风险内容并审查方法,首先防止道德违规。
常见错误
- 随意上传敏感数据。如果没有封闭/批准的工具和匿名化(如有必要),则不会上传个人数据。
- 假设“它在档案馆里,我可以使用它”。物理访问并不授予版权;情况已经澄清。
- 忽视文化敏感性。一个社区对其自身历史有发言权的权利受到尊重。
- 毫无疑问地复制偏见。来源的片面语言通过一个关键框架得到解决,并添加了缺失的声音。
- 隐藏人工智能的使用。透明度是学术诚实的要求;声明了用途。
总之
道德是围绕该模块的技术单元的框架。隐私包括保护敏感的个人数据;明确版权、使用权;文化敏感性,尊重社区对其自身历史有发言权的权利;透明度和真实性需要诚实地声明人工智能的使用。人工智能还会重现来源的偏见;研究人员有责任为此添加关键框架和缺失的声音。效率永远不能成为超越这些原则的理由。随着技术力量的增强,道德关注也必须增加。
应用任务
选择您要处理的文档。首先,使用“预安装隐私检查”模板扫描敏感数据并标记有风险的部分。然后用“版权状况评估”去掉使用前需要澄清的问题。最后,通过“偏差和缺失量检查”来审查来源摘要。就是否适合将文档上传到基于云的工具做出合理的决定。
清单
- [ ] 我在上传之前扫描了敏感的个人数据。
- [ ] 我已澄清该材料的版权状况。
- [ ] 我观察到文化敏感性和社区权利。
- [ ] 我用一个批判框架解决了来源的偏见。
- [ ] 我已经透明地声明了我对人工智能的使用。