收益:
- 能够通过评估输入的版权状况和工具的数据条件并对输出的权利提出质疑来降低法律风险
- 能够通过匿名化和最小化来保护个人数据,并通过对用户透明来确保隐私
- 能够为机构建立治理框架,其中包括批准的工具、禁止的数据和验证规则,并根据图书馆价值观测试其使用。
图书馆员和信息管理者不仅要组织和呈现信息,还要保护信息:保护创建者的权利、用户的隐私和机构的责任。人工智能向这三个领域提出了新的、复杂的问题。将文档上传到AI是否侵犯版权?将用户数据提供给人工智能工具是否侵犯隐私?组织应如何管理人工智能的使用?在这个结束单元中,我们将建立一个框架,将我们在整个模块中涉及的道德和法律线索结合在一起。
让我们定义一下这些概念。版权是授予作品创作者使用其作品的合法权利;未经授权的复制或使用可能被视为侵权。个人数据是直接或间接识别个人身份并受法律保护的任何信息。治理是管理组织对人工智能的使用的规则、政策和问责制框架。这三个概念构成了负责任的人工智能使用的法律和道德基础。
循序渐进:负责任且合法地使用人工智能
1.评估参赛作品的版权状况。在将文本、书籍或文章加载到人工智能工具之前,请考虑该作品的版权状态以及该工具的使用条款。将受版权保护的作品提供给使用您上传的数据用于其自身目的的工具可能会构成侵犯权利。
2.质疑输出的权利。 AI产生的文本的版权状况可能是不确定的,AI可能会在不知不觉中复制训练数据中受版权保护的内容。在发布人工智能输出之前,评估其原创性和潜在的违规行为。
3. 保护个人数据。用户的身份、阅读/搜索历史和个人信息在未经明确同意和强有力的保护的情况下不应进入任何人工智能工具。匿名化和数据最小化(仅提供必要的数据)至关重要。
4. 确保透明度和同意。用户应该知道他们的数据和交互是如何处理的;如果涉及人工智能,就应该明确说明。使用隐蔽人工智能会破坏信任。
5. 建立治理框架。组织应在书面政策中确定哪些工具得到批准、可以输入哪些数据、谁负责以及如何验证输出。
提示:为您的组织创建一个简单的“人工智能使用规则”表格:哪些工具得到批准,哪些数据永远不会输入(个人/专有/机密),每个输出如何验证以及谁负责。清晰的一页指南比冗长的政策更具可执行性。
图书馆管理的道德原则和价值观
图书馆员职业根深蒂固的价值观是人工智能时代的指南针:平等获取信息、思想自由、用户隐私、知识诚实和公正。人工智能可以支持或威胁这些价值观。它可能会扩大准入,但会加剧偏见;可能会加快服务速度,但可能会损害隐私;它可能有助于发现,但可能传播错误信息。
负责的图书馆员根据这些价值观测试每个人工智能的使用:“这种使用是否平等访问或排除某个群体?它是否保护隐私?它是否提供准确和诚实的信息?”人工智能是一种工具;您将使用它的价值观是该职业的本质。技术在不断变化,但这些价值观是图书馆事业不变的指南针。
注意:“每个人都在使用它”或“它很快”并不能证明使用人工智能是合理的。即使使用是合法的,也可能是不道德的;不要仅仅因为简单就采取对版权、隐私和正义有害的做法。最终的责任不在于工具,而在于使用它的专业人员。
三个迷你箱子
情况 1 — 受版权保护的下载已停止。一个团队计划将整本受版权保护的参考书加载到通用人工智能工具中以生成摘要。信息管理员发现这在版权和工具的数据使用条款方面都存在风险;相反,它只是在该机构的封闭系统内进行了简短的、经过授权的摘录的研究。
案例 2 — 个人数据匿名化。一家图书馆想要利用人工智能分析用户反馈;但反馈中包含用户名和联系信息。该团队在分析前对数据进行了匿名处理;仅处理匿名的集体倾向。隐私得到保护,洞察力重新获得。
案例 3——治理差距弥合。在一个组织中,员工在没有监督的情况下使用不同的人工智能工具,有时还输入机密文件。信息管理员发布了一页政策,定义了批准的工具、禁止的数据类型和验证规则;不确定性和风险显着降低。
人员能力和企业文化
治理政策的有效性取决于执行它的人。如果员工不了解人工智能的风险,即使写得最好的规则也只是纸上谈兵。因此,负责任地使用人工智能的持久基础是员工能力:每个员工都了解什么是幻觉、哪些数据不应该输入,以及为什么应该验证输出。图书馆和信息机构在这方面具有双重作用;它必须既培训自己的员工,又向用户传播这种素养。良好的企业文化是报告人工智能错误而不是隐藏它,并认为说“我不确定这个输出,让我们验证一下”是很正常的。在一个因害怕受到惩罚而隐藏错误的环境中,捏造的消息来源或侵犯隐私的行为会被忽视。此外,由于技术和工具日新月异,政策和培训应定期更新,而不是一次性更新。治理;这是一个规则、工具、教育和文化共同发挥作用的生命系统。该系统的中心是有能力的人,而不是车辆,他负责并做出最终决定。
提示:在采用新的人工智能工具之前,先做一个小试点:与有限的团队一起尝试真实但低风险的任务,记录错误和风险。在整个组织内推广该工具之前,这既可以培养能力,又可以揭示政策漏洞。
四个可复制模板
1)版权初审:
在将以下内容加载到人工智能工具之前,请帮助我评估其版权:该内容是否受版权保护,哪种使用方式有风险,哪种替代方案(摘录、许可、公共领域)更安全?内容类型:[此处]
2)个人资料扫描:
以下文本是否包含个人数据(姓名、联系方式、身份、阅读/搜索历史、暗示健康/信仰的信息)?对每一个进行标记,对其进行分类并建议如何对其进行匿名化。文本:[此处]
3)人工智能使用政策草案:
为我们的组织起草一页人工智能使用指南:(1) 批准的工具策略,(2) 从未输入的数据类型,(3) 输出验证规则,(4) 问责制和透明度,(5) 版权和隐私政策。保持简短且可操作。上下文:[此处]
4)伦理控制查询:
根据图书馆价值观测试以下计划的人工智能使用:访问公平性、隐私、准确性/完整性、偏见风险以及标记问题(如果有)。用法:[此处]
弱提示/强提示
弱提示:
我应该把它放在AI上来总结这本书吗?
该问题未考虑工具的版权、数据条件和替代方案;回答“是”可能会导致权利受到侵犯。
强力提示:
您的角色:助理版权和隐私顾问。我正在考虑将以下内容提供给人工智能工具。列出版权状况、车辆数据使用和个人数据风险等方面可能出现的问题;建议更安全的替代方案(简短报价、许可、公共领域、封闭系统)。声称法律确定性,显示风险。内容和背景:[此处]
强大的提示功能;它从版权、数据条件和隐私方面考虑了这一决定,并提出了安全的替代方案。
治理维度表
尺寸
基本问题
预防措施
版权
是否存在输入/输出侵权?
许可,公共领域,简短摘录
隐私
个人数据受到保护吗?
匿名化、最小化
透明度
用户知道吗?
信息清晰,同意
责任
谁负责?
书面政策,人工批准
价值观
访问和完整性受到保护吗?
道德检查、偏见检查
常见错误
- 不假思索地上传受版权保护的内容。存在版权侵权和数据状况的风险。
- 将个人数据输入公共工具。侵犯隐私和法律风险。
- 隐藏人工智能的使用。没有透明度,信任就会受损。
- 混淆“合法”与“道德”。合法使用可能是不道德的。
- 没有建立治理框架。不受控制的使用会产生不可预测的风险。
总之
版权、保密性和道德是人工智能时代图书馆责任的基础。评估参赛作品的版权状况以及工具的数据状况;质疑输出的权利;通过匿名化和最小化保护个人数据;对用户透明并获得同意;在组织中建立清晰的治理框架。图书馆根深蒂固的价值观(平等访问、隐私、诚信、公正)是检验人工智能每次使用的指南针。技术变革;责任和价值观不会改变,最终的责任始终在于人。
应用任务
使用“人工智能使用政策草案”模板为您的组织(或虚构的组织)准备一页使用规则文档:批准的工具、永远不会输入的数据、验证规则、责任。然后,使用“道德控制查询”模板测试您计划的访问、隐私、准确性和偏见的真实人工智能用途,并写下您将如何解决出现的任何问题。
清单
- [ ] 我评估了该条目的版权状况以及该工具的数据状况。
- [ ] 我对个人数据进行了匿名处理,并仅使用必要的数据。
- [ ] 我对人工智能的使用一直向用户保持透明并尊重用户的同意。
- [ ] 我为该组织制定了书面的人工智能使用政策。
- [ ] 我用图书馆员的价值观测试了用法,并将责任留给了人类。
模块考试
1、以下哪项是人工智能在图书馆和信息管理领域最准确的定位?
- A) AI是摘要、元数据、搜索和推荐助手;准确性、来源可靠性和道德决策的责任在于人类 ✔
- B)人工智能可以可靠地验证来源的真实性和准确性
- C) 人工智能只适用于图书编目,与其他图书馆工作无关
- D)由于人工智能比人类更加公正,因此主题和分类决定应该留给它。
描述:人工智能;它是一个助手,负责起草元数据、总结元数据、翻译元数据、标记模式并将其指向源。有能力的专家负责高后果的任务,例如准确性验证、主题和分类决策、来源可信度以及版权和隐私决策;未经验证的输出可能会导致伪造来源的传播或侵犯隐私。
2. 为什么“幻觉”对图书馆员来说特别危险?
- A)人工智能的输出产生非常慢并且浪费时间
- B) 人工智能可以令人信服地产生不存在的来源和报价,而职业的本质是来源的真实性✔
- C) 幻觉只发生在图像处理中,与文本无关
- D)幻觉只出现在非常古老的人工智能工具中,而不是当前的工具中。
解释:幻觉是指人工智能以极其令人信服的方式产生不存在的来源、引用或信息。由于专业的本质是来源的真实性和可靠性,如果将捏造的印记或引述未经核实地转移给参考书目或用户,就会发生严重的错误信息。
3. 人工智能生成元数据时,以下哪项是伪造风险最高的领域?应如何解决?
- A) 语言区是风险最大的区,不需要验证
- B) 标题字段风险最高,应填写预测
- C) ISBN 和出版年份具有最高的伪造风险,应逐字核实原始来源 ✔
- D)没有哪个领域是有风险的,因为人工智能总是正确地生成元数据
解释:精确的数字字段,如 ISBN 和出版年份,很容易被 AI 伪造;人工智能可以生成看起来合理的数字,而不是它不知道的 ISBN。这些字段必须逐字验证原始来源(条形码、印记/彩页)。
4. 在分配主题术语时使用“受控词汇”的主要目的是什么?
- A) 确保记录中术语的一致性和可用性;防止人工智能编造免费条款✔
- B) 自动将人工智能请求的每个新术语添加到目录中
- C) 完全消除主题词并仅按标题搜索
- D)放慢编目速度并用不同的术语编写每条记录
描述:受控词汇表是经过批准的标准术语列表。如果同一主题在不同的记录中使用不同的术语,则用户会找到一个而错过另一个。通过向 AI 提供此列表并告诉它“仅从列表中选择”,可以保持一致性和可查找性;人工智能未列出的新术语不应添加到目录中。
5. 从人工智能获取文档分类号时,正确的做法是什么?
- A) 人工智能给出的准确数字应直接接受,无需看官方表格
- B) 根本不应该使用分类号,来源应该随机搁置
- C) 大师班建议应视为初步,具体步骤应以官方分类表核实✔
- D)由于人工智能无法分类,因此应完全跳过此任务
解释:人工智能通常可以找到正确的专业类别,但可能会错过子级别(例如病史而不是医学)或产生看似合理的错误数字。因此,大师班提案应被视为一个开始,具体步骤应通过官方分类表进行验证。
6. 比较语义搜索和关键词搜索时,哪一个说法是正确的?
- A)在所有情况下语义搜索都应该取代关键字搜索
- B) 语义搜索找到语义相关的资源;关键字搜索精确标题或 ISBN 更可靠 ✔
- C)关键字搜索比语义搜索更好地找到语义相关的不同术语的来源
- D)语义搜索仅适用于数字数据,不适用于文本
描述:语义搜索可以找到不同单词但相关的资源,例如“睡眠问题”和“睡眠障碍”,因为它与单词的含义相匹配(通过嵌入向量)。相比之下,当查找准确的 ISBN、完整标题或法规编号时,关键字/域搜索更为可靠。最佳实践是同时使用两者。
7. 针对个性化资源推荐中的“过滤泡沫”风险,图书馆员的职责是什么?
- A)通过只向用户推荐最相似的资源来强化泡沫
- B) 完全放弃提出建议
- C) 公开分享用户的阅读历史
- D) 有意识地添加具有不同观点和视野的来源,并透明地陈述这一点 ✔
解释:过滤气泡是指推荐系统不断地将用户锁定在相似的内容中,并使他们远离新的和不同的观点。图书馆的价值在于平等和多样化的访问;因此,图书馆员有意识地通过添加看起来不同、令人大开眼界的资源并透明地说明这一点来打破泡沫。
8. 在利用人工智能处理档案文件时,哪种做法在“真实性和完整性”方面是正确的?
- A) 用人工智能“美化”文档,补足缺失部分并替换原来的内容
- B)删除原始的原始版本,仅保留经过人工智能改进的版本
- C) OCR 只能纠正识别错误,不得修改内容,应保留原始原件,并明确标记衍生品 ✔
- D) 接受 OCR 输出作为“干净文本”,不进行任何更正,并将其打开进行搜索。
描述:档案工作的本质是确保文档来自声称的来源并且其内容未被更改。 OCR修正只能消除识别错误,不能改变内容;人工智能“恢复”并不能替代实际证据,因为它可以弥补缺失的部分。原始(原始)扫描应始终保存,衍生品应清晰标记。
9. 负责任地构建图书馆信息机器人需要满足以下哪些条件?
- A)机器人根据常识快速给出每个问题的答案,并且不引用来源
- B) 机器人仅依赖经过验证的公司信息、引用事实并向专家/人类提出敏感问题 ✔
- C) 机器人直接就医疗和法律问题提供精准建议
- D)对用户隐藏,无论他是在与机器人还是人类交谈
说明:建议机器人应仅依赖于经过验证的当前信息和机构来源列表,而不是其一般记忆,应通过引用来源提供事实,不应就医疗/法律/敏感问题提供建议,应将其引导给专家,并应在必要时将其转移给人类。因此,机器人并没有取代人类,而是成为减轻负担的一层。
10. 在文献计量学中,找出作者的引用计数或 h 指数的正确方法是什么?
- A)直接询问人工智能,因为它给出的数字总是正确的
- B) 从实际引文数据库中获取数字;仅使用人工智能来组织和解释这些数据✔
- C) 估计数字并在广播决策中使用它们
- D) 将引用次数视为作者作品质量的直接衡量标准。
解释:人工智能可以在不访问真实数据的情况下编造诸如引用计数和 h-index 之类的值(例如,它可以在实际为 19 时给出值 42)。因此,数字和引文必须取自真实的引文数据库;人工智能只能用于对这些真实数据进行聚类、排序和解释。
11. 关于文献计量指标的限制(引用次数、h 指数、影响因子),哪一项是正确的?
- A)指标直接衡量质量并且跨领域具有可比性
- B) 标准可以安全地单独用于招聘和晋升决策。
- C) 指标表明使用情况,而不是质量;不能跨领域比较,必须与定性评估相平衡✔
- D)人文学科的成果在引文数据库中得到充分、完整的体现
披露:这些指标表明使用情况和可见性,它们不是质量的直接衡量标准。由于各个领域的引用文化不同(例如医学和哲学),因此不能直接比较;人文学科中以书籍为主的产出在数据库中代表性不足。因此,标准不应单独用于评价个体,而应与定性评价相平衡。
12. RAG(访问增强制造)方法相对于通用人工智能的主要优势是什么?
- A) 通过将答案与机构的真实文件联系起来并引用来源来显着减少幻觉✔
- B) 无论文档库的质量如何,始终完美响应
- C)使幻觉完全且永久不可能发生
- D)向所有人开放所有文档,无需访问控制
说明:在回答问题时,RAG 首先从该机构自己的文件中查找相关内容,并仅根据这些内容给出答案,并引用来源。这样,答案就会与真实且可追溯的文档联系起来,幻觉就会大大减少。然而,RAG 并不能完全消除幻觉,因为如果提出错误的部分,答案仍然可能是错误的。
13. 在人文社会科学领域,验证人工智能对用户的引用最可靠的方法是什么?
- A)确保引言看起来可信且流畅
- B) 只需要求 AI 重现相同的引言
- C) 通过在作者的实际作品中查找来验证引用✔
- D) 接受这句话出自名人之名就足够了
描述:人工智能可以生成完全捏造的引文,出自真实作者之手;这句话似乎逐字准确且令人信服,这一事实并不能证明其准确性。最可靠的方法是在作者的实际作品中查找来验证引用; “这位作者可能会说这样的话”的逻辑是不够的。
14. 在版权、隐私和道德方面,使用人工智能的哪项原则是正确的?
- A) 受版权保护的数据和个人数据可以不假思索地输入公共工具,因为速度很快
- B) 如果使用合法,则绝对符合道德,无需进一步评估。
- C)当人工智能产生输出时,责任完全转移给工具,而不是人类。
- D) 从一开始就必须尊重版权和隐私;匿名、透明度和同意至关重要,最终责任在于人 ✔
说明:将受版权保护的内容和个人数据(用户ID、阅读/搜索历史)冲动地输入到通用人工智能工具中可能会导致权利和隐私受到侵犯;匿名化、数据最小化、透明度和同意至关重要。此外,即使使用是合法的,也可能是不道德的; “每个人都使用它”或“它发生得很快”并不能证明这种做法是合理的,最终的责任在于专家,而不是工具。