单位 1 / 11

图书馆管理和信息管理中的人工智能简介:角色、边界、身份验证、隐私和道德

收益:

  • 能够区分人工智能在图书馆工作流程中节省时间的地方(元数据、摘要、搜索、建议)以及准确性、来源可靠性和隐私决策留给人类的地方,具体取决于风险级别。
  • 能够应用一门学科,通过将每个输出链接到源、在独立源中确认它并通过偏差过滤器来验证它。
  • 了解为什么幻觉、伪造来源和用户隐私是这个行业从一开始就必须考虑的风险。

当编目专家早上坐在办公桌前时,他可能有数十本新到的书籍、来自捐赠收藏的数百份文件以及一个等待数字化的档案箱。参考馆员(帮助用户查找信息的专家)全天回答诸如“该主题的可靠来源在哪里?”之类的问题。信息经理负责保持组织的数千个文档可发现且可靠。在本单元中,我们将阐明人工智能(简称 AI;大型语言模型和类似工具)在这些任务中究竟在哪些方面节省了时间,以及人类的判断、选择和责任在哪些方面仍然存在。

让我们从一个定义开始:人工智能,我们指的是经过大量文本训练的语言生成和模式识别软件工具。这些工具对大数据块进行总结、翻译、建议分类、生成草稿文本以及标记模式。但它不知道来源是否真实存在,信息是否正确,或者用户的隐私是否受到保护。这就是为什么在图书馆和信息管理中,人工智能是助手,而不是决策者。

人工智能在哪里起作用,在哪里不起作用?

让我们将图书馆工作流程分为三层。第一层是机械且重复的任务:从书的署名中提取草稿元数据、总结长报告、将文本从一种语言翻译成另一种语言、清理数据表。人工智能在这里很强大,可以节省大量时间。

第二层是准司法工作:给文档赋予什么主题标题,是否将某个资源纳入集合,向用户推荐什么资源。人工智能在这里提出建议,但了解机构政策和用户真正需求的专家拥有最终决定权。

第三层是纯粹的判断和问责:确认信息准确、决定版权、是否披露敏感个人数据、确认来源的可靠性。在这一层,AI的输出只是一个起点;责任完全在于人类。

提示:在向人工智能分配任务之前,问问自己:“如果这个输出是错误的,会发生什么?”如果答案是“我会浪费一些时间”,请随意使用人工智能。如果答案是“散布虚假来源、误导用户或泄露个人数据”,请务必验证输出。

幻觉:图书馆员最大的危险

幻觉是指人工智能以极其令人信服的语言产生不存在的信息、来源或引用,就好像它们是真实的一样。这对于图书馆管理和信息管理来说尤其危险;因为我们专业的本质是来源的真实性和可靠性。

当你告诉人工智能“推荐五篇关于这个主题的学术论文”时,它可以生成看似真实但根本不存在的标题、作者和期刊名称。这些捏造的来源非常令人信服,以至于读者甚至图书馆员都可以将它们添加到参考书目中而无需验证它们。在人文社会科学领域,危险更大:当“1897年的那份文件”是为历史学家捏造的,或者“那份法院判决”为法学家捏造的,其结果就是严重的错误信息。

注意:未经真实目录、数据库或来源本身验证,人工智能产生的来源引用、引用或参考不得转移到任何地方。仅仅因为它“看起来令人信服”并不意味着它是真的。

验证纪律:三步

图书馆员在使用人工智能时必须遵守的基本规则是:

1. 连接到源。每一个事实、数字、日期和印记都必须基于原始来源。询问人工智能“告诉我你从哪里得到这些信息”并独立检查该来源。

2. 独立确认。验证人工智能之外的至少一个可靠来源(真实目录、官方数据库、主要文档)中的关键信息。

3. 将其通过偏置过滤器。人工智能带有其训练数据的偏差。建议的主题、建议列表或摘要可能会突出某些观点并掩盖其他观点。问问谁被排除在外,缺少什么观点。

隐私和用户隐私

图书馆职业最基本的道德原则之一是用户隐私:一个人阅读的内容、他搜索的内容以及他感兴趣的主题都是保密的。将数据输入人工智能工具,尤其是通过互联网运行的公共工具,其中包括用户身份、搜索历史或借用资源,可能会违反这一原则;因为这些数据可能会进入第三方系统。

同样,在组织中,非机密但敏感的文档(人员信息、合同、内部信件)不应上传到通用人工智能工具。对于此类数据,首选在机构自己的安全、封闭系统上运行的工具。

提示:在将任何数据输入人工智能之前,询问“此信息是公开的吗?”问。如果答案是否定的,或者您不确定,请将这些数据采用去个性化、匿名的格式,或者仅使用该机构批准的安全工具。

三个迷你箱子

案例 1 — 400 个文档的草稿元数据。一家大学图书馆必须对一位教授捐赠的 400 份文件进行编目。专家利用人工智能从每个文档的首页提取草稿标题、日期和主题建议:每个文档的平均时间从 12 分钟减少到 4 分钟。但每一份草稿印记都与原始文件进行了比较并得到了专家的批准; AI 编造的 17 个错误日期在此步骤中被捕获。

案例 2 — 假冒消息来源被抓获。一位咨询馆员在为一名本科生寻找有关“气候移民”的资源时,收到了 YZ 的 6 篇文章建议。图书馆员在该机构的数据库中检索了所有这些文章:六分之二的文章根本不存在。验证步骤防止学生获得捏造的消息来源。

案例 3 — 防止泄露机密。一家图书馆考虑使用通用人工智能工具从结账记录中分析“哪个用户对哪个主题感兴趣”。信息管理者意识到这些数据与用户ID一起出去会侵犯隐私;这些数据首先被匿名化,并仅作为汇总的、去识别化的统计数据进行处理。

四个可复制模板

1)开始定义角色和边界:

您的角色:经验丰富的助理编目和信息管理专家。你的任务:根据我给你的来源中的信息制作一份草稿。规则: (1) 仅使用我给您的文本中的信息,不要添加您自己的信息。 (2) 不确定的地方标记“[必须验证]”。 (3) 不得编造任何日期、姓名或印记。如果你明白了,就开始吧。来源:[此处]

2)验证检查问题:

在下面的文本中列出每个事实主张(日期、名称、编号、来源引用)。对于每个:您从文本中的何处获得此信息?如果文中没有明确说明,请写“文中没有”。文本:[此处]

3)偏见和缺失的视角检查:

以下总结/建议强调了哪些观点,遗漏了哪些观点?哪些群体、地区或观点可能会被遗漏?只依靠文字,不要猜测。文本:[此处]

4)隐私预检查:

下面的文本是否包含个人数据(姓名、身份证号码、联系方式、阅读/搜索历史记录)或敏感的公司信息?如果是这样,请列出它并建议如何对其进行匿名化。文本:[此处]

弱提示/强提示

弱提示:

给我找一些关于这个主题的资源。

这个提示会邀请AI生成假资源。没有角色、边界、验证规则和资源。人工智能可以产生可信但不存在的标签。

强力提示:

您的角色:参考馆员助理。从我在下面提供的目录条目中选择与“气候移民”主题相关的内容,并解释它们为何相关。请勿添加列表以外的来源,请勿捏造来源。如果您不确定,请说“没有列出合适的来源”。目录条目:[此处]

区别很明显:强烈的提示迫使人工智能从给定的真实来源工作,而不是从自己的记忆中工作,并防止捏造。

层级及职责表

业务层

样本任务

人工智能的作用

男人的决定

机械的

元数据草稿、摘要、翻译

快速生成草稿

验证、批准

准司法

主题标题、来源建议

提供建议

按政策选择

纯粹的判断

认证、版权决定

仅提供初步信息

全部责任由个人承担

常见错误

  • 将 AI 输出替换为源。 AI是助手,不是资源;每个输出都经过验证。
  • 接受捏造的来源作为令人信服的。仅仅因为它看起来不错并不意味着它是正确的。
  • 将个人/敏感数据输入公共工具。从一开始就尊重用户隐私和公司机密。
  • 无视偏见。人工智能承载着对其进行训练的数据的观点;询问缺少什么。
  • 把判断留给AI。准确性、版权和隐私的决定权属于人类。

综上所述

人工智能;它是图书馆管理和信息管理中总结、起草、翻译和模式标记的有力助手。节省大量机械作业时间;就准司法事务提供建议;但准确性、来源可靠性、用户隐私和道德决策的验证属于人类。幻觉是这个行业最大的危险:未经核实,不得使用任何来源或引述。以明确的角色、边界和验证规则运行人工智能;通过独立来源确认每个关键输出。

应用任务

从您的领域选择一个真正的主题。向 AI 询问有关该主题的 5 条资源建议,然后在实际目录或数据库中搜索每条资源,并记下实际存在的数量。然后,使用“初创公司定义角色和边界”模板,告诉人工智能仅根据您提供的文本工作,并比较两种方法的输出。写出哪种方法会阻止拟合。

清单

  • [ ]我确定了任务在哪一层(机械、半司法、纯判断)。
  • [ ]“如果这个输出不正确会发生什么?”我问了这个问题。
  • [ ] 我已根据独立来源验证了每条信用和引文。
  • [ ] 我已检查输入 AI 的数据中没有个人/敏感信息。
  • [ ] 我保留最终决定权并承担责任。