收益:
- 能够理解语义搜索如何找到关键字搜索错过的相关资源及其含义的接近性,并能够同时使用这两种方法。
- 能够根据人工智能支持的发现系统摘要是否基于源进行批判性评估,并与源进行确认。
- 能够澄清用户模糊的问题并在可靠性方面区分“看似相关”的结果
用户在目录中搜索“儿童睡眠问题”,但最热门的相关资源标题为“小儿睡眠障碍”。经典搜索可能根本不显示此来源,因为它与单词完全匹配。这就是语义搜索发挥作用的地方:它是一种匹配单词含义而不是拼写的搜索形式。在本单元中,您将了解基于人工智能的语义搜索和发现系统如何工作、它们给图书馆员带来什么以及它们存在哪些陷阱。
让我们定义基本概念。语义搜索的核心是嵌入:将文本的含义转换为数字向量(一种含义坐标)的技术。含义相近的文本在这个数字空间中彼此接近。因此,虽然“睡眠问题”和“睡眠障碍”是不同的词,但它们的位置很接近,搜索其中一个也会找到另一个。这就是捕捉关键词搜索错过的相关资源的力量。
一步一步:理解和使用语义搜索
1.了解用户的真实意图。语义搜索试图捕捉用户的意思。作为图书管理员,您的工作是澄清用户模糊的问题并向搜索系统提供正确的输入。
2.关键词和语义搜索结合使用。语义搜索查找具有相关但不同单词的资源;在查找确切的术语、名称或代码(作者姓名、法律编号)时,关键字搜索更可靠。优秀的图书管理员会同时使用两者。
3. 批判性地评估结果。语义搜索返回“看起来相关”的结果;但看起来相关并不意味着准确或值得信赖。您评估结果的来源和及时性。
4. 教授用户搜索策略。发现系统功能强大,但用户经常使用单个单词进行搜索。图书馆员的任务之一是教用户更好地搜索。
提示:当寻找非常精确的信息(特定的 ISBN、完整的标题、作者的所有作品)时,语义搜索可能比关键字/域搜索弱;因为它混淆了“意义相近”的其他结果。使用基于域的搜索来获取精确信息,使用语义搜索来进行发现和主题浏览。
发现系统和人工智能驱动的摘要
现代发现系统不再仅仅提供结果列表;有些通过人工智能直接给出问题的总结答案。这是一个强大但有风险的趋势。如果系统根据集合中的实际来源生成摘要并引用来源,这会很有用。但如果系统根据自己的一般记忆生成答案而不引用来源,则可能会带来产生幻觉的风险,并可能误导用户。
图书馆员的作用是告诉用户此类摘要是否基于来源。 “系统给出的摘要是一个开始,到原始来源去验证”是信息素养的基础。
注意:即使人工智能驱动的发现摘要引用了来源,也不要假设引用的来源实际上支持该信息。有时系统会显示正确的来源,但返回错误的摘要。对于关键用途,请与用户一起打开并检查资源的相关部分。
三个迷你箱子
案例 1 — 发现转义源。一位研究人员正在寻找有关“城市热岛”的资源,但该系列中最好的研究的标题是“城市的热舒适度”。关键词搜索漏掉了这个;由于其语义接近性,语义搜索使其跻身前五个结果之列。研究人员找到了他原本不会看到的来源。
案例 2——误导性的“兴趣”。一位用户搜索“法国大革命的经济原因”。语义搜索还对一些总体上与“革命与经济”主题有关但与法国大革命无关的来源进行了排名。图书馆员意识到这些“看似相关”的结果实际上与主题并不相符,并引导用户找到正确的资源。
案例 3 — 摘要验证。一个发现系统对一个问题给出了人工智能摘要,并引用了两个来源。图书馆员打开了资料来源:一个支持摘要,另一个则与摘要相反。系统误解了资源。图书管理员向顾客展示了正确的来源和实际发现。
排名、可见性和公平性
搜索结果中哪些资源出现在顶部,哪些资源出现在底部,这并不是一个无害的技术细节;绝大多数用户只看前几个结果。因此,排名决定了实际看到的信息。基于人工智能的排名根据其学到的模式计算其“相关性”指标,这些模式可能倾向于突出流行的、被高度引用的或某些语言的来源。因此,新的或不同语言的有价值但鲜为人知的资源可能仍然不可见。图书馆员的工作是知道顺序不是一个中立的事实,并教导用户超越最初的结果,尝试不同的搜索词,并对结果的顺序提出质疑。 “前三个来源”永远不应该与“前三个来源”等同,特别是对于研究问题而言。发现需要更深入地挖掘列表。
提示:在教用户搜索时,向他们展示如何使用两到三组不同的术语来搜索同一主题。不同的term返回不同的结果排名;这打破了单一搜索造成的盲点,开辟了更丰富的资源库。
四个可复制模板
1)搜索词扩展:
丰富下面的搜索主题以进行语义和关键字搜索。列出同义词、相关术语和可能的形式/技术等效项。仅建议与主题真正相关的术语。主题:[此处]
2)澄清用户问题:
建议 3 个澄清问题 我应该要求澄清以下模糊的用户问题(例如范围、时期、类型、语言)。不要假设用户意图,呈现选项。问题:[这里]
3)评估结果相关性:
以下是搜索主题和返回的结果标题/摘要。将每个结果与主题的相关程度评价为“高/中/低”,并给出一句话理由。只需依赖给出的文本即可。主题:[此处] / 结果:[此处]
4)摘要-来源一致性检查:
以下是摘要以及其所依据的源文本。摘要中的每项主张是否都真实存在于源文本中?逐项标记“支持/不支持/部分”。摘要:[此处] / 来源:[此处]
弱提示/强提示
弱提示:
列出有关此主题的最佳资源。
AI不知道从哪个集合中,按照什么标准,从实际存在的资源中进行选择;可以根据他的一般记忆列出一个虚构的“最佳”列表。
强力提示:
你的角色:侦察助理。下面是搜索主题和从侦察系统返回的 15 个实际结果(标题+摘要)。根据与主题的相关性列出这 15 个结果,并为每个结果给出一句话理由。将新的来源添加到列表中,进行弥补。主题:[此处] / 结果:[此处]
强大的提示将AI限制在真实的结果集上并使其进行评估;它可以防止从一般记忆中进行制造和检索。
搜索类型对比图
状态
最好的方法
为什么
确切的书名/ISBN/作者
字段/关键字
一对一匹配可靠
主题探索,不同术语
语义搜索
捕捉意义的接近性
当前事件/名词
关键词+日期
准确性和及时性
相关但不同的名称来源
语义搜索
找到同义词
常见错误
- 使用语义搜索来获取精确信息。域名搜索 ISBN 或完整标题更可靠。
- 假设“看起来相关的内容”是真的。含义的接近并不能保证可靠性或准确性。
- 不看源码就给出AI总结。摘要可能误解了来源。
- 没有澄清用户模糊的问题。错误的输入会带来错误的结果。
- 仅使用一种方法。最好结合使用语义和关键字搜索。
综上所述
语义搜索和发现系统通过匹配含义而不是单词来找到关键词搜索错过的相关资源,并加强发现。人工智能驱动的摘要提供了便利,但也存在产生幻觉和误解来源的风险。图书馆员的工作;结合使用语义和关键词搜索,批判性地评估“看起来相关”的内容,验证人工智能摘要的来源,并教会用户基于来源的确认搜索习惯。
应用任务
选择一个主题并进行关键字和语义搜索(如果适用);比较两组结果:语义搜索找到了哪些额外资源,混合了哪些不相关的结果?生成人工智能驱动的摘要(或获取样本摘要),并使用“摘要-源一致性检查”模板检查摘要中的声明是否实际出现在源中。
清单
- [ ] 我使用域/关键字进行精确信息和语义搜索以进行发现。
- [ ] 我澄清了用户模糊的问题。
- [ ] 我评估了“似乎相关”的结果的可靠性。
- [ ]我对AI摘要与原始来源进行了验证。
- [ ]我解释了用户基于来源的搜索习惯。