单位 5 / 11

推荐系统和个性化资源推荐

收益:

  • 能够区分基于内容的推荐方法和协作推荐方法,并通过验证真实集合中的每个推荐来防止虚假来源
  • 能够以有意识的多样性打破过滤泡沫,并以透明的理由提出建议
  • 保护用户阅读和搜索历史的隐私并安全地处理这些数据

读者可能会问“我读完了这本书,接下来我应该读什么?” ”,一个好的图书馆员会推荐适合他或她的兴趣、水平和目的的资源。在数字世界中,推荐系统大规模地做到这一点:它们通过查看用户过去的兴趣或资源的特征来推荐新资源。在本单元中,您将了解基于人工智能的推荐系统如何工作、它们给图书馆带来了什么,以及如何管理隐私、偏见和“过滤泡沫”等风险。

让我们定义一下这些概念。基于内容的推荐着眼于来源的特征(主题、作者、流派)并推荐相似的来源:“如果您喜欢这本历史书,您可能也会喜欢这本涵盖同一时期的书。”协同过滤的工作原理是“像您一样喜欢资源的其他用户也喜欢这些资源”。过滤气泡是指推荐系统将用户锁定在不断相似的内容中,并使他们远离新的、不同的观点。一个好的图书馆推荐既能吸引人们的兴趣,又能打破泡沫。

循序渐进:负责任的建议方法

1、明确目的。该提案的目的是什么?您是否希望用户继续阅读、拓宽视野或查找特定研究问题的资源?目的决定推荐的类型。

2. 验证来源和真实性。 AI在提出建议时可以编造不存在的书。验证每个建议的资源是否确实存在于集合或可靠的目录中。

3. 保持多样性。只推荐“最相似”的一个会产生过滤气泡。有意识地包容不同的观点、不同的作者和不同的层次。图书馆的任务是打开视野,而不是将其限制在生态中。

4.保护隐私。个性化推荐使用用户的阅读历史,并且极其准确。请勿将此数据提供给通用人工智能工具;仅在获得用户同意的情况下在机构的安全系统内进行处理。

5. 保持透明。向用户解释推荐的原因:“推荐此资源是因为它与您感兴趣的主题相关。”透明度增强信任和信息素养。

提示:有意识地将“略有不同”的资源添加到建议列表中,并声明:“这些资源接近您感兴趣的领域;我添加此资源是为了复习。” This both breaks the filter bubble and demonstrates the discovery value of the library.

该提案的道德层面

Recommendation systems seem innocent but create powerful effects. Which resources are recommended to a user shapes his or her information world.如果系统只突出流行的来源或仅从特定角度突出,少数声音、不同观点和不太知名的有价值的来源将被忽视。 AI can reinforce this trend by inheriting the popularity and biases in the training data.

This is where the value of librarianship comes in: the library is not a commercial recommendation engine; Its mission is to ensure equal and diverse access to information. It is the librarian's responsibility to align the recommendation system with this value.

Attention: User's reading and search history is one of the most sensitive privacy data. What a person reads can reveal information about his or her health, political views, beliefs, or personal crisis. Never transfer this data with its identity to external systems;匿名和同意至关重要。

三个迷你箱子

案例 1——基于内容的推荐有效。 A school library used a content-based system to recommend resources to students that were similar to the book they were reading.一名学生读完了一本科幻小说; The system recommended three books covering the same theme but from a different author.学生借了两本;读书的习惯一直延续着。图书馆员此前已经确认所有建议实际上都存在于馆藏中。

案例 2——虚假建议被发现。 A librarian asked an AI to recommend 8 books to a user. He checked the list in the catalogue: 3 out of 8 books were missing at all;人工智能编造了看似合理的头条新闻。 The verification step prevented non-existent books from being recommended to the user.

案例 3 — 过滤气球破裂。研究人员不断地与具有相同观点的来源合作,系统总是建议类似的观点。图书馆员故意收录了两个来源,对这个主题提出了对比的方法,并明确了这一点。正是由于这些相反的来源,研究人员才意识到他的研究的不完整方面。

冷启动和新用户问题

推荐系统的一个众所周知的挑战是冷启动问题:系统不知道向新用户或刚刚添加到没有历史数据的集合中的资源推荐什么。在这种情况下,许多系统会转向最流行的资源作为安全的选择;这意味着鲜为人知的有价值的资源根本不被推荐,受欢迎程度会自行增加。从图书馆管理的角度来看,这与平等访问的价值相冲突。解决方案是在做出推荐并根据内容特征突出显示新添加的资源之前,向新用户询问一个简短、明确的偏好问题(哪些主题、哪个级别、哪个目的)。此时,通过分析资源的主题和特征,AI甚至可以将一本从未借过的书链接到相关用户;只要建议来自真实收藏并经过验证。因此,该系统不仅使“非常喜爱”的内容可见,而且还使“相关且有价值”的内容可见。

提示:为新用户设置推荐时,应基于用户当前的需求而不是系统的历史数据。一个好的问题(“这是为了研究,为了娱乐,到什么程度?”)通常会产生比几个月的行为数据更准确的建议。

四个可复制模板

1)基于内容的相似资源推荐:

以下是用户喜欢的资源的主题/摘要。我还列出了我们收藏中的现有资源。仅从这个列表中,建议 5 个与主题相似的资源,并为每个资源写一句话理由。未列出的建议来源。最喜欢的来源:[这里]/收藏列表:[这里]

2)增加多样性的建议:

在下面的建议列表中,添加 2 个资源,以拓宽用户的视野并提供不同的视角或副主题(仅来自我提供的集合列表)。解释为什么它们不同且有价值。列表:[此处] / 收藏:[此处]

3)推荐理由说明:

对于下面的每项推荐,请写一个简短、透明的理由,以便向用户展示:“推荐此资源是因为……”不夸张,不暗示个人数据。建议:[此处]

4)隐私预检查:

以下建议条目是否包含用户识别信息或敏感信息(暗示健康、信仰、政治观点)?如果是这样,请标记它并建议如何对其进行匿名化。输入:[此处]

弱提示/强提示

弱提示:

推荐10本书供该用户阅读。

人工智能在不知道集合的情况下从其全局记忆中生成建议;他可以编造不存在的书,也不尊重多样性和隐私。

强力提示:

您的角色:读者咨询助理。以下是用户喜欢的主题以及我们收藏中的真实来源列表。 (1) 从列表中建议 5 个与该主题相关的来源。 (2) 另外添加 2 个不同视角的来源,让你大开眼界。 (3) 为每项建议写下清晰的理由。请勿脱离清单、伪造来源或暗示个人数据。主题:[此处] / 收藏:[此处]

强大的提示功能;它将其限制于实际的收集,要求多样性,并增加了理由和隐私规则。

推荐类型对比图

建议类型

强项

风险

图书馆员的职责

基于内容

很好地吸引注意力

过滤气泡

增加品种

协作的

惊喜发现

隐私、流行偏见

匿名、平衡

AI生产清单

编造来源

验证现实

常见错误

  • 未经核实就提出建议。人工智能可以弥补不存在的来源。
  • 只是推荐“最相似”。过滤气泡缩小了用户的视野。
  • 将阅读历史记录导出到外部工具。它是隐私中最敏感的数据。
  • 提出建议没有道理。透明度支持信任和素养。
  • 忽略流行偏见。宝贵但鲜为人知的资源丢失了。

综上所述

推荐系统是强大的工具,可以通过捕获用户兴趣来促进发现;基于内容的方法和协作方法具有不同的优势和风险。人工智能能够快速生成建议,但也可以发明不存在的来源、过滤泡沫并强化偏见。图书馆员的工作;验证真实馆藏中的每一条建议,以有意识的多样性打破泡沫,以透明的理由提出建议,保护用户隐私,维护图书馆平等和多样化访问的价值。

应用任务

准备一份简短的事实收集清单(10-15 个来源)。使用“基于内容的相似资源推荐”模板为用户生成推荐,并验证它们是否都确实存在于列表中。然后,使用“增加多样性的建议”模板将具有不同观点的来源添加到列表中。最后,使用“建议基本原理解释”模板为每个建议创建透明的解释,并计划如何将其呈现给用户。

清单

  • [ ] 我验证了集合中确实存在每个建议。
  • [ ] 我添加了多样性来打破过滤泡沫。
  • [ ] 我保证了用户阅读/搜索历史记录的安全,我没有将其提供给外部工具。
  • [ ] 我为每项建议准备了透明的理由。
  • [ ] 为了避免流行偏见,我一直关注鲜为人知且有价值的来源。