收益:
- 能够实现从不从 AI 内存中获取引用计数和引用,同时使用 AI 对从真实引文数据库中获取的数据进行聚类和汇总
- 能够理解引用、h 指数和影响因子等指标表明使用情况而不是质量,以及它们在各个领域的不可比性。
- 能够考虑单独使用文献计量标准来评估个人的道德限制,并通过定性评估来平衡它们
大学图书馆衡量其机构的研究成果;研究人员寻找某个领域最有影响力的研究;经理可能想要评估一个部门的科学可见性。这项工作的背后是文献计量学:对科学出版物及其之间的引用关系进行数字化检查的领域。在本单元中,您将学习如何在引文分析、出版物映射和影响评估中使用人工智能;但您将学习如何克服数值指标的局限性和道德陷阱。
让我们定义一下这些概念。引用是一份出版物对另一份出版物的科学引用;引用次数被认为是作品被使用程度的指标。 h 指数是结合研究人员的生产力和影响力的衡量标准(如果 h 份出版物每篇均获得至少 h 次引用,则 h 指数为 h)。影响因子是衡量期刊平均引用水平的指标。这些指标很有用,但都不是“质量”的直接衡量标准;牢记这种区别是文献计量学的本质。
一步一步:负责任的文献计量分析
1. 澄清问题。 “这个领域的基础研究是什么?”、“我们机构被引用最多的出版物有哪些?”、“这两个领域如何交叉?”每个问题都需要不同的分析。
2. 使用可靠的数据。引文分析的可靠性取决于数据源的可靠性。人工智能可以计算引用计数或出版物列表;因此,使用真实引文数据库中的数据至关重要。使用人工智能来解释和总结真实数据,而不是生成数据。
3. 标记图案。人工智能有助于总结大量出版物中的主题集群、协作网络或随时间变化的趋势。这将人类分析师的注意力引导到重要的点上。
4. 在上下文中解释该标准。低引用次数并不表明该作品毫无价值;领域可能很小,主题可能很新,或者出版物可能很新。切勿在没有上下文的情况下解释该数字。
5.遵守道德界限。文献计量方法不应单独用于做出有关雇用、晋升或资助个人的决策。数字不能衡量人的价值;数字不能衡量人的价值。滥用它们既不公平又有害。
提示:AI进行引文分析时,提供真实数据库的引文计数和出版物引用情况;让人工智能简单地组织、分组和解释这些数据。 “这位作家的h指数是多少?”直接询问可能会得到一个虚构的数字。
标准和操纵的限制
由于文献计量指标看似强大,因此很容易被滥用。引文数量可以通过多种方式夸大:过度自引(引用自己的作品)、引用环(一群人相互引用)或该领域自己的引用文化。而且,跨领域的标准不具有可比性:医学文章和哲学文章的引用环境完全不同。
这个问题在人文社会科学领域表现得更加明显;因为这些领域的重要成果(书籍、翻译、评论)在引文数据库中代表性不足。仅通过引用次数来衡量历史学家或文学学者的影响力是对作品本质的误解。图书馆员是向管理员和研究人员解释这些标准的局限性的指南。
注意:不要将文献计量指标作为对个人学术成就或部门质量的最终判断。负责任的研究评估原则强调措施应该补充定性评估,而不是取代它。
三个迷你箱子
案例 1 — 绘制区域。一位图书馆员想要向一个研究小组展示其领域的基础工作。它从真实的引文数据库中提取了 200 份出版物的数据; YZ 将这些数据总结为主题集群,并突出显示了被引用最多的 10 项研究。分析师验证了数据库中的每个簇和标识符;小组很快掌握了该地区的结构。
案例 2 — 假 h 指数被抓获。一位经理向 AI 询问一位研究人员的 h 指数; AI说“42”。图书管理员查看了实际的数据库:正确的值为19; AI已经补足了这个数字。这表明指标永远不应该从人工智能内存中获取,而应该从真实数据中获取。
情况 3 — 防止不正确的比较。一个单位希望根据两章的平均引用次数进行比较来分配资金。图书馆员解释说,其中一个系是医学系(高引用文化),另一个系是人文系(书籍多,低引用文化),这种比较是不公平的。该评估得到了考虑到现场差异的定性标准的支持。
视觉地图和阅读陷阱
文献计量学中常用的工具是网络图(例如同引或共同作者网络),它通过节点和链接显示出版物或作者之间的关系。这些地图使一个地区的结构、集群和桥梁变得可见;人工智能可以聚合底层的真实数据并帮助解释这些地图。但视觉地图虽然强大,但也可能产生误导:一个大的、集中可见的节点可能不是“最重要的”,而只是“最有联系的”;簇的大小只能反映发表量,并不能反映该空间的价值。此外,地图的绘制方式(哪个阈值、哪个时间段、哪个数据库)完全改变了结果。因此,在将文献计量可视化作为决策基础时,必须明确说明它基于哪些数据、哪些参数以及在什么时间段内。如果人工智能生成的评论将地图上的某个节点定义为“领导者”或“最具影响力”,请检查该特征是否得到真实数据的支持。
提示:在解释网络图时,不要陷入“中心 = 顶部”的陷阱。中心性仅表示连接密度;作品的原创贡献或品质在地图上是看不到的,只能通过阅读内容来理解。
四个可复制模板
1)总结实际引文数据:
以下是我从真实引文数据库中获取的出版物列表和引文号。将它们分成主题簇,并用一句话总结每个主题簇。仅使用我提供的数据,不要添加/弥补新的出版物或引用计数。数据:[此处]
2) 趋势和形态标记:
突出显示下面基于年份的出版物/引用数据中的显着趋势(增加、减少、合作集中度)。每个观察都基于数据,而不是推测。数据:[此处]
3)标准解释警告:
解释以下文献计量标准,并说明其局限性:它提供了哪些主题的信息,没有提供哪些主题的信息,哪些主题可能被滥用?标准和背景:[此处]
4)面积差异控制:
下面两组的引文数据可以直接比较吗?评估各个领域之间引用文化的差异,并解释比较是否公平。数据:[此处]
弱提示/强提示
弱提示:
列出该作者最有影响力的文章和引用次数。
人工智能从其全局内存中生成虚构的标题和引用计数,而无需访问真实数据。结果:令人信服但虚假的分析。
强力提示:
您的角色:文献计量学助理。以下是我从真实引文数据库中提取的出版物引文和引文编号。将此数据从最常被引用的领域到最低的领域排序,将其划分为主题集群,并对每个集群进行总结。不要偏离我给出的数据,不要编造任何数字或标签。添加有关标准限制的简短注释。数据:[此处]
强大的提示功能;它将人工智能限制在真实数据上,禁止捏造,并提醒我们基准限制。
标准和限值表
标准
显示什么
什么不显示
注意
引用次数
使用/可见性
质量、准确性
取决于地区文化
h指数
生产力+影响力
个人的价值
对职业生涯长度敏感
影响因子
期刊平均数
单篇文章价值
期刊级别标准
协作网络
和谁一起工作过
贡献率
在网络中的角色不清楚
常见错误
- 向 AI 请求引用计数。数字是在真实数据库之外组成的。
- 认为标准是质量的衡量标准。引用表明用途,而不是质量。
- 直接比较面积。归因文化不同,这是不公平的。
- 通过归因来衡量人文学科。以书籍为主的产出在数据库中代表性不足。
- 用标准评估个人。雇用/晋升决定不应基于单一标准。
综上所述
在文献计量和引文分析中,人工智能是一个强大的助手,可以对真实数据进行聚类、标记趋势和总结;但永远不要从人工智能内存中获取引文号和署名,因为它是虚构的。指标显示使用情况和可见性,而不是质量;无法跨域比较;在人文学科中代表性不足,不能单独用于评估个人。图书馆员是一位负责任的向导,他解释这些标准的局限性,并通过定性评估来平衡它们。
应用任务
从真实的引文数据库中获取一小部分出版物(10-15 条记录,带有引文计数)。拥有AI集群并使用“汇总真实引文数据”模板进行汇总,然后验证引文并根据数据库进行计数。然后使用“标准解释警告”模板打印出您选择的指标(例如 h 指数)的限制,并计划如何向经理解释它。
清单
- [ ] 我提供的是真实数据库中的引文数和引文,不是AI补的。
- [ ] 我将这些指标作为使用/可见性的指标,而不是质量的指标。
- [ ] 我考虑到了不同领域之间引用文化的差异。
- [ ] 我考虑到了人文学科的代表性不足。
- [ ] 我并没有单独使用这个标准来评估个人。