收益:
- 通过示例认识人工智能模型中的文化、性别和诊断偏差如何在心理学背景下造成伤害
- 能够实施偏差检查,测试不同群体、语言和文化的输出
- 能够开发纠正以西方为中心的规范和污名化语言的提示和验证技术
人工智能(AI)并不是中立的。人工智能模型从互联网上的大量文本中学习,模型的“世界观”会因其中包含的声音较多和包含的声音较少而产生偏差。这种扭曲称为偏差。心理学上的偏差并不是普通的技术缺陷;它可以直接影响一个人的评估、诊断和治疗。一种症状在一种文化中可能被解读为“正常”,而在另一种文化中可能被解读为“病态”。一种行为可能在一种性别中被定义为“自信”,在另一种性别中被定义为“攻击性”。人工智能可以学习并复制这些历史偏见。在本单元中,您将学习在心理学背景下识别人工智能的偏见,并审核不同群体、语言和文化的输出。
偏见从何而来,有何危害?
人工智能偏见的三个主要来源:
- 训练数据不平衡。模型主要使用特定语言、文化和时期的文本进行训练。大部分心理学文献来自西方受过教育的工业化社会。因此,人工智能的“正常人类”假设反映了这个狭窄的样本。
- 纳入历史偏见。过去对某些群体进行病态化和污名化的文本也包含在数据中;模型学习这些模式。
- 缺乏代表性。该模型对于代表性不足的群体(不同种族、语言、性取向、残疾)的信息要么不充分,要么存在刻板印象。
危害是有形的:人工智能可能会将某一组的症状评估为比另一组更严重,而在另一组中则更轻微;可能错误地将某种文化表现形式(哀悼仪式、宗教体验)视为一种症状;它会产生侮辱性的、陈词滥调的语言。
注意:即使人工智能的输出看起来是“客观科学”,它也可能带有它所学到的偏见。特别是当涉及到不同的文化、性别、性取向和社会经济群体时,我们将每个结果视为“这对所有群体都公平吗?”用问题过滤。
心理学特有的偏见类型
偏见类型
从心理学角度看
风险
文化偏见
认为西方规范是普遍的
不要将文化表达误认为是病态
性别偏见
根据性别对同一行为有不同的解释
诊断差异
诊断偏倚
将某些群体描述为“容易”出现某些诊断
诊断过度/不足
语言偏见
对主导语言更“精通”,而对其他语言则比较肤浅
不平等的评价
冲压
通过诊断来识别患者的语言
有辱人格的框架
逐步:偏差控制
- 您可以将输出更改为“它是为谁编写的?”问题。默认主题是谁?他通常是一个受过教育的西方“普通”人。
- 与不同的组进行测试。在不同的文化、性别和年龄背景下重复相同的提示;评论有变化吗?
- 扫描柱头舌头。正确表述患者的诊断(“患有精神分裂症的人”而不是“精神分裂症患者”)。
- 添加文化背景。告诉人工智能客户的文化/语言背景,并且“不要将在这种背景下可能正常的表达视为病态”。
- 专家和社会的目光。如果您对某个文化问题不确定,请咨询了解该文化的同事。
- 让人们决定。甚至连偏见检查也不由人工智能来完成;正义的最终判决是你的。
提示:测试输出是否有偏差的实用方法是:更改提示中的单个属性(性别、文化、年龄),然后再次询问相同的问题。如果解释随着这种变化而“不公平”地改变,那就存在偏见。
三个迷你箱子
案例 1——将文化表达病态化。一位专业人士告诉人工智能,来自不同文化的客户在悲伤过程中正在“与死者交谈”。人工智能将此描述为“可能是一种精神病症状”。然而,在该客户的文化中,这是一种常见且正常的悲伤表达方式。专家拒绝人工智能的输出,因为他了解文化背景。不了解背景的人可能会做出严重的误判。
案例 2——性别偏见测试。调查员将同一案件摘要提供给AI两次;它只是改变了人的性别。在“女性”版本中,人工智能强调“情绪不稳定”,而在“男性”版本中,它将相同的行为视为“压力反应”。这清楚地表明了模型的性别偏见。研究人员记录了这种差异,并以这种意识使用输出。
案例3——纠正污名化语言。一份报告草案指出,人工智能是一个“病态的边界”。专家认为这是一种侮辱性语言,它通过诊断来识别该人,并将其翻译成针对该人的语言,例如“具有明确的边缘人格模式的个人”。语言上的微小变化对于保护客户的尊严会产生很大的影响。
可复制的提示和模板
检查以下文本是否存在偏见:标记表明文化、性别、性取向、年龄或社会经济偏见的陈述。还表明认为西方规范具有普遍性的假设。为每个建议一个更公平的替代方案。文本:[文本]
帮我评估一下下面的情况,但是客户的文化背景是[文化/语言]。在这种情况下,将可能正常的表达呈现为病理学;如果您不确定某个文化点,请说“这可能因文化而异,请咨询专家”。状态:[匿名状态]
将本文中识别诊断对象的侮辱性表达方式(例如“精神分裂症”、“边缘患者”)翻译成以该人为中心并维护其尊严的语言。不改变内容,只是使语言人性化。文字:[文字]
我将对以下案例摘要进行两次评估:一次是主题[特征A],另一次是[特征B]。两次评估之间是否存在不公平的差异,如果存在,是否是由于偏见造成的?比较.摘要:[匿名摘要]
弱提示/强提示
弱提示:“该客户的行为正常还是异常?”
这个提示并没有询问“正常”是针对谁的;而是询问“正常”是针对谁的。人工智能假定了一种以西方为中心、没有文化的“正常”,并且可以使文化表达病态化。
强烈提示:“这位客户处于[文化/语言背景]。解释一下这种行为是否可能是该文化背景下的正常表达,或者是需要注意的标志,两者分开讨论。不要做出明确的判断;提醒我咨询了解文化背景的专家。”
这种提示将上下文置于中心,防止文化误读,并将决定权留给专家。
常见错误
- 将人工智能输出误认为“目标”。忘记模型存在偏见并接受输出作为科学事实。
- 认为西方规范是普遍的。根据单一文化来定义“正常”,并对不同的表达方式进行病态化。
- 没有注意到侮辱性语言。将诊断者的语言误认为是“技术语言”。
- 不测试偏见。不要对不同的组尝试相同的提示并检查一致性。
- 在你不了解的文化中独自做出决定。无需咨询了解该文化的同事即可做出判断。
综上所述
人工智能是有偏见的,因为它从有偏见的世界的文本中学习;在心理学中,这种偏见会转化为文化、性别、诊断、语言和耻辱等形式的有形伤害。将每个输出与问题“这对所有群体公平吗?”进行比较。拉紧它;在不同的组中测试相同的提示;在您的提示中添加文化背景;将污名化语言改为以人为本的语言;寻求专家/社区对您不熟悉的文化的关注。正义的判断,包括对偏见的控制,源于人类。
应用任务
准备案例摘要(匿名)。给AI两次;仅改变一项特征(性别、文化或年龄)。将两份打印输出并排放置,检查是否存在不公平的差异。还让人工智能将报告段落中的污名化短语翻译成以人为本的语言,并记下差异。
清单
- [ ] 将输出更改为“这对所有群体公平吗?”我问了这个问题。
- [ ] 我用不同的群体/文化测试了相同的提示。
- [ ] 我在提示中添加了文化背景;我并没有将文化表达病态化。
- [ ] 我把污名化的语言改成了以人为本的语言。
- [ ] 我就一个我不熟悉的文化问题寻求专家/同事的建议。
- [ ] 我将最终的公平性决定权留给了我自己的判断,而不是人工智能。