收益:
- 能够使用人工智能作为截止分数、子量表和语言解释支持来解释量表和测试结果
- 能够通过维持诊断来自临床判断和多个数据而不是来自量表分数来限制人工智能输出
- 能够在人工智能解释中考虑测试版权、规范背景和文化有效性风险
在心理学中,量表和测试(如焦虑量表、抑郁量表、性格测试、智力测试)是试图将一个人的内心世界转化为数字的工具。但仅靠数字并不能描述一个人。在抑郁量表上得分“高”的人实际上可能处于暂时的悲伤状态; “得分低”的人可能隐藏了他们的症状。这就是为什么量表解释是一门艺术:将数字与临床判断、历史和背景相结合。人工智能 (AI) 可以在这个过程中提供帮助——提醒子量表测量的内容、用通俗易懂的语言解释分数、完善报告句子——但它永远不会提供诊断和解释。在本单元中,您将学习如何使用人工智能作为音阶解释的安全支持。
人工智能在尺度解释中能做什么和不能做什么
人工智能可以: 用简单的语言解释量表的一般结构和子维度;一般性地解释分数“可能意味着什么”;改进报告的语言;起草一份简单的文字向客户解释;描述不同子量表分数之间的总体模式。
人工智能不能做什么:从评分得出诊断;决定截止分数(标记量表“临床水平”限制的阈值)对该人意味着什么;确保结果的文化/语言有效性;了解测试的规范(测试在哪个组中以及以什么平均值进行标准化)。人工智能还可以通过“假装记住”受版权保护的测试项目来生成错误信息。
注意:量表分数是一个数据,而不是诊断。诊断;它是访谈、病史、观察、多种测量与临床判断相结合的结果。问AI“根据这个分数诊断是什么?”询问就是邀请代理人做他不能做的工作。
截止分数和常态陷阱
每个衡量标准都有一个标准:也就是说,该测试在特定样本(例如,在特定国家、年龄和语言组)中标准化。在另一种文化中,相同的截止分数可能会产生误导。例如,一个国家制定的焦虑量表的“高”阈值可能会使正常的情绪表达在不同的文化中显得病态。 AI 不知道这个上下文;它只是做了一个机械映射,比如“高分=高焦虑”。专家的工作是在文化有效性的框架内权衡解释。
此外,截止分数是概率性的,而不是绝对性的。 “超限1分”与“超限20分”不同;存在一定的测量误差。人工智能倾向于将分数严格分为“轻度/中度/重度”类别;而真正的解释知道这些界限是模糊的。
一步一步:人工智能驱动的安全量表解读
- 计算/验证原始分数并自行调整。不要把评分交给人工智能;人工智能也会犯算术错误。
- 向AI请求结构澄清。 “这个分量表通常衡量什么?”问;这是一般信息,不是个人评论。
- 自己添加上下文。将故事、观察和其他数据纳入你自己的判断中,而不是人工智能。
- 在语言层面使用人工智能。让人工智能起草对客户的解释或报告,然后进行纠正以确保临床准确性。
- 质疑文化有效性。该量表适合该客户的文化/语言吗?你问的这个问题是人工智能漏掉的。
- 从多个数据建立诊断。分数被解释为表格的一部分,而不是孤立的。
提示:像编辑一样使用人工智能,“将我的评论翻译成可理解的语言”,而不是“解释乐谱”。让解释本身来自于你;让AI让一切变得美丽。
三个迷你箱子
案例 1——机械解释的危险。专家将抑郁量表的结果(28分)交给AI并说“解释”。 AI 表示“严重抑郁症,需要治疗”。然而,客户两周前失去了一位亲戚;分数反映了悲伤反应。在没有临床背景的情况下,“重度抑郁症”的人工智能标签具有误导性和破坏性。当专家添加上下文时,解释就会完全改变。
案例 2 — 正确的支持。心理学家对人格量表的 5 个子量表进行自我评分,然后告诉人工智能“用通俗易懂的语言写出每个子量表通常衡量的内容,准备一份文本草稿,我将向客户解释;不要写诊断。”人工智能产生清晰的轮廓;心理学家纠正并使用临床准确性。大约40分钟的写作工作减少到10分钟,并且再次来自专家的评论。
案例 3——文化有效性。一位客户在另一个国家制定的社交焦虑量表中得分很高。人工智能提示“明显的社交焦虑症”。专家意识到量表的标准不适合客户的文化背景,并且某些项目使该文化中正常的害羞变得病态。分数是相同的,但当通过文化有效性的过滤器时,解释会发生变化。
可复制的提示和模板
我想向客户解释心理测量量表的各个子量表。对于下面的子量表名称,请用简单且非侮辱性的语言解释每个子量表通常测量的内容,而无需进行书面诊断或发表个人评论。分量表:[列表]
将我下面的评论草稿翻译成客户可以理解的简单语言。更改内容,添加新的临床声明;只是使语言易于理解且不带有评判性。添加诊断语句。草稿:[我自己的评论]
该量表[量表名称/类型]用于不同的文化/语言环境。写一份我应该在文化和语言有效性方面注意的一般风险清单(规范背景、项目适当性、措辞差异)。
在下面的报告段落中,标记过于精确的陈述(“肯定”、“严重”、“证据”)或暗示单分诊断,并建议我用更慎重、多数据感知的语言重写它。段落:[文字]
弱提示/强提示
弱提示:“贝克抑郁评分为28,诊断是什么?”
这个提示迫使人工智能做出诊断,即使是在没有上下文的情况下只根据一个分数;这是错误的,也是不道德的。
强烈提示:“用通俗易懂的语言解释抑郁量表通常筛查哪些区域。诊断。还用一系列注意事项解释为什么仅高分并不意味着诊断(例如悲伤、暂时的压力、测量错误、文化背景)。”
这个提示将AI置于教育/解释的角色;将诊断和解释留给专家。
常见错误
- 根据评分做出诊断。将单个数字转化为临床结论;而诊断则来自多个数据。
- 将截止分数误认为是最终限制。忽略测量误差和上下文并说“超出限制=患者”。
- 绕过文化有效性。应用在不同文化中开发的量表,而不询问背景。
- 将评分留给AI。 AI在算术和物品匹配上可能会出现错误;必须验证评分。
- 将受版权保护的测试项目打印到 AI。 AI可能会错误地“记住”测试项目;此外,许多测试都受版权保护。
总之
量表和测试分数只是一个数据,而不是诊断。解释AI子量表结构帮助客户准备可理解的语言并改进报告句子;但诊断、截止分数解释和文化有效性决策均来自专家通过临床判断。验证评分,自己添加上下文,从概率和文化角度解读截止分数。不要将人工智能用作评论员,而是将其用作润色评论的编辑。
应用任务
选择您使用的量表的子维度。首先,写一段你自己的临床评论。然后给AI这段话“翻译成简单语言,添加临床主张”并比较输出:AI在哪些点介入了内容,它在哪里纠正了语言?还要询问人工智能在不同文化中使用相同量表的风险,并拿出一份清单。
清单
- [ ] 评分是我自己验证的,没有交给AI。
- [ ] 我不是根据评分来确定诊断,而是根据多个数据和推理。
- [ ] 我认为截止分数是概率性的且与上下文相关。
- [ ] 我质疑文化/语言的有效性。
- [ ] 我使用人工智能作为语言编辑器,而不是解释器。
- [ ] 我对报告中过于精确的表述进行了审核。