收益:
- 能够利用人工智能将原始采访记录、开放式调查回复和支持票转化为主题和见解
- 能够在人工智能支持下加速定性分析步骤,例如亲和力映射和编码,并用人眼验证结果
- 能够通过将人工智能编造或夸大的主题链接回真实的引述来剔除它们
用户研究中最乏味且最容易跳过的阶段是综合:将数十次访谈、数百份调查回复和支持票(用户的帮助请求)转化为有意义的见解。这项工作需要人工花费数天时间;这就是为什么团队经常走捷径并“凭感觉”做出决定。人工智能正好解决了这个瓶颈:它可以在几分钟而不是几小时内将原始文本分解为主题。但综合并不是一个“产生总结”的任务;而是一个“产生总结”的任务。这是一种基于证据的、可审计的推理。本单元向您展示如何保持洞察力的真实性,同时使人工智能成为您的综合伙伴。
什么是洞察,而不是总结
我们先来澄清一下这个术语。洞察力是一种从数据中产生并指导设计的有意义的模式:“用户不是在结账步骤放弃,而是在第一次看到运费时放弃。”这不是摘要(“用户抱怨付款”);这也不是一个观察结果(“参与者 4 在看到运费时停下来”)。洞察力捕捉了许多观察结果背后的共同原因,并为设计决策打开了大门。
人工智能自然倾向于生成摘要。你的工作是将其从总结变成洞察:“为什么?”以及“这对设计有何改变?”将您的问题嵌入到提示中。
定性分析步骤和人工智能的地位
定性(非数字、基于文本/观察)分析通常按以下步骤进行:
- 编码:文本中每个有意义的部分都被赋予一个标签(“运输成本问题”、“缺乏信心”)。
- 亲和力图(affinitymapping):相似的标签进行分组;团体成为主题。
- 主题优先级:确定有多少用户看到哪个主题以及看到的强度。
- 见解和建议:主题“做什么?”连接到句子。
人工智能极大地加快了步骤 1 和 2:在几分钟内完成初始编码和初始分组。然而,群组的含义、主题的重要性以及建议的准确性都需要人工验证。 AI给你一张“初稿地图”;您根据实际情况修正地图。
提示:在你告诉人工智能“提取主题”之前,请给它你的编码方案(标签列表)。这样,它就能以每个人的共同语言工作,并且输出具有可比性。
证据链:每个主题都链接到一个引言
综合的黄金法则:每个主题都至少与一个逐字引用相关联。这句话证明了这个主题是真实的。当向 AI 询问主题时,始终包含引用要求;告诉他不要创作一个他找不到引用的主题。这样你就可以从源头上停止幻觉:一个虚构的主题被标记为“毫无根据”,因为它在源中没有对应的内容。
层
例子
来源
观察
“参与者4看到运费后放弃了购物车”
一对一录音
代码
“意外成本”
标签
主题
“隐性成本破坏信任”
5 名参与者重复
洞察力
“应尽早显示运费”
我留下主题
建议
“将运费估算添加到产品页面”
设计决策
当利益相关者问“我们如何知道这一点?”时,这条链就开始了。当你提问时,它可以让你从观察返回到引用。
三个迷你箱子
案例 1 — 240 份调查回复,90 分钟。一个团队用 AI 编码了 240 份开放式(自由文本)调查回复。该模型提出了 11 个主题;该团队在 90 分钟内审查了这些内容,将其范围缩小到 7 个,合并了 2 个主题,并删除了 2 个不受支持的主题。原本两天的手工工作减少到半天,证据链得以保存。
案例2——夸张的主题被抓住。人工智能产生了“用户讨厌该应用程序”的强烈主题。当团队查看报价时,他们发现只有 2 名参与者是严厉的,而 18 名参与者是中立的。主题被改写为“对某种流程的强烈失望”。教训:人工智能会夸大情绪强度;计算频率。
案例 3——缺少少数意见。虽然该模型强调了大多数主题,但它淡化了 3 名参与者提出的关键可访问性问题,称其为“不重要”。设计师注意到了这一点,并将其作为一个单独的发现保存下来;后来发现这个问题影响了所有屏幕阅读器用户。教训:少数群体的信号并不总是“不太重要”。
可复制的提示
您的角色:定性研究分析师。编码方案(标签):<<列表>>任务:使用这些标签对下面的匿名记录进行编码。添加[参与者
将以下编码数据转换为邻近图:将相似的代码分组,为每组命名一个主题。对于每个主题:计算该主题出现在多少个人参与者中,包括 2 个最有力的引述,并写下一句话“为什么”解释。分别标记证据薄弱的主题。数据:<<codes>>
我想测试以下主题:“<<theme>>”。分别列出源文本中支持和拒绝该主题的引号。最后,评估该主题的支持程度(强/中/弱)。来源:<<transcription>>
将这个主题列表转化为见解和建议。对于每个主题:1)一句话洞察(包含“因为……”),2)具体的设计建议,3)这个建议影响什么屏幕/流程。不要编造;如果基础薄弱,请写“需要更多研究”。主题:<<列表>>
弱提示/强提示
弱者:“分析这些对话并告诉我结果。”
结果:没有来源、没有频率信息、并且容易夸大的总结。
Strong:“用我给你的标签编写这份文字记录;将每个主题与[参与者
结果:高频、基于证据、可审计的综合。
区别:强提示提示频率+报价+弱主播提示;这些可以防止夸张和幻觉。
常见错误
- 不计算频率。在不知道“用户想要 X”这句话背后是 2 个人还是 20 人的情况下做出决定。
- 考虑情绪的强度。 AI倾向于突出强烈的表达;它可以隐藏中立的多数。
- 消除少数信号。很少有人遇到的问题可能很关键(例如可访问性)。
- 不需要引用。无引号的主题是无法验证的主题。
- 一圈内完成。综合是迭代的;测试第一个输出并锐化提示。
综上所述
综合是将原始数据转化为驱动设计的洞察力的推理。人工智能极大地加快了编码和邻近分组等机械步骤,但洞察力的意义和重要性仍然是人类的。黄金法则是将每个主题与文字引用联系起来;计算频率,纠正情绪夸张,不要错过少数信号。当你建立从观察到引用、从主题到建议的证据链时,你就能获得既快速又可靠的研究成果。
应用任务
- 对您的 8-10(或虚构)采访/调查回复进行匿名化。
- 编写您自己的编码方案(6-8 个标签),并在第一个提示下由人工智能对其进行编码。
- 使用第二个提示删除主题;请注意每个主题有多少参与者。
- 用第三个提示测试最强的主题:比较支持和反驳的引言。
- 以洞察+建议+受影响屏幕的形式写出一个主题,并绘制证据链。
清单
- [ ] 我提前把我的编码方案给了AI。
- [ ] 我将每个主题与至少一个逐字引用链接起来。
- [ ] 我统计了每个主题出现的个人参与者数量。
- [ ] 我经常纠正夸张的情绪表达。
- [ ] 我有意识地决定是否消除少数信号。
- [ ] 我将这些见解与具体的设计方案和受影响的屏幕联系起来。