单位 8 / 11

可用性测试分析和结果综合

收益:

  • 能够利用人工智能将可用性测试记录和观察笔记转换为结果、权重和建议
  • 能够根据严重程度对结果进行排名并生成优先级表
  • 能够用真实的观察证据纠正人工智能遗漏或夸大的发现

可用性测试是一种通过向真实用户分配特定任务并对其进行监控来观察设计在哪里有效以及在哪里陷入困境的方法。测试本身很简单;真正的挑战在于事后:将数小时的记录、一页页的观察笔记和分散的屏幕截图转化为清晰、优先的发现。手工合成需要数天时间,团队经常无法完成。人工智能打破了这个瓶颈:将记录和笔记转化为发现、权重和推荐。但决定一个观察是否真的是一个问题以及它有多重要是由人类的判断决定的。

观察、发现和建议之间的区别

在合成中分离三层至关重要:

  • 观察:发生了什么,不予评论。 “参与者 3 搜索‘继续’按钮达 40 秒。”
  • 发现:从观察中出现的模式。 “用户很难找到主要操作。”
  • 建议:该怎么办。 “使主按钮在视觉上脱颖而出。”

人工智能可以快速生成这三层,但经常将观察与发现混淆,或者从单个观察中推断出整个发现。您的工作是验证每个发现背后是否有足够的观察结果(有多少参与者、多少次)。

提示:让人工智能说“在每个发现下方,添加支持它的观察结果以及有多少参与者看到了它”。通过这种方式,您可以立即将夸大的发现与单个观察结果区分开来。

严重性:首先要修复什么?

并非所有的发现都是平等的。严重性表示问题需要解决的紧急程度,由三个因素决定:

  1. 影响:该问题是否会阻止用户完成任务或只是惹恼他们?
  2. 频率:有多少用户以及多久一次?
  3. 业务影响:此问题对转化、收入或信任有多大影响?

典型的等级:严重(完全妨碍任务)、高(严重困难)、中(减慢速度)、低(装饰性)。人工智能可能会建议初始排名,但最终的权重决策(特别是业务影响)需要团队了解背景。

发现

影响

频率

重要性

建议

找不到主按钮

会干扰任务

4/6 参加者

批评的

突出显示按钮

错误信息不清楚

放慢速度

3/6

澄清消息

图标含义不清楚

轻微的犹豫

2/6

中等

添加标签

色调不喜欢

化妆品

1/6

留待以后再说

三个迷你箱子

案例1——录音5小时,半天发现结果。一个团队将 6 次用户测试(总共 5 小时)的笔记输入给人工智能。该模型提出了 14 项发现;该团队根据观察的数量检查了每一项,将范围缩小到 9 个,并按重要性顺序对它们进行了排名。原本手动需要 2 天的合成时间减少到了半天。

案例 2——夸大的调查结果被发现。 “用户不懂导航,”人工智能在一项重要发现中写道。当团队查看支持性观察结果时,他们发现它是基于单个参与者的单个时刻。该调查结果被降级为“中等”,并要求提供更多数据。教训:单一的观察并不能得出关键的发现。

案例 3 — 错过了关键问题。该模型将重复出现但看似次要的问题(表单不自动滚动)视为“低”。当设计师查看观察结果时,他意识到这导致 5 名参与者放弃任务,并将其设置为“高”。教训:人工智能的重要性估计是通过观察证据纠正的。

一起阅读定量和定性数据

可用性测试主要是定性的(基于观察的),但也有定量(数字)信号:任务完成率、任务持续时间、错误数量、满意度得分。最强大的综合将两者结合起来:“只有 33% 的参与者完成了结帐任务(定量),所有未能完成的人都陷入了运输步骤(定性)。”当您分别提供这两个数据时,人工智能可以帮助将它们结合起来;但您确认数字和样本量的准确性。在小样本中(例如 5 个用户)谈论百分比可能会产生误导;说“五分之三的用户”比说“60%”更诚实。让模型用绝对数字来说话。

提示:让 AI 说“写成‘有多少用户’而不是百分比。”在小样本中,百分比给人的印象比实际情况更精确。

可复制的提示

您的角色:可用性分析师。从以下匿名测试笔记中得出结果。对于每项发现:1)明确的陈述,2)支持观察结果以及有多少参与者看到它,3)效果(阻塞/减缓/美容)。将基于单一观察的发现标记为“弱证据”。注释:<<正文>>

按重要性对调查结果列表进行排序。标准:影响(任务障碍?)、频率(有多少参与者?)、业务影响。将每个发现分配为“严重”/“高”/“中”/“低”并写下理由。如果您不确定业务影响,请说“团队必须评估”。调查结果:<<列表>>

为每项发现写下具体的、可操作的设计建议。建议:会发生什么变化+为什么可以解决问题+它会影响什么屏幕。避免模​​糊的(“做得更好”)建议。调查结果:<<列表>>

总结此调查结果报告以供利益相关者演示:撰写一份简短的执行摘要,其中包括 3 个最关键的调查结果、证据(有多少用户)和建议的行动。夸张;从笔记中获取数字。报告:<<文本>>

弱提示/强提示

弱:“从这些测试分数中得出结论。”

结果:混合列表,没有证据,没有重要性顺序,并且将单个观察结果误认为是发现。

强:“从笔记中得出一个发现;在每个发现下,添加支持观察结果以及有多少参与者看到它;将基于单个观察的结果标记为‘弱证据’;然后根据效果-频率-工作效果按重要性顺序对其进行排序。”

结果:基于证据、优先考虑、可辩护的调查结果。

区别:强提示提示证据数量+弱提示+重要性标准。

常见错误

  • 混淆观察与发现。将单个“发生的事情”转化为总体结论。
  • 从单一观察中得出关键发现。在验证频率之前不会给出权重。
  • 决定人工智能的业务影响。收入/转化影响需要背景;他在他的团队中。
  • 不要优先考虑。杂乱无章的调查结果让团队陷入瘫痪;并不是所有事情都能一次性解决。
  • 让建议含糊其辞。 “做得更好”是不适用的;什么、为什么以及在哪里应该清楚。

总之

可用性测试的价值在于将录音和笔记转化为清晰、优先的结果。人工智能极大地加速了这种综合:将观察结果汇总成发现,起草建议,提出重要性顺序。但验证每个发现背后的观察数量、消除基于单个观察的夸大发现以及根据背景来衡量业务影响是人类的工作。基于证据、具有一定频率并按重要性顺序排列的调查结果报告将是快速且对利益相关者来说是站得住脚的。

应用任务

  1. 对可用性测试(真实的或虚构的)中的注释进行匿名化。
  2. 在第一次提示时删除发现的结果;检查每个项下的观察值数量。
  3. 隔离标记为“弱证据”的发现并决定是否需要额外的数据。
  4. 根据第二个提示,按重要性顺序对发现进行排序;作为一个团队评估业务影响。
  5. 根据第三个提示,为每个发现写下具体建议并创建优先级表。

清单

  • [ ] 我将观察、发现和建议作为不同的层次进行保存。
  • [ ] 我验证了有多少参与者展示了每个发现。
  • [ ] 我将基于单一观察的发现标记为弱证据。
  • [ ] 我通过影响-频率-工作影响确定了严重性级别。
  • [ ] 与团队一起评估业务影响决策。
  • [ ] 我具体写了建议(什么/为什么/在哪里)。