ユニット 8 / 11

ユーザビリティテストの分析と結果の総合

利益:

  • 人工知能を使用してユーザビリティテストの記録と観察メモを所見、重み、推奨事項に変換する機能
  • 重大度に応じて結果をランク付けし、優先順位付け表を作成する機能
  • 人工知能が省略または誇張した発見を、実際の観察証拠に基づいて修正する能力

ユーザビリティテストは、実際のユーザーに特定のタスクを与えてモニタリングすることで、デザインがどこで機能し、どこで行き詰まっているかを観察する方法です。テスト自体は簡単です。本当の課題はその後にあります。何時間にもわたる記録、何ペー​​ジにもわたる観察ノート、散在するスクリーンショットを、明確で優先順位の高い調査結果に変えるのです。この合成には手作業で何日もかかり、チームは未完成のまま放置することがよくあります。人工知能はこのボトルネックを解消し、記録とメモを結果、重み付け、推奨事項に変換します。しかし、観察が本当に問題であるかどうか、そしてそれがどれほど重要であるかを判断するのは人間の判断です。

観察、発見、提案の違い

合成では 3 つのレイヤーを分離することが重要です。

  • 観察: 何が起こったのか、コメントはありません。 「参加者 3 は、「続行」ボタンを 40 秒間探しました。」
  • 発見: 観察から現れるパターン。 「ユーザーは主要なアクションを見つけるのに苦労しています。」
  • 推奨事項: 何をすべきか。 「主ボタンを視覚的に目立たせます。」

AI はこれら 3 つのレイヤーをすぐに生成しますが、観察と発見を混同したり、単一の観察から発見全体を推測したりすることがよくあります。あなたの仕事は、それぞれの発見の背後に十分な観察 (参加者の数、回数) があることを検証することです。

ヒント: 人工知能に「各結果の下に、それを裏付ける観察結果と、それが見られた参加者の数を追加してください」と言わせます。このようにして、単一の観察結果から膨らんだ結果を即座に区別できます。

重大度: 最初に何を修正するか?

すべての結果が等しいわけではありません。重大度は、問題をどの程度緊急に修正する必要があるかを示し、次の 3 つの要素によって決定されます。

  1. 影響: この問題により、ユーザーはタスクを完了できなくなりますか? それともユーザーをイライラさせるだけですか?
  2. 頻度: ユーザーの数と頻度はどれくらいですか?
  3. ビジネスへの影響: この問題はコンバージョン、収益、または信頼にどの程度影響しますか?

典型的なスケール: クリティカル (ミッションを完全に妨げる)、高 (厳しい難易度)、中 (速度が低下する)、低 (表面的)。 AI は最初のランキングを提案するかもしれませんが、最終的な重み付けの決定、特にビジネスへの影響には、チームのコンテキストに関する知識が必要です。

見つける

影響

周波数

重要性

提案

主ボタンが見つかりません

任務の邪魔になる

4/6参加者

クリティカル

ハイライトボタン

エラーメッセージが不明瞭

遅くなる

3/6

高い

メッセージを明確にする

アイコンの意味が不明瞭

わずかな躊躇

2/6

中程度

タグを追加

色合いが気に入らなかった

化粧品

1/6

低い

後で残しておきます

ミニケース3個

ケース 1 — 5 時間の記録、半日で結果が得られます。あるチームは、6 回のユーザー テスト (合計 5 時間) のメモを AI に入力しました。このモデルは 14 の発見を示唆しました。チームはそれぞれを観測数と照合し、9 つに絞り込み、重要度の順にランク付けしました。手作業で2日かかっていた合成作業が半日に短縮された。

ケース 2 — 誇張された所見が見つかった。 AIは「ユーザーはナビゲーションを理解していない」と重要な発見を記した。チームが裏付けとなる観察結果を調べたところ、それが 1 人の参加者の 1 つの瞬間に基づいていることがわかりました。この結果は「中程度」に格下げされ、さらなるデータが要求された。教訓: 単一の観察では重要な発見はできません。

ケース 3 — 重要な問題を見逃した。このモデルでは、繰り返し発生するものの一見軽微な問題 (フォームが自動スクロールしない) を「低」としてカウントしました。設計者は観察結果を確認したところ、これにより 5 人の参加者がタスクを放棄する原因になっていることがわかり、それを「高」に設定しました。教訓: AI の重要性の推定は観察証拠によって修正されます。

定量的データと定性的データを一緒に読み取る

ユーザビリティ テストはほとんどが定性的 (観察ベース) ですが、タスク完了率、タスク期間、エラー数、満足度スコアなどの定量的 (数値) シグナルもあります。最も強力な合成は、この 2 つを組み合わせたものです。「チェックアウト タスクを完了した参加者は 33% のみ (定量的)、完了できなかった参加者全員が出荷ステップで行き詰まった (定性的)」。人工知能は、これら 2 つのデータを別々に与えると結合するのに役立ちます。ただし、数値とサンプルサイズの正確性を確認するのはあなたです。パーセンテージについて話すと、サンプルが小さい場合 (例: ユーザー 5 人) は誤解を招く可能性があります。 「60%」と言うよりも、「ユーザー 5 人中 3 人」と言う方が正直です。モデルに絶対数で話してもらいます。

ヒント: AI に「パーセンテージではなく『ユーザー数』と書いてください」と言わせます。サンプルが小さい場合、パーセンテージは実際よりも高い精度を示します。

コピー可能なプロンプト

あなたの役割: ユーザビリティ アナリスト。以下の匿名化されたテストノートから結果を導き出します。各所見について: 1) 明確な記述、2) 裏付けとなる観察とそれを見た参加者の数、3) 効果 (ブロック/遅延/表面効果)。単一の観察に基づく結果を「弱い証拠」としてマークします。注: <<テキスト>>

この結果のリストを重要度に従って並べ替えます。基準: 影響 (タスクの障害?)、頻度 (参加者の数?)、ビジネスへの影響。それぞれの結果を重大/高/中/低に割り当て、根拠を書きます。ビジネスへの影響がわからない場合は、「チームは評価する必要がある」と言います。調査結果: <<リスト>>

それぞれの結果について、具体的で実用的な設計上の推奨事項を記述します。推奨事項: 何が変わるのか + なぜこれで問題が解決するのか + どの画面に影響するのか。曖昧な (「もっと良くする」) 推奨事項は避けてください。調査結果: <<リスト>>

関係者向けのプレゼンテーション用にこの調査結果レポートを要約します。最も重要な 3 つの調査結果、証拠 (ユーザー数)、および推奨されるアクションを含む簡単な概要を作成します。過言;メモから数字を取得します。レポート: <<テキスト>>

弱いプロンプト / 強いプロンプト

弱者: 「これらのテストのスコアから結論を導き出します。」

結果: 証拠がなく、重要度の順序もなく、単一の観察結果を所見と誤解する混合リスト。

強者: 「メモから所見を引き出します。各所見の下に、裏付けとなる観察とそれが観察された参加者の数を追加します。単一の観察に基づくものを「弱い証拠」としてマークします。その後、効果、頻度、作業効果に従って重要性の順にランク付けします。」

結果: 証拠に基づいた、優先順位が付けられた、擁護可能な調査結果。

違い: 強力なプロンプトは、証拠の数 + 弱いプロンプト + 重要性基準をプロンプトします。

よくある間違い

  • 観察と発見を混同する。単一の「何が起こったのか」を全体的な結論に変える。
  • 単一の観察から重要な発見をすること。周波数が検証されるまで重量は表示されません。
  • 人工知能に対するビジネスへの影響を決定します。収益/コンバージョンへの影響にはコンテキストが必要です。彼は彼のチームにいます。
  • 優先順位を付けないでください。調査結果のリストが整理されていないため、チームは麻痺してしまいます。すべてを一度に解決できるわけではありません。
  • 提案を曖昧なままにする。 「もっと良くする」という言葉は当てはまりません。何を、なぜ、どこで明確にする必要があります。

要約すれば

ユーザビリティテストの価値は、録音とメモを明確で優先順位の高い結果に変えることにあります。人工知能はこの統合を大幅に加速します。観察結果を調査結果に集約し、推奨事項を作成し、重要性の順序を提案します。しかし、各結果の背後にある観測値の数を検証し、単一の観測値に基づいて水増しされた結果を除外し、コンテキストに応じてビジネスへの影響を重み付けするのは人間の仕事です。証拠に基づいており、一定の頻度で、重要度の順に並べられた調査結果レポートは、迅速であり、利害関係者にとって防御可能になります。

アプリケーションタスク

  1. ユーザビリティ テスト (現実または架空) のメモを匿名化します。
  2. 最初のプロンプトで検出結果を削除します。それぞれの観測値の数を確認します。
  3. 「弱い証拠」とマークされた調査結果を分離し、追加のデータが必要かどうかを判断します。
  4. 2 番目のプロンプトでは、結果を重要度の順にランク付けします。チームとしてビジネスへの影響を評価します。
  5. 3 番目のプロンプトでは、各結果に対する具体的な提案を書き、優先順位付け表を作成します。

チェックリスト

  • [ ] 観察、発見、提案を別のレイヤーとして保持しました。
  • [ ] 各所見を示した参加者の数を検証しました。
  • [ ] 単一の観察に基づく結果を弱い証拠としてマークしました。
  • [ ] 重大度レベルは、影響 - 頻度 - ジョブへの影響によって決定しました。
  • [ ] ビジネスへの影響に関する決定をチームとともに評価しました。
  • [ ] 提案を具体的に(何を、なぜ、どこで)書きました。