одиниця 8 / 11

Аналіз тестування зручності використання та узагальнення результатів

Прибуток:

  • Можливість перетворювати записи тестів на зручність використання та нотатки спостережень у висновки, ваги та рекомендації за допомогою штучного інтелекту
  • Здатність ранжувати висновки за ступенем серйозності та створювати таблицю пріоритетів
  • Здатність виправляти результати, які штучний інтелект пропускає або перебільшує, за допомогою реальних даних спостережень

Юзабіліті-тестування — це метод спостереження за тим, де дизайн працює, а де він застряє, ставлячи конкретні завдання реальним користувачам і контролюючи їх. Сам тест простий; Справжнє завдання полягає в наслідках: перетворити години запису, сторінки нотаток спостережень і розрізнені знімки екрана в чіткі, пріоритетні висновки. Цей синтез займає кілька днів вручну, і команди часто залишають його незавершеним. Штучний інтелект відкриває це вузьке місце: перетворює записи та нотатки на висновки, вагу та рекомендації. Але людське судження вирішує, чи справді спостереження є проблемою і наскільки воно важливе.

Різниця між спостереженням, знаходженням і навіюванням

У синтезі важливо розділити три рівні:

  • Спостереження: Що сталося, без коментарів. «Учасник 3 шукав кнопку «продовжити» протягом 40 секунд».
  • Висновок: закономірність, що випливає зі спостережень. «Користувачі мають проблеми з пошуком основної дії».
  • Рекомендація: що робити. «Виділяє основну кнопку».

Штучний інтелект швидко створює ці три рівні, але часто плутає спостереження з знахідкою або виводить цілий висновок з одного спостереження. Ваше завдання полягає в тому, щоб перевірити, чи є достатньо спостережень (скільки учасників, скільки разів) за кожним висновком.

Порада: нехай штучний інтелект скаже: «під кожним висновком додайте спостереження, які його підтверджують, і скільки учасників його бачили». Таким чином ви можете миттєво відрізнити завищені висновки від одного спостереження.

Серйозність: що виправити в першу чергу?

Не всі висновки однакові. Рівень серйозності вказує на те, наскільки терміново потрібно вирішити проблему, і визначається трьома факторами:

  1. Вплив: проблема заважає користувачеві виконати завдання чи просто дратує його?
  2. Частота: скільки користувачів і як часто?
  3. Вплив на бізнес: наскільки ця проблема впливає на конверсію, дохід або довіру?

Типова шкала: Критичний (повністю заважає місії), Високий (сувора складність), Середній (уповільнює), Низький (косметичний). ШІ може запропонувати початкове ранжування, але остаточне рішення щодо ваги — зокрема вплив на бізнес — вимагає від команди знання контексту.

знахідка

Вплив

частота

важливість

Пропозиція

Неможливо знайти основну кнопку

Це заважає виконанню завдання

4/6 учасників

критичний

Кнопка виділення

Повідомлення про помилку незрозуміле

уповільнення

3/6

висока

Уточніть повідомлення

Значення значка незрозуміле

легке вагання

2/6

середній

Додати тег

Колірний тон не сподобався

косметичні засоби

1/6

низький

залиште це на потім

три міні-чохла

Випадок 1 — 5 годин запису, знахідки за півдня. Одна команда передала нотатки 6 тестів користувача (загалом 5 годин) ШІ. Модель запропонувала 14 знахідок; Команда перевірила кожне з них за кількістю спостережень, звузила їх до 9 і розташувала їх у порядку важливості. Синтез, який займав би 2 дні вручну, скоротився до половини дня.

Випадок 2 — Спіймано завищену знахідку. «Користувачі не розуміють навігацію», — написав AI у критичному висновку. Коли команда переглянула підтверджуючі спостереження, вони виявили, що вони базуються на одному моменті від одного учасника. Висновок було знижено до "помірного", і було запропоновано додаткові дані. Урок: одне спостереження не робить критичного висновку.

Випадок 3 — пропущена критична проблема. Модель зарахувала повторювану, але, здавалося б, незначну проблему (форма не автоматично прокручується) як «низьку». Коли дизайнер подивився на спостереження, він зрозумів, що це спричинило відмову від завдання у 5 учасників, і встановив для нього значення «високе». Урок: Оцінка важливості штучного інтелекту коригується на основі даних спостережень.

Спільне читання кількісних і якісних даних

Перевірка юзабіліті здебільшого якісна (на основі спостережень), але є також кількісні (числові) сигнали: швидкість виконання завдань, тривалість завдання, кількість помилок, оцінка задоволеності. Найпотужніший синтез поєднує обидва: «Лише 33% учасників виконали завдання оформлення замовлення (кількісне), а всі, хто не зміг виконати, застрягли на етапі доставки (якісне)». Штучний інтелект допомагає об’єднати ці два дані, коли ви надаєте їх окремо; але ви підтверджуєте точність чисел і розмір вибірки. Розмова про відсотки може ввести в оману в невеликих вибірках (наприклад, 5 користувачів); Сказати «3 з 5 користувачів» більш чесно, ніж сказати «60%». Попросіть модель говорити в абсолютних цифрах.

Порада: нехай штучний інтелект скаже «напишіть як «скільки користувачів» замість відсотка». У невеликих вибірках відсоток створює враження більшої точності, ніж насправді.

Копіювані підказки

Ваша роль: аналітик юзабіліті. Зробіть висновки з наведених нижче анонімних нотаток до тесту. Для кожного висновку: 1) чітке твердження, 2) підтверджуючі спостереження та кількість учасників, які це бачили, 3) ефект (блокування/уповільнення/косметичний). Позначте результати, засновані на одному спостереженні, як «СЛАБКІ ДОКАЗИ». Примітки: <<текст>>

Розсортуйте цей список знахідок за важливістю. Критерії: вплив (перешкода завдання?), частота (скільки учасників?), бізнес-вплив. Призначте кожному висновку Критичний/Високий/Середній/Низький і напишіть обґрунтування. Якщо ви не впевнені щодо впливу на бізнес, скажіть «команда повинна оцінити». Висновки: <<список>>

Напишіть конкретні практичні рекомендації щодо дизайну для кожного знахідки. Рекомендація: що зміниться + чому це вирішує проблему + на який екран впливає. Уникайте розпливчастих («робити краще») рекомендацій. Висновки: <<список>>

Узагальніть цей звіт про результати для презентації зацікавленим сторонам: напишіть короткий підсумок, який включає 3 найважливіші висновки, докази (кількість користувачів) і рекомендовані дії. Перебільшення; взяти числа з нотаток. Доповідь: <<текст>>

Слабка підказка / Сильна підказка

Слабкий: «Зробіть висновки з цих тестових результатів».

Результат: змішаний список без доказів, без порядку важливості та помилково помилково вважати одним спостереженням знахідкою.

Сильний: «Намалюйте висновок із нотаток; під кожним висновком додайте підтверджуючі спостереження та кількість учасників, у яких він був помічений; позначте той, що базується на одному спостереженні, як «слабкий доказ»; потім розташуйте його в порядку важливості відповідно до ефекту-частоти-ефекту роботи».

Результат: засновані на доказах, пріоритетні, обґрунтовані висновки.

Різниця: сильна підказка містить кількість доказів + слабка підказка + критерій важливості.

Поширені помилки

  • Плутає спостереження з знахідкою. Перетворення одного «що сталося» на загальний висновок.
  • Робити критичні висновки з одного спостереження. Жодна вага не буде надана, доки частота не буде перевірена.
  • Вирішення впливу штучного інтелекту на бізнес. Для впливу на дохід/конверсію потрібен контекст; Він у своїй команді.
  • Не розставляйте пріоритети. Невпорядкований список знахідок паралізує команду; Не все можна виправити відразу.
  • Залишення пропозицій розпливчастими. «Зробіть краще» не можна застосувати; Що, чому і де має бути зрозуміло.

Підсумовуючи

Цінність тестування зручності використання полягає в тому, що записи та нотатки перетворюються на чіткі, пріоритетні результати. Штучний інтелект значно прискорює цей синтез: агрегує спостереження у висновки, готує рекомендації, пропонує порядок важливості. Але перевірити кількість спостережень, що стоять за кожним висновком, відсіяти роздуті висновки на основі окремих спостережень і зважити вплив на бізнес з урахуванням контексту — справа людини. Звіт про результати, який ґрунтується на доказах, має певну частоту та впорядкований у порядку важливості, буде швидким і обґрунтованим для зацікавлених сторін.

Аплікаційне завдання

  1. Зробіть анонімними нотатки з тесту юзабіліті (реального чи вигаданого).
  2. Видаліть висновки за першим запитом; Перевірте кількість спостережень під кожним.
  3. Виділіть результати, позначені як «слабкі докази», і вирішіть, чи потрібні додаткові дані.
  4. За допомогою другої підказки розташуйте результати в порядку важливості; Оцініть вплив на бізнес як команда.
  5. За допомогою третьої підказки напишіть конкретні пропозиції щодо кожного висновку та створіть таблицю пріоритетів.

контрольний список

  • [ ] Я зберіг спостереження, висновки та пропозиції як окремі шари.
  • [ ] Я перевірив, скільки учасників показали кожну знахідку.
  • [ ] Я позначив результати, засновані на одному спостереженні, як слабкі докази.
  • [ ] Я визначив рівень тяжкості за впливом на роботу, частоту ударів.
  • [ ] Оцінка рішення щодо впливу на бізнес разом із командою.
  • [ ] Я написав пропозиції конкретно (що/чому/де).