Прибуток:
- Можливість перетворювати записи тестів на зручність використання та нотатки спостережень у висновки, ваги та рекомендації за допомогою штучного інтелекту
- Здатність ранжувати висновки за ступенем серйозності та створювати таблицю пріоритетів
- Здатність виправляти результати, які штучний інтелект пропускає або перебільшує, за допомогою реальних даних спостережень
Юзабіліті-тестування — це метод спостереження за тим, де дизайн працює, а де він застряє, ставлячи конкретні завдання реальним користувачам і контролюючи їх. Сам тест простий; Справжнє завдання полягає в наслідках: перетворити години запису, сторінки нотаток спостережень і розрізнені знімки екрана в чіткі, пріоритетні висновки. Цей синтез займає кілька днів вручну, і команди часто залишають його незавершеним. Штучний інтелект відкриває це вузьке місце: перетворює записи та нотатки на висновки, вагу та рекомендації. Але людське судження вирішує, чи справді спостереження є проблемою і наскільки воно важливе.
Різниця між спостереженням, знаходженням і навіюванням
У синтезі важливо розділити три рівні:
- Спостереження: Що сталося, без коментарів. «Учасник 3 шукав кнопку «продовжити» протягом 40 секунд».
- Висновок: закономірність, що випливає зі спостережень. «Користувачі мають проблеми з пошуком основної дії».
- Рекомендація: що робити. «Виділяє основну кнопку».
Штучний інтелект швидко створює ці три рівні, але часто плутає спостереження з знахідкою або виводить цілий висновок з одного спостереження. Ваше завдання полягає в тому, щоб перевірити, чи є достатньо спостережень (скільки учасників, скільки разів) за кожним висновком.
Порада: нехай штучний інтелект скаже: «під кожним висновком додайте спостереження, які його підтверджують, і скільки учасників його бачили». Таким чином ви можете миттєво відрізнити завищені висновки від одного спостереження.
Серйозність: що виправити в першу чергу?
Не всі висновки однакові. Рівень серйозності вказує на те, наскільки терміново потрібно вирішити проблему, і визначається трьома факторами:
- Вплив: проблема заважає користувачеві виконати завдання чи просто дратує його?
- Частота: скільки користувачів і як часто?
- Вплив на бізнес: наскільки ця проблема впливає на конверсію, дохід або довіру?
Типова шкала: Критичний (повністю заважає місії), Високий (сувора складність), Середній (уповільнює), Низький (косметичний). ШІ може запропонувати початкове ранжування, але остаточне рішення щодо ваги — зокрема вплив на бізнес — вимагає від команди знання контексту.
знахідка
Вплив
частота
важливість
Пропозиція
Неможливо знайти основну кнопку
Це заважає виконанню завдання
4/6 учасників
критичний
Кнопка виділення
Повідомлення про помилку незрозуміле
уповільнення
3/6
висока
Уточніть повідомлення
Значення значка незрозуміле
легке вагання
2/6
середній
Додати тег
Колірний тон не сподобався
косметичні засоби
1/6
низький
залиште це на потім
три міні-чохла
Випадок 1 — 5 годин запису, знахідки за півдня. Одна команда передала нотатки 6 тестів користувача (загалом 5 годин) ШІ. Модель запропонувала 14 знахідок; Команда перевірила кожне з них за кількістю спостережень, звузила їх до 9 і розташувала їх у порядку важливості. Синтез, який займав би 2 дні вручну, скоротився до половини дня.
Випадок 2 — Спіймано завищену знахідку. «Користувачі не розуміють навігацію», — написав AI у критичному висновку. Коли команда переглянула підтверджуючі спостереження, вони виявили, що вони базуються на одному моменті від одного учасника. Висновок було знижено до "помірного", і було запропоновано додаткові дані. Урок: одне спостереження не робить критичного висновку.
Випадок 3 — пропущена критична проблема. Модель зарахувала повторювану, але, здавалося б, незначну проблему (форма не автоматично прокручується) як «низьку». Коли дизайнер подивився на спостереження, він зрозумів, що це спричинило відмову від завдання у 5 учасників, і встановив для нього значення «високе». Урок: Оцінка важливості штучного інтелекту коригується на основі даних спостережень.
Спільне читання кількісних і якісних даних
Перевірка юзабіліті здебільшого якісна (на основі спостережень), але є також кількісні (числові) сигнали: швидкість виконання завдань, тривалість завдання, кількість помилок, оцінка задоволеності. Найпотужніший синтез поєднує обидва: «Лише 33% учасників виконали завдання оформлення замовлення (кількісне), а всі, хто не зміг виконати, застрягли на етапі доставки (якісне)». Штучний інтелект допомагає об’єднати ці два дані, коли ви надаєте їх окремо; але ви підтверджуєте точність чисел і розмір вибірки. Розмова про відсотки може ввести в оману в невеликих вибірках (наприклад, 5 користувачів); Сказати «3 з 5 користувачів» більш чесно, ніж сказати «60%». Попросіть модель говорити в абсолютних цифрах.
Порада: нехай штучний інтелект скаже «напишіть як «скільки користувачів» замість відсотка». У невеликих вибірках відсоток створює враження більшої точності, ніж насправді.
Копіювані підказки
Ваша роль: аналітик юзабіліті. Зробіть висновки з наведених нижче анонімних нотаток до тесту. Для кожного висновку: 1) чітке твердження, 2) підтверджуючі спостереження та кількість учасників, які це бачили, 3) ефект (блокування/уповільнення/косметичний). Позначте результати, засновані на одному спостереженні, як «СЛАБКІ ДОКАЗИ». Примітки: <<текст>>
Розсортуйте цей список знахідок за важливістю. Критерії: вплив (перешкода завдання?), частота (скільки учасників?), бізнес-вплив. Призначте кожному висновку Критичний/Високий/Середній/Низький і напишіть обґрунтування. Якщо ви не впевнені щодо впливу на бізнес, скажіть «команда повинна оцінити». Висновки: <<список>>
Напишіть конкретні практичні рекомендації щодо дизайну для кожного знахідки. Рекомендація: що зміниться + чому це вирішує проблему + на який екран впливає. Уникайте розпливчастих («робити краще») рекомендацій. Висновки: <<список>>
Узагальніть цей звіт про результати для презентації зацікавленим сторонам: напишіть короткий підсумок, який включає 3 найважливіші висновки, докази (кількість користувачів) і рекомендовані дії. Перебільшення; взяти числа з нотаток. Доповідь: <<текст>>
Слабка підказка / Сильна підказка
Слабкий: «Зробіть висновки з цих тестових результатів».
Результат: змішаний список без доказів, без порядку важливості та помилково помилково вважати одним спостереженням знахідкою.
Сильний: «Намалюйте висновок із нотаток; під кожним висновком додайте підтверджуючі спостереження та кількість учасників, у яких він був помічений; позначте той, що базується на одному спостереженні, як «слабкий доказ»; потім розташуйте його в порядку важливості відповідно до ефекту-частоти-ефекту роботи».
Результат: засновані на доказах, пріоритетні, обґрунтовані висновки.
Різниця: сильна підказка містить кількість доказів + слабка підказка + критерій важливості.
Поширені помилки
- Плутає спостереження з знахідкою. Перетворення одного «що сталося» на загальний висновок.
- Робити критичні висновки з одного спостереження. Жодна вага не буде надана, доки частота не буде перевірена.
- Вирішення впливу штучного інтелекту на бізнес. Для впливу на дохід/конверсію потрібен контекст; Він у своїй команді.
- Не розставляйте пріоритети. Невпорядкований список знахідок паралізує команду; Не все можна виправити відразу.
- Залишення пропозицій розпливчастими. «Зробіть краще» не можна застосувати; Що, чому і де має бути зрозуміло.
Підсумовуючи
Цінність тестування зручності використання полягає в тому, що записи та нотатки перетворюються на чіткі, пріоритетні результати. Штучний інтелект значно прискорює цей синтез: агрегує спостереження у висновки, готує рекомендації, пропонує порядок важливості. Але перевірити кількість спостережень, що стоять за кожним висновком, відсіяти роздуті висновки на основі окремих спостережень і зважити вплив на бізнес з урахуванням контексту — справа людини. Звіт про результати, який ґрунтується на доказах, має певну частоту та впорядкований у порядку важливості, буде швидким і обґрунтованим для зацікавлених сторін.
Аплікаційне завдання
- Зробіть анонімними нотатки з тесту юзабіліті (реального чи вигаданого).
- Видаліть висновки за першим запитом; Перевірте кількість спостережень під кожним.
- Виділіть результати, позначені як «слабкі докази», і вирішіть, чи потрібні додаткові дані.
- За допомогою другої підказки розташуйте результати в порядку важливості; Оцініть вплив на бізнес як команда.
- За допомогою третьої підказки напишіть конкретні пропозиції щодо кожного висновку та створіть таблицю пріоритетів.
контрольний список
- [ ] Я зберіг спостереження, висновки та пропозиції як окремі шари.
- [ ] Я перевірив, скільки учасників показали кожну знахідку.
- [ ] Я позначив результати, засновані на одному спостереженні, як слабкі докази.
- [ ] Я визначив рівень тяжкості за впливом на роботу, частоту ударів.
- [ ] Оцінка рішення щодо впливу на бізнес разом із командою.
- [ ] Я написав пропозиції конкретно (що/чому/де).