이득:
- 사용성 테스트 기록 및 관찰 메모를 인공 지능을 통해 결과, 가중치 및 권장 사항으로 변환하는 기능
- 심각도에 따라 결과의 순위를 매기고 우선순위 테이블을 생성하는 기능
- 인공지능이 누락하거나 과장한 결과를 실제 관찰 증거로 수정하는 능력
사용성 테스트는 실제 사용자에게 특정 작업을 제공하고 모니터링하여 디자인이 작동하는 위치와 막히는 위치를 관찰하는 방법입니다. 테스트 자체는 쉽습니다. 진정한 도전은 여파에 있습니다. 몇 시간에 걸친 기록, 관찰 메모 페이지, 흩어져 있는 스크린샷을 명확하고 우선순위가 높은 결과로 바꾸는 것입니다. 이 합성은 수작업으로 며칠이 걸리며 팀에서는 종종 미완성 상태로 남겨둡니다. 인공 지능은 이러한 병목 현상을 열어 기록과 메모를 결과, 가중치 및 권장 사항으로 전환합니다. 그러나 관찰이 실제로 문제인지, 그것이 얼마나 중요한지를 결정하는 것은 인간의 판단입니다.
관찰, 발견, 제안의 차이점
합성에서 세 개의 레이어를 분리하는 것이 중요합니다.
- 관찰: 무슨 일이 일어났는지, 코멘트가 없습니다. "참여자 3은 '계속' 버튼을 40초 동안 검색했습니다."
- 발견: 관찰에서 나타나는 패턴. "사용자가 기본 작업을 찾는 데 어려움을 겪고 있습니다."
- 권장 사항: 해야 할 일. "기본 버튼을 시각적으로 눈에 띄게 만듭니다."
AI는 이 세 가지 레이어를 신속하게 생성하지만 종종 관찰과 발견을 혼동하거나 단일 관찰에서 전체 발견을 추론합니다. 귀하의 임무는 각 결과 뒤에 충분한 관찰 결과(참가자 수, 횟수)가 있는지 확인하는 것입니다.
팁: 인공 지능이 "각 결과 아래에 이를 뒷받침하는 관찰 내용과 해당 결과가 나타난 참가자 수를 추가하세요."라고 말하도록 합니다. 이렇게 하면 단일 관찰에서 부풀려진 결과를 즉시 구별할 수 있습니다.
심각도: 무엇을 먼저 고쳐야 할까요?
모든 결과가 동일한 것은 아닙니다. 심각도는 문제를 얼마나 긴급하게 해결해야 하는지를 나타내며 다음 세 가지 요소에 의해 결정됩니다.
- 영향: 문제로 인해 사용자가 작업을 완료하지 못하거나 짜증만 나게 됩니까?
- 빈도: 사용자 수와 빈도는 얼마나 됩니까?
- 비즈니스 영향: 이 문제가 전환, 수익 또는 신뢰에 얼마나 영향을 미치나요?
일반적인 규모: 심각(미션을 완전히 방해함), 높음(심각한 난이도), 중간(느림), 낮음(외관). AI는 초기 순위를 제안할 수 있지만 최종 가중치 결정(특히 비즈니스 영향)에는 팀의 맥락에 대한 지식이 필요합니다.
발견
영향
빈도
중요성
제안
기본 버튼을 찾을 수 없습니다
업무에 방해가 되네요
4/6 참가자
중요한
하이라이트 버튼
오류 메시지가 명확하지 않습니다.
속도를 늦추다
3/6
높다
메시지를 명확히 하라
아이콘 의미가 불분명함
약간의 망설임
2/6
중간
태그 추가
색상 톤이 마음에 들지 않았습니다.
화장품
1/6
낮음
나중을 위해 남겨두세요
세 개의 미니 케이스
사례 1 - 5시간 동안 녹음하고 반나절 만에 결과를 얻습니다. 한 팀은 6개의 사용자 테스트(총 5시간)에 대한 메모를 AI에 입력했습니다. 모델은 14가지 결과를 제안했습니다. 팀은 관찰 횟수와 비교하여 각 항목을 확인하고 9개로 좁힌 다음 중요도 순으로 순위를 매겼습니다. 수동으로 2일이 걸리던 합성이 반나절로 단축되었습니다.
사례 2 — 부풀려진 결과가 발견되었습니다. AI는 비판적 발견에서 “사용자는 내비게이션을 이해하지 못한다”고 썼다. 팀이 뒷받침하는 관찰 내용을 살펴보면 그것이 단일 참가자의 한 순간을 기반으로 한다는 것을 발견했습니다. 결과는 "보통"으로 하향 조정되었으며 더 많은 데이터가 요청되었습니다. 교훈: 단 한번의 관찰로는 중요한 결론을 내릴 수 없습니다.
사례 3 — 중요한 문제가 누락되었습니다. 모델은 반복되지만 사소해 보이는 문제(자동 스크롤되지 않는 양식)를 "낮음"으로 계산했습니다. 디자이너는 관찰 결과를 검토한 결과 이로 인해 5명의 참가자가 작업을 포기한다는 사실을 깨닫고 이를 "높음"으로 설정했습니다. 교훈: AI의 중요도 추정은 관찰 증거에 의해 수정됩니다.
정량적 데이터와 정성적 데이터를 함께 읽기
사용성 테스트는 대부분 정성적(관찰 기반)이지만 작업 완료율, 작업 기간, 오류 수, 만족도 점수와 같은 정량적(수치적) 신호도 있습니다. 가장 강력한 종합은 이 두 가지를 결합한 것입니다. "참가자의 33%만이 결제 작업(정량적)을 완료했으며 완료하지 못한 모든 사람은 배송 단계(정성적)에서 막혔습니다." 인공 지능은 이 두 데이터를 별도로 제공할 때 이를 결합하는 데 도움이 됩니다. 하지만 숫자와 표본 크기의 정확성은 확인합니다. 작은 표본(예: 사용자 5명)에서는 백분율에 대해 말하는 것이 오해의 소지가 있을 수 있습니다. "60%"라고 말하는 것보다 "사용자 5명 중 3명"이라고 말하는 것이 더 정직합니다. 모델에게 절대적인 숫자로 말하도록 요청하세요.
팁: AI가 "백분율 대신 '사용자 수'로 쓰세요"라고 말하게 하세요. 작은 표본에서는 백분율이 실제보다 더 정밀하다는 인상을 줍니다.
복사 가능한 프롬프트
귀하의 역할: 유용성 분석가. 다음의 익명화된 테스트 노트에서 결과를 도출합니다. 각 결과에 대해: 1) 명확한 설명, 2) 관찰을 뒷받침하는 관찰 및 이를 본 참가자 수, 3) 효과(차단/느림/미관). 단일 관찰을 기반으로 한 결과를 "약한 증거"로 표시합니다. 참고: <<텍스트>>
이 결과 목록을 중요도별로 정렬하세요. 기준: 영향(작업 장애?), 빈도(참가자 수?), 비즈니스 영향. 각 결과를 심각/높음/보통/낮음으로 할당하고 근거를 작성합니다. 비즈니스 영향이 확실하지 않은 경우 "팀이 평가해야 합니다."라고 말합니다. 조사 결과: <<목록>>
각 결과에 대해 구체적이고 실행 가능한 설계 권장 사항을 작성합니다. 권장 사항: 변경 사항 + 문제가 해결되는 이유 + 영향을 미치는 화면. 모호한("더 나은 성과를 내세요") 권장 사항은 피하세요. 조사 결과: <<목록>>
이해관계자 프레젠테이션을 위해 이 결과 보고서를 요약합니다. 가장 중요한 3가지 결과, 증거(사용자 수) 및 권장 조치를 포함하는 간략한 요약을 작성합니다. 과장; 메모에서 숫자를 가져옵니다.보고서: <<text>>
약한 프롬프트 / 강한 프롬프트
약함: "이 시험 점수로부터 결론을 도출합니다."
결과: 증거가 없고 중요도가 없으며 단일 관찰을 결과로 착각하는 혼합 목록입니다.
강력함: "메모에서 결과를 도출하고, 각 결과 아래에 뒷받침하는 관찰 내용과 그것이 나타난 참가자 수를 추가합니다. 단일 관찰을 기반으로 한 것을 '약한 증거'로 표시한 다음 효과-빈도-작업 효과에 따라 중요도 순서로 순위를 매깁니다."
결과: 증거 기반의 우선순위가 부여된 방어 가능한 결과입니다.
차이점: 강한 프롬프트 증거 수 + 약한 프롬프트 + 중요도 기준.
일반적인 실수
- 관찰과 발견을 혼동합니다. 하나의 "무슨 일이 일어났는지"를 전체적인 결론으로 바꾸는 것입니다.
- 단일 관찰을 통해 중요한 결과를 도출합니다. 빈도가 확인될 때까지 가중치가 부여되지 않습니다.
- 인공 지능에 대한 비즈니스 영향을 결정합니다. 수익/전환 영향에는 맥락이 필요합니다. 그는 그의 팀에 있습니다.
- 우선순위를 정하지 마십시오. 정리되지 않은 결과 목록은 팀을 마비시킵니다. 모든 것이 한 번에 해결될 수는 없습니다.
- 제안을 모호하게 남겨 둡니다. "더 잘해라"는 적용되지 않습니다. 무엇을, 왜, 어디서 명확하게 밝혀야 합니다.
요약하면
사용성 테스트의 가치는 녹음과 메모를 명확하고 우선순위가 높은 결과로 바꾸는 데 있습니다. 인공 지능은 이러한 합성을 크게 가속화합니다. 관찰 내용을 결과로 집계하고 권장 사항 초안을 작성하며 중요도 순서를 제안합니다. 그러나 각 결과 뒤에 있는 관찰 수를 확인하고, 단일 관찰을 기반으로 과장된 결과를 제거하고, 상황에 따라 비즈니스 영향을 평가하는 것은 인간의 작업입니다. 증거에 기초하고 특정 빈도를 가지며 중요도 순으로 정리된 조사 결과 보고서는 이해관계자에게 신속하고 방어적일 것입니다.
응용과제
- 사용성 테스트(실제 또는 가상)의 메모를 익명화합니다.
- 첫 번째 프롬프트에서 결과를 제거합니다. 각각의 관측치 수를 확인하세요.
- "약한 증거"로 표시된 결과를 분리하고 추가 데이터가 필요한지 여부를 결정합니다.
- 두 번째 프롬프트에서는 중요도에 따라 결과의 순위를 매깁니다. 팀으로서 비즈니스 영향을 평가합니다.
- 세 번째 프롬프트에서는 각 결과에 대한 구체적인 제안을 작성하고 우선순위 테이블을 만듭니다.
체크리스트
- [ ] 관찰, 발견, 제안을 별도의 레이어로 유지했습니다.
- [ ] 각 결과를 보여준 참가자 수를 확인했습니다.
- [ ] 나는 단일 관찰에 기초한 결과를 약한 증거로 표시했습니다.
- [ ] 영향-빈도-작업 영향에 따라 심각도 수준을 결정했습니다.
- [ ] 팀과 함께 비즈니스 영향 결정을 평가했습니다.
- [ ] 나는 제안 사항을 구체적으로(무엇을/왜/어디에서) 썼습니까?