Enhet 8 / 11

Usability Testing Analyse og syntese av funn

Gevinster:

  • Evne til å konvertere brukervennlighetstester og observasjonsnotater til funn, vekter og anbefalinger med kunstig intelligens
  • Evne til å rangere funn etter alvorlighetsgrad og lage en prioriteringstabell
  • Evne til å korrigere funn som kunstig intelligens utelater eller overdriver med ekte observasjonsbevis

Usability testing er en metode for å observere hvor designet fungerer og hvor det setter seg fast ved å gi spesifikke oppgaver til reelle brukere og overvåke dem. Selve testen er enkel; Den virkelige utfordringen er i kjølvannet: å gjøre om timer med opptak, sider med observasjonsnotater og spredte skjermbilder til klare, prioriterte funn. Denne syntesen tar dager for hånd, og team lar den ofte være uferdig. Kunstig intelligens åpner denne flaskehalsen: å gjøre poster og notater til funn, vekt og anbefaling. Men det er menneskelig dømmekraft å avgjøre om en observasjon virkelig er et problem og hvor viktig den er.

Forskjellen mellom observasjon, funn og forslag

Det er avgjørende å skille tre lag i syntesen:

  • Observasjon: Hva skjedde, ingen kommentar. «Deltaker 3 søkte etter «fortsett»-knappen i 40 sekunder.»
  • Funn: Mønsteret som kommer fra observasjoner. "Brukere har problemer med å finne den primære handlingen."
  • Anbefaling: Hva du skal gjøre. "Får den primære knappen visuelt ut."

AI produserer raskt disse tre lagene, men forveksler ofte observasjon med funn eller utleder et helt funn fra en enkelt observasjon. Din jobb er å verifisere at det er nok observasjoner (hvor mange deltakere, hvor mange ganger) bak hvert funn.

Tips: La den kunstige intelligensen si "under hvert funn, legg til observasjoner som støtter det og hvor mange deltakere det ble sett i." På denne måten kan du umiddelbart skille oppblåste funn fra en enkelt observasjon.

Alvorlighet: hva skal jeg fikse først?

Ikke alle funn er like. Alvorlighetsgrad angir hvor raskt et problem må løses og bestemmes av tre faktorer:

  1. Virkning: Hindrer problemet brukeren fra å fullføre oppgaven eller irriterer den dem bare?
  2. Frekvens: Hvor mange brukere og hvor ofte?
  3. Virksomhetspåvirkning: Hvor mye påvirker dette problemet konvertering, inntekt eller tillit?

En typisk skala: Kritisk (helt hindrer oppdraget), Høy (alvorlig vanskelighetsgrad), Middels (senker farten), Lav (kosmetisk). AI kan foreslå en innledende rangering, men den endelige vektingsbeslutningen – spesielt forretningseffekten – krever teamets kunnskap om konteksten.

finne

Virkning

frekvens

viktighet

Forslag

Primærknapp ble ikke funnet

Det forstyrrer oppgaven

4/6 deltakere

kritisk

Uthev-knapp

Feilmeldingen er uklar

bremse ned

3/6

høy

Forklar meldingen

Betydningen av ikonet er uklart

liten nøling

2/6

medium

Legg til tag

Fargetone ble ikke likt

kosmetikk

1/6

lav

la det stå til senere

tre minisaker

Case 1 — 5 timers opptak, funn på en halv dag. Ett team matet notatene til 6 brukertester (5 timer totalt) til AI. Modellen foreslo 14 funn; Teamet sjekket hver enkelt mot antall observasjoner, reduserte det til 9 og rangerte dem i rekkefølge etter viktighet. Syntese, som ville tatt 2 dager manuelt, ble redusert til en halv dag.

Tilfelle 2 — Oppblåst funn fanget. "Brukere forstår ikke navigasjon," skrev AI i et kritisk funn. Da teamet så på de støttende observasjonene, fant de ut at det var basert på et enkelt øyeblikk fra en enkelt deltaker. Funnet ble nedgradert til «moderat» og mer data ble etterspurt. Leksjon: en enkelt observasjon gir ikke et kritisk funn.

Tilfelle 3 – Besvart kritisk problemstilling. Modellen regnet et tilbakevendende, men tilsynelatende mindre problem (skjemaet ikke automatisk rulling) som "lavt". Da designeren så på observasjonene, skjønte han at dette førte til at oppgavene ble forlatt hos 5 deltakere og satte den til "høy". Leksjon: AIs betydningsestimat er korrigert av observasjonsbevis.

Lese kvantitative og kvalitative data sammen

Usability-testing er for det meste kvalitativ (observasjonsbasert), men det er også kvantitative (numeriske) signaler: oppgavegjennomføringsrate, oppgavevarighet, antall feil, tilfredshetsscore. Den kraftigste syntesen kombinerer de to: "Bare 33 % av deltakerne fullførte betalingsoppgaven (kvantitativ), og alle som ikke klarte å fullføre, ble sittende fast ved frakttrinnet (kvalitativt)." Kunstig intelligens hjelper til med å kombinere disse to dataene når du gir dem hver for seg; men du bekrefter nøyaktigheten av tallene og prøvestørrelsen. Å snakke om prosenter kan være misvisende i små utvalg (f.eks. 5 brukere); Å si «3 av 5 brukere» er mer ærlig enn å si «60 %». Be modellen snakke i absolutte tall.

Tips: La AI-en si «skriv som «hvor mange brukere» i stedet for en prosentandel». I små prøver gir prosent inntrykk av større presisjon enn det faktisk er.

Kopiérbare spørsmål

Din rolle: brukervennlighetsanalytiker. Tegn funn fra følgende anonymiserte testnotater. For hvert funn: 1) tydelig utsagn, 2) støttende observasjoner og hvor mange deltakere som har sett det, 3) effekt (blokkerende/bremsende/kosmetisk). Merk funn basert på en enkelt observasjon som "SWAK BEVIS". Merknader: <<tekst>>

Sorter denne listen over funn etter viktighet. Kriterier: påvirkning (oppgavehindre?), frekvens (hvor mange deltakere?), virksomhetspåvirkning. Tildel hvert funn Kritisk/Høy/Middels/Lav og skriv en begrunnelse. Hvis du er usikker på forretningseffekten, si «teamet må evaluere». Funn: <<liste>>

Skriv en konkret, praktisk designanbefaling for hvert funn. Anbefaling: hva vil endre + hvorfor dette løser problemet + hvilken skjerm det påvirker. Unngå vage ("gjør bedre") anbefalinger. Funn: <<liste>>

Oppsummer denne funnrapporten for presentasjon av interessenter: skriv et kort sammendrag som inkluderer de 3 mest kritiske funnene, bevis (hvor mange brukere) og anbefalt handling. Overdrivelse; ta tall fra notater.Rapport: <<tekst>>

Svak forespørsel / Sterk forespørsel

Svak: "Trekk konklusjoner fra disse testresultatene."

Resultat: En blandet liste uten bevis, ingen rekkefølge av betydning, og å ta feil av en enkelt observasjon som et funn.

Sterkt: "Tegn et funn fra notatene; under hvert funn, legg til støttende observasjoner og hvor mange deltakere det ble sett i; merk det som er basert på en enkelt observasjon som 'svake bevis'; ranger det deretter i rekkefølge etter viktighet i henhold til effekt-frekvens-arbeidseffekt."

Resultat: Evidensbaserte, prioriterte, forsvarbare funn.

Forskjell: sterk forespørsel gir antall bevis + svak forespørsel + viktighetskriterium.

Vanlige feil

  • Forvirrende observasjon med funn. Gjøre en enkelt "hva skjedde" til en samlet konklusjon.
  • Å gjøre kritiske funn fra en enkelt observasjon. Ingen vekt vil bli gitt før frekvensen er verifisert.
  • Bestemme virksomhetens innvirkning på kunstig intelligens. Inntekts-/konverteringseffekt krever kontekst; Han er på laget sitt.
  • Ikke prioriter. Den uorganiserte listen over funn lammer teamet; Ikke alt kan fikses på en gang.
  • Etterlater vage forslag. "Gjør det bedre" er ubrukelig; Hva, hvorfor og hvor skal være klart.

Oppsummert

Verdien av brukervennlighetstesting kommer i å gjøre opptak og notater til klare, prioriterte funn. Kunstig intelligens fremskynder denne syntesen i stor grad: samler observasjoner til funn, utarbeider anbefalinger, foreslår viktighetsrekkefølge. Men det er menneskelig arbeid å verifisere antall observasjoner bak hvert funn, å luke ut oppblåste funn basert på enkeltobservasjoner, og å vekte forretningseffekt med kontekst. En funnrapport som er basert på evidens, har en viss frekvens og er ordnet i viktighetsrekkefølge vil være både rask og forsvarlig for interessenter.

Søknadsoppgave

  1. Anonymiser notater fra en brukervennlighetstest (ekte eller fiktive).
  2. Fjern funnene ved den første ledeteksten; Sjekk antall observasjoner under hver.
  3. Isoler funn merket "svake bevis" og avgjør om ytterligere data er nødvendig.
  4. Med den andre ledeteksten rangerer du funnene i rekkefølge etter viktighet; Vurder virksomhetens innvirkning som et team.
  5. Med den tredje ledeteksten, skriv konkrete forslag for hvert funn og lag en prioriteringstabell.

sjekkliste

  • [ ] Jeg holdt observasjon, funn og forslag som separate lag.
  • [ ] Jeg bekreftet hvor mange deltakere som viste hvert funn.
  • [ ] Jeg markerte funn basert på en enkelt observasjon som svake bevis.
  • [ ] Jeg bestemte alvorlighetsgraden ved påvirkning-frekvens-jobbpåvirkning.
  • [ ] Evaluerte beslutningen om forretningseffekt med teamet.
  • [ ] Jeg skrev forslagene konkret (hva/hvorfor/hvor).