Unità 8 / 11

Analisi dei test di usabilità e sintesi dei risultati

Guadagni:

  • Capacità di convertire i record dei test di usabilità e le note di osservazione in risultati, pesi e raccomandazioni con l'intelligenza artificiale
  • Capacità di classificare i risultati in base alla gravità e produrre una tabella di priorità
  • Capacità di correggere i risultati che l'intelligenza artificiale omette o esagera con prove di osservazione reale

Il test di usabilità è un metodo per osservare dove il design funziona e dove si blocca, assegnando compiti specifici a utenti reali e monitorandoli. Il test in sé è semplice; La vera sfida sta nel dopo: trasformare ore di registrazione, pagine di note di osservazione e schermate sparse in risultati chiari e prioritari. Questa sintesi richiede giorni di lavoro manuale e i team spesso la lasciano incompiuta. L’intelligenza artificiale apre questo collo di bottiglia: trasformando registrazioni e note in risultati, peso e raccomandazioni. Ma è il giudizio umano a decidere se un’osservazione è davvero un problema e quanto sia importante.

Differenza tra osservazione, scoperta e suggestione

È fondamentale separare tre strati nella sintesi:

  • Osservazione: cosa è successo, nessun commento. "Il partecipante 3 ha cercato il pulsante 'continua' per 40 secondi."
  • Risultato: il modello che emerge dalle osservazioni. "Gli utenti hanno difficoltà a trovare l'azione primaria."
  • Raccomandazione: cosa fare. "Fa risaltare visivamente il pulsante principale."

L’intelligenza artificiale produce rapidamente questi tre strati, ma spesso confonde l’osservazione con la scoperta o deduce un’intera scoperta da una singola osservazione. Il tuo compito è verificare che ci siano abbastanza osservazioni (quanti partecipanti, quante volte) dietro ogni risultato.

Suggerimento: chiedi all'intelligenza artificiale di dire "sotto ogni risultato, aggiungi osservazioni che lo supportano e in quanti partecipanti è stato visto". In questo modo puoi distinguere immediatamente i risultati gonfiati da una singola osservazione.

Gravità: cosa correggere prima?

Non tutti i risultati sono uguali. La gravità indica l'urgenza con cui un problema deve essere risolto ed è determinata da tre fattori:

  1. Impatto: il problema impedisce all'utente di completare l'attività o semplicemente lo infastidisce?
  2. Frequenza: quanti utenti e con quale frequenza?
  3. Impatto aziendale: quanto incide questo problema sulla conversione, sulle entrate o sulla fiducia?

Una scala tipica: Critica (ostacola completamente la missione), Alta (difficoltà grave), Media (rallenta), Bassa (estetica). L'intelligenza artificiale può suggerire una classifica iniziale, ma la decisione finale sulla ponderazione, in particolare sull'impatto aziendale, richiede la conoscenza del contesto da parte del team.

trovare

Impatto

frequenza

importanza

Suggerimento

Impossibile trovare il pulsante principale

Interferisce con il compito

4/6 partecipanti

critico

Pulsante Evidenzia

Il messaggio di errore non è chiaro

rallentando

3/6

alto

Chiarire il messaggio

Significato dell'icona poco chiaro

leggera esitazione

2/6

medio

Aggiungi etichetta

La tonalità del colore non è piaciuta

cosmetici

1/6

basso

lascialo per dopo

tre mini custodie

Caso 1 — 5 ore di registrazione, risultati in mezza giornata. Un team ha fornito all'intelligenza artificiale gli appunti di 6 test utente (5 ore in totale). Il modello ha suggerito 14 risultati; Il team ha confrontato ciascuna di esse con il numero di osservazioni, ha ristretto il campo a 9 e le ha classificate in ordine di importanza. La sintesi, che manualmente avrebbe richiesto 2 giorni, è stata ridotta a mezza giornata.

Caso 2 — Reperto gonfiato catturato. "Gli utenti non capiscono la navigazione", ha scritto l'AI in una constatazione critica. Quando il team ha esaminato le osservazioni di supporto, ha scoperto che si basavano su un singolo momento di un singolo partecipante. Il risultato è stato declassato a "moderato" e sono stati richiesti più dati. Lezione: una singola osservazione non costituisce una conclusione critica.

Caso 3: Problema critico mancato. Il modello ha considerato un problema ricorrente ma apparentemente minore (il modulo non a scorrimento automatico) come "basso". Quando il progettista ha esaminato le osservazioni, si è reso conto che ciò ha causato l'abbandono del compito in 5 partecipanti e l'ha impostato su "alto". Lezione: la stima dell’importanza dell’intelligenza artificiale è corretta da prove osservative.

Leggere insieme dati quantitativi e qualitativi

I test di usabilità sono per lo più qualitativi (basati sull'osservazione), ma ci sono anche segnali quantitativi (numerici): tasso di completamento dell'attività, durata dell'attività, numero di errori, punteggio di soddisfazione. La sintesi più potente combina i due: “Solo il 33% dei partecipanti ha completato l’attività di pagamento (quantitativa) e tutti coloro che non l’hanno completata sono rimasti bloccati nella fase di spedizione (qualitativa)”. L'intelligenza artificiale aiuta a combinare questi due dati quando li fornisci separatamente; ma confermi l'accuratezza dei numeri e la dimensione del campione. Parlare di percentuali può essere fuorviante in campioni piccoli (es. 5 utenti); Dire "3 utenti su 5" è più onesto che dire "60%". Chiedi al modello di parlare in numeri assoluti.

Suggerimento: chiedi all'intelligenza artificiale di dire "scrivi 'quanti utenti' anziché una percentuale". In campioni piccoli, la percentuale dà l'impressione di una precisione maggiore di quanto non sia in realtà.

Prompt copiabili

Il tuo ruolo: analista di usabilità. Trai i risultati dalle seguenti note di test anonimizzate. Per ogni risultato: 1) dichiarazione chiara, 2) osservazioni di supporto e quanti partecipanti l'hanno visto, 3) effetto (blocco/rallentamento/cosmetico). Contrassegnare i risultati basati su una singola osservazione come "PROVA DEBOLE". Note: <<testo>>

Ordina questo elenco di risultati per importanza. Criteri: impatto (impedimento nel compito?), frequenza (quanti partecipanti?), impatto aziendale. Assegnare ciascun risultato Critico/Alto/Medio/Basso e scrivere una motivazione. Se non sei sicuro dell'impatto aziendale, di' "il team deve valutare". Risultati: <<lista>>

Scrivi una raccomandazione progettuale concreta e attuabile per ogni risultato. Raccomandazione: cosa cambierà + perché risolve il problema + su quale schermo influisce. Evita raccomandazioni vaghe ("fai meglio"). Risultati: <<lista>>

Riassumere questo rapporto sui risultati per la presentazione alle parti interessate: scrivere un breve riepilogo esecutivo che includa i 3 risultati più critici, le prove (quanti utenti) e l'azione consigliata. Esagerazione; prendi i numeri dalle note. Rapporto: <<testo>>

Prompt debole / Prompt forte

Debole: "Trai conclusioni da questi punteggi dei test."

Risultato: un elenco misto senza prove, senza ordine di importanza e confondendo una singola osservazione come un risultato.

Forte: "Traccia un risultato dalle note; sotto ciascun risultato, aggiungi osservazioni di supporto e in quanti partecipanti è stato osservato; contrassegna quello basato su una singola osservazione come 'evidenza debole'; quindi classificalo in ordine di importanza in base all'effetto-frequenza-lavoro."

Risultato: risultati basati sull’evidenza, prioritari e difendibili.

Differenza: suggerimento forte numero di prove + suggerimento debole + criterio di importanza.

Errori comuni

  • Confondere l'osservazione con la scoperta. Trasformare un singolo “cosa è successo” in una conclusione complessiva.
  • Ottenere risultati critici da una singola osservazione. Non verrà assegnato alcun peso finché non verrà verificata la frequenza.
  • Decidere l’impatto aziendale sull’intelligenza artificiale. L'impatto sulle entrate/conversioni richiede il contesto; È nella sua squadra.
  • Non dare priorità. L'elenco disorganizzato dei risultati paralizza la squadra; Non tutto può essere risolto in una volta.
  • Lasciare vaghi i suggerimenti. “Fare meglio” è inapplicabile; Cosa, perché e dove dovrebbe essere chiaro.

In sintesi

Il valore dei test di usabilità sta nel trasformare registrazioni e note in risultati chiari e prioritari. L’intelligenza artificiale accelera notevolmente questa sintesi: aggrega le osservazioni in risultati, elabora raccomandazioni, suggerisce un ordine di importanza. Ma è compito umano verificare il numero di osservazioni alla base di ciascun risultato, eliminare risultati gonfiati basati su singole osservazioni e valutare l'impatto aziendale in base al contesto. Un rapporto sui risultati basato su prove, con una certa frequenza e organizzato in ordine di importanza sarà rapido e difendibile per le parti interessate.

Compito dell'applicazione

  1. Anonimizza le note di un test di usabilità (reale o fittizio).
  2. Rimuovere i risultati al primo prompt; Controllare il numero di osservazioni sotto ciascuna.
  3. Isolare i risultati contrassegnati come "evidenza debole" e decidere se sono necessari dati aggiuntivi.
  4. Con il secondo suggerimento, classifica i risultati in ordine di importanza; Valutare l'impatto aziendale come squadra.
  5. Con il terzo suggerimento, scrivi suggerimenti concreti per ciascun risultato e crea una tabella di priorità.

lista di controllo

  • [ ] Ho mantenuto l'osservazione, i risultati e il suggerimento come livelli separati.
  • [ ] Ho verificato quanti partecipanti hanno mostrato ciascun risultato.
  • [ ] Ho contrassegnato i risultati basati su una singola osservazione come prova debole.
  • [ ] Ho determinato il livello di gravità in base alla frequenza dell'impatto e all'impatto sul lavoro.
  • [ ] Valutare la decisione sull'impatto aziendale con il team.
  • [ ] Ho scritto i suggerimenti concretamente (cosa/perché/dove).