Unité 8 / 11

Analyse des tests d’utilisabilité et synthèse des résultats

Gains :

  • Capacité à convertir les enregistrements de tests d'utilisabilité et les notes d'observation en résultats, pondérations et recommandations grâce à l'intelligence artificielle
  • Capacité à classer les résultats selon leur gravité et à produire un tableau de priorisation
  • Capacité à corriger les résultats que l'intelligence artificielle omet ou exagère avec des preuves d'observation réelles

Les tests d'utilisabilité sont une méthode permettant d'observer où la conception fonctionne et où elle reste bloquée en confiant des tâches spécifiques à de vrais utilisateurs et en les surveillant. Le test lui-même est simple ; Le véritable défi se situe au lendemain : transformer des heures d’enregistrement, des pages de notes d’observation et des captures d’écran éparses en résultats clairs et hiérarchisés. Cette synthèse prend des jours à la main et les équipes la laissent souvent inachevée. L'intelligence artificielle ouvre ce goulot d'étranglement : transformer les enregistrements et les notes en conclusions, poids et recommandations. Mais c’est au jugement humain de décider si une observation constitue réellement un problème et quelle est son importance.

Différence entre observation, découverte et suggestion

Il est essentiel de séparer trois couches dans la synthèse :

  • Observation : Que s'est-il passé, pas de commentaire. "Le participant 3 a recherché le bouton "Continuer" pendant 40 secondes."
  • Constatation : le modèle émergeant des observations. "Les utilisateurs ont du mal à trouver l'action principale."
  • Recommandation : Que faire. "Fait ressortir le bouton principal visuellement."

L’IA produit rapidement ces trois niveaux, mais confond souvent observation et découverte ou déduit une découverte complète à partir d’une seule observation. Votre travail consiste à vérifier qu'il y a suffisamment d'observations (combien de participants, combien de fois) derrière chaque résultat.

Astuce : demandez à l'intelligence artificielle de dire : « sous chaque résultat, ajoutez les observations qui le soutiennent et le nombre de participants chez lesquels il a été observé ». De cette façon, vous pouvez distinguer instantanément les résultats gonflés d’une seule observation.

Gravité : que corriger en premier ?

Tous les résultats ne sont pas égaux. La gravité indique l'urgence avec laquelle un problème doit être résolu et est déterminée par trois facteurs :

  1. Impact : le problème empêche-t-il l'utilisateur de terminer la tâche ou le gêne-t-il ?
  2. Fréquence : combien d’utilisateurs et à quelle fréquence ?
  3. Impact sur l'entreprise : dans quelle mesure ce problème a-t-il un impact sur la conversion, les revenus ou la confiance ?

Une échelle typique : Critique (gêne complètement la mission), Élevé (difficulté sévère), Moyen (ralentit), Faible (cosmétique). L'IA peut suggérer un classement initial, mais la décision de pondération finale – en particulier l'impact commercial – nécessite la connaissance du contexte par l'équipe.

trouver

Impact

fréquence

important

Suggestions

Le bouton principal est introuvable

Cela interfère avec la tâche

4/6 participants

critique

Bouton de surbrillance

Le message d'erreur n'est pas clair

ralentir

3/6

haut

Clarifier le message

Icône dont la signification n'est pas claire

légère hésitation

2/6

moyen

Ajouter une balise

Le ton de la couleur n'était pas apprécié

cosmétiques

1/6

faible

laisse ça pour plus tard

trois mini-cases

Cas 1 — 5 heures d'enregistrement, résultats en une demi-journée. Une équipe a transmis à l’IA les notes de 6 tests utilisateurs (5 heures au total). Le modèle a suggéré 14 résultats ; L’équipe a vérifié chacune d’elles par rapport au nombre d’observations, l’a réduit à 9 et les a classées par ordre d’importance. La synthèse, qui aurait pris 2 jours manuellement, a été réduite à une demi-journée.

Cas 2 — Conclusion gonflée détectée. "Les utilisateurs ne comprennent pas la navigation", a écrit l'IA dans une conclusion critique. Lorsque l’équipe a examiné les observations à l’appui, elle a constaté qu’elle était basée sur un seul moment d’un seul participant. Le résultat a été rétrogradé à « modéré » et des données supplémentaires ont été demandées. Leçon : une seule observation ne permet pas de tirer un résultat critique.

Cas 3 — Problème critique manqué. Le modèle a considéré un problème récurrent mais apparemment mineur (le formulaire ne défilant pas automatiquement) comme « faible ». Lorsque le concepteur a examiné les observations, il s'est rendu compte que cela provoquait un abandon de tâche chez 5 participants et l'a réglé sur "élevé". Leçon : l'estimation de l'importance de l'IA est corrigée par des preuves observationnelles.

Lire ensemble des données quantitatives et qualitatives

Les tests d'utilisabilité sont principalement qualitatifs (basés sur l'observation), mais il existe également des signaux quantitatifs (numériques) : taux d'achèvement des tâches, durée de la tâche, nombre d'erreurs, score de satisfaction. La synthèse la plus puissante combine les deux : « Seulement 33 % des participants ont terminé la tâche de paiement (quantitative), et tous ceux qui n’ont pas réussi à la terminer se sont retrouvés bloqués à l’étape d’expédition (qualitative). » L'intelligence artificielle permet de combiner ces deux données lorsque vous les fournissez séparément ; mais vous confirmez l'exactitude des chiffres et la taille de l'échantillon. Parler de pourcentages peut être trompeur dans de petits échantillons (par exemple 5 utilisateurs) ; Dire « 3 utilisateurs sur 5 » est plus honnête que dire « 60 % ». Demandez au modèle de parler en chiffres absolus.

Astuce : demandez à l'IA de dire "écrivez sous la forme" combien d'utilisateurs "au lieu d'un pourcentage". Dans les petits échantillons, le pourcentage donne l’impression d’une plus grande précision qu’il ne l’est en réalité.

Invites copiables

Votre rôle : analyste d'utilisabilité. Tirez les résultats des notes de test anonymisées suivantes. Pour chaque résultat : 1) une déclaration claire, 2) des observations à l'appui et le nombre de participants qui l'ont vu, 3) un effet (bloquant/ralentissant/cosmétique). Marquez les résultats basés sur une seule observation comme « FAIBLES PREUVES ». Remarques : <<texte>>

Triez cette liste de résultats par importance. Critères : impact (obstacle à la tâche ?), fréquence (combien de participants ?), impact business. Attribuez à chaque résultat Critique/Élevé/Moyen/Faible et rédigez une justification. Si vous n'êtes pas sûr de l'impact commercial, dites « l'équipe doit évaluer ». Résultats : <<liste>>

Rédigez une recommandation de conception concrète et exploitable pour chaque résultat. Recommandation : qu'est-ce qui va changer + pourquoi cela résout le problème + quel écran cela affecte. Évitez les recommandations vagues (« faire mieux »). Résultats : <<liste>>

Résumez ce rapport de conclusions pour la présentation aux parties prenantes : rédigez un bref résumé qui comprend les 3 conclusions les plus critiques, les preuves (combien d'utilisateurs) et l'action recommandée. Exagération; prendre des nombres dans des notes.Rapport : <<texte>>

Invite faible/Invite forte

Faible : "Tirez des conclusions de ces résultats aux tests."

Résultat : une liste mixte sans preuves, sans ordre d'importance et prenant une seule observation pour un résultat.

Fort : "Tirez un résultat à partir des notes ; sous chaque résultat, ajoutez des observations à l'appui et le nombre de participants chez lesquels il a été observé ; marquez celui basé sur une seule observation comme "preuve faible" ; puis classez-le par ordre d'importance en fonction de l'effet-fréquence-effet du travail. "

Résultat : des conclusions fondées sur des données probantes, hiérarchisées et défendables.

Différence : invite forte invite le nombre de preuves + invite faible + critère d'importance.

Erreurs courantes

  • Confondre observation et découverte. Transformer un seul « ce qui s’est passé » en une conclusion globale.
  • Tirer des conclusions critiques à partir d’une seule observation. Aucun poids ne sera attribué tant que la fréquence n’aura pas été vérifiée.
  • Décider de l’impact commercial sur l’intelligence artificielle. L’impact sur les revenus/conversions nécessite du contexte ; Il fait partie de son équipe.
  • Ne donnez pas de priorité. La liste désorganisée des découvertes paralyse l'équipe ; Tout ne peut pas être réglé d’un coup.
  • Laissant les suggestions vagues. « Faire mieux » est inapplicable ; Quoi, pourquoi et où doivent être clairs.

En résumé

L’intérêt des tests d’utilisabilité réside dans la transformation des enregistrements et des notes en résultats clairs et hiérarchisés. L’intelligence artificielle accélère grandement cette synthèse : regroupe les observations en conclusions, élabore des recommandations, suggère un ordre d’importance. Mais c'est un travail humain de vérifier le nombre d'observations derrière chaque résultat, d'éliminer les résultats exagérés basés sur des observations uniques et de pondérer l'impact commercial en fonction du contexte. Un rapport de conclusions fondé sur des preuves, ayant une certaine fréquence et classé par ordre d’importance sera à la fois rapide et défendable auprès des parties prenantes.

Tâche de candidature

  1. Anonymisez les notes d’un test d’utilisabilité (réel ou fictif).
  2. Supprimez les résultats à la première invite ; Vérifiez le nombre d’observations sous chacune.
  3. Isolez les résultats marqués « preuves faibles » et décidez si des données supplémentaires sont nécessaires.
  4. À la deuxième invite, classez les résultats par ordre d’importance ; Évaluez l’impact commercial en équipe.
  5. Avec la troisième invite, rédigez des suggestions concrètes pour chaque constatation et créez un tableau de priorisation.

liste de contrôle

  • [ ] J'ai conservé l'observation, les découvertes et les suggestions dans des couches distinctes.
  • [ ] J'ai vérifié combien de participants ont montré chaque résultat.
  • [ ] J'ai marqué les résultats basés sur une seule observation comme des preuves faibles.
  • [ ] J'ai déterminé le niveau de gravité par impact-fréquence-impact sur le travail.
  • [ ] Évalué la décision d'impact commercial avec l'équipe.
  • [ ] J'ai écrit les suggestions concrètement (quoi/pourquoi/où).