Gewinne:
- Möglichkeit, Usability-Testaufzeichnungen und Beobachtungsnotizen mithilfe künstlicher Intelligenz in Ergebnisse, Gewichtungen und Empfehlungen umzuwandeln
- Fähigkeit, Ergebnisse nach Schweregrad zu ordnen und eine Priorisierungstabelle zu erstellen
- Fähigkeit, Erkenntnisse, die künstliche Intelligenz auslässt oder übertreibt, mit echten Beobachtungsbeweisen zu korrigieren
Usability-Tests sind eine Methode, um zu beobachten, wo das Design funktioniert und wo es stecken bleibt, indem konkrete Aufgaben an echte Benutzer vergeben und diese überwacht werden. Der Test selbst ist einfach; Die eigentliche Herausforderung liegt im Nachgang: Stundenlange Aufzeichnungen, seitenlange Beobachtungsnotizen und verstreute Screenshots in klare, priorisierte Ergebnisse umzuwandeln. Diese Synthese nimmt Tage in Anspruch und die Teams lassen sie oft unvollendet. Künstliche Intelligenz öffnet diesen Engpass: Sie wandelt Aufzeichnungen und Notizen in Erkenntnisse, Gewicht und Empfehlungen um. Aber es ist das menschliche Urteilsvermögen, zu entscheiden, ob eine Beobachtung wirklich ein Problem darstellt und wie wichtig sie ist.
Unterschied zwischen Beobachtung, Feststellung und Suggestion
Bei der Synthese ist es wichtig, drei Schichten zu trennen:
- Beobachtung: Was passiert ist, kein Kommentar. „Teilnehmer 3 suchte 40 Sekunden lang nach dem ‚Weiter‘-Button.“
- Befund: Das Muster, das sich aus Beobachtungen ergibt. „Benutzer haben Probleme, die primäre Aktion zu finden.“
- Empfehlung: Was zu tun ist. „Sorgt dafür, dass die Haupttaste optisch hervorsticht.“
KI erstellt diese drei Schichten schnell, verwechselt aber oft Beobachtung mit Befund oder leitet aus einer einzelnen Beobachtung einen ganzen Befund ab. Ihre Aufgabe besteht darin, zu überprüfen, ob hinter jedem Ergebnis genügend Beobachtungen (wie viele Teilnehmer, wie oft) stecken.
Tipp: Lassen Sie die künstliche Intelligenz sagen: „Fügen Sie unter jedem Befund Beobachtungen hinzu, die ihn unterstützen, und geben Sie an, bei wie vielen Teilnehmern er beobachtet wurde.“ Auf diese Weise können Sie überhöhte Befunde sofort von einer einzelnen Beobachtung unterscheiden.
Schweregrad: Was muss zuerst behoben werden?
Nicht alle Erkenntnisse sind gleich. Der Schweregrad gibt an, wie dringend ein Problem behoben werden muss und wird durch drei Faktoren bestimmt:
- Auswirkung: Hindert das Problem den Benutzer daran, die Aufgabe abzuschließen, oder nervt es ihn nur?
- Häufigkeit: Wie viele Benutzer und wie oft?
- Auswirkungen auf das Geschäft: Wie stark wirkt sich dieses Problem auf Konvertierung, Umsatz oder Vertrauen aus?
Eine typische Skala: Kritisch (behindert die Mission völlig), Hoch (schwerer Schwierigkeitsgrad), Mittel (verlangsamt), Niedrig (kosmetisch). KI schlägt möglicherweise eine erste Rangfolge vor, aber die endgültige Gewichtungsentscheidung – insbesondere die geschäftlichen Auswirkungen – erfordert die Kenntnis des Teams über den Kontext.
finden
Auswirkungen
Frequenz
Bedeutung
Vorschlag
Die primäre Schaltfläche kann nicht gefunden werden
Es stört die Aufgabe
4/6 Teilnehmer
kritisch
Schaltfläche „Hervorheben“.
Fehlermeldung ist unklar
langsamer werden
3/6
hoch
Klären Sie die Botschaft
Symbolbedeutung unklar
leichtes Zögern
2/6
mittel
Tag hinzufügen
Der Farbton gefiel uns nicht
Kosmetika
1/6
niedrig
lass es für später
drei Mini-Koffer
Fall 1 – 5 Stunden Aufnahme, Befunde in einem halben Tag. Ein Team fütterte die KI mit den Notizen von 6 Benutzertests (insgesamt 5 Stunden). Das Modell schlug 14 Ergebnisse vor; Das Team verglich jede einzelne mit der Anzahl der Beobachtungen, grenzte sie auf 9 ein und ordnete sie in der Reihenfolge ihrer Wichtigkeit. Die Synthese, die manuell zwei Tage gedauert hätte, wurde auf einen halben Tag verkürzt.
Fall 2 – Überhöhter Befund erwischt. „Benutzer verstehen die Navigation nicht“, schrieb die KI in einem kritischen Befund. Als sich das Team die unterstützenden Beobachtungen ansah, stellte es fest, dass es sich um einen einzelnen Moment eines einzelnen Teilnehmers handelte. Der Befund wurde auf „moderat“ herabgestuft und es wurden weitere Daten angefordert. Lektion: Eine einzelne Beobachtung führt noch nicht zu einer kritischen Feststellung.
Fall 3 – Kritisches Problem übersehen. Das Modell stufte ein wiederkehrendes, aber scheinbar geringfügiges Problem (das Formular, das nicht automatisch scrollt) als „gering“ ein. Als sich der Designer die Beobachtungen ansah, stellte er fest, dass dies bei 5 Teilnehmern zum Abbruch der Aufgabe führte und stellte den Wert auf „hoch“. Lektion: Die Wichtigkeitsschätzung der KI wird durch Beobachtungsnachweise korrigiert.
Quantitative und qualitative Daten gemeinsam lesen
Usability-Tests sind meist qualitativ (beobachtungsbasiert), es gibt aber auch quantitative (numerische) Signale: Aufgabenerledigungsrate, Aufgabendauer, Anzahl der Fehler, Zufriedenheitswert. Die aussagekräftigste Synthese kombiniert beides: „Nur 33 % der Teilnehmer haben die Checkout-Aufgabe abgeschlossen (quantitativ), und alle, die es nicht geschafft haben, blieben beim Versandschritt stecken (qualitativ).“ Künstliche Intelligenz hilft dabei, diese beiden Daten zu kombinieren, wenn Sie sie getrennt bereitstellen. Sie bestätigen jedoch die Richtigkeit der Zahlen und der Stichprobengröße. Bei kleinen Stichproben (z. B. 5 Benutzern) kann es irreführend sein, über Prozentsätze zu sprechen; „3 von 5 Nutzern“ zu sagen ist ehrlicher als „60 %“. Bitten Sie das Modell, in absoluten Zahlen zu sprechen.
Tipp: Lassen Sie die KI sagen: „Schreiben Sie als ‚wie viele Benutzer‘ statt als Prozentsatz.“ Bei kleinen Stichproben erweckt die Prozentangabe den Eindruck größerer Präzision, als sie tatsächlich ist.
Kopierbare Eingabeaufforderungen
Ihre Rolle: Usability-Analyst. Ziehen Sie Erkenntnisse aus den folgenden anonymisierten Testnotizen. Für jeden Befund: 1) klare Aussage, 2) unterstützende Beobachtungen und Anzahl der Teilnehmer, 3) Wirkung (blockierend/verlangsamend/kosmetisch). Markieren Sie Ergebnisse, die auf einer einzelnen Beobachtung basieren, als „SCHWACHE Evidenz“. Hinweise: <<text>>
Sortieren Sie diese Liste der Ergebnisse nach Wichtigkeit. Kriterien: Auswirkung (Aufgabenbehinderung?), Häufigkeit (wie viele Teilnehmer?), geschäftliche Auswirkung. Weisen Sie jedem Ergebnis die Kriterien „Kritisch/Hoch/Mittel/Niedrig“ zu und schreiben Sie eine Begründung. Wenn Sie sich über die geschäftlichen Auswirkungen nicht sicher sind, sagen Sie: „Das Team muss eine Bewertung durchführen.“ Ergebnisse: <<Liste>>
Schreiben Sie für jedes Ergebnis eine konkrete, umsetzbare Designempfehlung. Empfehlung: Was wird sich ändern + warum das Problem dadurch gelöst wird + welchen Bildschirm es betrifft. Vermeiden Sie vage („besser machen“) Empfehlungen. Ergebnisse: <<Liste>>
Fassen Sie diesen Ergebnisbericht zur Präsentation für die Interessengruppen zusammen: Schreiben Sie eine kurze Zusammenfassung, die die drei wichtigsten Ergebnisse, Beweise (wie viele Benutzer) und empfohlene Maßnahmen enthält. Übertreibung; Nehmen Sie Zahlen aus Notizen. Bericht: <<text>>
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwach: „Ziehen Sie aus diesen Testergebnissen Schlussfolgerungen.“
Ergebnis: Eine gemischte Liste ohne Beweise, ohne Reihenfolge der Wichtigkeit und mit der Verwechslung einer einzelnen Beobachtung als Feststellung.
Stark: „Zeichnen Sie einen Befund aus den Notizen. Fügen Sie unter jedem Befund unterstützende Beobachtungen hinzu und geben Sie an, bei wie vielen Teilnehmern er beobachtet wurde. Markieren Sie den Befund, der auf einer einzelnen Beobachtung basiert, als ‚schwacher Beweis‘ und ordnen Sie ihn dann in der Reihenfolge seiner Wichtigkeit nach Effekt-Häufigkeit-Arbeitseffekt.“
Ergebnis: Evidenzbasierte, priorisierte, vertretbare Erkenntnisse.
Unterschied: starke Eingabeaufforderung fordert Anzahl der Beweise + schwache Eingabeaufforderung + Wichtigkeitskriterium.
Häufige Fehler
- Beobachtung mit Finden verwechseln. Ein einzelnes „was passiert ist“ in eine Gesamtschlussfolgerung umwandeln.
- Aus einer einzigen Beobachtung kritische Erkenntnisse gewinnen. Bis zur Überprüfung der Häufigkeit wird keine Gewichtung vorgenommen.
- Entscheidende geschäftliche Auswirkungen auf künstliche Intelligenz. Umsatz-/Conversion-Auswirkungen erfordern Kontext; Er ist in seinem Team.
- Priorisieren Sie nicht. Die unorganisierte Liste der Befunde lähmt das Team; Nicht alles kann auf einmal behoben werden.
- Lassen Sie die Vorschläge vage. „Besser machen“ trifft nicht zu; Was, warum und wo sollte klar sein.
Zusammenfassend
Der Wert von Usability-Tests liegt darin, dass Aufzeichnungen und Notizen in klare, priorisierte Ergebnisse umgewandelt werden. Künstliche Intelligenz beschleunigt diese Synthese erheblich: Sie fasst Beobachtungen zu Erkenntnissen zusammen, formuliert Empfehlungen und schlägt eine Reihenfolge der Wichtigkeit vor. Aber es ist menschliche Arbeit, die Anzahl der Beobachtungen hinter jedem Ergebnis zu überprüfen, überhöhte Ergebnisse auf der Grundlage einzelner Beobachtungen auszusortieren und die geschäftlichen Auswirkungen anhand des Kontexts zu gewichten. Ein Ergebnisbericht, der auf Beweisen basiert, eine bestimmte Häufigkeit hat und nach Wichtigkeit geordnet ist, ist sowohl schnell als auch für die Beteiligten vertretbar.
Anwendungsaufgabe
- Anonymisieren Sie Notizen aus einem Usability-Test (real oder fiktiv).
- Entfernen Sie die Befunde bei der ersten Aufforderung; Überprüfen Sie jeweils die Anzahl der Beobachtungen.
- Isolieren Sie als „schwache Evidenz“ gekennzeichnete Ergebnisse und entscheiden Sie, ob zusätzliche Daten erforderlich sind.
- Ordnen Sie bei der zweiten Eingabeaufforderung die Ergebnisse in der Reihenfolge ihrer Wichtigkeit. Bewerten Sie die geschäftlichen Auswirkungen im Team.
- Schreiben Sie mit der dritten Eingabeaufforderung konkrete Vorschläge zu jedem Befund und erstellen Sie eine Priorisierungstabelle.
Checkliste
- [ ] Ich habe Beobachtung, Erkenntnisse und Vorschläge als separate Ebenen aufbewahrt.
- [ ] Ich habe überprüft, wie viele Teilnehmer jedes Ergebnis zeigten.
- [ ] Ich habe Ergebnisse, die auf einer einzelnen Beobachtung basieren, als schwache Beweise markiert.
- [ ] Ich habe den Schweregrad anhand der Auswirkungen, der Häufigkeit und der Auswirkungen auf die Arbeit bestimmt.
- [ ] Bewertete die Entscheidung über die geschäftlichen Auswirkungen mit dem Team.
- [ ] Ich habe die Vorschläge konkret geschrieben (was/warum/wo).