יחידה 8 / 11

בדיקת שמישות ניתוח וסינתזה של ממצאים

רווחים:

  • יכולת להמיר רשומות בדיקות שמישות והערות תצפית לממצאים, משקלים והמלצות עם בינה מלאכותית
  • יכולת לדרג ממצאים לפי חומרה ולייצר טבלת תעדוף
  • יכולת לתקן ממצאים שבינה מלאכותית משמיטה או מגזימה עם ראיות תצפית אמיתיות

בדיקת שמישות היא שיטה להתבוננות איפה העיצוב עובד ואיפה הוא נתקע על ידי מתן משימות ספציפיות למשתמשים אמיתיים ומעקב אחריהם. המבחן עצמו קל; האתגר האמיתי הוא שלאחר מכן: הפיכת שעות של הקלטה, דפים של הערות תצפית וצילומי מסך מפוזרים לממצאים ברורים עם עדיפות. הסינתזה הזו נמשכת ימים ביד ולעתים קרובות צוותים משאירים אותה לא גמורה. בינה מלאכותית פותחת את צוואר הבקבוק הזה: הפיכת רשומות והערות לממצאים, משקל והמלצה. אבל זה שיקול דעת אנושי להחליט אם תצפית היא באמת בעיה ועד כמה היא חשובה.

הבדל בין התבוננות, מציאת והצעה

חשוב להפריד שלוש שכבות בסינתזה:

  • תצפית: מה קרה, אין תגובה. "משתתף 3 חיפש את כפתור 'המשך' במשך 40 שניות".
  • ממצא: הדפוס העולה מתצפיות. "משתמשים מתקשים למצוא את הפעולה העיקרית."
  • המלצה: מה לעשות. "גורם לכפתור הראשי לבלוט חזותית."

בינה מלאכותית מייצרת במהירות את שלוש השכבות הללו, אך לעתים קרובות מבלבלת בין תצפית לממצא או מסיק ממצא שלם מתצפית בודדת. התפקיד שלך הוא לוודא שיש מספיק תצפיות (כמה משתתפים, כמה פעמים) מאחורי כל ממצא.

טיפ: בקש מהאינטליגנציה המלאכותית לומר "מתחת לכל ממצא, הוסף תצפיות שתומכות בו ובכמה משתתפים הוא נצפה". כך תוכלו להבחין באופן מיידי בין ממצאים מנופחים מתצפית בודדת.

חומרה: מה לתקן קודם?

לא כל הממצאים שווים. החומרה מציינת באיזו דחיפות יש לתקן בעיה והיא נקבעת על ידי שלושה גורמים:

  1. השפעה: האם הבעיה מונעת מהמשתמש לבצע את המשימה או סתם מעצבנת אותו?
  2. תדירות: כמה משתמשים ובאיזו תדירות?
  3. השפעה עסקית: עד כמה בעיה זו משפיעה על ההמרה, ההכנסה או האמון?

סולם אופייני: קריטי (מפריע לחלוטין למשימה), גבוה (קושי חמור), בינוני (מאיט), נמוך (קוסמטי). בינה מלאכותית עשויה להציע דירוג ראשוני, אבל החלטת הניפוח הסופית - במיוחד ההשפעה העסקית - דורשת ידע של הצוות על ההקשר.

מציאת

השפעה

תדירות

חשיבות

הצעה

לא ניתן למצוא את הלחצן הראשי

זה מפריע למשימה

4/6 משתתפים

קריטי

כפתור הדגשה

הודעת השגיאה אינה ברורה

האטה

3/6

גבוה

הבהירו את המסר

משמעות הסמל לא ברורה

היסוס קל

2/6

בינוני

הוסף תג

גוון הצבע לא אהב

קוסמטיקה

1/6

נמוך

להשאיר את זה לאחר מכן

שלושה מיני תיקים

מקרה 1 - 5 שעות הקלטה, ממצאים בחצי יום. צוות אחד הזין הערות של 6 בדיקות משתמש (5 שעות בסך הכל) ל-AI. המודל הציע 14 ממצאים; הצוות בדק כל אחת מהן מול מספר התצפיות, צמצם אותה ל-9 ודירג אותן לפי סדר חשיבות. הסינתזה, שהייתה לוקחת יומיים באופן ידני, הופחתה לחצי יום.

מקרה 2 - נתפס ממצא מנופח. "משתמשים לא מבינים ניווט", כתב ה-AI בממצא קריטי. כשהצוות בחן את התצפיות התומכות, הם גילו שזה מבוסס על רגע בודד של משתתף בודד. הממצא הורד ל"מתון" והתבקשו נתונים נוספים. לקח: תצפית בודדת אינה מהווה ממצא קריטי.

מקרה 3 - החמצה בעיה קריטית. המודל מנה בעיה חוזרת אך לכאורה מינורית (הצורה אינה גלילה אוטומטית) כ"נמוכה". כשהמעצב הסתכל על התצפיות, הוא הבין שזה גרם לנטישת משימה אצל 5 משתתפים והציב אותה ל"גבוהה". לקח: הערכת החשיבות של AI מתוקנת על ידי ראיות תצפיתיות.

קריאת נתונים כמותיים ואיכותיים יחד

בדיקת השימושיות היא בעיקרה איכותית (מבוססת תצפית), אך ישנם גם אותות כמותיים (מספריים): שיעור השלמת משימה, משך משימה, מספר שגיאות, ציון שביעות רצון. הסינתזה החזקה ביותר משלבת בין השניים: "רק 33% מהמשתתפים השלימו את משימת התשלום (כמותית), וכל מי שלא הצליח להשלים נתקע בשלב המשלוח (איכותי)." בינה מלאכותית עוזרת לשלב את שני הנתונים הללו כאשר אתה נותן אותם בנפרד; אבל אתה מאשר את הדיוק של המספרים ואת גודל המדגם. דיבור על אחוזים יכול להטעות בדגימות קטנות (למשל 5 משתמשים); אמירת "3 מתוך 5 משתמשים" היא כנה יותר מאמירת "60%". בקשו מהדגם לדבר במספרים מוחלטים.

טיפ: בקש מה-AI לומר "כתוב בתור 'כמה משתמשים' במקום באחוזים." בדגימות קטנות, אחוז נותן רושם של דיוק גדול יותר ממה שהוא בפועל.

הנחיות הניתנות להעתקה

תפקידך: מנתח שמישות. צייר ממצאים מהערות הבדיקה האנונימיות הבאות. לכל ממצא: 1) אמירה ברורה, 2) תצפיות תומכות וכמה משתתפים ראו אותה, 3) אפקט (חוסם/האטה/קוסמטי). סמן ממצאים המבוססים על תצפית בודדת כ"ראיות חלשות". הערות: <<text>>

מיין את רשימת הממצאים הזו לפי חשיבות. קריטריונים: השפעה (מעכב משימה?), תדירות (כמה משתתפים?), השפעה עסקית. הקצה לכל ממצא קריטי/גבוה/בינוני/נמוך וכתוב נימוק. אם אינך בטוח לגבי ההשפעה העסקית, אמור "הצוות חייב להעריך". ממצאים: <<רשימה>>

כתוב המלצה עיצובית קונקרטית ומעשית לכל ממצא. המלצה: מה ישתנה + למה זה פותר את הבעיה + על איזה מסך זה משפיע. הימנע מהמלצות מעורפלות ("עשה טוב יותר"). ממצאים: <<רשימה>>

סכמו את דוח הממצאים הזה להצגת בעלי עניין: כתבו תקציר מנהלים קצר הכולל את 3 הממצאים הקריטיים ביותר, ראיות (כמה משתמשים) ופעולה מומלצת. הַגזָמָה; קח מספרים מהפתקים. דיווח: <<text>>

הנחיה חלשה / הנחיה חזקה

חלש: "הסיקו מסקנות מתוצאות המבחנים הללו".

תוצאה: רשימה מעורבת ללא ראיות, ללא סדר חשיבות וטעות בתצפית בודדת כממצא.

חזק: "צייר ממצא מההערות; מתחת לכל ממצא, הוסף תצפיות תומכות וכמה משתתפים הוא נראה; סמן את הממצא המבוסס על תצפית בודדת כ'ראיה חלשה'; לאחר מכן דרג אותו לפי סדר חשיבות לפי אפקט-תדירות-עבודה".

תוצאה: ממצאים מבוססי עדויות, מועדפים, ניתנים להגנה.

הבדל: הנחיה חזקה מעוררת מספר ראיות + הנחיה חלשה + קריטריון חשיבות.

טעויות נפוצות

  • מבלבל בין תצפית לממצא. הפיכת "מה קרה" בודד למסקנה כוללת.
  • ביצוע ממצאים קריטיים מתוך תצפית בודדת. לא יינתן משקל עד לאימות התדירות.
  • החלטה על השפעה עסקית על בינה מלאכותית. השפעת הכנסה/המרה דורשת הקשר; הוא בצוות שלו.
  • אין לתעדף. רשימת הממצאים הלא מאורגנת משתקת את הצוות; לא הכל ניתן לתיקון בבת אחת.
  • השארת הצעות מעורפלות. "עשה טוב יותר" אינו ישים; מה, למה ואיפה צריך להיות ברור.

לסיכום

הערך של בדיקות השימושיות מגיע בהפיכת הקלטות והערות לממצאים ברורים עם עדיפות. בינה מלאכותית מאיצה מאוד את הסינתזה הזו: אוסף תצפיות לממצאים, מנסח המלצות, מציע סדר חשיבות. אבל זו עבודה אנושית לאמת את מספר התצפיות מאחורי כל ממצא, לנכות ממצאים מנופחים על סמך תצפיות בודדות, ולשקלל את ההשפעה העסקית עם ההקשר. דו"ח ממצאים המבוסס על ראיות, בעל תדירות מסוימת ומסודר לפי סדר חשיבות יהיה מהיר וניתן להגנה בפני בעלי העניין.

משימת יישום

  1. אנונימי הערות ממבחן שמישות (אמיתי או בדיוני).
  2. הסר את הממצאים בהנחיה הראשונה; בדוק את מספר התצפיות מתחת לכל אחת.
  3. ממצאים בודדים מסומנים כ"ראיות חלשות" ומחליטים אם יש צורך בנתונים נוספים.
  4. עם ההנחיה השנייה, דרג את הממצאים לפי סדר חשיבותם; הערכת ההשפעה העסקית כצוות.
  5. עם ההנחיה השלישית, כתוב הצעות קונקרטיות לכל ממצא וצור טבלת סדר עדיפויות.

רשימת בדיקה

  • [ ] שמרתי על תצפית, ממצאים והצעות כשכבות נפרדות.
  • [ ] בדקתי כמה משתתפים הראו כל ממצא.
  • [ ] סימנתי ממצאים המבוססים על תצפית בודדת כראיה חלשה.
  • [ ] קבעתי את רמת החומרה לפי השפעה-תדירות-השפעה על עבודה.
  • [ ] העריכו את החלטת ההשפעה העסקית עם הצוות.
  • [ ] כתבתי את ההצעות בצורה קונקרטית (מה/למה/איפה).