Kazanimlar:
- Kullanılabilirlik testi kayıtları ve gözlem notlarını yapay zeka ile bulgu, ağırlık ve öneriye dönüştürebilme
- Bulguları önem derecesine (severity) göre sıralayıp önceliklendirme tablosu üretebilme
- Yapay zekanın atladığı veya abarttığı bulguları gerçek gözlem kanıtıyla düzeltebilme
Kullanılabilirlik testi (usability test), gerçek kullanıcılara belirli görevler verip onları izleyerek tasarımın nerede işe yaradığını, nerede takıldığını gözlemleme yöntemidir. Testin kendisi kolaydır; asıl zorluk sonrasındadır: saatlerce kayıt, sayfalarca gözlem notu ve dağınık ekran görüntülerini net, önceliklendirilmiş bulgulara dönüştürmek. Bu sentez elle günler alır ve ekipler sıklıkla yarım bırakır. Yapay zeka bu darboğazı açar: kayıt ve notları bulgulara, ağırlığa ve öneriye çevirir. Ama bir gözlemin gerçekten sorun olup olmadığına ve ne kadar önemli olduğuna karar vermek insan yargısıdır.
Gözlem, bulgu ve öneri farkı
Sentezde üç katmanı ayırmak kritiktir:
- Gözlem (observation): Ne oldu, yorumsuz. "Katılımcı 3, 'devam' butonunu 40 saniye aradı."
- Bulgu (finding): Gözlemlerden çıkan kalıp. "Kullanıcılar birincil eylemi bulmakta zorlanıyor."
- Öneri (recommendation): Ne yapmalı. "Birincil butonu görsel olarak öne çıkar."
Yapay zeka bu üç katmanı hızla üretir ama sıklıkla gözlemle bulguyu karıştırır veya tek bir gözlemden koca bir bulgu çıkarır. Sizin işiniz, her bulgunun arkasında yeterli gözlem (kaç katılımcı, kaç kez) olduğunu doğrulamaktır.
İpucu: Yapay zekaya "her bulgunun altına onu destekleyen gözlemleri ve kaç katılımcıda görüldüğünü ekle" dedirtin. Böylece tek gözlemden şişirilmiş bulguları anında ayırt edersiniz.
Önem derecesi (severity): neyi önce düzeltmeli?
Bulguların hepsi eşit değildir. Önem derecesi (severity), bir sorunun ne kadar acil düzeltilmesi gerektiğini gösterir ve üç etkenle belirlenir:
- Etki: Sorun kullanıcının görevi tamamlamasını engelliyor mu, yoksa sadece rahatsız mı ediyor?
- Sıklık: Kaç kullanıcıda ve ne sıklıkta görüldü?
- İş etkisi: Bu sorun dönüşümü, geliri veya güveni ne kadar etkiliyor?
Tipik bir ölçek: Kritik (görevi tamamen engelliyor), Yüksek (ciddi zorluk), Orta (yavaşlatıyor), Düşük (kozmetik). Yapay zeka bir ilk sıralama önerebilir, ama nihai ağırlık kararı — özellikle iş etkisi — ekibin bağlam bilgisini gerektirir.
Bulgu
Etki
Sıklık
Önem
Öneri
Birincil buton bulunamıyor
Görevi engelliyor
4/6 katılımcı
Kritik
Butonu öne çıkar
Hata mesajı belirsiz
Yavaşlatıyor
3/6
Yüksek
Mesajı netleştir
İkon anlamı belirsiz
Hafif tereddüt
2/6
Orta
Etiket ekle
Renk tonu beğenilmedi
Kozmetik
1/6
Düşük
Sonraya bırak
Üç mini vaka
Vaka 1 — 5 saat kayıt, yarım günde bulgu. Bir ekip 6 kullanıcı testinin (toplam 5 saat) notlarını yapay zekaya verdi. Model 14 bulgu önerdi; ekip her birini gözlem sayısına karşı kontrol edip 9'a indirdi, önem sırasına dizdi. Elle 2 gün sürecek sentez yarım güne indi.
Vaka 2 — Şişirilmiş bulgu yakalandı. Yapay zeka "kullanıcılar gezinmeyi anlamıyor" diye kritik bir bulgu yazdı. Ekip destekleyen gözlemlere baktığında bunun tek bir katılımcının tek bir anına dayandığını gördü. Bulgu "orta" seviyeye indirildi ve daha fazla veri istendi. Ders: tek gözlem, kritik bulgu yapmaz.
Vaka 3 — Atlanan kritik sorun. Model, sık tekrar eden ama küçük görünen bir sorunu (form otomatik kaydırmıyor) "düşük" saydı. Tasarımcı gözlemlere bakınca bunun 5 katılımcıda görev terkine yol açtığını fark etti ve "yüksek"e çekti. Ders: yapay zekanın önem tahmini gözlem kanıtıyla düzeltilir.
Nicel ve nitel veriyi birlikte okumak
Kullanılabilirlik testi çoğunlukla niteldir (gözleme dayalı), ama yanında nicel (sayısal) sinyaller de olur: görev tamamlama oranı, görev süresi, hata sayısı, memnuniyet puanı. En güçlü sentez ikisini birleştirir: "Katılımcıların yalnızca %33'ü ödeme görevini tamamladı (nicel) ve tamamlayamayanların hepsi kargo adımında takıldı (nitel)." Yapay zeka bu iki veriyi ayrı verdiğinizde birleştirmeye yardım eder; ama sayıların doğruluğunu ve örneklem büyüklüğünü siz teyit edersiniz. Küçük örneklemde (örneğin 5 kullanıcı) yüzde konuşmak yanıltıcı olabilir; "5 kullanıcıdan 3'ü" demek "%60" demekten daha dürüsttür. Modelden mutlak sayı ile konuşmasını isteyin.
İpucu: Yapay zekaya "yüzde yerine 'kaç kullanıcıdan kaçı' biçiminde yaz" dedirtin. Küçük örneklemlerde yüzde, olduğundan büyük bir kesinlik izlenimi verir.
Kopyalanabilir promptlar
Rolün: kullanılabilirlik analisti.Aşağıdaki anonimleştirilmiş test notlarından bulgular çıkar.Her bulgu için: 1) net ifade, 2) destekleyen gözlemler ve kaç katılımcıdagörüldüğü, 3) etki (engelliyor/yavaşlatıyor/kozmetik).Tek gözleme dayanan bulguları "ZAYIF KANIT" olarak işaretle.Notlar: <<metin>>
Bu bulgu listesini önem derecesine göre sırala.Ölçüt: etki (görev engeli mi?), sıklık (kaç katılımcı?), iş etkisi.Her bulguya Kritik/Yüksek/Orta/Düşük ata ve gerekçesini yaz.İş etkisi hakkında emin değilsen "ekip değerlendirmeli" de.Bulgular: <<liste>>
Her bulgu için somut, uygulanabilir bir tasarım önerisi yaz.Öneri: ne değişecek + neden bu sorunu çözer + hangi ekranı etkiler.Belirsiz ("daha iyi yap") önerilerden kaçın. Bulgular: <<liste>>
Bu bulgu raporunu paydaş sunumu için özetle:en kritik 3 bulguyu, kanıtını (kaç kullanıcı) ve önerilen aksiyonu içerenkısa bir yönetici özeti yaz. Abartma; sayıları notlardan al.Rapor: <<metin>>
Zayıf prompt / Güclü prompt
Zayıf: "Bu test notlarından sonuç çıkar."
Sonuç: Kanıtsız, önem sırası olmayan, tek gözlemi bulgu sanan karışık liste.
Güçlü: "Notlardan bulgu çıkar; her bulgunun altına destekleyen gözlemleri ve kaç katılımcıda görüldüğünü ekle; tek gözleme dayananı 'zayıf kanıt' işaretle; sonra etki-sıklık-iş etkisine göre önem sırasına diz."
Sonuç: Kanıta bağlı, önceliklendirilmiş, savunulabilir bulgular.
Fark: güçlü prompt kanıt sayısı + zayıf kanıt işareti + önem ölçütü ister.
Sık yapılan hatalar
- Gözlemle bulguyu karıştırmak. Tek bir "ne oldu"yu genel bir sonuca dönüştürmek.
- Tek gözlemden kritik bulgu çıkarmak. Sıklık doğrulanmadan ağırlık verilmez.
- İş etkisini yapay zekaya karar verdirmek. Gelir/dönüşüm etkisi bağlam bilgisi ister; ekibindedir.
- Önem sırası yapmamak. Sırasız bulgu listesi ekibi felç eder; her şey aynı anda düzeltilemez.
- Önerileri belirsiz bırakmak. "Daha iyi yap" uygulanamaz; ne, neden, nerede belli olmalı.
Özetle
Kullanılabilirlik testinin değeri, kayıt ve notların net, önceliklendirilmiş bulgulara dönüşmesinde ortaya çıkar. Yapay zeka bu sentezi büyük ölçüde hızlandırır: gözlemleri bulgulara toplar, öneri taslakları yazar, önem sırası önerir. Ama her bulgunun arkasındaki gözlem sayısını doğrulamak, tek gözleme dayanan şişirilmiş bulguları ayıklamak ve iş etkisini bağlamla ağırlıklandırmak insan işidir. Kanıta bağlı, sıklığı belli ve önem sırasına dizilmiş bir bulgu raporu, hem hızlı hem paydaş karşısında savunulabilir olur.
Uygulama görevi
- Bir kullanılabilirlik testinin (gerçek veya kurgusal) notlarını anonimleştirin.
- İlk prompt ile bulguları çıkarın; her birinin altındaki gözlem sayısını kontrol edin.
- "Zayıf kanıt" işaretli bulguları ayırıp ek veri gerekip gerekmediğine karar verin.
- İkinci prompt ile bulguları önem sırasına dizin; iş etkisini ekipçe değerlendirin.
- Üçüncü prompt ile her bulguya somut öneri yazıp bir önceliklendirme tablosu oluşturun.
Kontrol listesi
- [ ] Gözlem, bulgu ve öneriyi ayrı katmanlar olarak tuttum.
- [ ] Her bulgunun kaç katılımcıda göründüğünü doğruladım.
- [ ] Tek gözleme dayanan bulguları zayıf kanıt olarak işaretledim.
- [ ] Önem derecesini etki-sıklık-iş etkisiyle belirledim.
- [ ] İş etkisi kararını ekiple değerlendirdim.
- [ ] Önerileri somut (ne/neden/nerede) yazdım.