লাভ:
- কৃত্রিম বুদ্ধিমত্তার সাহায্যে ব্যবহারযোগ্যতা পরীক্ষার রেকর্ড এবং পর্যবেক্ষণ নোটগুলিকে অনুসন্ধান, ওজন এবং সুপারিশগুলিতে রূপান্তর করার ক্ষমতা
- তীব্রতা অনুসারে ফলাফলগুলিকে র্যাঙ্ক করার এবং একটি অগ্রাধিকার সারণী তৈরি করার ক্ষমতা
- কৃত্রিম বুদ্ধিমত্তা বাদ দেয় বা বাস্তব পর্যবেক্ষণ প্রমাণের সাথে অতিরঞ্জিত করে এমন অনুসন্ধানগুলিকে সংশোধন করার ক্ষমতা
ইউজেবিলিটি টেস্টিং হল ডিজাইন কোথায় কাজ করে এবং কোথায় আটকে যায় তা বাস্তব ব্যবহারকারীদের নির্দিষ্ট কাজ দিয়ে এবং তাদের পর্যবেক্ষণ করার একটি পদ্ধতি। পরীক্ষা নিজেই সহজ; আসল চ্যালেঞ্জটি হল পরের দিকে: রেকর্ডিংয়ের ঘন্টাগুলি, পর্যবেক্ষণ নোটগুলির পৃষ্ঠাগুলি এবং বিক্ষিপ্ত স্ক্রিনশটগুলিকে পরিষ্কার, অগ্রাধিকারযুক্ত ফলাফলগুলিতে পরিণত করা। এই সংশ্লেষণটি হাতে কয়েক দিন সময় নেয় এবং দলগুলি প্রায়শই এটি অসমাপ্ত রেখে যায়। কৃত্রিম বুদ্ধিমত্তা এই বাধা খুলে দেয়: রেকর্ড এবং নোটগুলিকে অনুসন্ধান, ওজন এবং সুপারিশে পরিণত করা। কিন্তু একটি পর্যবেক্ষণ সত্যিই একটি সমস্যা কিনা এবং এটি কতটা গুরুত্বপূর্ণ তা নির্ধারণ করা মানুষের বিচার।
পর্যবেক্ষণ, অনুসন্ধান এবং পরামর্শের মধ্যে পার্থক্য
সংশ্লেষণে তিনটি স্তর আলাদা করা গুরুত্বপূর্ণ:
- পর্যবেক্ষণ: কি হয়েছে, কোন মন্তব্য নেই. "অংশগ্রহণকারী 3 40 সেকেন্ডের জন্য 'চালিয়ে যান' বোতামটি অনুসন্ধান করেছে।"
- অনুসন্ধান: পর্যবেক্ষণ থেকে উদ্ভূত প্যাটার্ন। "প্রাথমিক ক্রিয়া খুঁজে পেতে ব্যবহারকারীদের সমস্যা হচ্ছে।"
- সুপারিশ: কি করতে হবে। "প্রাথমিক বোতামটিকে দৃশ্যত আলাদা করে তোলে।"
AI দ্রুত এই তিনটি স্তর তৈরি করে, কিন্তু প্রায়শই পর্যবেক্ষণকে খুঁজে বের করার সাথে বিভ্রান্ত করে বা একটি একক পর্যবেক্ষণ থেকে সম্পূর্ণ অনুসন্ধানের অনুমান করে। আপনার কাজ হল প্রতিটি অনুসন্ধানের পিছনে পর্যাপ্ত পর্যবেক্ষণ (কতজন অংশগ্রহণকারী, কতবার) আছে তা যাচাই করা।
টিপ: কৃত্রিম বুদ্ধিমত্তা বলতে বলুন "প্রতিটি অনুসন্ধানের নীচে, এটিকে সমর্থন করে এমন পর্যবেক্ষণ যোগ করুন এবং কতজন অংশগ্রহণকারীদের মধ্যে এটি দেখা গেছে।" এইভাবে আপনি অবিলম্বে একটি একক পর্যবেক্ষণ থেকে স্ফীত ফলাফলগুলিকে আলাদা করতে পারেন।
তীব্রতা: প্রথমে কি ঠিক করবেন?
সব ফলাফল সমান নয়। তীব্রতা নির্দেশ করে যে একটি সমস্যা কতটা জরুরীভাবে ঠিক করা দরকার এবং তিনটি বিষয় দ্বারা নির্ধারিত হয়:
- প্রভাব: সমস্যাটি কি ব্যবহারকারীকে কাজটি সম্পূর্ণ করতে বাধা দেয় বা তাদের বিরক্ত করে?
- ফ্রিকোয়েন্সি: কতজন ব্যবহারকারী এবং কত ঘন ঘন?
- ব্যবসায়িক প্রভাব: এই সমস্যাটি রূপান্তর, রাজস্ব বা বিশ্বাসকে কতটা প্রভাবিত করে?
একটি সাধারণ স্কেল: সমালোচনামূলক (সম্পূর্ণভাবে মিশনে বাধা দেয়), উচ্চ (গুরুতর অসুবিধা), মাঝারি (ধীরগতির), নিম্ন (প্রসাধনী)। এআই একটি প্রাথমিক র্যাঙ্কিংয়ের পরামর্শ দিতে পারে, তবে চূড়ান্ত ওজন নির্ধারণের সিদ্ধান্ত - বিশেষ করে ব্যবসায়িক প্রভাব - প্রসঙ্গ সম্পর্কে দলের জ্ঞান প্রয়োজন।
খোঁজা
প্রভাব
ফ্রিকোয়েন্সি
গুরুত্ব
সাজেশন
প্রাথমিক বোতাম খুঁজে পাওয়া যাবে না
এটি কাজের সাথে হস্তক্ষেপ করে
4/6 অংশগ্রহণকারী
সমালোচনামূলক
হাইলাইট বোতাম
ত্রুটি বার্তা অস্পষ্ট
মন্থর
3/6
উচ্চ
বার্তাটি পরিষ্কার করুন
আইকন মানে অস্পষ্ট
সামান্য দ্বিধা
2/6
মাঝারি
ট্যাগ যোগ করুন
কালার টোন পছন্দ হয়নি
প্রসাধনী
1/6
কম
পরে জন্য ছেড়ে দিন
তিনটি মিনি কেস
কেস 1 - 5 ঘন্টা রেকর্ডিং, অর্ধেক দিনে ফলাফল। একটি দল 6টি ব্যবহারকারীর পরীক্ষার নোট (মোট 5 ঘন্টা) এআইকে খাওয়ায়। মডেলটি 14টি অনুসন্ধানের পরামর্শ দিয়েছে; দলটি পর্যবেক্ষণের সংখ্যার বিপরীতে প্রতিটিকে পরীক্ষা করেছে, এটিকে 9-এ সংকুচিত করেছে এবং গুরুত্ব অনুসারে তাদের র্যাঙ্ক করেছে। সংশ্লেষণ, যা ম্যানুয়ালি 2 দিন লাগত, তা অর্ধেক দিনে কমিয়ে আনা হয়েছিল।
কেস 2 — স্ফীত অনুসন্ধান ধরা পড়েছে। "ব্যবহারকারীরা নেভিগেশন বোঝেন না," এআই একটি সমালোচনামূলক অনুসন্ধানে লিখেছে। যখন দলটি সমর্থনকারী পর্যবেক্ষণগুলি দেখেছিল, তখন তারা দেখেছিল যে এটি একটি একক অংশগ্রহণকারীর একক মুহুর্তের উপর ভিত্তি করে। অনুসন্ধানটি "মধ্যম" তে নামিয়ে আনা হয়েছিল এবং আরও ডেটা অনুরোধ করা হয়েছিল। পাঠ: একটি একক পর্যবেক্ষণ একটি সমালোচনামূলক অনুসন্ধান করে না।
কেস 3 - মিস করা জটিল সমস্যা। মডেলটি একটি পুনরাবৃত্ত কিন্তু আপাতদৃষ্টিতে গৌণ সমস্যা (ফর্মটি স্বয়ংক্রিয়-স্ক্রলিং নয়) "নিম্ন" হিসাবে গণনা করেছে। ডিজাইনার যখন পর্যবেক্ষণগুলি দেখেছিলেন, তখন তিনি বুঝতে পেরেছিলেন যে এটি 5 জন অংশগ্রহণকারীর মধ্যে কাজ পরিত্যাগ করেছে এবং এটি "উচ্চ" তে সেট করেছে। পাঠ: AI এর গুরুত্ব অনুমান পর্যবেক্ষণমূলক প্রমাণ দ্বারা সংশোধন করা হয়।
পরিমাণগত এবং গুণগত ডেটা একসাথে পড়া
ব্যবহারযোগ্যতা পরীক্ষা বেশিরভাগই গুণগত (পর্যবেক্ষণ-ভিত্তিক), তবে পরিমাণগত (সংখ্যাসূচক) সংকেতও রয়েছে: কাজ সমাপ্তির হার, কাজের সময়কাল, ত্রুটির সংখ্যা, সন্তুষ্টি স্কোর। সবচেয়ে শক্তিশালী সংশ্লেষণ দুটিকে একত্রিত করে: "মাত্র 33% অংশগ্রহণকারীরা চেকআউট টাস্ক (পরিমাণগত) সম্পন্ন করেছে এবং যারা সম্পূর্ণ করতে ব্যর্থ হয়েছে তারা শিপিং ধাপে (গুণগত) আটকে গেছে।" কৃত্রিম বুদ্ধিমত্তা এই দুটি ডেটা একত্রিত করতে সাহায্য করে যখন আপনি তাদের আলাদাভাবে দেন; কিন্তু আপনি সংখ্যার সঠিকতা এবং নমুনার আকার নিশ্চিত করেন। শতাংশ সম্পর্কে কথা বলা ছোট নমুনাগুলিতে বিভ্রান্তিকর হতে পারে (যেমন 5 ব্যবহারকারী); "5 এর মধ্যে 3 জন ব্যবহারকারী" বলা "60%" বলার চেয়ে বেশি সৎ। মডেলকে পরম সংখ্যায় কথা বলতে বলুন।
টিপ: AI বলতে বলুন "শতাংশের পরিবর্তে 'কতজন ব্যবহারকারী' লিখুন।" ছোট নমুনায়, শতাংশ প্রকৃতপক্ষে তার চেয়ে বেশি নির্ভুলতার ছাপ দেয়।
অনুলিপিযোগ্য প্রম্পট
আপনার ভূমিকা: ব্যবহারযোগ্যতা বিশ্লেষক। নিম্নলিখিত বেনামী পরীক্ষার নোট থেকে ফলাফল আঁকুন। প্রতিটি অনুসন্ধানের জন্য: 1) স্পষ্ট বিবৃতি, 2) সমর্থনকারী পর্যবেক্ষণ এবং কতজন অংশগ্রহণকারী এটি দেখেছেন, 3) প্রভাব (অবরুদ্ধ/ধীরগতি/প্রসাধনী)। একটি একক পর্যবেক্ষণের ভিত্তিতে ফলাফলগুলিকে "দুর্বল প্রমাণ" হিসাবে চিহ্নিত করুন। নোট: <<text>>
গুরুত্ব অনুসারে ফলাফলের এই তালিকাটি সাজান। মানদণ্ড: প্রভাব (কাজের প্রতিবন্ধকতা?), ফ্রিকোয়েন্সি (কতজন অংশগ্রহণকারী?), ব্যবসায়িক প্রভাব। প্রতিটি ফাইন্ডিং সমালোচনামূলক/উচ্চ/মাঝারি/নিম্ন নির্ধারণ করুন এবং একটি যুক্তি লিখুন। আপনি যদি ব্যবসায়িক প্রভাব সম্পর্কে অনিশ্চিত হন তবে বলুন "দল অবশ্যই মূল্যায়ন করবে।" ফলাফল: <<তালিকা>>
প্রতিটি অনুসন্ধানের জন্য একটি কংক্রিট, কার্যকরী নকশা সুপারিশ লিখুন। প্রস্তাবনা: কী পরিবর্তন হবে + কেন এটি সমস্যার সমাধান করে + কী স্ক্রীনকে প্রভাবিত করে। অস্পষ্ট ("ভাল করুন") সুপারিশ এড়িয়ে চলুন। ফলাফল: <<তালিকা>>
স্টেকহোল্ডার উপস্থাপনার জন্য এই ফলাফলের প্রতিবেদনটি সংক্ষিপ্ত করুন: একটি সংক্ষিপ্ত কার্যনির্বাহী সারাংশ লিখুন যাতে 3টি সবচেয়ে গুরুত্বপূর্ণ ফলাফল, প্রমাণ (কতজন ব্যবহারকারী) এবং প্রস্তাবিত পদক্ষেপ অন্তর্ভুক্ত থাকে। অতিরঞ্জন; নোট থেকে নম্বর নিন। রিপোর্ট: <<text>>
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল: "এই পরীক্ষার স্কোরগুলি থেকে উপসংহার আঁকুন।"
ফলাফল: কোনো প্রমাণ ছাড়াই একটি মিশ্র তালিকা, গুরুত্বের কোনো ক্রম নেই, এবং একটি অনুসন্ধান হিসাবে একটি একক পর্যবেক্ষণকে ভুল করা।
শক্তিশালী: "নোটগুলি থেকে একটি অনুসন্ধান আঁকুন; প্রতিটি অনুসন্ধানের অধীনে, সমর্থনকারী পর্যবেক্ষণ যোগ করুন এবং এতে কতজন অংশগ্রহণকারীকে দেখা গেছে; একটি একক পর্যবেক্ষণের ভিত্তিতে একটিকে 'দুর্বল প্রমাণ' হিসাবে চিহ্নিত করুন; তারপর প্রভাব-ফ্রিকোয়েন্সি-কাজের প্রভাব অনুসারে গুরুত্বের ক্রম অনুসারে এটিকে র্যাঙ্ক করুন।"
ফলাফল: প্রমাণ-ভিত্তিক, অগ্রাধিকার, প্রতিরক্ষাযোগ্য ফলাফল।
পার্থক্য: শক্তিশালী প্রম্পট প্রমাণের সংখ্যা + দুর্বল প্রম্পট + গুরুত্বের মাপকাঠি।
সাধারণ ভুল
- খোঁজার সাথে বিভ্রান্তিকর পর্যবেক্ষণ। একটি সামগ্রিক উপসংহারে একটি একক "কি ঘটেছে" বাঁক।
- একটি একক পর্যবেক্ষণ থেকে সমালোচনামূলক ফলাফল তৈরি করা। ফ্রিকোয়েন্সি যাচাই না হওয়া পর্যন্ত কোন ওজন দেওয়া হবে না।
- কৃত্রিম বুদ্ধিমত্তার উপর ব্যবসায়িক প্রভাবের সিদ্ধান্ত নেওয়া। রাজস্ব/রূপান্তর প্রভাব প্রসঙ্গ প্রয়োজন; তিনি তার দলে আছেন।
- অগ্রাধিকার দেবেন না। ফলাফলের অসংগঠিত তালিকা দলকে পঙ্গু করে দেয়; একবারে সবকিছু ঠিক করা যায় না।
- অস্পষ্ট পরামর্শ ছেড়ে. "ভাল করুন" প্রযোজ্য নয়; কি, কেন এবং কোথায় পরিষ্কার হওয়া উচিত।
সংক্ষেপে
ব্যবহারযোগ্যতা পরীক্ষার মূল্য রেকর্ডিং এবং নোটগুলিকে স্পষ্ট, অগ্রাধিকারযুক্ত ফলাফলগুলিতে পরিণত করার মাধ্যমে আসে। কৃত্রিম বুদ্ধিমত্তা এই সংশ্লেষণকে ব্যাপকভাবে ত্বরান্বিত করে: অনুসন্ধানগুলিকে একত্রিত করে, সুপারিশের খসড়া তৈরি করে, গুরুত্বের ক্রম নির্দেশ করে। তবে প্রতিটি অনুসন্ধানের পিছনে পর্যবেক্ষণের সংখ্যা যাচাই করা, একক পর্যবেক্ষণের উপর ভিত্তি করে স্ফীত ফলাফলগুলিকে আগাছা করা এবং প্রসঙ্গ সহ ব্যবসায়িক প্রভাবকে ওজন করা মানুষের কাজ। একটি অনুসন্ধান প্রতিবেদন যা প্রমাণের উপর ভিত্তি করে তৈরি, একটি নির্দিষ্ট ফ্রিকোয়েন্সি রয়েছে এবং গুরুত্ব অনুসারে সাজানো হয়েছে উভয়ই স্টেকহোল্ডারদের কাছে দ্রুত এবং রক্ষাযোগ্য হবে।
আবেদন টাস্ক
- একটি ব্যবহারযোগ্যতা পরীক্ষা থেকে নোট বেনামী করুন (বাস্তব বা কাল্পনিক)।
- প্রথম প্রম্পটে ফলাফলগুলি সরান; প্রতিটি অধীনে পর্যবেক্ষণ সংখ্যা পরীক্ষা করুন.
- "দুর্বল প্রমাণ" চিহ্নিত ফলাফলগুলিকে বিচ্ছিন্ন করুন এবং অতিরিক্ত ডেটা প্রয়োজন কিনা তা নির্ধারণ করুন।
- দ্বিতীয় প্রম্পটের সাথে, গুরুত্বের ক্রমানুসারে ফলাফলগুলিকে স্থান দিন; একটি দল হিসাবে ব্যবসায়িক প্রভাব মূল্যায়ন.
- তৃতীয় প্রম্পটের সাথে, প্রতিটি অনুসন্ধানের জন্য সুনির্দিষ্ট পরামর্শ লিখুন এবং একটি অগ্রাধিকার সারণী তৈরি করুন।
চেকলিস্ট
- [] আমি পর্যবেক্ষণ, অনুসন্ধান এবং পরামর্শকে আলাদা স্তর হিসাবে রেখেছিলাম।
- [ ] আমি যাচাই করেছি যে কতজন অংশগ্রহণকারী প্রতিটি অনুসন্ধান দেখিয়েছে৷
- আমি একটি একক পর্যবেক্ষণের উপর ভিত্তি করে ফলাফলকে দুর্বল প্রমাণ হিসেবে চিহ্নিত করেছি।
- আমি প্রভাব-ফ্রিকোয়েন্সি-জব ইমপ্যাক্ট দ্বারা তীব্রতার মাত্রা নির্ধারণ করেছি।
- [ ] দলের সাথে ব্যবসায়িক প্রভাব সিদ্ধান্ত মূল্যায়ন.
- [ ] আমি পরামর্শগুলিকে সুনির্দিষ্টভাবে লিখেছিলাম (কি/কেন/কোথায়)।