Unit 6 / 10

Data Analisis Deria

Keuntungan:

  • Keupayaan untuk mentafsir jenis panel deria, ujian hedonik/deskriptif dan kebolehpercayaan panelis
  • Keupayaan untuk mendraf ringkasan data deria, pengekstrakan tema dan tafsiran statistik dengan AI
  • Keupayaan untuk mengesahkan tafsiran statistik AI dengan data panel mentah dan reka bentuk percubaan

Anda berada di makmal R&D untuk yogurt buah rendah gula yang baru dibangunkan. Pasukan pemasaran bertanya "adakah pengguna menyukainya?" dia bertanya, dan pengeluaran bertanya, "Bolehkah ia dibezakan daripada produk rujukan?" dia tertanya-tanya. Beliau mempunyai borang hedonik 9 mata yang diisi oleh 60 ahli panel pengguna, skor QDA daripada panel deskriptif 8 orang terlatih, dan keputusan ujian diskriminasi segi tiga. Beratus-ratus baris skor mentah dalam Excel, serta kotak ulasan terbuka untuk setiap ahli panel. Nampaknya menggoda untuk bertanya kepada pembantu AI "ringkaskan data ini, adakah pengguna menyukainya?" Dalam unit ini, kami akan mengkaji cara membaca data deria dengan betul, menggunakan AI untuk ringkasan dan pengekstrakan tema, dan yang paling penting, mengesahkan tafsiran statistik AI dengan data panel mentah dan reka bentuk percubaan.

Jenis ujian deria: tanya soalan yang betul dengan ujian yang betul

Kesilapan yang paling biasa dalam analisis deria adalah untuk mengelirukan jenis soalan dengan jenis ujian. Terdapat tiga keluarga utama dan masing-masing menjawab soalan yang berbeza.

  • Ujian hedonik (afektif): "Berapa banyak yang disukai?" menjawab soalan. Instrumen klasik ialah skala hedonik 9 mata (1 = sangat tidak suka, 5 = tidak suka atau tidak suka, 9 = sangat suka). Ahli panel adalah pengguna yang tidak berpendidikan; Matlamatnya adalah untuk mengukur penerimaan/keutamaan. Secara amnya, panel 50-100 orang diperlukan.
  • Ujian deskriptif (QDA): "Apakah ciri yang ada pada produk dan dalam keamatan apa?" menjawab soalan. Panel terlatih terdiri daripada 8-12 orang menjaringkan ciri yang mereka huraikan (mis. "konsistensi berkrim," "masam," "rasa buah-buahan") pada skala keamatan 0-15. Ia tidak mengukur suka, ia mencipta profil.
  • Ujian diskriminasi: "Adakah kedua-dua produk secara persepsi berbeza?" menjawab soalan. Dalam ujian segi tiga, tiga sampel diberikan kepada panel; dua adalah sama, satu berbeza, dan ahli panel memilih "yang berbeza." Ideal untuk menguji sama ada perubahan dalam formulasi dapat dilihat.
Petua: Sebelum memilih ujian, lengkapkan ayat anda: "Saya ingin tahu sama ada ___." Jika jurang "suka", gunakan ujian hedonik, jika "berbeza", gunakan ujian diskriminasi, dan jika "kuat dalam ciri yang mana", gunakan ujian deskriptif. Jika anda tidak menyatakan tujuan ini semasa memberikan data kepada AI, ringkasan akan dirangka dengan cara yang salah.

Kebolehpercayaan ahli panel dan reka bentuk percubaan

Sebelum anda boleh mempercayai markah mentah, anda perlu mempercayai panel itu sendiri. Beberapa prinsip asas:

  • Ujian buta: Ahli panel tidak sepatutnya mengetahui sampel mana yang merupakan "produk baharu" dan yang mana "rujukan". Contoh dibentangkan dengan kod rawak 3 digit (cth. 417, 682).
  • Pampasan pesanan pembentangan: Sampel pertama yang dirasai secara amnya berfaedah (berat sampel pertama). Susunan pembentangan hendaklah seimbang/rawak dalam kalangan ahli panel.
  • Pengulangan: Jika ahli panel yang sama menjaringkan sampel yang sama sekali lagi dengan kod yang berbeza, anda boleh mengukur ketekalan (kebolehulangan). Dalam panel deskriptif, ahli panel yang tidak konsisten dilatih semula atau dikecualikan.
  • Semakan rujukan: Jika terdapat dua sampel yang sama dibentangkan secara membuta tuli dan ahli panel memberi skor dengan sangat berbeza, data ahli panel itu disyaki.

Contoh ringkasan data hedonik

Di bawah ialah jadual ringkasan ujian hedonik untuk 60 ahli panel. Membandingkan formula baharu (kod 417) dengan rujukan (kod 682).

ciri

Formula baharu (417) purata

Rujukan (682) purata

Std. sisihan (417)

n

Penghargaan umum

7.1

7.4

1.3

60

Rasa/aroma

6.8

7.3

1.5

60

ketekalan

7.3

7.2

1.1

60

Penampilan

7.6

7.5

0.9

60

Niat membeli (%)

58%

65%

60

Mudah untuk melihat carta ini dan berkata "rujukannya lebih baik sedikit, tetapi perbezaannya kecil." Tetapi adakah perbezaan min 0.3 ketara secara statistik atau bunyi? Di sinilah AI menghasilkan paling banyak halusinasi.

Ringkasan, pengekstrakan tema dan penggubalan tafsiran statistik dengan AI

Anda boleh menggunakan AI sebagai pemecut untuk tiga tugas: mendraf abstrak berangka, mengekstrak tema daripada ulasan terbuka dan mendraf tafsiran statistik. Tetapi dalam ketiga-tiga, output adalah draf, bukan keputusan.

Gesaan yang kuat untuk mengekstrak tema daripada ulasan terbuka:

Peranan: Anda seorang penganalisis deria. Di bawah ialah ulasan terbuka daripada 60 pengguna untuk yogurt buah rendah gula (kod 417). Tugasan anda:1) Kumpulan ulasan kepada 5-7 tema (cth. kemanisan, masam, tekstur, perisa buah).2) KIRA bilangan komen yang positif/negatif/neutral bagi setiap tema dan tulis nombornya.3) Tambah petikan langsung, rumuskan. JANGAN buat tema yang tidak disebut dalam ulasan.4) JANGAN BUAT kesimpulan statistik; Ini adalah ringkasan kualitatif. Output sebagai jadual: | Tema | Positif | Negatif | Berkecuali | Contoh pernyataan |Ulasan:[60 ulasan ditampal di sini]

Sekarang mari kita lihat perbezaan antara gesaan lemah dan kuat dalam tafsiran statistik:

PROMPT LEMAH: "Analisis data deria ini, beritahu saya jika produk baharu itu lebih baik daripada rujukan." (AI MUNGKIN membuat "ya lebih baik" atau "terdapat perbezaan yang ketara" tanpa mengetahui saiz sampel, jenis ujian, nilai-p.) PROMPT KUAT: "Di bawah adalah skor kesukaan keseluruhan mentah bagi ujian hedonik 9 mata dengan 60 panelis (lajur 417 dan 682). Untuk ujian-t berpasangan dan sahkan, TULIS dalam langkah-langkah yang diperlukan. TULIS. Ujian manakah yang sesuai dan mengapa (berpasangan atau bebas)? - Bagaimanakah cara saya menyediakan tafsiran secara berbeza jika p<0.05 keluarkan nilai-p berangka?

Gesaan yang kuat menjadikan penasihat kaedah AI; Anda mengira nombor.

Kepentingan statistik dan pengesahan sampel

Katakan ringkasan AI menulis "produk baharu dinilai jauh lebih rendah daripada rujukan." Anda perlu mengesahkan ini dengan data mentah. Mari lihat logik ujian-t berpasangan dengan pengiraan mudah:

import numpy sebagai npdari statistik import scipy# skor kesukaan keseluruhan 60 panelis (9 mata hedonik)baharu = np.array([7,8,6,7,7,6,8,7, ...]) # kod 417, n=60rujukan = np.array([7,8,7,8,7,7,8,7,7,8,7, ...]) panel yang sama kedua-dua produk -> t-testit_stat berpasangan, p_value = stats.ttest_rel(new, reference)difference = new.mean() - reference.mean()print(f"Min perbezaan: {difference:.2f} score")print(f"t = {t_stat:.2f}, p = {p_value:.0f}, p = {p_value:.0} >)= No Comment perbezaan ketara secara statistik."

Titik kritikal di sini: perbezaan min 0.30 mata mungkin menjadi tidak ketara dengan p = 0.18. Kenyataan AI bahawa "rujukan lebih baik" ialah tafsiran yang tidak disokong secara statistik. Apabila membuat keputusan anda, anda harus melihat nilai p, saiz sampel dan andaian ujian, bukan min sahaja.

Awas: LLM boleh menghasilkan pernyataan muktamad seperti "p<0.05, perbezaannya adalah ketara" walaupun ia tidak diberikan data berangka mentah. Ini adalah halusinasi. Jangan tulis sebarang nilai-p, komen kepentingan atau pertimbangan "pengguna suka" ke dalam laporan berdasarkan teks AI; kira semula dalam perisian statistik anda sendiri (R, SPSS, JASP, Python).

kes mini

Di sebuah syarikat minuman, pasukan sensori sedang menilai formula baharu yang mengurangkan gula dalam jus oren sebanyak 15%. Pasukan itu menjalankan ujian hedonik 9 mata dengan 90 pengguna dan menyalurkan gambar mentah kepada AI untuk meringkaskan keputusan. Laporan AI mengatakan "formula baharu kurang disukai (p<0.05)" dan pasukan memutuskan untuk membatalkan formula tersebut. Seorang jurutera kanan menjalankan semula data mentah dalam R: perbezaan benar 7.0 vs 6.8, p = 0.31 — jadi tiada perbezaan yang ketara. Lebih-lebih lagi, diperhatikan susunan persembahan tidak seimbang, formula baru sentiasa dirasai kedua dan dipengaruhi oleh kelesuan rasa (adaptasi). AI kedua-duanya membentuk nilai-p dan gagal mengesan kecacatan reka bentuk percubaan. Pasukan mengulangi ujian dengan reka bentuk yang seimbang, dan formula rendah gula diterima. Beralih kepada data mentah menyelamatkan produk yang baik daripada dibuang.

Kesilapan biasa

  • Ujian hedonik (kesukaan) yang mengelirukan dengan ujian deskriptif (profil); Mengatakan "skor masam tinggi" tidak bermakna ia tidak disukai.
  • Meletakkan penyataan nilai p atau "perbezaan ketara" rekaan AI ke dalam laporan tanpa melakukan pengiraan mentah.
  • Mengabaikan saiz sampel; Mengitlak "pengguna menyukainya" daripada ujian hedonik 12 orang.
  • Tidak mengimbangi susunan persembahan dan mengabaikan bias keletihan sampel pertama/rasa.
  • Membenarkan ahli panel mengetahui sampel mana yang merupakan "produk baharu" tanpa ujian buta.
  • Kegagalan untuk memastikan bahawa AI meringkaskan ulasan terbuka terhadap penjanaan petikan/tema yang dibuat-buat.
  • Menimbang semua markah secara sama rata tanpa memeriksa kebolehpercayaan ahli panel (konsistensi pendua buta).

Secara ringkasnya

  • Dalam ujian deria, mula-mula tentukan soalan: gunakan ujian hedonik untuk rasa, ujian segitiga untuk perbezaan, ujian deskriptif (QDA) untuk profil.
  • Percayai panel sebelum mempercayai markah mentah: semak kebolehpercayaan dengan ujian buta, pengimbangan susunan persembahan, main semula dan pendua buta.
  • Gunakan AI untuk ringkasan berangka, pengekstrakan tema daripada ulasan terbuka dan perundingan kaedah statistik; tetapi output adalah draf.
  • Perbezaan min tidak sama dengan kepentingan statistik; Perbezaan min yang kecil mungkin menjadi tidak ketara dengan nilai p.
  • AI boleh menghasilkan nilai-p, tafsiran kepentingan, dan halusinasi penghakiman "thumbs up"; Kira semula setiap keputusan statistik dengan data mentah dalam perisian anda sendiri.
  • Keputusan produk/formula akhir; Statistik yang disahkan, reka bentuk percubaan yang mantap dan kebolehpercayaan panelis dipertimbangkan bersama, bukan berdasarkan teks AI.

Tugasan permohonan

Reka bentuk ujian hedonik 9 mata dan ujian segi tiga untuk 40-60 panelis pada produk yang dikaji sendiri atau hipotesis (cth., sup kurang garam, kek bebas gluten). Tulis reka bentuk percubaan anda: berapa ramai ahli panel, pengekodan buta, pelan pengimbangan pesanan pembentangan dan sama ada anda akan menggunakan pendua buta. Buat jadual data mentah yang realistik (sekurang-kurangnya 20 baris) dan berikan AI dua gesaan berbeza: (1) pengekstrakan tema daripada ulasan terbuka, (2) nasihat kaedah statistik (dengan jelas meminta untuk tidak membentuk nilai-p). Kemudian jalankan ujian-t berpasangan sendiri dalam Python/R/JASP dan bandingkan dengan tafsiran AI. Dalam nota satu halaman: Terangkan yang mana satu pernyataan AI yang anda sahkan, yang anda sanggah dengan data mentah dan perkara yang anda asaskan pada keputusan produk akhir anda. Dalam memo anda, huraikan sekurang-kurangnya satu risiko berat sebelah dalam reka bentuk percubaan anda dan cara anda mengurangkannya.