Njësia 6 / 10

Të dhënat e analizës ndijore

Fitimet:

  • Aftësia për të interpretuar llojet e paneleve ndijore, testimin hedonik/përshkrues dhe besueshmërinë e panelistëve
  • Aftësia për të hartuar përmbledhjen e të dhënave shqisore, nxjerrjen e temave dhe interpretimin statistikor me AI
  • Aftësia për të vërtetuar interpretimin statistikor të AI me të dhëna të papërpunuara të panelit dhe modelin e provës

Jeni në laboratorin e R&D për një kos frutash të sapo zhvilluar me pak sheqer. Ekipi i marketingut pyet "a u pëlqen konsumatorëve?" ai pyet dhe prodhimi pyet: "A mund të dallohet nga produkti referues?" pyet ai. Ai ka formularë hedonikë me 9 pika të plotësuara nga 60 panelistë të konsumatorëve, rezultatet e QDA nga një panel përshkrues i trajnuar prej 8 personash dhe rezultatet e një testi të diskriminimit trekëndësh. Qindra rreshta rezultatesh të papërpunuara në Excel, plus një kuti komentesh të hapura për çdo panelist. Duket joshëse të pyesësh një asistent të AI "të përmbledhë këto të dhëna, a u pëlqejnë konsumatorëve?" Në këtë njësi, ne do të studiojmë se si të lexojmë saktë të dhënat ndijore, të përdorim AI për nxjerrjen e përmbledhjeve dhe temave, dhe më e rëndësishmja, do të vërtetojmë interpretimin statistikor të AI me të dhënat e papërpunuara të panelit dhe dizajnin e provës.

Llojet e testeve shqisore: bëni pyetjen e duhur me testin e duhur

Gabimi më i zakonshëm në analizën shqisore është ngatërrimi i llojit të pyetjes me llojin e testit. Ka tre familje të mëdha dhe secila i përgjigjet një pyetjeje të ndryshme.

  • Testet hedonike (afektive): "Sa u pëlqye?" i përgjigjet pyetjes. Instrumenti klasik është shkalla hedonike me 9 pikë (1 = jashtëzakonisht i papëlqyer, 5 = as i pëlqyer e as i papëlqyer, 9 = i pëlqyer jashtëzakonisht). Panelistët janë konsumatorë të paarsimuar; Qëllimi është të matet pranimi/preferenca. Në përgjithësi, kërkohet një panel prej 50-100 personash.
  • Testet përshkruese (QDA): "Cilat karakteristika ka produkti dhe në çfarë intensiteti?" i përgjigjet pyetjes. Një panel i trajnuar prej 8-12 personash vlerëson karakteristikat që ata përshkruajnë (p.sh. "konsistencë kremoze", "thithësi", "aromë frutash") në një shkallë intensiteti 0-15. Nuk mat pëlqimet, krijon profile.
  • Testet e diskriminimit: "A janë dy produktet perceptualisht të ndryshme?" i përgjigjet pyetjes. Në testin e trekëndëshit, panelit i jepen tre mostra; dy janë të njëjta, njëri është i ndryshëm dhe panelisti zgjedh "të ndryshmen". Ideale për të testuar nëse një ndryshim në formulim është i dukshëm.
Këshillë: Përpara se të zgjidhni testin, plotësoni fjalinë tuaj: "Dua të di nëse ___." Nëse hendeku është "i pëlqyer", përdorni testin hedonik, nëse "i ndryshëm", përdorni testin e diskriminimit dhe nëse "i fortë në cilin tipar", përdorni testin përshkrues. Nëse nuk e specifikoni këtë qëllim kur i jepni të dhënat AI, përmbledhja do të kornizohet në mënyrë të gabuar.

Besueshmëria e panelistëve dhe dizajni i provës

Përpara se të mund t'u besoni rezultateve të papërpunuara, duhet t'i besoni vetë panelit. Disa parime bazë:

  • Testi i verbër: Panelisti nuk duhet të dijë se cili mostër është "produkti i ri" dhe cili është "referenca". Shembujt janë paraqitur me kode të rastësishme 3-shifrore (p.sh. 417, 682).
  • Kompensimi i rendit të prezantimit: Mostra e parë e shijuar është përgjithësisht e dobishme (paragjykim i mostrës së parë). Rendi i prezantimit duhet të jetë i balancuar/randomizuar ndërmjet panelistëve.
  • Përsëritja: Nëse i njëjti panelist shënon përsëri të njëjtin mostër me kode të ndryshme, mund të matni qëndrueshmërinë (përsëritshmërinë). Në panelin përshkrues, panelisti jokonsistent rikualifikohet ose përjashtohet.
  • Kontrolli i referencës: Nëse ka dy mostra identike të paraqitura verbërisht dhe panelisti i shënon ato ndryshe, të dhënat e atij panelisti janë të dyshimta.

Shembull përmbledhje e të dhënave hedonike

Më poshtë është një tabelë përmbledhëse e testit hedonik për 60 panelistë. Krahasimi i formulës së re (kodi 417) me referencën (kodi 682).

veçori

Formula e re (417) mesatare.

Referenca (682) mesatare.

Std. devijimi (417)

n

Vlerësim i përgjithshëm

7.1

7.4

1.3

60

Shije/aroma

6.8

7.3

1.5

60

qëndrueshmëri

7.3

7.2

1.1

60

Pamja e jashtme

7.6

7.5

0.9

60

Synimi i blerjes (%)

58%

65%

-

60

Është e lehtë të shikosh këtë grafik dhe të thuash "referenca është pak më e mirë, por ndryshimi është i vogël". Por a është një ndryshim mesatar prej 0.3 statistikisht i rëndësishëm apo zhurmë? Kjo është ajo ku AI prodhon më shumë halucinacione.

Përmbledhja, nxjerrja e temave dhe hartimi i interpretimit statistikor me UA

Ju mund të përdorni AI si një përshpejtues për tre detyra: hartimin e abstrakteve numerike, nxjerrjen e temave nga komentet e hapura dhe hartimin e interpretimeve statistikore. Por në të treja, rezultati është një draft, jo një vendim.

Një kërkesë e fuqishme për nxjerrjen e temave nga komentet e hapura:

Roli: Ju jeni një analist shqisor. Më poshtë janë komentet e hapura nga 60 konsumatorë për kos frutash me pak sheqer (kodi 417). Detyra juaj: 1) Gruponi komentet në 5-7 tema (p.sh. ëmbëlsia, thartira, cilësi, shija e frutave). 2) NUMËRONI sa komente janë pozitive/negative/neutrale për secilën temë dhe shkruani numrin.3) Shtoni citate të drejtpërdrejta, përmblidhni. MOS krijoni një temë që nuk është përmendur në komente. 4) MOS NXIRONI konkluzione statistikore; Kjo është një përmbledhje cilësore. Prodhimi si tabelë: | Tema | Pozitive | Negative | Neutral | Shembull i deklaratës |Komente:[60 komente të ngjitura këtu]

Tani le të shohim ndryshimin midis promptit të dobët dhe të fortë në interpretimin statistikor:

NJOFTIM I DOBËT: "Analizo këto të dhëna shqisore, më thuaj nëse produkti i ri është më i mirë se referenca." (AI MUND të përbëjë "po është më mirë" ose "ka një ndryshim domethënës" pa ditur madhësinë e kampionit, llojin e testit, vlerën p.) NJOFTIM I FORTË: "Më poshtë janë rezultatet e përgjithshme të pëlqimit të testit hedonik me 9 pikë me 60 panelistë (kolonat 417 dhe 682). Për ITE të çiftuar do të llogarisë testin t, por do të llogaris testin e nevojshëm, por WRITE. SPSS/R - Cili test është i përshtatshëm dhe përse (i çiftuar apo i pavarur) - Si mund ta konfiguroj interpretimin ndryshe nëse P<0.05 jepet një kuadro numerike?

Prompti i fuqishëm e bën këshilluesin e metodës së AI; Ju llogaritni numrin.

Rëndësia statistikore dhe vërtetimi i mostrës

Le të themi se përmbledhja e AI shkruante "produkti i ri u vlerësua dukshëm më i ulët se referenca". Ju duhet ta verifikoni këtë me të dhëna të papërpunuara. Le të shohim logjikën e çiftuar të testit t me një llogaritje të thjeshtë:

importoni numpy si npnga statistikat e importit scipy# rezultatet e përgjithshme të pëlqimit të 60 panelistëve (hedonike me 9 pikë) të reja = np.array([7,8,6,7,7,6,8,7, ...]) # kodi 417, n=60referenca = np.array([8,7,7,7,7]). 682, n=60# I njëjti panelist shënoi të dy produktet -> t-testit_stat të çiftuar, p_value = stats.ttest_rel(new, reference)difference = new.mean() - reference.mean()print(f"Diferenca mesatare: {difference:.2f} rezultati")print(f"t = {ttest_stat. Koment: Nëse p >= 0.05, do të thotë "nuk ka dallim statistikisht domethënës."

Pika kritike këtu: diferenca mesatare prej 0.30 pikësh mund të rezultojë e parëndësishme me p = 0.18. Deklarata e AI se "referenca është më e mirë" është një interpretim që nuk mbështetet statistikisht. Kur merrni vendimin tuaj, duhet të shikoni vlerën p, madhësinë e kampionit dhe supozimet e testit, jo vetëm mesataren.

Kujdes: LLM-të mund të prodhojnë deklarata përfundimtare si "p<0.05, ndryshimi është i rëndësishëm" edhe kur atyre nuk u jepen të dhëna të papërpunuara numerike. Ky është një halucinacion. Mos shkruani asnjë vlerë p, komente të rëndësisë ose gjykime "të pëlqyera nga konsumatorët" në raport bazuar në tekstin e UA; rillogaritni në softuerin tuaj statistikor (R, SPSS, JASP, Python).

mini rast

Në një kompani pijesh, ekipi ndijor po vlerëson një formulë të re që redukton sheqerin në lëngun e portokallit me 15%. Ekipi kryen një test hedonik me 9 pika me 90 konsumatorë dhe ia jep pamjen e papërpunuar AI për të përmbledhur rezultatet. Raporti i AI thotë se "formula e re u pëlqye dukshëm më pak (p<0.05)" dhe ekipi vendos të heqë formulën. Një inxhinier i vjetër rishfaq të dhënat e papërpunuara në R: diferenca e vërtetë 7.0 kundrejt 6.8, p = 0.31 — pra nuk ka dallim të rëndësishëm. Për më tepër, vihet re se rendi i paraqitjes nuk është i balancuar, formula e re shijohet gjithmonë e dyta dhe ndikohet nga lodhja e shijes (përshtatja). Inteligjenca artificiale të dyja përbënte vlerën p dhe nuk arriti të dallonte të metën e dizajnit të provës. Ekipi përsërit testin me dizajnin e balancuar dhe formula me pak sheqer pranohet. Kthimi te të dhënat e papërpunuara shpëtoi një produkt të mirë nga flakja.

Gabimet e zakonshme

  • Ngatërrimi i testimit hedonik (pëlqimi) me testimin përshkrues (profil); Të thuash “rezultat i lartë i thartirës” nuk do të thotë se nuk pëlqehet.
  • Vendosja e deklaratës së vlerave p të krijuara nga AI ose "diferencës domethënëse" në raport pa bërë llogaritjen e papërpunuar.
  • Injorimi i madhësisë së mostrës; Përgjithësimi i "konsumatorëve e pëlqyen" nga një test hedonik me 12 persona.
  • Mos balancimi i rendit të prezantimit dhe anashkalimi i paragjykimit të lodhjes së mostrës së parë/shijes.
  • Lejimi i panelistëve të dinë se cili mostër është "produkti i ri" pa testim të verbër.
  • Dështimi për të siguruar që AI përmbledh komentet e hapura kundër krijimit të citimeve/temave të sajuara.
  • Peshimi i të gjitha pikëve në mënyrë të barabartë pa kontrolluar besueshmërinë e panelistëve (konsistenca e dyfishimit të verbër).

Në përmbledhje

  • Në testin ndijor, fillimisht përcaktoni pyetjen: përdorni testin hedonik për shijen, testin e trekëndëshit për dallimin, testin përshkrues (QDA) për profilin.
  • Besojini panelit përpara se t'u besoni rezultateve të papërpunuara: kontrolloni besueshmërinë me testimin e verbër, balancimin e rendit të prezantimit, riprodhimin dhe dublikatën e verbër.
  • Përdorni AI për përmbledhjen numerike, nxjerrjen e temave nga komentet e hapura dhe konsultimin e metodave statistikore; por prodhimi është një draft.
  • Diferenca mesatare nuk është e njëjtë me rëndësinë statistikore; Dallimet e vogla mesatare mund të rezultojnë të parëndësishme me një vlerë p.
  • Inteligjenca artificiale mund të prodhojë vlerën p, interpretimin e rëndësisë dhe halucinacionet e gjykimit "bravo"; Rillogaritni çdo rezultat statistikor me të dhëna të papërpunuara në softuerin tuaj.
  • Vendimi për produktin/formulën përfundimtare; Statistikat e vërtetuara, dizajni i fortë i provës dhe besueshmëria e panelistëve konsiderohen së bashku, jo të bazuara në tekstin e AI.

Detyra e aplikimit

Hartoni një test hedonik me 9 pika dhe një test trekëndëshi për 40-60 panelistë në një produkt të vetë-studiuar ose hipotetik (p.sh., supë me kripë të reduktuar, kek pa gluten). Shkruani modelin tuaj të eksperimentit: sa panelistë, kodim të verbër, plan balancues të rendit të prezantimit dhe nëse do të përdorni dublikatë të verbër. Krijoni një tabelë realiste të të dhënave të papërpunuara (të paktën 20 rreshta) dhe jepni AI-së dy kërkesa të ndryshme: (1) nxjerrjen e temës nga komentet e hapura, (2) këshilla për metodën statistikore (kërkoni në mënyrë eksplicite që të mos përcaktojë vlerën p). Pastaj ekzekutoni vetë testin e çiftuar t në Python/R/JASP dhe krahasojeni atë me interpretimin e AI. Në një shënim me një faqe: Shpjegoni se cilën nga deklaratat e AI keni konfirmuar, të cilat i keni hedhur poshtë me të dhëna të papërpunuara dhe mbi çfarë e keni bazuar vendimin tuaj përfundimtar të produktit. Në memon tuaj, përshkruani të paktën një rrezik paragjykimi në modelin tuaj të provës dhe se si e keni reduktuar atë.