Eining 6 / 10

Skyngreiningargögn

Hagnaður:

  • Hæfni til að túlka gerðir skynjunarborða, hedonic/lýsandi prófun og áreiðanleika panelmeðlima
  • Hæfni til að semja samantekt á skyngögnum, þemaútdrátt og tölfræðilega túlkun með gervigreind
  • Geta til að sannreyna tölfræðilega túlkun gervigreindar með hráum spjaldtölvum og prufuhönnun

Þú ert á rannsóknarstofu fyrir nýþróaða ávaxtajógúrt með lágum sykri. Markaðsteymið spyr „líst neytendum á það?“ spyr hann og framleiðslan spyr: "Er hægt að greina hana frá viðmiðunarafurðinni?" spyr hann. Hann er með 9 punkta hedonísk eyðublöð útfyllt af 60 neytendanefndum, QDA stig frá þjálfuðu 8 manna lýsingarpanel og niðurstöður þríhyrningsprófs. Hundruð raða af hráum stigum í Excel, auk opinn athugasemdareit fyrir hvern pallborðsfulltrúa. Það virðist freistandi að spyrja AI aðstoðarmann „taka saman þessi gögn, líkar neytendum við þau? Í þessari einingu munum við rannsaka hvernig á að lesa skynjunargögn rétt, nota gervigreind til samantektar og þemaútdráttar, og síðast en ekki síst, sannreyna tölfræðilega túlkun gervigreindar með hráum spjaldtölvum og prófunarhönnun.

Skynprófategundir: Spyrðu réttu spurningarinnar með réttu prófinu

Algengustu mistökin í skyngreiningu eru að rugla saman tegund spurningar og tegund prófs. Það eru þrjár stórar fjölskyldur og hver svarar annarri spurningu.

  • Hedónísk (áhrifarík) próf: "Hversu líkaði við það?" svarar spurningunni. Klassíska hljóðfærið er 9 punkta hedóníski kvarðinn (1 = mjög mislíkað, 5 = hvorki líkað né mislíkað, 9 = mjög líkað). Pallborðsmenn eru ómenntaðir neytendur; Markmiðið er að mæla viðurkenningu/val. Almennt þarf 50-100 manna pallborð.
  • Lýsandi próf (QDA): "Hvaða eiginleika hefur varan og í hvaða styrkleika?" svarar spurningunni. Þjálfaður hópur af 8-12 manns skorar einkennin sem þeir lýsa (t.d. „rjómalöguð samkvæmni,“ „súrleiki,“ „ávaxtabragð“) á styrkleikakvarðanum 0-15. Það mælir ekki líkar, það býr til snið.
  • Mismununarpróf: "Eru vörurnar tvær skynjunarlega ólíkar?" svarar spurningunni. Í þríhyrningsprófinu eru þrjú sýni gefin til pallborðsins; tveir eru eins, einn er ólíkur og pallborðsmaður velur þann „ólíkan“. Tilvalið til að prófa hvort breyting á samsetningu sé áberandi.
Ábending: Áður en þú velur prófið skaltu klára setninguna þína: "Ég vil vita hvort ___." Ef bilið er „líkt“, notaðu hegðunarpróf, ef „öðruvísi“ notaðu mismununarpróf og ef „sterkt í hvaða eiginleika“ notaðu lýsandi próf. Ef þú tilgreinir ekki þennan tilgang þegar þú gefur gögnin til gervigreindar verður samantektin sett inn á rangan hátt.

Áreiðanleiki pallborðs og prufuhönnun

Áður en þú getur treyst hráum stigum þarftu að treysta pallborðinu sjálfu. Nokkrar grundvallarreglur:

  • Blindpróf: Dómnefndin ætti ekki að vita hvaða sýni er „nýja varan“ og hver er „viðmiðunin“. Dæmi eru sett fram með 3 stafa slembikóðum (t.d. 417, 682).
  • Kynningarpöntunarbætur: Fyrsta sýnishornið sem smakkað er er almennt hagstætt (skekkja í fyrsta sýni). Kynningarröð ætti að vera í jafnvægi/slembivali meðal nefndarmanna.
  • Endurtekning: Ef sami þátttakandi skorar sama úrtakið aftur með mismunandi kóða, getur þú mælt samkvæmni (endurtekningarhæfni). Í lýsandi pallborði er hinn ósamkvæmi pallborðsmaður endurmenntaður eða útilokaður.
  • Tilvísunarathugun: Ef tvö eins sýni eru sett fram í blindni og nefndarmaður skorar þau mjög mismunandi, er grunur á gögnum nefndarmanns.

Dæmi um hedonic gagnasamantekt

Hér að neðan er yfirlitstafla yfir hegðunarprófið fyrir 60 nefndarmenn. Að bera saman nýju formúluna (kóði 417) við tilvísunina (kóði 682).

eiginleiki

Ný formúla (417) meðaltal.

Tilvísun (682) meðaltal.

Std. frávik (417)

n

Almennt þakklæti

7.1

7.4

1.3

60

Bragð/ilmur

6.8

7.3

1.5

60

samræmi

7.3

7.2

1.1

60

Útlit

7.6

7.5

0,9

60

Kaupáform (%)

58%

65%

60

Það er auðvelt að skoða þetta graf og segja "viðmiðunin er aðeins betri, en munurinn er lítill." En er meðalmunur 0,3 tölfræðilega marktækur eða hávaði? Þetta er þar sem gervigreind framkallar flestar ofskynjanir.

Samantekt, þemaútdráttur og tölfræðitúlkun með gervigreind

Þú getur notað gervigreind sem hraðal fyrir þrjú verkefni: að semja tölulegar útdrættir, draga þemu úr opnum athugasemdum og semja tölfræðilegar túlkanir. En í öllum þremur er útkoman drög, ekki ákvörðun.

Öflug hvetja til að draga þemu úr opnum athugasemdum:

Hlutverk: Þú ert skynjunarfræðingur. Hér að neðan eru opnar athugasemdir frá 60 neytendum um sykurlausa ávaxtajógúrt (kóði 417). Verkefni þitt:1) Flokkaðu athugasemdir í 5-7 þemu (t.d. sætleiki, súrleiki, áferð, ávaxtabragð).2) TELDU hversu margar athugasemdir eru jákvæðar/neikvæðar/hlutlausar fyrir hvert þema og skrifaðu töluna.3) Bættu við beinum tilvitnunum, taktu saman. EKKI búa til þema sem ekki er nefnt í athugasemdum.4) EKKI DRAGA tölfræðilegar ályktanir; Þetta er eigindleg samantekt. Úttak sem tafla: | Þema | Jákvæð | Neikvætt | Hlutlaus | Dæmi um yfirlýsingu | Athugasemdir:[60 athugasemdir límdar hér]

Nú skulum við sjá muninn á veikum og sterkum hvetjum í tölfræðilegri túlkun:

WEAK PROMPT: "Greindu þessi skynjunargögn, segðu mér hvort nýja varan sé betri en tilvísunin." (AI GETUR gert upp "já það er betra" eða "það er marktækur munur" án þess að vita um úrtaksstærð, tegund prófs, p-gildi.) STERK HRINGING: "Hér fyrir neðan eru hráar almennar mætur á 9 punkta hedonic prófinu með 60 þátttakendum (dálkur 417 og 682). niðurstaðan í SPSS/R - Hvaða próf er viðeigandi og hvers vegna (parað eða óháð) - Hvernig set ég túlkunina upp ef p<0,05 kemur út með tölulegu p-gildi?

Öflug hvetja gerir AI aðferðaráðgjafa; Þú reiknar út töluna.

Tölfræðileg marktækni og sannprófun úrtaks

Segjum að samantekt gervigreindar hafi skrifað "nýja varan var metin verulega lægri en viðmiðunin." Þú þarft að staðfesta þetta með hráum gögnum. Við skulum sjá pöruð t-próf rökfræði með einföldum útreikningi:

flyttu inn numpy sem npfrom scipy innflutningstölfræði# almennt mætur á 60 þátttakendum (9-punkta hedonic)new = np.array([7,8,6,7,7,6,8,7, ...]) # kóða 417, n=60tilvísun = np.array([7,8,7, 8,7,7, 8,7,7) n=60# Sami pallborðsmaður skoraði báðar vörurnar -> paraði t-testit_stat, p_value = stats.ttest_rel(new, reference)difference = new.mean() - reference.mean()print(f"Meanmismunur: {difference:.2f} score")print(f"t = {t_stat:.3f_value)e: Athugasemd: {t_stat:.3f}"), p: 0,05 þýðir það "enginn tölfræðilega marktækur munur."

Mikilvægi punkturinn hér: meðalmunur 0,30 stig getur reynst ómarktækur með p = 0,18. Fullyrðing AI um að „tilvísun sé betri“ er túlkun sem er ekki studd tölfræðilega. Þegar þú tekur ákvörðun þína ættir þú að skoða p-gildi, úrtaksstærð og forsendur prófsins, ekki meðaltalið eitt og sér.

Varúð: LLMs geta framleitt endanlegar staðhæfingar eins og "p<0,05, munurinn er marktækur" jafnvel þegar þeim er ekki gefin hrá töluleg gögn. Þetta er ofskynjun. Ekki skrifa nein p-gildi, mikilvægar athugasemdir eða „neytendum líkaði við“ dóma inn í skýrsluna byggða á texta gervigreindar; endurreikna í þínum eigin tölfræðihugbúnaði (R, SPSS, JASP, Python).

lítill hulstur

Hjá drykkjarvörufyrirtæki er skynjunarteymið að meta nýja formúlu sem dregur úr sykri í appelsínusafa um 15%. Liðið keyrir 9 punkta hegðunarpróf með 90 neytendum og gefur gervigreindinni hráa mynd til að draga saman niðurstöðurnar. Gervigreindarskýrslan segir að "nýju formúlunni þótti marktækt minna (p<0,05)" og teymið ákveður að hætta formúlunni. Yfirverkfræðingur keyrir aftur hrá gögnin í R: sannur munur 7,0 á móti 6,8, p = 0,31 - svo enginn marktækur munur. Þar að auki er tekið eftir því að framsetningarröðin er ekki í jafnvægi, nýja formúlan er alltaf smakkuð í öðru sæti og verður fyrir áhrifum af bragðþreytu (aðlögun). Gervigreindin bjó bæði til p-gildið og tókst ekki að koma auga á hönnunargalla prufunnar. Liðið endurtekur prófið með yfirvegaðri hönnun og sykurlítil formúlan er samþykkt. Að snúa sér að hráum gögnum bjargaði góðri vöru frá því að henda henni.

Algeng mistök

  • Að rugla saman hedónískum (líkingar)prófum og lýsandi (prófíl)prófum; Að segja "hátt súrefnisstig" þýðir ekki að það sé ekki líkað við það.
  • Að setja AI-samsett p-gildi eða „verulegur munur“ yfirlýsingu í skýrsluna án þess að gera hráa útreikninginn.
  • Hunsa úrtaksstærð; Alhæfa „neytendum líkaði það“ úr 12 manna hegðunarprófi.
  • Ekki jafnvægi á framsetningarröðinni og horfa framhjá fyrsta sýnishorninu/bragðþreytaskekkjunni.
  • Leyfa fundarmönnum að vita hvaða sýni er „nýja varan“ án blindprófunar.
  • Misbrestur á að tryggja að gervigreind taki saman opnar athugasemdir gegn því að búa til tilvitnanir/þemu.
  • Vega öll stig jafnt án þess að athuga áreiðanleika pallborðsfulltrúa (blind tvítekning).

Í stuttu máli

  • Í skynprófinu skaltu fyrst ákvarða spurninguna: notaðu hedonískt próf fyrir bragð, þríhyrningspróf fyrir mismun, lýsandi próf (QDA) fyrir prófíl.
  • Treystu pallborðinu áður en þú treystir hráum stigum: athugaðu áreiðanleika með blindprófun, jafnvægi í kynningarpöntunum, endurspilun og blindri afritun.
  • Notaðu gervigreind fyrir tölulegar samantektir, þemaútdrátt úr opnum athugasemdum og ráðgjöf um tölfræðiaðferðir; en útkoman er uppkast.
  • Meðalmunur er ekki það sama og tölfræðileg marktækni; Lítill meðalmunur getur reynst óverulegur með p-gildi.
  • AI getur framleitt p-gildi, þýðingu túlkunar og ofskynjanir á „thumbs up“ dómgreind; Endurreiknaðu hverja tölfræðilega niðurstöðu með hráum gögnum í þínum eigin hugbúnaði.
  • Lokaákvörðun um vöru/formúlu; Staðfest tölfræði, öflug prufuhönnun og áreiðanleiki pallborðsfulltrúa eru teknar saman, ekki byggðar á gervigreindartexta.

Umsóknarverkefni

Hannaðu 9 punkta hedonískt próf og þríhyrningspróf fyrir 40-60 nefndarmenn á sjálfstætt rannsakaða eða ímyndaða vöru (t.d. súpu með minni salti, glútenlausa köku). Skrifaðu út tilraunahönnun þína: hversu margir þátttakendur, blindkóðun, jafnvægisáætlun kynningarpöntunar og hvort þú munt nota blindar afrit. Búðu til raunhæfa hrágagnatöflu (að minnsta kosti 20 línur) og gefðu gervigreindinni tvær mismunandi leiðbeiningar: (1) þemaútdrátt úr opnum athugasemdum, (2) ráðleggingar um tölfræðilegar aðferðir (biðjið beinlínis um að gera ekki upp p-gildið). Keyrðu síðan paraða t-prófið sjálfur í Python/R/JASP og berðu það saman við túlkun gervigreindar. Í athugasemd á einni síðu: Útskýrðu hvaða fullyrðingar gervigreindarinnar þú staðfestir, sem þú afsannaðir með hráum gögnum og á hverju þú byggðir endanlega vöruákvörðun þína. Í minnisblaðinu þínu skaltu lýsa að minnsta kosti einni hættu á hlutdrægni í prufuhönnun þinni og hvernig þú minnkaðir hana.