收益:
- 能够解释感官小组类型、享乐/描述性测试和小组成员的可靠性
- 能够利用人工智能起草感官数据摘要、主题提取和统计解释
- 能够利用原始面板数据和试验设计来验证人工智能的统计解释
您正在新开发的低糖水果酸奶的研发实验室中。营销团队询问“消费者喜欢它吗?”他问,生产也问:“它能与参考产品区分开来吗?”他想知道。他有 60 名消费者小组成员填写的 9 分享乐表格、训练有素的 8 人描述性小组的 QDA 分数,以及三角形辨别测试的结果。 Excel 中的数百行原始分数,以及每个小组成员的开放式评论框。似乎很容易问人工智能助手“总结一下这些数据,消费者喜欢吗?”在本单元中,我们将研究如何正确读取感官数据,使用人工智能进行总结和主题提取,最重要的是,使用原始面板数据和试验设计验证人工智能的统计解释。
感官测试类型:通过正确的测试提出正确的问题
感官分析中最常见的错误是将问题类型与测试类型混淆。共有三个主要家族,每个家族都回答不同的问题。
- 享乐(情感)测试:“有多喜欢它?”回答了问题。经典的工具是 9 点享乐量表(1 = 非常不喜欢,5 = 既不喜欢也不不喜欢,9 = 非常喜欢)。小组成员都是未受过教育的消费者;目标是衡量接受度/偏好。一般需要50-100人的小组。
- 描述性测试 (QDA):“产品具有哪些功能以及强度如何?”回答了问题。由 8-12 人组成的训练有素的小组按照 0-15 的强度等级对他们描述的特征(例如“奶油稠度”、“酸味”、“果味”)进行评分。它不衡量喜欢,而是创建个人资料。
- 歧视测试:“这两种产品在感知上是否不同?”回答了问题。在三角测试中,给小组提供三个样品;两个相同,一个不同,小组成员选择“不同的一个”。非常适合测试配方变化是否明显。
提示:在选择测试之前,请完成您的句子:“我想知道是否 ___。”如果差距是“喜欢”,则使用特征测试,如果“不同”,则使用歧视测试,如果“哪个特征较强”,则使用描述性测试。如果在向人工智能提供数据时没有指定此目的,则摘要将以错误的方式构建。
小组成员可靠性和试验设计
在您可以信任原始分数之前,您必须信任面板本身。几个基本原则:
- 盲测:小组成员不应该知道哪个样品是“新产品”,哪个样品是“参考品”。示例以 3 位随机代码表示(例如 417、682)。
- 呈现顺序补偿:品尝的第一个样品通常是有利的(第一个样品偏差)。小组成员之间的演示顺序应平衡/随机。
- 重复:如果同一位小组成员使用不同的代码再次对同一样本进行评分,则可以衡量一致性(可重复性)。在描述性小组中,不一致的小组成员将被重新培训或排除。
- 参考资料检查:如果盲目提供两个相同的样本,并且小组成员对它们的评分差异很大,则该小组成员的数据是可疑的。
特征数据摘要示例
下面是 60 名小组成员的快乐测试的汇总表。将新公式(代码 417)与参考公式(代码 682)进行比较。
特征
新公式 (417) 平均值
参考 (682) 平均值
标准。偏差 (417)
n
普遍赞赏
7.1
7.4
1.3
60
味道/香气
6.8
7.3
1.5
60
一致性
7.3
7.2
1.1
60
外观
7.6
7.5
0.9
60
购买意向(%)
58%
65%
—
60
看到这张图表很容易说“参考性好一点,但差别很小”。但 0.3 的平均差异是否具有统计显着性或噪音?这是人工智能产生最多幻觉的地方。
利用人工智能进行摘要、主题提取和统计解释起草
您可以使用人工智能作为三项任务的加速器:起草数值摘要、从开放式评论中提取主题以及起草统计解释。但在这三个项目中,产出都是草案,而不是决定。
从开放式评论中提取主题的强大提示:
角色:您是一名感官分析师。以下是 60 位消费者对低糖水果酸奶(代码 417)的开放式评论。您的任务:1) 将评论分为 5-7 个主题(例如甜味、酸味、质地、水果风味)。2) 计算每个主题有多少条评论是正面/负面/中性,并写下数字。3) 添加直接引用,进行总结。不要编造评论中未提及的主题。4)不要得出统计结论;这是一个定性的总结。输出为表格: |主题 |积极|负面|中性|声明示例 |评论:[此处粘贴了 60 条评论]
现在让我们看看弱提示和强提示在统计解释上的区别:
弱提示:“分析这些感官数据,告诉我新产品是否比参考产品更好。” (人工智能可能会在不知道样本量、测试类型、p 值的情况下编造“是的,更好”或“存在显着差异”。) 强烈提示:“以下是 60 名小组成员的 9 点享乐测试的原始总体喜好分数(第 417 和 682 列)。对于配对 t 检验。写出必要的步骤,但我将在 SPSS/R 中计算和验证结果。- 哪个测试是合适的,为什么(配对或独立)? - 如果 p<0.05 拟合一个数值 p 值,我该如何设置不同的解释?
强大提示打造AI方法顾问;你计算一下这个数字。
统计显着性和样本验证
假设人工智能摘要写道“新产品的评级明显低于参考产品”。您需要用原始数据来验证这一点。让我们通过简单的计算来看看配对 t 检验逻辑:
import numpy as npfrom scipy import stats# 60 名小组成员的总体喜欢分数(9 分 hedonic)new = np.array([7,8,6,7,7,6,8,7, ...]) # 代码 417, n=60reference = np.array([7,8,7,8,7,7,8,7, ...]) # 代码 682, n=60# 同一小组成员得分products -> 配对 t-testit_stat, p_value = stats.ttest_rel(new, reference)difference = new.mean() - reference.mean()print(f"平均差: {difference:.2f} 分数")print(f"t = {t_stat:.2f}, p = {p_value:.3f}")# 注释:如果 p >= 0.05,则意味着“没有统计上的显着差异”。
这里的关键点是:当 p = 0.18 时,0.30 点的平均差异可能微不足道。 AI关于“参考更好”的说法是一种没有统计支持的解释。在做出决定时,您应该查看 p 值、样本量和检验假设,而不仅仅是平均值。
注意:法学硕士可以产生明确的陈述,例如“p<0.05,差异显着”,即使没有提供原始数值数据。这是幻觉。请勿根据人工智能的文本在报告中写入任何p值、显着性评论或“消费者喜欢”的判断;在您自己的统计软件(R、SPSS、JASP、Python)中重新计算。
迷你盒
一家饮料公司的感官团队正在评估一种新配方,该配方可将橙汁中的糖分降低 15%。该团队对 90 名消费者进行了 9 点享乐测试,并将原始图片输入 AI 来总结结果。 AI 报告称“新公式的受欢迎程度显着降低 (p<0.05)”,团队决定废弃该公式。一位高级工程师在 R 中重新运行原始数据:真实差异为 7.0 与 6.8,p = 0.31 — 因此没有显着差异。此外,值得注意的是,呈现顺序不平衡,新配方总是第二次品尝,并且受到味觉疲劳(适应)的影响。 AI 既弥补了 p 值,也未能发现试验设计缺陷。团队以平衡设计重复测试,低糖配方被接受。利用原始数据可以避免优质产品被丢弃。
常见错误
- 混淆享乐(喜好)测试与描述性(概况)测试;说“酸度高”并不代表不喜欢。
- 将人工智能炮制的 p 值或“显着差异”陈述放入报告中,而不进行原始计算。
- 忽略样本量;从 12 人享乐测试中概括出“消费者喜欢它”。
- 不平衡呈现顺序并忽视第一个样品/味觉疲劳偏差。
- 让小组成员无需盲测就能知道哪个样品是“新产品”。
- 未能确保人工智能总结开放式评论,反对生成虚构的引言/主题。
- 对所有分数进行同等加权,而不检查小组成员的可靠性(盲目重复一致性)。
综上所述
- 在感官测试中,首先确定问题:品味使用享乐测试,差异使用三角测试,轮廓使用描述性测试(QDA)。
- 在信任原始分数之前先信任专家组:通过盲测、演示顺序平衡、重播和盲复制来检查可靠性。
- 利用AI进行数值总结、开放式评论主题提取、统计方法咨询;但输出是草稿。
- 平均差不等于统计显着性;对于 p 值来说,较小的平均差异可能并不显着。
- AI可以产生p值、显着性解释以及“竖起大拇指”判断的幻觉;在您自己的软件中使用原始数据重新计算每个统计结果。
- 最终产品/配方决定;经过验证的统计数据、稳健的试验设计和小组成员的可靠性是一起考虑的,而不是基于人工智能文本。
应用任务
针对自学或假设产品(例如减盐汤、无麸质蛋糕),为 40-60 名小组成员设计 9 点享乐测试和三角测试。写下你的实验设计:有多少小组成员、盲编码、演示顺序平衡计划以及是否使用盲重复。创建一个真实的原始数据表(至少20行),并给AI两种不同的提示:(1)从开放式评论中提取主题,(2)统计方法建议(明确要求不要弥补p值)。然后在 Python/R/JASP 中自行运行配对 t 检验,并将其与 AI 的解释进行比较。在一页纸的注释中:解释你确认了人工智能的哪些陈述,用原始数据反驳了哪些陈述,以及你最终产品决策的依据是什么。在您的备忘录中,描述您的试验设计中至少一种偏倚风险以及您如何减少它。