单位 7 / 12

情感分析和质量管理:使用语音分析进行质量检查

收益:

  • 能够通过情绪分析和语音分析来读取个人和总体趋势,并使用分数作为信号而不是绝对事实
  • 能够使用客观记分卡扫描 100% 的对话并生成基于证据的初步评估,同时将最终决定权留给人类
  • 能够建立透明的质量体系,远离惩罚文化,以实现发展和体验改进

呼叫中心每天有数千个对话,但采用经典方法,质量团队只能聆听和评估其中的一小部分(大多数地方为 1-2%)。这意味着 98% 的对话在未经检查的情况下就丢失了;即使客户受到虐待或代表一再提供虚假信息,也没有人会注意到。人工智能从根本上改变了这种情况:它可以阅读和评估每一次对话。在本单元中,我们将涵盖两个相关主题:情绪分析(测量客户和代表的情绪基调)和质量管理(QA - 质量保证;评估对话与标准的合规性)。

前两个术语。情感分析是文本或语音的积极、消极或中性情绪基调;它是自动检测愤怒、满足和焦虑等情况。语音分析(交互分析)是对所有对话进行集中分析,提取趋势、常见话题、风险和机会。它们共同为呼叫中心提供了“倾听的耳朵”:从经理无法单独聆听的数千个对话中产生意义。

情绪分析:把握脉搏

情感分析在两个层面上发挥作用。单一级别:显示对话的总体基调(“客户开始生气,最终平静下来”)和转折点。聚合水平:从数千个对话中提取诸如“本周负面情绪上升 18%,主要是关于‘账单’”的趋势。这些信息很有价值:它可以尽早捕捉到日益高涨的愤怒情绪、产品问题或对新活动的困惑。

然而,情感分析并不完美。在土耳其语中,讽刺、反讽和习语可能会误导模型(“非常感谢,服务很棒!”这句话可能是在愤怒中说的)。此外,情绪得分只是一个信号,而不是确定的事实。因此,使用情绪分析不是为了惩罚个人代表,而是为了了解趋势并突出显示需要关注的对话。

提示:将情绪分析用作“警报”,而不是“判断”。一次负分并不能谴责一个代表;但消极趋势的上升表明有一个领域需要审查。与人验证信号。

质量管理:100%评价而不是1%

在经典的质量检查中,质量专家使用评估表对一些随机选择的呼叫进行评分(记分卡 - 诸如“是否给出了问候、是否验证了身份、是否提供了解决方案、结束是否合适”等项目)。该方法存在样本量小、主观性和延迟问题。在人工智能支持的 QA 中,模型根据记分卡项目自动评估所有对话;哪篇文章缺失,哪些演讲有风险,哪位代表在哪一个问题上应该得到支持——这一切都显示出来了。

关键点:AI的QA评分是初步筛选和指示,而不是最终评估。 AI说“这次对话似乎跳过了身份验证步骤”;质量专家检查这些标记的对话并做出最终决定。因此,专家不会听取数千个对话,而是专注于人工智能标记的有风险/典型的对话——既更公平又更全面。

下表对这两种方法进行了比较:

尺寸

经典质量检查

人工智能驱动的质量检查

适用范围

1-2% 的对话

100% 扫描

持续时间

慢慢地,用手听

即时扫描

一致性

因专家而异

不断应用标准

主观性

标准很明确,信号+人

最终决定

专家

专家(专注于人工智能)

风险

逃避问题

虚假标志(必须验证)

一步一步:人工智能驱动的质量计划

  1. 明确记分卡:客观、可衡量地编写评价项目(不是像“表现有礼貌”那样含糊不清,而是像“用姓名/适当的地址问候客户”这样清晰)。
  2. 给AI设定标准:根据这些项目将每个对话评为“完成/未完成/不清楚”;你出示了证明语句。
  3. 突出显示有风险的内容:将低分、愤怒或合规风险的对话带给专家。
  4. 专家确认:最终评分和反馈属于人类;人工智能所说的“不确定”的地方,人类肯定可以去。
  5. 将其转化为指导:将调查结果用于代理发展 - 专注于改进,而不是惩罚。

四个可复制模板

1) 记分卡评分:

根据下列项目评价下列匿名对话。对于每个项目:给出 status=[已完成/未完成/不清楚] 和一个证据句子(引自对话)。如果没有证据,就说“不清楚”;猜测。项目: 1) 适当的问候 2) 身份验证 3) 理解问题 4) 正确的信息/解决方案 5) 强制信息 6) 有礼貌的结束语。演讲:<<解密>>

2)情绪及转折点分析:

画出下面匿名对话的情绪轨迹。- 起始语气,结束语气(平静/愤怒/焦虑/满意),- 情绪改变的时刻以及原因(引用),- 是否有任何愤怒/危机的迹象,代理人如何处理?注意可能的讽刺/讽刺;如果您不确定,请说“不清楚”。演讲:《抄录》

3)汇总趋势报告:

以下是本周的匿名对话标签和情绪得分。 (1) 增加最多的负面情绪主题,(2) 可能的根本原因假设(证明),(3) 建议检查的 3 个主题。从数据中获取数字,而不是编造数字;将假设标记为“必须确认”。数据:<<汇总表>>

4)教练总结(代理开发):

根据以下评估的对话,为一名代表制作一份以发展为重点、非惩罚性的辅导说明。 - 优势 (2), - 需要改进的地方(2,带有具体示例), - 1 个建议的微观目标。个人判断/标签使用。数据:<<语音评级>>

弱提示/强提示

弱提示:

评价该代表的好坏。

主观、无标准、无证据、惩罚性;它产生了不公正且站不住脚的“判断”。

强力提示:

根据 6 项记分卡评估这次匿名对话;对于每个项目,引用演讲中的已完成/未完成/不清楚+证据。如果没有证据,就说“不清楚”。我(质量专家)将做出最终决定;你只要有证据做一个初步的评估就可以了。

区别在于:标准明确、证据强制性、不确定性诚实、最终决定权在人。

三个迷你箱子

案例 1 — 100% 覆盖率的力量。在一家银行,QA 团队每月可以收听约 1,200 次对话(占总数的 1.5%)。全部 80,000 条对话均由 AI 扫描;事实证明,身份验证步骤有 6% 的情况被跳过——这种合规风险在传统抽样中永远不会出现。经过有针对性的辅导,2个月内这一比例下降到了1%以下。

案例 2——讽刺陷阱。在电商中心,情感模型将诸如“你太棒了,我已经等了三天了”这样的讽刺句子视为“积极”;所以一些愤怒的顾客似乎“满意”了。当模型不作为唯一决策者并通过人眼采样验证分数时,团队将反讽案例单独标记,报告的可靠性增加。教训:情绪分数是一个信号,而不是绝对的事实。

案例 3——早期预警。一家电信公司的语音分析显示,从周二开始,围绕“bill”的负面情绪在 3 天内增加了 40%。调查显示,发票在向新关税的过渡中被错误地反映。在数千起投诉累积之前,这个问题就被早期的情绪信号发现并解决了。分析已成为一种预警系统和质量工具。

常见错误

  • 将情绪分数视为绝对真理。反讽、习语和语境会误导模型;使用分数作为信号,与人验证。
  • 让AI评分作为最终决定。在QA中,最终的评估和反馈属于人;人工智能不断进步。
  • 记分卡项目模糊。 “他表现得很好”是无法衡量的;写出客观的、可验证的项目。
  • 将 QA 变成惩罚工具。目的是发展和客户体验;惩罚文化使代理人保持沉默并破坏数据。
  • 没有证据的评估。每项发现都应该引用演讲中的内容来支持;否则就应该被称为“不清楚”。
注意:用人工智能衡量所有对话功能强大但很敏感。将其变成一个不断监控和惩罚员工的系统,既不道德,也会破坏团队的信任。目标是改善客户体验和代理商发展;透明度和发展重点至关重要。

综上所述

情绪分析和人工智能驱动的质量管理使呼叫中心能够听到数千个对话:扫描 100% 而不是 1% 的样本,及早捕捉趋势并保持质量评估的一致性。但情感分数只是一个信号,而不是绝对的事实;在 QA 中,最终决定权属于人类。客观地写记分卡,将每一个发现都归因于证据,将不确定性留给人类,并以透明的方式建立整个系统,其目的是发展和体验改进,而不是惩罚。

应用任务

设计一个包含 6 个项目的客观记分卡(每个项目应该是可测量和可证明的)。采取虚构/匿名成绩单并应用“1) 记分卡评估”和“2) 情绪分析”模板。突出显示模型认为“模棱两可”或可能具有讽刺意味的区域,并写出人类专家应如何验证它们。最后,制作一份以发展为重点的备忘录,其中包含“4)辅导总结”。

清单

  • [ ] 我的记分卡项目是客观的、可衡量的和可验证的。
  • [ ] AI评估初筛;最终的 QA 决定和反馈取决于人类。
  • [ ] 我使用情绪分数作为信号,而不是绝对真理。
  • [ ] 每项发现均由谈话中引用的证据支持;否则“不清楚”。
  • [ ] 我建立这个系统的目的是为了发展和体验提升,而不是为了惩罚。
  • [ ] 向员工透明地解释了分析的目的和范围。