단위 7 / 12

감정 분석 및 품질 관리: 음성 분석을 통한 QA

이득:

  • 감정 분석 및 음성 분석을 통해 개별 및 집계 추세를 읽고 점수를 절대적인 사실이 아닌 신호로 사용하는 기능
  • 객관적인 스코어카드로 대화를 100% 스캔하고 증거 기반 예비 평가를 생성하는 동시에 최종 결정은 사람에게 맡기는 기능
  • 발전과 경험향상을 위해 형벌문화에서 벗어나 투명성을 갖춘 품질시스템을 구축할 수 있는 능력

콜센터에서는 매일 수천 건의 대화가 이루어지지만 전통적인 방법을 사용하면 품질팀은 그 중 극히 일부(대부분의 경우 1~2%)만 듣고 평가할 수 있습니다. 이는 대화의 98%가 검토되지 않은 채 손실된다는 의미입니다. 고객이 부당한 대우를 받거나 담당자가 반복적으로 거짓 정보를 제공하더라도 누구도 이를 알아차릴 수 없습니다. 인공 지능은 이러한 상황을 근본적으로 변화시킵니다. 인공 지능은 모든 대화를 읽고 평가할 수 있습니다. 이 단원에서는 감정 분석(고객과 담당자의 감정적 어조 측정)과 품질 관리(QA - 품질 보증, 대화의 표준 준수 여부 평가)라는 두 가지 관련 주제를 다룰 것입니다.

처음 두 용어. 감정 분석은 텍스트나 연설의 긍정적, 부정적 또는 중립적 감정 어조입니다. 분노, 만족, 불안 등의 상황을 자동으로 감지하는 것입니다. 음성 분석(상호작용 분석)은 모든 대화를 종합적으로 분석하여 동향, 빈번하게 발생하는 주제, 위험 및 기회를 추출하는 것입니다. 이들은 함께 콜센터에 "듣는 귀"를 제공합니다. 관리자가 개별적으로 들을 수 없는 수천 개의 대화에서 의미를 생성합니다.

감정 분석: 맥박 유지

감정 분석은 두 가지 수준에서 작동합니다. 단일 수준: 대화의 일반적인 어조(“고객이 화를 내기 시작했다가 결국 진정됨”)와 전환점을 보여줍니다. 집계 수준: 수천 개의 대화에서 '이번 주에 주로 '청구서'에 대한 부정적인 감정이 18% 증가했습니다.'와 같은 추세를 추출합니다. 이 정보는 금물입니다. 분노의 물결, 제품 문제 또는 새로운 캠페인에 대한 혼란을 조기에 포착합니다.

그러나 감정 분석은 완벽하지 않습니다. 터키어에서는 빈정거림, 아이러니, 관용어가 모델을 오해할 수 있습니다("정말 감사합니다. 훌륭한 서비스입니다!"라는 문장이 화를 내며 말했을 수도 있음). 또한 감정 점수는 신호일 뿐 확정적인 진실은 아닙니다. 따라서 감정 분석을 사용하여 개별 담당자를 처벌하는 것이 아니라 추세를 확인하고 주의가 필요한 대화를 강조하세요.

팁: 감정 분석을 '판단'이 아닌 '경고'로 사용하세요. 단일 부정적인 점수는 대표자를 비난하지 않습니다. 그러나 부정적인 경향이 증가하는 것은 검토가 필요한 영역을 나타냅니다. 사람과 신호를 확인하십시오.

품질 관리: 1%가 아닌 100% 평가

전통적인 QA에서 품질 전문가는 평가 양식(스코어카드 - "인사말 제공, 신원 확인, 제안된 솔루션, 마무리가 적절했는지"와 같은 항목)을 사용하여 무작위로 선택된 통화 몇 개에 점수를 매깁니다. 이 방법은 작은 샘플 크기, 주관성 및 지연 문제로 어려움을 겪습니다. 인공 지능 지원 QA에서 모델은 스코어카드 항목에 따라 모든 대화를 자동으로 평가합니다. 어떤 기사가 누락되었는지, 어떤 연설이 위험한지, 어떤 문제에 대해 어떤 대표가 지원되어야 하는지 등 모두 보여줍니다.

중요한 점: AI의 QA 점수는 최종 평가가 아닌 예비 심사 및 지표입니다. AI는 “이 대화는 인증 단계를 건너뛴 것 같다”고 말한다. 품질 전문가는 표시된 대화를 검토하고 최종 결정을 내립니다. 따라서 전문가는 수천 개의 대화를 듣는 대신 AI가 표시하는 위험하고 모범적인 대화, 즉 더 공정하고 포괄적인 대화에 중점을 둡니다.

다음 표에서는 두 가지 접근 방식을 비교합니다.

크기

클래식 QA

AI 기반 QA

범위

대화의 1~2%

100% 스캔됨

기간

천천히, 손으로 듣기

인스턴트 스캔

일관성

전문가에 따라 다름

기준에 지속적으로 적용

주관성

높다

기준은 명확해 신호+인간

최종 결정

전문가

전문가(AI 중심)

위험

문제 탈출

허위 기호(확인해야 함)

단계별: AI 기반 품질 프로그램

  1. 스코어카드를 명확하게 작성하십시오. 평가 항목을 객관적이고 측정 가능하게 작성하십시오("예의 바르게 행동했습니다"처럼 모호하지 않고 "고객 이름/적절한 주소로 인사드립니다"와 같이 명확하게 작성하십시오).
  2. AI에게 기준을 제공합니다. 이러한 항목에 따라 각 대화를 "완료/완료되지 않음/불분명"으로 평가합니다. 증거문을 보여주셨는데요.
  3. 위험한 부분 강조 표시: 점수가 낮거나 화가 났거나 규정 준수 위험이 있는 대화를 전문가에게 가져옵니다.
  4. 전문가는 다음을 확인합니다. 최종 점수와 피드백은 인간의 것입니다. AI가 '불확실'하다고 부르는 장소는 분명 인간이 이용할 수 있는 곳이다.
  5. 코칭으로 전환: 결과를 에이전트 개발에 사용합니다. 처벌이 아닌 개선에 중점을 둡니다.

복사 가능한 템플릿 4개

1) 스코어카드 등급:

다음 항목에 따라 다음 익명 대화를 평가해 보세요. 각 항목에 대해 상태=[완료/완료되지 않음/불분명] 및 증거 문장(대화에서 인용)을 제공합니다. 증거가 없으면 "불분명"이라고 말하세요. 추측.항목: 1) 적절한 인사말 2) 인증 3) 문제 이해 4) 올바른 정보/해결책 5) 필수 정보 6) 정중한 마무리.음성: <<해독>>

2) 감정 및 전환점 분석:

아래에 익명 대화의 감정적 궤적을 그려보세요.- 시작 어조, 끝 어조(평온함/분노/불안/만족)- 감정이 변한 순간 및 이유(인용문 포함)- 분노/위기의 징후가 있었습니까? 상담원은 이를 어떻게 처리했습니까?아이러니/비꼬는 표현이 있을 수 있습니다. 확실하지 않으면 "불분명"이라고 말하세요. 음성: <<기록>>

3) 종합적인 추세 보고서:

아래는 이번주 익명 대화 태그와 감정 점수입니다. (1) 가장 많이 증가하는 부정적 감정 주제, (2) 가능한 근본 원인 가설(증명), (3) 검토할 권장 주제 3가지. 데이터에서 숫자를 취하세요. 꾸며내지 마세요. 가설을 "확인해야 함"으로 표시합니다.데이터: <<요약 표>>

4) 코칭 요약(에이전트 개발):

다음 평가된 대화를 바탕으로 ONE 담당자를 위한 개발 중심의 비처벌적 코칭 노트를 작성하세요. - 강점(2), - 개선이 필요한 부분(2, 구체적인 사례 포함), - 1개의 미세 목표 제시. 라벨의 개인적인 판단/사용.데이터: <<음성 등급>>

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

이 대표자가 좋은지 나쁜지를 평가해 보세요.

주관적, 기준 없음, 증거 없음, 징벌적; 그것은 부당하고 변호할 수 없는 “판결”을 낳는다.

강력한 프롬프트:

6개 항목 스코어카드에 따라 이 익명 대화를 평가하십시오. 각 항목에 대해 완료/완료되지 않음/불분명 + 연설에서 나온 증거를 인용하세요. 증거가 없으면 "불분명"이라고 말하세요. 최종 결정은 나(품질 전문가)가 내리게 됩니다. 증거를 가지고 예비 평가를 하면 됩니다.

차이점은 기준이 명확하고 증거가 필수이며 불확실성이 정직하고 최종 결정은 개인에게 있다는 것입니다.

세 개의 미니 케이스

사례 1 - 100% 적용 범위의 힘. 한 은행에서 QA팀은 매달 최대 1,200건의 대화(전체의 1.5%)를 들을 수 있었습니다. 80,000개의 대화는 모두 AI로 스캔되었습니다. 인증 단계를 6% 건너뛴 것으로 나타났습니다. 이는 기존 샘플링에서는 결코 볼 수 없는 규정 준수 위험입니다. 타겟 코칭을 실시한 결과, 2개월 만에 그 비율이 1% 미만으로 떨어졌습니다.

사례 2 - 아이러니한 함정. 전자상거래 센터에서는 "멋져요. 3일 동안 기다렸어요"와 같은 아이러니한 문장을 "긍정적"으로 간주하는 감정 모델을 사용했습니다. 그래서 일부 화난 고객은 "만족"한 것처럼 보였습니다. 모델을 단독 의사결정자로 만들지 않고 사람의 눈으로 샘플링하여 점수를 검증한 경우, 아이러니한 경우를 별도로 표시하여 보고서의 신뢰도를 높였습니다. 교훈: 감정 점수는 절대적인 진실이 아니라 신호입니다.

사례 3 - 조기 경고. 한 통신사의 음성 분석 결과, '빌'을 둘러싼 부정적 감정이 화요일부터 사흘 만에 40%나 증가한 것으로 나타났다. 조사 결과 새로운 관세로의 전환 과정에서 송장이 잘못 반영된 것으로 드러났다. 수천 건의 불만이 쌓이기 전에 초기 감정 신호에 의해 문제가 포착되고 해결되었습니다. 분석은 품질 도구이자 조기 경고 시스템이 되었습니다.

일반적인 실수

  • 감정 점수를 절대적인 진실로 간주합니다. 아이러니, 관용어, 맥락은 모델을 오도합니다. 점수를 신호로 사용하고 사람에게 확인합니다.
  • AI 점수를 최종 결정으로 삼는다. QA에서 최종 평가와 피드백은 사람의 몫입니다. AI가 발전합니다.
  • 모호한 스코어카드 항목. "그가 잘 행동했다"는 것은 측정할 수 없습니다. 객관적이고 검증 가능한 항목을 작성합니다.
  • QA를 처벌 도구로 전환. 목표는 개발과 고객 경험입니다. 처벌 문화는 에이전트를 침묵시키고 데이터를 손상시킵니다.
  • 증거 없는 평가. 각 결과는 연설문의 인용문으로 뒷받침되어야 합니다. 그렇지 않으면 "불분명"이라고 불러야 합니다.
주의: AI를 통한 모든 대화를 측정하는 것은 강력하지만 민감합니다. 이를 직원을 지속적으로 모니터링하고 처벌하는 시스템으로 바꾸는 것은 비윤리적이며 팀의 신뢰를 파괴하는 것입니다. 목표는 고객 경험과 상담원 개발을 개선하는 것입니다. 투명성과 개발 초점이 필수적입니다.

요약하면

감정 분석 및 AI 기반 품질 관리를 통해 콜센터는 수천 건의 대화를 들을 수 있습니다. 즉, 1%가 아닌 100% 샘플을 스캔하고 추세를 조기에 포착하며 품질 평가를 일관되게 유지합니다. 그러나 감정 점수는 절대적인 진실이 아니라 신호입니다. QA에서 최종 결정은 사람의 몫입니다. 스코어카드를 객관적으로 작성하고, 모든 결과를 증거에 귀속시키고, 불확실성을 인간에게 맡기고, 처벌이 아닌 개발 및 경험 개선을 목표로 전체 시스템을 투명하게 구축합니다.

응용과제

6개 항목으로 구성된 객관적인 스코어카드를 디자인합니다(각 항목은 측정 가능하고 입증 가능해야 합니다). 가상/익명 기록을 가져와 "1) 스코어카드 평가" 및 "2) 감정 분석" 템플릿을 적용합니다. 모델이 "모호하다"고 말하는 부분이나 아이러니가 있을 수 있는 부분을 강조하고 인간 전문가가 이를 어떻게 검증해야 하는지 작성하세요. 마지막으로 “4) 코칭 요약”을 포함하여 개발 중심 메모를 작성합니다.

체크리스트

  • [ ] 내 스코어카드 항목은 객관적이고 측정 가능하며 검증 가능합니다.
  • [ ] AI 평가 사전심사; 최종 QA 결정과 피드백은 사람의 몫입니다.
  • [ ] 나는 감정 점수를 절대적인 진실이 아닌 신호로 사용합니다.
  • [ ] 각 결과는 대화에서 인용된 증거로 뒷받침됩니다. 그렇지 않으면 "불분명"합니다.
  • [ ] 처벌이 아닌 발전과 경험 향상을 목적으로 시스템을 구축했습니다.
  • [ ] 분석 목적과 범위를 직원들에게 투명하게 설명하였습니다.