收益:
- 它设计了一个安全的响应流程,对公民问题进行分类,生成响应草案,并在必要时将其委托给人类。
- 它通过覆盖率、准确性、周转率和解决率指标逐个主题地衡量聊天机器人的质量,并发现盲点。
- 它决定哪些公民问题可以自动回答,哪些必须留给人类权威。
公共服务与公民接触最多的点是服务台:电话、售票处、电子邮件、呼叫中心、机构网站和社交媒体。有市民问“房产税如何缴纳?”、“居住证到哪里领取?”、“办理该证件需要什么材料?”他问道。其中许多问题反复出现;答案是显而易见的;但成交量很大,且仅限营业时间。聊天机器人(自动回答书面或语音问题的软件助手)和人工智能支持的响应系统可以满足这种重复性负担,并指导警官执行需要真正专业知识的任务。在本单元中,您将学习如何在公民服务中端到端地使用人工智能——从问题分类到响应生成、多语言、可访问性以及最关键的方面,防止错误信息。
为什么公民问题很难?
公民问题在三个方面是困难的。首先,准确性:文件清单不正确导致公民无法前往机构;期限不正确将导致权利丧失。其次,平等:两个人问同一个问题不能得到不同的答案;而且,每个人都应该理解它,无论教育水平、语言或残疾如何。第三,隐私:公民在提问时经常写下自己的个人信息(“我的TR ID是这个,我的申请怎么样?”),这些数据必须受到保护。
将人工智能定位在这三个约束范围内的关键是:人工智能是一个界面,以适当的语言向公民传达预先批准的准确信息;它本身并不制定立法。实现这一目标的方法是将聊天机器人连接到组织批准的知识库(常见问题解答、监管摘要、服务指南)——这称为 RAG(检索增强生成),其中人工智能从受信任的文档存储库中提取相关内容,并在生成答案之前仅根据它进行响应。
提示:始终在聊天机器人的响应中包含来源:“此信息基于[服务指南/通告号],[官方页面]了解当前状态。”来源不明的答案既无法验证,也会降低公民的信任。
逐步:建立公民响应流程
- 确定范围。聊天机器人将针对哪些问题做出回应(税务、民事登记程序、许可证),以及针对哪些问题它会说“我正在引导您到相关单位”?最好将其委托给人类,而不是对超出范围的问题给出答案。
- 准备批准的知识库。每个答案都必须基于由机构控制的注明日期和来源的文本。负责人应跟踪更新情况。
- 写下语气和语言规则。礼貌、简单、不使用行话、短句。正式但不冷漠的语言。
- 设置个人数据规则。聊天机器人应仅在安全身份验证后提供个性化信息,例如交易状态;提供一般信息时不应要求提供个人数据。
- 定义升级点。投诉、异议、具有法律后果的问题或不清楚的问题应传达给人们。
- 监控和改进。回答错误的问题应每周进行审查并更新知识库。
三个迷你箱子
案例 1——负载减少,警官求助于专业知识。某大都市的呼叫中心每月接到约 48,000 个电话;其中,61% 涉及五个反复出现的主题。基于 RAG 的聊天机器人涵盖了这五个主题;呼叫中心工作人员分为复杂的投诉和申诉;平均等待时间从7分钟减少到2分钟。
案例 2 — 错误信息陷阱。一位不明来源的聊天机器人飞行员重复了旧的金额,称“今年护照费为 1,200 里拉”;而迫击炮已经更新。连续三天,公民带来的金额都是错误的。教训:聊天机器人应该只依赖过时的、最新的和来源的知识库;不应该任由自由生产。
案例 3——无障碍增益。一个组织将聊天机器人的响应简化为 B1(基础中级)语言级别,并使它们适合视障人士的屏幕阅读器。因不懂服务指南而前来售票处的市民比例下降28%;在投诉中,以“我不明白”为主题的反馈下降到三分之一。
四个可复制模板
1) 依赖于源的响应生成:
您的角色:一位有礼貌且直言不讳的公共服务顾问。仅根据我在下面提供的认证信息文本进行回答。如果你被问到文中没有的内容,请说“我引导你到[单位]获取有关此主题的准确信息”,并且不要编造答案。在答案末尾添加来源。批准的信息:[粘贴文本]问题:[公民问题]
2)语言简化:
将下面的官方文本翻译成中学毕业生可以轻松理解的简单土耳其语。解释术语、缩短句子、制定分步列表。含义和法律内容不应改变。将不清楚的区域标记为“需要澄清”。文本:[粘贴官方文本]
3) 多语言回复(附验证说明):
将以下经过批准的土耳其语答案翻译成[目标语言]。正确识别官方术语;将您不确定的术语及其土耳其语版本保留在括号中。添加注释,表明翻译应由专家检查。答案:[文字]
4)升级分类器:
对以下公民消息进行分类:(A) 一般查询 -> 适当的自动回复,(B) 个性化交易状态 -> 需要身份验证,(C) 投诉/上诉/法律结果 -> 移交给人工。仅给出一个字母和一句话的理由。如果不确定,最安全的选择 (C)。消息:[文本]
弱提示/强提示
弱项:“向公民通报财产税。”
Strong:“你的角色是一个有礼貌的公共顾问。仅根据下面经过批准的信息文本进行回答;文本中没有的内容进行弥补,必要时请咨询相关部门。简单、简明、逐步地写下答案。不要要求提供个人数据。在末尾添加来源和注释“检查官方页面以了解当前金额”。批准的信息:[文本]。问题:[问题]。”
区别:强烈的提示将响应限制在经批准的来源,防止捏造,定义基调和机密性;结果是可以直接向公民展示的质量。
自动响应还是交给人工?
状态
正确的方法
为什么
文件清单、工作时间、一般流程
自动响应(RAG)
信息已确定并获得批准
“我的申请怎么样?”
认证+系统查询
个人资料
投诉、异议、申诉
移交给人类
需要欣赏和同理心
具有法律后果的问题
移交给人类
责任和理由
超出范围/不确定
移交给人类
避免造假风险
衡量聊天机器人的质量:数字,而不是直觉
公民聊天机器人不是通过说“它看起来工作正常”来管理的;被测量。通过四个指标跟踪聊天机器人在公共服务中的表现。覆盖率(聊天机器人在未将问题交给人类的情况下正确回答的问题的百分比);准确率(给出的答案符合立法和现行实践,并采用手动样本控制);周转率(问题转移给人类——如果太低,聊天机器人可能会对错误的话题充满信心);满意度/解决率(在第一次接触时解决公民的问题)。在每周仪表板上跟踪这些指标可以让聊天机器人在哪里产生幻觉以及哪些主题需要委托给人类。
迷你案例——发现盲点。某省局聊天机器人整体覆盖率高达78%;然而,对于“残疾公民权利”这个小标题,准确率仅为 41%,因为该模型是根据未更新的规定得出答案的。如果没有基于主题的测量,这个盲点将隐藏在平均值中。该团队暂时关闭了该线程,以“始终委托给人类”规则,并在内容更新后重新打开它。
用于按样本检查响应质量的每周模板:
任务:以下是聊天机器人上周给出的 20 个答案和公民问题。评估每个答案:1) 是否符合法律规定? (是/否/可疑 - 指定项目/来源)2)是否有任何遗漏或误导性信息?3)是否应该委托给人类?输出:表(问题编号|适用性|风险说明|建议)。列出那些对高层的适用性有疑问的人。注意:这是审计草案;最终决定权属于检查人员。
提示:聊天机器人能够说“我不知道,我要把你转给官员”并不是弱点,而是质量保证。在公开场合,自信的错误答案比诚实的接管要付出更大的代价。
常见错误
- 将聊天机器人释放到免费生产中。未连接到经批准的知识库的机器人将提供过时或伪造的信息。
- 不引用消息来源。公民无法核实,公务员无法检查;虫子悄无声息地传播。
- 未经身份验证处理个人数据。回答“我的申请状态如何?”的问题没有安全验证是 KVKK 风险。
- 没有定义临界点。将投诉和反对意见留给机器人会增加受害程度。
- 不简化语言。不理解的准确信息对于公民来说是无效的;可访问性是必须的。
- 没有建立反馈循环。如果回答错误的问题得不到监控和纠正,同样的错误将会重复出现。
总之
在公民服务中,人工智能可以快速、简单、24/7 地响应重复性问题,指导官员从事需要真正专业知识的工作。秘密在于三件事:将答案链接到批准的知识库(RAG),为每个答案添加来源,以及将投诉/反对/个人行动问题委托给人类。设计合理的聊天机器人可以减少负载;来源不明、不受控制的机器人会迅速传播虚假信息。
应用任务
写下您单位中 5 个最常见的公民问题及其认可的答案。使用“基于资源的答案生成”模板生成这五个问题的聊天机器人答案。然后,使用“委托分类器”模板,标记哪些问题应委托给人工。简化至少一个 B1 级答案。
清单
- [ ] 聊天机器人仅依赖于经过批准的、过时的、来源的知识库。
- [ ] 每个答案都引用来源。
- [ ] 未经安全验证,不会处理个人数据。
- [ ] 转交给负责投诉/异议/法律问题的人员。
- [ ] 语言简单易懂(考虑到残疾和语言多样性)。
- [ ] 错误答案有每周反馈和更新周期。