质检做了三年,座席还是老样子:从"扣分"到"辅导"的机制改造
先说一个让人不舒服的调研数字:接近四分之三的客服座席对自己的质检项目只是"忍受",谈不上认同。
这个数字来自一份百余人规模的行业投票。它解释了一个普遍现象:很多中心的质检做了三年,评分表越来越细、扣分越来越严,但服务质量曲线是一条直线——没变差,也没变好。
问题不在执行力度,在机制本身。
一、扣分式质检的三个死穴
死穴一:样本量根本撑不起"评价"这个动作
多数中心每月只监听每位座席 6 通左右的通话。而这位座席一个月可能处理几百通。
用 6 通去代表几百通,统计学上不成立。座席心里也清楚这一点,所以当他因为某一通被扣分时,第一反应不是"我要改",而是"你们就听了 6 通,凭什么"。
这不是态度问题,是方法问题。样本量决定了扣分式质检从一开始就缺乏说服力。
死穴二:评分卡在衡量"有没有说对台词",不在衡量"服务好不好"
常见评分项长这样:是否报工号、是否称呼客户姓名三次、是否使用了规定的结束语。
这些项容易打分、容易统计,也容易让座席学会"演"——台词全说了,问题没解决,客户照样不满意。评分卡分数和 CSAT 脱钩,是很多中心质检失效的根因。
死穴三:标准不一致,争议永远在
同一个行为,A 质检员扣分、B 质检员不扣。座席之间一交流,就变成"凭什么 Jon 那次没被扣分"。
没有校准机制,评分就不是标准,只是个人偏好。而一旦座席认定评分不公平,后续所有辅导都会被当成"找茬"。
二、改造的起点:把 QA 重新定位成"审计",而不是"打分"
化解样本量质疑的关键,是换一个问题。
扣分式质检问的是:"这位座席这个月表现好不好?"——6 通样本回答不了。
辅导式质检问的是:"我们从这些样本里,能发现哪些改进点?"——6 通样本完全够用。
这不是话术游戏,是用途的根本改变:从"给个人下结论"变成"为团队找问题"。一旦定位成审计和发现,座席的防御心理会明显下降,因为他不再是被打分的对象。
这个定位必须从入职第一天就讲清楚,并贯穿到每一次一对一。中途改口径,座席不会信。
三、六个落地动作
动作 1:评分卡拆成"红线项"和"导向项"双轨
| 红线项(合规) | 导向项(行为) | |
|---|---|---|
| 性质 | 一票否决,不设权重 | 用于辅导,不直接挂钩绩效 |
| 内容 | 禁语、隐私泄露、违规承诺、风控话术 | 需求澄清是否有效、信息是否完整、ownership 表现 |
| 评价方式 | 是/否 | 分级描述 + 具体事例 |
| 谁看 | 合规与质检 | 班组长与座席本人 |
关键:红线项保留"扣分"逻辑(合规没有商量余地),导向项不进个人绩效,只进辅导记录。这样才能让座席愿意把真实短板暴露出来。
动作 2:座席自评 + 质检同评,然后比对
流程是:座席先听自己的录音并打分 → 质检对同一通独立打分 → 双方坐下来比对差异。
这个动作有三重收益:座席理解了评分逻辑;质检看到了座席的自我认知偏差;讨论本身就是最好的辅导。
注意防作弊:确实有人会一律给自己打满分。所以自评必须和质检评分同一通、同时做,且差异要被讨论,不能只交表。
动作 3:只标注"关键时刻",不要求听全程
让座席听完整通录音再打分,时间成本太高,这也是监听量上不去的现实原因。
改成:质检在录音里打时间戳,标出影响最大的几个片段(正面负面都要标),座席只听这几段。
附加收益是能沉淀出一个"关键时刻库"——好的片段和差的片段都可以复用为新员工培训素材,一次投入多次使用。
动作 4:固定校准会,统一"什么叫好"
每月或每季度,让所有质检员和班组长评同一批录音,然后公开讨论分歧。
校准会真正的价值不在于"统一分数",而在于让"好"的标准被说出来。很多时候质检员自己也说不清为什么扣分,校准会逼着大家把隐性标准显性化。
动作 5:用 VoC 决定"测什么",而不是拍脑袋
评分卡上的项目应该来自客户真实的不满:CSAT 低分录音、投诉工单、重复来电、质检发现的差评片段。
而不是"上个月觉得开场白不够好,这个月加一项开场白评分"。
一个实用做法:每季度做一次"差评录音归因",把客户明确表达不满的通话归类,出现频次最高的三类直接进下季度评分卡。
动作 6:把质检结果接回培训
这是最容易断的一环。质检发现了问题 → 记在表里 → 然后没有然后。
最低要求是建立"问题类型 → 培训资源"的映射表:
| 高频问题类型 | 对应动作 |
|---|---|
| 需求澄清不到位 | 场景化话术演练(班会 15 分钟) |
| 产品知识错误 | 知识库条目修订 + 专项测验 |
| 情绪应对失当 | 一对一角色扮演 |
| 流程执行跳步 | 系统侧加硬约束(不给跳过) |
注意最后一类:如果某个问题反复出现,先怀疑流程和系统,不要只怪人。 能靠产品设计解决的,不要靠培训解决。
四、国内落地的三个现实约束
- 录音存储成本直接限制监听量。 很多中心因为存储费用只保留 3–6 个月录音,历史案例库建不起来。建议对"关键时刻片段"单独留存(只存片段不存全程),成本低两个数量级。
- 在线会话的质检覆盖率极低。 语音至少有录音,企微和网页会话往往只存文字,且座席同时聊 5 个窗口,人工根本看不过来。这块建议优先上自动化方案。
- ASR + 大模型可以做全量初筛。 这是国内目前落地最快的一条路径:机器对 100% 通话做转写和风险项初筛,人工只复核被标记的疑似问题。它直接解决了"样本量不足"这个死穴——覆盖率从几个百分点提到 100%,人工工作量反而下降。但前提是:大模型只能做红线项的初筛(禁语、违规承诺、投诉信号),导向项仍然要人工判断。让模型给"服务态度"打分,是把偏见自动化。
五、怎么判断改造成效
不要看质检分数——分数一定会涨,因为标准变松了。看这四个:
- 座席主动申请听自己录音的比例(认同度的直接体现)
- 同一问题类型的重复出现率(辅导是否真的生效)
- CSAT 与评分卡的相关系数(评分卡是否终于在衡量客户在意的事)
- 三个月后新员工的上手速度(关键时刻库是否在发挥作用)
本文为原创内容。文中调研数字引自公开行业投票,样本规模有限,仅作趋势参考。