AI 客服死在第二步:从试点到规模化的五阶段路线图
先说一个残酷但普遍的现象:AI 客服项目很少死在试点阶段,绝大多数死在第二步。
试点会成功,是因为它被精心照顾过——场景是挑过的,数据是清洗过的,有一两个人天天盯着调prompt,还有厂商的实施顾问全程在场。等到推广到第二个、第三个业务线,这些条件一起消失,效果随之塌方。
所以真正要设计的不是"怎么赢下试点",而是"试点之后怎么走"。
一、试点为什么会骗我们
试点结果不可信,不是因为有人作弊,而是三个结构性原因:
- 场景被挑过了。选的一定是最高频、最简单、答案最标准的那一类,天然远离真实世界的长尾。
- 数据是临时洗过的。为了跑通 demo 整理过一遍知识库,而上线后的知识库是持续腐化的。
- 有人在兜底。试点期间一线的班组长会主动补位,这些人工兜底不会出现在任何一张效果报表里。
识别方法很简单:把试点期间的人工干预次数也统计进去。如果"AI 处理了 1000 通"背后有 200 次人工补位,那它不是 100% 自助,是 80%。
二、选场景:三条标准 + 一条否决线
三条标准(缺一不可)
| 标准 | 含义 | 判断方法 |
|---|---|---|
| 有量 | 收益与调用频次直接相关 | 看日/周均量,低于日均 20 次的不值得单独立项 |
| 边界清晰 | 能一句话说清"办完了"的定义 | 说不出终态的场景,模型也学不会 |
| 失败可降级 | 错了能立刻转人工且带上上下文 | 无法降级的场景,一旦答错就是事故 |
一条否决线:涉及资金变动、身份核验、投诉升级,且出错后不可逆的场景,先不要上自助。这不是保守,是 ROI 最差的一类投入——省下的人力成本远低于事后赔付与口碑损失。
一个常被忽略的顺序建议:先做客户最容易失败的地方,而不是我们最想自动化的地方。 海外 ContactBabel 的研究里有个很有说服力的数据点——约 19% 的呼入客户,是先尝试过网页自助、失败之后才拨电话的(业内称为"失效需求")。这批需求是最容易转化的自助场景,因为客户已经用行为投过票了:他愿意自助,只是当时的自助没帮上忙。
三、五阶段路线图
阶段 0:数据地基(1–2 个月,最容易被跳过)
- 盘清知识库的真实状态:多少文档超过一年没更新,多少是 PDF/Word 而非结构化条目;
- 统一工单标签与意图清单,这是一切评测的前提;
- 把历史会话按问题类型分一遍,得到真实流量分布图。
这个阶段没有任何 AI 产出物,所以最容易被砍。但跳过它的代价会在阶段 3 一次性连本带利偿还。
阶段 1:后台型能力(先不面对客户)
推荐最先上线的三类:通话/会话摘要、工单自动填单、质检红线项全量初筛。
共同特征是不直接服务客户,出错代价可控,却立刻帮座席省掉最讨厌的那部分工作。这一步的目的是:让一线先相信 AI 有用,为后续推广积累信任资本。
阶段 2:座席辅助(人机同前台)
知识推荐、实时话术提示、下一步操作建议。
关键设计是提示必须可采纳也可忽略——一旦变成强制路径,座席就会想办法绕开。并且在这一阶段就明确:辅助产生的过程数据不进个人绩效(详见我们此前那篇质检改造文章)。
阶段 3:窄口径自助(第一次真正面对客户)
一次只上一个场景。推荐从这类开始:查订单状态、改收货地址、重置密码、开票进度查询。
判断"窄"的标准是:该场景的客户说法不超过 20 种主要变体,且后台只需打通一个系统。
别小看这一个场景。以日均 800 通呼入、目标场景占 15% 计算,若遏制率能达到六成,一年减少的人工交互量在数万通量级——通常足以覆盖下一阶段的投入。这就是"用第一阶段赚来的钱做第二阶段"的机制。
阶段 4:规模化与治理(从此常态化)
到这里,工作重心要从"再做更多场景"转向"保住已有场景的效果":
- 建立评测集与季度回归(方法见我们的《意图识别准确率》一文);
- 给每个上线场景设明确的 Owner,没有 Owner 的场景三个月必坏;
- 建立知识库变更触发重测的机制——文档更新了,评测必须跟着跑。
四、三个必须提前设好的止损信号
项目最怕的是"效果已经变差了,但报表上看不出来"。这三个信号要在一开始就写进运营周报:
- 遏制率上升,但 CSAT 下降 ——机器不是在解决问题,是在把客户拦在外面。
- 同一问题 7 日内重复来电率上升 ——说明自助给了答案但没办成事。
- 平均轮次持续上升 ——这是最早期的恶化信号,往往比投诉率早出现一到两个月。
任何一个信号连续两周触发,暂停新增场景,回头做诊断。规模化阶段最常见的问题不是跑得不够快,是没有刹车的车不敢开快。
五、国内落地的五点注意
- 企微/钉钉侧的会话常常接不回联络中心系统。客户在企微里问了半天最后打电话过来,联络中心完全看不到这段上下文。这块的价值往往比优化机器人还大。
- 把自助入口放到客户真正的需求动线上。很多企业的自助藏在 App 三级页面,客户压根没找到过,却在报表里被记为"自助无人使用"。
- 知识库多为非结构化文档。让大模型直接读一堆过时的 Word 只会得到自信而错误的答案;先做文档治理,再做检索增强。
- 预算按用量计费时要盯峰值。AI 成本随调用量线性增长,而大促期间的调用量可能暴涨。建议同时设定总量与峰值并发两道闸。
- 给一线留反馈通道。让座席能一键标记"这条 AI 答错了",这是最便宜、最持续的训练数据来源。
六、落地清单
- 统计试点期间的人工补位次数,折算真实自助率。
- 用"有量 / 边界清晰 / 可降级"三条筛一遍候选场景,剩下的用否决线再砍一刀。
- 先做阶段 0 的数据地基,再谈模型选型。
- 从后台型能力切入,让一线先尝到好处。
- 第一个自助场景只做一个,做透再扩。
- 上线前就把三个止损信号接进周报。
本文为原创内容。文中路线图为方法层面建议,示例数值仅用于说明量级,不构成行业基准。