AI客服大模型怎么选:五项评测指标与实测方法
“GPT 和通义谁家客服机器人更聪明?”——这是最没用的问题。通用榜单的高分,不代表在你的客服场景能打。客服场景的模型选型,要用自己的数据和自己的指标来测。
指标一:意图识别准确率
从历史对话里抽 200 条真实用户提问,覆盖售前、售后、投诉、闲聊四类,测模型能否正确分类。客服场景的目标是≥ 90%,尤其要盯“退款”“换货”“催单”这类容易混淆的相近意图。
指标二:拒答能力(这是客服专属指标)
通用模型喜欢“努力回答”,但客服机器人对没有依据的问题必须敢说不知道。准备 30 条知识库里不存在的问题(虚构的产品参数、不存在的政策),测模型会不会编造答案。拒答率越高的模型,越适合客服。
指标三:知识库检索融合质量
同一个问题搭配不同知识库片段喂给模型,看它是否忠实引用给定材料、会不会被无关片段带偏。这项指标直接决定 RAG 架构下幻觉的多少,比模型参数量重要得多。
指标四:响应速度与并发成本
- 首响延迟:目标 P95 ≤ 3 秒,超时用户流失率明显上升
- 单次对话成本:按平均 8 轮对话 × 每轮 token 数估算月成本
- 并发表现:大促期间 10 倍流量下延迟是否可控
指标五:中文口语与错别字鲁棒性
真实用户会打错字、发拼音、用网络梗(“这个锅锅洗了会掉漆不”)。把历史对话里的“脏数据”原样喂给模型,看理解是否稳定。用干净测试集测出来的指标会严重高估线上表现。
一套低成本实测流程
- 第一步:标注 200~300 条历史对话作为测试集(一天工作量)
- 第二步:2~3 个候选模型跑同一套脚本对比
- 第三步:人工盲评 50 条回复,区分不出模型名次就选便宜的
记住:客服场景选模型,测出来第一的不一定适合你,适合你的是意图识别稳、敢拒答、成本低的那一个。