这几年客服渠道的主流叙事一直是”语音在被文字、聊天机器人取代”。最近一份行业分析报告给出了不同的判断:对话式AI正在让语音这个渠道重新变得重要。
一. 语音客服正在被重新盘活
研究机构CurrentAnalysis旗下的GlobalData近期发布的一份报告指出,新一代对话式AI正在消除语音渠道过去的老毛病,让语音重新成为客服场景里有竞争力的选择。跟需要打字、等回复的消息类渠道比,语音能给到”即时满足感”。同时,文章引用了8×8公司CEO Samuel Wilson的一句话:”下一个十亿个语音号码,会分配给AI代理”。
但这份报告没有停留在乐观判断上,它同时点出了几个卡住落地的具体障碍。
排第一位的是延迟:传统的语音处理流程要经过语音转文字这类多个步骤,每一步都在叠加延迟,最后堆出来的是让对话变得生硬的停顿感。除了延迟,报告还提到了另外三个问题:AI幻觉的风险、后端集成时接口文档不清楚导致的对接困难、以及生成式AI本身的算力成本。
二. 语音客服这道题,难在哪
把”延迟”这个问题往下拆一层,会发现语音客服场景里真正难啃的,是几件互相绑在一起的事。
对话要打断得自然
真人打客服电话很少是”你说完我再说”的标准轮次制,经常是说到一半被追问打断,或者说”嗯””啊”这类没有实际内容的语气词。AI要是把这些语气词当成”用户说完了”的信号,会话很快就会显得生硬甚至答非所问。
电话这条链路本身就是老基础设施
客服场景的语音入口大多数还是走传统电话网络,不是新潮的App内语音通话。AI客服要真正落地,得能原生接入SIP/PSTN这类电话网络协议,而不是只能在自家App里跑demo。
多人同时在线的场景要能分清是谁在说话
不少咨询场景不是一个人在打电话,两个人轮流问、或者一个人帮另一个人问的情况很常见,AI要能分清楚当前是谁在说话,而不是把所有麦克风信号混在一起处理。
效果好不好,得有办法量出来
客服这类AI代理上线之后到底做得怎么样,如果没有一套标准化的评测方法,企业很难判断这套系统是不是真的达标,只能靠上线之后用户投诉的多少去反推。
三. 声网的对话式AI引擎怎么接住这几层
打断这一层:优雅打断
声网在对话式AI引擎做了”优雅打断”,能自动识别”嗯””啊”这类没有实际语义的语气词,避免AI把这些词误判成打断信号,也支持按需过滤自定义的文本。这个能力对应的正是”电话客服里语气词特别多,AI不能一听到停顿就抢话”这个问题。
电话网络这一层:原生SIP/PSTN接入
声网的对话式AI引擎支持SIP/PSTN协议原生接入,开发者先用对话式AI Studio把工作流编排出来,正式部署到生产环境时一行代码就能完成拨打电话。这条路径决定了一个客服系统要不要自己从头搭一套电话接入基础设施,还是直接接一个现成的。
多说话人这一层:声纹识别
多人同时在线的问题,声网用的是声纹识别:只需要4到10秒的语音注册,之后对话过程中实时比对,基本没有可感知的延迟,可以区分出同一通电话里不同的说话人。
效果度量这一层:VoiceAgentEval评测基准
声网联合美团、xbench发布了一套叫VoiceAgentEval的评测基准,专门评估AI代理在外呼场景里的表现,覆盖客服、销售、招聘、金融、调研、主动关怀六大业务领域、30个子场景,模拟150种用户画像,建立了15个语音评估指标。这套东西解决的是”AI客服到底做得好不好,能不能量化判断”这个问题,不用只靠上线后的投诉量去反推效果。
四. 结语
AI语音客服打断处理得自然、电话网络能原生接入、多说话人分得清、效果能量化评估,这几层能力叠在一起,才是AI智能客服从”能用”走到”好用”的真正门槛。如果你的产品正好有AI客服、AI外呼这类实时语音交互方面的需求,可以进一步了解声网的对话式AI引擎。