打断做得好不好,是语音助手「像不像人」的分水岭,也是最难调的一环。 它不是「检测到声音就停止播放」那么简单:调得太敏感,键盘声、咳嗽、一句「嗯」都能把智能体打断;调得太迟钝,用户已经开口了它还在自顾自…
打断做得好不好,是语音助手「像不像人」的分水岭,也是最难调的一环。 它不是「检测到声音就停止播放」那么简单:调得太敏感,键盘声、咳嗽、一句「嗯」都能把智能体打断;调得太迟钝,用户已经开口了它还在自顾自…
「记住,周五下班前要发布教程」——用户说完这句,助手会答应得很好,然后在会话结束的那一刻忘得一干二净。 要让它真记住,得把几件事串起来:模型能调用你的业务函数,函数结果能落库,下次会话还能取回来。缺一…
2026 世界人工智能大会(WAIC) 圆满落幕,作为杨浦区人工智能重点企业代表,声网携对话式 AI 引擎、对话式 AI 开发套件、实时转录翻译等多款 AI 产品亮相本次大会 H2 – D…
用户问「我的订单到哪了」,模型只能猜——它不知道你库里有什么。而模型猜出来的物流状态,比不回答更糟。 MCP(Model Context Protocol)解决的就是这件事:用一套统一协议让模型去发现…
语音助手一旦要回答公司产品、客户订单、内部流程这类问题,就不能再指望大模型的参数记忆了——它不知道你们的东西,而且会一本正经地编。 解法是在自定义 LLM 网关里加一层 RAG:取出用户当前的问题,检…
自定义 LLM 的价值不只是「换个模型」。真正的好处是,鉴权、审计、提示词、限流、降级、业务逻辑这些东西可以全部收进你自己的网关,而不是散落在各处。 要搭的东西不复杂:一个 /chat/complet…
一个 Next.js 应用就能把浏览器端该做的事全做完:发临时 Token、启停智能体、发布麦克风、播放智能体音频、展示智能体状态和实时字幕。服务端这条链路是 凤鸣 ASR → DeepSeek V4…
这篇教程带你用 Python 搭一个真正能对话的语音智能体。浏览器负责采集麦克风、加入 RTC/RTM 频道;FastAPI 负责发临时 Token、创建和停止智能体;剩下的交给声网云端——凤鸣做语音…
去年这个时候,打开一个AI陪聊App,主流界面还是聊天框。 用户输入一句话,等模型吐字,读完回复,再打下一句。角色设定可以很细,头像可以很漂亮,回复也能做到秒回。刚开始玩,确实容易上头。可聊久了,总会…
Voice Agent 的体验问题,常被一句“反应慢”带过。实际排查时,这句话没有太多工程价值。慢在哪里?是用户说完后 STT 还没给出最终文本,还是 LLM 首字迟迟不来?是 TTS 首帧音频太慢,…
本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。