在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

美团”智播”月GTV涨82%背后:数字人直播的”秒回”是怎么做到的

美团技术团队近期披露了一组数字:”智播”数字人直播系统上线后,月度GTV同比增长82%,开播场次提升了11倍。

数字人直播不是新鲜事,早几年的数字人主播,本质上是”预录播放+关键词触发”,观众问什么,主播播什么现成的话术。真正让”智播”这类系统跑出增长曲线的,是它做到了全双工实时语音问答:观众开口提问,数字人当场理解、当场生成回答、当场开口说话,整条链路走的是”语义理解→回答生成→动作合成→画面渲染”的实时闭环。

这条链路听起来只是”AI+数字人”的组合,但真正做过实时音视频的人都知道,把它在生产环境里跑稳、跑便宜、跑到能承受直播间几千人同时在线提问,中间有一串很具体的工程难题。这篇文章想把这些难题拆开讲清楚,并说明声网对话式AI引擎(Conversational AI Engine)已经把其中大部分做成了现成能力。

数字人直播


一. 数字人直播的链路,难在哪四个环节

把”智播”这类系统的技术链路拆开看,其实是四段接力:听得清 → 答得对/答得快 → 说得自然 → 画面对得上嘴型。链路本身不复杂,难的是每一棒都要在”直播”这个特殊场景下达标:

1. 直播间是最吵的地方,却要求”听得清”

直播背景音乐、连麦嘉宾声音、观众弹幕转语音提问时的环境噪声——数字人要在这种环境里准确抓住”到底谁在向我提问”,普通的语音识别在嘈杂环境下极易误判或漏判。

2. 观众会打断,AI要”知趣”

真人主播被弹幕刷屏时会自然调整话题;数字人如果不能识别”用户正在插话”,就会自顾自把上一句答完,显得又笨又慢。但打断检测如果太灵敏,又会把语气词、笑声、背景杂音都误判成”打断”,导致主播说话变得支离破碎。

3. 观众在全国甚至全球,网络状况参差不齐

直播间用户可能在地铁、在偏远地区、在跨境网络环境下观看,音视频链路一旦对网络抖动、丢包敏感,轻则卡顿掉字,重则数字人”失语”。

4. 从”听到”到”张嘴回答”,观众的耐心只有几百毫秒

真人对话中,超过1秒的停顿就会让人觉得”这人是不是没听懂”。数字人直播如果响应延迟做不到接近人类对话的节奏,”实时互动”这个卖点就名不副实,观众只会觉得是个反应迟钝的机器人。

这四个问题,恰好对应声网对话式AI引擎的四项核心能力。


二. 声网对话式AI引擎怎么接住这四个问题

声网对话式AI引擎的"选择性注意力锁定"实践

声网对话式AI引擎是一套面向实时语音/多模态交互场景的基础设施,核心定位就是把”实时音视频传输”和”对话式AI”这两件原本分离的技术拼接成一条稳定的产线,开发者只需要把自己的大模型、TTS、数字人渲染服务接进来即可。针对上面四个问题,它给出的方案分别是:

对应”听得清”——对话人声锁定

声网自研的选择性注意力算法(selective attention)能让系统锁定主要说话人,屏蔽背景噪声和干扰声,实测在商场、地铁站、咖啡店等嘈杂环境下仍能实现约95%的纯净对话识别率。对直播间这种背景音乐+多人声混杂的场景,这一层降噪能力是数字人能”听清提问”的前提。

对应”知趣地打断”——自研AI VAD

不同于通用语音活动检测(VAD),声网自研的AI VAD针对人类真实对话的停顿、语气、节奏做了专门适配。这意味着数字人主播既能在观众真正提问时及时让路,也不会被一声”哈哈”或杂音打断话头——这恰恰是真人主播的自然反应,也是当前多数数字人方案容易翻车的地方。

对应”全球网络参差不齐”——弱网抗性

依托声网自身的全球实时网络与智能路由,系统在高达80%丢包率的极端网络环境下仍能保持交互稳定,支持跨区域的丝滑互动。对于想把数字人直播间做到海外、做到下沉市场的团队,这一层是能不能”播得动”的基础保障。

对应”几百毫秒内张嘴回答”——超低延迟

声网实测数据是端到端响应中位数约650毫秒,这个数字级别的延迟,是数字人对话能被观众感知为”实时交流”而非”机器人问答”的分水岭。


三. 更关键的一点:数字人渲染不用自己从零接

美团”智播”链路里”动作合成→画面渲染”这一段,往往是团队自研成本最高的部分。声网对话式AI引擎目前已支持接入 Akool(Beta)、HeyGen(Alpha/Beta)等数字人渲染服务,让AI Agent”有一张会跟嘴型对话的脸”,也就是说,语音理解、大模型对话、语音合成、数字人驱动这条完整链路,开发者不需要每一环都自己造轮子,声网负责把实时音视频链路和各环节服务打通、并保证端到端的低延迟与稳定性,团队可以把精力集中在话术、人设和大模型效果调优上。

在模型选择上,引擎对大模型层保持开放,官方已支持大模型包括 OpenAI(含 Realtime API)、Azure OpenAI、Google Gemini/Vertex AI、Anthropic Claude 以及 Dify 和自定义模型;语音识别可选择声网自研的 ARES、Azure 或 Deepgram;语音合成可选择 Azure、Cartesia、OpenAI、Hume AI 等。对于本身已经在用某个大模型或TTS服务的团队,这种”零改造接入”的兼容性意味着不需要为了上线实时对话能力而推翻现有技术选型。


四. 不止是直播:同一套底座能接住的场景

美团的电商直播只是”实时音视频+对话式AI”这条组合拳的一个应用切面。同一套能力,官方场景清单里还包括24小时智能客服、IoT设备语音交互、虚拟购物助手、AI教学辅导、心理陪伴、游戏NPC等——但凡是”用户说话、AI要在几百毫秒内自然应答、且不能因为网络或环境噪声掉链子”的场景,本质上都在解决和数字人直播同一组工程问题:听得清、答得快、打断得自然、网络扛得住。


五. 写在最后

美团”智播”的82%增长曲线,说到底不是”数字人”这个形态带来的,而是”数字人第一次能像真人一样实时接住观众的提问”这件事带来的。这背后是语音识别、大模型推理、语音合成、数字人渲染四个独立技术栈,被一条稳定的实时链路拼接成了一个整体体验。

对于正在评估是否要做数字人直播、AI客服或语音陪伴类产品的团队,与其从底层音视频传输开始重新踩坑,不如先看看现成的对话式AI引擎能覆盖到哪一步,把”听得清、答得快、打断自然、扛得住弱网”这几件苦活外包出去,团队才有余力把心思花在真正决定用户体验上限的地方:话术设计和人设打磨。

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。