在线咨询
专属客服在线解答,提供专业解决方案
工单支持
专业技术支持团队,随时响应服务需求

英雄联盟全队语音上线,游戏语音的技术门槛到底在哪

《英雄联盟》运营了将近17年,团队公布10月份即将上线“全队玩家语音聊天”功能。这件事拖了这么久,背后牵出的是游戏语音要解决的一整套技术问题,延迟、弱网、降噪、审核。这篇想借着这条新闻,把游戏语音的技术门槛说清楚。


一.英雄联盟之前的语音限制

Riot Games成立于2006年,《英雄联盟》2009年10月27日上线,这款游戏到现在运营了快17年,玩家规模庞大,2024年全球总决赛(Worlds)决赛峰值同时观看人数694万,2025年是670万,比当年关注度第二高的赛事系列高出72%。

这款游戏运营了这么多年,语音聊天却一直是个半成品功能。Riot官方在今年9月8日的开发者更新里说得很直接:”除了现有的、只能让你和预组队的队友语音的系统之外,我们现在要把语音功能扩展到可以和你队伍里的所有人聊天。”翻译一下就是:之前只有跟好友一起排队进入的那批人之间能语音,如果队伍里有随机匹配来的陌生人,这几个人之间是没法语音的。


二. 游戏组队语音是什么,怎么实现的,会有什么技术挑战

游戏里的组队语音,基本流程是这样的:每个玩家说话的声音先被麦克风采集,编码成数据包,通过网络传给服务器(或者直接传给队友,取决于架构),服务器把多个人的语音流混合或者分别转发,到达每个人的设备上再解码播放出来。听起来简单,但电竞场景对这条链路的要求比普通语聊房高得多,至少有这几个难点。

延迟:团战等不起

团战是秒级甚至毫秒级的事,一句”闪现在这”喊出去,语音传到队友耳朵里要是慢了两三百毫秒,配合可能已经来不及了。延迟要求比聊天软件严格得多。

弱网抗丢包

电竞玩家的网络环境千差万别,有人用光纤,有人用不稳定的宽带甚至热点。丢包率一高,语音就容易变成机械音或者直接断断续续,这种时候最影响团战沟通。

降噪和回声消除

机械键盘的敲击声、风扇声、麦克风本身的环境噪音,都会混进语音里;多人同时说话时还要解决回声和抢话的问题。这块听起来是细节,实际上直接决定语音聊天能不能用,太吵的话队友宁愿关麦。

规模和并发

《英雄联盟》全球同时在进行的对局数量巨大,每一局都要给五人队伍临时开一条语音通道,比赛结束立刻关掉,这种高频次的创建和销毁,加上要覆盖全球不同地区的玩家,对底层基础设施的弹性要求很高。

审核和毒性管理

这是Riot自己点出来的那个卡了17年的关键原因。语音聊天的毒性问题比文字聊天更难处理:文字可以关键词过滤,语音没法简单这么做,得先识别内容再判断。第三方调研机构Speechly在2023年的一份报告里给出过具体数字:接近70%的美国玩家用过语音聊天,其中49%遭遇过毒性行为,如果只看用语音聊天的玩家,这个比例升到72%,报告明确说语音聊天是游戏内毒性最严重的渠道,比文字聊天和游戏内行为都更突出,而且只有大约三分之一的受害者会去举报。这也解释了为什么Riot这次给语音功能设了荣誉等级门槛。


三. 怎么解决这些技术挑战

对着上面五个问题一条一条看,声网在游戏语音这块做的事情,正好覆盖了每一层。

延迟和弱网抗丢包

声网的游戏语音方案,在80%丢包率下仍能保持对话流畅,断网三到五秒也能恢复响应,不需要重新建立连接。这个指标背后不是一个单一技术,是几层机制叠在一起。发送端和接收端会持续监测带宽、延迟、抖动和丢包率这几个数据的实时变化,网络一变差,码率、分辨率这些参数会跟着动态调整。丢包这块用的是两种互补的机制:一种是ARQ重传,接收端发现关键包没到就向发送端请求重传,代价是要等一次来回的延迟;另一种是FEC前向纠错,发送端在发原始包的同时顺带发一些冗余的纠错包,哪个包丢了直接靠剩下的包推算出来,不用等重传,延迟极低。

路径这一层,声网用的是SD-RTN这张软件定义实时网:调度系统持续采集各节点间的链路质量、带宽和负载数据,动态算出一条延迟最低、最稳定的传输路径,而不是固定走一条线路。

降噪和回声消除

声网AI降噪引擎的端到端处理延迟低于40毫秒,移动端CPU占用不超过10%,能识别100多种突发噪声类型,专门针对键盘敲击声、风噪、家庭背景杂音、多人抢话这几种游戏语音里最常见的干扰场景做过模型训练。通过DNN-based Masking,让深度神经网络给语音和噪声分别打上”掩蔽”标签,同时看时域的原始波形和频域的频谱图两种信息,而不是只靠一种视角去判断哪部分是人声、哪部分是噪声。

训练数据是数千万条真实游戏场景里采集的语音,不是录音棚里的干净素材,这也是为什么模型能准确识别键盘敲击、风噪这类游戏场景特有的干扰声。多人同时说话、抢话的场景里,模型还有一个”主发言人优先建模”的机制,会优先保证当前正在说话那个人的声音清晰,而不是把所有麦克风信号一视同仁地处理。

规模和并发

声网的游戏方案覆盖30多个平台开发框架、3万多款移动终端,覆盖全球200多个国家和地区、平均延迟400毫秒、可用性99.99%。这组数字说的是基础设施本身的覆盖面,对应的是”每局比赛都要临时开一条语音通道、覆盖全球玩家”这个规模问题,具体怎么撑住这种高频次的频道创建和销毁,还要看底层架构。

声网把”频道”这层逻辑单独拆出来管理,用专门的模块记录每个频道里有哪些人、分别是什么角色、彼此之间有没有互动关系,每局比赛开一个新频道,互相之间是隔离的,不会串。玩家接入的时候,调度模块会就近找一个物理距离更近的服务器入口,把全球涌入的连接请求分散到不同节点上,避免所有人都挤在同一个点排队。后台还有一套监控机制,持续探测各节点的健康状况,一旦某个节点出问题就会被自动下线,新接入的对局不会被分配到这个有问题的节点上。

审核和毒性管理

声网在这一层提供的是让审核真正能落地的底层能力。声网有专门的音视频内容审核解决方案,把”游戏语音开黑”列为核心应用场景之一,对应的正是”言语辱骂、不当言论、商业引流”这类违规语音的治理需求。

真正能说明前面这几层能力在游戏语音场景里怎么落地的,是声网和Oopz的合作案例。Oopz是PC端游戏语音赛道排进前三的平台。

这次合作解决的是一个听起来矛盾、实际很常见的问题:降噪不彻底和过度降噪。降噪力度不够,键盘声、风扇声漏进语音里,体验差;降噪力度太强,又容易把人声本身的细节一起抹掉,声音发闷发假,用户反而觉得更难受。这个平衡点很难靠纯算法在办公室里调出来,因为真实世界的噪声场景太杂。

声网为此专门搭了一个负本底噪声声学实验室,里面有全消声室和混响室,用来在接近真实环境的声学条件下采集噪声样本、反复训练和校验降噪模型,而不是只用录音棚里的干净样本去训练。这套合作后续还计划往主播端场景延伸,说明同一套底层能力,从普通玩家开黑延伸到直播场景是可以复用的。


四. 写在最后

一个运营了17年的头部游戏,全队语音聊天这么基础的功能都要打磨这么久才敢上线,背后是延迟、弱网、降噪、审核这几层工程缺一不可。这也是游戏语音这件事的真实门槛:表面是一个开关,底下是一整套基础设施。如果你的产品有游戏语音、游戏社交或者游戏直播方面的需求,可以进一步了解声网的游戏解决方案

在声网,连接无限可能

想进一步了解「对话式 AI 与 实时互动」?欢迎注册,开启探索之旅。

本博客为技术交流与平台行业信息分享平台,内容仅供交流参考,文章内容不代表本公司立场和观点,亦不构成任何出版或销售行为。