IIT RTC Conference是伊利诺伊理工大学主办、IEEE参与的实时通信年度会议,办了很多年,往年议程基本是编解码、NAT穿透、移动网络这类偏底层的RTC工程话题。
今年(2026年9月22-23日)的会议官方设了6个分论坛:Research Track、WebRTC & Real-Time Applications、Programmable Real-Time Networks and Applications、Next Generation Emergency Communications Services(NG911)、AI in RTC,还有IEEE通信质量与可靠性研讨会。光看这个分论坛名单就能看出变化:AI in RTC被设成了独立分论坛,跟WebRTC本身是并列关系。
一. AI in RTC:覆盖了语音AI几乎所有的工程难题
这个分论坛官方涵盖的内容包括大模型和生成式AI语音、语音识别与合成、边缘AI部署、声纹识别、负责任AI实践,特别点出了延迟、隐私、互操作性这几个在生产环境里绕不开的约束。今年这个分论坛下面几场具体演讲,正好把这几层难题摆得很实在。
规模:并发上来后,转发路径会先扛不住
Hector Zelaya提出的判断是”媒体并不总是点对点传输”。传统实时通信里,两个用户通话经常能直连,TURN服务器只是兜底方案;但语音AI架构里,用户说的话几乎总要先经过服务端的AI Agent处理——识别、推理、合成完了再送回来,这条路径天然不是点对点,TURN中继的转发压力因此会随着并发用户数迅速堆高,顶到瓶颈上。他给的方案是用eBPF技术把TURN的ChannelData包转发下沉到内核层去做,不用每个包都走一遍用户空间的服务进程,减轻服务器负担。
延迟:800毫秒预算怎么分配
CCC智能解决方案的Karthik Kaiplody把语音AI一次对话的延迟拆成端点检测、语音转文字、大模型生成回复、文字转语音几段,行业公认的总预算大概800毫秒。他有个说法值得展开:”端点检测是AI的抖动缓冲”。
传统实时通信里,抖动缓冲区的作用是抹平网络传输时快时慢的问题;端点检测在语音对话里干的是同一类事,判断用户是真的说完了还是只是换气停顿一下,判断早了会抢话,判断晚了对话就显得拖沓。这一步看起来简单,实际是四段里最容易出问题、也最难做准的一环,因为它要处理的是人说话本身的不确定性,不是纯粹的信号处理问题。思科的Krishna Tyagi补充了”产出延迟”这个角度:不只是响应快不快,AI生成内容的节奏能不能跟上真实对话,同样影响体验。
实测数据:现在最快能做到多少
这套延迟拆解框架不是纸上谈兵。2026年8月一份针对语音/实时Agent推理延迟的公开评测,测了OpenAI、Google、Anthropic、Groq、Cerebras等多家服务商的模型和推理平台:大模型首字延迟(TTFT)最快的是Baseten平台跑gpt-oss-120b,万级token输入负载下做到0.23秒;语音端到端延迟方面,Deepslate Opal是0.44秒,Grok Voice Think Fast 2.0是0.70秒,OpenAI的GPT-Realtime-1.5是0.81秒;语音合成音质对比上,Cartesia Sonic 3.6拿到1288分(Elo评分),高于ElevenLabs Flash v2.5的1083分。这组数字说明800毫秒预算是真实可以做到的目标,也说明延迟和音质是要一起权衡的两个指标,跑得快不代表听起来自然。
信任:语音AI已经在生产环境里直接面对用户
KR3信息系统的Neha Prakash提出的问题是:语音AI现在直接对着真实用户说话、做决策,中间没有人工审核这道传统安全网了。她给的应对思路是分层防御:入口处做边界认证,给AI能采取的动作划一个明确的范围,敏感数据做分割和去标识化处理,关键操作路径上加并行运行的防护栏,遇到高风险操作主动上报给人来判断。
二. NG911:应急通信这个最保守的场景,也在往AI化走
NG911分论坛官方关注的是FCC对IP化911系统的监管要求,以及AI/ML技术在处理多媒体报警信息、提升定位准确度上的应用。
产业侧已经有真实动作:通信设备商Comtech在2026年6月发布了Allerium Coral,把NG9-1-1网络从单纯的”传输层”改造成”协调层”,让事故信息能在不同应急机构之间实时交换,而不是分散在各自的门户系统里各看各的。美国陆军官方网站也报道过Fort Irwin基地实现了下一代911系统的一个里程碑,具体系统集成细节这里不展开,只是想说明:连应急通信这种”出错代价极高、天然保守”的场景,也已经在往实时协同和AI辅助这个方向走了。
三. Programmable Real-Time Networks:网络这一层也要学会自己管自己
这个分论坛官方关注Open RAN、云原生5G核心网、网络API,以及AI驱动的网络自动化。今年具体的演讲里,Origami Networks的Greg Agami讲的是自主网络容量管理——网络能不能自己判断负载、自己调整容量,不需要人工介入。这跟语音AI场景里”流量模式突然变得不可预测”(比如一个语音Agent同时被几万人调用)背后的诉求是一致的:传输层不能只靠人工规划扩容,得自己具备实时判断和调整的能力。
结语
相比某一场具体演讲的技术细节,一个学术会议把”AI in RTC”设成独立分论坛这件事本身分量更重:语音AI对实时系统提出的规模、延迟、信任这几个问题,已经被这个领域正式承认为独立的研究方向,这一点从分论坛这种正式的学术建制、以及实测数据里能压到0.7秒以内的真实进展上都能看出来。