豆包视频通话升级,火山引擎多模态传输系统提供技术支撑
走到一个陌生景点举着手机让豆包带你逛它看到路牌标识主动提醒方向看到建筑开口介绍典故旁边路人聊天、街边叫卖豆包不会被带偏依然只跟你对话。豆包视频通话功能升级后AI 可以在连续变化的真实场景中实现更自然的连续交互这为用户带来了三个最直观的感受能边看边听边说。用户不用等 AI 说完才能开口AI 能同时接收和处理音频、视频、文本三路输入。指着航班牌问 这个怎么走它看懂你指的是行李转盘多人聊天时它结合口型和画面判断是谁在对话不被旁边闲聊带偏。AI 会主动开口。持续感知环境变化看到关键标识会主动提醒处理任务时主动调用工具查信息、整理结果。交互模式从 一问一答 升级成了 双向协作用户不用每次都先开口。对话节奏自然。不打断也不冷场该说时说该听时听。自然接话、合理停顿精准分辨旁人闲聊和背景噪声。官方评测显示对比传统级联方案对话节奏违和问题减少了约 50%—— 用户几乎不会遇到 AI 说完话突然停住 或 我还没说完 AI 就抢答 的尴尬。这背后是一次双线升级模型层接入原生音视频全双工大模型 SeedRealtime在业界率先实现音视频全双工技术的规模化落地。而支撑这一切的底层传输架构也已悄然完成从实时通信技术 RTC到火山引擎多模态传输系统MMT的代际跃迁。SeedRealtime 定义了 AI 能做什么而火山引擎 MMT 决定了 用户能不能真正感受到这些能力。MMT 在三个核心环节完成了提升。秒接通秒应答传统 RTC 架构下音视频通道与信令通道分离用户发起视频通话时需要经历多轮协商 —— 媒体通道建联、模型会话建立、状态同步各自为政叠加下来往往需要数秒才能真正进入可用状态。用户看到的是 连接中… 的转圈等待体验大打折扣。MMT 通过统一的多模态会话架构将媒体传输与模型会话深度整合客户端底层基于 QUIC 库复用连接、多路复用一次建联即可承载音视频、信令、模型状态等多路数据传输层基于 MoQ 协议实现统一会话控制媒体流与控制信令在同一会话中协同调度省去了多通道分别建联的开销。最终建联耗时从秒级压缩到数百毫秒用户点开视频通话几乎秒接通对话感的连贯性大幅提升。零丢字从源头杜绝答非所问此前音频传输通道和模型推理通道是异步建联的 —— 音频可能已经在传了但模型会话还没建立好或者模型已经就绪但首帧音频还没同步到位。用户刚开口说 帮我看看这道题模型只收到了 这道题回答自然跑偏。MMT 的核心突破就是用统一的多模态会话控制从根本上解决了状态异步问题音视频流与模型会话状态在同一传输链路中统一调度不再是两条各跑各的管道网关层引入 MediaKit 同源处理算法实时判断首帧是否完整、音画是否对齐、模型是否就绪——只有所有模态状态同步后才会触发模型推理从源头上杜绝了丢字和答非所问延迟抖动超过 1 秒就会导致模型接收信息变形的老问题在 MMT 的精细会话控制下得到系统性改善。精准意图理解智能推理应答人与人通话传输层忠实搬运就够了。但 AI 交互不一样用户指着屏幕上一行小字提问如果传输层继续传低码率视频模型可能根本看不清那行字回答自然跑偏更合理的方式是触发高清图、抽帧或局部增强。传统 RTC 不具备按需调整传输策略的能力。MMT 通过 C/S 架构设计让传输从哑管道变成了智能调度层服务侧网关承担关键决策角色。用户传来一句话网关可以选择是否直接送往模型用户打开摄像头网关判断是否需要抽帧、是否需要高清图、是否要结合模型反馈改变处理策略分层会话控制。哪一路音频优先、哪一帧视频更值得送给模型、哪些内容需要可靠传输、哪些可以为低延迟做取舍都由 MoQ 信令上的分层逻辑单元精细控制多模态同步保障。语音、画面、时序信息在传输层就完成对齐模型拿到的是打包好的、同步的多模态输入而不是自己再去拼拼凑凑。传输系统第一次 理解 了模型需要什么而不是机械地搬运所有数据。MMT 不是被动地等 SeedRealtime 来 取 数据而是主动地根据模型的推理状态把 对的数据、以对的形态、在对的时机 递送到模型面前。模型决定智能上限传输决定体验下限AI 实时交互的竞争不只发生在模型层。当行业焦点都在讨论谁的模型更聪明时火山引擎在做一件更长期的事把传输基础设施从哑管道升级为智能调度层让大模型的能力近乎无损耗地传递给每一个终端用户。豆包视频通话接入 SeedRealtime是这套能力的一次完整展示。随着同传、外语陪练、博物馆讲解等场景加速落地边看边听边说的实时多模态交互将成为越来越多产品的标配体验。而支撑这一切的底座是一个经过亿级用户验证、能承载百倍复杂度的传输系统。模型让 AI 更聪明火山引擎让 AI 更真实。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →