字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
核心亮点
字节跳动 Seed 团队发布 SeedRealtime,一款用统一架构原生融合音频、视频与文本的全双工大模型。它不再把“看、听、说”拆成多个模型拼接,而是让模型在同一时间线上同时处理三种模态,实现真正边看、边听、边说的自然交互。它已在豆包 App 全量上线,成为业内首个规模化落地的音视频全双工方案,把实验室能力直接推到亿级用户面前。
具体能力或事件经过
传统音视频对话多采用级联架构:先语音识别、再大模型理解、再语音合成,链路长、延迟高,还容易出现抢话、冷场等节奏问题。SeedRealtime 把多模态塞进一个端到端模型,用户说话的同时模型已在“听”和“看”,回应也可以中途插话,对话节奏接近真人。实测显示,相比级联方案,其音视频对话的节奏异常减少了一半,体验上的卡顿与错位明显缓解。
技术细节
关键在于“原生融合”而非“后期拼接”。统一架构让音频与视频特征在同一表示空间内对齐,模型能依据画面上下文判断何时该沉默、何时该接话,从而消除了级联系统固有的等待开销。全双工意味着收发信道同时打开,模型在输出语音的同时继续接收用户的音视频流,这正是自然对话的基础能力。视频的加入还让模型能读取表情、手势与环境,理解层次更丰富。
与竞品对比
对比 GPT-4o 的语音模态与国内同类实时模型,SeedRealtime 的差异化在于把视频也纳入实时双工回路,而不只是语音。多数竞品仍停留在“语音全双工”,字节则率先把视觉感知做实时的第三只眼。借助豆包亿级用户体量,它拿下了从技术到规模的完整闭环,这是纯研究型团队难以复制的落地优势。
行业影响或适用场景
全模态实时交互是下一代人机入口的关键形态,适用于陪伴、教育、导购、无障碍等需要“眼耳口”协同的场景。SeedRealtime 的规模化上线,标志着国产大模型在实时多模态赛道从追赶到局部领跑。对行业而言,它树立了“全双工 + 视频”的新标杆,也将倒逼竞品加速补齐实时视觉能力,推动整个赛道向更自然的人机交互演进。