AI AI工具情报站
模型动态MarkTechPost(RSS)

开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

📰 MarkTechPost(RSS)📅 2026-08-09T23:58:34.000Z

核心亮点

NVIDIA NemotronLabs 近日开源 VoiceChat-11B,端到端全双工语音模型。说白了,它把“听、想、说”塞进同一神经网络,省去 ASR、LLM、TTS 串接。最直接好处是延迟大降:Full-Duplex-Bench 1.0 上流畅轮换延迟仅 448 毫秒,接近人类对话节奏。

具体能力或事件经过

模型有两大卖点。一是真正全双工:边说边听,用户插话立即让出话轮,480 毫秒内接管率(TOR)达 1.00,几乎不抢话。二是首个支持对话实时工具调用的开源全双工模型:查天气或订单时经独立通道发 脚本,用“on-hold”话术补空隙,对话不冷场。

技术细节

VoiceChat-11B 采用混合 Mamba/Transformer 架构,由 NVIDIA 组件拼装:Fast Conformer 编码器持续编码 16kHz 音频流,Nemotron Nano v2 作 9B LLM 主干消费音频 token 并预测文本 token,TTS 解码器输出 22.05kHz 语音。训练用约 55 万小时真实与合成音频。权重以宽松的 OpenMDW-1.1 许可开放,但标注“仅限研究用途”。

与竞品对比

相比 ASR+LLM+TTS 级联,端到端延迟更低。VoiceBench 列开源全双工第二,Full-Duplex-Bench 1.0 亦列开源第二;BFCL-v3 口语工具调用平均 56.1%。它在开源中具竞争力但非最强,NVIDIA 自认仍是研究产物。

行业影响或适用场景

部署门槛是一张 80GB 显存 GPU(A100、H100、B200 等),无托管 API。适用可插话语音客服、车内助手、点餐与 IVR、游戏 NPC 等。宽松许可允许自托管修改、免计费。短板:上下文上限约两分钟、多轮后可能崩成乱码、话轮结束会自言自语,离生产尚有距离。

适用人群与注意事项

说白了,这个模型目前更适合有 GPU 自研能力的团队“把玩”和二次开发,而不是普通用户直接上手。最该关注的是做语音客服、车载助手、智能硬件的工程师,以及需要低延迟实时对话的研究者。需要注意:它要求单卡 80GB 显存,对个人开发者门槛不低;上下文只有约两分钟,长对话会“翻车”;NVIDIA 明确标注“仅限研究用途”,商业落地前务必确认许可边界。如果你只是想要一个能聊天的中文语音助手,它现在还不是那个答案。