AI AI工具情报站
模型动态公众号:MiniMax(稀宇科技)

通用全模态生成系统支持 2K 视频与原生立体声

📰 公众号:MiniMax(稀宇科技)📅 2026-08-03T02:44:09.000Z

核心亮点

MiniMax正式开源新一代通用视频模型H3,这是其在多模态生成方向的重要一步。H3能统一理解文本、图像、视频和音频四种模态,并生成最高2K分辨率、最长15秒、带有32 kHz原生立体声音频的视频。相比上一代,H3把视频生成从单纯画面拓展到带声音、带理解的完整片段,意味着它可以一次性产出更接近成片的素材,而不只是无声的画面。开源让更多开发者能直接上手。

具体能力或事件经过

H3以开源方式发布,开发者可直接拉取权重进行本地部署或二次开发。在生成能力上,它支持最长15秒的视频,分辨率最高2K,音频为32 kHz原生立体声,不再是后期配音。模型可同时接收多张图片、多段视频和多段音频作为参考,理解上下文后生成连贯内容。官方展示了广告、短剧等场景的样例,强调其审美与一致性,证明开源模型也能达到接近商业产品的观感。

技术细节

H3采用统一多模态架构,把文本、图像、视频、音频映射到同一表示空间,因此能跨模态理解与生成。原生立体声意味着音频在生成阶段就带左右声道,避免后期合成的廉价感。32 kHz采样率对于一般视频配音和音效足够清晰。2K分辨率在保持细节的同时控制算力开销,适合中小团队使用。多模态参考让生成结果更可控,也更贴合给定素材。

与竞品对比

和Runway、Pika等偏短视频工具相比,H3强调统一多模态与原生声音,更像一个通用引擎。与Sora相比,H3先走开源路线,降低使用门槛,但极致时长和画质仍有差距。开源策略让它更容易被开发者和企业集成,形成围绕模型的工具和生态,这是闭源产品难以快速复制的优势。

行业影响或适用场景

H3适合广告TVC、短剧、创意片头、动态海报、UI动效和游戏实机等场景。对中小创作者,开源意味着低成本试错;对企业,可私有部署保护数据。它预示着视频生成正从单一画面走向声画一体的多模态生产,降低专业视频制作门槛,也让更多团队能用上此前只有大厂才玩得起的生成能力。