AI AI工具情报站
模型动态MiniMax:Blog(网页)

开源全能多模态生成模型,支持 2K 原生立体声视频

📰 MiniMax:Blog(网页)📅 2026-07-31T09:59:02.996Z

核心亮点

MiniMax 推出全能多模态生成模型 H3,把"看、听、说、写"整合进同一模型。它联合理解文本、图像、视频和音频,并直接生成带原生立体声的视频。在 2K、15 秒设定下,生成成本压到主流模型三分之一以下,在高质量视频普遍昂贵的当下很抢眼。

具体能力或事件经过

H3 的"全能"在输入输出两端都体现。输入可同时吃进文字提示、参考图、视频片段和环境声音,创作者能一次喂入情绪板、人声样本和脚本。输出最高 2K、15 秒、带原生立体声的视频,而非先出画面再贴音轨。官方强调它在指令跟随、文字与品牌标识呈现、V2V 动作迁移上突出。

技术细节

H3 走统一多模态架构:不同模态先映射到共享表征空间,再由同一套流程生成视频。原生立体声说明音频与画面在同一管线联合生成,避免后期配音的口型错位与方位丢失。分辨率与价格解耦是关键:2K 每秒价格低于主流三分之一,768p 低于主流 720p 一半,用户可用更低预算拿更高清晰度。

与竞品对比

对比只做文生视频、按分辨率阶梯加价的产品,H3 的优势是"全模态、高分辨、低单价"同时成立。原生立体声与准确的文字品牌呈现,弥补了多数视频模型"画面漂亮但字幕乱码、声音单薄"的短板。V2V 动作迁移让它更靠近真实广告、短片工作流,而非一次性 demo。

行业影响或适用场景

说白了,H3 把多模态生成门槛又拉低一截。广告、电商、短视频、游戏预告团队能用更低成本产出更清晰、带真实声场的视频,意味着更快迭代与更小试错代价。MiniMax 还计划很快开源权重,吸引社区微调与硬件适配,把能力从云端 API 延伸到本地部署,惠及更广的中小创作者与研究者。