AI资讯ai-models
Pro 正式版上线,Agent 能力大幅增强
核心亮点
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 三端同步上线,模型名设为 deepseek-v4-pro 即可调用。说白了,这是一次"正式毕业"的发布:此前若在灰度或预览阶段,现在所有人都能稳定使用。官方重点强调它的智能体能力显著增强,并甩出了两组硬核评测数字。
具体能力或事件经过
在智能体相关的基准上,V4-Pro 的 HLE(无工具 / 有工具)分别达到 42.7 和 60.0,Terminal Bench 2.1 为 87.9。HLE 是考验模型做深度、开放式研究能力的难题集,能调用工具时分数大幅跳升,说明模型"会用工具"后上限明显抬高。Terminal Bench 则衡量在真实命令行环境里完成多步任务的能力,87.9 属于相当高的水准。
技术细节
从数字看,V4-Pro 的提升主要落在"执行"而非"闲聊"。HLE 无工具 42.7 已经不低,但加上工具后冲到 60.0,说明它在检索、调用、验证这条链路上做得更顺。Terminal Bench 87.9 则表明它能稳定地在 shell 环境里跑命令、看输出、再决策,具备真正的"动手"能力,而不是只给建议。
与竞品对比
在 Pro 级智能体赛道上,Claude、GPT 等都有各自的强项。DeepSeek-V4-Pro 用开源生态 + 三端同步 + 明确评测来建立信任。简单来说,它想证明:国产模型在"能跑完复杂任务"这件事上,已经可以和第一梯队同台竞技,而且通过 API 同步上线,开发者能立刻接入。
行业影响或适用场景
对构建自主研究助手、自动化运维、代码智能体的团队,V4-Pro 是一个高性价比的新选项。三端同步意味着产品、网页、后端可以共用同一套能力。随着 Agent 能力成为大模型竞争的胜负手,V4-Pro 的正式发布,会进一步推高"谁的执行更稳"这条主线的热度。