AI AI工具情报站
国内AI动态 paper

多领域编码智能体评测套件

📰 HuggingFace Daily Papers(社区热门论文) 📅 2026-07-23

核心亮点

腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四大工作领域的编码智能体评测套件。它最较真的地方在于:每一个任务都从真实的 commit、PR 或业务场景逆向工程而来,再改写成口语化的角色扮演请求,从构造上就抵抗数据污染。简单来说,它考的不是“背过的题”,而是智能体在真实工作流里真把活干好的能力。

具体能力或事件经过

WorkBuddy Bench 把评测从“做题”拉回“干活”。传统基准常用公开数据集,模型很可能在训练时见过答案;这里则把企业里真实发生过的开发、网页操作、办公自动化、安全处置等任务,重新包装成自然语言委托,让智能体像接到同事需求一样去执行。四个领域覆盖了工程师日常的大部分动作:写代码、跑网页、处理文档、做安全响应,因此更能反映智能体上岗后的真实表现。

技术细节

抗污染的关键在“逆向工程 + 角色扮演改写”:任务源头是真实仓库与业务记录,答案空间不固定,模型无法靠记忆刷题。评测在 CodeBuddy Code 与 Claude Code 上运行,覆盖主流编码智能体,保证横向可比。所有任务目录、环境镜像、评分工具与参考方案均全面开源,意味着任何团队都能复现结果、对齐标准,而不是只看厂商自报分数。这种“可复现评测”正是行业最缺的公信力。

与竞品对比

相比只考算法题或单轮生成的基准,WorkBuddy Bench 胜在“工作域完整”与“来源真实”。它不和学术榜单比谁的模型刷分高,而是提供一把统一的尺子,让不同编码智能体在同一组真实任务下公平较量。对采购方来说,这类开源、可复现的基准比营销话术更有参考价值。

行业影响或适用场景

说白了,编码智能体到了拼“真干活”的阶段,WorkBuddy Bench 这类基准会成为选型与迭代的刚需。它适用于企业评估智能体在研发、办公、安全等场景的胜任度,也适合开发者对照分数找短板。全面开源的作法,更能推动整个编码智能体赛道从自说自话走向公开可比,加速能力水位整体上探。