WorkBuddy Bench是什么
WorkBuddy Bench 是腾讯开源的编码智能体评测套件,覆盖代码、网页、办公、安全四大真实场景。任务从真实 commit、PR 及业务场景逆向构建,改写为口语化请求以抗数据污染。在260 个任务在隔离沙箱中通过隐藏测试、规则检查与 LLM 评判多元评分,并在双框架下交叉验证,实现开源可复现、可审计的端到端评测。
阅读目录

WorkBuddy Bench的主要功能
- Code(代码):80 个仓库级软件工程任务,涵盖 bug 修复、功能开发、接口调整、算法实现等 18 个类别,由开发者、算法工程师、产品经理、QA、运维五种角色发起请求。
- Web(网页):70 个前端任务,覆盖页面实现、交互设计、数据可视化、视觉设计、代码测试、文档转换等 7 个类别,要求交付可运行的前端制品而非对话文本。
- Office(办公):50 个多文件业务流程任务,智能体需处理电子表格、文档、PDF、JSON 等混合格式文件,完成数据核对、报告生成、状态更新等交接型工作。
- Security(安全):60 个红蓝队安全任务,包括漏洞发现与利用、恶意软件分析、安全运营、AI 智能体安全评估,采用确定性评分脚本,无 LLM 评判器参与。
WorkBuddy Bench的技术原理
- 逆向工程构建:每个任务从真实代码提交、PR、CVE 或业务场景逆向工程而来,改写为简短口语化的角色扮演请求,使提示词无法通过搜索引擎还原。
- 刻意信息不充分:请求仅陈述意图与约束,省略目标文件、精确接口、边界处理等细节,智能体必须自行从工作区恢复上下文,测试需求消歧与落地能力。
- 回合后评估隔离:智能体解题期间能看到任务指令与工作区,评分资产(隐藏测试、评分细则等)在完成后才引入沙箱,避免评分信息泄露。
- 双框架交叉验证:所有任务在 CodeBuddy Code 与 Claude Code 两种智能体框架下分别运行,消除单一框架的系统性偏差。
- 抗污染机制:依赖任务构建方式封闭可搜索提示路径,配合数据集版本管理定期刷新,替代传统保密式防污染方案。

微信关注回复“开源”,加入AI开源项目交流群
如何使用WorkBuddy Bench
- 获取任务集:访问 GitHub 下载标准化任务目录,包含 instruction.md、task.toml、environment/ 环境镜像与 tests/ 评分资产。
- 运行评测:将智能体接入 Harbor 风格任务目录,在隔离 Docker 沙箱中执行,智能体读取自然语言请求后探索工作区并生成制品。
- 查看结果:任务完成后自动运行评分器,代码子集通过隐藏单元测试评分,网页子集通过规则+LLM/VLM+智能体评判器评分,办公子集通过规则检查与证据驱动的 LLM 评判器评分,安全子集通过确定性 scoring.py 评分。
- 独立审计:任何第三方均可离线重新运行单个任务并直接检查其内容,实现端到端可复现与可审计。
WorkBuddy Bench的核心优势
- 真实工作分布:任务类别、模式、难度均匹配内部真实使用分类法,非基于公开题库或教程练习构造。
- 完全开源可审计:任务目录、环境镜像、评估代码、评分测试、参考答案全部公开,区别于 CursorBench 等封闭厂商基准。
- 多维度评分体系:代码用隐藏测试、网页用规则+语义+交互三重评判、办公用规则+证据驱动 LLM 评判、安全用确定性脚本,各子集评分工具独立设计。
- 角色与场景多样性:代码子集引入五种请求者角色,安全子集覆盖红蓝队全频谱,避免单一任务类型导致的评估偏差。
- 效率与能力解耦:排行榜同时报告 token 消耗与轮次效率,GPT-5.5 以最小输出预算取得顶级分数,证明高分不等于高消耗。
WorkBuddy Bench的项目地址
- 项目官网:https://workbuddybench.com/
- GitHub仓库:https://github.com/Tencent/workbuddy-bench
- HuggingFace模型库:https://huggingface.co/datasets/tencent/workbuddy-bench
- 技术论文:https://workbuddybench.com/report/main.pdf
WorkBuddy Bench的同类竞品对比
| 维度 | WorkBuddy Bench | SWE-bench |
|---|---|---|
| 任务来源 | 真实 commit/PR/业务场景逆向工程 | 公开 GitHub issue |
| 抗污染方式 | 构建层面封闭搜索路径+版本管理 | 依赖发布时的新颖性 |
| 覆盖领域 | Code / Web / Office / Security 四领域 | 仅代码缺陷修复 |
| 开源程度 | 任务/镜像/评分/答案全部公开 | 公开任务集与测试 |
| 请求风格 | 口语化、角色扮演、信息不充分 | 详细技术 issue 描述 |
| 评测框架 | 双框架(CodeBuddy + Claude Code) | 单一框架 |
WorkBuddy Bench的应用场景
- 智能体研发基准:为编码智能体、前端 AI 工具、办公自动化 Agent、安全 AI 提供标准化能力标尺。
- 模型选型参考:跨模型排行榜覆盖 Claude Opus 4.8、GPT-5.5、GLM-5.2、DeepSeek-V4 等主流模型,辅助企业选型。
- 学术研究与对比:完全开源的任务集与评分协议,支持第三方复现、审计与改进,推动领域基准迭代。
- 产品迭代优化:通过细分的子集得分与 token 效率数据,定位智能体在代码导航、前端状态管理、跨文件一致性等具体环节的短板。
- 安全能力评估: 独立的安全子集为 AI 红队与蓝队能力提供可量化的攻防测试环境。
