来源:互联网 更新时间:2026-07-26 12:29
在AI智能体评测领域,一直缺少一个能真正衡量模型在真实职场中动手能力的标准。市面上常见的评测基准,要么是简单的代码填空题,要么是脱离实际工作流的理论问题。直到腾讯优图实验室和科恩安全实验室联合推出了
简单来说,WorkBuddy Bench是一个
框架本身依托Docker沙箱隔离运行环境,自动化执行任务、校验产出,并输出标准化的打分结果。这从根本上解决了AI智能体实操能力缺乏统一、可信评测标准的行业痛点。更关键的是,所有数据集、执行代码和校验逻辑全部开源可复现,意味着任何人都可以验证和复现评测结果。数据集本体托管在Hugging Face,GitHub仓库则提供完整的评测运行调度框架。

WorkBuddy Bench的设计思路非常清晰,它不是为了评测而评测,而是为了解决一个实际问题:如何客观、全面地评估AI智能体在真实职场中的表现?为此,它设计了一系列独特的功能。
最后,
results目录,方便后续的数据分析。为了让大家快速上手,这里梳理一下仓库的核心模块:
src/workbuddy_bench:框架的核心调度、打分和沙箱管理源码。datasets:数据集拉取脚本,数据集原始文件独立托管在Hugging Face。scripts:环境初始化、批量评测、数据集校验和任务预览脚本。configs:模型配置模板和评测任务Job模板。.agents/skills:AI智能体一键评测的自动化技能工具。.env.example:环境变量配置模板,用来存储模型API密钥和数据集路径。WorkBuddy Bench的技术栈非常清晰和现代:
整个评测流程高度自动化,大致分为7个步骤:
WorkBuddy Bench的应用场景非常广泛,几乎覆盖了所有与AI智能体能力评估相关的领域:
使用WorkBuddy Bench并不复杂,按照以下步骤操作即可。
首先,确保本地已安装Docker、Python 3.12及以上版本,以及uv包管理工具。然后克隆GitHub项目仓库到本地:
git clone https://github.com/Tencent/workbuddy-bench cd workbuddy-bench
uv sync,自动安装所有Python依赖。cp .env.example .env。执行仓库内置的脚本,按需下载单个赛道或全部260道评测任务。脚本会自动校验文件哈希,防止数据集损坏。
.agents/skills智能体技能,在支持Agent Skill的编码工具中调用指令,即可全自动完成数据集下载、模型配置、批量评测和分数汇总的全流程。所有任务运行日志、单题得分、赛道平均分统一保存在项目results文件夹中,方便进行二次数据分析。
为了更直观地展示WorkBuddy Bench的优势,我们选取了2款主流的AI智能体评测基准进行多维度对比:
| 对比维度 | WorkBuddy Bench(腾讯) | HumanEval | AgentBench(Meta) |
|---|---|---|---|
| 开发主体 | 腾讯多实验室联合开源 | OpenAI | Meta FAIR团队 |
| 评测任务来源 | 企业真实业务工单逆向重构 | 简易独立代码填空题 | 人工构造多工具调用任务 |
| 覆盖赛道 | Code/前端Web/Office办公/安全Security 四大场景 | 仅Python代码单赛道 | 通用工具调用、网页交互,无安全、办公细分赛道 |
| 运行环境隔离 | Docker独立沙箱,任务环境完全隔离 | 本地直接运行代码,无隔离机制 | 轻量沙箱,不支持完整项目级工程测试 |
| 防刷分设计 | 真实业务定制任务,无公开网络原题 | 题目全网公开,大模型易记忆刷题 | 人工构造场景,存在公开数据集泄露风险 |
| 复现难度 | 完整容器镜像、数据集开源,一键复现 | 仅代码片段,无完整项目工程环境 | 依赖Meta自有环境组件,本地完整复现成本高 |
| 适配模型 | 所有OpenAI协议大模型,闭源/开源通用 | 仅适配代码专用大模型 | 仅适配Meta系模型,第三方模型适配复杂 |
A:当然可以。评测框架只提供调度逻辑,全部任务数据集托管在Hugging Face。仓库内置了专用下载脚本,可以单独拉取单赛道数据集,脱离框架单独使用。
A:不能。所有任务校验和代码执行都依赖Docker沙箱隔离。缺少Docker会存在本地文件篡改、脚本恶意执行的风险,框架强制依赖容器环境。
A:不需要。下载脚本支持指定单赛道下载,只拉取70道Web前端任务即可,能节省本地存储和下载时间。
A:只要模型服务兼容OpenAI标准API接口,就可以直接接入。只需在.env文件填写本地模型接口地址和密钥,无需修改框架源码。
A:单赛道分数仅代表智能体在该领域的实操能力。四大赛道的评分规则和任务难度是独立设计的,Code、Web、Office、Security的得分不能横向对比。
A:项目采用腾讯自有开源协议,允许个人和企业非商用科研、测试使用。如果涉及到商用落地和二次分发,需要联系腾讯官方获取授权。
WorkBuddy Bench作为腾讯推出的全场景职场AI智能体开源评测基准,其价值不仅在于填补了现有评测工具的空白,更在于它提供了一个真正贴近真实职场、可复现、可信赖的评测方案。它解决了传统评测只聚焦简易代码、缺少真实企业多岗位任务、没有安全与办公细分赛道的痛点。依托Docker沙箱,它实现了高可信度的自动化打分流程;通过兼容主流大模型服务,它降低了使用门槛;而双模式评测设计,则兼顾了轻量化与专业化的需求。
毫不夸张地说,无论你是大模型研发团队、企业AI工具选型者、安全攻防测试人员,还是高校人工智能科研人员,WorkBuddy Bench都能提供一个客观、标准化的智能体实操能力量化依据。这或许正是AI智能体评测领域,一直等待的那个“标准答案”。
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
货拉拉如何查看历史订单 货拉拉往期行程轨迹查询【功能教学】
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
今日小鸡庄园答案2026.7.2
美债股纳斯达克首盘暴跌38%且加密代理交易解体,AVAX价格何去何从?
男生头像配网名可爱(精选100个)
赵云与阿斗神兵符使用教程 神兵符怎么使用
国家养老服务消费补贴上线京东
余姚的路虎4s店在哪个位置
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc