来源:互联网 更新时间:2026-08-17 14:24
当大模型学会用工具,解决问题的能力确实让人眼前一亮。但现有的评估方法,大多只关注单步骤任务中模型调用工具的表现——说白了,就是测一测模型能不能正确调用一个函数。可现实中的问题往往是多步骤、环环相扣的,需要模型先规划、再检索、再执行、再检查……这种复杂场景下的工具使用能力,目前评估得远远不够。
正是为了填补这个空白,T-Eval应运而生。它把大模型的工具使用能力拆解成六个精细的子过程,逐项评估,而不是简单地看最终结果。这六个维度分别是:

这种细粒度的拆解,让评估不再是“一锤子买卖”,而是能找出模型到底在哪个环节掉链子。
构建一套可靠的评测基准,背后是三个阶段的打磨:
首先,团队根据工具的可用性和使用频率,精心挑选了15种基础工具,覆盖研究、旅行、娱乐、网络、生活和金融等多个领域。每个工具都配套生成详细的API文档,尽量排除因工具描述不清而导致的调用失败。
接下来是生成指令。先用GPT-3.5产出初始问题,再让GPT-4把问题打磨得更严谨。随后,开发了一个多智能体框架,让这些智能体在工具集中协作求解,同时记录下完整的求解路径和工具返回结果。最后,由人类专家从中挑选出高质量样本作为基准数据。

这项工作的意义,可以从三个层面看:
团队在T-Eval上测试了20种大语言模型,既有基于API的商业模型,也有开源模型。结果显示,GPT-4在整体评分上拔得头筹,工具使用能力确实强悍。
开源模型方面,分别测试了7B、13B和70B三个规模。规律很明显:模型参数越大,表现越好。其中,Qwen-72B的总得分已经非常接近API商业模型。这或许说明,开源模型在工具使用上的潜力正在快速释放。

T-Eval目前已经集成到OpenCompass评测平台中。如果你想深入了解,可以查阅论文原文或访问官方项目页面。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
2026年三角洲行动账号交易指南:5大交易平台对比与安全选购建议
Windy卫星云图怎么看?云层变化识别技巧
TRUMP价格走势与WEPE预售进展解析
kimi提示词专家使用方法新手指南
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
WorkBuddy登录后怎么查看积分?
一加手机如何设置三指长按屏幕局部截图
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc