来源:互联网 更新时间:2026-08-12 15:36
PAST-Bench 是普林斯顿大学王梦迪团队推出的一套基准测试,核心用途很明确:检验个人 AI Agent 是否具备递归式自我改进能力。它的评估方式也很直接——把 Agent 在“有记忆”和“无记忆”两种条件下的任务表现放在一起比较,从而判断它跨会话保存下来的经验,是否真的能在后续任务中带来行为上的改进。就覆盖范围来看,PAST-Bench 主要考察四类能力:记忆、流程复用、信息搜集和更新,共包含 26 个场景、204 个任务回合。

past-bench build-image --kind sandbox 构建评估所需的 Docker 沙箱镜像。past-bench evolve 运行单个任务族并加上 --compare-no-persistence 参数做 Smoke Test。--trace-dir 目录下查看 sequence_comparison.json,获取 Δ 值和机制证据分数。agents/ 目录下实现适配器并确保支持 --compare-no-persistence 开关即可。| 维度 | PAST-Bench | SWE-Bench |
|---|---|---|
| 核心目标 | 检验 Agent 保存的跨会话经验是否真正改进了后续行为 | 检验 Agent 能否一次性正确修复真实 GitHub issue |
| 评估单元 | 一个任务族的多轮会话序列(早期积累 → 后期复用) | 单个独立的代码修复任务 |
| 持久化设计 | 核心设计:支持持久化状态(记忆、技能、会话历史)的开启与关闭 | 无持久化:每个任务都是全新环境,Agent 从零开始 |
| 对照机制 | 匹配对照实验——同一任务族分别运行”有记忆”和”无记忆”版本,精确归因 Δ 值 | 无对照设计——只判断 patch 是否正确,不区分改进来源 |
| 归因粒度 | 机制级:通过 Mechanism-Evidence Score 追踪”存储→检索→应用”的完整路径 | 结果级:只判断最终 patch 是否通过测试用例 |
| 能力覆盖 | 记忆、流程复用、信息搜集、状态更新(4 类跨会话能力) | 代码理解、调试、测试驱动开发(单会话能力) |
| 典型输出 | sequence_comparison.json(含 Δ 值、机制证据分数) | 通过率(Resolved %) |
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
腾讯ima怎么把微信内容一键导入知识库?
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc