热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >PAST-Bench – 普林斯顿推出的个人 Agent 的性能归因基准

PAST-Bench – 普林斯顿推出的个人 Agent 的性能归因基准

来源:互联网 更新时间:2026-08-12 15:36

PAST-Bench是什么

PAST-Bench 是普林斯顿大学王梦迪团队推出的一套基准测试,核心用途很明确:检验个人 AI Agent 是否具备递归式自我改进能力。它的评估方式也很直接——把 Agent 在“有记忆”和“无记忆”两种条件下的任务表现放在一起比较,从而判断它跨会话保存下来的经验,是否真的能在后续任务中带来行为上的改进。就覆盖范围来看,PAST-Bench 主要考察四类能力:记忆、流程复用、信息搜集和更新,共包含 26 个场景、204 个任务回合。

PAST-Bench – 普林斯顿推出的个人 Agent 的性能归因基准

PAST-Bench的主要功能

  • 评估递归自我改进

    :检验个人 AI Agent 保存的跨会话经验(记忆、技能、任务历史)是否真正改进了后续行为。
  • 隔离经验积累效果

    :区分”得分提升来自经验积累”还是”基础模型变强/Prompt 变化/任务难度”等其他因素。
  • 四维能力诊断

    :覆盖记忆、流程复用、信息搜集、状态更新四大维度,定位 Agent 具体哪类能力有缺陷。
  • 机制归因分析

    :不仅看最终得分,还追踪”存储→检索→应用”的完整路径,判断改进是否有真实路径支撑。

PAST-Bench的技术原理

  • 任务族序列设计

    :Agent 按顺序执行同一任务族的多轮会话。早期会话创造保存经验的机会,后期会话检验这些经验是否被正确使用。
  • 匹配对照实验

    :为每轮后期会话设计对照版本,关闭持久化能力,其他条件完全一致。通过”有记忆得分 – 无记忆得分”得到自我进化差值 Δ。
  • 机制证据追踪

    :运行时记录记忆写入、技能调用、会话检索、状态更新等遥测数据,计算 Mechanism-Evidence Score,验证改进是否遵循预期路径。
  • 持久化产物审计

    :检查 Agent 实际保存的内容(记忆条目、技能文件、会话索引),分析其结构、时效性和可复用性。

如何使用PAST-Bench

  • 环境准备

    :从 GitHub 克隆 PAST-Bench 仓库并安装核心依赖及 Agent 适配器。
  • 模型配置

    :在环境变量中配置所使用模型的 API Key。
  • 沙箱构建

    :执行 past-bench build-image --kind sandbox 构建评估所需的 Docker 沙箱镜像。
  • 快速验证

    :用 past-bench evolve 运行单个任务族并加上 --compare-no-persistence 参数做 Smoke Test。
  • 完整评估

    :遍历全部 26 个任务族运行评估,每个任务族自动执行”有持久化”和”无持久化”两组对照实验。
  • 结果分析

    :在 --trace-dir 目录下查看 sequence_comparison.json,获取 Δ 值和机制证据分数。
  • 自定义接入

    :如需评估自有 Agent,在 agents/ 目录下实现适配器并确保支持 --compare-no-persistence 开关即可。

PAST-Bench的核心优势

  • 真正的归因能力

    :PAST-Bench 能精确区分改进来自经验积累是模型本身变强/Prompt 变化/任务变简”。
  • 匹配对照实验设计

    :每个任务族都配有关闭持久化的对照版本,其他条件完全一致,实现有记忆与无记忆的直接因果对比。
  • 机制级诊断

    :提出 Mechanism-Evidence Score,判断 Agent 是否答对,还追踪”存储→检索→应用”的完整路径,识别”碰巧答对”与”真正复用经验”的区别。
  • 四维能力拆解

    :将模糊的自我改进拆分为记忆、流程复用、信息搜集、状态更新四类具体能力,精准定位短板。
  • 诊断驱动改进

    :基于基准暴露的运行时故障,直接催生 Hermes+ 框架,证明其不仅是评估工具,更是 Agent 架构优化的诊断引擎。

PAST-Bench的项目地址

  • GitHub仓库

    :https://github.com/Gen-Verse/PAST-Bench
  • arXiv技术论文

    :https://arxiv.org/pdf/2608.04003

PAST-Bench的同类竞品对比

维度PAST-BenchSWE-Bench
核心目标检验 Agent 保存的跨会话经验是否真正改进了后续行为检验 Agent 能否一次性正确修复真实 GitHub issue
评估单元一个任务族的多轮会话序列(早期积累 → 后期复用)单个独立的代码修复任务
持久化设计核心设计:支持持久化状态(记忆、技能、会话历史)的开启与关闭无持久化:每个任务都是全新环境,Agent 从零开始
对照机制匹配对照实验——同一任务族分别运行”有记忆”和”无记忆”版本,精确归因 Δ 值无对照设计——只判断 patch 是否正确,不区分改进来源
归因粒度机制级:通过 Mechanism-Evidence Score 追踪”存储→检索→应用”的完整路径结果级:只判断最终 patch 是否通过测试用例
能力覆盖记忆、流程复用、信息搜集、状态更新(4 类跨会话能力)代码理解、调试、测试驱动开发(单会话能力)
典型输出sequence_comparison.json(含 Δ 值、机制证据分数)通过率(Resolved %)

PAST-Bench的应用场景

  • 学术研究

    :为 Agent 递归自我改进提供标准化、可复现的量化评估环境,支持不同架构的客观对比。
  • 框架开发

    :通过四维能力拆解精准定位 Agent 框架短板,指导架构优化(如 Hermes+ 的诞生)。
  • 模型选型

    :在固定框架下对比不同基座模型的跨会话经验复用表现,识别各模型的能力偏向。
  • 持久化验证

    :测试不同记忆结构和检索策略的实际效果,避免”存了但找不到”或”存了但没用”的无效持久化。
  • 产品迭代

    :区分新版本得分提升是来自”跨会话经验积累”还是”基础模型变强”,确保持久化功能真实产生价值。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc