来源:互联网 更新时间:2026-08-27 07:29
接下来的工作,沿着同样的思路把这套方法延伸到了记忆机制上。《Recursive Language Models as Memory Systems》(2026 年 2 月)给出的结果很直接:在 LongMemEval 上,基于 Gemini 3 Flash 的配置,成绩大致从 87.2% 提升到了 89.8%。这也说明了一点,**记忆本质上也可以是对上下文进行计算,而不是一上来就先搭一整套向量库和检索器**。
热度起来以后,复现工作很快泼了一瓢冷水。《Think, But Don't Overthink》(2026 年 3 月)发现,深度为 1 的递归在 Oolong 上有帮助,更深反而可能伤准确率,同时把耗时和 token 打爆。递归深度要调,不能默认越大越好。
还有几条保留意见值得并排看。Oolong、LongMemEval 与真实 Agent 任务的相关性并不强,LongCoT 也很新。递归系统会拆成许多小调用,中位数成本好看,尾部查询可能很贵,千万 token 的端到端延迟也不轻松。
这些保留意见很重要。后面动手时,我们会看见它们被写成了代码里的护栏。
论文里对上下文做 REPL 的那一半,需要论文和官方库才能完整感受。想先摸到“拆开任务、子节点干活、再汇总”这一半,可以先把过程写成一段很短的伪代码。`pi-rlm` 做的事,大致就落在这棵调用树上。
```python
def solve(task):if is_atomic(task): # Step 1: Atomizer
return execute(task)# Step 2: Executorelse:
subtasks = plan(task) # Step 2: Plannerresults = []
for subtask in subtasks:results.append(solve(subtask))# Recursive call
return aggregate(results) # Step 3: Aggregator# Entry point:
answer = solve(initial_request)```
代码很直接。任务够小就执行;不够小就规划出子任务,对每个子任务再调用一次 `solve`,最后把结果聚起来。Atomizer 决定何时停拆,Planner 决定怎么拆,Executor 干活,Aggregator 聚合。递归落在那一行 `solve(subtask)` 上。Pi 扩展 `pi-rlm` 把这套逻辑做成了带护栏的引擎。根节点开一个规划器,严格输出 JSON,在 `solve` 和 `decompose` 之间二选一。选分解就长出子节点,每个子节点像一个 worker。子结果回来后,合成器汇总,已完成的当证据,失败的当缺口。叶节点不再往下拆,只做一次普通求解。默认护栏比较严格。`maxDepth` 默认 2,到顶就强制直接解。`maxNodes` 默认 24,剩余预算会塞进规划器提示词。`maxBranching` 默认 3,子任务会被裁到预算内。任务血缘里出现环,就强制求解,避免无限递归。有效子任务不足两个时,自动回退到直接解(除非你强行 `mode=decompose`)。第一次跑,最适合带实时树。```shell
pi-rlm "Analyze the architecture of this repo"--tools-profile read-only --live
```屏幕上会出现深度 0 的根节点,规划器决定直接解还是拆开,子节点在 depth 1 各自开 Pi 会话,最后合成器合并输出。树本身就是递归。每个节点对应一次模型调用,根侧上下文只接收子节点的结果,不会被整个塞满。每个决策里的 `reason` 字段,会写清为什么此刻选择分解或求解。护栏实验是教学价值最高的一组。同一句任务,分别用浅深度、更深深度、以及完全关掉递归的 `mode=solve` 跑三遍,对比达到深度、访问节点数、耗时和输出质量。```shellpi-rlm "Find top reliability risks in this codebase" --max-depth 1 --json
pi-rlm "Find top reliability risks in this codebase" --max-depth 3 --jsonpi-rlm "Find top reliability risks in this codebase" --mode solve --json
````mode=solve` 接近论文里的非递归基线。`--max-depth 1` 接近论文默认深度,`--max-depth 3` 则把“更深不一定更好”的理念写到了工程当中,由人类经控制。引擎还会在分解无益时自动回退。
预算也能单独控制,如下。```shell
pi-rlm "Write a README for this repo"--max-nodes 8 --max-branching 2```
规划器提示词里带着 `remainingNodeBudget`,并被要求绝不超过 `maxBranching`。预算耗尽时,剩余节点会被取消,合成器明确汇报缺口。这些设置参数就是成本与质量权衡的艺术。后端选择对应论文那句“递归子调用可以指向自身或另一个 LM”。`sdk` 在进程内复用,开销最低,接近自我递归。`cli` 每个节点起一个全新 `pi -p` 子进程,隔离清楚。如果用`tmux` 加上 `--live` 最戏剧化,窗格按 `depth-0`、`depth-1` 递归变成可见的进程树。每次运行还会落到 `/tmp/pi-rlm-runs/pi-rlm真正聚焦的,其实是任务轴上的那一套能力:递归拆解与合成、深度和节点预算、分支控制、环检测,以及以节点为单位可观测的成本与延迟。它并没有把论文的另一半也一并照搬过来——那部分说的是对上下文本身做 REPL,包括切片、检索、再对切片继续发起子查询。说白了,论文里关于超长上下文,以及把上下文“当记忆来用”这两块的数据表现,单靠任务树工具是复现不出来的。
[1] Zhang, Kraska & Khattab,《Recursive Language Models》,编号 arXiv 2512.24601(arxiv.org/abs/2512.24601)
[2] Alex Zhang 博客 alexzhang13.github.io/blog/2025/rlm/[3] 开源库 rlm,github.com/alexzhang13/rlm
[4] Prime Agent,github.com/PrimeIntellect-ai/prime-agent[5] pi-rlm(v0.1.3),github.com/manojlds/pi-rlm
[6]《Think, But Don't Overthink》(2026 年 3 月); [7]《Recursive Language Models as Memory Systems》(2026 年 2 月)","createTime":1786458492,"ext":{"closeTextLink":0,"comment_ban":0,"description":"","focusRead":0},"fa vNum":0,"html":"","isOriginal":0,"likeNum":0,
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
车载冰箱重置到出厂设置几步?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
管线机怎么接云米净水器
Windy卫星云图怎么看?云层变化识别技巧
WorkBuddy积分怎么获得?
5000-6000元鼠标有什么推荐?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc