摘要
Recuris 在冻结模型和工具外部维护可验证的 Skill Memory,并通过结构化轨迹、组件级失败定位、局部 patch 与 held-out 验证门,跨任务演化 Agent 的工作记忆与技能调用控制。它是持久 harness 自进化的代表,但不属于严格 Agentic RL,因为没有用环境回报更新模型策略。(来源:原始论文记录(本地存档),pp.4-10)
核心内容
- Memory
M=(E,W,rho,C)同时包含经验记忆、工作记忆 schema、调用策略和 checker;环境或工具证据通过 checker 后才能提交状态更新。(来源:原始论文记录(本地存档),pp.4-8) - 固定 Meta-Agent 从失败轨迹定位责任组件并提议局部修复;修复须同时通过源任务和 held-out development tasks,否则回滚。(来源:原始论文记录(本地存档),pp.8-10)
- 作者报告 37 个 model-benchmark pair 中 35 个提升;但 Terminal-Bench 的 adaptation 相对同预算 retry 仅多 2.3 points,
p=0.774,说明部分收益来自重试而非适应本身。(来源:原始论文记录(本地存档),pp.1, 23)
相关页面
- 概念:Recursive Self-Improvement、Self-Improving Harness、Agent Failure Localization、Meta-Agent
- 实体:Recuris
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.24876
- arXiv:https://arxiv.org/abs/2608.24876
- 定位信息:pp.1, 4-10, 17-18, 23-24, 31-33
待核实问题
- 公开性核实(2026-08-28):官方仓库已提供 evaluation/evolution code、Skill Memory packages、冻结 splits、安装和对照运行命令,采用 Apache-2.0;这满足“可启动复现材料已公开”,不等于结果已复现。(GitHub)
- 仍待独立复现:35/37 提升、组件定位、held-out gate 与跨模型迁移结果;本知识库未运行需要模型服务和 benchmark 环境的实验。
- 解释边界:组件定位指标仍是最可能有效的 repair decision,不是因果识别;结果对 checker、split、模型服务和预算敏感。