摘要

Recuris 在冻结模型和工具外部维护可验证的 Skill Memory,并通过结构化轨迹、组件级失败定位、局部 patch 与 held-out 验证门,跨任务演化 Agent 的工作记忆与技能调用控制。它是持久 harness 自进化的代表,但不属于严格 Agentic RL,因为没有用环境回报更新模型策略。(来源:原始论文记录(本地存档),pp.4-10)

核心内容

  • Memory M=(E,W,rho,C) 同时包含经验记忆、工作记忆 schema、调用策略和 checker;环境或工具证据通过 checker 后才能提交状态更新。(来源:原始论文记录(本地存档),pp.4-8)
  • 固定 Meta-Agent 从失败轨迹定位责任组件并提议局部修复;修复须同时通过源任务和 held-out development tasks,否则回滚。(来源:原始论文记录(本地存档),pp.8-10)
  • 作者报告 37 个 model-benchmark pair 中 35 个提升;但 Terminal-Bench 的 adaptation 相对同预算 retry 仅多 2.3 points,p=0.774,说明部分收益来自重试而非适应本身。(来源:原始论文记录(本地存档),pp.1, 23)

相关页面

来源

待核实问题

  • 公开性核实(2026-08-28):官方仓库已提供 evaluation/evolution code、Skill Memory packages、冻结 splits、安装和对照运行命令,采用 Apache-2.0;这满足“可启动复现材料已公开”,不等于结果已复现。(GitHub
  • 仍待独立复现:35/37 提升、组件定位、held-out gate 与跨模型迁移结果;本知识库未运行需要模型服务和 benchmark 环境的实验。
  • 解释边界:组件定位指标仍是最可能有效的 repair decision,不是因果识别;结果对 checker、split、模型服务和预算敏感。