摘要

StarHarness 把企业 Agent harness 作为可搜索的外部程序空间,按失败模式和 verifier 结果分层,用 proposer-visible、hidden selection 与 held-out evaluation 隔离搜索和泛化,并只接受通过验证且改善隐藏选择集的 patch。它是持久 harness 自进化和企业工作流验证的代表,不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.2-9)

核心内容

  • 搜索空间覆盖 prompt/task framing、工具 schema、参数预处理、skills、MCP、subagent、上下文、验证和 finish logic;patch 经过 scope/import/smoke 检查后才评估。(来源:原始论文记录(本地存档),pp.2-4)
  • ITBench SRE、EnterpriseOps-Gym 和 AutomationBench Finance 使用 Kubernetes、SQL verifier 或程序化 assertions;作者报告相对 GEPA(Pi) 分别提升 13.8、22.3、17.6 points。(来源:原始论文记录(本地存档),p.5)
  • GPT-5.4 的 paired baseline 到 evolved harness 在三项任务上为 40.0% 到 75.0%、23.3% 到 43.7%、57.1% 到 83.2%;但同时改动多个 harness 层,不能据此分离单个 patch 的因果贡献。(来源:原始论文记录(本地存档),pp.6-9)

相关页面

来源

待核实问题

  • 代码状态核实(2026-08-28):论文给出的 GitHub 仓库可访问,但只有一个 README.md,内容为 “Coming soon.”,没有实现、许可证、配置或复现脚本;因此当前不能把它写成“代码已公开”。(GitHub
  • 仍待独立复现:三个企业 benchmark 的提升、跨模型迁移和 patch 级归因;样本规模与每环境 4-12 个 accepted changes 也限制外推。