摘要
StarHarness 把企业 Agent harness 作为可搜索的外部程序空间,按失败模式和 verifier 结果分层,用 proposer-visible、hidden selection 与 held-out evaluation 隔离搜索和泛化,并只接受通过验证且改善隐藏选择集的 patch。它是持久 harness 自进化和企业工作流验证的代表,不是严格 Agentic RL。(来源:原始论文记录(本地存档),pp.2-9)
核心内容
- 搜索空间覆盖 prompt/task framing、工具 schema、参数预处理、skills、MCP、subagent、上下文、验证和 finish logic;patch 经过 scope/import/smoke 检查后才评估。(来源:原始论文记录(本地存档),pp.2-4)
- ITBench SRE、EnterpriseOps-Gym 和 AutomationBench Finance 使用 Kubernetes、SQL verifier 或程序化 assertions;作者报告相对 GEPA(Pi) 分别提升 13.8、22.3、17.6 points。(来源:原始论文记录(本地存档),p.5)
- GPT-5.4 的 paired baseline 到 evolved harness 在三项任务上为 40.0% 到 75.0%、23.3% 到 43.7%、57.1% 到 83.2%;但同时改动多个 harness 层,不能据此分离单个 patch 的因果贡献。(来源:原始论文记录(本地存档),pp.6-9)
相关页面
- 概念:Harness Optimization、Self-Improving Harness、Recursive Self-Improvement
- 实体:StarHarness
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.24804
- arXiv:https://arxiv.org/abs/2608.24804
- GitHub:https://github.com/ServiceNow/StarHarness
- 定位信息:pp.1-9
待核实问题
- 代码状态核实(2026-08-28):论文给出的 GitHub 仓库可访问,但只有一个
README.md,内容为 “Coming soon.”,没有实现、许可证、配置或复现脚本;因此当前不能把它写成“代码已公开”。(GitHub) - 仍待独立复现:三个企业 benchmark 的提升、跨模型迁移和 patch 级归因;样本规模与每环境 4-12 个 accepted changes 也限制外推。