摘要
Astar 训练一个从工业迭代历史中提出下一轮可执行演化方向的模型,并把代码 Agent、训练/部署系统和真实结果接回后续训练。它是本批资料中少数在模型提案策略层使用 GRPO 的严格 Agentic RL 例子,同时展示模型、harness 与工业环境的有限共进化。(来源:原始论文记录(本地存档),pp.5, 9-16)
核心内容
- 数据经 pairwise commit expansion、AST/reachability 归一化、配置白名单和 intent denoising 清洗;112B-token mid-training、81.1M positive-token SFT 后,用 reward model + GRPO 训练 0.6B/4B/8B 提案模型。(来源:原始论文记录(本地存档),pp.9-12)
- reward model 预测候选改动能否降低系统 loss,并由周期性真实训练审计校准;作者报告 Astar-8B 真实执行 S@1 0.6786、reward AUC 0.8487,且 RL 消融继续提高 reward-model@1。(来源:原始论文记录(本地存档),pp.13-14)
- Lazada recall model 的 20 次线上迭代与 A/B 数字属于作者披露的生产报告,闭数据、成本和独立复现条件有限;不能直接泛化到 coding/browser Agent。(来源:原始论文记录(本地存档),p.25)
相关页面
- 概念:Agentic RL、Recursive Self-Improvement、Self-Improving Harness、Harness Engineering
- 实体:Astar
- 主题:LLM Agent Self-Improvement
来源
- 原始文件:原始资料(本地存档)
- alphaXiv:https://www.alphaxiv.org/abs/2608.27287
- arXiv:https://arxiv.org/abs/2608.27287
- 定位信息:pp.1, 5, 9-16, 25
待核实问题
- 日期核实(2026-08-28):arXiv 记录为 2026-08-27 15:56 UTC,换算到 UTC+8 已是 2026-08-28;PDF 首页的 2026-08-28 与本地日期一致,不构成冲突。
- 仍不可外部核实:reward model 漂移、线上 A/B 完整协议和闭数据。当前只有作者披露,且没有公开仓库或可复现生产环境。
- 仍待验证:跨领域泛化,尤其不能从 Lazada 检索/广告系统直接推到 coding 或 browser Agent。