摘要

Astar 训练一个从工业迭代历史中提出下一轮可执行演化方向的模型,并把代码 Agent、训练/部署系统和真实结果接回后续训练。它是本批资料中少数在模型提案策略层使用 GRPO 的严格 Agentic RL 例子,同时展示模型、harness 与工业环境的有限共进化。(来源:原始论文记录(本地存档),pp.5, 9-16)

核心内容

  • 数据经 pairwise commit expansion、AST/reachability 归一化、配置白名单和 intent denoising 清洗;112B-token mid-training、81.1M positive-token SFT 后,用 reward model + GRPO 训练 0.6B/4B/8B 提案模型。(来源:原始论文记录(本地存档),pp.9-12)
  • reward model 预测候选改动能否降低系统 loss,并由周期性真实训练审计校准;作者报告 Astar-8B 真实执行 S@1 0.6786、reward AUC 0.8487,且 RL 消融继续提高 reward-model@1。(来源:原始论文记录(本地存档),pp.13-14)
  • Lazada recall model 的 20 次线上迭代与 A/B 数字属于作者披露的生产报告,闭数据、成本和独立复现条件有限;不能直接泛化到 coding/browser Agent。(来源:原始论文记录(本地存档),p.25)

相关页面

来源

待核实问题

  • 日期核实(2026-08-28):arXiv 记录为 2026-08-27 15:56 UTC,换算到 UTC+8 已是 2026-08-28;PDF 首页的 2026-08-28 与本地日期一致,不构成冲突。
  • 仍不可外部核实:reward model 漂移、线上 A/B 完整协议和闭数据。当前只有作者披露,且没有公开仓库或可复现生产环境。
  • 仍待验证:跨领域泛化,尤其不能从 Lazada 检索/广告系统直接推到 coding 或 browser Agent。