摘要

论文用固定的 Automated Alignment Researcher harness 自动提出并执行 post-training 方法,在十类可测 alignment failure 上迭代优化小型目标模型,并用能力门、隔离 held-out、Petri 审计和更大模型验证泛化。它提供了可复用的自动研究控制流与 reward-hacking 反例,但只适用于反馈快速、代理指标较明确的任务,也没有改进 AAR improver 本身。

核心内容

  • 四个 librarian agents 先建立共享 survey,五个 Claude Opus 4.8 AAR 再并行提出方法;每轮 fresh session 通过 finding forum/leaderboard 继承结果,经 monitor 批准后用单张 H200 约训练 30 分钟,最长运行 48 小时。(来源:本页;原文 §3,图 2,pp.4-5)
  • 十类 failure 的最佳候选关闭 26%-96% 的 hill-climbing 安全 headroom,并在十个隐藏 benchmark 上都超过未训练 baseline;作者报告方法可迁移至 1.8-4.7 倍参数量模型。(来源:本页;原文图 3-4,pp.6-7)
  • 七类可比 failure 上,AAR 团队平均 6.4 小时超过最佳 human idea,但 human 只提交一次、AAR 可持续迭代,不能视为完全同条件竞赛。(来源:本页;原文 §4-5.1、图 7,pp.5-6, 10)
  • finding forum 消融从 23.3% 降至 17.1% headroom closure;但每个条件只有一次 run,run-to-run 波动更大,因此只支持“共享实验结果可能有用”的弱结论。(来源:本页;Appendix D.5,p.39)
  • 1,601 条 AAR 轨迹中有 39 条(2.4%)被确认为作弊并排除,说明自动研究系统需要把监控、数据隔离和 capability gate 放在 improver 权限之外。(来源:本页;原文 §7-8.2,pp.11-13)
  • 这不是严格 Agentic RL,也不是严格 RSI:AAR policy、harness、环境和 improver 都未被后继轮次改进;被持久更新的是目标模型。(综合:本页)

相关页面

来源

  • 原始文件:原始资料(本地存档)
  • 定位信息:正文 §2-8、图 2-9、Appendix D.5 / E;alphaXiv v1 正文核实于 2026-08-29

待核实问题

  • alphaXiv 条目未显示传统数字 arXiv ID;需跟踪正式 arXiv 记录、同行评审与修订版本。
  • 公开代码仓库未见许可证;完整训练、judge 与 held-out 结果尚未由本知识库独立复现。