摘要
Context Engineering 是为模型构造、筛选、维护和呈现任务上下文的系统性方法,目标是在长时任务中保留必要状态,同时避免把全部历史无差别塞入上下文窗口。(来源:Harness Engineering for Self-Improvement)
核心内容
定义
它把上下文视为可演化的结构化资产,并通过搜索、选择、过滤、格式化和持久化等操作维护其生命周期。(来源:Harness Engineering for Self-Improvement)
关键要点
- ACE 通过生成、反思和整理三个角色增量维护结构化 playbook,避免反复重写整块提示造成信息坍缩。(来源:Harness Engineering for Self-Improvement)
- MCE 进一步区分“如何管理上下文”的机制与“上下文中有什么”的内容,在元层优化技能、在基础层优化任务上下文。(来源:Harness Engineering for Self-Improvement)
- 文件系统可承载长期记忆、执行轨迹和产物,让模型按需检索,而非让所有状态常驻当前对话。(来源:Harness Engineering for Self-Improvement)
- 诊断上下文失败时,应区分 harness 压缩删除了必要信息,还是信息仍然可用但模型出现目标漂移或状态跟踪失败;两者需要不同修复。(来源:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures)
- Meta-Harness 把这种按需访问推进到优化器本身:proposer 从文件系统选择性读取所有候选的代码、分数与 raw traces。完整接口在文本分类搜索集上的中位/最佳准确率为 50.0%/56.7%,高于 scores-only 的 34.6%/41.3%,说明预先压缩反馈会丢失可用于长程归因的信息。(来源:Meta-Harness: End-to-End Optimization of Model Harnesses,表 3,p.7)
- Computer-use 观察也有明显预算权衡:OSWorld 的单次 a11y observation 在 90 分位达到 6343.60 tokens;增加历史对 Set-of-Marks 基线有帮助,却让 screenshot-only 的长历史表现下降,说明“更多上下文”不是单调收益。(来源:OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments,§5.2)
适用范围与边界
尤其适合长时、多阶段、可中断的智能体任务。它不能自动保证信息正确,仍需来源追踪、去重、评估与失效信息清理机制。(来源:Harness Engineering for Self-Improvement)
分歧与演变
上下文工程究竟长期属于外部软件层,还是会成为模型智能的一部分,文章认为仍是开放问题。(来源:Harness Engineering for Self-Improvement)
相关页面
- 上位概念:Harness Engineering
- 相关概念:Self-Improving Harness、Agent Failure Localization、Computer-Use Agent
- 相关实体:Lilian Weng、Interaction-Centric Agent Failure Taxonomy、Meta-Harness、OSWorld
- 相关主题:LLM Agent Self-Improvement、Browser and Computer-Use Agents
来源
- Harness Engineering for Self-Improvement
- Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures
- Meta-Harness: End-to-End Optimization of Model Harnesses
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
待核实问题
- ACE 与 MCE 的具体实验结论尚待核对各自原论文;Meta-Harness 已完成 v1 全文核对。