详细摘要:Agent Harness Engineering: A Survey
背景与问题
2022-2024 年间,LLM agent 从概念验证(AutoGPT、BabyAGI)走向生产部署。然而一个反复出现的模式越来越清晰:同样的模型,不同的框架质量,可靠性可以相差数倍。
具体来说:
- 2025-2026 年,多个团队报告了仅通过修改执行框架(不改变模型)就实现了 10× 性能提升
- Anthropic、OpenAI、LangChain 在生产中独立得出了相同结论:框架即瓶颈
- 学术研究与工程实践之间存在鸿沟:研究者研究模型能力,工程师解决框架可靠性
三个核心主张
主张 1(概念性):框架是真实世界的绑定约束
- 三个近期案例证明框架级改动获得超过模型级改动的收益
- 提出了工程三阶段演化模型
主张 2(分类学):ETCLOVG 七层分类法
- E: Execution environment — 执行环境与沙箱
- T: Tool interface — 工具接口与协议
- C: Context management — 上下文与记忆管理
- L: Lifecycle/Orchestration — 生命周期与编排
- O: Observability — 可观测性
- V: Verification — 验证与评估
- G: Governance — 治理与安全
主张 3(实证):170+ 开源项目映射
- 执行层、工具层、生命周期层、验证层覆盖密集
- 可观测性和治理层在开源生态中较稀疏,更多存在于商业平台
关键数据
| 指标 | 数值 | 说明 |
|---|---|---|
| 框架级编码收益 | 最高 10× | 仅修改编辑工具格式,15 个模型全提升 |
| Terminal-Bench 2.0 提升 | +13.7 pp | 固定 GPT-5.2-Codex,仅改框架 |
| Meta-Harness 分数 | 76.4% | 自动框架优化超越手工方案 |
| Claude Code 权限提示减少 | 84% | 沙箱化后的安全收益 |
| 映射项目数 | 170+ | 最大的开源 agent-harness 语料库 |
| 论文页数 | 71 页 | 含详细附录 |
跨层综合:三个核心权衡
- 成本-质量-速度三角:在推理成本、任务质量和执行速度三者间权衡
- 能力-控制权衡:agent 越强,越难安全控制
- 框架耦合问题:agent 逻辑和框架越耦合,维护越困难
开放研究问题
- 执行环境的硬化与扩展
- 长程 agent 的状态可靠性
- 从 agent 轨迹中诊断失败
- 跨 agent、工具和人的标准化交接
- 框架如何随模型进步而演进