详细摘要:Agent Harness Engineering: A Survey

背景与问题

2022-2024 年间,LLM agent 从概念验证(AutoGPT、BabyAGI)走向生产部署。然而一个反复出现的模式越来越清晰:同样的模型,不同的框架质量,可靠性可以相差数倍

具体来说:

  • 2025-2026 年,多个团队报告了仅通过修改执行框架(不改变模型)就实现了 10× 性能提升
  • Anthropic、OpenAI、LangChain 在生产中独立得出了相同结论:框架即瓶颈
  • 学术研究与工程实践之间存在鸿沟:研究者研究模型能力,工程师解决框架可靠性

三个核心主张

主张 1(概念性):框架是真实世界的绑定约束

  • 三个近期案例证明框架级改动获得超过模型级改动的收益
  • 提出了工程三阶段演化模型

主张 2(分类学):ETCLOVG 七层分类法

  • E: Execution environment — 执行环境与沙箱
  • T: Tool interface — 工具接口与协议
  • C: Context management — 上下文与记忆管理
  • L: Lifecycle/Orchestration — 生命周期与编排
  • O: Observability — 可观测性
  • V: Verification — 验证与评估
  • G: Governance — 治理与安全

主张 3(实证):170+ 开源项目映射

  • 执行层、工具层、生命周期层、验证层覆盖密集
  • 可观测性和治理层在开源生态中较稀疏,更多存在于商业平台

关键数据

指标数值说明
框架级编码收益最高 10×仅修改编辑工具格式,15 个模型全提升
Terminal-Bench 2.0 提升+13.7 pp固定 GPT-5.2-Codex,仅改框架
Meta-Harness 分数76.4%自动框架优化超越手工方案
Claude Code 权限提示减少84%沙箱化后的安全收益
映射项目数170+最大的开源 agent-harness 语料库
论文页数71 页含详细附录

跨层综合:三个核心权衡

  1. 成本-质量-速度三角:在推理成本、任务质量和执行速度三者间权衡
  2. 能力-控制权衡:agent 越强,越难安全控制
  3. 框架耦合问题:agent 逻辑和框架越耦合,维护越困难

开放研究问题

  1. 执行环境的硬化与扩展
  2. 长程 agent 的状态可靠性
  3. 从 agent 轨迹中诊断失败
  4. 跨 agent、工具和人的标准化交接
  5. 框架如何随模型进步而演进

相关笔记