Agent Harness Engineering: A Survey

论文概览

这篇论文系统性地定义了 Agent Harness Engineering(智能体执行框架工程)——即包裹在 LLM 之外的工程基础设施层。核心论点是:在生产环境中,任务执行可靠性更大程度上取决于执行框架(harness)而非模型本身

  • 难度级别:Intermediate — 不要求数学推导,但需要对 LLM agent 系统有基本了解
  • 建议学习时间:45-60 分钟阅读,2-4 小时完整消化

如何阅读这份材料

文件内容优先级
summary.md详细摘要 + 关键数据⭐ 必读
insights.md核心见解与分析⭐⭐⭐ 最重要
qa.md15 道自测题⭐ 巩固知识
method.mdETCLOVG 框架详解⭐⭐ 核心内容
mental-model.md这篇论文在学术版图中的位置⭐ 辅助理解

Key Takeaways

  1. 绑定约束论题(Binding-Constraint Thesis):对于长程任务,基准方差可能由执行框架而非模型驱动
  2. ETCLOVG 七层分类法:Execution → Tool → Context → Lifecycle → Observability → Verification → Governance
  3. 工程三阶段演进:Prompt Engineering → Context Engineering → Harness Engineering
  4. 三个核心权衡:成本-质量-速度三角、能力-控制权衡、框架耦合问题
  5. 170+ 开源项目映射:揭示了生态系统的覆盖模式与空白

文件夹结构

~/claude-papers/papers/openreview-eONq7FdiHa/
├── paper.pdf              # 原始 PDF
├── meta.json              # 元数据
├── README.md              # 本文件
├── summary.md             # 详细摘要
├── insights.md            # 核心见解
├── qa.md                  # 自测题
├── method.md              # ETCLOVG 框架详解
├── mental-model.md        # 思维模型
├── index.html             # 交互式 HTML 探索器
├── images/                # 提取的图表
└── code/                  # 代码演示

相关笔记