SkillOpt: Executive Strategy for Self-Evolving Agent Skills
论文元数据
- 标题: SkillOpt: Executive Strategy for Self-Evolving Agent Skills
- 作者: Yifan Yang et al.
- 机构: Microsoft + 上海交通大学 + 同济大学 + 复旦大学
- arXiv: 2605.23904, 2026年5月
- 代码: https://aka.ms/SkillOpt
- 页数: 27页
问题概述
当前的 Agent skill 文档主要有三种来源:(1) 人工手写,(2) 一次性 LLM 生成,(3) 通过松散的自我修订演化而来。这些方法都无法像深度学习优化器那样——在反馈信号下稳定地、可证明地改进初始状态。没有一个方法能保证优化后的 skill 一定优于起点。
SkillOpt 提出了首个系统化的文本空间优化器(text-space optimizer),专门用于训练 Agent skill 文档。核心思想:将 skill 文档视为冻结 Agent 的”外部状态”,用一个独立的优化器模型(optimizer model)以深度学习式的纪律来训练它。
六项核心贡献
- 贡献1 —— 文本空间优化范式: 首次将深度学习优化器的训练纪律(bounded edits、validation gate、negative feedback)引入 Agent skill 优化,使 skill 文档在反馈信号下稳定改进。
- 贡献2 —— 冻结 Agent + 外部优化器架构: 目标 Agent 完全冻结,优化器模型独立运行。最终部署产物仅为一个 300-2000 token 的 markdown 文件,零推理开销。
- 贡献3 —— 有界编辑 + 文本学习率: 引入 add/delete/replace 三种结构化编辑操作,用编辑预算 L(edit budget)控制文本空间的”步长”,防止大规模语义跳变。
- 贡献4 —— 留出验证门控: 每次编辑候选必须通过留出验证集(held-out validation gate)的严格检查,只有严格提升验证分数才接受,杜绝有害编辑积累。
- 贡献5 —— 被拒编辑缓冲区: 失败的编辑提案被存入 rejected-edit buffer,作为后续优化器调用的负反馈信号,避免重复尝试无效方向。
- 贡献6 —— 轮次级慢/元更新: 每轮(epoch)结束时进行全局反思,总结哪些编辑方向有效/失败,维持长期训练的稳定性。
关键结果
SkillOpt 在 52/52 个 (模型, 基准, harness) 组合中全部达到最佳或并列最佳。
| 基准 | Direct Chat | Codex Harness | Claude Code Harness |
|---|---|---|---|
| SearchQA | ✓ 最佳 | ✓ 最佳 | ✓ 最佳 |
| SpreadsheetBench | ✓ 最佳 | ✓ 最佳 | ✓ 最佳 |
| OfficeQA | ✓ 最佳 | ✓ 最佳 | ✓ 最佳 |
| DocVQA | ✓ 最佳 | ✓ 最佳 | ✓ 最佳 |
| LiveMathematicianBench | ✓ 最佳 | ✓ 最佳 | ✓ 最佳 |
| ALFWorld | ✓ 最佳 | ✓ 最佳 | ✓ 最佳 |
| 平均提升 (GPT-5.5) | +23.5 | +24.8 | +19.1 |
- 超越所有基线: 人工手写 skills、一次性 LLM 生成 skills、Trace2Skill、TextGrad、GEPA、EvoSkill
- 优化后的 skill 具有跨模型、跨 harness、跨相近基准的迁移能力
标签
#skill-optimization #agent-skills #text-space-training #llm-agent
相关笔记
- insights — 核心洞察与概念转变
- method — 方法详解与 DL 类比
- pre-reading-formula-motivation — 设计动机与对比分析