SkillOpt: Executive Strategy for Self-Evolving Agent Skills

论文元数据

  • 标题: SkillOpt: Executive Strategy for Self-Evolving Agent Skills
  • 作者: Yifan Yang et al.
  • 机构: Microsoft + 上海交通大学 + 同济大学 + 复旦大学
  • arXiv: 2605.23904, 2026年5月
  • 代码: https://aka.ms/SkillOpt
  • 页数: 27页

问题概述

当前的 Agent skill 文档主要有三种来源:(1) 人工手写,(2) 一次性 LLM 生成,(3) 通过松散的自我修订演化而来。这些方法都无法像深度学习优化器那样——在反馈信号下稳定地、可证明地改进初始状态。没有一个方法能保证优化后的 skill 一定优于起点。

SkillOpt 提出了首个系统化的文本空间优化器(text-space optimizer),专门用于训练 Agent skill 文档。核心思想:将 skill 文档视为冻结 Agent 的”外部状态”,用一个独立的优化器模型(optimizer model)以深度学习式的纪律来训练它。

六项核心贡献

  • 贡献1 —— 文本空间优化范式: 首次将深度学习优化器的训练纪律(bounded edits、validation gate、negative feedback)引入 Agent skill 优化,使 skill 文档在反馈信号下稳定改进。
  • 贡献2 —— 冻结 Agent + 外部优化器架构: 目标 Agent 完全冻结,优化器模型独立运行。最终部署产物仅为一个 300-2000 token 的 markdown 文件,零推理开销
  • 贡献3 —— 有界编辑 + 文本学习率: 引入 add/delete/replace 三种结构化编辑操作,用编辑预算 L(edit budget)控制文本空间的”步长”,防止大规模语义跳变。
  • 贡献4 —— 留出验证门控: 每次编辑候选必须通过留出验证集(held-out validation gate)的严格检查,只有严格提升验证分数才接受,杜绝有害编辑积累。
  • 贡献5 —— 被拒编辑缓冲区: 失败的编辑提案被存入 rejected-edit buffer,作为后续优化器调用的负反馈信号,避免重复尝试无效方向。
  • 贡献6 —— 轮次级慢/元更新: 每轮(epoch)结束时进行全局反思,总结哪些编辑方向有效/失败,维持长期训练的稳定性。

关键结果

SkillOpt 在 52/52 个 (模型, 基准, harness) 组合中全部达到最佳或并列最佳。

基准Direct ChatCodex HarnessClaude Code Harness
SearchQA✓ 最佳✓ 最佳✓ 最佳
SpreadsheetBench✓ 最佳✓ 最佳✓ 最佳
OfficeQA✓ 最佳✓ 最佳✓ 最佳
DocVQA✓ 最佳✓ 最佳✓ 最佳
LiveMathematicianBench✓ 最佳✓ 最佳✓ 最佳
ALFWorld✓ 最佳✓ 最佳✓ 最佳
平均提升 (GPT-5.5)+23.5+24.8+19.1
  • 超越所有基线: 人工手写 skills、一次性 LLM 生成 skills、Trace2Skill、TextGrad、GEPA、EvoSkill
  • 优化后的 skill 具有跨模型、跨 harness、跨相近基准的迁移能力

标签

#skill-optimization #agent-skills #text-space-training #llm-agent

相关笔记