SkillOpt 学习材料索引

📄 论文元数据

字段内容
英文标题SkillOpt: Executive Strategy for Self-Evolving Agent Skills
中文译名SkillOpt:自进化 Agent 技能的执行策略
作者Yifan Yang et al.
机构Microsoft, SJTU, Tongji, Fudan
发布arXiv:2605.23904, 2026年5月
页码27页
代码https://aka.ms/SkillOpt
核心贡献首个系统化的文本空间 Agent 技能优化器 —— 将技能文档视为可优化「参数」,用深度学习纪律(梯度式编辑、学习率预算、验证门禁、动量机制)进行受控训练

📁 文件清单

#文件名类型描述
1architectureHTML 架构图自包含暗色主题 SVG 架构图,展示 SkillOpt 完整 Pipeline(Frozen Agent → Optimizer → Merge & Rank → Validation Gate → Accept/Reject 闭环),含图例和3张摘要卡片
2workflow-mermaidMarkdown + Mermaid三张 Mermaid 流程图:(1) 完整 Pipeline 流程图 (2) 深度学习类比映射图 (3) 关键设计决策脑图;含中文标注和 emoji
3_index索引页本文档:论文元数据、文件清单、推荐学习顺序

🎯 推荐学习顺序(5步)

第一步:快速概览

打开 architecture.html 在浏览器中查看架构总览图。重点理解 5 个核心模块的颜色编码和箭头流向:

  • 🟢 Frozen Agent(翠绿)—— 执行 rollout
  • 🔵 Optimizer Model(青色)—— 生成编辑提案
  • 🟡 Merge & Rank(琥珀)—— 合并与预算裁剪
  • 🟣 Validation Gate(紫色)—— 把关接受/拒绝
  • Rejected Buffer & Slow Update(灰蓝)—— 反馈闭环

第二步:深入 Pipeline

阅读 workflow-mermaid.md 中的 图解一(Pipeline 流程图),理解单次 Epoch 的完整数据流。

第三步:理解设计哲学

阅读 图解二(深度学习类比),理解 SkillOpt 为何不是简单的「让 LLM 改技能文档」,而是一个受控的优化过程——编辑是「梯度」、预算 L 是「学习率」、Gate 是「validation」。

第四步:把握关键设计

阅读 图解三(关键设计决策树),理解 Bounded Edits、Textual LR、Held-out Gate、Rejected Buffer、Slow Update 这五大设计为什么共同保证了优化稳定性。

第五步:回到论文

阅读 论文输入记录,获取完整摘要和关键亮点。如需深入,访问 arXiv 原文和代码仓库。


🔗 相关链接

  • 📥 论文输入记录:skillopt
  • 📊 全部 52/52 实验结果概览见 architecture.html 摘要卡片
  • 🔬 与 SkeMex 的对比:SkillOpt 是单一技能的「教练」;SkeMex 是多技能的「记忆系统」