SkillOpt 学习材料索引
📄 论文元数据
| 字段 | 内容 |
|---|---|
| 英文标题 | SkillOpt: Executive Strategy for Self-Evolving Agent Skills |
| 中文译名 | SkillOpt:自进化 Agent 技能的执行策略 |
| 作者 | Yifan Yang et al. |
| 机构 | Microsoft, SJTU, Tongji, Fudan |
| 发布 | arXiv:2605.23904, 2026年5月 |
| 页码 | 27页 |
| 代码 | https://aka.ms/SkillOpt |
| 核心贡献 | 首个系统化的文本空间 Agent 技能优化器 —— 将技能文档视为可优化「参数」,用深度学习纪律(梯度式编辑、学习率预算、验证门禁、动量机制)进行受控训练 |
📁 文件清单
| # | 文件名 | 类型 | 描述 |
|---|---|---|---|
| 1 | architecture | HTML 架构图 | 自包含暗色主题 SVG 架构图,展示 SkillOpt 完整 Pipeline(Frozen Agent → Optimizer → Merge & Rank → Validation Gate → Accept/Reject 闭环),含图例和3张摘要卡片 |
| 2 | workflow-mermaid | Markdown + Mermaid | 三张 Mermaid 流程图:(1) 完整 Pipeline 流程图 (2) 深度学习类比映射图 (3) 关键设计决策脑图;含中文标注和 emoji |
| 3 | _index | 索引页 | 本文档:论文元数据、文件清单、推荐学习顺序 |
🎯 推荐学习顺序(5步)
第一步:快速概览
打开 architecture.html 在浏览器中查看架构总览图。重点理解 5 个核心模块的颜色编码和箭头流向:
- 🟢 Frozen Agent(翠绿)—— 执行 rollout
- 🔵 Optimizer Model(青色)—— 生成编辑提案
- 🟡 Merge & Rank(琥珀)—— 合并与预算裁剪
- 🟣 Validation Gate(紫色)—— 把关接受/拒绝
- ⚪ Rejected Buffer & Slow Update(灰蓝)—— 反馈闭环
第二步:深入 Pipeline
阅读 workflow-mermaid.md 中的 图解一(Pipeline 流程图),理解单次 Epoch 的完整数据流。
第三步:理解设计哲学
阅读 图解二(深度学习类比),理解 SkillOpt 为何不是简单的「让 LLM 改技能文档」,而是一个受控的优化过程——编辑是「梯度」、预算 L 是「学习率」、Gate 是「validation」。
第四步:把握关键设计
阅读 图解三(关键设计决策树),理解 Bounded Edits、Textual LR、Held-out Gate、Rejected Buffer、Slow Update 这五大设计为什么共同保证了优化稳定性。
第五步:回到论文
阅读 论文输入记录,获取完整摘要和关键亮点。如需深入,访问 arXiv 原文和代码仓库。