Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

论文元数据

  • 标题: Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory
  • 作者: Haoran Sun 等(复旦大学、上海人工智能实验室、华中科技大学)
  • 发表: arXiv:2606.09365,2026 年 6 月
  • 简称: SkeMex

解决的问题

现有医疗智能体依赖原始轨迹记忆或模型微调来复用经验,但原始轨迹噪声大、冗余度高,且无法区分哪些记忆真正有用;而基于训练的方法计算成本高、存在灾难性遗忘风险,且每次改进都需重新部署。SkeMex 提出了一种部署后自演化(post-deployment self-evolution)框架,将医疗推理经验压缩为可复用的技能单元(skill units),在不更新模型权重的前提下,通过环境反馈持续评估和演化这些技能,实现跨任务、跨模型的泛化推理能力提升。

主要贡献

  • 技能记忆(Skill Memory):将部署经验蒸馏为紧凑的技能单元 m_i = (k_i, c_i, u_i),包含检索键、可复用临床步骤内容、效用统计量,在语义级别而非原始轨迹级别存储经验,大幅降低噪声和冗余。
  • 效用估计(Utility Estimation):引入基于环境反馈的信用分配机制——仅在技能被实际采用时更新其效用,使用窗口级优势估计消除单样本难度方差,确保只有真正有用的技能被保留和强化。
  • Read-Write-Assess-Govern 闭环生命周期:四阶段流水线实现技能的检索(价值感知多通道筛选)、写入(轨迹到技能的蒸馏)、评估(优势估计 + 信用分配)、治理(弃用 / 成熟 / 合并 / 归档),形成完整的自演化回路。
  • 即插即用泛化(Plug-and-Play Generalization):技能记忆与模型权重完全解耦,同一技能库可跨不同模型骨架(GPT-4、Qwen、DeepSeek)和异构任务设置泛化使用,无需任何重新训练。

关键实验结果

基准测试核心提升
HealthBench显著优于代表性记忆型智能体基线
LiveMedBench在动态临床场景中持续提升推理准确率
模型泛化GPT-4、Qwen、DeepSeek 均受益于同一技能库
效率检索开销边际成本远低于推理收益

学习导航

  • 难度: Intermediate(需了解 LLM Agent、记忆机制、强化学习基础)
  • 建议学习时间: ~45 分钟
  • 核心方法细节: 见 method.md
  • 深层理解与洞察: 见 insights.md