论文
GRASP:面向自改进LLM智能体的门控回归感知技能提议器
GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents
摘要
在结构化环境中行动的 LLM 代理以操作方式而不是对话方式失败,并且可靠性取决于环境的程序知识。先前的自我改进方法会积累自然语言指导,而不会检查每个新项目是否保留了之前的正确行为,因此修复一个轨迹的注释可能会默默地使另一个轨迹回归。我们引入了 GRASP(门控回归感知技能提议器),它将智能体改进视为对有限技能库的一系列编辑,只有当每个候选者在硬回归预算下对平衡的保留探针产生净改进时才接纳它。我们在两个基于 FHIR 的临床基准上评估了五个基本模型(gpt-oss-120b、DeepSeek V4 Flash、Gemini 3.1 Flash Lite、GPT-4.1、GPT-5.4)的 GRASP。在 MedAgentBench 上,GRASP 将 gpt-oss-120b 从 40.6% 提升到 88.8%,比五个自我改进基线中最强的一个提高了 21.0 分,并将所有其他基础模型提高了 17.2 到 40.3 分。消融将收益归因于比较提案生成、接受门和硬回归预算,而不是技能编写本身,未经验证并不比不使用技能好。该机制扩展到临床领域之外,改进了四个非临床环境中三个的代理,并且仅在行动空间开放的情况下保持平坦。冻结的库可以跨模型转移,其中来自较强模型的技能可以提高较弱的执行者的能力,使其超出他们自己学到的知识,而反之则不然,这是一种没有非门控基线重现的不对称性。
