论文
从相关性到执行效用:面向基于技能的LLM智能体的奖励感知动态执行门控
From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents
摘要
Agent 技能日益被用于为大语言模型(LLM)智能体配备可复用的程序性知识。尽管随着技能库不断扩大,近期工作已大幅改进技能检索,但检索到一个看似合理的技能组合并不能保证执行它是值得的。由于每次以技能为条件的 rollout 计算代价高昂,决定是否应执行检索到的组合已成为愈发重要的挑战。为此,我们提出奖励感知动态执行门(RADEG),一个位于技能检索与智能体执行之间的轻量级、与检索器无关的决策层。RADEG 学习一个低成本的代理模型,在昂贵的 rollout 启动之前预测查询-技能组合对的执行效用。为了在控制任务难度的同时获得有信息量的监督,我们通过删除、添加或替换一个技能对每个检索到的组合做局部扰动,产生匹配的同查询 rollout,从而分离组合构成对验证器奖励的影响。部署时,随着新的验证器反馈到来,RADEG 仅更新一个热启动的逻辑回归头,无需重训检索器或智能体即可低成本地调整执行/跳过边界。在 288 条收集到的 rollout 上的查询级留出评估中,RADEG 大幅减少不必要的智能体执行,同时保留大部分下游验证器奖励。它在不同执行预算下始终优于基于相关性和随机的门控,表明执行感知的代理建模为技能检索提供了实用且高性价比的补充。
