论文

从相关性到执行效用:面向基于技能的LLM智能体的奖励感知动态执行门控

From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

智能体系统Agent 动作执行与治理Agent Skills

摘要

Agent 技能日益被用于为大语言模型(LLM)智能体配备可复用的程序性知识。尽管随着技能库不断扩大,近期工作已大幅改进技能检索,但检索到一个看似合理的技能组合并不能保证执行它是值得的。由于每次以技能为条件的 rollout 计算代价高昂,决定是否应执行检索到的组合已成为愈发重要的挑战。为此,我们提出奖励感知动态执行门(RADEG),一个位于技能检索与智能体执行之间的轻量级、与检索器无关的决策层。RADEG 学习一个低成本的代理模型,在昂贵的 rollout 启动之前预测查询-技能组合对的执行效用。为了在控制任务难度的同时获得有信息量的监督,我们通过删除、添加或替换一个技能对每个检索到的组合做局部扰动,产生匹配的同查询 rollout,从而分离组合构成对验证器奖励的影响。部署时,随着新的验证器反馈到来,RADEG 仅更新一个热启动的逻辑回归头,无需重训检索器或智能体即可低成本地调整执行/跳过边界。在 288 条收集到的 rollout 上的查询级留出评估中,RADEG 大幅减少不必要的智能体执行,同时保留大部分下游验证器奖励。它在不同执行预算下始终优于基于相关性和随机的门控,表明执行感知的代理建模为技能检索提供了实用且高性价比的补充。

从相关性到执行效用:面向基于技能的LLM智能体的奖励感知动态执行门控:论文配图
图1:动机研究概览。对于每个查询,GoS检索按PPR相关性排序的八技能包。我们构造三个局部变体并观察到,每种扰动都可能使验证器奖励增加、减少或保持不变,这表明更高的检索相关性并不可靠地意味着更高的执行效用。