论文
SiLR:保持结构的准入与过程奖励机制用于大语言模型工具智能体
SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents
摘要
LLM工具智能体的运行时门控通常被建模为滤波器。在ReAct循环中,被拒绝的提案会以相同状态生成新的提案,因此门控是提案流上的搜索操作,其准入标准决定了哪些轨迹可达。我们研究了违反后恢复阶段的准入问题,即在系统仍处于违反状态时必须允许进展,发现存在标量投影陷阱:一个聚合分数门控会接受局部改进的提案并将其轨迹导向平台期。SiLR采用影子执行每条提案,并基于分支级违反状态的乘积序(包含过载分支支持和各分支严重性)进行准入。我们证明,不存在标量代理能对此序保持正确性,因此失败是表征性的,而非阈值调整问题。在挖掘的Gym-ANM场景中,SiLR在21个多动作episode中全部恢复,而终端类和最佳标量门控分别恢复0/21和9/21,结果在包含24个场景的完整基准中具有显著性。终端与结构化场景的二元差异在三个模型家族和CityLearn中均成立。由于准入基于确定性模拟,LLM位于信任边界之外:一种改变量级分布的攻击能击败标量和仅支持类基线,但仅通过完整分支级谓词才能防御。当两个约束家族同时激活时,所有测试的标量投影均允许物理不安全的动作;仅支持类允许的最大比例为63.2%(42,410个中),乘积序为0。在最困难的双家族轨迹中,标量门控仅通过不安全类恢复。当作为GRPO过程奖励复用时,其在所有挖掘场景中均优于计数投影,且是唯一一个未加门控策略超越未训练基线的奖励(0.844 vs. 0.778)。标量投影在两个设计点均丢失违反几何结构,唯有完整乘积序在结构上充分。
