论文

RL 是否扩大了 LLM Agent 的能力边界? PASS@(k,T) 分析

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

模型评测模型能力评测

摘要

强化学习是否真正扩展了 LLM 代理的功能,还是仅仅使它们更加可靠?对于静态推理,最近的工作回答了第二个问题:基本曲线和 RL pass@k 曲线在大 k 处收敛。我们询问这是否适用于代理工具的使用,其中 T 轮交互启用了重新采样无法恢复的组合策略。我们引入了 PASS@(k,T),这是一种二维度量,它共同改变采样预算 k 和交互深度 T,将能力扩展与效率改进分开。我们的主要发现是,与静态推理结果相反,使用工具的强化学习确实扩大了能力边界:强化学习代理的通过曲线拉到基础模型的上方,并且差距在大 k 时扩大而不是收敛。该扩展特定于组合的、顺序的信息收集;在更简单的任务上,强化学习的表现与之前的工作预测一致。在匹配的训练数据下,有监督的 微调 在相同的组合任务上回归边界,将自我导向的探索隔离为因果因素。机制分析表明,强化学习将基本策略分布重新加权到子集,其下游推理通常会产生正确答案,改进集中在智能体如何整合检索到的信息上。这些结果协调了 LLM 的 RL 的乐观和悲观读数:在不同的任务类型上,两者都是正确的。