论文
临界状态强化学习:诊断多回转工具使用的可训练状态
Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use
摘要
多回合工具使用失败可能取决于单个模型调用,但奖励变化本身并不能揭示哪个调用将从训练中受益。当奖励取决于后来的交互时,它们的变化可以反映下游随机性,而不是当前行为之间的差异。我们引入临界状态强化学习来识别多轮交互中的可训练状态。给定任务定义的候选调用和本地奖励,该方法评估每个奖励是否捕获了操作对任务成功的影响以及是否可以改进参考策略。然后,它使用嵌套采样将依赖于动作的奖励变化与连续噪声分开,并使用上下文老虎机训练优化所选状态的策略。 Berkeley Function Calling Leaderboard (BFCL) v4 上的实验将诊断选择状态下的训练与替代状态下的训练进行了比较。对于功能缺失的任务,诊断会在工具可用后选择响应;对于缺少参数的任务,它会在提供缺少参数之前选择响应。训练选定的响应可以提高性能,包括在缺失功能的任务上提高约 14 个百分点,而训练替代方案则使性能持平或更差。我们进一步跨模型和任务应用该配方,包括记录重复调用避免和内存管理。