R2V Agent:教导 SLM 何时寻求帮助
R2V Agent: Teaching SLMs When to Ask for Help
摘要
高效的代理系统仅在较便宜的本地模型可能失败的决策中才会产生昂贵的前沿模型成本。现有的 LLM 级联通常在执行前路由整个查询,但任务难度会在中间轨迹发生变化 - 在不稳定的工具调用、截断的观察或复合局部错误之后 - 使得预执行路由变得脆弱。我们引入了 \textbf{R2V-Agent},一个用于交互式代理的风险校准 SLM-LLM 路由框架。 R2V 结合了四个组件:精炼的小语言模型 (SLM) 策略、更强的教师 LLM、在每个步骤对候选操作进行评分的轻量级流程验证器,以及校准的步骤级路由器。路由器是我们的核心贡献:SLM 训练完毕后,它会估计每一步的残余失败风险,并且仅在需要教师干预时才会升级。为了明确定义路由问题,我们首先使用标准离线管道训练稳定的本地 SLM:教师轨迹上的行为克隆(BC),然后是具有一致性正则化的验证者引导的直接偏好优化(DPO)。然后,使用 Brier 校准的概率估计和条件风险值 (CVaR) 约束目标,针对该固定策略的残余故障对路由器进行训练,该目标会惩罚扰动种子中最坏情况的故障。在具有四个 SLM 主干的 HumanEval+、TextWorld 和 TerminalBench 中,R2V 改进了可靠性成本边界:它在 $0.60\%$ LLM 升级的情况下实现了 $94.3\%$ HumanEval+ 的成功,将 TextWorld 从 $64.6\%$ 仅 SLM 的成功恢复到 $98.2\%$ 在 $41.7\%$ 升级的情况下,并达到$93.3\%$ TerminalBench 在 $33.9\%$ LLM 调用上取得成功,大约是启发式路由器成本的一半。