论文
重试、切换还是放弃?经受控错误注入学习策略感知的工具使用策略
Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection
摘要
使用工具的LLM智能体通常在工具调用可靠成功的环境中训练和评估,然而部署中的工具可能瞬时、持续或静默地失败。因此稳健恢复不仅仅是重复重试:智能体可能需要重试同一路径、切换到替代路径,或认识到已无可行路径。我们提出BENCH2ROBUST,一个将无故障工具使用基准转化为受控随机环境的框架,具有场景控制的可解性,其中回合明确要求在可用路径耗尽后进行重试、切换或停止。我们使用BENCH2ROBUST研究两种互补干预:通过贝叶斯工具记忆(BTM)提供的结构化运行时恢复上下文,以及课程控制的强化学习。在来自4个家族的7个模型和两个多轮基准家族上,工具失败产生近乎普遍的鲁棒性差距。在留出的Retail任务上,BTM无需再训练即可将鲁棒性提升最高16.8个百分点,而RL学到互补的恢复行为,在没有推理时BTM的情况下仍然有益。二者结合在注入下达到40.8-45.5%,同时保持无故障性能。这些结果表明,稳健的工具使用受益于将环境特定的恢复知识与习得的恢复行为相结合。