论文

经不确定性对齐强化学习探索智能体工具调用决策

Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

模型训练强化学习Agentic RL

摘要

基于大型语言模型 (LLM) 的代理通常会做出次优的工具使用决策,包括不受支持的工具调用和幻觉的直接响应,这可能会在多步骤交互过程中累积错误。现有方法主要通过推理时间校正或基于决策结果和结构化清单的粗粒度奖励信号来改善这些行为,而代理决策的不确定性特征尚未得到充分探索。我们观察到,面向决策的强化学习往往会削弱正确和错误行为之间的不确定性分离,导致过度自信的错误和较弱的探索信号。因此,我们提出了 TRUST,它将不确定性量化纳入奖励设计中,作为维持不确定性分离的排斥力,并标记轻量级关键转弯注释,以用于多转弯轨迹的统一后训练。不同工具使用基准的实验结果表明,TRUST 不断提高决策质量和代理性能,同时在优化过程中保持更可靠的不确定性估计。

经不确定性对齐强化学习探索智能体工具调用决策:论文配图
图 1:错误决策但不确定性较低时工具调用决策失败与我们的 TRUST 解决方案之间的比较。