论文

ReDAct:LLM 代理的不确定性延迟

ReDAct: Uncertainty-Aware Deferral for LLM Agents

智能体系统Agent 动作执行与治理

摘要

最近,基于 LLM 的代理在许多应用程序中变得越来越流行,包括复杂的顺序决策问题。然而,他们继承了LLM产生幻觉的倾向,从而导致错误的决定。在连续设置中,即使是一个错误也会不可逆转地降低轨迹,使幻觉成为一个更大的问题。虽然较大的 LLM 产生的幻觉较少,但它们的每个词元成本明显较高。在本文中,我们通过提出 ReDAt(Reason-Defer-Act)来解决这种权衡。在 ReDAct 中,代理配备了两个 LLM:默认使用的小型、廉价模型和大型、更可靠但昂贵的模型。当小模型的预测不确定性超过校准阈值时,决策将推迟到大模型。我们在基于文本的体现环境(例如 ALFWorld 和 MiniGrid)中评估了我们的方法,结果表明,仅将大约 15% 的决策推迟到大型模型就可以与专门使用它的质量相匹配,同时显着降低推理成本。