论文
从不确定性到有效干预:学习何时指导LLM Agent
From Uncertainty to Action: Learning to Steer LLM Agents
摘要
对LLM Agent进行干预,需要决定是否纠正、在哪一步纠正,以及采用什么机制。不确定性常被用于决定何时干预,但它能否指导这些具体选择仍不清楚。我们在每个非终止步骤分别采用四种机制干预Agent轨迹,并让每次干预后的执行继续直到任务结束。由此形成的逐步结果表(SOT),包含三个基准、两个Agent的1,864条轨迹及约82,000次反事实续跑。结果显示,不确定性可以识别容易失败的轨迹,却没有单一信号能够可靠定位干预真正有用的步骤。因此,我们提出VoS(Value of Steering,干预价值),一种可离线或在线使用的轨迹级监控器,从SOT学习每一步干预的价值,并据此选择干预位置。带有损害预算的触发机制决定是否干预,限制VoS对原本成功轨迹造成扰动的比例。VoS在基准、Agent及离线或在线方式构成的全部12种设置中均优于不加干预的执行,平均提升7.8个百分点;相较五种已有不确定性触发方法中最强者,在11种设置中表现更好,平均提升2.9个百分点。消融实验显示,依据实际测量的结果训练,以及严格限制干预损害,都是必要条件。
