论文

校准不是控制:为什么LLM智能体监督需要干预

Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention

智能体系统Agent 动作执行与治理Agent Harness

摘要

LLM智能体的运行时监督常被框定为标量风险预测:估计失败似然、置信或不确定性——然后在分数越阈值时干预。我们主张该框定为控制瞄准了错误对象。相关问题不是智能体继续下去有多大可能失败——而是可用干预能否改善结果。两个轨迹前缀可以有相同的风险估计——却需要不同动作——因为一个仍可挽回——另一个不能。我们把该失配形式化为目标错误——并把干预优势(干预而非继续的期望效用增益)识别为监督的决策对象。为测量该失配——我们引入前缀分支——从相同轨迹状态执行候选动作的同前缀反事实协议。跨四个基准——动作条件化控制相对标量路由带来依机制而异的增益。在校准分解中——重新校准同一标量分数改进预测指标——但控制遗憾不变——表明仅校准不能修复目标错误。一个简单的仅前缀动作条件化控制器在最强交互机制中大幅降低遗憾——ALFWorld上从0.506到0.110。当干预弱或标量路由已保留干预相关信息时——增益缩小。这些结果提示LLM智能体监督应从校准的风险评分转向动作条件化的价值估计。

校准不是控制:为什么LLM智能体监督需要干预:论文配图
图 1:目标不匹配概述。标量风险监督预测如果代理继续并应用阈值规则可能会发生什么。然而,具有相同持续风险的国家在可恢复性方面可能有所不同,并且需要采取不同的行动。相反,我们将监督框架为行动条件控制:比较可用行动的下游价值并选择具有最高预期效用的行动。