论文

度量多步LLM智能体中治控诱导的信念分歧

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

模型评测智能体系统Agent Harness评测方法与指标

摘要

软件智能体基准通常只报告是否解决任务,但智能体是经治控达成结果的——治控决定它看到什么、可采取哪些动作、哪些失败被修复、哪些状态被验证、哪些证据被记录。我们显示:即使任务、环境与基座LLM固定,治控也会改变智能体的多步信念。我们引入信念rollout诊断:在不同治控下引出关于进度、风险、可恢复性、约束、失败模式、不确定性、未来成功、修复成本与下一动作的结构化K步轨迹;定义跨治控信念分歧并分解为接口移位的到达项与随时间范围增长的成长项。在受控编码任务与公开基准压力测试上:阻断动作、压缩修复、选择性验证与成本感知证据裁剪常在保持最终成功的同时改变驱动后续决策的信念。我们进一步引入BIWM——免训练协议:规范化观测、记录被删分支、展开修复痕迹、记录验证掩码、影子执行风险分支并跨治控视图对齐信念轨迹。结果表明治控设计是智能体评估的实验变量而非实现细节。

度量多步LLM智能体中治控诱导的信念分歧:论文配图
图 1:相同的任务和相同的大语言模型在不同的利用下可能会产生不同的信念。这个示意性类比在改变界面的同时保持任务固定。在提供刀叉的原始参考工具 H0H_{0} 下,模型判断牛排任务是可行的,并分配很高的成功概率。在风险门控工具 H2H_{2} 下,筷子界面被重新标记为违反策略的条件,并且模型分配了较低的成功概率。这里,H0H_{0} 和 H2H_{2} 表示软件实验中使用的相同原始参考和风险门控角色,K=5K=5 是用于计算 Dbelief​(H0,H2,K)D_{\mathrm{belief}}(H_{0},H_{2};K) 的信念推出范围。尽管任务和基础大语言模型保持不变,但工具改变了交互证据,从而改变了对任务难度和预期成功的诱导信念。