论文
度量多步LLM智能体中治控诱导的信念分歧
Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
摘要
软件智能体基准通常只报告是否解决任务,但智能体是经治控达成结果的——治控决定它看到什么、可采取哪些动作、哪些失败被修复、哪些状态被验证、哪些证据被记录。我们显示:即使任务、环境与基座LLM固定,治控也会改变智能体的多步信念。我们引入信念rollout诊断:在不同治控下引出关于进度、风险、可恢复性、约束、失败模式、不确定性、未来成功、修复成本与下一动作的结构化K步轨迹;定义跨治控信念分歧并分解为接口移位的到达项与随时间范围增长的成长项。在受控编码任务与公开基准压力测试上:阻断动作、压缩修复、选择性验证与成本感知证据裁剪常在保持最终成功的同时改变驱动后续决策的信念。我们进一步引入BIWM——免训练协议:规范化观测、记录被删分支、展开修复痕迹、记录验证掩码、影子执行风险分支并跨治控视图对齐信念轨迹。结果表明治控设计是智能体评估的实验变量而非实现细节。
