论文

默认陷阱:重新思考使用工具的 LLM Agent的计划评估

The Default Trap: Rethinking Plan Evaluation in Tool-Using LLM Agents

模型评测评测方法与指标

摘要

当默认对齐的整个计划被删除时,执行器可以对所提供计划优先级的变化做出强烈响应,同时显示相同信息选择概率的微小变化。我们将后者解释为对替代优先事项反应较弱的风险称为默认陷阱。我们将优先考虑不同信息目标的配对计划与共享的无计划参考进行比较。会计身份将这些不同的行为对比联系起来。在 160 个选定的零售、航空公司和 AgentDojo 任务的 3,200 个决策窗口中,切换优先级会强烈重定向两个模型的选择,而两个计划与默认对比有所不同。在另外 2,160 个窗口中,颠倒帐户列表顺序会使默认目标选择发生 63.3-98.3 个百分点的变化;无论顺序如何,优先级切换效果都保持在 96.7-100.0 点。一项单独的 3,240 个窗口组件研究发现,在单个优先级句子下有很强的控制力,附加文本的效果因组和方向而异。最后,相对于没有计划,1,080 个完整任务场景观察到的成功差异为 -19.4 到 +8.3 分。所有零售和航空公司的成功间隔均包括零; AgentDojo 结果描述了四个固定的应用程序世界。这些发现支持对优先级响应、与演示相关的默认值以及任务成功和成本的联合报告。