论文
被判定无用,无论如何受到质疑:使用工具的智能体很少将自己的证据判断转化为停止决策
Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
摘要
如果智能体的工具始终不返回任何有用的内容,则应该停止依赖它。在具有受控源故障的检索环境中,我们将智能体判断结果的方式与其执行的操作分开。我们比较较长和较短运行后在同一步骤中停止的结果,智能体判断无用;对于时钟或截止时间驱动的停止,这种对比度为零。在我们记录他们的判断的地方,我们测试的七个智能体在 97-100% 的情况下都认为失败来源的结果毫无用处,但他们中的大多数很少停止这种判断。当他们停止时,提示提示会改变,但不会改变他们停止的地方。来自记忆的回答许可和推理模式可以带来提前停止,无论证据如何,规定的预算将 7-8B 模型的停止移动到最后期限,并且最多部分地遵循提示中的停止规则或呼叫成本。仅当Harness强制执行积分步骤,使智能体在它判断为无用的连续五个结果后做出回答时,才会停止遵循证据。此步骤提高了每个模型的失败源成功率,在预算加倍时保持停止点固定,并且在智能体陈述其判断时不需要额外的判断调用。预先注册的 300 个新问题的复制证实了分离和规则的效果。