论文
HopRefusalBench:诊断多跳推理的搜索增强代理中的拒绝失败
HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning
摘要
搜索增强的 大语言模型 代理越来越有能力解决知识密集型任务,但当多跳问题基本上无法回答时,它们的行为仍然知之甚少。现有的弃权基准很大程度上暴露了单跳查询表面的缺陷,因此无法揭示仅在有效的中间推理和检索之后才出现的故障。我们引入了 HopRefusalBench,这是多跳搜索中第一个拒绝的受控基准,包含 889 个从基于 KILT 的实体路径构建的无法回答的问题。它将无法回答的三个原因(答案未知、错误前提和未指定上下文)与根、中间和终端拓扑交叉,使得前提验证、中间桥验证和终端停止可以单独观察。我们进一步提出了一个最终结果分类法,涵盖目标感知拒绝、伪拒绝、幻觉完成和搜索预算耗尽,以及触发后继续和词元浪费的源感知轨迹指标。在搜索增强模式下的 10 个前沿专有和开放权重模型中,最佳模型的目标感知正确停止率 (TCHR) 仅 42.9%。根项目和中间项目始终比终端项目更难,并且所有模型在错误前提下都达到最高 TCHR,在未指定问题上达到最低 TCHR。然而,当跨类别汇总时,每个模型的明确拒绝类响应中有 84.7--98.4% 确定了正确的理由,将主要瓶颈定位于做出适当的不回答;失败的轨迹反而会陷入幻觉或搜索预算耗尽。这些结果将多跳搜索中的拒绝确立为一个相应的评估问题,并为诊断和提高搜索增强代理的可靠性提供了基础。