论文

何时“足够”并不足够?搜索智能体中的虚幻完成

When Is Enough Not Enough? Illusory Completion in Search Agents

智能体系统Agent任务评测

摘要

近期的搜索智能体利用多轮推理与搜索工具,在多跳与长时程基准上取得强劲表现。然而尚不清楚,它们能否通过追踪、验证并维持这些问题中的多个条件,对所有要求进行可靠推理。我们在多约束问题下研究这一能力,其中有效答案必须同时满足若干约束。我们发现虚幻完成频繁发生:尽管存在未解决或被违反的约束,智能体仍认为任务已完成,导致验证不足的答案。为诊断这种行为,我们提出Epistemic Ledger,一个在多轮推理全程追踪每个约束的证据支持与智能体信念的评估框架。我们的分析揭示了四种反复出现的失败模式:裸断言、被忽视的反驳、停滞与过早退出。受这些发现启发,我们通过LiveLedger——一个推理时跟踪器——检验在执行过程中进行显式约束状态跟踪能否缓解这些失败。这一简单干预持续改善表现,在多约束问题上大幅减少验证不足的答案(最多减少26.5%),并提升总体准确率(最多提升11.6%)。

何时“足够”并不足够?搜索智能体中的虚幻完成
图2:我们工作的概览。详细说明请一并参见 §3.1–3.5。