论文
HiL-Bench(Human-in-Loop Benchmark):智能体知道何时求助吗?
HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?
摘要
前沿编码智能体在给定完整上下文时能解决复杂任务,但在规格说明不完整或含糊时便会崩溃。瓶颈不在于原始能力,而在于判断力:知道何时自主行动、何时求助。当前基准对这一失败模式视而不见。它们提供无歧义的详细指令,且只奖励执行正确性,因此一个对缺失需求做出幸运猜测的智能体,与一个本会提问以求确定的智能体,得分完全相同。我们提出HiL-Bench(Human-in-the-Loop Benchmark,人在回路基准)来度量这种选择性上报技能。每个任务都包含经人工核验的阻塞点(缺失信息、含糊请求、矛盾信息),这些阻塞点只有通过渐进探索才会浮现,而非一开始即可查验。我们的核心指标Ask-F1——问题精确率与阻塞点召回率的调和平均——刻画了过度提问与沉默猜测之间的张力;其结构在架构上杜绝了通过提问刷屏来作弊。在SWE与text-to-SQL领域的评估揭示出一个巨大的普遍性判断鸿沟:在决定是否提问时,没有任何前沿模型能恢复超过一小部分的全信息性能。失败分析识别出三种关键的求助模式:过度自信的错误信念且无缺口检测;检测到高度不确定性却持续出错;宽泛而不精确的上报且缺乏自我纠正。这些一致的模式证实,糟糕的求助能力是模型层面的缺陷,而非任务特有。基于塑形Ask-F1奖励的强化学习训练表明判断力是可训练的:一个32B模型同时提升了求助质量与任务通过率,且增益可跨领域迁移。模型学到的并不是何时提问的领域特定启发式,而是学会检测不可解决的不确定性并据此行动。
