论文

知道何时提问:分层语言智能体的自门控澄清

Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents

智能体系统Agent 规划

摘要

在分层推理中,失败通常起源于中间决策点,其中代理提交到错误的分支,而没有意识到它缺乏关键信息。我们不将澄清视为外部不​​确定性触发器,而是提出行动评级,这是一种将其置于智能体行动空间内的公式,与导航共享序数尺度,以便在每个决策点询问与行动直接竞争,并且在中间状态下可以观察到寻求帮助。代理人自己的评级出现了两种结构上不同的信息寻求模式:强制性(没有可行的分支)和机会主义(尽管有领先的候选人,但仍然存在不确定性)。在统一收费表分类(30,000 个节点分类、三个基准、4 个系列的 9~LLM)方面,我们观察到从强制澄清到机会主义澄清的制度转变,信息寻求有效性 (ISE) 是一种本地诊断,定义为帮助交互的比例,然后是正确的下一步导航步骤(不是最终任务指标),从 50% 上升到 74%。三种诊断对比无法重现这种结构。可分离性测试表明,当答案质量下降(-18.8% 准确度)时,信息寻求模式(模式分割、ISE 排名)仍然存在,这支持了代理寻求帮助的位置与其收到的帮助的质量之间的经验分离。在受控答案通道下,10位准确率提升达到+16.2%;我们将此视为更好的本地化可以解锁的上限,而不是部署估计。

知道何时提问:分层语言智能体的自门控澄清:论文配图
图 2:CBP-NY 上的澄清行为 (n=1,181),Claude Opus 4.6。 (a) QA 量和 ISE。堆叠条形图:每条记录的平均 QA,按模式(橙色:强制;绿色:机会性)和结果(实心:有效;浅色:无效)划分。右轴:10 位精度(蓝色菱形)。每个条上方的注释:总 QA/记录和总体 ISE (%)。 τ=10\tau{=}10 条件(概述)将交易量从强制性转变为机会性,同时最大限度地提高准确性。 (b) 澄清模式的 ISE。分组条形图比较每个阈值下的强制性 ISE(橙色)与机会性 ISE(绿色);在 τ=10\tau{=}10 时,两者都达到 ≈\approx75%,而在 τ=1\tau{=}1 时,两者均下降至 62%(过度触发)。