论文

早问、晚问、正确问:澄清时机对于长期代理来说什么时候很重要?

Ask Early, Ask Late, Ask Right: When Does Clarification Timing Matter for Long-Horizon Agents?

智能体系统Agent任务评测

摘要

长期人工智能代理执行涵盖数百个连续操作的复杂工作流程,但早期的一个错误假设可能会导致不可逆转的错误。当指令不完整时,代理不仅必须决定是否要求澄清,还必须决定何时要求澄清,并且之前没有工作衡量澄清值在执行过程中如何变化。我们引入了一个强制注入框架,该框架在代理轨迹的受控点提供 真值 澄清,涵盖四个信息维度(目标、输入、约束、上下文)、三个代理基准和四个前沿模型(每个基准三个;仅在单个基准上一个;84 个任务变体;6,000 多次运行)。与“越早越好”的普遍直觉相反,我们发现澄清的价值很大程度上取决于缺失的信息:目标澄清在执行 10% 后几乎失去所有价值(pass@3 从 0.78 下降到基线),而输入澄清保留了大约 50% 的价值。将任何澄清类型推迟到中间轨迹之后都会使性能降低到根本不询问的程度。跨模型 Kendall tau 相关性(共享相同任务覆盖范围的模型之间为 0.78-0.87;整个 4 模型面板中为 0.34-0.67)证实这些时序配置文件基本上是任务固有的。对 300 个无脚本会话的补充研究表明,当前的前沿模型没有在经验最优窗口内提出问题,其策略范围从过度询问(52% 的会话)到根本不询问。这些经验需求曲线提供了现有理论框架所需但缺乏的定量基础,并为时间意识澄清政策建立了具体的设计目标。代码和数据将公开发布。