论文
询问还是假设?在 编码智能体 中寻求不确定性澄清
Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents
摘要
随着 大语言模型 (LLM) 代理越来越多地部署在软件工程等开放领域中,它们经常遇到缺乏关键上下文的未指定指令。虽然人类开发人员自然会通过提出澄清问题来解决规格不足的问题,但当前的代理在很大程度上针对自主执行进行了优化。在这项工作中,我们系统地评估了 LLM 代理在 SWE-bench Verified 的未指定变体上寻求澄清的能力。我们提出了一种不确定性感知的多代理支架,可以将不规范检测与代码执行分离。在专有和开放权重前沿 LLM 中,我们的脚手架实现了 69.40% 的任务解决率,显着优于标准的单代理设置,并缩小了与按照完全指定的指令操作的代理的性能差距。此外,我们发现多智能体系统表现出经过良好校准的信息查找行为,保留对简单任务的查询,同时主动查找有关更复杂问题的信息。这些发现表明,当前的模型可以转变为主动协作者,智能体可以独立识别何时提出问题,以引出现实世界中未指定任务中缺失的信息。