论文

Agent知道自己做不到什么吗?评估工具使用Agent的可行性意识

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

智能体系统Agent任务评测

摘要

工具使用型Agent常因冗长的推理链与迭代的工具调用而产生可观的计算成本。在实际场景中,许多任务在受约束的工具环境下不可行,即成功完成任务所需的能力不可用。检测不可行任务并尽早停止执行,可显著减少不必要的执行成本。本文提出FeasiGen,一个自动构建不可行Agent任务的流水线,其通过识别成功完成任务所需的关键工具来构造此类任务。该方法从多个Agent系统的成功执行中抽取工具调用轨迹,识别在不同执行策略中一致共享的关键工具,并掩蔽这些工具,从而自动把可解任务变为不可行任务。人工验证确认,所构建任务的不可行性标注准确率超过94%。我们进一步提出可行性感知的评估指标,衡量Agent能否识别不可行任务并恰当地停止执行。对九个模型的大规模评估显示,其不可行性检测能力普遍较弱,错误继续率最高达73.9%。我们进一步观察到,多Agent架构能显著减少不可行条件下的错误执行。

Agent知道自己做不到什么吗?评估工具使用Agent的可行性意识:论文配图
图1:示例对比:智能体对不可行任务的早期识别,与未察觉不可行而错误继续执行的情形。