论文

AgentAbstain:LLM智能体知道何时不该行动吗

AgentAbstain: Do LLM Agents Know When Not to Act?

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

基于大语言模型(LLM)的智能体系统日益被部署执行自主任务,但既有评估大多关注任务成功,而非智能体是否知道何时应弃权。该空白带来真实风险:在歧义、约束冲突或工具失败下,智能体可能执行意外且不可逆的动作。为弥合该差距,我们提出首个系统的智能体弃权评估框架:工具使用型LLM智能体识别“何时不行动”的校准能力。AgentAbstain的核心是一个配对任务基准:建立在跨执行前推理与运行时发现的8类弃权场景的智能体原生分类之上;含42个可执行沙箱环境中的263个配对任务——每对由一个应行动任务与一个经受控扰动(指令、工具或环境状态)产生的应弃权变体构成。为规模化该配对设计并抵抗数据污染,我们提出AbstainGen:全自动合成沙箱环境并端到端生成配对任务的管线,经确定性重放与语义LLM裁判验证;新任务实例可按需再生成,三名独立标注者把94–98%的抽样任务评为设计良好。跨17个前沿LLM、4种智能体治控:最佳智能体(Gemini 3.1 Pro)仅取得59.5%的配对准确率(每对任务的行动与弃权两侧都正确)。更重要的是,弃权能力与通用任务解决能力大体独立——仅靠扩展任务解决能力无法弥合该差距。我们进一步识别事后弃权等失败模式:智能体在识别弃权触发前就执行了不可逆动作。代码与数据集开源于agentabstain.github.io。

AgentAbstain:LLM智能体知道何时不该行动吗:论文配图
图 1:同一应弃权任务上的四种不同代理行为。 (a) 用户指令请求文件验证和简报创建。 (b) MCP 沙盒环境包含相互矛盾的证据:文件元数据列出版本 2024,而注册表列出 2025。 (c) 每个面板显示我们 2×22{\times}2 评估的四个结果之一(提交检查 ×\times 响应弃权);只有成功弃权才会被计为对应该弃权任务的正确弃权。