论文

别启动你完成不了的任务:LLM智能体支持状态分诊的反事实审计

Don't Start What You Can't Finish: A Counterfactual Audit of Support-State Triage in LLM Agents

智能体系统Agent任务评测

摘要

当前的智能体评估大多奖励在完全明确任务上的执行,而近期工作对澄清[11, 22, 2]、能力自知[9, 1]、弃答[8, 14]与搜索终止[20, 5]的研究大多是割裂进行的。智能体能否在行动前诊断任务为何受阻,这一问题仍悬而未决。我们提出支持状态分诊审计(Support-State Triage Audit,SSTA-32),一个配对项诊断框架:通过最小反事实编辑,将同一基础请求在四种支持状态之间翻转——Complete(ANSWER)、Clarifiable(CLARIFY)、Support-Blocked(REQUEST SUPPORT)与Unsupported-Now(ABSTAIN)。我们在四种提示条件——Direct、Action-Only、Confidence-Only以及类型化的Preflight Support Check(PSC)——下评估一个前沿模型,采用带确定性启发式评分的双人格自动审计(DPAA)。默认执行在非完整任务上严重过度承诺(过度承诺率41.7%)。标量置信度映射虽避免过度承诺,却使三去向的分诊空间坍缩(类型化分诊准确率58.3%)。相反,Action-Only与PSC通过在提示中显式给出分类本体,均达到91.7%的类型化分诊准确率。针对性消融证实:移除支持充分性维度会选择性地降低REQUEST SUPPORT准确率,而移除证据充分性维度会在不支持项上引发系统性过度承诺。由于DPAA在单一上下文窗口内运行,这些结果代表能力上限估计;尽管如此,结构性发现表明前沿模型具备强大的潜在分诊能力,但需要显式的分类决策路径才能被安全激活。

别启动你完成不了的任务:LLM智能体支持状态分诊的反事实审计:论文配图
图2:各支持状态下的动作准确率热图:已完成项各条件均处理良好,关键差异在于模型区分三种未完成状态的能力。