论文
超越任务完成:通过过程感知评估揭示 LLM 智能体的腐化成功
Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation
摘要
基于大语言模型(LLM)的智能体日益被用于高风险场景,但当前基准主要评估任务是否完成,而非如何完成。我们提出过程感知评估(PAE),把智能体过程形式化为结构化观察,并暴露智能体观察、沟通与执行之间的一致性关系。PAE 沿互补轴(效用、效率、交互质量、程序完整性)评估智能体,并应用多维门控,一票否决腐化结果。在 tau-bench 上评估最先进 LLM 智能体,得到轴级、合规级和基准级发现。轴级上,各维度捕捉非冗余失败模式:效用掩盖可靠性缺口,速度不意味精度,简洁不预测意图遵从。程序合规级上,27-78% 的基准报告成功是腐化成功,掩盖了交互与完整性违规。此外,门控大幅压低 Pass^4 率并影响模型排名。对腐化成功案例的分析揭示各模型独特的失败特征:GPT-5 的错误分布在策略、执行与意图维度;Kimi-K2-Thinking 把 78% 的违规集中于策略忠实性与合规;Mistral-Large-3 以忠实性失败为主。基准级上,我们的分析暴露基准设计的结构性缺陷,包括任务范围缺口、矛盾奖励信号和产生意外成功的模拟器伪影。