论文

日志分析是AI智能体可信评估的必要条件

Log analysis is necessary for credible evaluation of AI agents

智能体系统Agent任务评测长程任务评测

摘要

代理基准通常仅报告最终结果:通过或失败。这从三个方面威胁了评估的可信度。首先,分数可能会因捷径和基准工件而夸大或缩小,从而歪曲能力。其次,由于支架限制和反复出现的故障模式,基准性能可能无法预测现实世界的效用。最后,能力分数可能隐藏代理采取的危险或灾难性行动。我们认为日志分析——对人工智能代理的输入、执行和输出的系统跟踪和分析——对于克服这些有效性威胁并促进可信的代理评估是必要的。在本文中,我们(1)提出了通过日志分析记录的可信评估威胁的分类,以及(2)制定了一套日志分析的指导原则。我们在 tau-Bench Airline 上阐释了这些原则,揭示了 pass^5 性能的引出不足近 50%,并且暴露了结果指标不可见的部署故障模式。最后,我们针对不同的利益相关者(包括基准创建者、模型开发者、独立评估者和部署者)提出了提高日志分析采用率的务实建议。