论文
经智能体轨迹剖析模型行为
Dissecting model behavior through agent trajectories
摘要
AI智能体性能不只是建模问题——它根本上是系统问题。模型的先进能力经智能体测试框架实现。因此——模型假设与测试框架行为之间的缺口很容易阻止模型全部能力转化为智能体性能。我们把它形式化为“意图-执行”缺口:模型意图与测试框架执行之间(及反向)的失配。我们主张最小化该意图-执行缺口与测试框架设计的其他方面(如工具与执行循环)同等重要。为说明这种测试框架-模型对齐的影响——我们开发简单可定制的测试框架“Simple Strands Agent”(SSA)。SSA旨在找到跨不同模型家族(Claude、Gemini、GPT、Grok、Qwen)泛化的大部分 common 模式——以及少量模型专属偏好。我们做出两项贡献:(i) 在流行智能体基准(SWE-Pro、SWE-Verified与Terminal-Bench-2)上复现或改进多样模型提供商家族报告的pass@1性能;(ii) 基于13.8万条SSA生成轨迹的分析——我们超越pass@1数字(其在前沿模型间相对持平)——以代码状态空间表示智能体轨迹——观察到模型级的问题解决行为差异。编辑频率、测试活动与相变等细粒度指标揭示各模型如何在自主问题解决的不同阶段分配精力。