论文
问题不在能力:LLM智能体各层级的harness敏感性呈非单调
It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers
摘要
LLM智能体部署中一个流行的假设认为,结构化程度更高的harness(执行框架)能普遍提升可靠性,且能力更强的模型所需的结构引导按比例更少——这两点合起来意味着模型能力层级与最优harness复杂度之间存在单调的反向关系。我们通过一个受控的432次运行实验检验该假设:在HEAT-24(一个包含24个任务、采用基于git的工作区验证的合成基准)上,将横跨四个能力层级的六个模型与三种harness条件(轻度light、均衡balanced、严格strict)进行交叉组合。结果在两个方面驳斥了这种单调反向关系。首先,对于所评估的前沿对话模型(Gemini 2.5 Flash),harness冗长度的增加使VTSR下降29-38个百分点——这是一个harness复杂度悖论。其次,对于所评估的前沿推理模型(Qwen3.5-122B,开启扩展思考),严格harness取得了最高VTSR(91.7%)和最低延迟,与预测相反。在受限层级内,一个2B模型(Gemma4:e2B)在所有harness下均达到91.7%,与强开放层级的稳定性相当。由于本研究中每个层级仅由单一模型代表,这些结果应被解读为模型特定的观察;在所评估的模型中,harness敏感性表现为非单调,并关键地取决于模型类型(对话型 vs. 推理型)。我们提出一个六标签的失败分类体系,显示format_violation在强模型失败中占主导,而wrong_file在低能力模型失败中占主导,并据此推导出实用的、按层级选择harness的指南。
