论文

模型与Harness的组合影响Agent任务表现

Finding the Right Fit: Model-Harness Interactions across Agent Tasks

智能体系统Agent HarnessAgent任务评测

摘要

选择Agent系统,需要同时选择语言模型及其执行任务的Harness。本文检验模型、Harness或两者组合在场景变化后能否维持优势。研究评估66种配置:OpenHands、DeepSeek Harness、PI和openJiuwen四个可配置Harness与五个模型,在TUA-Bench、ALE-CLI和Terminal-Bench 4上组合测试,并纳入Codex-GPT和Claude Code-Claude原配组合。模型排名随Harness变化:Terminal-Bench 4上,Claude在OpenHands中领先GPT 7.94分,在PI中却落后30.16分。五个模型中有四个的最佳Harness随基准改变,但也有稳定组合:Kimi在三个基准上使用openJiuwen均取得自身最高分,领先5.61—11.11分。厂商原配不一定最优,更高成本也不一定换来更高分数;GPT在PI下的Terminal-Bench 4得分高于DSH,单任务成本却不足后者的四分之一。配对执行轨迹揭示,模型几乎总是自行发起修复,因此Harness能否以模型可用的形式返回失败信息很关键。GPT更适合PI的轻量框架,经常产生格式错误工具调用的Kimi则更适合openJiuwen。作者建议把模型、Harness和任务共同评估,并在https://github.com/liyix/finding-the-right-fit及https://huggingface.co/datasets/yixuanli97/finding-the-right-fit公开适配器、评测代码和全部6,204条评分轨迹。