论文
输出格式与模型选择:单轮编码Agent表现中的交互效应
Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance
摘要
输出格式不是中立的实现细节——它可以重新排序模型排名,放大或抑制个体模型差异,并确定 编码智能体 是否成功或失败。我们进行了 3 个模型(DeepSeek V4、Doubao 2.0 Pro、Qwen 3.7 Max)x 3 种输出格式(完整文件、JSON Patch、统一 diff)x 6 个任务 x 20 次重复的受控单轮实验,在 4 个开源项目中总共运行 4,013 次。只有一个项目 (tqdm) 取得了非零成功率:dotenv、requests 和 jsoup 在 2,551 次运行中取得了零成功率。我们的中心发现是格式 x 模型交互,没有普遍最佳的格式。 Doubao 在 JSON Patch 方面取得了 94% 的成功率(Cohen 的 h = 1.57,p < 0.001),DeepSeek 在统一 diff 方面表现出色(66%,h = 0.63),Qwen 显示出较小但显着的全文件偏好(50%,h = 0.29,p < 0.05)。除了这些主要结果之外,我们还发现了一种独特的故障机制——格式滥用——代理正确地诊断了问题,但执行范围过大,最生动的是当单行修复被应用为完整文件替换时。我们提出了一种特定于模型的输出策略,一种将格式语义限制为代理自己的本地化步骤的工具设计原则,并发布所有数据和模板以实现可重复性。所有实验数据均可在 https://doi.org/10.5281/zenodo.21505157 获取。