论文

Harness-IF:评估编码智能体跨指令面的指令遵循

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

智能体系统Agent HarnessAgent任务评测

摘要

当一个编码智能体遵守某条规则时,它可能本来就会这么做。现有的指令遵循基准无法区分二者:它们将规则集中在用户轮次,而编码智能体基准则强调最终任务成功。我们提出Harness-IF,它从执行证据出发逐条对操作规则评分:从642条规则库中抽取60个真实多轮编码任务项、256条接受裁定的规则,分布于已部署智能体读取的五个可配置指令面。为将合规与巧合分开,我们引入Against-Prior Accuracy(AP-Acc),仅对那些被标注为与未经提示的默认行为相悖的规则评分——通过在九个探针构建中隐藏规则重跑任务来观测,其余规则经人工筛选。在12个前沿模型上,准确率介于72.1-85.9%,AP-Acc介于66.1-78.6%;每个模型在对抗先验的规则上都更差,差距为3.6至7.4分(均值5.81),且该方向在带题目聚类置信区间的共同支撑分析下依然成立。因此聚合分数会以模型特定的幅度高估合规性:先验对照使榜首构建保持不变并交换了三对相邻排名。在九个独立构建上进行的平衡冲突试点增加了第二个结果:汇总的优先级并不遵循提示词深度,系统提示词、项目文件和用户指令排在工具与技能描述之前。