论文

QuoteBench:匹配分数如何掩盖命令路径层面的失败

QuoteBench: How Matched Scores Can Hide Command-Path Failures

智能体系统Agent任务评测

摘要

大语言模型编码智能体通过可能对模型输出进行序列化、包装和重新解析的接口发出Bash命令。仅凭匹配的执行分数,无法区分命令生成错误与生成之后引入的失败。QuoteBench在来自14个事故衍生家族的56个单次任务上,通过对最终状态的精确校验来测量这一边界,围绕一个刻意未转义的新增解析器交叉组合生成契约与执行传输方式。在插值点进行转义可复现每条重放回复在原始路径下的结果,因此在披露边界条件下的任何恢复都必须来自模型改变其生成方式。在八个同窗口配置中,将同一回复通过新增解析器重放会使成功率下降55.4至73.2个百分点;披露边界为其中六个配置挽回30.4至60.7分,对另外两个配置则为零或略负。前沿模型的原始生成已接近饱和;边界适应能力才是仍在区分模型的因素。GPT-5.6-sol的-3.6分匹配差距掩盖了-64.3分的损害与+60.7分的补偿。部署配置会重新排列模型次序:26个可比模型对中有1个逆转明确无疑,另有4个处于单任务的边缘。对发出命令的智能体的评估应报告模型配置、生成契约、执行路径、工作点与最终状态校验器,而不是把匹配分数当作模型的固有属性。

QuoteBench:匹配分数如何掩盖命令路径层面的失败:论文配图
图2:在冻结配置扫描中,匹配嵌套成功率随操作族而变化。每个单元格是某次存储生成在某族四个任务上的通过百分比。行保留用于广泛覆盖的 15 个冻结配置;标记(thinking)的 Qwen 行启用思考开关,未标记的 Qwen 行为非思考模式,附录表 13 列出所查询的努力(effort)设置和请求参数。表 2 单独总结了每个基础模型观察到的最佳设置。列遵循附录表 7 中的机制分组。SSH 类任务使用本地双 shell 仿真。行按此冻结扫描中的匹配嵌套分数排序,与表 2 中观察到的最佳顺序不同。