论文
QuoteBench:匹配分数如何掩盖命令路径层面的失败
QuoteBench: How Matched Scores Can Hide Command-Path Failures
摘要
大语言模型编码智能体通过可能对模型输出进行序列化、包装和重新解析的接口发出Bash命令。仅凭匹配的执行分数,无法区分命令生成错误与生成之后引入的失败。QuoteBench在来自14个事故衍生家族的56个单次任务上,通过对最终状态的精确校验来测量这一边界,围绕一个刻意未转义的新增解析器交叉组合生成契约与执行传输方式。在插值点进行转义可复现每条重放回复在原始路径下的结果,因此在披露边界条件下的任何恢复都必须来自模型改变其生成方式。在八个同窗口配置中,将同一回复通过新增解析器重放会使成功率下降55.4至73.2个百分点;披露边界为其中六个配置挽回30.4至60.7分,对另外两个配置则为零或略负。前沿模型的原始生成已接近饱和;边界适应能力才是仍在区分模型的因素。GPT-5.6-sol的-3.6分匹配差距掩盖了-64.3分的损害与+60.7分的补偿。部署配置会重新排列模型次序:26个可比模型对中有1个逆转明确无疑,另有4个处于单任务的边缘。对发出命令的智能体的评估应报告模型配置、生成契约、执行路径、工作点与最终状态校验器,而不是把匹配分数当作模型的固有属性。
