论文

当可验证计数取决于措辞时:审核指令后续中措辞的稳健性

When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following

模型评测评测方法与指标

摘要

可验证的指令跟踪基准通常通过一个固定模板来表达每个约束。我们测试当操作要求不变但措辞不同时分数是否保持稳定。我们推出了 WISE,这是一个匹配的评估套件和报告协议,根据精确的字数、关键字包含一次以及包含的 8--12 个字范围进行实例化。在 100 个匹配的任务中,来自 7 个提供商的多达 13 个模型,以及对完整可见输出的重复生成评分,仅措辞就会产生重大的合规性变化。在回避家庭小组中,五种回避和排除形式低于积极基线,而结构控制也大大改变了依从性:在九个模型控制小组中,原始积极形式的依从性为 54.9%,较长积极形式的依从性为 48.2%,当目标出现较晚时为 36.7%,AVOID1 的依从性为 33.8%。严格的 JSON 结构探针显示了超出计数的措辞敏感性,具有不同的作用方向。效果大小、失败方向、最弱形式和模型排名因实现而异。在最具破坏性的排除形式下,排名最高的模型发生变化,24.1% 的严格排序模型对发生逆转。人类验证进一步表明,对精确计数解释的一致同意可以与截然不同的模型行为共存。 WISE 通过平均和最差形式合规性、措辞差距、失败概况和排名稳定性来补充传统分数。

当可验证计数取决于措辞时:审核指令后续中措辞的稳健性的原论文方法或结果图
图 2:六个共享非 Gemini 模型严格遵守三个约束。避免是最低的。 NEG 对精确计数和关键字包含的负面影响比 8-12 范围(其间隔包括零)更大。精确计数 AVOID 表示 AVOID1。