论文

Jev类决策模型可能更依赖选项名称,而非判定规则

Labels Override Definitions in Jev-Style Typed Decision Models

模型评测模型推理判别式推理与决策模型行为与机制分析Jev

摘要

类型化决策模型通过返回若干调用方指定选项的概率,回答关于输入的固定问题。每个选项包含短名称和文字定义,开发者在定义中写明模型应执行的规则。Jev将这种接口用于路由、审核和分流,随后出现开放实现;通过标签字符串评分把语言模型用作分类器时,也有相同操作。 我们研究可检查和修改权重的开放实现,考察概率遵循的是定义还是名称,并把偏向名称的现象称为选项名称偏差。对四个开放权重类型化决策模型、三种Qwen2.5答案读取方式、11项分类任务及我们提出的PolicyBench进行评测。PolicyBench只在定义中陈述规则;评测结果表明,多数系统主要依赖名称。 删除全部定义后,laya-td准确率未下降(0.8559对0.8487),尽管仅用定义能达到0.7971;把名称换成A和B提高了0.1511,区间为[0.1377, 0.1646]。von不受影响,两套代码的区别在于:Laya把名称和定义一起写入提示,von只写定义。不改变任何权重,只双向修改这一处,就使三个Laya检查点对名称变化完全不敏感,并在von中制造偏差:当名称与定义冲突,其准确率由0.8511降至0.2281。早期研究把这一失败归因于替代文本解码器的受约束决策头;我们的结果将原因定位到提示的呈现方式。我们提供两次调用即可完成的检查,并测量四种缓解措施的作用。

不同选项命名方式下,模型遵守规则的准确率。
不同选项命名方式下,模型遵守规则的准确率。