论文

任务能力不是指令遵循:评估小语言模型中的指令冲突行为

Task Competence Is Not Instruction Following: Evaluating Instruction-Conflicting Behavior in Small Language Models

模型评测模型行为与机制分析

摘要

指令调整的目的是使语言模型遵循用户的请求,但尚不清楚当指令与其通常的任务行为发生冲突时,小模型是否会遵循用户的请求。我们通过将标准指令与冲突的非标准指令配对(选择不正确的选项、输出相反的情绪或返回两倍的答案)来跨多项选择题回答 (MCQA)、情感分类和数学问答这三个任务来研究这一问题。这种跨任务设计使我们能够测试对冲突指令的抵制是否与特定任务特征相关或反映了更广泛的行为倾向。由于所有预测都是根据原始 真值 进行评分的,因此忽略非标准指令的模型仍然显得准确。使用标准精度、非标准精度和指令跟踪故障率 (IFFR),我们评估不同规模的指令调整 Qwen 模型。标准准确性和指令遵循通常都会随着规模的扩大而提高,尽管所有任务和数据集的模式并不一致。小模型保持能力,但通常会忽略非标准指令,而较大模型则显示两种设置之间存在明显差距。这些发现表明,任务能力的提高并不会自动提供对模型行为的可靠控制。因此,任务能力和遵循指令是不同的能力,仅报告标准准确性会隐藏指令遵循失败。