论文
按我说的做,而不是按我做的做:LLM 中的指令归纳冲突
Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs
摘要
语言模型经过训练可以遵循指令,但它们也是强大的模式完成器。当这两个目标发生冲突时会发生什么?我们构建了对话,其中用户指示以目标方式 T 进行操作(例如,始终输出特定标记、以特定语言回答或采用角色),而 N 个硬编码助理轮次则展示竞争模式 P。然后,我们测量此设置中的指令遵循 (IF) 率,涵盖 13 个模型和 16 个不同的指令,最多 50 个轮次。各个模型的平均指令遵循率范围为 1% 到 99%,很大程度上与标准能力基准不相关。从指令遵循到模式遵循的转变是普遍存在的,但高度依赖于模型。鲁棒性通过指令内容和输出格式来调节,当指令与其训练值先验一致时,模型抵抗归纳的时间更长,事实证明,不同的多词元响应比单词元输出更具抵抗力。思想链推理提高了稳健性,但并没有消除敏感性,并且可能会导致正确的深思熟虑和不正确的输出之间的分离。当被要求预测他们在这种情况下的行为时,模型的平均准确率达到 83.5%,但系统性地低估了他们自己对诱导压力的抵抗力。这些结果表明,即使对于其他能力强的模型来说,在归纳压力下,指令遵循仍然很脆弱,并且输出多样性,而不是与输入的语义参与,是预测鲁棒性的主要因素。