论文

指令复杂性导致对抗性 LLM 评估中的位置崩溃

Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation

模型评测模型行为与机制分析

摘要

当被指示在多项选择评估中表现不佳时,语言模型是否会与问题内容相关,还是会依赖位置捷径?我们使用六条件对抗性指令特异性梯度来映射这些方案之间的边界,该梯度对 2,000 个 MMLU-Pro 项目上的两个指令调整的 LLM(Llama-3-8B 和 Llama-3.1-8B)进行管理。分布筛选(响应位置熵)和独立的内容参与度标准(难度-准确度相关性)共同表征每个条件。梯度揭示了三种状态而不是单调过渡。模糊的对抗性指令会导致准确度适度降低,同时保留内容参与度。标准沙袋和能力模仿指令会导致部分内容参与的位置熵崩溃。两步答案感知回避指令会产生极端的位置崩溃,几乎完全集中在单个响应位置上(99.9%和87.4%)并且没有可测量的内容敏感性。这是唯一测试的多步指令,它产生了最极端的快捷方式。吸引子位置与每个模型的内容缺失空提示默认值相匹配。这种效应在两个模型和四个学术领域都得到了复制。分布崩溃和内容参与可以同时发生(筛选标准之间有 50% 的一致性),这表明基于熵的筛选和基于难度的内容评估捕获了响应有效性的部分独立维度。结果表明,指令复杂性可以决定在贪婪解码下的小型指令调整 LLM 中,对抗性合规性是否使用内容感知或内容盲机制。