论文

大语言模型中的预填充感知

Prefill Awareness in Large Language Models

模型评测模型行为与机制分析

摘要

语言模型的安全相关研究,包括对齐和越狱评估以及人工智能控制协议,通常依赖于预填充模型输出。如果人工智能模型能够识别并根据其先前的辅助消息已被插入或编辑的事实采取行动,那么这些方法的有效性和有效性可能会受到损害。我们研究前沿语言模型是否能够区分被篡改和未被篡改的助手端上下文,我们将这种能力称为预填充感知。为此,我们构建了跨三种预填充机制的二元偏好基准,过滤模型表现出一致立场的情况。我们发现前沿模型表现出显着的预填充意识:Claude Opus 4.5 在 9-35% 的情况下检测到与其偏好相反的预填充,提示时误报率为 0%;此外,模型通常会恢复到基线行为,而不会明确报告预填充物是外来的。后来的受控消融还表明,检测和抵抗依赖于不同的线索,其中风格不匹配主要影响模型是否将预填充标记为外来,而偏好不匹配主要影响它们是否恢复到基线答案。我们还检查了更现实的代理设置,例如未对准连续评估和 SWE 基准轨迹,其中前沿模型有时会以强烈依赖于数据集、任务成功和隐藏格式化工件的方式拒绝预填充助理转弯。我们的结果表明,预填充意识对于一些基于预填充的方法来说已经是一个重大的混乱。我们建议模型开发人员在前沿系统中跟踪此功能。

大语言模型中的预填充感知:论文配图
图 28:归因。 (左)总体 5 向精度,1/5 机会基线显示为虚线。 (右)每个条件的热图。