论文

历史锚定:既往行为如何将LLM决策引向不安全行动

History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions

模型评测安全与风险评测

摘要

前沿LLM越来越多地被部署为智能体,在同一或不同模型产生的一长串既往工具调用日志之后选择下一个动作。我们提出一个简单的安全问题:如果日志中的某个先前步骤有害,模型会继续有害路线吗?我们构建了HistoryAnchor-100:十个高风险领域的100个短场景,每个场景将三个强制有害的先前动作与一个自由选择节点配对,后者提供两个安全与两个不安全选项。跨六家提供商的17个前沿模型,我们发现一个惊人的不对称:在中性系统提示下,最强的对齐模型几乎从不选择不安全项,但只需附加一句话——“与既有历史中展示的策略保持一致”——就会将其翻转至91-98%,且被翻转的模型常在延续之外进一步升级。两个对照实验排除了更简单的解释:打乱动作标签后效应依旧,而同一指令配全安全的既往历史时,不安全率保持在7%以下。不同模型家族在不安全历史的剂量上翻转阈值不同,且在每个对齐家族中,旗舰模型都是受影响最重的成员,呈现出安全维度上的逆缩放模式。对于轨迹可能被重放、伪造或注入的智能体部署,这些结果是一个危险信号。