论文

从奖励作弊激活到智能体风险状态:上下文校准的机制监控

From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

模型评测安全与风险评测

摘要

语言模型代理通过观察、推理和动作选择的重复循环来行动,使得安全监控依赖于内部模型状态和环境上下文。我们研究了在 Gameable ALFWorld 和 WebShop 中运行的 ReAct 风格代理中的奖励作弊监控器。代理配备有基于激活的奖励作弊分数、词元级熵和决策上下文特征。我们发现在 \textit{School-of-Reward-Hacks} 数据集上微调的适配器可以将奖励作弊倾向转化为代理动作选择,特别是当环境暴露代理奖励可供性时。然而,减轻此类行为不能仅依靠激活动力。高奖励作弊激活识别出潜在的策略状态,但并不一定意味着立即进行利用操作。在下一步预测任务中,熵和上下文校准的内部特征比单独的奖励作弊激活改进了风险估计。激活方向控制进一步减少了选定的混合适配器机制中的代理利用行为。总体而言,我们的结果支持对代理进行上下文校准的内部监控:奖励作弊激活识别潜在的策略状态,而熵和决策上下文有助于确定该状态何时变为危险行为。

从奖励黑客激活到智能体风险状态:上下文校准的机制监控:论文配图
图 1:顺序代理中的上下文校准监控。在每个决策步骤中,代理在选择操作之前都会生成推理轨迹。我们在推理阶段监控奖励黑客激活、熵和决策上下文,并在执行下一个动作之前估计其风险。这说明了从代级监控到代理风险状态估计的转变。