论文
从奖励作弊激活到智能体风险状态:上下文校准的机制监控
From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents
摘要
语言模型代理通过观察、推理和动作选择的重复循环来行动,使得安全监控依赖于内部模型状态和环境上下文。我们研究了在 Gameable ALFWorld 和 WebShop 中运行的 ReAct 风格代理中的奖励作弊监控器。代理配备有基于激活的奖励作弊分数、词元级熵和决策上下文特征。我们发现在 \textit{School-of-Reward-Hacks} 数据集上微调的适配器可以将奖励作弊倾向转化为代理动作选择,特别是当环境暴露代理奖励可供性时。然而,减轻此类行为不能仅依靠激活动力。高奖励作弊激活识别出潜在的策略状态,但并不一定意味着立即进行利用操作。在下一步预测任务中,熵和上下文校准的内部特征比单独的奖励作弊激活改进了风险估计。激活方向控制进一步减少了选定的混合适配器机制中的代理利用行为。总体而言,我们的结果支持对代理进行上下文校准的内部监控:奖励作弊激活识别潜在的策略状态,而熵和决策上下文有助于确定该状态何时变为危险行为。
