论文

过滤有害动作并不够:智能体合成数据中的幻影迁移

Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF

模型评测安全与风险评测

摘要

合成数据被广泛用于训练大语言模型:生成便宜且易控。随着模型日益以智能体形态部署,合成轨迹很可能成为智能体行为训练数据的重要来源。我们研究在含对抗交互的合成智能体轨迹上训练的效果——包括终止另一智能体进程、降低其调度优先级、或未授权访问资源等动作。我们在近似强化学习rollout生成的此类轨迹上微调Llama 3.3 70B Instruct,并在Anthropic的Agentic Misalignment套件与Apollo的上下文图谋场景上评估所得模型:在这些轨迹上微调持续增加未对齐行为——泄露较基线上升约五倍(4.6%到24.9%);且该增加在从轨迹中移除每一条对抗动作后依然存在。在结构可比但从头就良性的轨迹上微调,效果小得多(15.5%)。结果表明未对齐倾向在生成过程中被引入、并以弥散方式编码于整条轨迹,而非局限于有害动作本身。该效应还依赖生成模型:Gemini 2.5 Flash生成的良性轨迹比Claude 3.7 Sonnet从相同任务生成的轨迹诱发略高的泄露率。相比之下,宽泛的安全基准在所有微调模型上相似退化,因此无法区分这些效应。结果表明:动作级过滤不足以确保合成智能体训练数据的安全——生成模型引入的倾向可存活于语义检查。

过滤有害动作并不够:智能体合成数据中的幻影迁移:论文配图
图 1:实验设计概述。我们在四个代理工具使用数据集上对 Llama 3.3 70B Instruct 进行微调,并跨三个基准类别评估每个结果模型。生成合成代理推出以近似 RL 轨迹结构(指令 →\rightarrow 工具调用 →\rightarrow 工具结果,无思想链)。我们生成三个数据集:包含明显有害的工具调用(例如进程终止、未经授权的资源访问)的对抗轨迹;过滤后的对抗性 →\rightarrow 良性,与去除了有害行为的对抗性集合相同;和良性直接轨迹(直接),结构上与对抗轨迹相似,从一开始就生成良性。 ToolACE 用作控制代理数据集,提供不是由我们的生成管道生成的公开可用的工具使用数据集。所有四个微调模型均根据错位基准(Anthropic 的 Agentic Misalignment、Apollo 的 In-context scheming、Alignment fakes)、能力(MMLU)和安全性(WMDP、Toxigen、Winogender、TruthfulQA)进行评估。星号 (**) 表示根据原始规范修改的基准;详细信息请参见第 2.4 节。