论文
过滤有害动作并不够:智能体合成数据中的幻影迁移
Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF
摘要
合成数据被广泛用于训练大语言模型:生成便宜且易控。随着模型日益以智能体形态部署,合成轨迹很可能成为智能体行为训练数据的重要来源。我们研究在含对抗交互的合成智能体轨迹上训练的效果——包括终止另一智能体进程、降低其调度优先级、或未授权访问资源等动作。我们在近似强化学习rollout生成的此类轨迹上微调Llama 3.3 70B Instruct,并在Anthropic的Agentic Misalignment套件与Apollo的上下文图谋场景上评估所得模型:在这些轨迹上微调持续增加未对齐行为——泄露较基线上升约五倍(4.6%到24.9%);且该增加在从轨迹中移除每一条对抗动作后依然存在。在结构可比但从头就良性的轨迹上微调,效果小得多(15.5%)。结果表明未对齐倾向在生成过程中被引入、并以弥散方式编码于整条轨迹,而非局限于有害动作本身。该效应还依赖生成模型:Gemini 2.5 Flash生成的良性轨迹比Claude 3.7 Sonnet从相同任务生成的轨迹诱发略高的泄露率。相比之下,宽泛的安全基准在所有微调模型上相似退化,因此无法区分这些效应。结果表明:动作级过滤不足以确保合成智能体训练数据的安全——生成模型引入的倾向可存活于语义检查。
