论文

COMPASS:面向安全搜索智能体的认知MCTS引导过程对齐

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

模型训练奖励建模与过程监督

摘要

由LLM驱动的搜索智能体具备多步推理与工具使用能力。然而,这些能力引入了由检索引发的安全退化,因为有害意图可能被分解为看似无害却导致不安全结果的子查询。现有对齐方法难以捕捉稀疏的安全信号,也无法在多步交互中监督多样化的违规行为。我们提出COMPASS,一个认知MCTS引导的过程对齐框架,旨在贯穿智能体工作流实现稳健的安全对齐,同时保留通用实用性。COMPASS集成了认知树探索(CTE)以高效合成隐蔽攻击轨迹,以及内省式逐步对齐(ISA)以隔离有风险的中间动作、实现细粒度的过程监督。实证结果表明,COMPASS在显著减少训练数据需求的同时,取得了良好的安全-实用权衡。

COMPASS:面向安全搜索智能体的认知MCTS引导过程对齐:论文配图
图1:搜索智能体因检索内容诱发安全退化的示例,说明检索结果可能削弱安全对齐,凸显安全搜索智能体研究的必要性。