论文
COMPASS:面向安全搜索智能体的认知MCTS引导过程对齐
COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents
摘要
由LLM驱动的搜索智能体具备多步推理与工具使用能力。然而,这些能力引入了由检索引发的安全退化,因为有害意图可能被分解为看似无害却导致不安全结果的子查询。现有对齐方法难以捕捉稀疏的安全信号,也无法在多步交互中监督多样化的违规行为。我们提出COMPASS,一个认知MCTS引导的过程对齐框架,旨在贯穿智能体工作流实现稳健的安全对齐,同时保留通用实用性。COMPASS集成了认知树探索(CTE)以高效合成隐蔽攻击轨迹,以及内省式逐步对齐(ISA)以隔离有风险的中间动作、实现细粒度的过程监督。实证结果表明,COMPASS在显著减少训练数据需求的同时,取得了良好的安全-实用权衡。
