论文
草案:任务解耦潜在推理以确保代理安全
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
摘要
使用工具的 LLM 代理的出现将安全监控从输出调节转变为审核长而嘈杂的交互轨迹,其中关键风险证据稀疏,使得标准二元监督不太适合贡献分配。为了解决这个问题,我们提出了 DRAFT(代理安全的任务解耦潜在推理),这是一种潜在推理框架,它将安全判断解耦为两个可训练阶段:一个将完整轨迹提炼成紧凑的连续潜在草案的提取器,以及一个共同关注草案和原始轨迹以预测安全性的推理器。 DRAFT 通过在潜在空间中执行证据聚合来避免有损的显式总结然后判断管道,从而实现端到端可微训练。在包括 ASSEBench 和 R-Judge 在内的基准测试中,DRAFT 始终优于强大的基准,将基准的平均准确率从 63.27% (LoRA) 提高到 91.18%,并学习更多可分离的表示。消融证明了提取器和推理器之间存在明显的协同作用。总体而言,DRAFT 表明,在读出之前进行连续潜在推理是在证据稀疏的长上下文监督下实现稳健代理安全的实用途径。