论文

提交前先验证:经由自我审计迈向LLM智能体的忠实推理

Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing

模型推理推理验证与自校正

摘要

在大语言模型(LLM)智能体中,推理轨迹被视为可靠的内部信念,用于引导动作和更新记忆。然而,连贯的推理仍可能违反逻辑或证据约束,使无依据的信念被反复存储并在决策步骤之间传播,导致长程智能体系统出现系统性行为漂移。大多数现有策略依赖共识机制,把一致性与忠实性混为一谈。本文受不忠实中间推理轨迹脆弱性的启发,提出自审计验证推理(Self-Audited Verified Reasoning, SAVeR),一个在动作提交之前对智能体内部信念状态强制执行验证以实现忠实推理的新框架。具体而言,我们在与忠实性相关的结构空间下,以结构化方式生成基于人设(persona)的多样化候选信念供选择。为达成推理忠实性,我们执行对抗性审计以定位违规,并在可验证的接受准则下通过约束引导的最小干预进行修复。在六个基准数据集上的大量实验表明,我们的方法持续提升推理忠实性,同时保持有竞争力的最终任务性能。

提交前先验证:经由自我审计迈向LLM智能体的忠实推理:论文配图
图 2:我们提出的 SAVeR 框架的概述。该图说明了整个闭环工作流程,突出显示了从信念生成和选择到审核和迭代修复的端到端过程。