论文

DenoiseFlow:面向可靠LLM Agentic工作流的不确定性感知去噪

DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows

模型推理智能体系统测试时计算扩展Agent Harness

摘要

自主智能体正日益被托付复杂的长时程任务,从数学推理到软件生成。虽然Agentic工作流通过把任务分解为多步推理链来促成这些任务,但随着序列变长,可靠性显著退化。具体而言,自然语言指令中的微小解读误差会在各步之间无声累积。我们把这种失效模式称为累积语义歧义。现有的缓解方法往往缺乏运行时自适应性,依赖静态探索预算、被动式错误恢复,或完全忽略不确定性的单路径执行。我们把多步推理过程形式化为噪声MDP,并提出DenoiseFlow,一个通过三个协同阶段执行渐进去噪的闭环框架:(1)感知(Sensing)估计每步语义不确定性;(2)调节(Regulating)基于估计风险在快速单路径执行与并行探索之间路由,自适应分配计算;(3)纠正(Correcting)通过基于影响的根因定位执行针对性恢复。在线自校准持续根据验证器反馈对齐决策边界,无需真实标签。在覆盖数学推理、代码生成和多跳问答的六个基准上的实验表明,DenoiseFlow在每个基准上都取得最高准确率(平均83.3%,较最强基线+1.3%),同时通过自适应分支把成本降低40-56%。详细的消融研究进一步确认了框架级的稳健性与通用性。代码见 https://anonymous.4open.science/r/DenoiseFlow-21D3/。