论文

ReFlect:面向复杂长程LLM推理的有效Harness系统

ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning

模型推理智能体系统推理验证与自校正Agent Harness

摘要

目前LLM的推理范式包括思维链、ReAct 和事后自我批评。这些范例依赖于两个在长期、多阶段任务上失败的假设。结果,错误在推理步骤中悄然累积,留下了一个悬而未决的问题:推理系统能否有效地检测到自身的故障并从中恢复?我们提出了 ReFlect,这是一个用于 LLM 推理的 \emph{harness} 系统,它创建独立的错误检测和恢复逻辑作为模型的确定性包装器。跨越 6 个推理领域的对照实验表明,即时级自我批评产生的公式化模板在 100 个经审核的反思块中的 90 个中没有标记出任何问题,并且所调查的LLM在至少 76% 的情况下错误地接受了错误的答案。我们的 ReFlect 工具在跨越小规模和前沿规模的六个模型中实现了从 gpt-4o-mini 上的 41\% 到 Claude Sonnet 4.5 上的 56\% 的任务成功率,每个模型相对于 Direct CoT 的增益范围从 Qwen2.5-72B 上的 +7 pp 到 Claude Sonnet 4.5 上的 +29 pp,此外还将 SWE 工作台补丁结构质量从 0\% (Direct CoT) 提高到 82\% (Qwen2.5-72B) 和 87\% (GPT-4o) 之间。值得注意的是,Harness增益与模型的直接 CoT 任务成功率成反比(拟合斜率为 -1.69,r=-0.76):基线成功率中每损失一个 pp,就会通过Harness增益的 1.69 pp 机械恢复。我们发现,在 Llama-3.3-70B 和 Qwen2.5-72B 上添加结构化推理状态和运算符仅产生 15.0--18.7% 对均值,因为这种规模的模型无法可靠地填充其运算符所需的状态。 ReFlect 与模型无关,无需训练,并且完全在推理时运行。