论文

RFEval:大推理模型反事实推理干预下的推理忠实性基准

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

模型评测评测方法与指标

摘要

大型推理模型(LRM)表现强劲,但常产出听起来合理却不反映真实决策过程的理由,损害可靠性与信任。我们提出推理忠实性的形式框架,由两个可检验条件定义:立场一致性(连接推理与答案的连贯立场)和因果影响(在输出级干预下所述推理因果地驱动答案),并显式与准确率解耦。为落地该框架,我们提出 RFEval,一个跨七任务、含 7,186 个实例的基准,通过受控的输出级反事实干预探测忠实性。评估十二个开源 LRM 后,我们发现 49.7% 的输出不忠实,主要源于立场不一致。失败集中在数学和代码等脆弱的收敛性领域,且与训练后范式的关系大于与规模的关系:家族内消融表明,在监督微调之上加当前 RL 式目标会降低推理忠实性,即使准确率保持。关键的是,准确率既非忠实性的充分代理也非可靠代理:控制模型与任务后,准确率与忠实性的关联微弱且统计不显著。本工作建立了审计 LRM 可靠性的严格方法学,并表明可信赖的 AI 不仅须优化正确结果,还须优化推理过程的结构完整性。代码与数据集见项目页:https://aidaslab.github.io/RFEval/。

RFEval:大型推理模型反事实推理干预下的推理忠实性基准
图1:LRM中推理不忠实所致风险的示例,其中所陈述的理由与最终输出相冲突。此类不一致可能误导用户、危及安全部署(尤其在高风险场景中),并掩盖偏见。