论文

Fisher-R1:训练大语言模型智能体进行可靠的假设检验

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

模型训练强化学习Agentic RL

摘要

可靠的假设检验是许多实证科学结论的基础。大语言模型(LLM)智能体正被越来越多地用于自动化这一过程,因为它们能够端到端地检查数据集、生成代码并产出分析。然而,我们表明它们经常犯细微的推理错误,即使分析执行正确也会导致错误结论。现有基准未能捕捉这一失败模式,因为它们很少评估所报告的p值在数据前提假设下是否统计有效。我们构建P-Bench来填补这一空白,该基准包含425个开放式、贴近现实的假设检验任务,覆盖经济学、生物学和医学。每个任务要求智能体仅依据一个科学假设和一个数据集选择统计方法、计算p值并得出结论。我们进一步提出Fisher-R1,一个通过合成任务与强化学习训练、面向严谨假设检验的开放权重LLM智能体。在P-Bench上,Fisher-R1-14B大幅优于其骨干模型,并超越GPT-5.4与DeepSeekV4-Pro等强专有及开源基线,单次尝试成功率相对DeepSeek-V4-Pro平均提升21%,在最难任务上提升达26%。我们的结果表明,当前LLM智能体缺乏用于假设检验的可靠统计推理,而在带有经核验统计奖励的任务上进行强化学习能显著提升可靠性。

Fisher-R1:训练大语言模型智能体进行可靠的假设检验:论文配图
图6:P-bench的数据整理。