论文
CEDAR-GRPO:面向LLM通用溯因推理的过程感知强化学习
CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs
摘要
溯因推理常被刻画为“对最佳解释的推断”,它是不确定性下解释的核心,从日常理解与调查到科学发现皆是如此。然而,LLM研究大多通过狭窄的任务特定基准研究溯因,使得观察到的收益能否迁移到训练或评测所用基准族之外并不清楚。我们追问RL后训练能否把溯因提升为一种可迁移的推理能力。我们提出CEDAR-GRPO,一个过程感知框架,将最终答案正确性与溯因奖励(证据覆盖与证据到解释的方向性)相结合。四个开源权重LLM在受控、领域中立的溯因假设生成与假设选择任务混合体上进行后训练。我们在11个未见任务上评估它们,涵盖假设选择、缺失事实生成、可废除推理、长上下文调查、临床推理、代码调试与非溯因对照任务。CEDAR-GRPO使每个模型在所有留出任务上都优于基模型与仅正确性GRPO:相对二者平均增益分别为7.4分与2.7分,最大增益30.8分。消融实验证实RL、溯因奖励设计与任务多样性各自都对迁移有贡献。过程级指标进一步显示出更强的溯因行为,包括探索备选、淘汰竞争解、回溯与不确定性标记。
