论文
推理深度和环境复杂性:跨逻辑推理任务的 RLVR 数据分配的对照研究
Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks
摘要
具有可验证奖励的强化学习(RLVR)已成为 后训练 推理模型的核心,但现有研究的一个关键限制是它们对推理空间的狭隘看法:难度仅被视为推理深度,而奖励则集中于前向演绎状态跟踪。相反,我们沿着两个维度来描述推理空间。困难。除了推理深度之外,我们还研究环境复杂性,其中模型必须在干扰因素和交互结构中识别出正确的路径。奖励推理形式。我们认为现实世界推理的四种核心能力:演绎状态跟踪、隐藏事件或事实的溯因恢复、归纳规则归纳和类比迁移。为了理清这些因素,我们构建了一个具有受控前分布和 后训练 分布的综合知识图环境,其中每个实例根据深度、复杂性和任务系列而变化。出现了三个发现:联合深度复杂性覆盖优于单轴方法;推理家族的反应不均匀,在强化学习覆盖区域之外,溯因推理会退化,任务相关性会聚集成演绎-溯因和归纳-类比对;在固定预算下,统一混合的效果优于分阶段课程。我们还发现,最近的现成模型表现出相同的演绎-溯因不对称性,这表明这种差距不仅仅是我们受控设置的产物。