论文
BODHI:LLM 是否会分支并发现异构推理?
BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?
摘要
尽管具有可验证奖励的强化学习(RLVR)提高了 大语言模型(LLM)在各种推理任务中的性能,但关于 RLVR 是否扩大了推理能力边界,或者只是提高了采样效率,仍存在很大争议。在本文中,我们通过采用受控迷宫求解实验并从基于语义等价的数学推理轨迹(BODHI-树)中提取树结构,研究了 RLVR 训练的 LLM 中测试时探索的本质。这有助于我们区分风格变化产生的熵和真正的推理分支。我们的研究结果表明,在 RLVR 模型中观察到的策略熵崩溃不仅仅是句法上的,而且还伴随着语义分支熵的显着减少。虽然 RLVR 提高了对环境约束的遵守和回溯能力,但它限制了延续的空间;我们提供的证据表明,这可能是 RLVR 样本效率提升的原因,尽管是以真正的生成轨迹多样性为代价的。