论文
何时思考,何时发言:学习 LLM 推理的披露政策
When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
摘要
在单流自回归接口中,相同的词元既更新模型状态又构成不可逆转的公共承诺。这种耦合产生了沉默税:额外的审议推迟了第一个与任务相关的内容,而幼稚的早期流媒体可能会导致过早的承诺,从而使后代产生偏见。我们引入并排(SxS)交错推理,这使得披露时间成为标准自回归生成中的可控决策。 SxS 在同一上下文中将部分披露与持续的私人推理交织在一起,但仅在迄今为止的推理支持时才发布内容。为了在不激励填充的情况下学习这种节奏,我们通过将答案前缀与支持推理前缀相匹配来构建蕴涵对齐的交错轨迹,然后使用 SFT 进行训练以获取双动作语义,并使用 RL 进行训练以恢复新格式下的推理性能。在两个 Qwen3 架构/规模(MoE Qwen3-30B-A3B、密集 Qwen3-4B)以及域内(AIME25)和域外(GPQA-Diamond)基准测试中,SxS 提高了 词元级 代理下的准确性 - 内容延迟 Pareto 权衡,例如更新间等待。