论文
HyLaR:具有解耦策略优化的混合潜在推理
HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization
摘要
思想链 (CoT) 推理显着提升了多模态 大语言模型 (MLLM) 解决复杂问题的能力。然而,使 CoT 适应视觉通常会离散信号以适应 LLM 输入,从而导致早期语义崩溃并丢弃细粒度细节。虽然外部工具可以缓解这种情况,但它们引入了严格的瓶颈,将推理限制在预定义的操作中。尽管最近的潜在推理范式将视觉状态内化以克服这些限制,但优化由此产生的混合离散连续动作空间仍然具有挑战性。在这项工作中,我们提出了 HyLaR(混合潜在推理),这是一个将离散文本生成与连续视觉潜在表示无缝交错的框架。具体来说,在初始冷启动监督 微调 (SFT) 之后,我们引入 DePO(解耦策略优化)以在该混合空间内实现有效的强化学习。 DePO 分解策略梯度目标,将独立的信任域约束应用于文本和潜在组件,以及精确的封闭形式 von Mises-Fisher (vMF) KL 正则化器。大量实验表明,HyLaR 在细粒度感知和一般多模态理解基准方面优于标准 MLLM 和最先进的潜在推理方法。代码可在 https://github.com/EthenCheng/HyLaR 获取。