论文

LoopCD:用于改进循环语言模型推理的循环对比解码

LoopCD: Loop-wise Contrastive Decoding for Improving Reasoning in Looped Language Models

模型推理解码与生成控制

摘要

循环语言模型 (LoopLM) 通过使用共享权重递归地细化内部潜在表示来执行“潜在推理”,为显式语言推理提供更有效的替代方案。尽管它们很有效,但我们发现 LoopLM 仍然容易出现循环不稳定:迭代中不稳定的细化可能会产生与推理错误相关的局部不确定“硬”标记。为了解决这个问题,我们提出了 LoopCD,即循环对比解码,它通过在推理时干预这些标记来增强 LoopLM 的推理性能。具体来说,我们利用 LoopLM 的内部动态,并将早期迭代的 logits 与最后一次细化迭代的 logits 进行对比,以形成最终的采样分布。我们发现这种策略非常高效,只引入了可以忽略不计的推理开销,并且不需要额外的训练,同时通过自然地细化推理关键硬词元来有效地提高推理性能。大量实验表明,我们的方法提高了近期代表性 LoopLM 在各种推理任务中的性能。