论文
OneLatent:面向视觉潜在推理的单token压缩
OneLatent: Single-Token Compression for Visual Latent Reasoning
摘要
思维链(CoT)提示能改善推理,但往往使推理成本增加一到两个数量级。为应对这些挑战,我们提出OneLatent,一个借助渲染CoT图像与DeepSeek-OCR隐藏状态的监督,将中间推理压缩为单个潜在token的框架。通过将文本步骤渲染为图像,我们获得了一种可检查、可审计的确定性监督信号,而无需模型输出冗长的文本理由。在各基准上,OneLatent将平均输出长度缩短11倍,相对文本CoT平均准确率仅下降2.21%,同时将输出token贡献(OTC)提升6.8倍。在长链逻辑推理上,OneLatent以单个潜在token在ProntoQA上达到99.80%、在ProsQA上达到97.80%,压缩率最高达87.4倍,支持压缩受限条件下的泛化。
