论文

OneLatent:面向视觉潜在推理的单token压缩

OneLatent: Single-Token Compression for Visual Latent Reasoning

模型训练监督微调与指令调优

摘要

思维链(CoT)提示能改善推理,但往往使推理成本增加一到两个数量级。为应对这些挑战,我们提出OneLatent,一个借助渲染CoT图像与DeepSeek-OCR隐藏状态的监督,将中间推理压缩为单个潜在token的框架。通过将文本步骤渲染为图像,我们获得了一种可检查、可审计的确定性监督信号,而无需模型输出冗长的文本理由。在各基准上,OneLatent将平均输出长度缩短11倍,相对文本CoT平均准确率仅下降2.21%,同时将输出token贡献(OTC)提升6.8倍。在长链逻辑推理上,OneLatent以单个潜在token在ProntoQA上达到99.80%、在ProsQA上达到97.80%,压缩率最高达87.4倍,支持压缩受限条件下的泛化。

OneLatent:面向视觉潜在推理的单token压缩
图1:推理接口与效率图。(a) 我们展示四种推理接口及其输出形式:No CoT、文本 CoT、iCoT、COCONUT 和 OneLatent。(b) 在 GSM8K 上,我们针对相同方法绘制 OTC(%/token)与生成输出 token 平均数量的关系。OneLatent 出现在输出长度最低的区域并保持高 OTC,表明其输出明显短于所比较的其他推理接口。