论文

基于自回归-扩散Collaborative Thoughts的推理

Reasoning with Autoregressive-Diffusion Collaborative Thoughts

模型推理推理验证与自校正

摘要

自回归模型与扩散模型代表两种互补的生成范式。自回归模型擅长序列规划与约束组合,却难以应对需要显式空间或物理基础的任务。相比之下,扩散模型通过高维生成捕捉丰富的空间结构,但缺乏满足复杂多阶段约束所需的逐步逻辑控制,也难以可靠地识别并纠正错误。我们提出Collaborative Thoughts,一个统一的协同框架,使自回归模型与扩散模型通过闭环交互共同进行推理与生成。在Collaborative Thoughts中,自回归模型执行结构化规划与约束管理,扩散模型将这些约束实例化为中间视觉思考(visual thoughts),并由基于视觉的评审模块评估视觉思考是否满足预期的结构与物理要求。该反馈随后用于迭代细化后续的规划与生成步骤,缓解跨模态的误差传播。重要的是,无论任务是自回归问答还是基于扩散的视觉生成,Collaborative Thoughts都使用同一个协同循环。通过若干代表性示例,我们展示了Collaborative Thoughts如何提升空间推理的可靠性与生成的可控性。

基于自回归-扩散Collaborative Thoughts的推理
图3:几何问题求解推理范式示意图。所提出的 AR-Diffusion Collaborative Thoughts(中)创建中间视觉蓝图,以弥合文本与视觉之间的鸿沟。该方法纠正了 Diffusion-Only 方法(右)中观察到的几何幻觉,并且与 AR-Only 文本思维链(左)相比显著提升了推理效率,将计算成本降低了数个数量级。