论文
潜空间思维信用:用于潜空间推理的多答案信用分配
Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning
摘要
潜空间推理让语言模型以连续潜表示完成中间推理,而不必将过程全部展开为离散思维链。但仅凭答案奖励,难以为潜空间思维分配信用:单个最终答案会混合思维质量与答案采样噪声。本文提出潜空间思维信用(LTC),一种分层信用分配框架。针对每个提示,LTC采样多个潜空间思维,固定每个思维之后的上下文,再从同一上下文生成多个答案,通过平均答案奖励估计思维级期望奖励。LTC用思维级优势优化潜空间思维阶段,用答案级优势优化答案阶段,并加入优势加权的思维匹配目标,帮助策略复现高信用思维。研究在GRPO式同策略训练框架中实现LTC,在数学推理和STEM多项选择题上评估。LTC取得所比较方法中的最佳平均准确率;消融实验与固定上下文诊断显示,多答案估计减少奖励估计误差,缓解模糊或错误的思维级信用。