论文
CopT:用于一般推理和代理推理的连续空间的对比 同策略 思维
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
摘要
思想链 (CoT) 是从 大语言模型 (LLM) 引出推理能力的标准方法。然而,常见的 CoT 范式将思考视为回答的先决条件,这可能会延迟获得看似合理的答案,并产生不必要的词元成本,即使模型能够在扩展思考(称为表演推理的行为)之前识别答案。在本文中,我们介绍了 CopT,一种重新设计的推理流程,它颠倒了通常的思考和回答顺序。 CopT 不是在回答之前思考,而是首先引出一个草稿答案,然后根据自己的草稿答案调用后续的 同策略 思维进行反思和纠正。为了评估草稿答案是否值得信任,CopT 将连续嵌入重新设计为推理时间对比验证器。具体来说,它对比了模型在离散词元输入和连续嵌入输入下对相同生成词元的支持,产生了用于答案可靠性的序列级反向 KL 估计器。我们的分析表明,在某些假设下,预期估计等于未解决的潜在状态和发出的答案标记之间的互信息,这解释了为什么它捕获了与答案相关的不确定性,而不是潜在状态中的任意不确定性。当答案被认为不够可靠时,CopT 会执行进一步的 同策略 思考,其中第二个 KL 估计器动态控制草稿答案的可见性,保留有用的部分信息,同时降低被不可靠内容误导的风险。在数学、编码和代理推理任务中,CopT 将峰值准确度提高了 23%,并在相当或更高的准确度下将标记使用量减少了 57%,而无需任何额外的训练。该代码可在 https://github.com/sdc17/CopT 获取。