论文

传播推理:剖析思维链如何跨模型转移

Reasoning that Travels: Dissecting How Chain-of-Thought Transfers Across Models

模型评测模型行为与机制分析

摘要

大型推理模型 (LRM) 在产生最终答案之前通常会生成广泛的思维链 (CoT) 轨迹。作为显式文本工件,这些痕迹可以传递到其他模型来解决相同的任务,从而实现跨模型推理传输。然而,仅成功的转移并不能揭示所提供的 CoT 如何为另一个模型的答案做出贡献。我们使用受控的提供者-接收者框架来研究这个问题,其中提供者生成推理跟踪,接收者通过越来越长的跟踪前缀解决相同的问题。我们将强制应答(接收者直接从前缀应答)与自由生成(接收者可以在应答之前继续推理)进行比较。在模型和基准测试中,完整轨迹通常会成功传输,但前缀轨迹揭示了不同的机制。在强制应答模式下,AIME 传输很大程度上是由明确的答案可用性驱动的。相反,MMLU-Pro 反映了接收者能力的更大作用,而 ZebraLogic 依赖于部分结构化答案信息,而不是单独的完整答案泄漏。在免费生成模式下,部分 CoT 提高了基准测试的性能,这表明前缀可以指导持续推理。最后,接收者之间的答案一致为尽早停止提供者推理提供了无金信号。总体而言,跨模型 CoT 迁移不是单一现象:它可以反映答案提取、推理支架或接收者依赖能力。