论文
从对比中学习:从多样化搜索轨迹合成推理路径
Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
摘要
蒙特卡洛树搜索(MCTS)已被广泛用于自动化推理数据探索,但当前的监督提取方法仍然低效。标准做法只保留单一最高奖励轨迹,丢弃了众多已探索路径中蕴含的对比信号。我们在此提出对比推理路径合成(CRPS),一个将监督提取从过滤过程转变为合成过程的框架。CRPS采用结构化反思流程分析高质量与低质量搜索轨迹之间的差异,提取关于策略转折点与局部失败模式的显式信息。这些洞见指导推理链的合成,使其在吸收成功模式的同时规避已识别的陷阱。实验表明,仅在60K条CRPS合成样本上微调的模型即可匹敌乃至超过在590K条标准拒绝采样样本上训练的基线,数据集规模缩小20倍。此外,CRPS提升了域外基准上的泛化能力,表明从成败对比中学习比只从成功中学习能产生更可迁移的推理能力。
