论文
可验证的搜索不是可学习的思想链
A Verifiable Search Is Not a Learnable Chain-of-Thought
摘要
人们很容易认为任何可以通过短程序解决的任务都可以作为其思想链教授给模型:写出步骤,进行微调,然后模型就会随之而来。本文表明该假设对于可识别的一类过程来说是失败的。测试平台有九个推理任务,每个任务都来自确定性生成器;公共和隐藏的分割共享生成器,因此保留的数据代理测试准确性。我将生成器逆向工程到 Python 求解器中,将它们渲染为思想链,并在 30B(3.5B 活跃)Nemotron 模型上提炼成等级 <= 32 LoRA。前向计算任务很容易安装:查找/算术和 8 位布尔任务传输(>= 0.99 和 0.68)。 Cryptarithm 则不然:尽管搜索求解器回答了 71% 的实例,但在 11 种思想链设计、来自可验证奖励的强化学习以及自我训练中,其回溯搜索的结果保持在 0.01-0.07。这不是能力差距。该模型对 97-100% 的行进行算术,并在 71% 的行中将正确的密码排在前八名;它不能以从左到右的推导方式继续搜索。 微调 学习可验证消除步骤的形状,而其判决成为无条件模板,只有 16-57% 的时间正确(“判决作为词元”)。上限适用于从 3B 到 671B 的骨干网以及 微调 和提示;受控干预可以找出原因:揭示密钥,从而使推导向前推进,将相同的实例从 0.03 提升到 0.57。当一个过程的唯一解决方案是在无信息结构上进行搜索时,就不存在可以模仿的忠实的前向思想链。只有通过删除搜索、将其组合核心预先计算到目录中并减少回忆加验证的跟踪,该任务才变得可学习;这样,第一名的解决方案达到 Private LB 0.92。提炼的是记忆和验证,而不是搜索。