论文
SanSi:循环类型决策模型与 System 1.5 推理
SanSi: A Looped Typed Decision Model for System 1.5 Thinking
摘要
类型化决策模型在不生成文本的情况下回答已声明的问题:决策头在单次前向传递中返回每个已声明选项的概率。单次传递是快速、直观的系统 1 思维。我们研究一次传递和生成推理之间的关系:循环,在输入 读出 之前,相同的层会递归应用多次。每个循环都让模型在提交答案之前修改其隐藏状态,而不生成 token;我们称之为系统 1.5 思维。我们提出了 SanSi,它将预训练的循环语言模型转变为类型化决策模型。每次循环后都会读取选项概率,并且每个循环都使用适当的评分规则进行训练,以便一个模型在一次运行中满足从一个循环到八个循环的所有预算。在来自 59 个来源的 10,027 个测试决策中,SanSi 达到了 72.0% 的准确率:比使用相同配方训练的相同形状的非循环模型高 13.5 个点,比其大小的较新非循环模型高 5.3 个点,比参数三倍的模型低 1.8 个点。在两个深度控制的任务中,循环将可解深度扩展到训练之外的深度,而较大的单通道模型会失败。作为强化学习策略优化的评委,在没有黄金答案的情况下,三思将生成器的F1提高了7.7分。