循环语言模型中的操作原型自省:过程质量水龙头、可执行分支和读出控制边界
Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary
摘要
语言模型能否读取其正在进行的计算的质量,并且外部干预能否将读取的结果转化为更好的结果?我们在冻结的 2.6B 循环 Transformer、Ouro-RLTT 中测试这两个问题。在 GSM8K 上,严格的预答案探测排除了答案区域和标准答案值,但预测成功:隐藏状态加上长度/对数概率特征达到 AUROC 0.797,而单独这些表面特征则达到 0.731(增量 +0.066;任务集群 95% CI [+0.021,+0.112];170 个任务)。在 Horizon Logic 上,一项前瞻性扩展的任务不相交研究给出了 +0.111 的增量(CI [+0.056,+0.169]),在新队列上独立复制(+0.095),并且对对抗性畸形兄弟捷径具有鲁棒性。重复性还将候选质量的可读性逐渐移至更早的物理深度;这种趋势在 Ouro 家族中得到了复制,在非家族 Huginn 中也得到了定性的体现,尽管他们的转移几何结构不同。读数转换为经过验证的决策级增益。在四个密封的选择性预测臂中,基于隐藏状态的分数比仅快捷方式的分数提高了风险覆盖率,即使每个候选者都形成良好,最终选择也会随机匹配(27/32 正确选择相对于 64.8% 预期;p = 0.0086)。生成控制不会转换:方向转向为负,分支屏幕有界,精确计算循环分配和最小 LoRA 方向绑定检测不到增益。这些测试通过 Ouro 的 192 槽循环缓存上的位精确分支/进位/修剪机制运行,包括后缀重新计算拼接,可节省高达 88% 的每分支层传递。我们将这种可用但不可生成控制的属性称为操作原型内省。所有承载值都使用源项不相交分割和反对称成对评估。