论文

失败的推理痕迹告诉你什么是可以修复的(但不是通过阅读它们)

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

模型推理测试时计算扩展

摘要

当训练后的语言模型在推理问题上失败时,常见的测试时间缩放响应是在额外的尝试上花费更多的计算,并且失败的跟踪不再发挥作用。我们认为这忽略了一个关键信号;一些失败来自于不幸的抽样,更多的执行轨迹会有所帮助,而另一些则是结构性的,无论预算如何,都会拒绝重新抽样。我们建议失败的跟踪编码可恢复性结构:测试时间干预可以挽救给定故障的推理时间签名。从可用干预措施的结构中得出的三个问题级轨迹特征,从失败的部署的分布签名而不是其文本中恢复了这种结构。它们将故障聚类成稳定的状态,描述不同 后训练 方法的故障拓扑($84.3{\pm}4.3\%$ 准确度,$+20\%$ 超过多数类基线),并支持 无需训练 路由规则,该规则将与部署相关的 Steerable-Hard 子集上的救援提升 $+12.2\%$(重试不足且有界的故障)可以进行干预)。功能和路由规则在两个跨系列探针之间传输。因此,相同的三个功能将废弃数据中的失败跟踪转换为诊断对象,支持测试时间路由和 后训练 分析,而无需训练时间或权重空间访问。