论文

检测-提取差距:模型在说出答案之前就知道答案

The Detection-Extraction Gap: Models Know the Answer Before They Can Say It

模型推理推理加速

摘要

现代推理模型在答案确定很久之后仍在继续生成。在五个模型配置、两个系列和三个基准中,我们发现 52--88% 的思想链标记是在从部分前缀恢复答案后生成的。这种承诺后的产生揭示了一种结构性现象:检测-提取差距。即使在跟踪的 10% 处,早期前缀的自由延续也能恢复正确的答案,而在 42% 的情况下,强制提取会失败。答案可以从模型状态中恢复,但提示条件解码无法提取它。我们通过自由连续分布和强制连续分布之间的总变差界限来形式化这种不匹配,从而产生后缀引起的移位的定量估计。利用这种不对称性,我们提出了黑盒自适应早期退出 (BAEE),它使用免费延续进行检测和提取,截断 70--78% 的序列生成,同时将所有模型的准确性提高 1--5pp。对于思维模式模型,提前退出可以防止承诺后覆盖,带来高达 5.8pp 的收益;成本优化的变体在平均 9 次 API 调用中实现了 68--73% 的减少。代码可在 https://github.com/EdWangLoDaSc/know2say 获取。