论文
隐藏状态中的质问者:扩散语言模型中的正确性信号
A Heckler in the Hidden State: Correctness Signals in Diffusion Language Models
摘要
扩散语言模型通过重复更新部分屏蔽序列来生成代码。我们询问它们的内部激活是否编码代码的正确性以及该信息是否可以改进生成。在六个扩散模型中,线性探针区分通过和失败的尝试,最强的读数通常出现在早期层之外。使用小的语义突变的控件支持与正确性的连接,而不仅仅是表面样式。与模型置信度相比,探测点估计没有提供一致的优势。将探针导出的方向添加到残余流不会对测试的转向设置产生可靠的改进,而相反的方向会降低性能。我们将这些观察结果与有关统计显着性或普遍无法操纵的主张区分开来。补充方法、存档结果和代码记录了测试的干预措施及其统计校准和再现性的限制。