论文
代码正确性可从生成前的 LLM 隐藏状态线性解码
Code Correctness Is Linearly Decodable from LLM Hidden States Before Generation
摘要
大语言模型 在其隐藏状态中编码丰富的信息。这项工作询问 Qwen3-4B-Instruct-2507 尚未生成的代码的正确性是否已经在其隐藏状态下清晰可见,并在 LiveCodeBench 的一组 444 个任务上进行了评估。模型的首次尝试代码的正确性可以从最终提示词元的隐藏状态线性解码,在生成任何输出词元之前捕获,在 50 个外部分割中,无泄漏的保留 AUC 为 0.881 +/- 0.008。为了评估该信号是否可以通过提示长度来解释,每个隐藏状态维度都根据其线性效应进行残差。该探针仍达到 0.842 +/- 0.010 的 AUC,大大高于 0.657 +/- 0.014 的逻辑提示长度基线,并且测试的非线性模型均未在此基础上有所改进。无法回答关于自我修复是否在模型的隐藏状态中留下几何签名的伴随问题,因为在这种设置中,第一次尝试失败后成功的修复太罕见,无法支持分析。该贡献既是经验性的,也是方法论性的,提供了证据,证明预生成隐藏状态包含最终代码正确性的强大信号,以及混杂控制诊断,该诊断量化了该信号中有多少在提示长度调整中幸存下来。