论文
可解码状态不等于被输出丢弃的信息
Decodable In-Context State and Model Output Across Training
摘要
先前的工作表明,探针可以解码模型错误的上下文绑定,并且探针引导的转向可以修复其中的一些错误。我们在公共训练前和训练后检查点跟踪探针准确性、模型输出和转向响应。在 Pythia 预训练期间,探针精度会提高,而探针引导转向在两种模型尺寸下从可忽略不计的全试验效益变为更大的效益。保存的分数将探针判断正确而模型回答错误的样例与正确候选者的低和高于均匀模型概率区分开来。预言机目标引导已经修复了许多早期错误,但保存的聚合无法将目标质量与干预敏感性分开。对最终状态或候选logit训练的解码器进行比较,发现在后期检查点模型错误上没有检测到最终状态优势。信息论反例解释了为什么仅对错误的可解码性无法建立丢弃的输出信息。与下游遗漏的联系仍然开放。