论文
TypeProbe:从预训练代码模型的隐藏状态恢复类型表示
TypeProbe: Recovering Type Representations from Hidden States of Pre-trained Code Models
摘要
最先进的代码模型取得了令人印象深刻的性能,但它们内部编码类型信息的程度仍然知之甚少。我们使用 Java 和 Python 代码示例的并行数据集来探测内部类型表示的预训练代码模型的剩余流。我们的结果表明,跨语言类型表示甚至可以从非类型化代码中出现。此外,我们通过在一种语言上训练探针来推断另一种语言中的参数和结果类型,来测试隐藏状态是否对类型化函数应用所隐含的结果类型进行线性编码。最后,我们发现这种结构对于词汇扰动和跨语言句法变化具有一定的鲁棒性。据我们所知,先前关于代码模型可解释性的工作并未直接针对形式类型语义或跨语言类型表示。我们发布我们的代码和数据集。