论文

论LLM代码正确性内部表示的鲁棒性

On the Robustness of LLMs' Internal Representation of Code Correctness

模型评测模型行为与机制分析

摘要

现代语言模型生成的代码通常读起来很自然。然而,它也常常无法实现所要求的内容。这不足为奇,因为研究表明模型自身的置信信号与实际正确性的校准很差。评估正确性的一种有希望的方法是查看模型内部:通过对比正确和不正确程序的隐藏状态,最近的工作捕获了代码正确性的内部信号,该信号能够比模型的 词元级 或声明的置信度更好地判断候选解决方案,而无需执行测试。然而,这个信号是通过一种特定的方式捕获的,留下了一个重要的问题:它是否反映了模型的鲁棒属性或该选择的产物。我们系统地研究这个问题,改变从模型内部提取信号的方式。除此之外,我们还询问信号的质量是否受到用于提取信号的数据的限制,通过构建仅在使它们不正确的故障方面不同的程序对。我们的结果表明,没有一种配置是最好的,并且隔离故障也无济于事。