论文
提示有帮助,但有教导作用吗?评估代码生成中的技能转移
Hints Help But Do They Teach? Evaluating Skills Transfer in Code Generation
摘要
当提示将失败的生成程序变成通过的程序时,它是否提供了缺失的信息,或者只是引导模型走向它已经可以生成的解决方案?我们使用可执行评估在 HumanEval+ 和 MBPP+ 上测试这些假设。对于Qwen2.5-3B-Instruct,自适应相关提示挽救了79个选定故障中的36个;一个不相关的提示拯救了 19 个,而 8 个无提示的样本解决了 46 个并恢复了 36 个相关提示拯救中的 31 个。 Phi-3.5-mini 显示了相同的模式:相关提示拯救了 101 个失败中的 42 个,无关提示拯救了 17 个,无提示采样解决了 57 个,包括 42 个相关提示拯救中的 36 个。由于提示条件使用不同的尝试预算,因此这些比较不会隔离纯粹的语义效果。对 Qwen 的机制测试确定了相关和不相关提示共享的稳定激活方向。持续添加这个方向会产生 14 次救援和 18 次回归,但没有可检测到的净准确度增益;习得的低秩干预具有积极但不精确的估计效果。完整的文本规范解决了 24 个上下文定义问题中的 22 个,而经过测试的虚拟 KV 前缀只解决了 5-11 个。后代隐藏状态探针跨基准转移,合并后的 AUROC 为 0.806 和 0.780,但它们相对于词元置信度的第一选择优势在统计上尚未解决。总体而言,相关提示可以挽救失败,但大多数挽救的解决方案已经可以通过普通采样得出,并且这里测试的内部干预措施并没有建立任务通用能力转移。