论文
面向代码LLM的噪声测试时强化学习
Noisy Test-Time Reinforcement Learning for Code LLMs
摘要
大语言模型 (LLM) 在各种与代码相关的任务中表现出了卓越的性能。然而,与通常高质量且无错误的精心策划的数据集不同,现实世界的用户指令通常是模糊且容易出错的,这对代码LLM的鲁棒性构成了重大挑战。此外,以鲁棒性为导向的微调依赖于配对的干净噪声样本,这些样本的管理成本很高,并且需要复杂的噪声模拟技术。为了应对这些挑战,我们提出了噪声测试时强化学习框架(NTRL-Code),该框架在测试阶段仅使用未标记的噪声数据来实现代码 LLM 的稳健自我进化。具体来说,NTRL-Code 使用保守的自降噪来获得更清晰的语义锚来进行目标估计,并采用基于抽象语法树(AST)的结构聚合机制来从多个候选程序中估计代理目标。然后,该策略在原始嘈杂的提示上进行优化,并采用结合了格式有效性、代码相似性和防重复信号的混合奖励。对三个基准的广泛实验(每个基准都包含字符级、单词级和段落级扰动)表明 NTRL 代码产生了稳健且一致的改进,稳定了各种基本模型的预测。我们的代码可在 https://github.com/Xikai97/NTRL-Code. 获取
