论文

BashCoder-R1:通过鲁棒性感知组相关策略优化实现鲁棒且可解释的 Bash 代码生成

BashCoder-R1: Towards Robust and Explainable Bash Code Generation with Robustness-Aware Group Relative Policy Optimization

模型训练强化学习

摘要

Bash 脚本对于系统管理、DevOps 和 CI/CD 至关重要,其中代码质量会影响稳定性和安全性。然而,LLM 生成的脚本通常缺乏推理,并包含鲁棒性缺陷,例如边缘情况处理不当和未经检查的故障。这在生产环境中尤其重要,因为即使是很小的错误也可能导致服务中断。我们提出了 BashCoder-R1,这是一个通过将可解释性作为设计目标来共同解决这两个问题的框架。该管道分为三个阶段。持续的 预训练 适应 Bash 语法。在专家验证的样本上进行长思想链监督的 微调 在代码生成之前教授风险规避推理。鲁棒性感知组相对策略优化优化了语法正确性、鲁棒性(通过 shellcheck 验证)和格式遵守的加权奖励。这种分阶段的设计确保模型逐步获得语法知识、推理能力和稳健的决策能力。在我们的 BashBench 基准测试(952 个实际任务、773 个单行任务和 179 个多行任务)上,BashCoder-R1 的 SyntaxPass 为 100.00/94.97,RobustWarnRate 为 4.01/16.47,RobustPass 为 95.99/79.33,FuncRate 为 93.01/93.85,单行和多行任务的 FullRate 分别为 90.04/73.18。与最强基线 DeepSeek-V3.2(推理)相比,相对 FullRate 提高了 37.82% 和 20.18%。人类评估证实其推理链的质量最高。