论文
强化学习改进基于 大语言模型 的自动化代码合规系统
Reinforcement learning to improve large language model-based automated code compliance systems
摘要
基于 大语言模型 (LLM) 的建筑法规自动代码合规性 (ACC) 方法很容易生成不正确的和幻觉的计算机可处理规则。本文介绍了 P4IR,这是一个两阶段框架,它使用有监督的 微调 (SFT) 将领域知识灌输到 LLM 中,然后通过组相对策略优化 (GRPO) 来提高以高级代码骨架的形式生成的中间表示的准确性。相对于 SFT 基线,该框架的树编辑距离和 词元级 Levenshtein 距离分别减少了 23.8% 和 38.6%。比较分析表明,这种方法在零样本设置中在代码结构和语义方面都优于领先的 LLM,特别是通过几次提示进行评估的 Claude Opus 和 Sonnet 4.5、GPT-5.2、Qwen-3-Max 和 GLM-4.7。此外,GRPO 阶段的误报率虽小但在统计上显着减少。通过将 SFT 与 GRPO 相结合,直接针对特定领域的目标进行优化,这种方法提供了一条通往更准确、更可靠的基于 LLM 的 ACC 系统的途径。