论文
StepPRM-RTL:步级过程奖励引导的LLM微调增强RTL代码生成
StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis
摘要
由于 Verilog 和 VHDL 中的长期推理、多步骤依赖性以及严格的正确性约束,自动生成数字硬件设计的 RTL 代码仍然具有挑战性。我们提出了 StepPRM-RTL,这是一种新颖的框架,它结合了逐步轨迹建模、过程奖励建模 (PRM) 和检索增强微调 (RAFT),以增强基于 LLM 的 RTL 代码生成的功能正确性和推理保真度。 StepPRM-RTL 从规范解决方案构建逐步推理轨迹,其中每个步骤都包含基本原理和增量代码修改。过程奖励模型 (PRM) 评估中间步骤,提供密集的反馈,指导 RAFT 微调期间的强化式更新。蒙特卡洛树搜索 (MCTS) 探索替代推理路径,通过高质量轨迹丰富训练数据集。这种逐步和结果感知奖励的集成使模型能够学习如何以及为何构建正确的 RTL,从而改进标准监督或基于结果的训练之外的长期推理。对基准 Verilog 和 VHDL 数据集的实验评估表明,StepPRM-RTL 在功能正确性和推理保真度指标方面优于现有最佳方法 10% 以上。消融研究证实,PRM 引导的奖励和逐步轨迹探索的结合是其性能的关键。 StepPRM-RTL 概括了 RTL 语言,并为高保真、可解释的代码生成提供了可扩展框架,为 LLM 辅助的硬件设计自动化建立了新标准。
