论文
CHORUS:以互补专家实现高覆盖测试台激励生成
CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation
摘要
大语言模型(LLM)推动了代码生成的发展,在这类任务中可执行反馈比单纯的文本模仿提供更可靠的学习信号。硬件验证是代码生成的重要应用,占现代芯片设计工作量的相当大比例,其中高覆盖测试台(testbench)激励生成是关键任务。我们提出CHORUS,一个后训练框架,其性能超越了常规从监督微调(SFT)到强化学习(RL)的管线。CHORUS建立在两个观察之上。第一,分阶段SFT产生行为多样的检查点,密集奖励RL将它们转化为总性能相当但任务级强项各异的强专家。第二,这些互补强项可以通过免训练的模型合并或进一步后训练加以利用,从而超越最佳单个专家。通过将所得专家整合进单个4B模型,CHORUS在CVDP-ECov上达到88.0% Pass@1,超过DeepSeek-R1(671B)13.5个百分点。
