论文

CHORUS:以互补专家实现高覆盖测试台激励生成

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

摘要

大语言模型(LLM)推动了代码生成的发展,在这类任务中可执行反馈比单纯的文本模仿提供更可靠的学习信号。硬件验证是代码生成的重要应用,占现代芯片设计工作量的相当大比例,其中高覆盖测试台(testbench)激励生成是关键任务。我们提出CHORUS,一个后训练框架,其性能超越了常规从监督微调(SFT)到强化学习(RL)的管线。CHORUS建立在两个观察之上。第一,分阶段SFT产生行为多样的检查点,密集奖励RL将它们转化为总性能相当但任务级强项各异的强专家。第二,这些互补强项可以通过免训练的模型合并或进一步后训练加以利用,从而超越最佳单个专家。通过将所得专家整合进单个4B模型,CHORUS在CVDP-ECov上达到88.0% Pass@1,超过DeepSeek-R1(671B)13.5个百分点。

CHORUS:以互补专家实现高覆盖测试台激励生成:论文配图
图1:仅靠规模无法解决测试平台生成问题。CVDP-ECov上的覆盖率通过率与模型规模的关系,模型规模以对数标度展示。通用模型、编程专用模型和硬件专用模型仅呈现微弱的规模趋势;即使是671B参数的前沿模型也远低于最佳可达性能。CHORUS(红色星号)作为一个单一的4B模型,通过针对性的后训练大幅超越了这一前沿。