论文

EAHC:用执行行为校准幻觉的Verilog代码候选重排

Execution-Anchored Hallucination Calibration Reranking for Verilog Code Generation

模型推理推理验证与自校正

摘要

大语言模型代码生成能力较强,但在Verilog等低资源硬件描述语言上表现明显下降。多候选采样提高正确解的出现概率,自动选出最佳候选仍困难。九个模型、两项基准的研究发现:基于测试通过与否的执行重排,受生成测试平台质量影响,跨领域迁移较差;大模型评判又可能产生推理幻觉,对执行等价代码作出不同判断。两类信号的错误来源互补:执行信号确定但测试覆盖有限,推理信号语义丰富却易产生幻觉。直接让推理模型看到执行结果,会使判断锚定测试结论,因此EAHC独立获取两类信号,只在最终决策时融合。框架用执行行为校准推理判断,使执行等价候选获得一致分数,双通道分别为40亿参数推理判别器EAHC-R,以及利用RAG生成测试平台进行执行验证的EAHC-T。