论文

LLM 在硬件设计的 RTL 编码中如何失败和泛化?

How LLMs Fail and Generalize in RTL Coding for Hardware Design?

摘要

将顺序编程先验转换为硬件设计的并行时序逻辑仍然是 大语言模型(LLM) 的关键瓶颈。为了研究这一点,我们受认知理论的启发,引入了一种基于问题可解决性的新错误分类法。我们的分类法将失败分为句法、语义、可解函数和不可解函数类型。评估显示,VerilogEval 基准存在严格的经验上限,前沿模型的初始通过率稳定在 90.8%。这些平台是由无法解决的功能错误定义的,暴露出不受测试时间计算扩展影响的持续知识差距。此外,我们揭示了一个显着的表面收敛差距:优化很容易消除语法错误,但同时加剧了更深层次的功能故障。我们的研究结果表明,对齐技术只是教会模型进行编译。虽然重复采样策略可以修补可解决的错误,但寄存器传输级(RTL)编码能力仍然受到预训练知识的严格限制。解决当前基于 LLM 的硬件生成管道中的挑战需要对模型推理而不是对齐干预进行更多研究。