论文
RTL-BenchLS:面向RTL推理与生成的大规模基准
RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models
摘要
基于LLM的RTL生成和推理是硬件设计自动化的一个有前途的方向。高质量基准是跟踪这一方向进展的关键基础设施。然而,现有的 RTL 基准在规模和任务范围方面都面临着固有的限制。它们涵盖的设计通常小而简单,任务几乎完全集中在规范到 RTL 的生成上。 Frontier 模型的性能在现有基准上已经饱和。扩大这些基准测试从根本上来说很困难,因为基准测试需要对齐的标签,例如规范和测试平台。这种一致的高质量数据很少可用于现实世界的设计。我们推出了 RTL-BenchLS,这是一个解决上述两个限制的大规模基准测试。它包含 10,000 多个经过正式验证的 Verilog 设计,涵盖比现有基准更大、更复杂的设计。除了规范到 RTL 生成之外,我们还提出了三个联合评估推理和生成的新任务:往返推理、屏蔽内容推理和存储库问题推理。前两个是自监督的,直接解决了扩展瓶颈。所有任务都通过正式的等效性检查进行验证,无需任何手动测试平台。我们在 RTL-BenchLS 上评估了八个大语言模型。即使是最好的模型,在自然语言往返推理上也只能达到 23%,在屏蔽内容推理上只能达到 28%,在存储库问题修复上只能达到 12%。 RTL-BenchLS 比现有基准测试更具挑战性。它为未来的改进留下了充足的空间,并为开发基于 LLM 的硬件设计方法提供了指导。
