论文
OpenRTLSet:用于基于 大语言模型 的 Verilog 模块设计的完全开源数据集
OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design
摘要
OpenRTLSet 引入了用于硬件设计的最大的完全开源数据集,为研究社区和行业提供超过 131,000 个不同的 Verilog 代码示例。我们的数据集独特地结合了来自 GitHub 存储库的 Verilog 代码(102k 模块)、VHDL 翻译(5k 模块)和可综合的 C/C++ 翻译(24k 模块),所有这些都可以免费访问,没有专有限制。使用推理模型 DeepSeek-R1,我们为每个代码示例生成了配对的自然语言描述,从而使各种语言模型系列(例如 Qwen 和 Granite)的 微调 能够用于 Verilog 代码生成。我们的数据集探索了多种选项,包括 Verilator 生成的 C++ 文件作为标记期间的附加上下文、量化技术(INT4 与 BF16)以及模型大小之间的性能差异(7B-32B 参数)。 OpenRTLSet 证明开源方法可以在硬件设计任务中实现卓越的性能,为该领域的可访问研究和商业用途奠定新的基础。