论文

用于恰当评估 RTL 代码优化的新基准

A New Benchmark for the Appropriate Evaluation of RTL Code Optimization

模型评测基准与评测资源

摘要

人工智能的快速进步日益依赖高效的集成电路(IC)设计。近期研究探索使用大型语言模型(LLM)生成寄存器传输级(RTL)代码,但现有基准主要评估语法正确性,而非以功耗、性能与面积(PPA)衡量的优化质量。本工作提出 RTL-OPT,一个评估 LLM 在 RTL 优化方面能力的基准。RTL-OPT 包含 36 个手工设计的数字设计,覆盖组合逻辑、流水线数据通路、有限状态机与存储接口等多种实现类别。每个任务提供一对 RTL 代码:一个次优版本和一个人工优化参考,后者反映传统综合工具未能捕捉的业界成熟优化模式。此外,RTL-OPT 集成了一个自动化评估框架,用于验证功能正确性并量化 PPA 改进,从而实现对硬件设计优化生成式模型的标准化且有意义的评估。

用于恰当评估 RTL 代码优化的新基准 配图
图 1:来自现有少数 RTL 优化工作(Yao et al., 2024)的示例与我们提出的基准的对比,该基准捕捉真实的 RTL 优化机会。次优设计是供 LLM 改进的输入,优化后的设计则是黄金参考。