论文

ChipBench:评估LLM在AI辅助芯片设计中性能的下一步基准

ChipBench: A Next-Step Benchmark for Evaluating LLM Performance in AI-Aided Chip Design

模型评测基准与评测资源

摘要

虽然大语言模型(LLM)在硬件工程中展现出显著潜力,但当前基准存在饱和和任务多样性有限的问题,未能反映LLM在真实工业工作流中的表现。为弥补这一差距,我们提出一个面向AI辅助芯片设计的综合基准,严格评估LLM在三项关键任务上的表现:Verilog生成、调试和参考模型生成。我们的基准包含44个具有复杂层次结构的真实模块、89个系统性调试案例,以及覆盖Python、SystemC和CXXRTL的132个参考模型样本。评估结果揭示出显著的性能差距:最先进的Claude-4.5-opus在Verilog生成上仅达30.74%,Python参考模型生成上仅13.33%,与现有饱和基准中SOTA模型超过95%通过率相比,挑战显著。此外,为帮助提升LLM参考模型生成,我们提供了高质量训练数据生成的自动化工具箱,促进这一欠探索领域的未来研究。代码见 https://github.com/zhongkaiyu/ChipBench.git。

ChipBench:评估LLM在AI辅助芯片设计中性能的下一步基准
图3:ChipBench 在不同任务上的工作流:(a) 评估 LLM 生成的 Verilog 代码,(b) 评估 LLM 生成的参考模型(reference models,支持 Python、SystemC 和 CXXRTL),以及 (c) 利用工具箱为参考模型生成高质量训练数据集(支持 Python、SystemC 和 CXXRTL,以 Python 为例)