论文
ChipBench:评估LLM在AI辅助芯片设计中性能的下一步基准
ChipBench: A Next-Step Benchmark for Evaluating LLM Performance in AI-Aided Chip Design
摘要
虽然大语言模型(LLM)在硬件工程中展现出显著潜力,但当前基准存在饱和和任务多样性有限的问题,未能反映LLM在真实工业工作流中的表现。为弥补这一差距,我们提出一个面向AI辅助芯片设计的综合基准,严格评估LLM在三项关键任务上的表现:Verilog生成、调试和参考模型生成。我们的基准包含44个具有复杂层次结构的真实模块、89个系统性调试案例,以及覆盖Python、SystemC和CXXRTL的132个参考模型样本。评估结果揭示出显著的性能差距:最先进的Claude-4.5-opus在Verilog生成上仅达30.74%,Python参考模型生成上仅13.33%,与现有饱和基准中SOTA模型超过95%通过率相比,挑战显著。此外,为帮助提升LLM参考模型生成,我们提供了高质量训练数据生成的自动化工具箱,促进这一欠探索领域的未来研究。代码见 https://github.com/zhongkaiyu/ChipBench.git。
