论文
HWE-Bench:在真实世界硬件缺陷修复任务上评测LLM智能体
HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
摘要
现有的硬件设计基准主要在孤立、组件级任务上评估大语言模型(LLM),例如根据规格生成HDL模块,尚未覆盖仓库规模的评估。我们提出HWE-Bench,这是首个在真实世界硬件缺陷修复任务上评估LLM智能体的大规模、仓库级基准。HWE-Bench包含417个任务实例,源自横跨Verilog/SystemVerilog与Chisel的六个主要开源项目的真实历史缺陷修复pull request,覆盖RISC-V核、SoC和安全信任根。每个任务都建立在完全容器化的环境中,智能体必须解决真实的缺陷报告,其正确性通过项目原生的仿真和回归流程验证。该基准通过一个高度自动化的流水线构建,可高效扩展到新仓库。我们用四种智能体框架评估了七个LLM,发现最佳智能体总体解决70.7%的任务,在较小核上的表现超过90%,但在复杂SoC级项目上降至65%以下。我们观察到模型间的性能差距比软件基准上通常报告的更大,且难度由项目规模和缺陷类型分布驱动,而非仅仅由代码规模决定。我们的失败分析将智能体的失败追溯到调试过程的三个阶段:故障定位、硬件语义推理,以及跨RTL、配置和验证组件的跨产物协调,为开发更强的硬件感知智能体提供了具体方向。
