论文

SpecRead:衡量语言模型是否理解硬件规格的基准

SpecRead: A Benchmark for Measuring Whether Language Models Understand Hardware Specifications

模型评测模型能力评测

摘要

硬件设计中大语言模型 (LLM) 的现有基准评估下游工件,例如生成的 RTL、断言或测试平台。当一个模型未能通过这样的基准测试时,这种失败是不明确的:它可能误读了规范,或者它可能理解了规范但未能编写代码。我们引入 SpecRead,这是一个将规范理解与生成能力隔离开来的基准测试。 SpecRead v2.1 包含超过 10 个开源 OpenTitan IP 块的 385 个问题:精确检索、横截面推理、变异规范中的矛盾检测、spec-RTL 一致性检查,以及 82 个控件(41 个干扰项、41 个一致 RTL)。 Type-4 项目是根据真实的 RTL 突变构建的;我们只保留 Icarus Verilog 模拟显示的改变可观察行为的突变。有规范与无规范消融表明问题需要摘录,而不是单独训练回忆(t1/t2 子集上无规范准确度为 3/20),尽管源文本的记忆仍可能有助于发现突变。作为小模型的初始表征,Ministral-3B 总体得分为 33.2%(128/385;宏观平均 39.0%):检索得分为 55.2%,横截面推理得分为 51.7%。在两种以矛盾为中心的类型上,判决加位置测量给出了 48.0% (t3) 和 63.3% (t4),干扰因素的假阳性率为 51.2%,一致 RTL 控制的假阳性率为 100%。分层评分显示,该模型可以很好地定位矛盾(位置准确度为 78.9-81.6%),但在其类别上得分较低(43.9-49.7%)。结构化“规则表”提示干预会降低除 t2(并列)之外的每种问题类型的准确性。 SpecRead 可通过确定性检查自动评分,在保守的主要评分下,灰色区域案例会被计为错误。该基准可通过突变注入为 3 类项目重新生成,并且完全由公共来源构建。