论文

LLM-FSM:扩展大语言模型以实现RTL代码生成中的有限状态推理

LLM-FSM: Scaling Large Language Models for Finite-State Reasoning in RTL Code Generation

模型评测基准与评测资源

摘要

有限状态推理,即理解并实现依赖状态的行为的能力,是硬件设计的核心。本文提出 LLM-FSM 基准,评估大语言模型(LLM)从自然语言规格中恢复有限状态机(FSM)行为、并将其转化为正确的寄存器传输级(RTL)实现的能力。与依赖人工构造样例的既有规格到 RTL 基准不同,LLM-FSM 通过全自动流水线构建。LLM-FSM 首先构建状态数量可配置、转移结构受约束的 FSM,然后提示 LLM 将每个 FSM 以结构化 YAML 格式连同应用上下文加以表达,并进一步把该 YAML 转换为自然语言(NL)规格。我们的流水线从同一 YAML 以构造即正确的方式合成参考 RTL 与测试平台(testbench)。全部 1,000 个问题均通过基于 LLM 与基于 SAT 求解器的检查加以验证,并对子集进行人工审查。我们的实验表明,随着 FSM 复杂度上升,即使最强的 LLM 准确率也急剧下降。我们进一步证明,通过监督微调(SFT)实现的训练时扩展能有效泛化到分布外(OOD)任务,而增加测试时计算可提升推理可靠性。最后,LLM-FSM 允许其 FSM 复杂度随未来模型能力扩展,保持可扩展性。

LLM-FSM:扩展大语言模型以实现RTL代码生成中的有限状态推理
图2:LLM-FSM 评估流水线概览。一条 NL(自然语言)规范通过三种工具链设置进行处理:Specification → RTL、Specification → YAML → RTL 以及 Specification → SystemC。每个模型预测都在同一参考 testbench 下执行,正确性通过与参考 RTL 进行逐周期输出匹配来判定。