论文

Alpha-RTL:RTL 硬件优化的测试时训练

Alpha-RTL: Test-Time Training for RTL Hardware Optimization

模型训练强化学习

摘要

大语言模型 (LLM) 在生成功能正确的寄存器传输级 (RTL) 硬件设计方面显示出越来越大的前景。最近的系统通过 EDA 集成强化学习以及语法、模拟和 PPA 奖励进一步改进,但在部署之前训练通用 RTL 生成器,同时测试时使用冻结策略进行搜索。相反,我们在测试时执行强化学习,允许 LLM 策略适应当前特定 RTL 问题的可执行 EDA 反馈。据我们所知,我们提出了 TTT-RTL,这是第一个按设计测试时训练框架,它闭合了 LLM 策略和用于 RTL 优化的 EDA 管道之间的循环。 TTT-RTL 对候选实现进行采样,通过语法检查和模拟对其进行验证,使用综合派生的 PPA 产品对有效设计进行评分,通过 PUCT 索引的设计状态池重用高奖励变体,并使用熵策略梯度目标更新策略。为了稳定稀疏或稳定奖励下的策略更新,我们引入了自适应 KL 预算控制器,该控制器使用参考 KL、有效样本大小和奖励饱和信号来调整熵约束。在 Nangate 45nm 下的 RTLLM v2.0 上,TTT-RTL 将几何平均 PPA 乘积比参考值降低了 65.1%,优于已发布的最强冻结策略代理基线 26.1%。在 Sky130 下的工业玄铁 C910 FPU 领先零预期单元上,TTT-RTL 实现了 59.4% 的 ADP 减少,并且消融证实了政策适应、国家重用和 KL 预算控制各自的贡献。这些结果表明,具有可执行 EDA 反馈的测试时训练可以使基于 LLM 的 RTL 生成超越功能正确性,转向物理优化的硬件。