论文

TicTacBench:评测编码Agent的RTL时序收敛能力

TicTacBench: Benchmarking Timing Closure Capabilities of Coding Agents

智能体系统Agent任务评测

摘要

大语言模型(LLM)的最新进展催生了能够执行复杂工程任务(包括寄存器传输级(RTL)设计与优化)的编码智能体。现有 RTL 基准主要评估生成 RTL 设计的功能正确性与性能、功耗、面积(PPA),对智能体进行时序收敛(timing closure)的能力评估不足。我们提出 TicTacBench,一个专门评测编码智能体在布局布线后(post-PnR)评估下完成 RTL 级时序收敛能力的基准。TicTacBench 包含 30 个多样化任务,每个任务提供一个次优 RTL 设计、真实的时序约束、功能等价性验证和时序报告。通过由 8 个前沿 LLM 驱动的编码智能体超过 300 次运行,我们发现即使最好的智能体也只能收敛 53.3% 的任务,平均伴随 7.18% 的面积-延迟积(ADP)退化和 8.83% 的能量-延迟平方积(EDDP)改善。我们归纳了智能体无法收敛时序的常见失败类别,进而提出 TicTacSkill,一种引导智能体遵循标准时序收敛流程的新方法,将时序收敛率提高 9%。这些结果表明,尽管编码智能体在 RTL 设计上已取得显著进展,其时序收敛能力仍有很大提升空间。

TicTacBench:评测编码Agent的RTL时序收敛能力:论文配图
图 1:PnR 前时序指标对 PnR 后时序收敛并不可靠。(a) 将 PnR 前收敛视为对 PnR 后收敛的预测会产生很高的假阳性:在 PnR 前看似收敛时序的设计在物理实现后常常失败。(b) PnR 前指标用于评估并不可靠。PnR 前被选为最佳的智能体与 PnR 后的结果不一致。