论文
TicTacBench:评测编码Agent的RTL时序收敛能力
TicTacBench: Benchmarking Timing Closure Capabilities of Coding Agents
摘要
大语言模型(LLM)的最新进展催生了能够执行复杂工程任务(包括寄存器传输级(RTL)设计与优化)的编码智能体。现有 RTL 基准主要评估生成 RTL 设计的功能正确性与性能、功耗、面积(PPA),对智能体进行时序收敛(timing closure)的能力评估不足。我们提出 TicTacBench,一个专门评测编码智能体在布局布线后(post-PnR)评估下完成 RTL 级时序收敛能力的基准。TicTacBench 包含 30 个多样化任务,每个任务提供一个次优 RTL 设计、真实的时序约束、功能等价性验证和时序报告。通过由 8 个前沿 LLM 驱动的编码智能体超过 300 次运行,我们发现即使最好的智能体也只能收敛 53.3% 的任务,平均伴随 7.18% 的面积-延迟积(ADP)退化和 8.83% 的能量-延迟平方积(EDDP)改善。我们归纳了智能体无法收敛时序的常见失败类别,进而提出 TicTacSkill,一种引导智能体遵循标准时序收敛流程的新方法,将时序收敛率提高 9%。这些结果表明,尽管编码智能体在 RTL 设计上已取得显著进展,其时序收敛能力仍有很大提升空间。
