论文

AI智能体真能完成RTL到GDS吗——工具交互式EDA工作流基准评测的教训

Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

智能体系统Agent任务评测Agent Skills长程任务评测

摘要

大语言模型(LLM)智能体正把电子设计自动化(EDA)从静态RTL生成扩展到长程、工具交互的工作流。但通用编码智能体——即使配备EDA领域技能——能否可靠执行涵盖综合、物理实现与工程变更指令(ECO)优化的端到端RTL到GDS流程,仍不清楚。我们在两个时序目标下、使用商业EDA工具,在PicoRV32 RTL到GDS流程上评估AI智能体;以端到端设计得分、阶段完成度与Token ROI(把设计质量与运行时和成本关联的成本效率指标)评估表现。比较三种智能体架构与四个基座模型,我们得出三条实践教训。第一,领域技能改善智能体对单个子任务的理解,但不保证长程EDA流程的可靠完成。第二,取得相近设计进展的智能体,Token ROI差距可达141倍,暴露运行时与成本效率的巨大差异。第三,底层工具接口失配是物理设计失败的主要来源,尤其当Tcl命令依赖工具版本或执行模式时。这些结果表明,稳健的智能体EDA不仅需要更强的模型,还需要结构化工具接口、持久设计上下文、受控执行与过程级评估。

AI智能体真能完成RTL到GDS吗——工具交互式EDA工作流基准评测的教训:论文配图
图 1. PicoRV32 RTL 至 GDS 评估流程。代理必须通过综合、物理实现、物理感知 ECO 和最终可交付成果生成来推进单个设计,同时在每个阶段后接收工具反馈。