论文

Rule2DRC:通过执行引导测试生成对 LLM 代理进行 DRC 脚本合成基准测试

Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

智能体系统Agent任务评测

摘要

可制造的芯片布局必须满足数以千计的基于几何的设计规则,设计规则检查 (DRC) 通过在布局上运行可执行的 DRC 脚本来强制执行这些规则。将自然语言规则翻译成正确的 DRC 脚本是一项劳动密集型工作,需要专门的专业知识,从而激励 LLM 代理进行 DRC 脚本合成和调试。然而,现有的基准测试具有较小的评估集,并且通常通过代码相似性而不是执行正确性来评估脚本,并且先前基于机器学习的方法要么忽略执行反馈,要么需要标记的测试布局作为代理的输入。为此,我们引入了 Rule2DRC,这是 DRC 脚本 编码智能体 的大规模基准测试,具有 1,000 个规则到脚本任务和 13,921 个评估芯片布局,用于基于执行的评分。 Rule2DRC 提供了一个评估管道,可通过 DRC 执行结果来测量功能正确性,而不需要将评估布局作为代理的输入。我们还提出了 SplitTester,一种用于程序选择的测试代理,它使用执行反馈来生成有区别的测试用例并分离以前无法区分的候选脚本,从而大大提高了该领域的 Best-of-N 选择性能。我们在 https://github.com/snu-mllab/Rule2DRC 发布了代码。