论文

用于硬件设计验证的自动Harness演化:大语言模型能否巩固已发现Harness的成果?

Automatic Harness Evolution for Hardware Design Verification: Can LLMs Consolidate Gains Across Discovered Harnesses?

智能体系统Agent HarnessAgent任务评测

摘要

代理行为取决于语言模型周围的工具,但尚不清楚语言模型是否能够可靠地改进硬件设计任务的此类工具。我们研究了围绕 12 个专有设计验证根本原因定位任务的固定主题模型的自动Harness演化。在每项任务的五次试验中,自动进化的Harness将完成的尝试次数提高了 71-76%,任意命中任务的覆盖率提高了 80-100%,而总正确尝试次数仅提高了 18-24%。最强大的成功至少可重复两次,一项任务改善了结果,后来的候选人在任务之间交换收益而不是保留它们。辅助候选者对从搜索中排除的四任务验证集进行了改进,但将其基线与包含搜索和验证任务的后续 12 任务重放联系起来,因此所选增益不会在整个池中持续存在。在测试的谱系中,有用的搜索、证据和最终确定行为出现在不同的候选者中,但并没有一致地整合到一个跨任务和指标占主导地位的单一工具中。在单独的 CVDP 交叉基准案例研究中,自动进化的定义宽度修复Harness比其 142 任务参考基线多产生了 35.6% 的功能通道;最终功能验证者对完成的输出进行了评分,但在修复过程中并未向主体代理显示。当进化产生互补的专业化而没有一致的整合时,这些结果支持存档感知的选择。