论文

基于MCP工具调用的硬件设计自动化AI智能体基准测试

Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling

智能体系统智能体互操作协议Agent任务评测MCP

摘要

我们探究由本地部署大语言模型驱动的AI智能体,能否在贴近产业实际的工具调用环境中可靠地自动化专家定义的硬件设计工作流。在这类环境中,工程师通过专用工具发出重复性、依赖有序的操作——例如创建组件、添加端口和连接布线。组件规范与命名规范的保密性约束通常排除了托管专有API,这促使人们使用本地部署的模型。为研究这一场景,我们构建了一个模型上下文协议(MCP)服务器,它复现了嵌入式系统开发中所用某专有硬件设计工具的状态与依赖逻辑,并构建了一个基准,覆盖单操作编辑、多步依赖链、无效请求、拼写错误的提示以及多服务器工具上下文。我们评估了七个开源模型,比较了系统提示、工具描述细节、上下文范围、单智能体与多智能体架构等流水线选择。结果显示,强模型在受测工作流上可实现接近完全的期望调用覆盖,但可靠性在很大程度上取决于任务结构和智能体配置。详尽的工具描述持续降低失败率;少样本提示会导致某些模型严重不作为;累积上下文会损害受限模型;多智能体分解能帮助较弱的执行体或长会话,但代价是额外的调用次数。这些发现为在有状态硬件设计环境中部署本地LLM智能体提供了实用指导。

基于MCP工具调用的硬件设计自动化AI智能体基准测试:论文配图
图1:目标应用领域中的一个组件。子组件、端口与连接构成按依赖排序的结构:每个元素必须先被创建,才能被后续操作引用。