论文

ChipMATE:通过强化学习进行多智能体训练以增强 RTL 生成

ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation

智能体系统Agent 协作

摘要

现有的基于 API 的 RTL 代码生成代理系统从根本上与工业实践不一致:它们假设在生成时有黄金测试平台可用,依赖于与芯片供应商的气隙安全要求不兼容的闭源 API,并且无法在供应商专有的 RTL 代码库上进行训练,从而导致宝贵的内部数据未被使用。最近的自训练模型解决了部署限制,但仍然是单轮生成器,忽视了验证在实际工业流程中的关键作用。为了弥补这些差距,我们推出了 ChipMATE,这是第一个用于 RTL 生成的自训练多智能体框架。受到工业实践的启发,正确性来自于独立编写的 RTL 模块和参考模型之间的交叉比较,ChipMATE 将 Verilog 代理与 Python 参考模型代理配对,无需任何黄金预言机即可相互验证彼此的输出。我们设计了一个基于回溯的推理工作流程,以防止跨回合的错误传播,以及一个两阶段的训练管道,首先单独训练每个代理以饱和其代码生成能力,然后联合训练团队以进行有效协作。为了支持训练,我们进一步构建了一个混合数据生成框架,可生成 64.4K 高质量参考 模型训练 样本。 ChipMATE 在具有 4B 和 9B 基本模型的 VerilogEval V2 上实现了 75.0\% 和 80.1\% pass@1,优于所有现有的自训练模型,甚至优于具有 1600B 参数的 DeepSeek V4。我们的代码和模型权重可在 https://github.com/zhongkaiyu/ChipMATE 中公开获取。