论文
使用生成式 AI 多代理架构为大规模 AI 数据中心平台自动生成硬件验证测试计划
Automated Hardware Validation Test Plan Generation for Large Scale AI Datacenter Platforms Using a Generative AI Multi-Agents Architecture
摘要
大规模人工智能数据中心平台由数千个异构硬件组件组成,其验证需要全面的故障注入测试计划。如今,这些计划是手动编写的:工程师审查硬件自愈验证文档和物料清单,枚举每个现场可更换单元的故障模式,并生成单层测试用例的平面列表。这个过程是劳动密集型的,容易出错,并且依赖于机构知识;覆盖差距很晚才显现出来,源规范的可追溯性是隐含的,而且每个平台的工作大部分都是重复的。本文提出了一种生成式 AI 多代理架构,可根据两个规范输入自动生成结构化硬件验证测试计划:自我修复验证文档(枚举每个现场可更换单元的已知故障模式及其检测和修复行为)以及组件物料清单。摄取代理将异构输入标准化为规范表示;分类代理通过部件描述和子类别层次结构的上下文推理将组件映射到功能域;生成代理通过将标准化故障模式与领域分类数据相结合来合成测试用例,填补空白并生成边缘情况。输出符合标准化模式,可直接导入内部验证软件。根据手动基线在两个生产平台上进行评估,该框架实现了 74.2% 和 51.4% 的覆盖范围扩展,将创作时间从几天缩短到几小时。它生成从每个测试用例到其源规范的完全可追踪的映射,并且其多代理分解可跨平台移植。自动化和专家评估确认了 100% 的提取保真度和对新场景的高度接受,验证了该框架作为强大的人机交互力量倍增器。