技术实践

OpenAI以公开基准实测自研推理芯片Jalapeño的吞吐、能效与延迟

概述

OpenAI的推理业务需要在同一套系统上兼顾高吞吐与快速响应,而现有商用硬件往往在两者间取舍。发布首款自研推理芯片Jalapeño后,OpenAI对芯片与配套系统开展了测试。测试在SemiAnalysis的公开基准InferenceX上进行,该基准衡量服务一个AI请求的完整过程,对比对象为领先的商用AI系统,覆盖从高吞吐到高交互低延迟的工作区间。架构上,Jalapeño以最小化数据搬运与通信延迟为核心:包括KV cache在内的模型状态被显式放置并保持本地,系统按推理阶段组合计算、内存与网络,较大的网络域让整个负载留在单一互联系统内。测试区间内,Jalapeño峰值吞吐下每瓦完成的AI工作为对比系统的1.5至1.9倍,端到端延迟低1.7至3.6倍,高交互负载性能高2.1至4.1倍;芯片额定700瓦,实测持续功耗不超过550瓦。对GPT-OSS部分注意力与混合专家模块,AI生成的实现比人类专家实现快1.5至1.8倍;内部测试显示前沿模型上的优势进一步扩大。芯片目前仍处测试阶段,尚未生产部署,计划年底开始进入公司算力设施;数字均为厂商自报的基准结果,属首代产品实测,实际表现待部署后检验。