论文

React-ing to Grace Hopper 200:五种开放权重编码模型、一款 React Native 应用程序、一款 GH200、一个周末

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

模型评测模型能力评测

摘要

我们在 NVIDIA GH200 576 GB 硬件上的单个多文件 React Native 应用程序生成任务上评估了五种最先进的开放权重编码语言模型 - Kimi-K2.5(在 Q3 和 Q4 量化)、GLM-5.1、Qwen3-Coder-480B 和 DeepSeek-V3.2。该任务指定身份验证、每用户每日计数和 Web 兼容性,并根据生成的项目是否开箱即用以及功能级别的正确性进行评估。我们发现 SWE-Bench 排名不能预测任务性能:Kimi-K2.5 在激进的 3 位量化(UD-Q3_K_XL,480 GB)下产生最完整且符合规范的输出,超过了具有更高 SWE-Bench Pro 分数的模型。我们记录了三个新颖的部署发现:(1) 编码工具中的默认温度 = 0 会导致推理模型架构中的采样挂起,(2) 推理模型思维轨迹可能会通过集成工具的文件路径解析器泄漏,(3) 本机移动 API 的 Web 平台适应是每个测试模型中普遍存在的训练数据差距。我们还绘制了 2026 年 4 月开放权重编码模型的硬件层结构,确定了两个架构学派,并表明效率学派(10-15 B 活动参数)以规模学派(32-40 B 活动参数)硬件成本的大约 1/7 提供了等效的 SWE-Bench 结果。