论文

API基准分数无法可靠迁移到聊天产品界面

API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

模型评测鲁棒性、公平性与可信度评测

摘要

基准分数是模型发布中的核心货币:它们为购买决策提供信息,塑造公众信任并影响政策。然而,基准分数背后的一个关键假设是,通过 API 测量的模型性能忠实地反映了已部署系统的行为。我们通过审核 ChatGPT、Claude 和 Gemini 的七个系统和九个涵盖一般能力、社会偏见和阿谀奉承的基准来挑战这一假设。我们发现系统性 API——接口在准确性和一致性方面存在差异。平均而言,API 评估的准确性比相应的接口评估高 3.4 个百分点,测试-再测试一致性高 2.1 个百分点。对于 ChatGPT,API 和接口访问之间的性能差异超过了 GPT 5.3 和 GPT 5.4 之间仅 API 的差异。换句话说,切换访问表面会降低性能,就像降低整个模型生成的性能一样。我们进一步测试公开的 API 控件是否可以通过改变系统提示、采样参数和推理设置来重现界面行为。这些控制措施在某些情况下会改变行为,但不能可靠地消除差距。我们的研究结果记录了上下文有效性差距:通过 API 获得的测量结果不一定能推广到相应的已部署接口,这使得使用 API 评估作为已部署系统的代理变得复杂化。