论文

程序的像素?源代码文本和图像输入词元会计的跨提供商案例研究

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images

模型评测基准与评测资源

摘要

长源代码上下文消耗许多文本标记,激发了将代码渲染为视觉语言模型图像的提议。最近的工作询问模型在这种转换后是否仍然可以解决代码任务。我们研究一个不同的系统问题:商业 API 如何计算生成的请求。我们提出了一个可重复的测量案例研究,针对原始源文本的提供商报告的输入标记和紧凑的渲染图像表示。该基准测试对跨五种编程语言的请求、从 20 到 2,000 行的 9 个源长度以及 Anthropic、OpenAI 和 Google Vertex AI 公开的 15 个可用模型别名进行配对。这些别名折叠成大约五个不同的会计签名,并且不是独立的模型复制。在 675 个完整的文本/图像对中,聚合图像与文本比率为 0.135、0.194 和 0.242,分别对应于报告的输入标记减少 86.5%、80.6% 和 75.8%。这些总数掩盖了本质上不同的收支平衡行为:Anthropic 和 OpenAI 图像在每个测试尺寸下获得的计数较低,而 Gemini 图像在 20 行时需要 6.95 倍的标记,而在总计 200 行时才在文本下方交叉。有针对性的审计还可以跨页面边界重现非单调的 Gemini 图像统计。这项研究测量了一个紧凑渲染管道的黑盒请求。它不衡量语义保真度、任务准确性、延迟、货币成本或编码代理效率。我们发布重现和扩展研究所需的脚本、修订固定语料库规范、原始使用记录、验证器和确定性分析。