论文
SemVerBench:版本约束解析语义的 LLM 理解基准
SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics
摘要
大型语言模型 (LLM) 编码智能体不断地决定版本是否满足 ^1.2.3 或 >=2.0,<3 等约束,但它们对版本约束语义的掌握从未被直接测量过。我们推出了 SemVerBench,这是跨三个生态系统(npm、PEP 440、Cargo)的 LLM 版本约束解析语义的第一个基准:240 个具有独特答案的机器可检查项目,由四个平衡来源(每个生态系统的官方测试套件加上三个前沿 LLM 提议者)以作者中立的方式构建,并由非循环两实现预言机标记。评估六个前沿模型,我们发现系统性的、可预测的每个机制的盲点:部分比较器进位规则(>1.2 意味着 >=1.3.0)捕获了 Cargo 上的每个模型(接近 60%),尽管标准 PEP 440 前缀匹配是通用的,但在零填充/发布后的极端情况下,GPT-5.1 崩溃了(0/26),而 Claude 保持在 97-100%(在一个包含 67 项预言机验证的集合)。 Opus 显着优于所有其他模型,Sonnet 优于 OpenAI 模型 (McNemar)。这些失败看起来更像是激活/应用程序差距,而不是知识差距:注入规则或轻微的正确提示可以恢复大多数错误,而区间分解则不能,并且模型在相同规则的基本形式上处于上限。作者分层分析发现没有统计上显着的自我偏爱。因为任务是可验证的,并且存在免费的、100%正确的解析器,所以工具委托达到~100%:编码智能体应该将版本解析委托给解析器,而不是在头中推理版本。