MetroLLM-Bench:评估作为公交信息亭运行时的语言模型
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
摘要
我们引入了 MetroLLM-Bench,这是一个包含 955 个案例的基准测试,用于测试作为交通信息亭策略层的语言模型。它涵盖了六个真实的地铁系统,从 37 个车站到 414 个车站,以及包括路线、票价计算、中断、可达性和对抗性输入在内的 11 个类别。在每种情况下,模型必须调用结构化工具并提交机器可渲染的终端状态,其中包含结果、每张机票的票价报价(如果适用)以及自助服务终端操作。第 1 层有 14 个确定性评分组件;第 2 层有八个语义质量组件,其中六个使用语言模型判断。我们报告第 1 级以及两个级别的综合分数。分层 75/25 分割保留 717 个案例用于训练数据生成,238 个案例用于保留评估。我们评估了来自 6 个供应商的 26 个模型,其中 23 个模型进行了排名。在保留分区上,通过参数高效 微调 (PEFT) 训练的 4B Qwen 3.5 学生在第 1 层上超过了 GPT-5.6 层(91.3 对 90.6 和 90.0),并在最大推理工作量下完全匹配 GPT-5.4 (91.4),Q4_K_M 占用空间为 2.6 GB。在此训练规模下,较大的 9B 和 27B 学生没有比 4B 学生提供进一步的第 1 级改进。在四种 Qwen 尺寸中,相对于相应基础模型的 PEFT 增益从 2B(三个训练种子)时的 +7.03 点下降到 27B 时的 -0.91;每颗种子在每种尺寸下都显示相同的方向。基于规则的确定性基线在第 1 层达到 84.6,剩余的语言模型优势集中在策略适应、复合场景、可访问性和时间推理方面。 Muse Glimmer 30B 在综合排名中领先,仅发球配置就将 Qwen 3.5 至 3.8 的比较提升了 2.7 个一级分数。基准测试、工具、复制指南和微调学生在 https://github.com/continker/metrollm-bench 上发布。