论文
衡量工具增强大语言模型中决策规模的使用:城市对比基准
Measuring Decision-Scale Use in Tool-Augmented LLMs: A Contrastive Urban Benchmark
摘要
城市决策支持通常会询问特定地点的活动是否异常高或低,而不是哪个地方的原始计数较多。在安静的街区接载 20 次可能比在机场接载 180 次更加不正常。我们引入了 URBANCONTRASTIVEQA,这是一个基准测试,询问工具增强语言模型是否可以进行这种相对于基线的比较。每个项目将来自纽约市、芝加哥和西雅图公共交通数据的两种城市情况配对,并根据当前活动与该地区历史基线的偏离程度进行标记。我们评估了五种工具输出格式下的六种指令调整模型。仅使用原始计数时,模型通常会选择较大的数字,即使该数字对于其区域而言不太异常。服务器计算的基线分数和序数标签提高了准确性,但增益因模型而异。对于异构城市源,工具界面需要公开本地基线,而不仅仅是活动量。我们发布了配对库、标签、评分脚本和数据卡。