论文
测量服务堆栈而不是模型:本地工具使用评估中隐藏的混淆
Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation
摘要
编码代理必须发出有效的工具调用(对所提供模式中的工具进行可解析的调用),然后工具才能执行其选择的操作。我们研究本地服务堆栈如何影响此协议步骤,并表明测量结果可以取决于服务层,而不仅仅是模型行为。在 Ollama 中,默认的 tools= 请求通过静态模板标志对每个模型进行门控:一些模型被接受并以文本形式返回调用,一些模型返回本机 tool_calls,而 Phi-3 和 Gemma-3 在推理之前被拒绝。在我们的工具中,拒绝和重试耗尽不会保留为结构化故障元数据,因此下游分析可能会将它们错误分类为模型非调用并天真地报告 0% 保真度。在保留本机通道的同时添加文本工具列表可以恢复可接受模型的大部分测量保真度,而统一文本协议会降低具有本机工具调用支持的 Llama-3.2 的保真度。 Ollama、此 http URL、vLLM 和 SGLang 上的跨堆栈探测显示了对同一请求的不同处理。约束解码消除了解析失败,但可能导致非终止,并且回合池与每个实例的估计差异最多约为 55 个点。最后,我们列出了一份清单,用于将服务行为视为评估协议的一部分。