论文
正确填写参数:LLM工具调用的分级难度基准与探针引导训练
Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls
摘要
大语言模型代理依赖于工具使用来获取其能力。现有的研究主要集中在选择合适的工具和协调调用顺序上,但正确填写工具调用参数同样关键,但在执行过程中却很少受到关注。例如,在云网络领域,即使是前沿模型也仅能正确完成不到一半的工具调用。受最近关于大语言模型隐藏状态编码模型预测丰富信息的研究启发,我们发现尽管模型生成一个参数值,其隐藏状态包含一个强有力的正确性信号:简单的线性探针可以准确预测该值是否正确。基于这一观察,我们提出了一种统一的探针引导框架,结合两种互补的方法:探针过滤式自监督训练(PBT),使用探针筛选可靠的自动生成调用以进行微调;探针引导式推理(PGR),在推理过程中使用探针选择更好的候选者。为了支持系统性评估,我们发布了ParamBench基准,从真实云网络API构建,根据参数嵌套深度、跨参数依赖性和从先前调用中推导值所需的推理要求将每个实例分类到五个难度级别。我们在ParamBench上对5个开放模型和6个外部基准进行广泛的实验,结果表明我们的方法显著提高了参数生成,平均精确匹配率从19.7%提高到59.6%。
