论文
技能跟踪:评估启用检索功能的 LLM 客服人员的实际技能使用情况
Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents
摘要
大语言模型 (LLM) 代理越来越依赖外部技能,但标准评估模糊了检索这些技能是否真的有帮助。聚合指标通常会比较检索到的任务与未检索到的任务,从而引入严重的选择偏差,并且无法隔离技能使用的真实效果。为了衡量这种实际使用能力(我们将其形式化为技能跟踪(SF)),我们引入了检索调用的实际使用效果(RAE)。 RAE 计算匹配的启用技能和禁用技能执行之间的相同任务结果差异,仅以代理主动检索技能的任务为条件。在跨编码和数学领域评估 17 LLM 时,我们发现了一个明显的评估悖论:模型经常显示出正的聚合检索提升,但 RAE 为负。在 MBPP+ 上,多个模型看似对整个系统有利,但实际上却损害了它们在执行检索的具体任务上的性能。这些发现表明,总体平均值可能会造成工具使用熟练程度的误导性假象,而 RAE 直接衡量检索到答案管道是否真正挽救的结果多于其造成的损害。