论文

检索指标可能误导:衡量长程工具使用Agent中的规则信息

When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents

模型评测评测方法与指标

摘要

精确匹配召回率常被用于判断检索器是否为下游决策模型提供有用规则。本文用Qwen2.5-3B和7B分类器,在τ-bench中研究行动前的规则分类。在提供标准规则的条件下,经调优的3B模型使用紧凑结构化状态,其宏F1比使用原始轨迹高0.20;7B模型在相同超参数下呈现相同排序。随后,研究以决策时上下文中检索排名最高的基准断言替代指定规则。尽管航空任务状态中只有7%在首位命中确切规则,3B分类器使用检索断言时的宏F1为0.58,使用标准规则时为0.60;差值为−0.02,按任务聚类的95%置信区间为[−0.23,+0.21]。随机非标准断言和无断言对照的得分分别为0.32和0.21。该配置下未检测到宏F1差异,但区间过宽,无法建立非劣效性。第二种检索器及7B模型出现类似现象,结果随微调配置变化。本文说明,在该任务中,仅看指定规则的精确匹配召回可能低估检索断言对下游分类的作用,检索效果应结合分类流程评估。