论文
效用、成本和权限约束下的反事实工具排名
Counterfactual Tool Ranking under Utility, Cost, and Privilege Constraints
摘要
反事实工具评估必须区分权威、历史支持以及比较的实际估计结果。我们使用十一个可执行的企业启发工具、精确的倾向日志和真实的本地模型上下文协议传输来研究这些区别。保留了最初的 45 次运行综合研究,然后接受 30 次实现回报控制运行和针对 1,930 个独立发布的伯克利函数调用排行榜 (BFCL) 任务的 15 次实验的挑战。全回报直接回归逆转了线性设置中最初有利的双鲁棒 (DR) 评估结果:直接回归的平均绝对误差为 0.0139,DR 的平均绝对误差为 0.0272。在变化的环境下,DR 保持优势,误差为 0.0227 比 0.0948。在函数名组不相交的 BFCL 派生分割上,直接选择器和 DR 选择器获得了 81.85% 和 79.83% 的平衡精度。两个固定的本地 Qwen2.5 模型在相同的 200 个保留任务上进行了评估,暴露了在固定提示下弃权的强烈失败。我们进一步描述了缺少支持下的策略差异:两个策略共享的不受支持的操作被取消,当绝对值都不可识别时,允许点识别增量变化。保留分歧的回退在所有五次支持差距运行中都实现了此属性,但保守的抽样范围并不能证明部署的改进。该贡献是一种可证伪的评估方法和独立的公共证据,而不是新的 DR 估计器、官方 BFCL 排行榜分数或生产代理安全声明。