论文
RubricRefine:通过 无需训练 预执行细化提高工具使用代理的可靠性
RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement
摘要
迭代自我细化是一种流行的推理时间可靠性技术,但其在代码模式工具使用中的有效性在很大程度上取决于反馈信号的结构:非结构化批评在模型之间的帮助不一致,甚至用实际执行反馈进行的修订也只能适度改善。主要的失败是工具间契约违规(错误的输出形状、不正确的工具路由、损坏的参数来源),这些错误运行完成后不会引发错误,从而导致运行时反馈不足。我们引入了 RubricRefine,这是一种用于执行前合约检查的 无需训练 方法,它生成特定于任务和注册表的规则,根据显式合约检查对候选代码进行评分,并在任何执行发生之前迭代修复故障。 RubricRefine 在 M3ToolEval 上以零执行尝试达到 0.86 美元(七个模型的平均水平),以比 rubric 引导的重新排名更低的延迟改进了之前的推理时间基线。在以单步为主的 API-Bank 上,性能保持平稳,这与该方法对工具间合约结构的依赖一致。 AppWorld 上的结果表明,我们的方法在多轮设置中保持了优势。由于该标准源自所提供的工具文档,因此该方法的优势在文档不完整的情况下仍然存在,但在文档不正确的情况下却相反。标题类别消融可识别哪些规则是承载的,即使在聚合校准较差的情况下,顶部容器校准也可以提前停止。