论文
CoVe:通过约束引导验证训练交互式工具使用智能体
CoVe: Training Interactive Tool-Use Agents via Constraint-Guided Verification
摘要
开发多轮交互式工具使用智能体颇具挑战,因为现实用户需求往往复杂模糊,而智能体必须执行确定性动作来满足它们。为弥合这一差距,我们提出 CoVe(Constraint-Verification),一个为训练交互式工具使用智能体设计的后训练数据合成框架,同时保证数据复杂性与正确性。CoVe 从定义显式任务约束开始,约束起双重作用:既引导复杂轨迹的生成,又充当评估轨迹质量的确定性验证器。这使为监督微调(SFT)构建高质量训练轨迹、为强化学习(RL)导出准确奖励信号成为可能。在具有挑战性的 τ²-bench 上的评估证明了框架的有效性。值得注意的是,我们紧凑的 CoVe-4B 模型在 Airline 与 Retail 域分别取得 43.0% 和 59.4% 的成功率;其总体表现显著优于同规模的强基线,并与最大达其 17 倍规模的模型保持竞争力。这些结果表明 CoVe 为最先进交互式工具使用智能体的训练数据合成提供了有效且高效的路径。为支持后续研究,我们开源代码、训练模型以及用于训练的全部 12K 高质量轨迹。
