论文

TRIP-Bench:面向真实场景中长程交互Agent的基准

TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios

智能体系统模型训练强化学习Agent任务评测Agentic RL长程任务评测

摘要

随着基于LLM的agent被部署到日益复杂的真实环境中,现有基准对若干关键挑战的呈现不足,例如强制执行全局约束、协调多工具推理,以及在长程多轮交互中适应不断演化的用户行为。为弥合这一差距,我们提出TRIP-Bench,一个以真实旅行规划场景为基础的长程基准。TRIP-Bench利用真实世界数据,提供18个精选工具和40多项旅行需求,并支持自动化评估。它包含不同难度的划分;困难划分强调冗长而含糊的交互、风格变化、可行性变化以及迭代式的版本修订。对话最长可达15个用户轮次,可能涉及150多次工具调用,上下文可能超过200k token。实验表明,即使是先进的模型,在简单划分上的成功率也至多为50%,在困难子集上则降至10%以下。我们进一步提出GTPO,一种带有专门奖励归一化与奖励差分的在线多轮强化学习方法。将GTPO应用于Qwen2.5-32B-Instruct,可提升约束满足率与交互鲁棒性,在我们的评测中优于Gemini-3-Pro。我们期望TRIP-Bench能推动实用的长程交互agent的发展,而GTPO能为稳健的长程训练提供一个有效的在线RL配方。

TRIP-Bench:面向真实场景中长程交互Agent的基准
图1:TRIP-Bench 概览。左:通过评分标准到约束(rubric-to-constraint)生成、渐进式修改链合成以及基于复杂度的任务筛选进行数据构建。右:长程评估流程,其中旅行智能体使用统一的工具集进行迭代规划,并在多样的用户模拟器交互下,依据基于规则的指标和回合级指标进行评估。