论文
TRIP-Bench:面向真实场景中长程交互Agent的基准
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
摘要
随着基于LLM的agent被部署到日益复杂的真实环境中,现有基准对若干关键挑战的呈现不足,例如强制执行全局约束、协调多工具推理,以及在长程多轮交互中适应不断演化的用户行为。为弥合这一差距,我们提出TRIP-Bench,一个以真实旅行规划场景为基础的长程基准。TRIP-Bench利用真实世界数据,提供18个精选工具和40多项旅行需求,并支持自动化评估。它包含不同难度的划分;困难划分强调冗长而含糊的交互、风格变化、可行性变化以及迭代式的版本修订。对话最长可达15个用户轮次,可能涉及150多次工具调用,上下文可能超过200k token。实验表明,即使是先进的模型,在简单划分上的成功率也至多为50%,在困难子集上则降至10%以下。我们进一步提出GTPO,一种带有专门奖励归一化与奖励差分的在线多轮强化学习方法。将GTPO应用于Qwen2.5-32B-Instruct,可提升约束满足率与交互鲁棒性,在我们的评测中优于Gemini-3-Pro。我们期望TRIP-Bench能推动实用的长程交互agent的发展,而GTPO能为稳健的长程训练提供一个有效的在线RL配方。
