论文

TREK:LLM 代理在复杂旅行计划中的旅行推理和评估套件

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

模型评测基准与评测资源

摘要

旅行计划对于使用工具的 LLM 代理来说是一项艰巨的压力测试:可用的行程是一个单一的工件,必须同时沿着多个轴正确 - 每个航班、酒店和景点都必须存在并且可预订,这些天必须是实际可旅行的,总的必须清除预算,并且该计划必须满足仅部分说明需求的旅行者。现有的代理基准一次对这些属性进行奖励,并使用软性或 LLM 判断的标准对最终输出进行评分,这些标准无法证明返回的计划是可执行的,并且既不可重现也不可审计。我们引入 TREK(旅行推理和评估套件),这是可行行程综合的基准:制定一个单一计划,该计划联合约束正确、无幻觉、时空可执行、预算有效,并响应旅行者未明确的角色需求。 TREK 包含 800 项多约束任务,其中 533 项可行,267 项因类型化路线/实体/预算原因证明不可行,覆盖 375 个城市和 13 个角色的 212,530 条记录的合成、内部一致的知识库,通过经过验证的 RESTful API 的生产型工具沙箱提供服务。每项任务均由完全确定性、基于规则的评估器进行评分,没有 LLM 法官,并提供经过人工验证的标准参考答案,在同一评估器下获得完美的 1.0 分,因此上限显然是可以实现的,并且每个剩余的差距都是代理的限制,而不是评分者的严格性。通过评估 9 个约束维度上的 15 个 LLM 智能体,我们发现即使是最强的(GPT-5.6)也只能对 46.2% 的可解决任务产生完全可行的计划,中位数为 6.6%,下限为 0.0%;满足旅行者未明确表达的需求已成为普遍的瓶颈,即使在边境也未得到解决。我们发布数据集、工具沙箱、确定性评估器和代理代码作为完全可重现的基准。