论文

再探大语言模型的旅行规划能力

Revisiting the Travel Planning Capabilities of Large Language Models

模型评测上下文与知识上下文工程模型能力评测

摘要

旅行规划是长程推理的关键任务,暴露出LLM的显著缺陷。但现有基准与评估主要以端到端方式评估最终规划,缺乏可解释性,难以分析失败根因。为弥合差距,我们把旅行规划分解为五个原子子能力:约束抽取、工具使用、规划生成、错误识别与错误纠正。我们实现解耦评估协议,利用oracle中间上下文严格隔离这些组件,从而在无级联错误噪声下测量原子性能边界。结果呈现鲜明对比:LLM擅长抽取显式约束,却难以推断隐式的开放世界需求;规划生成存在结构性偏置;自我纠正低效——表现为过度敏感与错误固执。这些发现为改进LLM推理与规划能力提供了精确方向。

再探大语言模型的旅行规划能力:论文配图
图 1:我们的解耦评估协议概述。我们使用预言机中间上下文独立评估每个原子子功能,以防止错误传播。