论文
再探大语言模型的旅行规划能力
Revisiting the Travel Planning Capabilities of Large Language Models
摘要
旅行规划是长程推理的关键任务,暴露出LLM的显著缺陷。但现有基准与评估主要以端到端方式评估最终规划,缺乏可解释性,难以分析失败根因。为弥合差距,我们把旅行规划分解为五个原子子能力:约束抽取、工具使用、规划生成、错误识别与错误纠正。我们实现解耦评估协议,利用oracle中间上下文严格隔离这些组件,从而在无级联错误噪声下测量原子性能边界。结果呈现鲜明对比:LLM擅长抽取显式约束,却难以推断隐式的开放世界需求;规划生成存在结构性偏置;自我纠正低效——表现为过度敏感与错误固执。这些发现为改进LLM推理与规划能力提供了精确方向。
