论文
ItinBench:基于大语言模型的跨多认知维度规划基准测试
ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models
摘要
具备高级认知能力的大语言模型(LLM)正作为智能体应用于各类推理与规划任务。传统评估通常聚焦于受控环境中的特定推理或规划问题。近期研究探索了以旅行规划为媒介,将多种言语推理任务整合进真实世界情境。然而,推理任务并不限于言语推理,对LLM的全面评估需要一个纳入多个认知领域任务的测试床。为填补这一空白,我们提出ItinBench,该基准在保留传统言语推理任务的同时,将一类空间推理任务即路径优化纳入旅行行程规划。ItinBench在多样任务上同时评估多种LLM,包括Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro以及GPT系列。我们的发现表明,LLM在同时处理多个认知维度时难以保持高且一致的表现。通过纳入来自不同人类级认知领域的任务,ItinBench为构建更能反映真实世界挑战的全面推理测试床提供了新洞见。代码与数据集:https://ethanwtl.github.io/IBweb/
