论文
基于大语言模型的零样本目标识别
Zero-Shot Goal Recognition with Large Language Models
摘要
大语言模型近期在知名规划领域上已接近与经典规划器持平,但这种能力依赖对世界知识的利用,而非真正的符号推理。目标识别是一项互补的溯因任务,在结构上更适合LLM的长处:它评估的是与世界知识的一致性,而非生成新颖的动作序列。本文首次将前沿LLM作为目标识别器,在关键经典PDDL基准上进行了系统的零样本评估。结果表明,LLM在目标识别上的能力并不均衡:一些模型随证据增加而提升,在完整观测下接近基于地标(landmark)方法的准确率;另一些模型则无论积累多少证据,仍锚定于世界知识先验。对模型推理轨迹的定性分析揭示,这种分化反映的是证据整合上的根本差异,而非对领域的熟悉程度。这些发现使目标识别成为衡量LLM基础规划知识的一个有原则的基准。