论文

PlanGPT补充研究:以定义的性能指标评估并与规划器比较

A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner

模型评测模型能力评测

摘要

自动规划是人工智能 (AI) 的一个子领域,其主要目标是生成一系列行动(称为计划),帮助我们从初始状态达到目标状态。规划问题由一组对象、初始状态和期望的目标状态定义。目标是计算一个计划,引导我们从初始状态到达目标状态。生成计划的程序称为计划程序。在本文中,我们对去年发布的最先进的大语言模型 PlanGPT 进行了补充研究。我们重新进行了一些实验来验证大语言模型的规划是否相关且值得。我们还检查了 PlanGPT 官方论文中获得的计划覆盖率结果是否正确,并且我们还对 PlanGPT 的性能进行了更全面的研究:在我们的论文中,使用两个指标来评估 PlanGPT 的性能:计划成本和计划生成时间。 planGPT 的结果与传统规划器针对相同计划和相同指标生成的结果进行了比较。我们发现 PlanGPT 并不比贪婪搜索策略更好。

PlanGPT补充研究:以定义的性能指标评估并与规划器比较:论文配图
图 1:BlocksWorld 域的所有问题的计划成本,其中 PlanGPT 为绿色,A* 为蓝色,Greedy 为橙色。