论文
三维刻画序贯决策:统一比较搜索、RL和LLM方法
A 3D Characterization Framework for Intelligent Sequential Decision Making
摘要
谜题被广泛用于评估人工智能(AI)系统进行顺序决策的推理能力,但来自不同范式的方法很少在统一条件下进行比较。为了解决这一差距,我们引入了一个三维特征框架,使人工智能方法的分析师能够通过 1) 将它们投影到马尔可夫决策过程 (MDP) 顺序决策形式,2) 通过人类事先对其设计进行排序来实现自主程度,以及 3) 技能和计算成本。使用该框架,我们分析了代表性的基于图、强化学习和基于大语言模型 (LLM) 的方法在设计选择和性能特征方面的差异,分别通过 Neurosolver、前向-后向强化学习 (FBRL) 和自动思维搜索 (AutoToS) 进行实例化,包括思维搜索的双代理扩展 (DA-ToS)。该分析依赖于河内塔谜题,该谜题提供了具有明确定义的规则和可扩展复杂性的受控基准,使得 在不断增加的问题规模上进行一致的比较。 3D 表征表明,基于 LLM 的方法由于其弱约束的动作空间设计,将复杂性从架构转移到推理时间验证,从而导致比 Neurosolver 和 FBRL 显着更高的内存和运行时成本。