论文
通过语义推广分析迭代策略细化
Iterative Policy Refinement through Semantic Rollout Analysis
摘要
结构化策略通过引入特定于任务的归纳偏差来提高模仿学习的效率、鲁棒性和可解释性,但现有的结构生成方法要么依赖于广泛的人类输入,要么依赖于大语言模型中编码的静态领域知识,这可能与专家的演示不一致。我们提出了一个闭环框架,该框架使用大语言模型指导的政策rollout分析来迭代地完善结构化政策。通过将rollout记录为语义上有意义的表格数据并提示大语言模型生成诊断分析代码,我们的方法可以识别策略结构中的次优问题并迭代地纠正它们,而无需人工指导。赛车和开门任务的实验表明,与零样本 LLM 生成的结构相比,我们的方法将模仿学习性能提高了 15%,并且实现相同强化学习性能所需的计算量减少了 75%。这些结果表明,表格rollout分析提供了有效的反馈信号,使大语言模型生成的政策结构与专家演示相一致,我们可以利用它自动生成良好的政策结构。