论文
大型离散策略:通过随机迭代评分推进显式行为建模
Large Discrete Policy: Advancing Explicit Behavior Modeling with Stochastic Iterative Scoring
摘要
行为策略通常被制定为连续生成模型,其迭代去噪过程具有表现力,但难以解释,并且容易产生令人难以置信的行为。我们提出了大型离散策略(LDiP),这是一个完全离散的行为建模框架,它从大量物理上可行的候选者中选择动作。 LDiP 不是扰乱动作,而是通过随机迭代评分来提高表现力:它利用分数空间随机性逐步重新评分和修剪候选者,从而在合理的动作中进行细粒度的排名和探索,同时保留明确的决策过程。在端到端规划、闭环驾驶、机器人操纵和视觉语言动作设置中,LDiP 始终优于自动驾驶中强大的离散和连续基线,并超过或匹配机器人操纵中的连续生成策略。这些结果表明,离散策略在配备有效的评分机制时,可以为行为建模提供一种富有表现力、合理且可解释的替代方案。项目网站:https://zhenxinli.net/LargeDiscretePolicy/。