论文

用数值专家共识改进语言轨迹预测

Revisiting Numerical Forecasting Models for Language-Based Trajectory Prediction

模型训练强化学习

摘要

基于语言的轨迹预测器将坐标表示为离散的 token 并学习目的地和群体推理等辅助任务。这种公式使模型能够捕获行为意图和社会背景,而不仅仅是协调动态。然而,token 级目标仅为连续坐标空间动力学提供间接指导。为了解决这一限制,我们引入了 MoRE(奖励混合专家),这是一种细化框架,可通过强化学习将数值预测先验转换为基于预训练的基于语言的预测器。五个冻结的数值预测器提供了运动和交互的补充坐标级知识。他们的预测被转化为专家奖励,并通过不确定性加权共识结合起来,对分歧进行惩罚。地面实况奖励将预测锚定到目标轨迹。为了将细化重点放在困难的情况上,MoRE 使用按预测熵排名的前 1% 的训练样本来细化策略。专家预测在 PPO 训练之前计算一次并缓存,因此在策略更新或推理期间不会运行专家。通过这种方式,MoRE 将基于语言的预测器的上下文建模与数值专家的坐标级反馈结合起来。在 ETH-UCY 上,MoRE 将 ADE 从 0.22 m 降低至 0.20 m,将 FDE 从 0.32 m 降低至 0.29 m。相对于基础策略,SDD 上的 ADE 降低了 17.9%,NBA 上的 ADE 降低了 12.7%。在 ETH-UCY 上,MoRE 还可以降低碰撞率并更好地匹配地面实况行人间距,而不会增加测量推理记忆或延迟。项目页面位于 https://jungyu0413.github.io/MoRE/.

用数值专家共识改进语言轨迹预测:论文原图
图 2:更多训练管道。冻结基础策略通过预测熵对训练样本进行排序。所选子集的数值专家预测将被缓存一次。解码后的策略样本获得专家共识和 PPO 细化的真实奖励,并与监督学习交织在一起。推理时只需要精化预测策略即可。