论文
行为基础模型中超越最小二乘的任务推理
Task Inference Beyond Least Squares in Behavioral Foundation Models
摘要
行为基础模型 (BFM) 旨在通过从奖励函数推断任务向量来解决各种下游任务,而无需测试时策略学习。虽然高效,但检索到的策略通常不是最优的,因为该任务向量的推断方式通常是使用普通最小二乘法 (OLS)。 OLS 最大限度地减少奖励重建误差,但使奖励的排序不受约束,这可能会使检索到的零样本策略的后继测量偏离最佳策略的后继测量。在这项工作中,我们提出了 BLS,这是一种高效的测试时推理方法,可以在最小化奖励重建误差与减少后继测量失配之间取得平衡。理论上,我们提供了一个以后继测量和奖励函数残差为特征的次优差距上限。根据经验,我们在最先进的 BFM 之上跨运动、操纵和人形控制基准评估了 BLS。 BLS 的性能优于现有的任务推理基线,计算开销可以忽略不计。项目页面:https://embodiedai-ntu.github.io/BLS