论文

EmbodiedMind:自适应数据管理和前缀树强化学习,实现高效的体现智能

EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence

模型训练强化学习

摘要

训练具体基础模型通常需要大规模数据集和大量计算资源,但通常会遇到三个关键限制:(1)由于样本信息量低,样本利用率低下; (2)异构任务之间的梯度贡献不平衡; (3)长期规划中存在严重的信用分配问题,其中轨迹级奖励不加区别地惩罚所有词元。为了解决这些问题,我们提出了一种有效的训练范式,通过战略数据选择和分层策略优化来实现最先进的平均性能。我们的方法由三个协同阶段组成。首先,基于拒绝采样的微调(RSFT)过滤掉低信息样本,以建立稳健的行为先验,同时防止分布崩溃。其次,迭代拒绝 GRPO (IR-GRPO) 采用按难度分层的特定任务队列,以在强化学习迭代中保持数据集平衡,并结合用于精确跨任务反馈的混合奖励机制。第三,为了增强长期任务规划,我们引入了 Trie-GRPO,这是一种基于动作前缀树的新型强化学习算法,可以实现步骤级优势估计。这通过将中间正确决策与下游错误隔离来解决信用分配问题,同时与传统搜索树相比,有效平衡探索效率和深度。结果,EmbodiedMind 在 18 个基准测试中实现了 70.02% 的最先进平均性能,并且在长期任务规划准确性方面显着优于其他 embodied 基础模型。我们的项目将被发布以实现可重复性。