论文

OmniSapiens:通过异质性感知相对策略优化实现的社会行为处理基础模型

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

模型训练强化学习

摘要

为了开发社交智能人工智能,现有方法通常对人类行为维度(例如情感、认知或社交属性)进行孤立建模。尽管有用,但特定于任务的建模通常会增加培训成本并限制跨行为设置的泛化。最近的推理强化学习方法有助于跨多个行为任务训练单个统一模型,但没有明确解决跨不同异构行为数据的学习问题。为了解决这一差距,我们引入了异构感知相对策略优化(HARPO),这是一种平衡异构任务和样本之间的学习的强化学习方法。这是通过调整优势来实现的,以确保在策略优化期间没有任何单个任务或样本会产生不成比例的影响。使用 HARPO,我们开发并发布了 Omnisapiens-7B 2.0,这是社交行为处理的基础模型。相对于现有的行为基础模型,Omnisapiens-7B 2.0 在行为任务中实现了最强的性能,在多任务和保留设置上分别获得高达 +16.85% 和 +9.37% 的增益,同时产生更明确和稳健的推理轨迹。我们还根据最新的 RL 方法验证了 HARPO,它在行为任务中实现了最一致的强劲性能。

OmniSapiens:通过异质性感知相对策略优化实现的社会行为处理基础模型
图5:上:在 ANX 任务上,HARPO 与去除样本级调制(sample-level modulation)的消融版本之间优势(advantage)分布的比较。样本级调制使优势分布收窄,从而可能为特定任务带来更好的性能(其他任务的分布见附录 E)。中与下:HARPO(中)与去除惯性控制(inertial control)(下)之间调制因子的比较。惯性控制使调制因子值的变化更加平缓。