论文
OmniSapiens:通过异质性感知相对策略优化实现的社会行为处理基础模型
OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization
摘要
为了开发社交智能人工智能,现有方法通常对人类行为维度(例如情感、认知或社交属性)进行孤立建模。尽管有用,但特定于任务的建模通常会增加培训成本并限制跨行为设置的泛化。最近的推理强化学习方法有助于跨多个行为任务训练单个统一模型,但没有明确解决跨不同异构行为数据的学习问题。为了解决这一差距,我们引入了异构感知相对策略优化(HARPO),这是一种平衡异构任务和样本之间的学习的强化学习方法。这是通过调整优势来实现的,以确保在策略优化期间没有任何单个任务或样本会产生不成比例的影响。使用 HARPO,我们开发并发布了 Omnisapiens-7B 2.0,这是社交行为处理的基础模型。相对于现有的行为基础模型,Omnisapiens-7B 2.0 在行为任务中实现了最强的性能,在多任务和保留设置上分别获得高达 +16.85% 和 +9.37% 的增益,同时产生更明确和稳健的推理轨迹。我们还根据最新的 RL 方法验证了 HARPO,它在行为任务中实现了最一致的强劲性能。
