论文

OdysSim:构建人类行为模拟的基础模型

OdysSim: Building Foundation Models for Human Behavior Simulation

模型训练预训练

摘要

大语言模型 越来越多地被部署为用于交互式评估和社交模拟的人体模拟器。然而,乐于助人的 后训练 将他们拉向同质的、过于令人愉快的助手语域,从而产生了行为 Sim2Real 差距。我们推出了 OdysSim,这是对行为基础模型(即经过训练以大规模模拟人类行为的模型)最大的开放系统研究。我们提出 SOUL,这是一种五个能力轴(CONV、SS、COG、ROLE、EVAL)的分类法,它将 62 个数据集和 23 个基准任务统一在一个框架下。具体来说,我们策划了 OdysSim 语料库(2140 万个交互、10B 个词元,用反向生成的社交上下文进行了改造),构建了 SOUL-Index 基准,并开发了一个结合中期训练、特定任务 RL 和专家 蒸馏 的端到端训练方案。由此产生的开放 8B OSim 模型在 23 项任务中的 8 项中排名第一或并列第一,在这一点上优于任何单独的前沿模型,其中在对话和社交任务上的收益最为强劲。它的输出在长度、格式和单词选择方面也更接近人类,并且它将零样本转移到$τ$-bench上的分布外用户模拟,在反应对齐方面几乎与真实用户匹配(93.2 vs. 93.5)。我们进一步表明,LLM 作为判断 RL 会诱发 奖励作弊 模式,并且我们的检测器可以在 后训练 期间减轻它们。总之,我们的研究结果表明,行为基础模型需要重新思考 LLM 训练范例。我们发布所有工件以支持未来的研究。