论文

Socio-Foundation:通过分层能力蒸馏实现个人行为模拟

Socio-Foundation: A Model for Generalizable Individual Behavior Simulation via Hierarchical Capability Distillation

模型优化模型训练强化学习蒸馏

摘要

模拟个人行为需要大型语言模型(LLM)来保留角色特征,同时适应动态的社会环境。然而,通用的LLM通常会扁平化不同的角色,而特定于任务的调整则受到碎片化和泛化的困扰。为了克服这些挑战,我们将个体模拟组织到\textbf{FONTS分类}中,包括五个互补的能力维度:\emph{人物保真度} (\textbf{F})、\emph{结果实现} (\textbf{O})、\emph{行为自然性} (\textbf{N})、\emph{轨迹连贯性} (\textbf{T}) 和 \emph{社交Grounding} (\textbf{S})。基于这种分类法,我们策划了一个标准化训练语料库,其中包含 14 个代表性数据集的约 1000 万个实例,并提出了 \textbf{Socio-Foundation}。 Socio-Foundation 通过三阶段管道将专业化与集成解耦:通过 DAPO 学习任务专家,通过离策略蒸馏将其整合为能力专家,并通过多教师在策略蒸馏 (MOPD) 将其统一。我们还建立了 \textbf{IndiEval},整合了 FONTS 维度的 29 个指标。实验表明,Socio-Foundation 的性能比 \textit{Qwen3-8B} 基础高出 11.0 个点,并且接近 \textit{GLM-5.2} 等前沿模型,消融和分布外评估进一步证明了我们模型的有效性和泛化性。

Socio-Foundation:通过分层能力蒸馏实现个人行为模拟:论文原图
图2:Socio-Foundation的整体框架。 (a)框架概述:我们将个体仿真组织为五个能力维度(F、O、N、T、S),将任务专家整合为能力专家,并将其集成为统一的仿真器。 IndiEval 使用按相同维度分组的任务本机指标来评估结果模型。 (b) 培训细节:针对特定任务的 DAPO 培训 LoRA 任务专家;离线策略蒸馏对固定离线前缀的能力专家进行培训; MOPD 使用加权前向 KL 监督统一学生的部署。