论文

超越个人角色:使综合对话与人群层面的行为分布保持一致

Beyond Individual Personas: Aligning Synthetic Dialogue to Population-Level Behavior Distributions

模型训练合成数据

摘要

合成对话语料库越来越多地用作目标对话数据的代理,但基于角色的生成器优化个体对话而不是语料库组成,从而产生具有扭曲的人群水平行为组合的局部可信对话。我们引入了 GroupPersona,一个将合成对话语料库与参考语料库的行为分布保持一致的框架。 GroupPersona 将人口统计数据转化为生成控制:它将每个对话的核心行为特征与可预测的副作用分开,并使用生成的行为组来根据定义参考人口的交互模式来调节用户代理。我们在跨越两个对话源(助手风格和 Reddit 衍生)的四个语料库上评估 GroupPersona,并具有两种结构变体:结构保留和变化增强。相对于最强的平均基线,GroupPersona 将 12 个行为属性的合成分布和参考分布之间的 Jensen-Shannon 差异从 0.234 降低到 0.177,降低了 24.4%,并且在保持结构对齐的同时,在所有四个语料库上都是最佳或并列最佳。它还实现了与参考对话质量分数最接近的校准,将参考对话配置文件的平均绝对偏差降低到 0.63,而次佳基线的平均绝对偏差为 0.91。