论文

迈向拟人对话:人类像聊天生成、评估与偏好对齐的闭环框架

Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment

模型训练上下文与知识强化学习记忆Agent记忆

摘要

人类化的私聊不只要求流畅的回复生成:系统必须保持人设、关系、记忆、有界知识、媒介特定的时机与连贯的多轮弧线。我们提出AnthroDial,一个把拟人对话表述为系统架构、可执行评估与诊断式对齐之联合问题的闭环框架。它组合:(1)带人设与场景卡、长期记忆、虚拟时间与单稿消息决策的角色条件定时对话运行时;(2)含L0有效性门、五个逐轮维度与五个对话级维度的可执行基准;(3)后训练管线——过滤16,436条定时决策样例做SFT,并以认知诊断、最近发展区(ZPD)感知的奖励应用GRPO:该奖励以卡尔曼滤波维持每个行为维度的能力估计、上调能力赤字更大的维度的权重,并以rollout分数作为任务级ZPD匹配,把优化聚焦到可学习的弱技能上。在一个含55个人设、50个场景、50个人设—场景绑定与每模型100个角色条件案例的基准上,我们评估16个系统——横跨前沿基线、开源模型、思考/非思考变体与SFT/RL消融。最强的未训练基线达32.00%严格ACC,Qwen3.6-27B-SFT+RL达39.00%严格ACC与98.5总分;在9B非思考设定下,SFT与RL把严格ACC从0.00%提升到13.00%与18.37%。结果表明当生成、评估与奖励塑形共享同一组行为维度时,拟人对话受益。

迈向拟人对话:人类像聊天生成、评估与偏好对齐的闭环框架:论文配图
图 1:助理式聊天与拟人化私人对话之间的激励比较。所提出的框架将时间安排、草稿修订、角色一致性、有限知识和多轮主动性转变为明确的生成和评估目标。