论文

注意差距:以心智理论为基础的认知调整摩擦

Mind the Gap: Theory-of-Mind-Grounded Friction for Epistemic Alignment

模型训练强化学习

摘要

富有成效的对话对齐需要区分\emph{表面协调}(确认和顺利的任务进展)和\emph{认知对齐}(信念状态的收敛);标准的基于偏好的方法通常会优化响应级别的偏好,而无需对后者进行显式建模。我们通过在每个指称表达中提取由四部分组成的信念结构,将心理理论 (ToM) 推理操作为摩擦策略优化中的控制信号:说话者的预期指称、收件人的解释以及每个参与者的对方信念模型。这使得摩擦可以从认知状态比较中机械地计算出来,捕获\emph{无声分歧},其中两个参与者在立足于不同的参照物的同时自信地进行。我们在两个层面上评估信号。在表示层面,消除二阶通道将误解召回率从 $65\%$ 减少到 $26\%$。在政策层面,奖励塑造 (FAR) 和信任区域 (FTR) 变体改善了干预 F1 和 DPO 上的保证情境校准,Brier 分数独立支持校准增益。在三轮训练中,FAR 和 FTR 保持相当稳定,而 DPO 变化很大,可能会降低基本策略中已有的干预能力。因此,基于 ToM 的摩擦为参考信念分歧下的上下文敏感干预提供了可训练的信号。