论文
以比较证据强化学习社会智能
Reinforcement Learning with Comparative Evidence for Social Intelligence
摘要
开发社交智能人工智能仍然严重依赖人类注释数据,限制了社交理解模型可以获得的规模和广度。从未标记数据中导出训练信号的方法提供了一条超越这种依赖性的途径,但社会预测缺乏数学和编码中可用的 验证 预言。此外,情感、意图、偏好和实用意义等核心社会目标往往是模糊的。相同的行为可以支持多种看似合理的解释,因此很难验证哪种解释最受支持。为了应对这一挑战,我们引入了比较证据强化学习(RLCE),这是一种强化学习方法,可以从未标记的训练数据中学习社会理解,而无需从真实注释构建奖励。给定 执行轨迹 组中的不同答案,RLCE 构建证据测试,识别支持某个答案而不是另一个答案的可观察证据,根据输入样本验证这些测试,并汇总测试结果以确定最受支持的解释。当策略产生新答案时,测试会重新生成,从而使它们能够与策略一起发展。在涵盖情感、语用学、交流意图和偏好的四个基准中,RLCE 在不使用真实训练标签进行奖励的七种方法中获得了最强的性能,包括共识、策略、LLM 判断 验证、多模态协同进化和基于标题的奖励。相对于最强基线的收益高达 +18.93 点。分析进一步表明,与比较的 rubric 方法相比,RLCE 在正确和错误预测之间表现出更大的奖励变化份额,可以推翻错误的策略派生偏好,并受益于成对测试构建、组合测试聚合和 on-策略测试演化。
