论文
Recon:用于用户建模的重构引导推理综合
Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling
摘要
用户建模旨在使用语言模型 (LM) 从过去的上下文-动作对(例如对话轮流)语料库中模仿个人的行为,从而能够在行为科学、人类与人工智能协作和市场研究等环境中模拟用户。最近的方法通过综合推理痕迹来增强这些语料库,这些痕迹通常是通过对上下文和动作进行调节而生成的。然而,这种条件构成了事后合理化而不是推理:轨迹保证证明行动的合理性,但可能不会编码潜在的潜在因果决策路径。我们提出了 Recon,它使用动作重建来根据其预测能力对推理轨迹进行评分:给定上下文和候选推理,重建模型预测动作,重建保真度决定推理质量。在四个领域中,Recon 的胜率超过了向后综合(标准事后合理化基线)54.7%。此外,我们发现使用 Recon 获得的奖励来训练推理综合模型可以提高下游用户建模性能,实现比基线高出 70.0% 的胜率。我们进一步表明,Recon 综合推理可以跨模型转移,并改进重建模型之外的用户建模。我们的工作表明,事后合理化不足以进行推理综合,有用且可解释的推理应该自然地从上下文中引出行动。