论文
UserGPT 技术报告
UserGPT Technical Report
摘要
从大规模数字痕迹中获得个性化的用户理解仍然是一个根本性的挑战。传统的用户分析方法依赖判别模型和手动特征工程来预测离散属性,通常会产生碎片化且逻辑不一致的配置文件,这些配置文件很难推广到长尾行为。在这项工作中,我们研究了一种生成范式,其中 大语言模型 (LLM) 将漫长而嘈杂的行为历史总结为连贯的叙述,捕捉细致入微的用户进化。我们的实验表明,即使是强大的 LLM 在复杂和隐含的个性化推理中仍然受到限制。我们提出了 UserGPT,这是一个通过属性生成和摘要生成来改进基于 LLM 的角色理解的框架。为了解决现实世界行为数据的稀缺问题,我们开发了一个用户行为模拟引擎,可以生成真实且复杂的用户轨迹。我们进一步引入了以数据为中心的语义化模块,该模块将异构行为日志转换为结构化且语义一致的输入,从而减少噪声和稀疏性。在此管道之上,我们设计了一种课程驱动的 后训练 策略,该策略将多阶段监督 微调 (SFT) 与双过滤器组相对策略优化 (DF-GRPO) 相结合,以加强对长期行为历史的推理。我们还构建了 HPR-Bench,这是从模拟数据得出的整体角色推理的基准。在 HPR-Bench 上,UserGPT 在标签预测方面的 Avg@10 得分为 0.7325,在摘要生成方面的 $Acc_{Ex}$ 得分为 0.7528,同时在保留关键信息的情况下将行为记录压缩高达 97.9%。这些结果证明了 UserGPT 在整体角色推理和个性化用户代理交互方面的有效性。