论文

LUNAR:通用用户行为日志上的个性化LLM基准

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

现有的个性化LLM基准主要依赖于文本型人格或孤立的行为信号,提供有限的跨域行为个性化评估,其中响应必须基于异构的日间生活活动。为解决这一差距,我们引入了LUNAR,用于评估LLMs在跨通用日间生活领域(包括服饰、食物、居住和移动)的历史交互中生成的长期响应如何进行跨域行为个性化。为了支持可扩展基准建设并减轻数据稀疏性和隐私顾虑,LUNAR使用基于真实世界行为模式的多阶段粗到细合成管道。精度分析显示,LUNAR与其他合成基准相比更接近实际行为分布。对19个主流LLM的实验表明,访问行为日志是必要的但不足于实现深度个性化:除了更多的上下文和更大的模型外,更好的性能并不保证;有效的个性化取决于在不同领域中选择和整合相关的证据。细粒度行为记录的直接检索始终优于压缩记忆,而更强的个性化则可能以隐私保护为代价。这些发现指出,证据选择、跨域集成和隐私控制是个性化LLMs的关键挑战。

LUNAR:通用用户行为日志上的个性化LLM基准:论文配图
图 1:LUNAR 中的跨域个性化示例。该模型必须检索并集成来自不同领域的异构行为证据,以生成个性化响应。