论文

个体文本语料库预测用户特定知识:个体化知识模拟的基准

Individual Text Corpora Predict User-Specific Knowledge: Benchmarks of Individualized Knowledge Simulation

模型评测模型能力评测

摘要

本研究探讨搜索历史中的个体文本语料库 (IC) 是否可用于模拟个体知识。我们收集了 316 名成年人的 IC,他们回答了 36 个多项选择知识项目,并在此任务上比较了几个 大语言模型 (LLM),其中只有 Qwen3-1.7B 被证明是可行的。通过低秩适应 (LoRA) 执行特定任务 微调 后,Qwen3-1.7B 在公开项目上的表现优于参与者和具有代表性的德国规范样本。然而,在非公开问题上,LLM 的表现比我们的参与者差,这表明公开问题的训练数据可能受到污染。当将 IC 集成到检索增强生成中以预测个体响应时,LLM 参与者的匹配准确度显着超过了机会,这表明了可检测的个体知识信号。然而,分配给参与者答案的概率很低,远低于正确答案的概率,表明对个人反应模式的校准较差。知识差距预测虽然对于超过 500 万个标记的语料库有所改善,但并不是最优的。我们讨论基于熵的评估基准作为个性化知识模拟的校准指标。