论文
PersonalBench:测量 LLM 个性化中的作者差距
PersonalBench: Measuring the Authorship Gap in LLM Personalization
摘要
个性化文本生成旨在使 LLM 以特定个人的风格进行写作,但现有基准衡量的是任务准确性或偏好一致性,而不是模型的输出是否实际上类似于目标作者的写作。我们引入了 PersonalBench,这是一个通过三个独立镜头评估推理时间个性化方法的基准:LUAR(经过训练的作者身份验证模型)、LLM 作为评判者和自动文体测量学。在 50 位作者、1,000 代和两个模型家族(Qwen 3、GLM-4)中,我们发现个性化方法确实产生了作者差异化的输出(LUAR 在 AUC=0.918 处区分生成文本中的目标作者),但这种差异从未跨越人类 LLM 边界。所有方法与真实作者的 LUAR 相似度在 0.484-0.508 范围内,低于跨作者人类下限 0.626(上限 0.756)。 LLM 自己的作者身份指纹占主导地位:生成的文本与任何人类作者的距离比随机人类彼此之间的距离更远。尽管在 LLM 判断上出现差异,但在 LUAR 上,方法在统计上彼此无法区分(分布为 0.024),我们将这种差异归因于性状提取和概况提取之间的循环性。我们验证了 LUAR 能够可靠地衡量我们语料库中的作者身份(AUC=0.76 单帖子,0.96 多帖子)。我们发布 PersonalBench 作为校准测量棒:推理时个性化调整了 LLM 的风格,但并未弥合与人类作者之间的差距。