论文
基于理论的评估揭示了 LLM 个性化中的作者差距
Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization
摘要
风格个性化——使 LLM 以特定个人的风格写作,而不仅仅是适应任务偏好——缺乏基于作者科学的评估。我们表明,作者身份验证理论中的基础评估改变了基准可以衡量的内容。借鉴三种测量传统——LUAR(一种训练有素的作者身份验证模型)、具有解耦特征匹配的 LLM 作为法官,以及经典的功能词文体计量学——我们评估了 50 位作者和 1,000 代人的四种推理时间个性化方法。基于理论的指标 (LUAR) 提供了临时替代方案无法提供的功能:校准基线(人类上限 0.756,跨作者下限 0.626)赋予分数绝对意义。所有方法的得分均低于该下限 (0.484-0.508),暴露了未校准指标无法察觉的作者身份差距。这三个指标产生接近于零的成对相关性 (|r| < 0.07),证实在没有理论基础的情况下,指标选择决定结论 - LLM 法官宣布明显的获胜者,而 LUAR 发现没有有意义的差异。这些发现证明了理论-基准循环的实际作用:作者理论揭示了临时基准所遗漏的评估失败。