论文
从提示词到行为对齐:用于推荐评估的个性化LLM裁判
From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation
摘要
传统的离线推荐评估严重依赖复杂且需人工维护的特征管线,难以规模化。虽然大语言模型(LLM)提供了直接从原始文本日志预测用户参与的有前景替代方案,但本研究的实证分析识别出一个关键失效模式,称为双向合理化。在零样本设定下,LLM能够在完全相同的项目和相同证据上,令人信服地为正面和负面两种用户参与结果同时辩护,凸显现成LLM在预测用户参与上的不可靠性。为解决这一问题,我们开发并应用了一个顺序行为对齐框架,将微调与基于成对正确与反事实理由的偏好优化相结合。在真实主页交互日志上评估,该对齐推理方法相比零样本基线在Macro-F1上提升32.19%,并与生产环境的特征工程基线持平。结果表明,行为对齐在缓解双向合理化的同时,无需人工管线开销即可提供人类可解释的推理轨迹。
