论文

AIMS:指令引导LLM生成的非对称边际监督

When History Misleads: Asymmetric Margin Supervision for Instruction-Guided LLM Generative Recommendation

应用与实践结构化分析、预测与决策

摘要

指令引导的生成式推荐中,LLM推荐器需平衡两个目标:响应用户当前请求与对齐交互历史中的偏好。两者冲突时历史事件可能覆盖请求。我们证明把单个历史事件的效应转化为监督面临两个障碍:对推荐影响最大的事件未必是支持目标项的事件;删除误导性事件可能提高目标分数但把竞争项提得更高,因此目标分数更高并不保证排序更好。我们提出非对称干预引导边际监督(AIMS),把删除单个历史事件的效应转化为排序监督:对已正确排序的训练请求,冻结参照模型识别能同时改善目标分数及其在推荐截断附近对竞争者边际的请求特定删除;这些边际作为训练目标,完整历史保留为输入。训练组合交叉熵与惩罚边际缺口的非对称辅助损失,其梯度只经竞争者分数回传。推理不变,无需历史编辑或删除搜索。在工业数据集与两个公开基准的六个LLM骨干上,AIMS较强基线提升Recall与NDCG;消融支持请求特定边际与非对称监督,所选删除优先移除违反约束的历史。