论文
面向主观任务的LLM推理:失败模式、缓解方法与动态推理路由
LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing
摘要
推荐系统以个性化为立身之本,其中“正确”很少是二元事实,而更多是人类主观偏好问题。当大语言模型(LLM)被部署为安全与质量规范的自主验证器时,它们面临一个独特挑战:情境感知的偏好对齐。可验证奖励强化学习(RLVR)的近期收益主要体现在客观的数学类任务上。我们在一个生产级推荐平台的四个真实验证任务上,对专有与开源模型开展大规模研究,探究显式推理能否泛化到主观的、以人为中心的行业评判标准。我们揭示了一个根本性缺陷:刚性的、以数学为中心的推理链会切实损害验证效果,而直接应用标准RLVR会触发我们称为推理坍缩(reasoning collapse)的现象——策略放弃细致推敲,转向快速的启发式猜测。我们提出一种条件长度惩罚后训练算法,将验证准确率与有界推理长度相耦合,阻止坍缩并恢复性能。最后,我们证明推理链的效果与其社会语言框架紧密耦合:在1500个合成人设上,仅推理人设的选择不同,验证准确率就会波动近0.38 macro-F1——这证明许多主观验证错误实为推理风格失配。这一观察催生了一种训练中期架构,通过情境对齐的人设来路由推理。本工作既提供了可扩展的算法补丁,也给出了让推理模型对齐现实世界主观约束的长期架构蓝图。
