论文

面向主观任务的LLM推理:失败模式、缓解方法与动态推理路由

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

模型训练强化学习

摘要

推荐系统以个性化为立身之本,其中“正确”很少是二元事实,而更多是人类主观偏好问题。当大语言模型(LLM)被部署为安全与质量规范的自主验证器时,它们面临一个独特挑战:情境感知的偏好对齐。可验证奖励强化学习(RLVR)的近期收益主要体现在客观的数学类任务上。我们在一个生产级推荐平台的四个真实验证任务上,对专有与开源模型开展大规模研究,探究显式推理能否泛化到主观的、以人为中心的行业评判标准。我们揭示了一个根本性缺陷:刚性的、以数学为中心的推理链会切实损害验证效果,而直接应用标准RLVR会触发我们称为推理坍缩(reasoning collapse)的现象——策略放弃细致推敲,转向快速的启发式猜测。我们提出一种条件长度惩罚后训练算法,将验证准确率与有界推理长度相耦合,阻止坍缩并恢复性能。最后,我们证明推理链的效果与其社会语言框架紧密耦合:在1500个合成人设上,仅推理人设的选择不同,验证准确率就会波动近0.38 macro-F1——这证明许多主观验证错误实为推理风格失配。这一观察催生了一种训练中期架构,通过情境对齐的人设来路由推理。本工作既提供了可扩展的算法补丁,也给出了让推理模型对齐现实世界主观约束的长期架构蓝图。

面向主观任务的LLM推理:失败模式、缓解方法与动态推理路由:论文配图
图1:(左)当预训练包含相关推理轨迹且验证器可靠时,RLVR能够增强推理。(中)RecSys面对的则是没有正确轨迹或可靠验证器的主观任务,直接套用RLVR会引发严重的推理崩溃。(右)我们提出一种长度惩罚RLVR算法来应对推理崩溃,并提出人设驱动的推理:LLM先从不同人设中学习多样的推理偏差,然后针对每个主观任务在上下文中选择合适的偏差。三联面板概览:(左)具有可靠推理轨迹与验证器的标准RLVR;(中)主观RecSys任务缺乏可靠轨迹与验证器,朴素的RLVR因此导致推理崩溃;(右)我们的长度惩罚RLVR加人设驱动推理。