论文

Cloud-ScPO:LLM 推理中半监督偏好优化的隐藏状态几何

Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

模型训练偏好优化

摘要

偏好优化改进了 大语言模型 (LLM) 中的数学推理,但可靠的选择-拒绝对通常需要经过验证的答案、人工注释或外部奖励模型。我们研究是否可以在半监督设置中从模型的内部表示几何中导出偏好监督。我们的分析表明,跨不同数学问题生成的推理轨迹形成结构化的全局点云,其中正确和错误的轨迹表现出不同的几何组织。基于这一观察,我们提出了 Cloud-ScPO,一种拓扑引导的偏好挖掘框架,它使用一个小的标记集来构建多个正确和不正确的参考云。每个轨迹由均值池隐藏状态表示,并使用跨参考库平均的组件级软 $k$ 最近邻度量对连接引起的组件进行评分。我们将这种跨问题的云信号与提示级别的自一致性相结合:自一致性决定了答案级别的偏好方向,而云评分则选择具体的轨迹并通过分数差来过滤对。在四种模型设置上对 GSM8K 和 MATH-Numeric 进行的实验表明,Cloud-ScPO 始终优于 ScPO,在 GSM8K 上的增益高达 4.49%,在 MATH-Numeric 上的增益高达 4.19%。配对级别分析进一步表明,Cloud-ScPO 保持了可比较的正确性可靠性,同时更有效地将信息丰富的选择轨迹与不完整、重复或其他低质量的拒绝响应区分开。