论文

从极少标签扩展LLM推理:带轻量验证器的半监督框架

Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier

模型训练奖励建模与过程监督

摘要

对大语言模型(LLM)开发而言——生成伪中间推理的近期方法进展显著——但它们通常依赖大量正确标注答案来评估推理质量。本文提出半监督框架——从极少监督扩展推理学习——把推理验证本身变成数据创建机制。我们仅用少量标注样本训练轻量推理正确性分类器——判断LLM生成的中间推理踪迹是否有效。此外——基于熵的置信阈值滤除不可靠样本——剩余高置信推理踪迹用于微调模型。在可验证数学题(Orca-Math子集)与图像场景图问答(GQA)+视觉编程上的实验表明——我们的方法取得与使用10-15倍更多标注数据可比的准确率。消融分析确认分类器与熵过滤对可扩展抗噪伪标注都必不可少。以轻量推理验证取代昂贵的答案级监督——我们的方法为构建大规模推理资源提供实用路径——并为未来从极少人类输入学习的自主推理系统铺路。

从极少标签扩展LLM推理:带轻量验证器的半监督框架:论文配图
(a) Orca-Math (Qwen2.5-0.5B-Instruct)(b) GQA (Llama3-8B-Instruct) 图 2:不同置信度指标下伪标记推理样本的精度。每个图都显示精度与低置信度样本排除率的关系(x 轴:从最低置信度到最高置信度移除的样本百分比,y 轴:精度)。按最终标记概率(蓝色)进行过滤不会产生任何改进或产生很小的改进,而基于熵的过滤(橙色)会在 90% 排除点附近产生精确度急剧上升,其中仅保留前 10% 的样本。