论文
从极少标签扩展LLM推理:带轻量验证器的半监督框架
Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier
摘要
对大语言模型(LLM)开发而言——生成伪中间推理的近期方法进展显著——但它们通常依赖大量正确标注答案来评估推理质量。本文提出半监督框架——从极少监督扩展推理学习——把推理验证本身变成数据创建机制。我们仅用少量标注样本训练轻量推理正确性分类器——判断LLM生成的中间推理踪迹是否有效。此外——基于熵的置信阈值滤除不可靠样本——剩余高置信推理踪迹用于微调模型。在可验证数学题(Orca-Math子集)与图像场景图问答(GQA)+视觉编程上的实验表明——我们的方法取得与使用10-15倍更多标注数据可比的准确率。消融分析确认分类器与熵过滤对可扩展抗噪伪标注都必不可少。以轻量推理验证取代昂贵的答案级监督——我们的方法为构建大规模推理资源提供实用路径——并为未来从极少人类输入学习的自主推理系统铺路。
