论文
面向不确定LLM反馈的置信度编排自演化
Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback
摘要
自演化大语言模型(LLM)通过生成自己的训练任务与解答来学习,从而降低对人工策划监督的依赖。然而,在许多推理领域,模型还必须验证所生成的任务并对所生成的答案作出判断,才能获得训练信号。这带来了训练信号难题:错误的自我判断会变成错误的梯度更新。现有方法要么依赖外部验证器而限制了通用性,要么把带噪的自生成反馈直接当作监督。我们提出COSE(Confidence-Orchestrated Self-Evolution),利用LLM内在的置信度作为轻量级不确定性信号来调制学习。COSE引入了置信度加权的PPO更新与置信度优先的经验回放。在19个保留基准与四个Qwen/Llama骨干(0.6B-4B)上,COSE持续超越基座模型,在通用推理与数学上取得最佳平均表现,同时在代码上保持竞争力。代码与数据发布于https://anonymous.4open.science/r/COSE_-B5C2。