论文

信任函数:通过学习何时信任弱老师来实现近乎无损的弱到强泛化

Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher

模型训练合成数据

摘要

弱到强泛化研究当可靠标签稀缺时,如何利用较弱教师的监督来提高优秀学生的水平。我们主要将其视为数据选择问题,其中的关键挑战是确定哪些弱标签足够可靠以充当训练信号。为了解决这个问题,我们引入了信任函数,为每个弱标签分配一个标量信任分数,并使用这些分数来过滤弱监督。在包括世界知识、定量推理和策略游戏在内的多个领域,信任过滤产生的学生可以匹配甚至有时超过 真值 监督,从而实现近乎无损的弱到强泛化。此外,信任函数实现了一个从弱到强的迭代链,通过训练学生并将其重新用作下一个老师来增加收益,从而放大收益。信任功能的优势可归因于多种机制。