论文

更少的数据近似更多:在高风险领域赢得忠实的信心

Less Data Approximates More: Earning Faithful Confidence in High-Stakes Domains

模型训练强化学习

摘要

大语言模型 越来越多地部署在高风险领域,在这些领域,自信但不正确的推论可能会造成严重的现实损害,从而将长期被忽视的信心问题 忠实性 带到最前沿。一个有前途的解决方案联合优化了无监督内部反馈强化学习(RLIF)和推理跟踪引导推理 蒸馏(RD),但它面临着三个持续的挑战,即高质量训练语料库的稀缺、事实上毫无根据的过度自信以及因不加区别的融合而放大的错误更新。受人类信心如何从不确定性到确定性积累的启发,我们提出渐进推理增益(PRG)来衡量推理步骤是否逐渐增强对最终答案的信心。在 PRG 的基础上,我们引入了 HyTuning,这是一种混合 后训练 框架,它自适应地重新加权 RD 和 RLIF,使用稀缺的监督推理轨迹作为稳定的锚点,同时利用大量的未标记查询来实现可扩展性。对多个特定领域和通用基准的实验表明,HyTuning 提高了准确性,同时在有限的监督下实现了置信度 忠实性,支持实际的“更少的数据近似更多”的效果。我们的代码将在接受后发布。