论文
TIAR:LLM 弃权学习的轨迹知情优势重新加权
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
摘要
本文研究了 大语言模型 (LLM) 弃权学习,特别是使用三元奖励来激励 大语言模型 中的诚实。本文通过从三元奖励转向轨迹通知优势重新加权来扩展该想法,在组相对策略优化(GRPO)训练期间动态地重新加权弃权奖励。这项工作的目标侧重于弃权学习,而不是提高真实性,作为减少幻觉的探索。本文的新颖之处在于方法论创新、优势重新加权和基准选择。该方法利用 GRPO 的多重轨迹作为自然弃权信号,使用奖励信号来探索知识边界并鼓励一致性。通过证明轨迹可以用作相对于查询的策略的置信度指标,然后将它们用于动态计算弃权优势。 AbstentionBench 被用作评估基准,因为这项工作旨在为弃权学习领域做出贡献。基准上的所有数据集都根据该方法和各种基线进行了测试。实证结果表明,TIAR 在 6 个评估类别中的 5 个中实现了最先进的弃权 F1 分数,在 31 个基准数据集中的 17 个上优于静态三元基线,同时完全保持了基线准确性。