论文

渐进式内容细化与递减奖励联合 LinUCB

Progressive Content Refinement with Decaying Reward Joint LinUCB

模型推理推理验证与自校正

摘要

迭代细化显着增强了大语言模型(LLM)性能;然而,现有的方法,从基于反馈的 Self-Refine 到传统的老虎机方法,通常依赖于静态选项或忽视饱和效应。这种忽视会导致过度利用,持续使用相同的提示或武器会导致奖励随着时间的推移而减少。为了应对这一挑战,我们提出了一种新颖的上下文强盗算法,该算法明确地结合了奖励衰减模型。我们的方法利用期望最大化(EM)算法,同时估计特定臂参数和衰减参数。此外,通过将提示嵌入为arm,我们促进了arm值的联合学习,将我们的方法与传统的不相交线性置信上限(LinUCB)框架区分开来。情绪反转和 GSM8K 基准测试的实验结果表明,我们的方法在强基线上实现了显着的性能提升。最后,我们的消融研究证实,将奖励衰减模型整合到强盗框架内对于减轻过度开发和优化迭代细化过程至关重要。