论文

KV-PRM:经KV缓存迁移的高效过程奖励模型支撑多智能体测试时扩展

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

模型训练奖励建模与过程监督

摘要

过程奖励模型(PRM)已被证明在引导测试时扩展(TTS)方法上高度有效——显著提升基于LLM的多智能体系统能力。但既有PRM基于文本:从零重新编码整条轨迹文本。在长的多智能体rollout中,随序列长度L二次增长的打分成本构成严重计算瓶颈,限制PRM在长上下文场景的应用。为此我们提出KV-PRM,一个高效过程奖励模型:直接读取LLM生成阶段自然产生的KV缓存,消除沉重的文本重编码。通过对照既有KV缓存处理单个“验证token”,KV-PRM把打分成本从O(L²)降到O(L)。我们形式化证明KV缓存的信息容量严格大于文本,且对下游奖励建模更高效。实证上,跨MATH、GSM8K与AIME基准:KV-PRM在束搜索、MCTS与加权投票等多种TTS方法下匹敌或严格超越文本PRM——打分FLOPs最多降低5,000倍、延迟降低37倍、每序列内存占用降低34倍。