论文
PRISM:通过过程奖励模型引导推理推进 Deep Think 前沿
PRISM: Pushing the Frontier of Deep Think via Process Reward Model-Guided Inference
摘要
DEEPTHINK 方法通过生成、细化和聚合候选解群体来改进推理,从而在复杂数学与科学任务上取得强劲表现。然而现有框架在推理期常缺可靠的正确性信号,形成群体增强瓶颈:更深的深思放大错误、压制正确的少数解,且追加算力收益微弱。本文给出 DEEPTHINK 系统的功能分解,并提出 PRISM,一个过程奖励模型(PRM)引导的推理算法,用步骤级验证同时引导群体细化与解答聚合。细化阶段,PRISM 把候选解视为 PRM 定义能量场中的粒子,通过分数引导重采样与随机细化重塑群体,把概率质量集中到更高质量推理上同时保持多样性。在数学与科学基准上,PRISM 与现有 DEEPTHINK 方法相当或更优:gpt-oss-20b 在 AIME25、HMMT25、GPQA Diamond 上分别达 90.0%、75.4%、71.4%,并追平或超过 gpt-oss-120b。此外,分析显示 PRISM 在细化中产生一致的净方向修正,在初始群体正确候选很少时依然可靠,且常位于计算-精度 Pareto 前沿。
