论文
用于超越域可验证性的推理时间缩放的内在选择和粒子重采样
Intrinsic Selection and Particle Resampling for Inference-Time Scaling Beyond Domain Verifiability
摘要
推理时间缩放 (ITS) 在数学和编码等可验证领域取得了巨大成功,在这些领域,廉价的验证可以实现可扩展的输出选择。然而,将 ITS 扩展到容易出现系统故障的任务(由错误的初始假设或未满足的多维约束驱动)通常依赖于昂贵的外部求解器或脆弱的基于模型的验证器。我们的主要见解是,并行样本集的内在统计数据,特别是长度调整的尾部熵,可以为解决方案质量提供强大的判别信号,而无需访问 真值。至关重要的是,这些统计数据充当自适应计算分配的难度门,跨扩展机制动态路由问题。首先,内在选择 (iS) 对候选者进行事后排名,匹配三个领域基于共识的算法,并将工程设计选择比 pass@1 基线提高 20%。其次,内在粒子过滤 (iPF) 将其推广到步进级重采样,引导生成过程走向高置信度推理轨迹,从而在困难的数学问题上将 pass@1 平均提高 6.1 分。最后,粒子 蒸馏 (dPF) 通过早期 logits 混合和 KL 引导的重采样注入特权指导,引导生成过去的系统推理错误以满足专家的标准,在复杂的临床反应中产生高达 26.5% 的增益。我们的管道无缝适用于广泛用途、专业领域和多模式架构,成功地将 ITS 扩展到开放式领域,无需训练有素的奖励模型或精确的 真值 验证。