论文
ThinkBooster:用于 LLM 推理无缝测试时间扩展的统一框架
ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning
摘要
测试时计算 (TTC) 扩展已成为通过在推理过程中分配额外计算(例如通过多样本生成和基于验证者的重新排名)来改进 大语言模型 (LLM) 推理的强大范例。现有的 TTC 扩展策略和推理评分器仍然分散,在不一致的协议下进行评估,并且很少通过质量成本权衡的角度进行分析。我们推出了 ThinkBooster,这是一个用于 LLM 推理无缝测试时计算扩展的统一框架,它由 (i) 一个模块化 Python 库组成,该库实现了最先进的 TTC 扩展策略和评分器系列,(ii) 一个联合评估性能和计算效率的基准,以及 (iii) 一个可部署的 OpenAI 兼容代理服务,可以将自适应推理直接集成到实际应用程序中。我们还提供了一个演示可视化调试器,用于检查推理轨迹、中间选择决策和替代推理路径。数学和编码任务的实证结果揭示了 TTC 扩展策略和评分方法的性能计算权衡,并证明 ThinkBooster 在现实世界任务中提供了实际收益。该代码可在 MIT 许可下在线获取。