论文

当独立抽样优于代理推理时

When Independent Sampling Outperforms Agentic Reasoning

模型推理测试时计算扩展

摘要

我们研究如何在固定预算下为竞争性编程分配推理时间计算。我们评估了 1-3 部分的 216 个 Codeforces 问题,将基于代理的推理与重复独立采样 (k-shot) 作为成本和模型调用数量的函数进行比较。在不同的模型和难度级别上,k-shot 始终实现了更好的准确性-成本和准确性-查询权衡。尽管在代理框架中进行了即时缓存,但这种差距仍然存在,表明每次调用的效率较低。我们的结果表明,对于独立的算法任务,在现实资源限制下,独立探索可以胜过更深入的代理推理。当推理预算固定时,我们还提供预算分配分析,并证明成本最优求解器可以最小化每美元的原则性度量对数失败可能性。