论文
CP-Agent:用于反馈驱动的竞争性编程的经过校准的风险控制代理
CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming
摘要
大语言模型 仍在与竞赛级编程作斗争,而许多代理补救措施依赖于大规模推理时间采样或昂贵的多阶段 后训练。我们研究执行反馈何时可靠地帮助 LLM CP 求解器以及哪些机制控制增益。我们将反馈驱动的解决方案建模为校准的停止过程,并确定三个量:错误准入风险、针对不良程序的程序级证据以及活动状态成功风险。在保留的跟踪校准和从预先声明的有限控制器清单中进行选择的情况下,生成的结构证书在错误接纳之前降低了干净成功概率的下限。我们将针对这些数量的机制实例化为双粒度验证、测试增强和经验驱动的自我进化,从而产生 CP-Agent。在不更新任何参数的情况下,CP-Agent 在 LiveCodeBench Pro 上将 Pass@1 从 25.8% 提高到 48.5%,在 ICPC-Eval 上将 Refine@5 提高了 11.0%。在三个 LLM 主干网中,CP-Agent 位于成本-准确性效率前沿,并且消融表明每个组件主要影响其相应的证书数量。