论文

A-ProS:通过多模型反馈实现可靠的自主编程

A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback

智能体系统Agent 架构与控制循环

摘要

大语言模型 (LLM) 展示了自动代码生成的强大潜力,但其使用执行反馈迭代完善解决方案的能力仍未得到充分开发。竞争性编程为这项研究提供了一个理想的测试平台,因为它需要端到端的算法推理、严格计算约束下的精确实现以及经过严格评估的完整功能正确性。在本文中,我们提出了 A-ProS,这是一种自主人工智能代理,它通过将解决方案生成与专门调试分开的混合多模型反馈框架来解决竞争性编程问题。 A-ProS 在 2 x 3 阶乘设计下将基于 ChatGPT 的生成器(GPT-4 和 GPT-5)与三个调试批评器相结合:Codestral-2508、Llama-3.3-70B 和 DeepSeek-R1。我们针对 ICPC 世界总决赛(2011-2024 年)和 Codeforces(评分 1200-1800)的 367 个问题评估了 6 个工作流程。结果显示,经过三轮细化后,GPT-5 工作流程从最初接受的 39 个解决方案改进到 85-90 个,而 GPT-4 从 15 个改进到 31-38 个。对 47 个问题的受控消融表明,有状态优化的性能比无状态方法高 8.5-10.6 个百分点,并将重复故障减少高达 3.5 倍。与基线代理循环相比,A-ProS 实现了超过 2 倍的增益,凸显了持久上下文和多模型反馈对于可靠的自主程序合成的重要性。