论文
Solvita:通过智能体进化增强大语言模型的竞赛编程能力
Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
摘要
大语言模型(LLM)仍难以满足高难度竞赛编程的严格推理要求。尽管近期的多智能体框架试图弥合这一可靠性差距,它们在根本上仍是无状态的:依赖静态检索,并丢弃此前任务中积累的宝贵解题与调试经验。为解决这一问题,我们提出Solvita,一个无需更新底层LLM权重即可实现持续学习的智能体进化框架。Solvita将解题重组为由策略选择、程序合成、认证监督与定向攻击构成的闭环系统,由四个专门智能体执行:Planner、Solver、Oracle与Hacker。关键在于,每个智能体都配有一个可训练的图结构知识网络。系统运行时,通过/未通过判定、测试认证质量以及Hacker发现的对抗性漏洞等结果信号,被转化为对这些网络权重的强化学习更新。这使智能体能够依据过往成败动态路由未来的查询,随时间有效积累可迁移的推理经验。在CodeContests、APPS、AetherCode及实时Codeforces比赛上的评估显示,Solvita在代码生成智能体中确立了新的最先进水平,优于现有多智能体流水线,并将单次通过基线的准确率提高近一倍。
