论文

MARS:面向竞赛编程的多专家LLM接力系统

MARS: Multi-Specialist LLM Relay System for Competitive Programming

智能体系统AI 基础设施Agent 协作SandboxAgent Sandbox

摘要

大语言模型擅长代码生成,但竞赛编程暴露出一个持久的失败模式:现有多智能体管线把工作分配给通用的规划者、编码者和调试者角色,而把算法技术的选择留给骨干模型独自承担。我们提出MARS(Multi-Agent Relay of Specialized LLMs,专用LLM多智能体接力),一个纯提示框架,其中每个智能体都是主题专家——动态规划、图论、字符串、几何等——并通过对算法理论语料库的检索增强生成来支撑。给定一个问题,检索选择一小组相关专家;一个起步者(starter)编写初始C++17解法,随后每一轮在沙盒中用公开示例运行候选解法,让当前专家保留、修复或交接草稿,并将一个结构化数据包转发给下一位专家。最后由单个基础设施修复(infrastructure-fixer)环节规范化样板代码。在CodeContests测试集上使用Gemma 4,MARS达到0.624±0.006的通过率,每任务记录的管线阶段为2.3个(比直接提示高+14.4个百分点),以3.3倍更低的墙钟成本缩小了与CodeSIM(0.731)的大部分差距,且每任务token花费的方差显著更小。源代码在GitHub上可用:https://github.com/fckand/mars。

MARS:面向竞赛编程的多专家LLM接力系统:论文配图
图1:MARS接力流程。任务从RAG加持的主题专家池中被路由到一个至多三名智能体的团队。每一轮运行代码生成、公开测试执行和自检/交接;修复代码在本地重跑后,当前代码与接力包才会移交给下一位专家或作最终提交。