论文

Stellar Colosseum:长周期数学与理论计算机研究的多智能体Harness

Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science

智能体系统Agent Harness

摘要

语言模型能生成可信短证明,但长周期研究依赖一系列不确定且相互关联的决策,仍可能不可靠。我们提出独立于模型的Harness Stellar Colosseum,为数学与理论计算机研究分配推理资源。它在证明构建前探索替代策略,用就绪门控判断路线是否成熟到可拆解,把证明计划表示为相互依赖的章节级子问题,并将验证器发现回传到受影响论证。各阶段并行生成候选,以定向证伪攻击,再通过重叠随机采样树聚合将候选和批评合为单一研究产物。工作流已作为Long Proof模式集成至Google Antigravity的Teamwork框架。我们通过开放研究及定理证明、竞赛编程基准展示能力。使用Gemini 3.1 Pro得到若干新结果,回应FOCS和JMLR等顶会顶刊论文中的开放问题。在取自FOCS、STOC、SODA研究级证明任务的TCS-Bench上,使用Gemini 3.1 Pro与Gemini 3.7 Flash达到71.0%准确率。独立Codeforces评估中,Gemini 3.1 Pro的带执行反馈证明导向流水线解出222题中的218题。