论文

IQuest-Coder-V1 技术报告

IQuest-Coder-V1 Technical Report

模型训练预训练强化学习Agentic RL

摘要

本报告介绍 IQuest-Coder-V1 系列(7B/14B/40B/40B-Loop),这是一个新的代码大语言模型(LLM)家族。我们超越静态代码表示,提出 code-flow 多阶段训练范式,通过流水线的不同阶段捕捉软件逻辑的动态演化。我们的模型通过演化式流水线开发,首先是由代码事实、仓库与补全数据构成的初始预训练。随后,我们实施专门的 mid-training 阶段,在 32k 上下文中整合推理与智能体轨迹,并在 128k 上下文中整合仓库级数据,以铸就深厚的逻辑基础。模型最终通过专用编码能力的后训练完成,该后训练分为两条专门路径:thinking 路径(利用推理驱动的强化学习)与 instruct 路径(针对通用辅助进行优化)。IQuest-Coder-V1 在代码智能的关键维度上——智能体软件工程、竞赛编程与复杂工具使用——取得了同类竞争模型中最先进的性能。为应对部署约束,IQuest-Coder-V1-Loop 变体引入循环机制,旨在优化模型容量与部署占用之间的权衡,为效果-效率权衡提供一条架构增强的路径。我们相信,IQuest-Coder-V1 系列的发布——包括从预训练基座到最终 thinking 与指令模型的完整白盒检查点链条——将推动自主代码智能与真实世界智能体系统的研究。

IQuest-Coder-V1 技术报告:论文配图
图 1:IQuest-Coder-V1 在不同基准测试中的性能。 LiveCodeBench v6的得分来自IQuest-Coder-V1-40B-Loop-Thinking模型,其余均为IQuest-Coder-V1-40B-Loop-Instruct模型。橙色虚线代表所选模型的平均分数。