论文
KAT-Coder-V2.5技术报告
KAT-Coder-V2.5 Technical Report
摘要
我们提出了 KAT-Coder-V2.5,这是一种以编码为中心的代理模型,经过训练可以在真实的可执行存储库中自主运行,而不是作为单轮代码生成器。其能力的瓶颈与其说是模型规模,不如说是可重复环境、可验证奖励和高价值轨迹的稀缺性,我们通过端到端代理 后训练 框架来解决这个问题。 AutoBuilder 将多语言存储库重建到沙盒环境中,并进行大规模的失败通过和通过验证,从中我们重新生成独立的任务规范,恢复未遂事件轨迹,并通过流程感知过滤提取监督,而 KwaiClawEnv 从可执行服务和真实任务种子中合成大规模工具使用轨迹。我们通过利用工具随机化、可靠性强化的沙箱、具有事后增强价值估计的非对称行动者—评价者 PPO 以及面向工具的奖励框架进一步扩展强化学习,并通过 Multi-Teacher 同策略 蒸馏 统一 SWE、Agent-Claw 和 WebCoding 专家。在六个软件工程和代理基准测试中,KAT-Coder-V2.5 在 PinchBench 上提供了最佳的代理工具使用结果,在存储库级软件工程方面仅次于前沿的 Opus 4.8。我们的服务可通过 https://streamlake.com/product/kat-coder 获取。