论文

GLM-5:面向长程Agent工程任务的大模型训练

GLM-5: from Vibe Coding to Agentic Engineering

模型训练智能体系统模型评测强化学习Agent Harness基准与评测资源Agentic RL

摘要

GLM-5以复杂系统工程和长程Agent任务为训练目标,在模型规模、稀疏注意力及后训练中共同改进。报告介绍slime异步强化学习基础设施,适应不同任务执行时长,支持更细粒度的后训练与持续迭代。 面向Agent的训练与多个实际运行框架中的评测相结合,检验模型能否在软件仓库、工具反馈及长程执行中完成任务。训练目标不只包含回答质量,也覆盖任务执行与工程交付能力。模型权重公开,并提供官方部署和调用入口。

GLM-5:面向长程Agent工程任务的大模型训练原论文图1
原论文图1:模型在所列基准中的能力比较。