论文
GLM-5V-Turbo:迈向多模式代理的原生基础模型
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
摘要
我们推出了 GLM-5V-Turbo,这是迈向多模式代理原生基础模型的一步。随着基础模型越来越多地部署在现实环境中,代理能力不仅取决于语言推理,还取决于对图像、视频、网页、文档、GUI 等异构上下文进行感知、解释和操作的能力。 GLM-5V-Turbo 围绕这一目标构建:多模态感知被集成为推理、规划、工具使用和执行的核心组件,而不是作为语言模型的辅助接口。本报告总结了 GLM-5V-Turbo 在模型设计、多模式训练、强化学习、工具链扩展以及与代理框架集成方面的主要改进。这些发展带来了多模式编码、可视化工具使用和基于框架的代理任务方面的强大性能,同时保留了有竞争力的纯文本编码能力。更重要的是,我们的开发过程为构建多模式代理提供了实用的见解,强调了多模式感知、分层优化和可靠的端到端验证的核心作用。