模型

Doubao-Seed-2.0-lite 升级为豆包首款全模态理解模型,Agent/Coding/GUI 能力同步升级

Doubao-Seed-2.0-lite升级,支持全模态理解

应用与实践模型推理智能体系统模型优化模型评测推理加速Agent 工具调用小模型/轻量模型模型能力评测编程语音交互与综合语音服务通用理解与问答视觉感知与空间理解

概述

Doubao-Seed-2.0-lite 升级新版本,为豆包大模型家族首款全模态理解模型,支持视频、图像、音频、文本原生统一理解,Agent、Coding 与 GUI 能力同步升级。视觉侧在物理(HiPhO)、医疗(MedXpertQA)等高阶学科推理上大幅超越2月发布的 Doubao-Seed-2.0-pro,在细粒度感知(BabyVision、WorldVQA)与具身理解(ERQA)等关键领域达到 SOTA;融入语音理解后可同时理解多种输入模态并完成跨模态联合推理,在视频理解中联合分析画面与音频以判断视听一致性,可按自然语言指令定位事件发生时间点、跨多时间段追踪人物与事件并做多步逻辑推理;音频侧支持19个语种精准语音转写、中英文与其他14个语种互译,并可捕捉情绪、环境背景声与音乐细节,文中称在语音识别、翻译等多项音频理解基准上优于 Gemini-3.1-Pro(OmniVideoBench、WorldSense 结果基于 Gemini-3.1-Pro 测得)。Agent 侧提升多轮多步多约束指令遵循,增强任务反思推理与多 Agent 协同调度,深度适配 OpenClaw、Hermes Agent 等框架,强化深度搜索与 Skill 动态调用;Coding 能力覆盖前端页面、3D 场景与游戏开发;GUI 侧把界面识别(按钮、菜单、表单、弹窗及状态)与操作执行(点击、输入、右键、滚动、拖拽等 Browser Use 与 Computer Use)打通为闭环,支持跨应用、跨窗口连续执行业务流程。新版本已在火山方舟上线。 Doubao-Seed-2.0-lite 升级新版本,成为豆包大模型家族首款全模态理解模型,支持视频、图像、音频、文本原生统一理解,Agent、Coding 与 GUI 能力同步升级,正文称其为同等算力成本下企业批量部署全模态推理任务的更优性价比选择,并已在火山方舟上线(模型主页 https://seed.bytedance.com/seed2)。视觉侧在物理(HiPhO)、医疗(MedXpertQA)等高阶学科推理上大幅超越 2 月发布的 Doubao-Seed-2.0-pro,在细粒度感知(BabyVision、WorldVQA)与具身理解(ERQA)达到 SOTA。音频侧支持 19 个语种的精准语音转写、中英文与其他 14 个语种互译,可捕捉语音中的情绪变化、环境背景声与音乐细节,正文称按公开评测集在语音识别、翻译等多项音频理解基准上优于 Gemini-3.1-Pro(OmniVideoBench 与 WorldSense 结果标注为基于 Gemini-3.1-Pro 测得)。视频理解侧可联合分析画面与音频、判断视听一致性,按自然语言指令定位事件发生时间点,跨多个时间段提取关键线索并追踪人物与事件发展、基于画面做多步逻辑推理。Agent 侧提升多轮多步多约束指令遵循、增强任务反思与多 Agent 协同调度,深度适配 OpenClaw、Hermes Agent 等框架并强化深度搜索与 Skill 动态调用;Coding 侧覆盖前端页面、3D 场景与游戏开发;GUI 侧打通界面元素识别与点击、输入、右键、滚动、拖拽等 Browser Use 与 Computer Use 操作。 Doubao-Seed-2.0-mini 全新版与 lite 新版同步上线,同样支持全模态理解;对比上一版本,思考长度大幅缩短、Tokens 效率更高,面向更低延迟与更低成本的全模态推理场景。正文未给出该版本的参数规模、评测数据与定价信息。