模型
豆包大模型1.8 视觉理解升级:单次视频理解帧数640→1280帧,图片 token 降至原来的44%
豆包成为浦东美术馆“官方AI讲解员”,背后上了啥科技?
概述
豆包大模型1.8 在视频感知、视频理解与空间理解上达到 SOTA 水平,视觉侧主要升级包括:视觉编码器整体升级使图片压缩比能力提升2.25倍、同样一张图的 token 数降低到原来的44%;默认图片理解精细度提高至 high,4K 左右高清图像不被压缩;单次视频理解帧数从640帧提升至1280帧,在1 FPS 低帧率下可理解20分钟视频;视频运动理解与复杂空间理解能力同步提升。交互侧支持流式视频理解,能持续追踪观众视角变化而非一次性「看一眼」,在移动、转身、调整拍摄距离时保持识别连续性,并在问题超出知识范围时调用工具检索公域资源与专业知识库,按角色设定把专业术语转为通俗表达、支持随时打断与连续追问;语音侧豆包语音模型可根据输入内容做情感演绎,具备呼吸感、自然停顿与起伏。