作者|沙丘社区

来源|沙丘社区(www.shaqiu.cn)

概览

  • Vidu Q3发布:全球首个16秒音视频直出模型

  • 蚂蚁灵波LingBot-VA开源,打通具身智能“预测-行动”最后一公里

  • 商汤开源SenseNova-MARS:多模态搜索推理超Gemini-3-Pro

  • 百度文心PaddleOCR-VL-1.5开源:全球首个“歪文档克星”,精度超Gemini-3-Pro

  • 宇树开源UnifoLM-VLA-0:单一策略搞定12类人形机器人操作任务


▎Vidu Q3发布:全球首个16秒音视频直出模型

1月30日,Vidu推出Q3视频大模型,以“为剧而生”为定位,成为全球首个支持16秒音视频直出的模型,标志AI视频迈入“完整叙事”时代。

其在Artificial Analysis榜单中斩获中国第一、全球第二(ELO1241),超越Runway Gen-4.5、Google Veo3.1及OpenAI Sora2。核心能力突破:16秒声画同步生成,口型、音效与剧情精准对齐,可直接作为漫剧/短剧/影视独立叙事单元;支持多镜头自动切换,依剧情张力适配运镜;兼容中、英、日多语种文字渲染,无需后期逐帧调整。

来源:https://mp.weixin.qq.com/s/ArvauFAQLdfTUbs0yxuMVw


▎蚂蚁灵波LingBot-VA开源,打通具身智能“预测-行动”最后一公里

1月30日,蚂蚁灵波“开源周”推出收官作——全球首个自回归视频-动作世界模型LingBot-VA,打通具身智能从“看懂世界”到“改变世界”的关键路径。

其核心突破是自回归视频-动作一体化建模:每一步同步生成“下一帧世界画面”与对应机器人动作序列,借MoT架构融合双模态,搭配“预测-执行-感知-修正”闭环防生成幻觉,异步推理设计解决端侧算力瓶颈。

实测中,面对制作早餐、插试管等6项高难任务,仅需30-50条真机演示即适配,成功率较Pi0.5平均提20%;仿真端刷新RoboTwin2.0(超90%)、LIBERO(98.5%)纪录。该模型承接前序LingBot-Depth/VLA/World,形成完整具身开发套件,目前模型、代码已在GitHub、Hugging Face开源。

来源:https://mp.weixin.qq.com/s/c0TSi7qPTEIZUzWyFme4oQ


▎商汤开源SenseNova-MARS:多模态搜索推理超Gemini-3-Pro

1月29日,商汤正式开源多模态自主推理模型SenseNova-MARS(8B/32B双版本),在MMSearch等6项权威基准测试中以69.74分超越Gemini-3-Pro(69.06分)、GPT-5.2(67.64分),登顶开源SOTA。

作为首个动态视觉推理+图文搜索融合的Agentic VLM,它能自主规划工具调用:精准裁剪<5%的微小细节(如赛车服Logo)、图像搜索匹配信息(如识别车手身份)、文本搜索抓关键数据(如公司成立年),可闭环完成“细节识别-检索-推理”复杂任务(如计算年份差值)。

其采用两阶段训练(自动化数据打基础+强化学习练直觉),搭配BN-GSPO算法保稳定。目前模型、代码及数据集已在GitHub、Hugging Face全开源,为开发者提供高可解释性的多模态推理基座。

来源:https://mp.weixin.qq.com/s/w4SWWs8Ib1FmfHB59zydlQ


▎百度文心PaddleOCR-VL-1.5开源:全球首个“歪文档克星”,精度超Gemini-3-Pro

1月29日,百度文心正式发布并开源文档解析模型PaddleOCR-VL-1.5(仅0.9B参数),全球首次实现“异形框定位”,精准识别倾斜、弯折、反光等不规则文档。其在OmniDocBench V1.5榜单中以94.5%综合精度登顶SOTA,超越Gemini-3-Pro、GPT-5.2等主流模型,表格理解、阅读顺序预测等核心指标领先2-5分。

模型新增印章识别、藏语/孟加拉语等多语种支持,解决跨页表格合并、长文档结构断裂问题,适配金融票据、政务流转等场景。目前模型、代码已在GitHub、HuggingFace开源,兼容昆仑芯、昇腾等多硬件平台,开发者可直接下载或通过PaddleOCR官网在线体验。

来源:https://mp.weixin.qq.com/s/6eSBEYf8MSuW71HWAFbc2w


▎宇树开源UnifoLM-VLA-0:单一策略搞定12类人形机器人操作任务

1月29日,宇树正式开源面向通用人形机器人的视觉-语言-动作(VLA)大模型UnifoLM-VLA-0。该模型基于Qwen2.5-VL-7B构建,仅用340小时真机数据训练,集成动力学约束与动作分块预测,实现视觉、语言与动作的深度融合。

核心优势显著:单一策略即可稳定完成12类复杂操作任务,外部扰动下仍保鲁棒性;LIBERO仿真基准平均得分98.7分接近最优,零样本空间推理能力比肩Gemini-Robotics-ER1.5。模型强化了2D/3D空间感知与语义对齐,支持长时序动作规划。目前项目主页、开源代码已上线GitHub,为开发者提供低成本人形机器人操作模型基座。

来源:https://mp.weixin.qq.com/s/cIZbQbO_P1sxJ_VL5_bmrw


▎相关研究
2025年金融业智能体最佳实践报告

2025年AI Agent应用最佳实践报告

2025年“大模型+安全”最佳实践报告
2025年央国企大模型应用跟踪报告

大模型应用跟踪调研(2025年12月)

...

*更多生成式AI研究可前往“沙丘智库”小程序查阅

*有任何需求可咨询客服微信:zimu738