小红书 dots 团队开源 dots3-note Preview:280B 总参 / 16B 激活、512K 上下文的文视听多模态长程 Agent 模型
dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步
概述
dots3-note Preview 是 dots3 系列中最轻量的型号,作为面向「服务真实生活」的多模态长程智能体的第一步开源:总参数 280B、激活参数 16B,支持 512K 上下文,具备文本、视觉与语音的多模态理解能力,并针对复杂推理与长程 Agent 任务做了优化,模型能力上自称在多项任务上比肩甚至超过参数规模数倍于自身的大尺寸模型。完整 dots3 系列规划为 note、jazz、aria 三档,以覆盖不同任务复杂度、响应速度与计算成本。开放方式上,模型按 Apache 2.0 协议发布于 Hugging Face 与 GitHub,模型结构已提交至 Transformers,模型 API 开放申请;详细的模型结构、训练与评测信息将与技术报告一起于一周内发布(发布时点尚未给出 arXiv/权重直链)。此外模型还在封闭、可验证的任务上提升了推理与问题解决能力,并通过长程任务的强化学习训练提升了从环境中学习、自主更新记忆的能力。 后续材料(2026-08-14):针对长程 Agent 场景下 value-free RL 训练效率低、稀疏奖励难以信用分配,而 PPO 的 critic 只能做固定算力前向估计、无法像 actor 一样推理反思的问题,团队提出 TEMPO:把长程任务拆成多个 macro-step,每个 macro-step 包含多轮模型与环境的交互,在该 macro-step 结束时同一个 Agent 从 actor 切换为 critic,通过 test-time scaling 的推理分析估计当前状态的预期剩余回报,从而在长程任务结束前更新策略;训练过程既训练如何行动、也训练如何自我评价,使单次运行需数十小时的任务也能做有效 RL 训练。评测显示,不同方法训练的模型在 ARC-AGI-3(ARC Prize 当年推出的、需自主进行数千轮交互、完整运行可达 40~50 小时的陌生环境学习能力测试)上差异显著:TEMPO 的平均 score 比 baseline checkpoint 提高 31.5%、比 GRPO 提高 20.6%,并在达到相同关卡时用更少通关步数取得更高分数。团队还观察到「评价比生成更简单」假设在该类任务上成立——Agent 作为 critic 时能从两条表面相似的分支中识别出真正突破环境规律的那个状态并给出差异显著的价值估计。 后续材料(2026-08-14):团队发现:即使面对自身还无法解决的问题,dots3-note Preview 作为 critic 时仍能从两条表面相似的状态中识别出真正突破环境规律的那个状态,并给出差异显著的价值估计;对实际蒙特卡洛采样结果的分析表明,允许 Agent 在测试时扩展计算时,它作为 critic 的能力非常强,即在其关注的任务上「评价比生成更简单」假设成立。把这一能力落到推理阶段,团队在上个月举办的 IMO 2026 中,基于 dots3-note Preview 的分支版本构建了一套内部 harness,让 Agent 递归生成 proof,并通过工具调用对生成的 proof 进行自我评估和增强,最终取得 IMO 官方认证的 42/42 满分金牌成绩。团队同时指出这一递归自我评价(recursive self-critiquing)能力是从可验证长程任务走向缺少可验证奖励信号的真实生活任务的关键,已列为下一步重点工作方向。