Google 开放740M参数的 EmbeddingGemma 2,将文本、图像、音频映射到共同向量空间,支持端侧与可截断嵌入。
沙丘判断:统一嵌入可简化多模态检索,端侧采用仍要分别核验向量维度、量化和模态内存成本。
按技术方向追踪论文、模型、开源项目、产品服务与工程实践
Google 开放740M参数的 EmbeddingGemma 2,将文本、图像、音频映射到共同向量空间,支持端侧与可截断嵌入。
沙丘判断:统一嵌入可简化多模态检索,端侧采用仍要分别核验向量维度、量化和模态内存成本。
Cascadia将975B MoE驻留11台共享CPU-GPU内存AI PC,定制OpenVINO专家执行及流式并发管线,并拆分吞吐与延迟。
沙丘判断:共享内存集群提供新的大模型部署路径,但并发吞吐与单请求延迟须分别衡量。
CMM通用循环架构,分离矩阵短期与长期记忆,以Transformer联合读写两者,在算法、上下文学习和循环推理任务对比十类架构。
沙丘判断:短期计算与长期保留分离提供新架构实验路径;当前算法与小规模任务结果尚不足以证明大规模语言训练收益。
Transformers 新版本增加 EmbeddingGemma 2 支持,修正 MoE 专家分派、连续批处理缓存和 OWLv2 对象查询相关行为。
沙丘判断:模型接入之外,缓存布局和并行分派也要按具体运行路径验证,避免升级后结果错配。
以LTC或CfC循环单元逐词元更新状态,提供训练、生成、对话和检查点入口。
沙丘判断:适合小规模架构实验,固定循环状态不等于已验证的长上下文能力或成熟通用基础模型。
Google 发布 Nano Banana 2.1,改进视觉设计、遮罩编辑、主体一致性与自然图像生成,提供 Gemini 中的闭源图像能力。
沙丘判断:编辑能力应通过连续改图和主体保持验收,发布宣传不能代替具体工作流的质量测试。
规则语言综述比较基础模型的无状态关系调用、LLM时序规范提取与可微逻辑验证,给出场景到特征的选择矩阵。
沙丘判断:把模型当作无状态关系调用可明确逻辑边界,非确定性输出仍需在执行语义中处理。
非自回归归文本潜在画布与规范词元监督,直接研究潜在预测语言表征的信息保留与读出能力,几何规则性不等同内容可恢复性。
沙丘判断:表征秩和各向同性不能替代内容恢复测试;实验中提供正确目标长度的条件须与实际预测长度表现分开。
QEMFN冻结CLIP特征以受预算控制量子纠缠融合,含匹配经典和去量子拓扑对照与真实硬件,不宣称计算优势。
沙丘判断:真实硬件验证与匹配经典对照都必要,存在量子模块不等于已证明计算优势。
LLM骨干联合传感器编码及动作语言监督,对比LoRA/交叉注意力/适配器,跨79传感模态和未见动作迁移,构建统一传感语言动作基础模型。
沙丘判断:跨传感模态迁移需要统一接口,未见动作评测可检验共享语言监督是否有效。
并行预测世界模型以动作因果前缀及未来隐表征交互替代解码状态递归,减少长时域误差和规划串行路径。
沙丘判断:减少解码递归可能改善规划速度,长时误差与动作因果结构需要共同检查。
Mistral 发布原生多模态 MoE 的公开 API 预览,约1.05T总参数、52B激活参数和1M上下文,权重计划月底另行公开。
沙丘判断:可关注大规模 MoE 与长时域 RL 的工程路线;当前应评估 API 预览,公开权重与复现条件仍待后续发布。
新仓库将MTP、106K草稿词表、稠密层Q8_0重编码和Metal补丁组合,为Apple Silicon提供Qwen3.8-Flash-Next本地API。
沙丘判断:可参考按实际验证批次选择量化和草稿词表的做法;需区分96GB实机与64GB模拟,并另测2bit专家的任务质量。
本文研究语言模型存储执行与协调分离的受限原型及负结果。
沙丘判断:存储、执行与协调分离值得做受控原型,当前负结果尚未证明通用能力和整体效率。
本文研究扩散语言模型对未决token进行自适应潜在递归,联合学习预测与计算分配。
沙丘判断:评估递归深度分配与已提交token回灌,可对照同规模AR及DLM的质量和真实吞吐。
Reka披露19B参数的Rho-1,以共享注意力和持续上下文连接文本、图像、视频及机器人动作,结合自回归与流匹配生成。
沙丘判断:统一状态可减少多模型串联的语义损失;这是研究预览,长视频漂移、编辑脆弱性和开放接入仍需核验。
路由梯度选择比激活频率在25条件中的24个下更大削弱拒绝,OLMoE拒绝34→9/100。
沙丘判断:梯度选择比激活频率更准确定位安全相关MoE专家;限五架构。
llama.cpp的OpenVINO后端升级到2026.4.1,为融合门控权重模型加入MoE图融合,并优化Qwen3.5单序列执行与设备枚举。
沙丘判断:约24倍预填充提升仅限Arc B390上的gemma-4-26B-A4B且需开启q4_asym64重量化;该模型在本后端本就存在退化重复,困惑度对比方差大,不能推广为通用加速。
Kolibri-1以约78B总参数和约3.46B激活参数提供德英双语能力与百万词元上下文,权重采用Apache 2.0许可。
沙丘判断:欧洲开放权重MoE提供可部署长上下文选项;激活参数不等于整模型显存,发布时间以真实提交而非标题日期为准。
研究让Agent用两个工具处理长文:按范围读取内容,以及调用子Agent处理片段。通过合成任务微调后,模型在较小工作窗口内完成检索与汇总,并在RULER和OOLONG-synth上比较效果。
沙丘判断:长文处理可以训练信息读取与子任务分派能力,不必把全部原文同时放入模型窗口;收益需要结合检索、计数和汇总等具体任务分别判断。
研究团队提出了第三种策略,学习但通道:允许在训练期间形成后门,但将其路由到可以在部署时禁用的指定隔离组件。
沙丘判断:以辅助路由将后门学习引导至隔离LoRA专家,部署时关闭该分支抑制触发。
Transformers新增FSDP2与专家并行二维DeviceMesh,并统一流水线、张量并行网格;模型适配名单作为同版关联信息。
沙丘判断:将模型适配与分布式训练配置连接起来,适合需要统一多种并行方式的训练团队参考。
研究团队引入了概念生命周期模型(CLM),它将概念表示为持久的、基于图的、时间版本化的实体,具有明确的出处和认知状态;以及基于概念的注意力(CGA),它通过图偏向自注意力(形式A)和概念节点上的门控交叉注意力(形式B)将概念图结构注入到Transformer计算中。
沙丘判断:显式概念时间与认识状态减少旧知识和无支持断言,但关闭注意机制对照显示图注意增益主要来自容量,保留负结果。
为了结合互补的优势,研究团队提出了 \textbf{ANI(自适应数值注入)},这是一种混合框架,用于管理基于语义上下文的数值特征的选择性注入。
沙丘判断:ANI用语义门控向LLM潜空间注入FoNE数值特征,区分标识符与算术操作数;MATH提高9.5点为报告条件。
llama.cpp的Vulkan矩阵乘法按每个MoE专家的实际行数选tile,避免用总词元数选取过大的分块;同日补充Intel内核调优。
沙丘判断:MoE优化需要按专家负载决定分块;单算子测量不能外推所有硬件与端到端吞吐。
为了研究中间边界政策,研究团队引入了边界许可证,它限制了允许交叉的词汇条目并承认相同形式的证书。
沙丘判断:将词元压缩代价与预测质量分开测量,有助于检验预分词边界的真实取舍。
研究团队提出SMat-Attention,以VC维度调节结构化远程路由,在注意力访问复杂度、预填充和缓存之间建立可调权衡。
沙丘判断:以结构复杂度调节远程路由,可比较长上下文计算成本与访问表达力的取舍。
研究团队引入了双潜在世界模型(Dual-WM),它通过不同的状态表示和动态模型将本地执行和长期规划分开。
沙丘判断:双潜空间分开局部动作与长程宏动作规划,指定五个视觉控制任务验证而非通用世界模拟器。
稀疏专家混合 (MoE) 大语言模型通过将每个标记路由到一小部分专家来扩展模型容量。
沙丘判断:用令牌误差直接监督 MoE 路由,保留稀疏执行预算,在两个骨干与四个问答基准验证。
研究团队提出DIET,这是一个基于删除响应的免训练专家剪枝框架。一次使用全部专家的校准前向计算,为匹配的条件与无条件词元记录专家输出及路由状态。
沙丘判断:缓存删除响应分配 MoE 专家剪枝预算,LingBot-Video 50% 专家删除后可在 48GB 单卡部署。