Dynamo 更新 worker 过载提示过期机制与多模态入口校验,明确 Qwen3-VL 视频限制、出站代理信任和已知后端问题。
沙丘判断:网关需要同时验证路由新鲜度、外部内容入口和后端兼容,不能把安全修复当成全面可用。
按技术方向追踪论文、模型、开源项目、产品服务与工程实践
Dynamo 更新 worker 过载提示过期机制与多模态入口校验,明确 Qwen3-VL 视频限制、出站代理信任和已知后端问题。
沙丘判断:网关需要同时验证路由新鲜度、外部内容入口和后端兼容,不能把安全修复当成全面可用。
TRL 修复 GRPO、RLOO 和蒸馏流程的多 EOS 停止条件、提示边界错配与 vLLM 统计问题,减少静默错误训练。
沙丘判断:训练框架的小版本也可能改变优化目标,应把生成停止与样本遮罩纳入升级回归。
llama.cpp 在 b11445—b11476 合并同日更新:优化 GLM-5 MTP,修复 Metal 残差融合,并提升特定 SYCL MLA 预填充路径。
沙丘判断:按硬件与模型分别评估才有意义;已回退优化和仅算子级加速不能混入总体性能结论。
DatologyAI 公开 Zephon,将数据混合与转换流水线分离,以固定 canonical lanes 保持 GPU 数变化后的全局 batch 数据一致。
沙丘判断:数据加载恢复应保持样本与打包顺序,确定性数据不等于跨硬件完全相同的模型权重。
Microsoft 公开可自带模型与数据的推荐理由审计工具,用改义编辑与同义改写对照测量决策敏感性。
沙丘判断:推荐理由是否影响决策,应通过干预和同义对照测量;理由写得合理不等于行为忠实。
连接原生请求转发、账户亲和性、整数预留结算、持久化管理与独立协议一致性测试。
沙丘判断:协议测试、模拟测试和真实供应商验收分开,适合模型服务的接入与结算验收。
编码Agent生成核函数组件,经可信构造器验证、任务评价和多样性归档,再测试冻结候选的迁移。
沙丘判断:把可执行、经验检查和契约认证分开,适合科学Agent的产物验收与复用。
AWS 发布 Strands Box 开发者预览,以操作系统限制和外部 Dogwood 引擎统一执行代码、MCP、网络及时间条件策略。
沙丘判断:语义策略可约束跨工具动作历史,但直接文件授权与解释器路径不同,部署时必须核对边界。
首个公开版本提供Lean形式化库、固定工具链和Comparator验证入口,可检验形式化陈述与目标结论的对应关系。
沙丘判断:可借鉴陈述比对和固定依赖的验证入口,Lean编译成功仍不保证原自然语言问题已被完整形式化。
Google 开放740M参数的 EmbeddingGemma 2,将文本、图像、音频映射到共同向量空间,支持端侧与可截断嵌入。
沙丘判断:统一嵌入可简化多模态检索,端侧采用仍要分别核验向量维度、量化和模态内存成本。
GitHub 为Agent规模开发拆分引用协调与对象服务,将权威对象放到Azure Blob并独立扩展读缓存,减少完整副本写放大。
沙丘判断:Agent 会放大提交和分支负载,协调状态与不可变对象分离值得借鉴,但内部测试不能当作全面上线收益。
E2B 将秘密值保留在沙箱之外,通过目的地和请求头规则注入 HTTPS 请求,支持项目级轮换而无需重启沙箱。
沙丘判断:凭据应在可信出口注入,目的地规则和返回内容也要检查,避免把秘密重新暴露给运行环境。
OpenAI 开放 Decisions API 公测,以 gpt-6-luna 返回谓词、选项和分级评分概率;共同输入上的判断独立执行。
沙丘判断:概率判断可替代短答案生成,串联依赖仍应拆请求,并按真实决策质量而非速度宣传验收。
FluidPD结合短暂预填充卸载与长期在位worker角色重配,以压力指标改善固定资源下服务SLO。
沙丘判断:固定 GPU 预算下可调角色与短时卸载,部署前需用实际延迟压力验证触发条件。
AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。
沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。
Cascadia将975B MoE驻留11台共享CPU-GPU内存AI PC,定制OpenVINO专家执行及流式并发管线,并拆分吞吐与延迟。
沙丘判断:共享内存集群提供新的大模型部署路径,但并发吞吐与单请求延迟须分别衡量。
MemMux为并行编码Agent提供可验证内存归属、子进程回收、逃逸检测及超额准入,含真实Claude Code运行验证。
沙丘判断:并行度需要依据真实进程资源控制,子进程逃逸和回收应纳入容量管理。
CMM通用循环架构,分离矩阵短期与长期记忆,以Transformer联合读写两者,在算法、上下文学习和循环推理任务对比十类架构。
沙丘判断:短期计算与长期保留分离提供新架构实验路径;当前算法与小规模任务结果尚不足以证明大规模语言训练收益。
SquidAgent用输出token预测并行关键路径与协调开销,继承编排者会话并预先统一约定,再确定性调度是否并行。
沙丘判断:并行不总能省时,输出预测、共享上下文和约定成本应纳入调度判断。
ParanoiaEval用200仓库配对任务仅改变风险处理决定性证据,评测编码Agent过度防御及证据响应,含人工校准判断。
沙丘判断:风险处理应响应决定性证据,最小配对任务可检验过度防御造成的浪费。
ScienceClaw跨23学科持续自演化Agent评测,技能更新须源任务重放复现且独立科学任务改善,控制保留、迁移与成本。
沙丘判断:技能更新需重放可复现并改善独立任务,持续评测应同时跟踪迁移、遗忘与成本。
BOTTLED在时间计算API统一预算下评测Agent将整批任务蒸馏成小模型或程序的能力,区分零样本能力与可摊销产物质量成本。
沙丘判断:单次能力与可摊销产品不同,统一预算下的产物质量和推理成本更接近复用价值。
Transformers 新版本增加 EmbeddingGemma 2 支持,修正 MoE 专家分派、连续批处理缓存和 OWLv2 对象查询相关行为。
沙丘判断:模型接入之外,缓存布局和并行分派也要按具体运行路径验证,避免升级后结果错配。
SeshBuddy 增加 OpenCode SQLite 直接读取和子任务聚合,统一文件与数据库会话定位,纳入本地全文索引及终端打开。
沙丘判断:会话管理应尊重工具的真实存储格式,统一定位与索引有助于减少跨 Harness 的历史断裂。
MLflow 支持 TypeSafe Jev 判断与模型网关追踪,并更新子资源权限及可选 SQL 日聚合;升级仍需要停写与迁移。
沙丘判断:新增评审能力与数据库升级须分开验收,混合版本滚动运行可能破坏追踪系统的兼容性。
Langfuse 新版完善 trace 主题归组、外部媒体信息与会话转写,帮助检查多模态和长会话 Agent 的执行记录。
沙丘判断:长会话监控需要把媒体与文本轨迹串起来,才便于定位模型调用之外的流程问题。
iphone-use 将真实 iPhone 操作迁到自建 XCTest 运行器,加入 USB 管理、任务指标、失败反馈与免费开发证书续签。
沙丘判断:真机 Agent 需要明确动作是否落地,恢复与签名管理也是长时间自动化的关键环节。
LangGraph CLI 新增 --image-uri 部署已推送镜像及 listeners list,并拒绝携带凭据的 Git 依赖,完善部署入口。
沙丘判断:部署工具应减少镜像重建与凭据暴露,采用时需核验监听器状态和依赖校验的实际行为。
Agent Control Plane 通过 MCP 与统一 Driver 调用多家编码 Harness,加入厂商异构约束、worktree隔离、预算和客观命令验收。
沙丘判断:异构评审应按实际模型厂商判断,并用可执行验收确认结果,避免只靠模型彼此宣布完成。
SoulsBench 用统一战斗状态、16种动作和200ms决策预算比较决策模型,记录超时、执行回退、成本与逐回合结果。
沙丘判断:实时决策评测需要同时记录延迟、回退和环境随机性;同一 adapter seed 并不能固定游戏运行。