AI技术追踪

免费开放

按技术方向追踪论文、模型、开源项目、产品服务与工程实践

今日重点22条

AI技术动态分布

AI技术追踪库

2026.10.06 · 183 条最新发布

Dynamo 更新 worker 过载提示过期机制与多模态入口校验,明确 Qwen3-VL 视频限制、出站代理信任和已知后端问题。

推理服务
ai-dynamo

沙丘判断:网关需要同时验证路由新鲜度、外部内容入口和后端兼容,不能把安全修复当成全面可用。

TRL 修复 GRPO、RLOO 和蒸馏流程的多 EOS 停止条件、提示边界错配与 vLLM 统计问题,减少静默错误训练。

模型服务框架
huggingface

沙丘判断:训练框架的小版本也可能改变优化目标,应把生成停止与样本遮罩纳入升级回归。

llama.cpp 在 b11445—b11476 合并同日更新:优化 GLM-5 MTP,修复 Metal 残差融合,并提升特定 SYCL MLA 预填充路径。

推理服务
ggml-org

沙丘判断:按硬件与模型分别评估才有意义;已回退优化和仅算子级加速不能混入总体性能结论。

Microsoft 公开可自带模型与数据的推荐理由审计工具,用改义编辑与同义改写对照测量决策敏感性。

评测方法与指标
microsoft

沙丘判断:推荐理由是否影响决策,应通过干预和同义对照测量;理由写得合理不等于行为忠实。

首个公开版本提供Lean形式化库、固定工具链和Comparator验证入口,可检验形式化陈述与目标结论的对应关系。

基准与评测资源
OpenAI

沙丘判断:可借鉴陈述比对和固定依赖的验证入口,Lean编译成功仍不保证原自然语言问题已被完整形式化。

Google 开放740M参数的 EmbeddingGemma 2,将文本、图像、音频映射到共同向量空间,支持端侧与可截断嵌入。

混合架构
Google DeepMind

沙丘判断:统一嵌入可简化多模态检索,端侧采用仍要分别核验向量维度、量化和模态内存成本。

GitHub 为Agent规模开发拆分引用协调与对象服务,将权威对象放到Azure Blob并独立扩展读缓存,减少完整副本写放大。

AI 开发与运维平台
GitHub

沙丘判断:Agent 会放大提交和分支负载,协调状态与不可变对象分离值得借鉴,但内部测试不能当作全面上线收益。

E2B 将秘密值保留在沙箱之外,通过目的地和请求头规则注入 HTTPS 请求,支持项目级轮换而无需重启沙箱。

SandboxAgent Sandbox
E2B

沙丘判断:凭据应在可信出口注入,目的地规则和返回内容也要检查,避免把秘密重新暴露给运行环境。

OpenAI 开放 Decisions API 公测,以 gpt-6-luna 返回谓词、选项和分级评分概率;共同输入上的判断独立执行。

结构化分析、预测与决策
OpenAI

沙丘判断:概率判断可替代短答案生成,串联依赖仍应拆请求,并按真实决策质量而非速度宣传验收。

FluidPD结合短暂预填充卸载与长期在位worker角色重配,以压力指标改善固定资源下服务SLO。

推理服务
Kartik Ramesh, Kaidi Fu, Zihan Zheng, Jiahuan Yu, Fabio Oliveira, Carlos Costa, Minjia Zhang

沙丘判断:固定 GPU 预算下可调角色与短时卸载,部署前需用实际延迟压力验证触发条件。

AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。

强化学习记忆Agentic RLAgent记忆
Chinmay Savadikar, Zhaoyu Zhang, Mingyu Zhao, Shuang Xie, Han Li, Tianfu Wu, Lingyun Wang

沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。

Cascadia将975B MoE驻留11台共享CPU-GPU内存AI PC,定制OpenVINO专家执行及流式并发管线,并拆分吞吐与延迟。

MoE分布式推理
Tate Berenbaum, Matias Parij, Muthaiah Venkatachalam

沙丘判断:共享内存集群提供新的大模型部署路径,但并发吞吐与单请求延迟须分别衡量。

MemMux为并行编码Agent提供可验证内存归属、子进程回收、逃逸检测及超额准入,含真实Claude Code运行验证。

Agent任务评测模型部署长程任务评测
Sumanyu Muku

沙丘判断:并行度需要依据真实进程资源控制,子进程逃逸和回收应纳入容量管理。

CMM通用循环架构,分离矩阵短期与长期记忆,以Transformer联合读写两者,在算法、上下文学习和循环推理任务对比十类架构。

递归架构
Ciaran Regan, Kai Arulkumaran, Luke Darlow, Stefania Druga, Sebastian Risi, Llion Jones

沙丘判断:短期计算与长期保留分离提供新架构实验路径;当前算法与小规模任务结果尚不足以证明大规模语言训练收益。

SquidAgent用输出token预测并行关键路径与协调开销,继承编排者会话并预先统一约定,再确定性调度是否并行。

Agent 协作
Yexiong Lin, Shanshan Ye, Yu Yao, Zhen Fang, Bo Han, Tongliang Liu

沙丘判断:并行不总能省时,输出预测、共享上下文和约定成本应纳入调度判断。

ParanoiaEval用200仓库配对任务仅改变风险处理决定性证据,评测编码Agent过度防御及证据响应,含人工校准判断。

Agent任务评测
Hanjun Luo, Xiucheng Zhang, Zhuoning Xu, Zhimu Huang, Yingbin Jin, Xinfeng Li, Hanan Salam

沙丘判断:风险处理应响应决定性证据,最小配对任务可检验过度防御造成的浪费。

ScienceClaw跨23学科持续自演化Agent评测,技能更新须源任务重放复现且独立科学任务改善,控制保留、迁移与成本。

Agent任务评测Agent Skills智能体自我改进长程任务评测
Mingda Zhang, Wenjin Liu, Tiesunlong Shen, Zikai Xiao, Zhenghong Lin, Qing Xu, Erik Cambria, Xiaoying Tang, Haoran Luo

沙丘判断:技能更新需重放可复现并改善独立任务,持续评测应同时跟踪迁移、遗忘与成本。

BOTTLED在时间计算API统一预算下评测Agent将整批任务蒸馏成小模型或程序的能力,区分零样本能力与可摊销产物质量成本。

Agent任务评测
Ankit Sonthalia, Haritz Puerto, Alexander Rubinstein, Martin Gubri, Seong Joon Oh

沙丘判断:单次能力与可摊销产品不同,统一预算下的产物质量和推理成本更接近复用价值。

SeshBuddy 增加 OpenCode SQLite 直接读取和子任务聚合,统一文件与数据库会话定位,纳入本地全文索引及终端打开。

AI 开发与运维平台
huangy7

沙丘判断:会话管理应尊重工具的真实存储格式,统一定位与索引有助于减少跨 Harness 的历史断裂。

MLflow 支持 TypeSafe Jev 判断与模型网关追踪,并更新子资源权限及可选 SQL 日聚合;升级仍需要停写与迁移。

可观测性
mlflow

沙丘判断:新增评审能力与数据库升级须分开验收,混合版本滚动运行可能破坏追踪系统的兼容性。

SoulsBench 用统一战斗状态、16种动作和200ms决策预算比较决策模型,记录超时、执行回退、成本与逐回合结果。

判别式推理与决策Agent任务评测Jev
AWoLnik

沙丘判断:实时决策评测需要同时记录延迟、回退和环境随机性;同一 adapter seed 并不能固定游戏运行。