AI技术追踪

免费开放

按技术方向追踪论文、模型、开源项目、产品服务与工程实践

今日重点22条

AI技术动态分布

AI技术追踪库

全部历史
全部历史 · 1,171 条最新发布

Cascadia将975B MoE驻留11台共享CPU-GPU内存AI PC,定制OpenVINO专家执行及流式并发管线,并拆分吞吐与延迟。

MoE分布式推理
Tate Berenbaum, Matias Parij, Muthaiah Venkatachalam

沙丘判断:共享内存集群提供新的大模型部署路径,但并发吞吐与单请求延迟须分别衡量。

SoulsBench 用统一战斗状态、16种动作和200ms决策预算比较决策模型,记录超时、执行回退、成本与逐回合结果。

判别式推理与决策Agent任务评测Jev
AWoLnik

沙丘判断:实时决策评测需要同时记录延迟、回退和环境随机性;同一 adapter seed 并不能固定游戏运行。

Perplexity 更新基于 Qwen3.8-27B 的决策模型,提供非因果全注意与原生小型读出头,官方报告 Decision Index 改善。

解码与生成控制
Perplexity

沙丘判断:决策权重需要匹配注意力与读出方式,默认因果语言生成接口不能自动复现原生概率结果。

MOTIVE学习多视角自验证的正确性置信度,推理时据此接受或利用历史重思,减少无效轮次。

推理验证与自校正
Ziquan Zhu, Hanruo Zhu, Si-Yuan Lu, Morris Yu-Chao Huang, Yicheng Lin, Wei Han, Tianlong Chen, Mingyuan Wu, Hanchao Yu, Gaojie Jin, Lu Liu, Bo Sun, Tianjin Huang

沙丘判断:重思机制应学习何时值得调用,多做验证并不保证更准确或更便宜。

在Boltz-2和OpenFold-3去噪坐标上施加局部闭式物理投影,不改权重、无需梯度或额外网络调用。

解码与生成控制
Qurat-ul-ain, Yee Whye Teh, Charlotte M. Deane, Matteo Cagiada

沙丘判断:轻量闭式约束可补充生成模型,采用前应分别验证物理有效性与结构任务质量。

TLAR从当前推理轨迹检索近似续写,依验证反馈调整激活及候选宽度,与草稿模型共树精确验证。

投机采样
Yuyang Dai, Yushun Dong

沙丘判断:自身历史可补充草稿模型,精确验证与自适应激活是保持输出一致性的关键。

COMPASS以直接回答正确性识别可干预注意头方向,在少量头上推理时操控,测量准确率与输出长度权衡。

推理策略与问题分解
Pratyay Dutta, Kowshik Thopalli, Vivek Narayanaswamy

沙丘判断:少量注意头可能提供控制接口,但准确率收益应与输出长度和干预成本同时报告。

ProbeGuard跟踪医疗多轮共识形成与反证存活,以分层校准控制选择风险,识别一致但错误答案。

推理验证与自校正
Xiaoyang Wang, Tianrui Wang, Christopher C. Yang

沙丘判断:多个模型一致不代表独立证据,多轮反证存活和选择风险比票数更有参考价值。

VALSE用初层难度估计与逐层门控选择非连续深度,提出成本及函数空间理论;可行性仅在原型规模初测。

推理加速
Jia-Dong Zhang

沙丘判断:跳层可减少计算,但原型可行性与真实大模型部署收益应明确分开。

ThinkFuse对照段级不确定性变化与全轨迹趋势,只在不稳定段融合辅助推理路径,测触发数与词元成本。

推理搜索与路径规划
Myunghoon Kang, Jungseob Lee, Jaehyung Seo, Heuiseok Lim

沙丘判断:辅助路径宜只在不稳定片段调用,融合收益应与触发次数和词元开销共同评估。

按问题答案一致性和自奖励差异自适应选择序列概率锐化指数,免训练提高数学代码与科学推理采样。

推理策略与问题分解
Bingnan Xiao, Chenhao Yang, Bingcong Li, Wei Ni, Xin Wang

沙丘判断:按问题调整概率锐化可能改善采样,奖励差异信号仍需防止偏好自我确认。

新仓库在FlashAttention-4 CuTe DSL上实现ExpCast并优化缩放、键遍历和V布局,披露B200长视频输入约2倍算子提速。

推理加速
MachGen

沙丘判断:可参考FP8算子与流水线优化;约2倍限于所测注意力调用,敏感层Q/K量化误差很大,部署应保留该层BF16。

新仓库将MTP、106K草稿词表、稠密层Q8_0重编码和Metal补丁组合,为Apple Silicon提供Qwen3.8-Flash-Next本地API。

MoE投机采样
MeldlabsAI

沙丘判断:可参考按实际验证批次选择量化和草稿词表的做法;需区分96GB实机与64GB模拟,并另测2bit专家的任务质量。

OpenAI 员工原帖宣布 GPT-6 Astra 与 GPT-6.1 Sol 订阅入口默认约提速50%,覆盖 Sign in with ChatGPT 接入的合作产品。

推理加速
OpenAI

沙丘判断:值得跟踪的是默认延迟下降对智能体交互的影响;TPS说明是特定运行指标,不能直接换算所有任务端到端提速。

本文研究神经提议与符号执行共享有类型几何状态,嵌套控制器分配搜索计算。

推理搜索与路径规划
Ruoran Xu; Wending Gao; Haoyu Cheng; Xiaoqiang Kang; Qiufeng Wang

沙丘判断:可将定理实例和构造转成可执行动作,并用精确约束及来源记录约束搜索。

本文研究自判断相关token后抑制无证据压力并放大证据的注意力转向,同时测迎合与顽固。

解码与生成控制
Yinghao He; Mengyu Xu; Haixiang Sun; Donghan Li; Yibo Wang; Lixu Wang; Kezhen Chen; Chi Li; Chunwei Liu; Bharat Bhargava; Chongyang Gao

沙丘判断:抗迎合不能牺牲合理更新;应加入错误压力与冲突证据联合条件评测。

本文研究LLM生成对齐参考人群因果图并按用户选择移除歧视因果路径。

解码与生成控制
Patrik Okanovic; Torsten Hoefler; Drago Plecko

沙丘判断:公平生成可明确保留与移除的因果路径;形式保证依赖人口模型和因果假设。

本文研究输入输出语义匹配定位隐藏有害意图,以拒绝方向评分决定停止生成。

解码与生成控制
Luoyu Chen; Weiqi Wang; Chenhan Zhang; Zhiyi Tian; Shui Yu

沙丘判断:生成时监控可同时用输入与已生成区域;应验证自适应攻击和过度拒绝的权衡。

本文研究将逐层KV保留与MoE专家数作为资源约束多目标黑盒搜索,代理集搜索后全数据复验。

推理加速
Qi Chen; Yingying Cheng; Zhaoyi Sun; Li Zhou; Fan Zhang; Jie Sun

沙丘判断:推理配置可保留Pareto方案;搜索预算与代理集泛化须与最终质量和延迟一起核验。

本文研究正文确认SV4D与GEN3C视频DiT及Proteina等固定检查点,按约束流形缓存块计算。

推理加速
Prashant Pandey; Devineni Sri Venkatraya Chowdary; Brejesh Lall

沙丘判断:适合对照科学生成任务的加速与几何约束保持;调度固定且光滑流形假设需单独核验。

本文研究跨层共享索引latent缓存并逐层独立选择,解码器吸收入查询直接评分。

KV Cache
Zhaohui Wang; Zhixin Pan; Fanxu Meng; Muhan Zhang

沙丘判断:稀疏注意可共享连续表征而非固定索引;需同时测索引开销、质量与逻辑缓存节省。

本文研究少样本免训练选择跳层或递归路由,与CoT互补扩展测试时适配。

测试时计算扩展
Michal Štefánik; Marek Kadlčík; Josef Kuchař; Michal Spiegel

沙丘判断:路由可作为token预算外的计算轴;失败路由可能使残差流分布偏移。

本文研究轨迹结果训练并持续更新回溯搜索价值策略。

推理搜索与路径规划
Xinyue Zeng; Shivam Shandilya; Guilherme Potje; Leonardo Nunes; Rakshanda Agarwal; Ranveer Chandra; Emre Kiciman; Dawei Zhou; Tusher Chakraborty

沙丘判断:回溯应兼顾成功收益与token成本,随新证据重新校准。

本文研究情绪请求引起过拒,SAE拒绝子空间反向干预兼顾危险拒绝。

解码与生成控制
Shuyi Miao; Yaojin Ma; Chenhang Cui; Xiaohao Liu; Dang Jisheng; Shengda Zhuo; Fei Shen; Tat-Seng Chua

沙丘判断:正常情绪表达应与有害请求配对测试;减少过拒必须同时保留危险拒答。