AI技术追踪

免费开放

按技术方向追踪论文、模型、开源项目、产品服务与工程实践

今日重点22条

AI技术动态分布

AI技术追踪库

全部历史
全部历史 · 397 条最新发布

离线语音系统比较2—5B指令模型四种量化在Jetson和树莓派上的吞吐、能耗与非洲语言质量。

端侧模型
Sunday Afariogun, Odunolaoluwa Jenrola, Zeinab Nezami

沙丘判断:端侧方案需按具体设备测能耗与语言质量,不能仅凭参数量选择量化版本。

SPECTRUM在固定信息预算循环代码自蒸馏中调制KV谱,检验正确实现多样性而非仅准确率的保留。

蒸馏
Yunbo Long, WenJie Chen, Jiaquan Zhang, Guangya Hao, Zihang Zeng, Pengze Li, Xi Chen

沙丘判断:自蒸馏不能只看正确率;保持有效实现多样性有助于避免反复训练后的模式收缩。

D-OPCD将图像Agent改良提示视为特权上下文,同策略蒸馏进扩散权重,再让技能演化继续改进。

蒸馏
Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang

沙丘判断:改良提示可成为训练时的特权信息,但最终能力必须在无该提示的条件下验证。

SRD将完整交互后的知识陷阱蒸馏为交互前预见训练目标,推理无需生成,在奖励全失败组仍提供学习信号。

蒸馏
Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi, Zhuofeng Li, Siming Zhang, Jiaxin Zhang, Jixuan Chen, Fang Wu, Pan Lu, Silvio Savarese, Julian McAuley, Chien-Sheng Wu

沙丘判断:事后知识可提供全失败组的学习信号,部署收益需确认不依赖未来交互信息。

OSFP4联合优化对角平滑与块scale,纳入实际NVFP4舍入或GPTQ干扰抵消,在质量与原生prefill吞吐间比较。

量化
Neriah Ben David, Ori Meir, Or Ordentlich

沙丘判断:量化设计需要使用实际舍入规则,质量与原生预填充吞吐应按同一配置比较。

编码Agent自纠正蒸馏以执行证据方向和有效样本量分别建模,用Dirichlet后验不确定性控制学习权重。

蒸馏
Yunbo Long, Guangya Hao, Yuhan Liu, Yiting Duan, Longyan Tan, Yunchen Long, Hao Wu

沙丘判断:反馈方向与证据数量需要分别建模,不确定性权重有助于避免少量执行结果过拟合。

研究发现视频VAE量化重建得分可保持而动作成功率崩溃;LatentQuant先对齐编码器再冻结接口适配解码器。

量化
Ziye Deng; Lufang Chen; Shuyu Feng; Zhenwei Duan; Zicong Ye; Yu Sun; Xiaofan Li; Ruyi Gan; Hao Wang; Hao Zhang

沙丘判断:世界动作模型量化须验动作成功率;重建指标接近原模型仍可能导致策略失效。

本文研究强模态向弱模态转移文本对齐并闭式权重合并。

模型合并
Hoigi Seo; Byung Hyun Lee; Minjun Kim; Dohyun Mah; Jongho Lee; Se Young Chun

沙丘判断:跨模态合并需检查供体对齐质量和方向性,不能假定双向收益对称。

本文研究持续Agent合并以轨迹行为监督学习参数门控并限制干扰。

模型合并
Shuaitong Li; Baochen Xiong; Xiaoshan Yang; Xizhe Zheng; Yifan Xu; Jianhao Huang; Changsheng Xu

沙丘判断:合并需直接测交互行为而非仅参数距离;新旧任务的稳定可塑性要分别验证。

本文研究低秩压缩后恢复压力的模块级功能结构与更新传播。

模型压缩
Zishan Shao; Liang Tian; Georgiy Zemlevskiy; Kangning Cui; Lixun Zhang; Yixiao Wang; Ting Jiang; Jinhee Kim; Yixuan Chen; Rui-Feng Wang; Fan Yang; Hai Li; Yiran Chen

沙丘判断:压缩方案比较应加入恢复后结果与模块诊断,终点损失排序可能翻转

以教师重写段为显式修订监督:相对改进平均5.22%并取得更高修订成功率。

蒸馏
Yuxiang Zhang 等

沙丘判断:教师重写段作为修订监督提升推理5.22%;限数学与编程任务。

只蒸馏教师超出Harness的增量能力(动作偏好对比+有效性检查),长程智能体优于OPD。

上下文工程蒸馏
Moonseok Choi 等

沙丘判断:只蒸馏教师超出Harness的增量能力,长程智能体优于OPD;限固定Harness。

教师隐奖励放大学生行为致坍缩;屏蔽不健康响应+初始化可缓解,关注点应转向教师评估可靠性。

蒸馏
Han Cui 等

沙丘判断:教师隐奖励放大学生行为致坍缩,屏蔽+初始化可缓解;限数学推理。

一步生成的去噪计算重组于网络深度并可被中间层解码,MeanFlow SiT-L/2可压缩16.6倍。

模型压缩
Arnold Caleb Asiimwe 等

沙丘判断:一步生成的去噪计算重组于网络深度,MeanFlow可压16.6倍;限流图模型。

imatrix为GGUF新格式加入基于激活的统计(熵、余弦相似度、L2范数、ECS评分)及--activation-statistics参数。

量化
ggml-org

沙丘判断:激活统计是量化质量诊断信号而非精度证明;默认不使imatrix体积翻倍,启用方式与解释口径需按工具输出确认。

qkx3尺度搜索在退化组上可能产生inf、NaN或越界值并触发Debug断言;b11366在舍入前限制量化级别,覆盖多种K量化格式。

量化
ggml-org

沙丘判断:遇到退化组量化失败时可使用修正后的构建;原文未证明既有量化权重损坏,也不支持统一精度收益结论。

受这一观察的启发,研究团队引入了 GAD-RL,它根据学生当前的任务表现和局部分布,在联合后训练期间自适应地调节教师监督。

强化学习蒸馏RLVR
Baode Wang 等

沙丘判断:按学生组奖励门控及衰减教师蒸馏,并按教师首选词的学生支持度加权;忠实OCR收益来自任务奖励与动态监督组合。

受这种统一能力的推动,研究团队引入了 UniEvo-VL,这是一种多模态模型的自我进化框架,可以在测试时计算期间从这种建设性的自我纠正反馈中学习。

蒸馏
Fang Wu 等

沙丘判断:同一统一多模态模型以批判特权上下文做教师,在学生自身扩散轨迹蒸馏;文字生成结果混合,不能泛称全任务自提升。

因此,研究团队提出了 PivotOPD,这是一个在on-policy蒸馏框架,可以共同训练学生防止关键错误并从他们造成的状态中恢复。

蒸馏
Yinghui He 等

沙丘判断:PivotOPD对LLM Agent关键错误用反向KL预防、随后恢复前向KL迁移,三交互域并Nemotron仓库迁移;教师事后监督不能流入推理。

Embed 5的Pro与Fast共享嵌入空间,可用Pro离线索引、Fast在线查询,支持文本图像混合输入、100多种语言及多档向量维度。

量化视觉感知与空间理解
Cohere

沙丘判断:索引质量与在线时延可分开选择模型;共享空间是家族设计,不保证已有Embed 4索引可直接替换。

研究团队提出了一个神经符号路由器,它对每个传入查询进行分类,并将其分派给最便宜的正确求解器,将结构化任务发送给确定性引擎,并为开放式单词问题保留小语言模型(SLM)。

端侧模型
Avyay Sadhu 等

沙丘判断:把确定性问题交给符号求解器,为端侧语言模型的能耗与可靠性取舍提供参考。

研究团队引入了 SAKI(带有 KL 约束插值的监督分配),它将 KL 约束教师引导的部署与最大耦合相结合,并重用已实现的接受/纠正事件来路由词元级监督。

蒸馏
Miteto Wei 等

沙丘判断:按教师纠正事件分配令牌监督,并用投机验证引擎提高在线蒸馏轨迹吞吐。

研究团队开发了一个评估框架,将保留率与因果贡献和部署效用联系起来。这些贡献共同为日益复杂的 Agentic 系统的可靠、可维护和安全开发奠定了基础。

Agent Harness蒸馏
Ziluowen Luo 等

沙丘判断:将 Agent 蒸馏扩展到模型、记忆产物与 Harness,并用因果贡献验证持久知识转移。