离线语音系统比较2—5B指令模型四种量化在Jetson和树莓派上的吞吐、能耗与非洲语言质量。
沙丘判断:端侧方案需按具体设备测能耗与语言质量,不能仅凭参数量选择量化版本。
按技术方向追踪论文、模型、开源项目、产品服务与工程实践
离线语音系统比较2—5B指令模型四种量化在Jetson和树莓派上的吞吐、能耗与非洲语言质量。
沙丘判断:端侧方案需按具体设备测能耗与语言质量,不能仅凭参数量选择量化版本。
SPECTRUM在固定信息预算循环代码自蒸馏中调制KV谱,检验正确实现多样性而非仅准确率的保留。
沙丘判断:自蒸馏不能只看正确率;保持有效实现多样性有助于避免反复训练后的模式收缩。
D-OPCD将图像Agent改良提示视为特权上下文,同策略蒸馏进扩散权重,再让技能演化继续改进。
沙丘判断:改良提示可成为训练时的特权信息,但最终能力必须在无该提示的条件下验证。
SRD将完整交互后的知识陷阱蒸馏为交互前预见训练目标,推理无需生成,在奖励全失败组仍提供学习信号。
沙丘判断:事后知识可提供全失败组的学习信号,部署收益需确认不依赖未来交互信息。
OSFP4联合优化对角平滑与块scale,纳入实际NVFP4舍入或GPTQ干扰抵消,在质量与原生prefill吞吐间比较。
沙丘判断:量化设计需要使用实际舍入规则,质量与原生预填充吞吐应按同一配置比较。
编码Agent自纠正蒸馏以执行证据方向和有效样本量分别建模,用Dirichlet后验不确定性控制学习权重。
沙丘判断:反馈方向与证据数量需要分别建模,不确定性权重有助于避免少量执行结果过拟合。
研究发现视频VAE量化重建得分可保持而动作成功率崩溃;LatentQuant先对齐编码器再冻结接口适配解码器。
沙丘判断:世界动作模型量化须验动作成功率;重建指标接近原模型仍可能导致策略失效。
本文研究强模态向弱模态转移文本对齐并闭式权重合并。
沙丘判断:跨模态合并需检查供体对齐质量和方向性,不能假定双向收益对称。
本文研究持续Agent合并以轨迹行为监督学习参数门控并限制干扰。
沙丘判断:合并需直接测交互行为而非仅参数距离;新旧任务的稳定可塑性要分别验证。
本文研究低秩压缩后恢复压力的模块级功能结构与更新传播。
沙丘判断:压缩方案比较应加入恢复后结果与模块诊断,终点损失排序可能翻转
以成功rollout为参照筛选失败rollout,教师输入token仅3.46-5.02%保持相当性能。
沙丘判断:仅3.46-5.02%教师token预算保持相当性能;限数学推理蒸馏。
以教师重写段为显式修订监督:相对改进平均5.22%并取得更高修订成功率。
沙丘判断:教师重写段作为修订监督提升推理5.22%;限数学与编程任务。
只蒸馏教师超出Harness的增量能力(动作偏好对比+有效性检查),长程智能体优于OPD。
沙丘判断:只蒸馏教师超出Harness的增量能力,长程智能体优于OPD;限固定Harness。
绑定教师查询与步长修复端点超权:八步学生较教师加速7.7-11.9倍、峰值显存降3.8-6.7倍。
沙丘判断:绑定教师查询与步长修复端点超权,7.7-11.9倍加速;限文本到动作。
教师隐奖励放大学生行为致坍缩;屏蔽不健康响应+初始化可缓解,关注点应转向教师评估可靠性。
沙丘判断:教师隐奖励放大学生行为致坍缩,屏蔽+初始化可缓解;限数学推理。
轨迹分布状态上的低秩最优校准:较干净校准保留更多数学推理。
沙丘判断:轨迹分布状态上的低秩最优校准保留更多数学推理;限dLLM压缩。
一步生成的去噪计算重组于网络深度并可被中间层解码,MeanFlow SiT-L/2可压缩16.6倍。
沙丘判断:一步生成的去噪计算重组于网络深度,MeanFlow可压16.6倍;限流图模型。
imatrix为GGUF新格式加入基于激活的统计(熵、余弦相似度、L2范数、ECS评分)及--activation-statistics参数。
沙丘判断:激活统计是量化质量诊断信号而非精度证明;默认不使imatrix体积翻倍,启用方式与解释口径需按工具输出确认。
qkx3尺度搜索在退化组上可能产生inf、NaN或越界值并触发Debug断言;b11366在舍入前限制量化级别,覆盖多种K量化格式。
沙丘判断:遇到退化组量化失败时可使用修正后的构建;原文未证明既有量化权重损坏,也不支持统一精度收益结论。
llama.cpp修正CUDA cuBLAS路径的NVFP4计算类型,并保留逐专家矩阵乘法参数。
沙丘判断:量化格式与累加精度需要共同配置,硬件支持和算子路径会影响低精度推理正确性。
为了应对这些挑战,研究团队提出了 ITC-MoE,这是一种用于 MoE DLM 的重要性引导词元感知压缩框架。
沙丘判断:联合重要性感知Tucker分解及冷热token补偿路由,压缩MoE扩散语言模型。
研究团队引入了 TopK-Guided,这是一种免训练方法,通过将有界词元级稀疏性适应与敏感度感知的块级预算分配相结合来解决这两个限制。
沙丘判断:以有界token稀疏调整和块敏感度预算分配压缩语言模型激活计算。
受这一观察的启发,研究团队引入了 GAD-RL,它根据学生当前的任务表现和局部分布,在联合后训练期间自适应地调节教师监督。
沙丘判断:按学生组奖励门控及衰减教师蒸馏,并按教师首选词的学生支持度加权;忠实OCR收益来自任务奖励与动态监督组合。
受这种统一能力的推动,研究团队引入了 UniEvo-VL,这是一种多模态模型的自我进化框架,可以在测试时计算期间从这种建设性的自我纠正反馈中学习。
沙丘判断:同一统一多模态模型以批判特权上下文做教师,在学生自身扩散轨迹蒸馏;文字生成结果混合,不能泛称全任务自提升。
因此,研究团队提出了 PivotOPD,这是一个在on-policy蒸馏框架,可以共同训练学生防止关键错误并从他们造成的状态中恢复。
沙丘判断:PivotOPD对LLM Agent关键错误用反向KL预防、随后恢复前向KL迁移,三交互域并Nemotron仓库迁移;教师事后监督不能流入推理。
Embed 5的Pro与Fast共享嵌入空间,可用Pro离线索引、Fast在线查询,支持文本图像混合输入、100多种语言及多档向量维度。
沙丘判断:索引质量与在线时延可分开选择模型;共享空间是家族设计,不保证已有Embed 4索引可直接替换。
研究团队提出了一个神经符号路由器,它对每个传入查询进行分类,并将其分派给最便宜的正确求解器,将结构化任务发送给确定性引擎,并为开放式单词问题保留小语言模型(SLM)。
沙丘判断:把确定性问题交给符号求解器,为端侧语言模型的能耗与可靠性取舍提供参考。
在这项工作中,研究团队首次系统地研究了 LLM 的 ZK 友好量化。
沙丘判断:零知识证明中的量化要按算子精度与证明结构选择,低比特不必然等比例节省证明成本。
研究团队引入了 SAKI(带有 KL 约束插值的监督分配),它将 KL 约束教师引导的部署与最大耦合相结合,并重用已实现的接受/纠正事件来路由词元级监督。
沙丘判断:按教师纠正事件分配令牌监督,并用投机验证引擎提高在线蒸馏轨迹吞吐。
研究团队开发了一个评估框架,将保留率与因果贡献和部署效用联系起来。这些贡献共同为日益复杂的 Agentic 系统的可靠、可维护和安全开发奠定了基础。
沙丘判断:将 Agent 蒸馏扩展到模型、记忆产物与 Harness,并用因果贡献验证持久知识转移。