开源项目QwenLM/FlashQLA:线性注意力训练与推理加速内核QwenLM/FlashQLAQwenLM·来源日期:2026.04.24模型推理推理加速收藏概述FlashQLA 来自 QwenLM 组织,定位为独立的高性能内核,针对线性注意力架构在训练与推理两个环节的加速问题。线性注意力模型的落地效果高度依赖底层 kernel 优化,官方提供专门内核有助于降低部署门槛、提升运行效率。仓库处于创建初期,支持的硬件范围与加速幅度需以代码与基准数据为准。