开源项目

QwenLM/FlashQLA:线性注意力训练与推理加速内核

QwenLM/FlashQLA

模型推理推理加速

概述

FlashQLA 来自 QwenLM 组织,定位为独立的高性能内核,针对线性注意力架构在训练与推理两个环节的加速问题。线性注意力模型的落地效果高度依赖底层 kernel 优化,官方提供专门内核有助于降低部署门槛、提升运行效率。仓库处于创建初期,支持的硬件范围与加速幅度需以代码与基准数据为准。