模型

LongCat 同步开源 Zigzag 注意力变体 LongCat-Flash-Thinking-ZigZag:支持最长 100 万 token 上下文

多维创新打造强泛化智能体模型,LongCat-Flash-Thinking-2601技术报告发布

模型架构模型推理上下文与知识新型架构推理加速KV Cache上下文工程

概述

针对全注意力二次计算复杂度难以支撑百万级 token 上下文、现有稀疏注意力方案需完全重训的问题,LongCat 团队提出 Zigzag 注意力机制:分层设计、在不同层交替使用 MLA(多头潜在注意力)与 SSA(流式稀疏注意力)两种稀疏注意力变体,避免计算不平衡以提升硬件利用率;对每个查询 token,注意力被限制在最近 W 个 token 的局部窗口与序列开头 B 个全局锚点,显著降低计算和内存复杂度。该机制在中期训练阶段通过结构化稀疏化流程把原始全注意力模型转换为稀疏变体,转换开销极低,优化后支持最长 100 万 token 上下文;团队同步在 Hugging Face(meituan-longcat/LongCat-Flash-Thinking-ZigZag)开源适配该机制的模型,完整继承 LongCat-Flash-Thinking-2601 的核心能力。