
2024 年DeepSeek-V3 用 557 万美元的训练成本震撼了硅谷2026 年DeepSeek-V4 将原生百万 token 上下文变成了开源基础设施。与此同时以 Mamba 为代表的状态空间模型SSM正在从学术概念走向生产部署。本文以 DeepSeek 的架构演进为线索系统梳理 Transformer 与 SSM 两条路线的碰撞、分野与殊途同归。一、Transformer 的慢性病二次方复杂度的诅咒自 2017 年《Attention Is All You Need》发表以来Transformer 凭借自注意力机制一统 NLP 江湖。然而这一架构有一个与生俱来的基因缺陷自注意力的计算和内存复杂度均为O(N2)O(N^2)O(N2)。序列长度每翻一倍计算量和显存消耗就增长四倍。在实际部署中这表现为三个致命瓶颈KV Cache 爆炸推理时需要缓存所有历史 token 的 Key 和 Value内存随序列线性增长首 token 时间TTFT急剧上升预填充阶段需要计算完整的注意力矩阵长文本天花板消费级 GPU 上纯 Transformer 通常难以处理超过 128K 的上下文面对这一困境业界分化出了两条截然不同的解决路线。二、路线一DeepSeek 的保守治疗——在 Transformer 框架内极致优化DeepSeek 选择了一条稳健而激进的路线不抛弃 Transformer 的基本框架而是在其内部进行一系列外科手术式的优化逐步将长文本推理的成本降到可接受的范围。2.1 第一次手术MLAV2/V320242024 年 5 月DeepSeek-V2 引入了Multi-head Latent AttentionMLA这是 DeepSeek 效率革命的起点。MLA 的核心思想是低秩联合压缩将 Key 和 Value 通过一个下投影矩阵压缩到一个低维隐向量ctKVc_t^{KV}ctKV中推理时只需缓存这个压缩向量而非完整的 per-head KV。在 DeepSeek-V3 中MLA 与 DeepSeekMoE 架构结合打造了一个 671B 参数、每 token 仅激活 37B 的巨型模型。该模型在 14.8T tokens 上完成预训练全程仅需 2.788M H800 GPU 小时——这一训练成本在当时引发了全球震动。2.2 第二次手术DSAV3.22025MLA 解决了 KV Cache 的每个 token 存多少问题但没有解决要看多少历史 token的问题。2025 年 12 月DeepSeek-V3.2 引入了DeepSeek Sparse AttentionDSA通过闪电索引器Lightning Indexer在注意力计算前快速筛选出最相关的 top-k token将核心注意力的复杂度从O(L2)O(L^2)O(L2)降到O(L⋅k)O(L \cdot k)O(L⋅k)。DSA 的检索-然后-注意力retrieve-then-attend机制本质上是在 Transformer 内部嵌入了一个轻量级的信息检索系统。2.3 第三次手术CSA HCA 混合注意力V420262026 年 4 月DeepSeek-V4 的发布标志着这条路线的成熟。V4 不再使用单一的注意力机制而是设计了两种互补的注意力分支并交替使用机制压缩率作用类比CSA4:1通过 softmax 门控池化压缩 KV再用 FP4 闪电索引器选择 top-512 相关块精读在书中找到最相关的章节细读HCA128:1将每 128 个 token 的 KV 合并为一个条目然后在其上运行密集注意力泛读快速浏览全书概要SWA无保留最近 128 个 token 的原始 KV当前页确保对最新内容的精确感知这种精读 泛读 当前页的三层设计使得 DeepSeek-V4 在 1M token 上下文下实现了惊人的效率V4-Pro 仅需 V3.2 的27% 推理 FLOPs 和 10% KV CacheV4-Flash 更是降至10% FLOPs 和 7% KV Cache。2.4 隐形的基石mHC 与 Muon除了注意力机制DeepSeek-V4 还引入了两项关键创新Manifold-Constrained Hyper-ConnectionsmHC替代了传统的残差连接。mHC 将残差流扩展为 4 条并行通道并通过 Sinkhorn-Knopp 算法将混合矩阵约束在 Birkhoff 多面体双随机矩阵流形上确保信号范数在深层网络中不会爆炸或消失。这使得 61 层的 V4-Pro 能够稳定训练。Muon 优化器则通过 Newton-Schulz 正交化步骤让梯度更新保持良好条件数在 32T token 的预训练规模上实现了更快的收敛。三、路线二SSM 的器官移植——另起炉灶的线性革命与 DeepSeek 的保守治疗不同另一条路线选择彻底抛弃自注意力机制回归控制论中的状态空间模型State Space Model, SSM。3.1 从 S4 到 Mamba选择性记忆的诞生SSM 的核心思想极其优雅用一个固定大小的隐状态Hidden State来压缩历史信息每步更新状态的计算量为O(1)O(1)O(1)总复杂度O(N)O(N)O(N)。这与 Transformer 的全员握手形成鲜明对比——SSM 更像一个流水线工人只保留当前的工作状态。早期的 S4 模型通过数学化的AAA矩阵设计HiPPO 理论保证了长程依赖的建模能力但缺乏灵活性。2023 年Mamba 引入了选择性机制Selective SSM让BBB、CCC矩阵依赖于输入数据实现了根据内容选择性记忆——这是 SSM 从死板过滤器进化为智能处理器的关键一跃。3.2 Mamba-2 的 SSDTransformer 与 SSM 的统一视角2024 年Mamba-2 提出了SSDState Space Duality框架从理论上证明了一个惊人的结论Transformer 的注意力机制和 SSM 的状态转移本质上是同一枚硬币的两面。两者都可以看作是用一个矩阵MMM去混合序列中的 token只是MMM的结构不同Attention 的MMM是稠密、内容相关、带 softmax 归一化的N×NN \times NN×N矩阵SSM 的MMM是下三角、由递归参数决定、带衰减的结构化半可分矩阵SSD 模型恰好位于两者的交集既可以写成递归形式SSM 视角O(1)O(1)O(1)单步推理又可以写成矩阵乘法形式注意力视角可利用 Tensor Core 加速。3.3 Mamba-3向 Transformer 靠拢20262026 年 3 月发布的 Mamba-3 进一步模糊了与 Transformer 的边界引入QKNorm / BCNorm稳定训练采用复数值状态更新实现更丰富的状态跟踪引入MIMO多输入多输出架构在不增加推理延迟的前提下提升表现去除短卷积层通过新的离散化递归机制在 SSM 内部隐式实现卷积效果在 1.5B 参数规模下Mamba-3 相比 Gated DeltaNet 平均准确率提升 1.8 个百分点同时将状态大小减半。四、正面交锋效率与能力的权衡4.1 效率维度两种降本哲学维度DeepSeek 路线V4SSM 路线Mamba核心策略保留注意力但通过压缩/稀疏化降低代价完全消除注意力用固定状态替代KV Cache极大压缩V4 为 V3.2 的 7-10%完全消除O(1)O(1)O(1)固定状态序列长度上限1M tokens已验证220K tokens消费级 GPU推理速度长文本相比基线提升 3-10 倍10.67× 更快370 tokens 后内存效率相比 GQA 基线降至 ~2%12.46× 更省DeepSeek 的路线是把 KV Cache 做到极致的小而 SSM 的路线是让 KV Cache 彻底消失。前者在短文本上几乎没有性能损失后者在任何长度上都保持恒定内存。4.2 能力维度精确检索 vs 长程建模然而效率的提升并非没有代价DeepSeek / Transformer 的优势精确关联回忆在大海捞针Needle-in-a-Haystack任务中显式注意力机制提供了更精确的 token 级归因。DeepSeek-V4-Pro 在 1M 上下文的 MRCR 任务上达到 83.5% 的准确率。可解释性注意力权重直观展示了模型在看哪里SSM 的优势长程依赖建模隐状态持续演化有效上下文利用率高达 90.2%Transformer 仅 12.7%动态变化检测对序列中的关键转折点更敏感状态跟踪在需要维护搜索前沿、约束传播等任务中固定状态提供了天然的工作记忆两者的短板也恰好互补纯 Transformer 在长文本上 KV Cache 爆炸纯 SSM 在关联回忆任务上受限于固定隐状态容量在复制任务上需要比 Transformer多 100 倍的训练数据。五、殊途同归混合架构的崛起2026 年的技术图景已经清晰纯 Transformer 在长文本场景下难以为继纯 SSM 在精确回忆任务上仍有短板而混合架构正在成为主流。5.1 DeepSeek-V4 本身就是一种混合有趣的是DeepSeek-V4 的 CSA HCA 交替设计与 SSM 领域的混合架构如 Jamba、Zamba、Mamba-2-Hybrid在哲学上高度相似Jamba / Zamba将 Transformer 层与 Mamba 层按一定比例如 1:7 到 1:10交错DeepSeek-V4将 CSA精细稀疏注意力与 HCA粗粒度压缩注意力交错两者都遵循同一个设计哲学用低成本机制处理全局/长程信息用高精度机制处理局部/关键信息。DeepSeek 没有使用 SSM 层但其分层压缩 稀疏选择的注意力设计与 SSM 的状态演化 选择性更新在抽象层面形成了呼应。5.2 SSD 理论架起的桥梁Mamba-2 的 SSD 框架从数学上证明Transformer 和 SSM 并非水火不容而是结构化矩阵混合的不同实例。这意味着针对 Transformer 的优化如 FlashAttention、稀疏注意力可以被移植到 SSMSSM 的线性复杂度优势可以被引入到混合模型中未来的架构设计可以在稠密注意力—结构化注意力—SSM的光谱上自由滑动5.3 未来的融合方向DeepSeek 在其技术报告中明确提到“我们将持续研究和完善模型架构努力突破 Transformer 的架构限制”。与此同时Mamba-3 通过引入 RoPE、QKNorm 和 MIMO正在主动向 Transformer 的设计范式靠拢。两条路线正在从对抗走向融合。六、选型指南何时用谁场景推荐路线理由短文本4K标准 Transformer / DeepSeek-V3生态成熟关联回忆强长文档/代码库128K-1MDeepSeek-V4原生 1M 上下文检索精度高开源可部署超长序列1M/ 实时流式SSM / 混合架构线性复杂度无 KV Cache延迟可控边缘设备/嵌入式SSM固定内存硬件要求极低需要精确检索/代码生成DeepSeek-V4 / 混合模型注意力机制提供精确的 token 级归因状态跟踪/多步推理SSM / 混合模型固定状态天然适合维护搜索前沿结语不是取代而是共生Transformer 与 SSM 的竞争本质上是表达能力与计算效率之间的永恒张力。DeepSeek 用四年时间证明在 Transformer 框架内通过 MLA → DSA → CSA/HCA 的渐进式优化可以将百万 token 上下文从研究 demo变成生产基础设施。SSM 则用数学优雅性证明完全抛弃二次方注意力线性复杂度同样可以建模复杂序列。2026 年的答案已经清晰未来的大模型架构既不会是Attention Is All You Need也不会是State Space Is All You Need而是在两者之间的光谱上根据任务需求灵活调配计算资源。DeepSeek-V4 的混合注意力、Mamba-3 的 Transformer 化设计、以及 SSD 理论的统一框架都指向同一个方向——选择性注意力 高效状态空间的融合。在这场架构革命中DeepSeek 和 Mamba 团队分别从两端向中间掘进。当他们在某个未来版本的模型中相遇时那或许就是下一代通用人工智能架构诞生的时刻。