为什么值得花时间理解 DeepSeek 的架构
2026 年 8 月,当我打开 Hugging Face 的排行榜时,DeepSeek 家族的身影几乎占据了整个视野。DeepSeek-V3 下载量超过 105 万,DeepSeek-V4-Flash 超过 188 万,DeepSeek-R1 更是突破 690 万——这还不包括那些基于它们蒸馏出来的小模型。
作为一个每天要和 AI 打交道的程序员,我越来越觉得:如果你只是把 DeepSeek 当成又一个”能用 GPT-4 的平替”来用,那其实是在浪费它的价值。DeepSeek 最值得关注的不是它有多便宜,而是它用什么样的方式、花什么样的成本,达到了今天这个性能水平。
这篇文章我想从工程视角出发,梳理一下 DeepSeek 从 V3 到 V4 的架构演进路线,讲清楚每个技术决策背后的思路——不是为了炫术语,而是为了让我们在实际选型和使用时有更好的判断力。
DeepSeek 模型家族全景
先给一个当前(2026 年 8 月)的 DeepSeek 模型全景图:
| 模型 | 总参数量 | 激活参数 | 架构 | 上下文长度 | 开源 | HF 下载量 |
|---|---|---|---|---|---|---|
| DeepSeek-V3 | 671B | 37B | MoE | 128K | 是(MIT) | 105万+ |
| DeepSeek-R1 | 671B | 37B | MoE | 128K | 是(MIT) | 691万+ |
| DeepSeek-V3.2 | 671B | 37B | MoE | 128K | 是(MIT) | 121万+ |
| DeepSeek-V4-Flash | 284B | 13B | MoE | 1M | 是(MIT) | 189万+ |
| DeepSeek-V4-Pro | 1.6T | 49B | MoE | 1M | 否 | 122万+ |
几个值得注意的点:
- V4-Flash 的总参数量比 V3 少了一半以上(284B vs 671B),激活参数更是从 37B 降到了 13B,但上下文长度从 128K 跃升到 100 万 token。这是一个非常激进的”以小博大”策略。
- V4-Pro 达到了 1.6T 的总参数量,激活参数 49B,是当前 DeepSeek 家族最强的模型,但尚未开源。
- R1 和 V3 共享同一个架构(都基于 V3-Base),区别在于训练方式——R1 引入了强化学习来激发推理能力。
V3 的核心技术栈:三大支柱
DeepSeek-V3 是 DeepSeek 的旗舰基座模型,也是理解整个技术路线的起点。它的技术架构可以拆解为三个核心创新:
1. Multi-head Latent Attention (MLA)
V3 沿用了 V2 中经过验证的 MLA 架构。传统的多头注意力机制(MHA)在每个 head 中都需要存储完整的 K 和 V 矩阵,对于大模型来说,KV Cache 的显存开销是巨大的。
MLA 的思路很巧妙:在注意力计算之前,先把 K 和 V 投影到一个低维的潜在空间(latent space),在这个低维空间里做注意力计算。这样做的直接效果是 KV Cache 大幅压缩——DeepSeek 官方的数据显示,V3 的 KV Cache 相比同规模的 Dense 模型可以减少约 50%。
对于工程实践来说,这意味着什么?简单说:同样的显存可以跑更大的 batch size,或者支持更长的上下文。在 R1 的推荐配置中,官方就特别强调要用 --max-model-len 32768 这样的参数来充分利用这一点。
2. DeepSeekMoE:无辅助损失的负载均衡
MoE(Mixture of Experts)架构的核心思想是:把一个大模型拆成多个”专家”子网络,每个 token 只激活其中的少数几个。这样可以在总参数量很大的情况下,保持每次推理的计算量在可控范围内。
V3 的 MoE 实现有一个非常值得注意的设计:无辅助损失的负载均衡策略(auxiliary-loss-free)。在传统的 MoE 实现中,需要额外引入一个辅助损失(auxiliary loss)来防止某些专家被过度使用、某些专家被闲置。这个辅助损失虽然简单,但在大规模训练时会引入额外的计算开销和调参复杂度。
DeepSeek 团队选择放弃这个辅助损失,转而通过训练策略来实现负载均衡。从结果来看,这个选择是成功的——V3 在 278.8 万 H800 GPU 小时的训练过程中,”没有经历过任何不可恢复的损失尖峰或回滚”。这是一个非常罕见的稳定性声明,背后是对训练工艺的极度自信。
3. 多 token 预测训练目标
V3 还引入了多 token 预测(multi-token prediction)作为训练目标。传统的语言模型训练是一步一步地预测下一个 token,而多 token 预测让模型同时预测未来多个 token。
这个技术听起来简单,但实际效果很有意思:
- 训练时,模型被迫建立更强的”全局预测能力”,不能只关注眼前这一步
- 推理时,虽然实际还是逐个 token 输出,但模型学到的表征更丰富
- 对长文本理解和生成有直接的正面效果
V3 的训练数据与规模
V3 的预训练数据规模是 14.8 万亿 token。这个数字怎么理解?
作为对比,OpenAI 的 GPT-3(175B)大约使用了 3000 亿 token 的预训练数据,GPT-4 的预训练数据规模据传在 15-20 万亿 token 量级。所以 V3 的 14.8 万亿 token 已经是当前开源模型中的顶级水平。
更重要的是,DeepSeek 官方强调这些数据是”多样化的高质量 token”(diverse and high-quality tokens)。数据质量往往比数量更重要——这也是为什么 DeepSeek 在总训练时长远小于某些竞品的情况下,能够达到相近的性能。
从 V3 到 R1:强化学习如何”唤醒”推理能力
DeepSeek-R1 可能是 2025 年初 AI 界最大的新闻之一。它的核心突破不是架构上的创新,而是训练范式的转变。
R1 基于 V3-Base 训练,但引入了大规模的强化学习(RL)。这个 RL 框架有两个关键特征:
纯 RL 路径:R1-Zero
DeepSeek 首先尝试了一个激进的做法——完全跳过监督微调(SFT),直接从 Base 模型开始做 RL。这就是 R1-Zero。令人惊讶的是,R1-Zero 在没有人类标注推理轨迹的情况下,自发涌现出了强大的推理行为:
- 自我反思(self-reflection):模型会在回答前先检查自己的推理过程
- 验证(verification):自动验证计算结果
- 动态策略适应(dynamic strategy adaptation):根据问题复杂度调整推理深度
但 R1-Zero 也有明显的问题:输出可读性差、有无限重复的倾向、中英文混杂严重。这些是纯 RL 路径的常见副作用。
Cold-start + RL:R1 的最终方案
为了解决 R1-Zero 的问题,R1 在 RL 之前加入了一个”冷启动”(cold-start)阶段,使用少量的高质量推理样本做初始微调。这既保留了 RL 带来的推理能力提升,又解决了输出质量和可读性的问题。
从 benchmark 数据看,R1 的效果非常显著:
| 指标 | DeepSeek-V3 | DeepSeek-R1 | Claude 3.5 Sonnet | GPT-4o |
|---|---|---|---|---|
| MMLU (Pass@1) | 88.5 | 90.8 | 88.3 | 87.2 |
| GPQA-Diamond | 59.1 | 71.5 | 65.0 | 49.9 |
| AIME 2024 | 65.2 | 84.0 | 74.3 | 66.7 |
| SimpleQA (Correct) | 24.9 | 30.1 | 28.4 | 38.2 |
最亮眼的是 GPQA-Diamond(需要深度推理的高难度问题),R1 达到了 71.5%,远超 GPT-4o 的 49.9%。
R1 蒸馏模型:让小型设备也能享受推理能力
R1 系列的另一大贡献是蒸馏出的小型模型。DeepSeek 将 R1 的推理能力蒸馏到了 Qwen 和 Llama 系列的小模型上:
| 蒸馏模型 | 基准模型 | AIME 2024 | GPQA-Diamond | 推理时间/题 |
|---|---|---|---|---|
| R1-Distill-Qwen-32B | Qwen2.5-Math-32B | 72.6 | 62.1 | ~1691ms |
| R1-Distill-Llama-8B | Llama-3.1-8B | 50.4 | 39.6 | ~1205ms |
| R1-Distill-Llama-70B | Llama-3.1-70B | 70.0 | 57.5 | ~1633ms |
| R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | 21.9 | 14.6 | ~688ms |
32B 的模型在 AIME 上达到 72.6%——这个数字比 GPT-4 还要高。这对工程实践来说意义重大:如果你有一个 24GB 显存的 GPU,完全可以本地跑起这个模型,获得接近顶级推理模型的效果。
V4 系列:百万 Token 上下文的革命
如果说 V3 和 R1 是 DeepSeek 的第一个里程碑,那么 2026 年 4 月发布的 V4 系列就是一个全新的纪元。
V4 的架构升级:三大新创新
V4 论文(arXiv:2606.19348)提出了三个新的架构创新:
1. 混合注意力:CSA + HCA
V4 引入了两种新的注意力机制:Compressed Sparse Attention(CSA,压缩稀疏注意力)和 Heavily Compressed Attention(HCA,重度压缩注意力)。这是一种混合注意力架构——不同类型的 token 使用不同的注意力策略。
直观理解:在处理长文档时,不是每个 token 都需要同样精细的注意力。V4 的思路是让模型学会”该注意什么、可以忽略什么”。
实际效果令人震撼:在 100 万 token 的上下文设置下,V4-Pro 只需要 V3.2 的 27% 的推理 FLOPs 和 10% 的 KV Cache。这意味着同样一套硬件,V4 能处理的上下文长度是 V3 的 8 倍以上。
2. Manifold-Constrained Hyper-Connections (mHC)
传统的 Transformer 使用残差连接(residual connections)让梯度更好地流动。V4 在此基础上提出了”流形约束超连接”(mHC),通过约束连接的方式让信息在层间传递时更加高效。
这不是一个容易实现的小改动——它涉及到网络拓扑的重新设计。但 V4 团队选择这样做,说明他们认为这是突破百万 token 上下文的关键路径之一。
3. Muon 优化器
V4 引入了新的优化器 Muon,用于”更快的收敛和更大的训练稳定性”。在大规模 MoE 训练中,优化器的选择对训练效率和稳定性有决定性影响。DeepSeek 选择自研优化器而不是使用 AdamW,说明他们在训练工艺上已经有足够的积累来做这种底层创新。
V4 的训练规模
V4 系列的预训练数据超过 32 万亿 token——是 V3(14.8T)的两倍多。这个数据量的飞跃直接对应了模型能力的提升。
V4-Flash:开源界的”小而强”
V4-Flash 是 V4 系列中开源的版本,它的定位非常清晰:以极小的模型体积提供尽可能强的能力。
- 总参数:284B(V3 是 671B,减少了 58%)
- 激活参数:13B(V3 是 37B,减少了 65%)
- 上下文:100 万 token
- 许可证:MIT(完全开源)
284B 的总参数和 13B 的激活参数意味着什么?在推理成本上,V4-Flash 比 V3 便宜了大约 65%。结合 100 万 token 的上下文能力,这让它成为了当前性价比最高的开源模型之一。
从 API 定价也能看出这一点:
| 模型 | 输入价格(缓存未命中) | 输出价格 | 上下文长度 |
|---|---|---|---|
| V4-Flash | 1.5-3.0 元/百万 tokens | 4.5-9.0 元 | 1M |
| V4-Pro | 4.5-9.0 元/百万 tokens | 13.5-27.0 元 | 1M |
| GPT-4o | ~4.5 元/百万 tokens | ~18 元 | 128K |
V4-Flash 的输入价格(高峰时段 3 元/百万 tokens)甚至低于 GPT-4o 的价格,同时还多了 8 倍的上下文长度。
架构演进路线图的工程启示
把这些技术点串起来,我们可以清晰地看到 DeepSeek 的技术演进路线:
1 | V2 (236B/21B) ──→ V3 (671B/37B) ──→ V3.2 (671B/37B) |
这条路线给我的启示是:
第一,DeepSeek 在”小模型大能力”这条路上走得比任何人都有信心。从 V3 的 671B 到 V4-Flash 的 284B,他们不是在做”降级”,而是在做”提效”。
第二,他们重视训练工艺胜过单纯堆参数。V3 只用 278.8 万 H800 小时就达到了当前级别——这个数字在业内是非常高效的。
第三,他们选择开源而不是封闭。V4-Flash 的 MIT 许可证意味着任何人都可以无限制地使用、修改、分发。这对构建生态来说是一个巨大的优势。
局限性与诚实讨论
当然,DeepSeek 也不是完美的。这里有几个我在实际使用中注意到的问题:
第一,中文场景下 V4-Pro 仍然优于 V4-Flash。如果你在中文写作、翻译等任务上需要最高质量,V4-Flash 可能还不够——它的参数量缩减在这些敏感任务上会显现出来。
第二,思考模式(Thinking Mode)虽然强大,但会带来显著的延迟和成本增加。V4-Flash 的输入价格在启用思考模式后实际上会翻倍(因为思考过程也要消耗 token)。对于不需要深度推理的任务,强行开启思考模式是浪费。
第三,V4-Pro 目前不开源。这意味着如果你想获得 V4 系列的最高能力,仍然需要依赖 API。API 的可用性和稳定性完全取决于 DeepSeek 的服务,这一点在关键业务场景下需要认真评估。
第四,关于”百万 token 上下文”——这更多是一个理论上限。在实际使用中,模型在超长上下文下的性能衰减是一个仍然开放的问题。DeepSeek 声称 V4-Pro 在 1M 上下文下只需要 27% 的 FLOPs,但这并不意味着模型在 1M token 的输入下仍然能保持和短上下文一样的回答质量。
参考链接
- DeepSeek-V3 技术报告:https://arxiv.org/abs/2412.19437
- DeepSeek-R1 技术报告:https://arxiv.org/abs/2501.12948
- DeepSeek-V4 技术报告:https://arxiv.org/abs/2606.19348
- V3 GitHub 仓库:https://github.com/deepseek-ai/DeepSeek-V3
- R1 GitHub 仓库:https://github.com/deepseek-ai/DeepSeek-R1
- DeepSeek API 文档:https://api-docs.deepseek.com/
- DeepSeek 模型定价:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
总结
DeepSeek 的架构演进路线给我最大的感受是:他们不是在追热点,而是在做工程。从 V3 的 MLA 和 MoE 优化,到 R1 的强化学习范式,再到 V4 的百万 token 上下文突破——每一步都是有明确技术目标的、有数据支撑的工程决策。
对于开发者来说,理解这些技术细节的价值在于:你可以更准确地判断什么场景该用什么模型,什么场景值得为思考模式付费,什么场景可以本地部署开源版本。这些判断力,才是真正属于你的东西。
下篇文章我会从开发者的角度,手把手讲解如何用 DeepSeek 的 API 做实际项目——包括思考模式的调用、成本优化技巧、以及我踩过的那些坑。