


2025年初,DeepSeek为何能迅速走红并引发行业兴奋?它的出现是否意味着大模型对GPU/NPU的算力需求不再那么紧迫?本文将从几个关键维度进行分析。
DeepSeek发布了两个主要版本:V3和R1。这两个版本的定位不同,分别针对不同的应用场景。
- V3模型:对标GPT4o,属于L1级别的聊天机器人,工程创新最多,性价比高。
- R1模型:对标OpenAI-o1,属于推理模型,产业影响巨大。
回顾历史,2024年7月,OpenAI用五级能力体系定义AGI(通用人工智能),其中:
- L1:聊天机器人,如ChatGPT、GPT4o等。
- L2:推理者,如o1、o3。
- L3:代理型智能体,如Operator。
- L4:创新者,能提出人类未想到的科研与产业创新方案。
- L5:组织者,一组AI形成有效协同的生产力组织。
DeepSeek-V3是一个MoE(Mixture-of-Experts)语言模型,总参数量为671B,每个Token激活的参数量为37B。为了实现高效训练与推理,DeepSeek-V3延续了DeepSeek-V2的MLA(Multi-head Latent Attention)及DeepSeekMoE架构,并引入了无需辅助损失的负载均衡策略和多Token预测训练目标以节省计算量。
低成本是DeepSeek-V3的最大亮点
DeepSeek V3的训练数据量达到了14.8万亿个Token,而训练成本仅为557.6万美元,远低于行业平均水平(Gemini为1.98亿美元)。具体来说,总共训练了2788K H800小时,按照每小时2美元的成本,总成本大约为560万美元。
技术优化点
1. 改造FFN:DeepSeekMoE + 动态路由
- MoE通过将大模型分拆成多个小的专家模型,每次处理Token时不需要全部参数被激活,从而减少计算量。
- DeepSeekMoE通过细粒度专家细分和共享专家隔离来提高专业知识获取,降低知识冗余。
2. 改造注意力模块:MLA(多头潜在注意力)
- MLA通过低秩压缩技术,将Q、K、V矩阵压缩到低维空间,显著减少了显存占用。
- 这一方法解决了传统MHA中KV Cache占用空间巨大的问题,同时保持了性能。
3. 分布式训练集群的深度优化
- DeepSeek V3在包含2048个H800 GPU的集群上训练,节点间通过IB网络互联。
- 集群利用率超出LLaMA 10个百分点,达到了34.7%。
4. 多Token预测与FP8混合精度
- 多Token预测减少了下一侧预测的计算量。
- FP8混合精度降低了计算量,提高了效率。
DeepSeek-R1对标OpenAI o1,专注于提升推理能力。前OpenAI首席科学家Ilya曾提到,预训练时代可能即将结束,因为数据增长放缓。因此,AI产业的发展目标转向强化学习和推理。
小编建议,DeepSeek V3和R1通过一系列技术创新,在资源有限的情况下实现了最佳性价比,为业内提供了宝贵的工程实践方案。



