首页>热点资讯>正文

Deepshock:一文看懂DeepSeek

2025-02-11 13:10
来源:网络

DeepSeek带来的Deepshock,一次看懂DeepSeek

为什么DeepSeek在2025年初一夜爆红?

2025年初,DeepSeek为何能迅速走红并引发行业兴奋?它的出现是否意味着大模型对GPU/NPU的算力需求不再那么紧迫?本文将从几个关键维度进行分析

DeepSeek V3与R1:两大版本的不同定位

DeepSeek发布了两个主要版本:V3和R1。这两个版本的定位不同,分别针对不同的应用场景。

- V3模型:对标GPT4o,属于L1级别的聊天机器人,工程创新最多,性价比高。

- R1模型:对标OpenAI-o1,属于推理模型,产业影响巨大。

回顾历史,2024年7月,OpenAI用五级能力体系定义AGI(通用人工智能),其中:

- L1:聊天机器人,如ChatGPT、GPT4o等。

- L2:推理者,如o1、o3。

- L3:代理型智能体,如Operator。

- L4:创新者,能提出人类未想到的科研与产业创新方案。

- L5:组织者,一组AI形成有效协同的生产力组织。

DeepSeek V3:低成本的基础模型

DeepSeek-V3是一个MoE(Mixture-of-Experts)语言模型,总参数量为671B,每个Token激活的参数量为37B。为了实现高效训练与推理,DeepSeek-V3延续了DeepSeek-V2的MLA(Multi-head Latent Attention)及DeepSeekMoE架构,并引入了无需辅助损失的负载均衡策略和多Token预测训练目标以节省计算量。

低成本是DeepSeek-V3的最大亮点

DeepSeek V3的训练数据量达到了14.8万亿个Token,而训练成本仅为557.6万美元,远低于行业平均水平(Gemini为1.98亿美元)。具体来说,总共训练了2788K H800小时,按照每小时2美元的成本,总成本大约为560万美元。

技术优化点

1. 改造FFN:DeepSeekMoE + 动态路由

- MoE通过将大模型分拆成多个小的专家模型,每次处理Token时不需要全部参数被激活,从而减少计算量。

- DeepSeekMoE通过细粒度专家细分和共享专家隔离来提高专业知识获取,降低知识冗余。

2. 改造注意力模块:MLA(多头潜在注意力)

- MLA通过低秩压缩技术,将Q、K、V矩阵压缩到低维空间,显著减少了显存占用。

- 这一方法解决了传统MHA中KV Cache占用空间巨大的问题,同时保持了性能。

3. 分布式训练集群的深度优化

- DeepSeek V3在包含2048个H800 GPU的集群上训练,节点间通过IB网络互联。

- 集群利用率超出LLaMA 10个百分点,达到了34.7%。

4. 多Token预测与FP8混合精度

- 多Token预测减少了下一侧预测的计算量。

- FP8混合精度降低了计算量,提高了效率。

DeepSeek R1:迈向更强推理能力的模型

DeepSeek-R1对标OpenAI o1,专注于提升推理能力。前OpenAI首席科学家Ilya曾提到,预训练时代可能即将结束,因为数据增长放缓。因此,AI产业的发展目标转向强化学习和推理。

小编建议,DeepSeek V3和R1通过一系列技术创新,在资源有限的情况下实现了最佳性价比,为业内提供了宝贵的工程实践方案。

举报
关注公众号“多特资源号”
内容来源于网络,不代表本站观点,侵删
热搜资讯