截止到现在,Deepseek所开源的所有模型的概要信息,包括模型参数量、模型文件大小等

截至 2026年7月23日,DeepSeek 官方 Hugging Face 账号共有 101 个公开模型仓库,可归入 18 个模型系列、19 个官方 Collection。其中既包括独立基础模型,也包括 Base/Chat/Instruct/RL 等不同检查点、日期升级版、蒸馏模型、领域专家模型和推测解码草稿模型。(Hugging Face)

这里的“文件大小”按以下口径整理:

  • 精确值:官方 Hugging Face 仓库目前显示的权重文件总量。
  • 约值:根据公开参数量和权重精度估算,不包括第三方 GGUF、AWQ、GPTQ 等量化版本。
  • BF16/FP16 通常约为 2字节/参数,FP8约为 1字节/参数,4bit约为 0.5字节/参数,实际还会有量化比例因子、索引和配置文件。
  • 对 MoE 模型,磁盘空间取决于总参数量;“激活参数量”主要反映每生成一个 Token 实际参与计算的参数量。

严格从许可证角度说,以下更准确地称为“官方开放权重模型”:不同系列许可证并不完全相同,例如 V4 采用 MIT License,而部分早期或多模态模型采用 DeepSeek Model License。(Hugging Face)

Deepseek开源模型全景(截止2026年7月)

一、主要模型系列概要

系列官方模型数量参数规模原始权重文件大小主要用途
DeepSeek-V46Flash:284B总参数、13B激活;Pro:1.6T总参数、49B激活Flash:160GB;Flash-Base:295GB;Flash-DSpark:167GB;Pro:865GB;Pro-Base约1.6TB;Pro-DSpark约890GB最新通用语言、推理、编程和超长上下文模型,支持1M上下文
DeepSeek-V3.24671B总参数、约37B激活每个约685GBV3系列最新稳定版、长思考和高强度推理
DeepSeek-V3.13671B总参数、约37B激活每个约685GB混合思考、工具使用、Agent任务
DeepSeek-V33671B总参数、37B激活每个约685GB通用大模型、代码和数学推理
DeepSeek-R110完整版671B/37B激活;蒸馏版1.5B~70B完整版约685GB;蒸馏版约3~141GB强化学习推理、数学、代码和复杂问题求解
DeepSeek-Math4Math-V2约671B;早期版本7BMath-V2约685GB;7B约14GB数学推理与形式化解题
DeepSeek-Prover6671B及7B671B约685GB;7B约14GBLean定理证明、形式化数学
DeepSeek-V2/V2.57主模型236B总参数、21B激活;Lite约16B主模型约470~480GB;Lite约32GB通用对话、编程和MoE研究
DeepSeek-Coder-V25236B/21B激活;Lite约16B约472GB;Lite约32GB代码生成、补全、修复和仓库级理解
DeepSeek-OCR2约3B每个约6GB文档、图像文字、版面和视觉Token压缩
DeepSeek-VL233B/16B/27B总参数;激活约1B/2.8B/4.5B约6GB/32GB/54GB图像理解、图表、OCR和视觉问答
Janus41B、1.3B、7B级约2~4GB或14GB统一多模态理解和图像生成
DeepSeek-VL41.3B、7B约4GB、14GB第一代视觉语言模型
DeepSeek-Coder v191.3B~33B约2.6~66GB代码基础模型和指令模型
DeepSeek-LLM47B、67B约14GB、134GBDeepSeek第一代通用语言模型
DeepSeek-MoE216B级MoE约32GB早期稀疏专家模型研究
ESFT13完整Lite模型16B;专家切片约0.9B~2B约32GB;专家切片约1.8~4GB专家专项微调实验
DeepSpec12草稿模型约0.9B~3B约1.8~6GB推测解码加速,不是独立通用聊天模型

V4 的参数和精度较特殊:Base版本主要采用FP8;Instruct版本采用专家参数FP4、其他主要参数FP8的混合格式,因此1.6T参数的V4-Pro正式版本权重只有约865GB,而不是3.2TB。(Hugging Face)

V3、V3.1、V3.2、R1、Math-V2和Prover-V2-671B均以V3系671B MoE架构为基础。官方架构通常称为 671B参数,而 Hugging Face 页面可能显示约 685B tensors;后者还可能计入共享参数、辅助模块或实际张量统计,不能简单理解为模型架构发生了变化。(Hugging Face)


二、DeepSeek-V4系列:6个模型

模型参数量激活参数官方/估算文件大小说明
DeepSeek-V4-Pro1.6T49B865GBV4旗舰指令模型,FP4+FP8混合权重
DeepSeek-V4-Pro-Base1.6T49B1.6TB基础预训练版本,主要为FP8
DeepSeek-V4-Pro-DSpark1.6T主体49B主体890GB在Pro上附加DSpark推测解码模块
DeepSeek-V4-Flash284B13B160GB较小、较快的V4指令模型
DeepSeek-V4-Flash-Base284B13B295GBFlash基础预训练版本,主要为FP8
DeepSeek-V4-Flash-DSpark284B主体13B主体167GBFlash加DSpark草稿解码模块

两种V4模型均提供最高约 100万Token上下文长度。DSpark版本不是重新训练出的全新基础模型,而是在相应V4模型上加入推测解码相关模块,以提高生成速度。(Hugging Face)


三、V3.2、V3.1与V3系列:10个模型

DeepSeek-V3.2:4个
  • DeepSeek-V3.2
  • DeepSeek-V3.2-Speciale
  • DeepSeek-V3.2-Exp
  • DeepSeek-V3.2-Exp-Base

这些模型均为约 671B总参数、37B激活参数 的MoE模型,官方原始权重仓库通常约 685GB。其中 Speciale 偏向高强度推理,Exp系列用于验证稀疏注意力等新机制。(Hugging Face)

DeepSeek-V3.1:3个
  • DeepSeek-V3.1
  • DeepSeek-V3.1-Base
  • DeepSeek-V3.1-Terminus

均约 671B总参数、37B激活参数、685GB原始权重。Terminus是V3.1后续修订检查点,重点改善语言一致性、工具调用和Agent能力。(Hugging Face)

DeepSeek-V3:3个
  • DeepSeek-V3
  • DeepSeek-V3-Base
  • DeepSeek-V3-0324

均约 671B总参数、37B激活参数、685GB FP8权重。V3-0324是2025年3月发布的升级检查点。(Hugging Face)


四、DeepSeek-R1系列:10个模型

模型参数量原始文件大小约值适合的部署级别
DeepSeek-R1671B,约37B激活685GB多机多卡
DeepSeek-R1-Zero671B,约37B激活685GB研究用途、多机多卡
DeepSeek-R1-0528671B,约37B激活685GB多机多卡
DeepSeek-R1-Distill-Qwen-1.5B1.5B约3~4GBCPU、手机或边缘设备实验
DeepSeek-R1-Distill-Qwen-7B7B约15GB单张16~24GB显卡
DeepSeek-R1-Distill-Llama-8B8B约16GB单张24GB显卡
DeepSeek-R1-Distill-Qwen-14B14B约29~30GB32~48GB显存
DeepSeek-R1-Distill-Qwen-32B32B约65~66GB80GB显卡或多卡
DeepSeek-R1-Distill-Llama-70B70B约140~141GB多张高端GPU
DeepSeek-R1-0528-Qwen3-8B8B约16GB单张24GB显卡

其中 R1-Zero 是主要依靠强化学习、几乎不经过传统监督微调的实验版本;R1是加入冷启动数据和多阶段训练后的正式模型;0528是后续推理能力升级版本。蒸馏模型虽然带有“R1”名称,但其底层架构分别来自Qwen或Llama,并不是把671B MoE模型直接裁剪成小模型。(Hugging Face)


五、数学和形式化证明模型:10个

DeepSeek-Math:4个
模型参数量文件大小约值
DeepSeek-Math-V2约671B/37B激活约685GB
deepseek-math-7b-base7B约14GB
deepseek-math-7b-instruct7B约14GB
deepseek-math-7b-rl7B约14GB

Math-V2建立在V3系大模型之上,重点提升可验证数学推理;早期7B系列分别对应基础、指令微调和强化学习版本。(Hugging Face)

DeepSeek-Prover:6个
模型参数量文件大小约值
DeepSeek-Prover-V2-671B671B/37B激活约685GB
DeepSeek-Prover-V2-7B7B约14GB
DeepSeek-Prover-V1.5-Base7B约14GB
DeepSeek-Prover-V1.5-SFT7B约14GB
DeepSeek-Prover-V1.5-RL7B约14GB
DeepSeek-Prover-V17B约14GB

这组模型主要用于将自然语言数学问题转换成Lean形式化证明,并自动搜索和验证证明过程。(Hugging Face)


六、DeepSeek-V2、V2.5和Coder-V2:12个

DeepSeek-V2/V2.5:7个
  • DeepSeek-V2
  • DeepSeek-V2-Chat
  • DeepSeek-V2-Chat-0628
  • DeepSeek-V2-Lite
  • DeepSeek-V2-Lite-Chat
  • DeepSeek-V2.5
  • DeepSeek-V2.5-1210

V2和V2.5主体约为 236B总参数、21B激活参数。原始BF16权重理论上约472GB,实际完整仓库通常约 470~480GB。Lite版本约16B,BF16文件约 32GB。V2.5是V2通用能力和Coder能力的融合升级版。(Hugging Face)

DeepSeek-Coder-V2:5个
  • DeepSeek-Coder-V2-Base
  • DeepSeek-Coder-V2-Instruct
  • DeepSeek-Coder-V2-Instruct-0724
  • DeepSeek-Coder-V2-Lite-Base
  • DeepSeek-Coder-V2-Lite-Instruct

完整版约 236B总参数、21B激活参数、470~480GB BF16文件;Lite版约 16B、32GB。主要用于代码生成、代码补全、调试、数学和仓库级代码理解。(Hugging Face)


七、多模态和OCR模型:13个

DeepSeek-OCR:2个
  • DeepSeek-OCR
  • DeepSeek-OCR-2

OCR-2公开参数规模约 3B,BF16原始文件约 6GB;第一代OCR也处于相近量级。这一系列不仅识别文字,还将高分辨率文档压缩为较少的视觉Token,以降低长文档处理成本。(Hugging Face)

DeepSeek-VL2:3个
模型总参数每Token激活参数文件大小约值
deepseek-vl2-tiny约3B约1.0B约6GB
deepseek-vl2-small约16B约2.8B约32GB
deepseek-vl2约27B约4.5B约54GB

VL2采用MoE语言模型与视觉编码器组合,适合图像问答、OCR、图表、网页截图和多图理解。(Hugging Face)

DeepSeek-VL第一代:4个
  • deepseek-vl-1.3b-base
  • deepseek-vl-1.3b-chat
  • deepseek-vl-7b-base
  • deepseek-vl-7b-chat

1.3B型号因为还包括视觉编码器和投影层,整个仓库的张量规模接近2B,BF16文件约 4GB;7B型号约 14GB。(Hugging Face)

Janus:4个
模型参数量文件大小约值
Janus-1.3B1.3B语言主体,完整仓库约2B级约4GB
JanusFlow-1.3B1.3B语言主体,完整仓库约2B级约4GB
Janus-Pro-1B约1B约2~3GB
Janus-Pro-7B约7B约14GB

Janus将视觉理解和图像生成放入同一框架;JanusFlow进一步探索自回归语言模型与流匹配图像生成的结合。(Hugging Face)


八、第一代语言和代码模型:15个

DeepSeek-LLM:4个
  • deepseek-llm-7b-base:7B,约14GB
  • deepseek-llm-7b-chat:7B,约14GB
  • deepseek-llm-67b-base:67B,约134GB
  • deepseek-llm-67b-chat:67B,约134GB

这是DeepSeek较早期的通用Dense语言模型系列。(Hugging Face)

DeepSeek-MoE:2个
  • deepseek-moe-16b-base
  • deepseek-moe-16b-chat

总参数约16B,原始BF16文件约 32GB。这是DeepSeek早期验证细粒度专家划分和共享专家机制的重要模型。(Hugging Face)

DeepSeek-Coder第一代:9个
模型参数量文件大小约值
deepseek-coder-1.3b-base1.3B约2.6GB
deepseek-coder-1.3b-instruct1.3B约2.6GB
deepseek-coder-5.7bmqa-base5.7B约11~12GB
deepseek-coder-6.7b-base6.7B约13~14GB
deepseek-coder-6.7b-instruct6.7B约13~14GB
deepseek-coder-7b-base-v1.57B约14GB
deepseek-coder-7b-instruct-v1.57B约14GB
deepseek-coder-33b-base33B约66GB
deepseek-coder-33b-instruct33B约66GB

这些模型覆盖Python、C/C++、Java、Go等多种编程语言,Base版本适合继续预训练,Instruct版本适合自然语言编程指令。(Hugging Face)


九、ESFT领域专家模型:13个

ESFT即 Expert-Specialized Fine-Tuning,是在DeepSeek-V2-Lite专家结构上,只选择或微调特定专家的研究项目。(Hugging Face)

完整模型:

  • ESFT-vanilla-lite:约16B,约32GB

12个专家切片:

  • ESFT-gate-translation-lite
  • ESFT-token-translation-lite
  • ESFT-gate-math-lite
  • ESFT-token-math-lite
  • ESFT-gate-law-lite
  • ESFT-token-law-lite
  • ESFT-gate-code-lite
  • ESFT-token-code-lite
  • ESFT-gate-intent-lite
  • ESFT-token-intent-lite
  • ESFT-gate-summary-lite
  • ESFT-token-summary-lite

这些专家权重约为 0.9B~2B,原始文件通常约 1.8~4GB。它们不是完整通用模型,一般需要配合相应基础模型或用于ESFT实验。


十、DeepSpec推测解码模型:12个

这些模型是给Qwen3、Gemma 4等目标模型生成候选Token的“草稿模型”,主要用于提高推理速度,不应按独立DeepSeek聊天模型理解。(Hugging Face)

DSpark:4个
  • dspark_qwen3_4b_block7:约1B,约2GB
  • dspark_qwen3_8b_block7:约2B,约4GB
  • dspark_qwen3_14b_block7:约3B,约6GB
  • dspark_gemma4_12b_block7:约3B,约6GB
DFlash:4个
  • dflash_qwen3_4b_block7:约1B,约2GB
  • dflash_qwen3_8b_block7:约2B,约4GB
  • dflash_qwen3_14b_block7:约3B,约6GB
  • dflash_gemma4_12b_block7:约3B,约6GB
Eagle3:4个
  • eagle3_qwen3_4b_ttt7:约0.9B,约1.8GB
  • eagle3_qwen3_8b_ttt7:约2B,约4GB
  • eagle3_qwen3_14b_ttt7:约2B,约4GB
  • eagle3_gemma4_12b_ttt7:约2B,约4GB

十一、本地部署时应如何理解这些文件大小

原始官方权重大小并不等于实际本地部署必须占用的显存。例如:

参数规模BF16原始权重8bit量化约值4bit量化约值常见部署方式
1.5B3GB1.5~2GB0.9~1.2GBCPU、手机、边缘设备
7B14GB7~8GB4~5GB8GB显存可尝试,12GB更稳妥
14B28~30GB15~17GB8~10GB12~16GB显存
32B64~66GB34~38GB18~22GB24GB显卡
67~70B134~141GB72~80GB38~48GB48GB显存或多卡
236B MoE约472GB约240GB约125~145GB多卡服务器
671B MoE约685GB FP8常见量化约350~450GB多节点或大型服务器
V4-Pro 1.6T865GB混合FP4/FP8已部分采用FP4大型多节点集群

还必须为 KV Cache、推理框架、激活张量和系统缓存预留空间。特别是长上下文模型,上下文从几千Token增加到几十万甚至100万Token后,KV Cache可能比模型权重本身更早成为显存瓶颈。

总结

DeepSeek目前的开放权重体系已经从早期的 7B/67B Dense模型,发展到:

  • V4-Pro:1.6T总参数、49B激活、865GB权重
  • V4-Flash:284B总参数、13B激活、160GB权重
  • V3/R1系列:671B总参数、37B激活、约685GB权重
  • V2系列:236B总参数、21B激活、约472GB权重
  • 1.5B~70B的R1蒸馏模型
  • 覆盖代码、数学、定理证明、OCR、视觉理解、图像生成、领域专家和推测解码的完整模型矩阵

从一般个人或企业本地部署角度看,最具实际可操作性的仍是 R1蒸馏1.5B~32B、Coder 7B/33B、Math 7B、VL2-Tiny以及Janus-Pro-7B;V3、R1完整版和V4则主要面向多卡服务器或数据中心集群。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Are you human? Please solve:Captcha