截至 2026年7月23日,DeepSeek 官方 Hugging Face 账号共有 101 个公开模型仓库,可归入 18 个模型系列、19 个官方 Collection。其中既包括独立基础模型,也包括 Base/Chat/Instruct/RL 等不同检查点、日期升级版、蒸馏模型、领域专家模型和推测解码草稿模型。(Hugging Face)
这里的“文件大小”按以下口径整理:
- 精确值:官方 Hugging Face 仓库目前显示的权重文件总量。
- 约值:根据公开参数量和权重精度估算,不包括第三方 GGUF、AWQ、GPTQ 等量化版本。
- BF16/FP16 通常约为 2字节/参数,FP8约为 1字节/参数,4bit约为 0.5字节/参数,实际还会有量化比例因子、索引和配置文件。
- 对 MoE 模型,磁盘空间取决于总参数量;“激活参数量”主要反映每生成一个 Token 实际参与计算的参数量。
严格从许可证角度说,以下更准确地称为“官方开放权重模型”:不同系列许可证并不完全相同,例如 V4 采用 MIT License,而部分早期或多模态模型采用 DeepSeek Model License。(Hugging Face)
-576x1024.jpg)
一、主要模型系列概要
| 系列 | 官方模型数量 | 参数规模 | 原始权重文件大小 | 主要用途 |
|---|---|---|---|---|
| DeepSeek-V4 | 6 | Flash:284B总参数、13B激活;Pro:1.6T总参数、49B激活 | Flash:160GB;Flash-Base:295GB;Flash-DSpark:167GB;Pro:865GB;Pro-Base约1.6TB;Pro-DSpark约890GB | 最新通用语言、推理、编程和超长上下文模型,支持1M上下文 |
| DeepSeek-V3.2 | 4 | 671B总参数、约37B激活 | 每个约685GB | V3系列最新稳定版、长思考和高强度推理 |
| DeepSeek-V3.1 | 3 | 671B总参数、约37B激活 | 每个约685GB | 混合思考、工具使用、Agent任务 |
| DeepSeek-V3 | 3 | 671B总参数、37B激活 | 每个约685GB | 通用大模型、代码和数学推理 |
| DeepSeek-R1 | 10 | 完整版671B/37B激活;蒸馏版1.5B~70B | 完整版约685GB;蒸馏版约3~141GB | 强化学习推理、数学、代码和复杂问题求解 |
| DeepSeek-Math | 4 | Math-V2约671B;早期版本7B | Math-V2约685GB;7B约14GB | 数学推理与形式化解题 |
| DeepSeek-Prover | 6 | 671B及7B | 671B约685GB;7B约14GB | Lean定理证明、形式化数学 |
| DeepSeek-V2/V2.5 | 7 | 主模型236B总参数、21B激活;Lite约16B | 主模型约470~480GB;Lite约32GB | 通用对话、编程和MoE研究 |
| DeepSeek-Coder-V2 | 5 | 236B/21B激活;Lite约16B | 约472GB;Lite约32GB | 代码生成、补全、修复和仓库级理解 |
| DeepSeek-OCR | 2 | 约3B | 每个约6GB | 文档、图像文字、版面和视觉Token压缩 |
| DeepSeek-VL2 | 3 | 3B/16B/27B总参数;激活约1B/2.8B/4.5B | 约6GB/32GB/54GB | 图像理解、图表、OCR和视觉问答 |
| Janus | 4 | 1B、1.3B、7B级 | 约2~4GB或14GB | 统一多模态理解和图像生成 |
| DeepSeek-VL | 4 | 1.3B、7B | 约4GB、14GB | 第一代视觉语言模型 |
| DeepSeek-Coder v1 | 9 | 1.3B~33B | 约2.6~66GB | 代码基础模型和指令模型 |
| DeepSeek-LLM | 4 | 7B、67B | 约14GB、134GB | DeepSeek第一代通用语言模型 |
| DeepSeek-MoE | 2 | 16B级MoE | 约32GB | 早期稀疏专家模型研究 |
| ESFT | 13 | 完整Lite模型16B;专家切片约0.9B~2B | 约32GB;专家切片约1.8~4GB | 专家专项微调实验 |
| DeepSpec | 12 | 草稿模型约0.9B~3B | 约1.8~6GB | 推测解码加速,不是独立通用聊天模型 |
V4 的参数和精度较特殊:Base版本主要采用FP8;Instruct版本采用专家参数FP4、其他主要参数FP8的混合格式,因此1.6T参数的V4-Pro正式版本权重只有约865GB,而不是3.2TB。(Hugging Face)
V3、V3.1、V3.2、R1、Math-V2和Prover-V2-671B均以V3系671B MoE架构为基础。官方架构通常称为 671B参数,而 Hugging Face 页面可能显示约 685B tensors;后者还可能计入共享参数、辅助模块或实际张量统计,不能简单理解为模型架构发生了变化。(Hugging Face)
二、DeepSeek-V4系列:6个模型
| 模型 | 参数量 | 激活参数 | 官方/估算文件大小 | 说明 |
|---|---|---|---|---|
| DeepSeek-V4-Pro | 1.6T | 49B | 865GB | V4旗舰指令模型,FP4+FP8混合权重 |
| DeepSeek-V4-Pro-Base | 1.6T | 49B | 约1.6TB | 基础预训练版本,主要为FP8 |
| DeepSeek-V4-Pro-DSpark | 1.6T主体 | 49B主体 | 约890GB | 在Pro上附加DSpark推测解码模块 |
| DeepSeek-V4-Flash | 284B | 13B | 160GB | 较小、较快的V4指令模型 |
| DeepSeek-V4-Flash-Base | 284B | 13B | 295GB | Flash基础预训练版本,主要为FP8 |
| DeepSeek-V4-Flash-DSpark | 284B主体 | 13B主体 | 167GB | Flash加DSpark草稿解码模块 |
两种V4模型均提供最高约 100万Token上下文长度。DSpark版本不是重新训练出的全新基础模型,而是在相应V4模型上加入推测解码相关模块,以提高生成速度。(Hugging Face)
三、V3.2、V3.1与V3系列:10个模型
DeepSeek-V3.2:4个
DeepSeek-V3.2DeepSeek-V3.2-SpecialeDeepSeek-V3.2-ExpDeepSeek-V3.2-Exp-Base
这些模型均为约 671B总参数、37B激活参数 的MoE模型,官方原始权重仓库通常约 685GB。其中 Speciale 偏向高强度推理,Exp系列用于验证稀疏注意力等新机制。(Hugging Face)
DeepSeek-V3.1:3个
DeepSeek-V3.1DeepSeek-V3.1-BaseDeepSeek-V3.1-Terminus
均约 671B总参数、37B激活参数、685GB原始权重。Terminus是V3.1后续修订检查点,重点改善语言一致性、工具调用和Agent能力。(Hugging Face)
DeepSeek-V3:3个
DeepSeek-V3DeepSeek-V3-BaseDeepSeek-V3-0324
均约 671B总参数、37B激活参数、685GB FP8权重。V3-0324是2025年3月发布的升级检查点。(Hugging Face)
四、DeepSeek-R1系列:10个模型
| 模型 | 参数量 | 原始文件大小约值 | 适合的部署级别 |
|---|---|---|---|
| DeepSeek-R1 | 671B,约37B激活 | 685GB | 多机多卡 |
| DeepSeek-R1-Zero | 671B,约37B激活 | 685GB | 研究用途、多机多卡 |
| DeepSeek-R1-0528 | 671B,约37B激活 | 685GB | 多机多卡 |
| DeepSeek-R1-Distill-Qwen-1.5B | 1.5B | 约3~4GB | CPU、手机或边缘设备实验 |
| DeepSeek-R1-Distill-Qwen-7B | 7B | 约15GB | 单张16~24GB显卡 |
| DeepSeek-R1-Distill-Llama-8B | 8B | 约16GB | 单张24GB显卡 |
| DeepSeek-R1-Distill-Qwen-14B | 14B | 约29~30GB | 32~48GB显存 |
| DeepSeek-R1-Distill-Qwen-32B | 32B | 约65~66GB | 80GB显卡或多卡 |
| DeepSeek-R1-Distill-Llama-70B | 70B | 约140~141GB | 多张高端GPU |
| DeepSeek-R1-0528-Qwen3-8B | 8B | 约16GB | 单张24GB显卡 |
其中 R1-Zero 是主要依靠强化学习、几乎不经过传统监督微调的实验版本;R1是加入冷启动数据和多阶段训练后的正式模型;0528是后续推理能力升级版本。蒸馏模型虽然带有“R1”名称,但其底层架构分别来自Qwen或Llama,并不是把671B MoE模型直接裁剪成小模型。(Hugging Face)
五、数学和形式化证明模型:10个
DeepSeek-Math:4个
| 模型 | 参数量 | 文件大小约值 |
|---|---|---|
DeepSeek-Math-V2 | 约671B/37B激活 | 约685GB |
deepseek-math-7b-base | 7B | 约14GB |
deepseek-math-7b-instruct | 7B | 约14GB |
deepseek-math-7b-rl | 7B | 约14GB |
Math-V2建立在V3系大模型之上,重点提升可验证数学推理;早期7B系列分别对应基础、指令微调和强化学习版本。(Hugging Face)
DeepSeek-Prover:6个
| 模型 | 参数量 | 文件大小约值 |
|---|---|---|
DeepSeek-Prover-V2-671B | 671B/37B激活 | 约685GB |
DeepSeek-Prover-V2-7B | 7B | 约14GB |
DeepSeek-Prover-V1.5-Base | 7B | 约14GB |
DeepSeek-Prover-V1.5-SFT | 7B | 约14GB |
DeepSeek-Prover-V1.5-RL | 7B | 约14GB |
DeepSeek-Prover-V1 | 7B | 约14GB |
这组模型主要用于将自然语言数学问题转换成Lean形式化证明,并自动搜索和验证证明过程。(Hugging Face)
六、DeepSeek-V2、V2.5和Coder-V2:12个
DeepSeek-V2/V2.5:7个
DeepSeek-V2DeepSeek-V2-ChatDeepSeek-V2-Chat-0628DeepSeek-V2-LiteDeepSeek-V2-Lite-ChatDeepSeek-V2.5DeepSeek-V2.5-1210
V2和V2.5主体约为 236B总参数、21B激活参数。原始BF16权重理论上约472GB,实际完整仓库通常约 470~480GB。Lite版本约16B,BF16文件约 32GB。V2.5是V2通用能力和Coder能力的融合升级版。(Hugging Face)
DeepSeek-Coder-V2:5个
DeepSeek-Coder-V2-BaseDeepSeek-Coder-V2-InstructDeepSeek-Coder-V2-Instruct-0724DeepSeek-Coder-V2-Lite-BaseDeepSeek-Coder-V2-Lite-Instruct
完整版约 236B总参数、21B激活参数、470~480GB BF16文件;Lite版约 16B、32GB。主要用于代码生成、代码补全、调试、数学和仓库级代码理解。(Hugging Face)
七、多模态和OCR模型:13个
DeepSeek-OCR:2个
DeepSeek-OCRDeepSeek-OCR-2
OCR-2公开参数规模约 3B,BF16原始文件约 6GB;第一代OCR也处于相近量级。这一系列不仅识别文字,还将高分辨率文档压缩为较少的视觉Token,以降低长文档处理成本。(Hugging Face)
DeepSeek-VL2:3个
| 模型 | 总参数 | 每Token激活参数 | 文件大小约值 |
|---|---|---|---|
deepseek-vl2-tiny | 约3B | 约1.0B | 约6GB |
deepseek-vl2-small | 约16B | 约2.8B | 约32GB |
deepseek-vl2 | 约27B | 约4.5B | 约54GB |
VL2采用MoE语言模型与视觉编码器组合,适合图像问答、OCR、图表、网页截图和多图理解。(Hugging Face)
DeepSeek-VL第一代:4个
deepseek-vl-1.3b-basedeepseek-vl-1.3b-chatdeepseek-vl-7b-basedeepseek-vl-7b-chat
1.3B型号因为还包括视觉编码器和投影层,整个仓库的张量规模接近2B,BF16文件约 4GB;7B型号约 14GB。(Hugging Face)
Janus:4个
| 模型 | 参数量 | 文件大小约值 |
|---|---|---|
Janus-1.3B | 1.3B语言主体,完整仓库约2B级 | 约4GB |
JanusFlow-1.3B | 1.3B语言主体,完整仓库约2B级 | 约4GB |
Janus-Pro-1B | 约1B | 约2~3GB |
Janus-Pro-7B | 约7B | 约14GB |
Janus将视觉理解和图像生成放入同一框架;JanusFlow进一步探索自回归语言模型与流匹配图像生成的结合。(Hugging Face)
八、第一代语言和代码模型:15个
DeepSeek-LLM:4个
deepseek-llm-7b-base:7B,约14GBdeepseek-llm-7b-chat:7B,约14GBdeepseek-llm-67b-base:67B,约134GBdeepseek-llm-67b-chat:67B,约134GB
这是DeepSeek较早期的通用Dense语言模型系列。(Hugging Face)
DeepSeek-MoE:2个
deepseek-moe-16b-basedeepseek-moe-16b-chat
总参数约16B,原始BF16文件约 32GB。这是DeepSeek早期验证细粒度专家划分和共享专家机制的重要模型。(Hugging Face)
DeepSeek-Coder第一代:9个
| 模型 | 参数量 | 文件大小约值 |
|---|---|---|
deepseek-coder-1.3b-base | 1.3B | 约2.6GB |
deepseek-coder-1.3b-instruct | 1.3B | 约2.6GB |
deepseek-coder-5.7bmqa-base | 5.7B | 约11~12GB |
deepseek-coder-6.7b-base | 6.7B | 约13~14GB |
deepseek-coder-6.7b-instruct | 6.7B | 约13~14GB |
deepseek-coder-7b-base-v1.5 | 7B | 约14GB |
deepseek-coder-7b-instruct-v1.5 | 7B | 约14GB |
deepseek-coder-33b-base | 33B | 约66GB |
deepseek-coder-33b-instruct | 33B | 约66GB |
这些模型覆盖Python、C/C++、Java、Go等多种编程语言,Base版本适合继续预训练,Instruct版本适合自然语言编程指令。(Hugging Face)
九、ESFT领域专家模型:13个
ESFT即 Expert-Specialized Fine-Tuning,是在DeepSeek-V2-Lite专家结构上,只选择或微调特定专家的研究项目。(Hugging Face)
完整模型:
ESFT-vanilla-lite:约16B,约32GB
12个专家切片:
ESFT-gate-translation-liteESFT-token-translation-liteESFT-gate-math-liteESFT-token-math-liteESFT-gate-law-liteESFT-token-law-liteESFT-gate-code-liteESFT-token-code-liteESFT-gate-intent-liteESFT-token-intent-liteESFT-gate-summary-liteESFT-token-summary-lite
这些专家权重约为 0.9B~2B,原始文件通常约 1.8~4GB。它们不是完整通用模型,一般需要配合相应基础模型或用于ESFT实验。
十、DeepSpec推测解码模型:12个
这些模型是给Qwen3、Gemma 4等目标模型生成候选Token的“草稿模型”,主要用于提高推理速度,不应按独立DeepSeek聊天模型理解。(Hugging Face)
DSpark:4个
dspark_qwen3_4b_block7:约1B,约2GBdspark_qwen3_8b_block7:约2B,约4GBdspark_qwen3_14b_block7:约3B,约6GBdspark_gemma4_12b_block7:约3B,约6GB
DFlash:4个
dflash_qwen3_4b_block7:约1B,约2GBdflash_qwen3_8b_block7:约2B,约4GBdflash_qwen3_14b_block7:约3B,约6GBdflash_gemma4_12b_block7:约3B,约6GB
Eagle3:4个
eagle3_qwen3_4b_ttt7:约0.9B,约1.8GBeagle3_qwen3_8b_ttt7:约2B,约4GBeagle3_qwen3_14b_ttt7:约2B,约4GBeagle3_gemma4_12b_ttt7:约2B,约4GB
十一、本地部署时应如何理解这些文件大小
原始官方权重大小并不等于实际本地部署必须占用的显存。例如:
| 参数规模 | BF16原始权重 | 8bit量化约值 | 4bit量化约值 | 常见部署方式 |
|---|---|---|---|---|
| 1.5B | 3GB | 1.5~2GB | 0.9~1.2GB | CPU、手机、边缘设备 |
| 7B | 14GB | 7~8GB | 4~5GB | 8GB显存可尝试,12GB更稳妥 |
| 14B | 28~30GB | 15~17GB | 8~10GB | 12~16GB显存 |
| 32B | 64~66GB | 34~38GB | 18~22GB | 24GB显卡 |
| 67~70B | 134~141GB | 72~80GB | 38~48GB | 48GB显存或多卡 |
| 236B MoE | 约472GB | 约240GB | 约125~145GB | 多卡服务器 |
| 671B MoE | 约685GB FP8 | — | 常见量化约350~450GB | 多节点或大型服务器 |
| V4-Pro 1.6T | 865GB混合FP4/FP8 | — | 已部分采用FP4 | 大型多节点集群 |
还必须为 KV Cache、推理框架、激活张量和系统缓存预留空间。特别是长上下文模型,上下文从几千Token增加到几十万甚至100万Token后,KV Cache可能比模型权重本身更早成为显存瓶颈。
总结
DeepSeek目前的开放权重体系已经从早期的 7B/67B Dense模型,发展到:
- V4-Pro:1.6T总参数、49B激活、865GB权重
- V4-Flash:284B总参数、13B激活、160GB权重
- V3/R1系列:671B总参数、37B激活、约685GB权重
- V2系列:236B总参数、21B激活、约472GB权重
- 1.5B~70B的R1蒸馏模型
- 覆盖代码、数学、定理证明、OCR、视觉理解、图像生成、领域专家和推测解码的完整模型矩阵
从一般个人或企业本地部署角度看,最具实际可操作性的仍是 R1蒸馏1.5B~32B、Coder 7B/33B、Math 7B、VL2-Tiny以及Janus-Pro-7B;V3、R1完整版和V4则主要面向多卡服务器或数据中心集群。