DeepSeek V4
DeepSeek-V4 是深度求索(DeepSeek)于 2026 年 4 月 24 日正式发布的开源旗舰模型,约 1 万亿参数 MoE 架构 + 100 万 token 长上下文 + CSA/HCA 混合注意力机制。在 Agent 能力、世界知识和推理性能三个核心维度达到开源最高水准,部分指标已比肩 Gemini 3.1 Pro、Claude Opus 4.6。
一、公司速览
深度求索
- 公司全称:深度求索人工智能科技有限公司(DeepSeek AI)
- 成立时间:2023 年 7 月
- 总部:杭州
- 创始人:梁文锋(量化基金幻方量化创始人)
- 官网:deepseek.com
- 定位:通用人工智能公司,以”极致效率 + 开源”为差异化能力
核心方向
- DeepSeek 系列自研大模型
- 差异化:从 V3 开始就是”开源 + 极致低成本”
- 产品形态:API + 聊天产品 + 开源权重
二、产品矩阵
模型层
| 模型 | 发布时间 | 定位 |
|---|---|---|
| DeepSeek-V4 系列 | 2026-04-24 | 最新旗舰开源 |
| DeepSeek-V3.2 | 2025 末 | 上一代旗舰 |
| DeepSeek-V3 | 2024 末 | 第三代 |
| DeepSeek-R1 | 2025 初 | 推理专精模型 |
| DeepSeek-Coder | 持续 | 编程专精模型 |
产品层
| 产品 | 定位 |
|---|---|
| DeepSeek Chat | C 端对话产品 |
| DeepSeek API | 极低价格 API |
| 开源权重 | Hugging Face / GitHub |
三、DeepSeek-V4 核心特性
3.1 模型规模
- 约 1 万亿参数 MoE 架构(实际根据 Pro/Max/Flash 子版本不同)
- 比 V3.2 显著扩展
- MIT 协议完全开源 来源
3.2 长上下文
- 100 万 token(1M)超长上下文窗口
- 通过 CSA(Compressed Sparse Attention) + HCA(Hierarchical Compressed Attention) 混合注意力机制实现 来源
- 推理 FLOPs 和 KV cache 大小相比 V3.2 显著优化
3.3 混合注意力架构
V4 的核心创新是 CSA + HCA 混合注意力:
- CSA(Compressed Sparse Attention):局部稀疏注意力,处理近距离 token
- HCA(Hierarchical Compressed Attention):分层压缩注意力,处理远距离 token
- 两者优势叠加:长上下文效率革命性提升来源
3.4 工程代号
V4 发布前曾以工程代号 “MODEL1” 出现在 Flash 推理框架的测试日志里,引发社区猜测 来源。
3.5 双版本:V4-Pro 与 V4-Flash
- V4-Pro:1.6T 总参数 / 49B 激活,性能比肩顶级闭源模型
- V4-Flash:285B 总参数 / 13B 激活的经济版,API 模型名 deepseek-v4-flash;上下文同为 1M,支持非思考 / 思考模式(reasoning_effort:high / max)
- Flash 官方定价:输入(缓存命中)0.02 元 / 百万 tokens,输入(缓存未命中)1 元 / 百万 tokens——约为 V4-Pro 标准价 12 元的 1/12,按量付费、无包月 官方价格页
四、能力评测
4.1 三大核心维度
| 维度 | DeepSeek-V4 | 对比对象 |
|---|---|---|
| Agent 能力 | 开源最高 | 部分指标比肩 Gemini 3.1 Pro / Claude Opus 4.6 来源 |
| 世界知识 | 开源最高 | 同上 |
| 推理性能 | 开源最高 | 同上 |
4.2 与闭源旗舰对比
V4 在多个核心指标上比肩(不是超过,是比肩)海外闭源旗舰:
- Gemini 3.1 Pro(Google)
- Claude Opus 4.6(Anthropic)
这意味着 V4 是开源阵营里第一个能与最顶级闭源模型正面竞争的模型之一来源。
4.3 评测意义
百万 token 上下文是开源模型的分水岭——之前只有闭源模型能做到。V4 把这个能力下放到开源,且效率革命性提升,是开源生态的重要节点 来源。
五、技术亮点
5.1 架构继承
V4 继承 V3 的多项设计:
- MLA(Multi-head Latent Attention):减少 KV cache
- **MoE 路由策略
- FP8 训练:降低训练成本
5.2 V4 新增
| 新增 | 作用 |
|---|---|
| CSA 局部稀疏注意力 | 近距离 token 高效处理 |
| HCA 分层压缩注意力 | 远距离 token 高效处理 |
| 百万级上下文原生支持 | 不靠位置编码外推 |
| KV cache 进一步压缩 | 降低推理显存占用 |
六、商业策略
6.1 价格
DeepSeek 一贯的极致低价路线:
- V3 时代 API 价格就比 OpenAI 低一个数量级
- V4 延续这个路线
- 具体定价需查官方最新公告
6.2 开源策略
- MIT 协议完全开源 来源
- 权重在 Hugging Face 开放
- 支持本地部署、二次训练、商用
6.3 对行业的影响
V4 发布再次证明了 “中国开源大模型可以比肩海外顶级闭源”——这是整个开源生态的胜利 来源。
七、国内大模型横向对标
| 模型 | 公司 | 上下文 | 开源 | Agent 能力 | 编程能力 | 长上下文效率 |
|---|---|---|---|---|---|---|
| DeepSeek V4 | 深度求索 | 1M | ✅ MIT | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐(CSA/HCA) |
| Kimi K3 | 月之暗面 | 4M | ✅ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐(KDA) |
| M3 | MiniMax | 1M | ✅ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐(MSA) |
| GLM-5.3 | 智谱 | 中长 | ✅ MIT | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ |
DeepSeek V4 的独特卖点:
- MIT 协议最自由
- 极致低价路线
- CSA/HCA 混合注意力
- 效率革命性提升
八、适合什么样的使用者
推荐用 DeepSeek V4 的场景
- ✅ 本地私有部署:MIT 协议宽松
- ✅ 成本敏感应用:API 价格仍是开源阵营最低之一
- ✅ 长文档分析:百万级上下文原生支持
- ✅ 需要二次训练:MIT 协议允许
- ✅ 效率敏感场景:CSA/HCA 让推理更快
不太推荐用 DeepSeek V4 的场景
- ❌ 顶级前端编程:Kimi K3 在 Frontend Arena 上领先
- ❌ 超长上下文:Kimi K3 的 4M 更大
- ❌ 多模态需求:V4 主打文本,多模态能力不如 M3 / GLM-5.3
九、常见问题
Q1:DeepSeek-V4 和 V3.2 怎么选?
- V4 是当前最强版本
- V3.2 在 V4 发布后逐渐成为”上代”
- 全新项目推荐 V4
Q2:CSA/HCA 是什么意思?
- CSA(Compressed Sparse Attention):局部稀疏注意力,处理近距离 token 关系
- HCA(Hierarchical Compressed Attention):分层压缩注意力,处理远距离 token 关系
- 两者混合实现百万级上下文高效推理
Q3:DeepSeek 价格为什么这么低?
- 早期用量化基金的高利润做补贴
- 工程效率极高(V3 训练成本仅 558 万美元)
- V4 延续”用技术降本”路线
- 不靠涨价获取超额利润
Q4:DeepSeek V4 安全吗?
- 完全开源可审查
- 与 OpenAI、Anthropic 闭源不同,权重可下载检查
- 但生成内容仍可能有偏见或错误,需要应用层防护
十、延伸阅读
- DeepSeek-V4 论文
- DeepSeek-V4 架构深度解析
- 腾讯云开发者 V4 分析
- 观察者网 V4 发布报道
- Hugging Face 权重集合
- Quasar Alpha - DeepSeek 也有匿名马甲记录
十一、一句话总结
DeepSeek V4 是 2026 年开源大模型”长上下文 + 极致效率”维度的标杆——1T MoE + 百万级上下文 + CSA/HCA 混合注意力 + MIT 协议 + 极低价格,再次证明了”中国开源可以比肩海外顶级闭源”。如果你的项目需要本地私有化、成本敏感、长文档处理,DeepSeek V4 是当前最值得认真考虑的选项。
十二、V4.1 Flash(2026-09-10 前后正式发布)
2026-09-09 DeepSeek 开放平台发布官方通知:计划于北京时间 9 月 10 日前后正式发布 V4.1 Flash;9 月 8 日起中间版本限时内测(模型 ID:deepseek-v4.1-flash-expires-on-0910,9 月 10 日下线),内测期计费暂与 V4 Flash 相同。
- 官方口径:经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时各项指标上全面超越 V4 Pro;采用全新模型结构,原生多模态支持
- 过渡方案:V4.1 Flash 正式上线后、V4.1 Pro 上线前,对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费
- Flash 系列新价格(9 月 10 日 12:00 起):空闲时段缓存命中输入 0.02 元 / 百万 tokens、缓存未命中输入 1 元 / 百万 tokens、输出 4 元 / 百万 tokens;高峰时段各项为空闲时段的 2 倍 来源(IT之家)
正式发布(2026-09-10 12:00):官方模型 ID 定为 deepseek-flash,调用最新 V4.1 Flash 即用此名(官方发布公告、官方更新日志)。旧模型 V4 Flash 与 V4 Flash Vision Exp 已下线,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 出于兼容被暂时路由到 V4.1 Flash,未来将废弃。
- 模型定位:全新模型结构系列中尺寸最小的一款,具备原生多模态视觉理解;设计目标为能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型
- 官方基准(更新日志 09-10):GPQA Diamond 90.9、Terminal-Bench 2.1 90.6(V4 Pro 为 87.9)、HLE 带工具 63.9(Pro 60.0)、NL2Repo-Bench 65.4(Pro 61.5)、DeepSWE v1.1 74.2、CyberGym 88.1 等多项反超上代 V4 Pro
- V4 Pro 下线安排:北京时间 2026-09-14 12:00 之后至 V4.1 Pro 上线前,
deepseek-v4-pro请求全部路由到 V4.1 Flash 并按 Flash 单价计费;官方同步开放「V4 Pro vs V4.1 Flash」对比测试反馈通道 - 规格与价格:上下文 1M、最大输出 384K、并发 2500;价格见官方模型与价格页
第三方实测(2026-09-10 前后,两家独立评测)
- 虎嗅实测:14 组任务、累计 3 亿 token——原生多模态是最大进步(同图解释从旧版约 200 秒缩短到约 5.7 秒);重任务因模型自行开多 Agent(单题最多 37 个子 Agent)导致总花费反增约 36%,轻任务反而更省约 45%;长上下文一致性仍弱(同一报告数字前后矛盾)
- 网易智能实测:3 套可运行应用——代码生成速度约为旧版的 3-4 成用时;旧 V4 两题出现 bug(游戏画面上下颠倒、小店订单查询失败),V4.1 三题全过
- 使用建议:重任务明确约束模型自行开多 Agent 的倾向;长文档/长报告任务注意核对前后数字一致性