DeepSeek V4 Flash 正式版已上线

探索未至之境
深度求索

以极致性价比与前沿推理能力,重塑全球 AI 开发者的调用版图。从开源模型到全链路 Agent 解决方案,深度求索持续推动人工智能的边界。

OpenRouter 实时调用数据 全球第一
周调用量
7.22T
Token / 周
缓存命中折扣
98%
行业普遍 90%
输出价格
¥2
每百万 Token
激活参数
130亿
MoE 架构
V4 Flash V4 Pro Harness 开源权重
7.22T
周调用 Token 量
98%
缓存命中折扣
2840亿
总参数规模
130亿
激活参数
#1
OpenRouter 调用榜

为开发者而生的推理引擎

从架构优化到后训练策略,DeepSeek 以工程创新重新定义大模型的性价比边界。

极致性价比

V4 Flash 正式版以 2840 亿总参数、130 亿激活参数的 MoE 架构,在典型 Agent 任务中单任务成本比同级模型低约 60%。98% 的缓存命中折扣进一步压缩实际使用成本。

🧠

后训练突破

与预览版参数规模完全一致,全部能力提升源自后训练阶段的策略优化。在涵盖代码工程、终端操作、全栈开发的 9 项 Agent 基准测试中全面超越大六倍的上一代模型。

🔧

Harness 全链路

Model + Harness = Agent。深度求索正在将前沿模型能力转化为领先的 Agent 产品,覆盖从模型本身到工程化能力的完整工作流。

🇨🇳

国产算力协同

V4 系列从设计阶段即与国产芯片深度适配,“芯模协同”模式让模型与芯片团队在研发早期即协同工作,推动自主可控的 AI 软硬件生态成熟。

📊

全球调用登顶

V4 Flash 以 7.22 万亿 Token 周调用量登顶 OpenRouter 全球榜首,中国模型周调用量连续十四周超过美国,全球开发者用真实调用投票。

🔓

开源开放

持续开源模型权重,秉持长期主义原则,与全球开发者社区共同推进 AI 技术边界。从 V3 到 V4,开源始终是深度求索的核心承诺。

MoE 混合专家与芯模协同

从底层架构到芯片适配,深度求索构建了完整的自主技术栈。

更少的激活,更强的性能

V4 Flash 采用混合专家架构,总参数 2840 亿,每次推理仅激活 130 亿参数。这种设计在保持知识容量的同时,将推理成本压缩到极致。

与华为昇腾的“芯模协同”合作,让模型从设计阶段即与国产芯片深度适配。芯片与模型在研发早期协同工作,实现从底层到应用的全链路优化。

2840 亿总参数 · 130 亿激活参数 · 98% 缓存折扣 · 国产芯片原生适配

┌─ 输入层 ─────────────────────┐
│ Tokenizer → Embedding │
├─ MoE 专家层 (2840亿总参) ────┤
激活专家: 130亿参数
路由: Top-K 稀疏激活
├─ 推理加速层 ─────────────────┤
缓存命中率: 98%
国产芯片原生适配
└─ 输出层 ─────────────────────┘

探索未至之境:深度求索的技术哲学与产业实践

“探索未至之境”不仅是深度求索的品牌宣言,更是这家中国 AI 公司从创立之初便践行的技术信条。2026 年,当全球大模型竞争进入白热化阶段,深度求索以一系列工程创新与架构突破,向业界展示了另一条通往通用人工智能的路径——不盲目堆砌参数,而是在效率与能力的交汇点上寻找最优解。

后训练:效率优先的新范式

2026 年 7 月 31 日,DeepSeek V4 Flash 正式版上线。令开发者社区意外的是,这款模型的参数规模与四月的预览版完全一致,却在九项 Agent 基准测试中全面超越了总参数量近六倍的 V4 Pro 预览版。这一结果传递出一个清晰的信号:大模型的能力增长正在从参数规模扩张转向训练策略优化

V4 Flash 采用混合专家架构,总参数 2840 亿,但每次推理仅激活 130 亿参数。这种设计在保持知识容量的同时,将推理成本压缩到了极致。更关键的是,DeepSeek 在正式版的训练中加大了智能体与工具使用方向的专家训练力度,并采用了自研的 Harness 极简模式进行基准测试。这意味着,模型能力的跃升并非来自更大的算力集群,而是来自对训练数据的精准利用和对推理路径的深度优化。

性价比的临界点

在全球开发者社区,DeepSeek 的定价策略引发了连锁反应。V4 Flash 的官方定价为每百万 Token 输入 1 元、输出 2 元,配合 98% 的缓存命中折扣,实际使用成本远低于行业平均水平。海外评测机构 Artificial Analysis 测算,在典型 Agent 任务中,V4 Flash 的单任务成本比竞品低约 60%。

这种性价比并非以牺牲性能为代价。官方跑分数据显示,V4 Flash 在多项基准测试中超过 GLM 5.2,与 Claude Opus 4.8 的差距也在显著缩小。用更少的计算资源实现更强的性能,这正是深度求索“探索未至之境”的题中之义——在算力约束的边界上,用工程智慧开辟新的可能性。

国产算力的协同进化

2026 年 5 月,DeepSeek V4 发布时,官方技术报告将华为昇腾与英伟达并列写入硬件验证清单。这一细节被路透社解读为“从依赖美国半导体转向更多采用中国本土 AI 设备”的战略转向。更值得关注的是双方的合作深度:华为方面表示,通过“芯模协同”技术,昇腾超节点全系列产品实现了对 V4 的支持。

所谓“芯模协同”,意味着芯片与模型在研发早期阶段就开始协同工作——模型可以基于芯片架构来设计,芯片厂商也能针对模型需求进行针对性优化。这种模式被专家比作汽车行业的“原厂设计”,比通常的“0 Day 适配”更加提前和深入。在外部技术封锁持续收紧的背景下,这种从底层构建自主生态的能力,成为中国 AI 产业穿越周期的关键底气。

Harness:从模型到 Agent 的桥梁

2026 年 8 月,DeepSeek Harness 团队微信公众号完成注册,头像是一头“黑色鲸鱼”。这个细节在技术圈引发了广泛讨论。根据官方招聘信息,Harness 团队的公式是:Model + Harness = Agent。“除模型本身以外的所有工作,都属于 Harness 的范畴。”

Harness 的本质是让模型真正“跑起来”的工程化能力。2026 年,Harness 直接带动了 Vibe Coding 成为自“GPT 时刻”以来首个成功商业化的杀手级应用。DeepSeek 组建独立团队推进 Harness,标志着其从单一的基础模型供给者向全链路 AI 工作流解决方案构建者的转型。有参与内测的开发者评价“愿意称其为宇宙最强”,虽然具体细节尚未公开,但方向已经清晰。

开源与长期主义

在商业化与开源之间的张力中,深度求索选择了一条独特的路线。公司高层向投资者明确表示,将继续把资源投入 AI 基础研究与开源大模型开发,以实现通用人工智能为长期目标。从 V3 到 V4,从 R1 到 V4 Flash,开源始终是深度求索与全球开发者社区建立信任的基石。

截至 2026 年 8 月,中国模型在 OpenRouter 周度调用量前五名中占据全部席位,DeepSeek 独占两席。这不是一次短暂的流量脉冲,而是全球开发者用真金白银的 Token 调用做出的选择。当“别打广告了,我们希望得到 DeepSeek 的价格”这样的评论出现在竞争对手的社交账号下时,市场已经给出了答案。

未至之境,仍在探索

DeepSeek 的故事远未结束。第二融资谈判的波折、Harness 内测的期待、国产芯片的深度适配、海外市场的合规挑战——每一个议题都考验着这家公司的战略定力。但有一点可以确定:在算力与算法的交汇处,在开源与商业的平衡中,深度求索正在书写一条不同于硅谷的 AI 发展路径。

“探索未至之境”从来不是一句空洞的口号。它意味着在别人堆参数的时候优化架构,在别人追逐热点的时候深耕工程,在别人筑墙的时候选择开源。这条路或许更慢,但每一步都踩得更实。深度求索正在用行动证明,中国 AI 公司不仅能够跟随,更能够定义属于自己的技术范式。

获取 DeepSeek 客户端

支持 Windows / macOS / Linux,随时随地体验前沿推理能力。

立即下载
当前版本 V4.1 · 大小约 128MB

热门搜索