7 月 31 日,DeepSeek 做了一件让整个行业侧目的事:他们把 V4 Flash 的正式版开源了(MIT 协议),而这个只激活 13B 参数(总参数里每次真正动用的部分)的模型,在第三方智能指数上拿到了 50 分——距离 OpenAI 的闭源旗舰 GPT-5.6 Luna,只差 1 分。

把这事想成一个快递站:站里有辆小电驴(Flash,13B 激活)和一辆大货车(Pro/闭源旗舰)。大货车排量大、跑得远,一直是王牌。有一天小电驴装了个新导航算法——没换发动机、没加大电池,就更新了软件——结果送餐比大货车还快。最狠的是:这个导航算法现在免费公开了,谁都能装。类比到此为止,实际差别是:大货车司机不会把自己的发动机图纸也公开,但 DeepSeek 真的把权重(模型的核心文件,拿到就能自己跑)全部放了出来。
事件

没换骨架只换训练,Flash 把自家 Pro 打趴了

DeepSeek 官方明确说了:V4 Flash 0731 的模型结构和尺寸与三个月前的预览版完全一致——总参 284B,激活 13B,1M 上下文窗口(一次能记住的文本长度)。唯一的区别是重新做了一轮后训练(模型骨架不变,只调整「怎么回答问题」的策略,类似给同一个人换了一套工作方法)

结果呢?官方公布的 9 项 Agent 基准测试,Flash 正式版全面超越定位更高的 V4-Pro 预览版。最夸张的是 DeepSWE(高难度编码):从预览版的 7.3 分跳到 54.4 分,暴涨超过 6 倍。Terminal Bench 2.1(终端操作)拿到 82.7,超过 Pro 的 72.1,甚至压过了智谱 GLM-5.2 的 81.0,距离 Claude Opus 4.8 的 85.0 只差 2.3 分。

换句话说:行业默认的「Pro 一定比 Flash 强」的分层逻辑,被 DeepSeek 自己打破了。轻量版不是低配版——它只是还没被好好训练过。

82.7
Terminal Bench 2.1
终端操作测试,超 Pro 预览版 10.6 分,距 Opus 4.8 仅差 2.3。来源:DeepSeek 官方。
54.4
DeepSWE(预览版 7.3)
高难度编码,较预览版暴涨 6 倍以上。来源:DeepSeek 官方。
70.3
Toolathlon Verified
工具调用综合测试,超 Pro 预览版 14.4 分。来源:DeepSeek 官方。
数字

距闭源天花板 1 分,价格便宜六成

第三方评测机构 Artificial Analysis 的智能指数(跨多项任务的综合能力评分,可比模型中位数约 17 分)给了 V4 Flash 0731 一个 50 分。这个数字意味着什么?

横向比:与 Google Gemini 3.6 Flash 持平(50 分),距 GPT-5.6 Luna 仅差 1 分(51 分),距当前开源第一 Kimi K3 差 7 分(57 分)。纵向比:较自家 Flash 预览版提升 10 分(40→50),较定位更高的 V4-Pro 预览版高 6 分(44→50)。这是开源模型(把模型文件公开,谁都能下载开发)历史上第一次如此接近这个量级的闭源旗舰。

性价比炸裂

价格方面:缓存命中输入 0.2 元/百万 token(AI 按字数收费的单位),未命中输入 1 元,输出 2 元。按每任务成本算,比降价后的 GPT-5.6 Luna 还便宜约 60%。OpenAI 同一天把 Luna 降了 80%,但依然贵过 DeepSeek。

模型AA 智能指数激活参数开源每任务成本
V4 Flash 07315013BMIT基准
GPT-5.6 Luna (max)51未公开+60%
Gemini 3.6 Flash50未公开
Kimi K3 (max)57未公开
V4 Pro 预览版4449B更高

数据来源:Artificial Analysis 智能指数(2026-07-31)、DeepSeek 官方定价页。每任务成本按 Artificial Analysis 口径。

DeepSeek V4 Flash 相关配图 1
相关配图 1 · 来源:111cn.net · 数据口径以原文为准
反直觉

后训练比堆参数更有效——这对谁最有利

这次发布最反直觉的一点:模型骨架完全没变。284B 总参、13B 激活、CSA+HCA 混合注意力、32T token 训练数据——全部和三个月前一样。变的只有后训练策略。

这说明什么?当前大模型的性能瓶颈,很可能不在「模型有多大」,而在「训练方法有多精细」。同样的骨架,换一套后训练策略就能实现质的飞跃——这对算力(跑模型所需的计算资源)有限的团队是巨大利好:你不需要更多 GPU,你需要更好的训练方法。

DeepSeek 官方还透露了一个信号:V4-Pro 正式版将于 8 月初上线。如果 Pro 也做同样的后训练升级,开源旗舰的天花板还会再抬一截。

为什么「只换训练」就能质变
01
骨架不变
284B/13B MoE,1M 上下文,架构与预览版一致
02
后训练重做
更精细的 RL/对齐策略,针对 Agent 场景强化
03
Agent 能力质变
9 项基准全面超 Pro,DeepSWE 6 倍提升
04
开源放出
MIT 协议,167GB 权重,谁都能下载部署
核心启示:性能瓶颈不在参数量(表示模型大小的数字),在训练方法。算力有限 ≠ 智能上限。
DeepSeek V4 Flash 相关配图 2
相关配图 2 · 来源:111cn.net · 数据口径以原文为准
格局

开源 vs 闭源的天平,正在倾斜

把视角拉远一点。2026 年上半年发生了什么?Kimi K3 火到停售、DeepSeek V4 Flash 追平闭源、GLM-5.2 紧随其后——中国开源模型正在集体逼近全球天花板。

与此同时,闭源阵营在做什么?OpenAI 同一天把 GPT-5.6 Luna 降价 80%。这不是巧合——当开源模型在智能指数上只差 1 分、价格还便宜六成的时候,闭源厂商唯一的护城河就只剩下「你不用自己部署」的便利性了。

但 MIT 协议意味着:任何团队都可以下载权重、私有化部署、按自己的需求微调(拿自家素材再训练,让它更贴合你)。对于数据敏感的企业(金融、医疗、政府),这不是「要不要省钱」的问题,是「能不能用」的问题。开源模型第一次同时满足了「够聪明」和「能私有化」两个条件。

MIT
许可协议
商用、修改、再分发均不受限。对创业团队和数据敏感企业极具吸引力。
167GB
权重文件大小
FP4/FP8 混合精度发布,含 DSpark 草稿模块。Q8 量化(压缩模型文件、让它更好跑的瘦身技术)约 110GB 内存可跑。
8 月初
V4-Pro 正式版
DeepSeek 官方透露 Pro 正式版即将上线,届时也将接入 Codex。
动手

今天就能用:谁该切、怎么切

V4 Flash 0731 已经上线 DeepSeek 第一方 API,Ollama 也同步上架(ollama run deepseek-v4-flash:0731-cloud)。原生支持 OpenAI Responses API 格式,并针对 Codex 做了适配。

该不该切?三个判断
1

你有大量重复性 Agent 任务(代码生成、终端操作、工具调用):优先测。Flash 0731 在这类任务上已经逼近 Opus 4.8,成本低六成。

2

你需要私有化部署(数据不出域):现在就能下。MIT 协议 + 167GB 权重 + Q8 量化 110GB 内存可跑。

3

你需要顶级规划/创意能力:再等等。V4-Pro 正式版 8 月初上线,定位更高。Flash 强在「干活」,不在「出主意」。

快速上手
APIapi.deepseek.com,模型名 deepseek-v4-flash,兼容 OpenAI SDK
本地ollama run deepseek-v4-flash:0731-cloud(或下载 GGUF 离线跑)
Codex原生适配,在 Codex CLI / VS Code 插件中配置 DeepSeek 为提供方即可
价格输入 1 元/百万 token(缓存命中 0.2 元),输出 2 元/百万 token

当一个 13B 激活的开源模型只差闭源天花板 1 分、还便宜六成的时候,「等闭源降价」的策略已经过时了。今天能做的第一件事:把你的 Agent 工作流里最重复的那一环,拿 V4 Flash 跑一轮 A/B。数据会替你做决定。

跑分数据来自 DeepSeek 官方公布及 Artificial Analysis 第三方评测。部分基准(DSBench 系列)使用 DeepSeek 自研 Harness,与旧版 Terminal Bench 2.0 非同套题目,真实生产环境表现仍需第三方复现。