7 月 31 日,DeepSeek 做了一件让整个行业侧目的事:他们把 V4 Flash 的正式版开源了(MIT 协议),而这个只激活 13B 参数(总参数里每次真正动用的部分)的模型,在第三方智能指数上拿到了 50 分——距离 OpenAI 的闭源旗舰 GPT-5.6 Luna,只差 1 分。
没换骨架只换训练,Flash 把自家 Pro 打趴了
DeepSeek 官方明确说了:V4 Flash 0731 的模型结构和尺寸与三个月前的预览版完全一致——总参 284B,激活 13B,1M 上下文窗口(一次能记住的文本长度)。唯一的区别是重新做了一轮后训练(模型骨架不变,只调整「怎么回答问题」的策略,类似给同一个人换了一套工作方法)。
结果呢?官方公布的 9 项 Agent 基准测试,Flash 正式版全面超越定位更高的 V4-Pro 预览版。最夸张的是 DeepSWE(高难度编码):从预览版的 7.3 分跳到 54.4 分,暴涨超过 6 倍。Terminal Bench 2.1(终端操作)拿到 82.7,超过 Pro 的 72.1,甚至压过了智谱 GLM-5.2 的 81.0,距离 Claude Opus 4.8 的 85.0 只差 2.3 分。
换句话说:行业默认的「Pro 一定比 Flash 强」的分层逻辑,被 DeepSeek 自己打破了。轻量版不是低配版——它只是还没被好好训练过。
距闭源天花板 1 分,价格便宜六成
第三方评测机构 Artificial Analysis 的智能指数(跨多项任务的综合能力评分,可比模型中位数约 17 分)给了 V4 Flash 0731 一个 50 分。这个数字意味着什么?
横向比:与 Google Gemini 3.6 Flash 持平(50 分),距 GPT-5.6 Luna 仅差 1 分(51 分),距当前开源第一 Kimi K3 差 7 分(57 分)。纵向比:较自家 Flash 预览版提升 10 分(40→50),较定位更高的 V4-Pro 预览版高 6 分(44→50)。这是开源模型(把模型文件公开,谁都能下载开发)历史上第一次如此接近这个量级的闭源旗舰。
价格方面:缓存命中输入 0.2 元/百万 token(AI 按字数收费的单位),未命中输入 1 元,输出 2 元。按每任务成本算,比降价后的 GPT-5.6 Luna 还便宜约 60%。OpenAI 同一天把 Luna 降了 80%,但依然贵过 DeepSeek。
| 模型 | AA 智能指数 | 激活参数 | 开源 | 每任务成本 |
|---|---|---|---|---|
| V4 Flash 0731 | 50 | 13B | MIT | 基准 |
| GPT-5.6 Luna (max) | 51 | 未公开 | 否 | +60% |
| Gemini 3.6 Flash | 50 | 未公开 | 否 | — |
| Kimi K3 (max) | 57 | 未公开 | 是 | — |
| V4 Pro 预览版 | 44 | 49B | 否 | 更高 |
数据来源:Artificial Analysis 智能指数(2026-07-31)、DeepSeek 官方定价页。每任务成本按 Artificial Analysis 口径。
后训练比堆参数更有效——这对谁最有利
这次发布最反直觉的一点:模型骨架完全没变。284B 总参、13B 激活、CSA+HCA 混合注意力、32T token 训练数据——全部和三个月前一样。变的只有后训练策略。
这说明什么?当前大模型的性能瓶颈,很可能不在「模型有多大」,而在「训练方法有多精细」。同样的骨架,换一套后训练策略就能实现质的飞跃——这对算力(跑模型所需的计算资源)有限的团队是巨大利好:你不需要更多 GPU,你需要更好的训练方法。
DeepSeek 官方还透露了一个信号:V4-Pro 正式版将于 8 月初上线。如果 Pro 也做同样的后训练升级,开源旗舰的天花板还会再抬一截。
开源 vs 闭源的天平,正在倾斜
把视角拉远一点。2026 年上半年发生了什么?Kimi K3 火到停售、DeepSeek V4 Flash 追平闭源、GLM-5.2 紧随其后——中国开源模型正在集体逼近全球天花板。
与此同时,闭源阵营在做什么?OpenAI 同一天把 GPT-5.6 Luna 降价 80%。这不是巧合——当开源模型在智能指数上只差 1 分、价格还便宜六成的时候,闭源厂商唯一的护城河就只剩下「你不用自己部署」的便利性了。
但 MIT 协议意味着:任何团队都可以下载权重、私有化部署、按自己的需求微调(拿自家素材再训练,让它更贴合你)。对于数据敏感的企业(金融、医疗、政府),这不是「要不要省钱」的问题,是「能不能用」的问题。开源模型第一次同时满足了「够聪明」和「能私有化」两个条件。
今天就能用:谁该切、怎么切
V4 Flash 0731 已经上线 DeepSeek 第一方 API,Ollama 也同步上架(ollama run deepseek-v4-flash:0731-cloud)。原生支持 OpenAI Responses API 格式,并针对 Codex 做了适配。
你有大量重复性 Agent 任务(代码生成、终端操作、工具调用):优先测。Flash 0731 在这类任务上已经逼近 Opus 4.8,成本低六成。
你需要私有化部署(数据不出域):现在就能下。MIT 协议 + 167GB 权重 + Q8 量化 110GB 内存可跑。
你需要顶级规划/创意能力:再等等。V4-Pro 正式版 8 月初上线,定位更高。Flash 强在「干活」,不在「出主意」。
当一个 13B 激活的开源模型只差闭源天花板 1 分、还便宜六成的时候,「等闭源降价」的策略已经过时了。今天能做的第一件事:把你的 Agent 工作流里最重复的那一环,拿 V4 Flash 跑一轮 A/B。数据会替你做决定。
跑分数据来自 DeepSeek 官方公布及 Artificial Analysis 第三方评测。部分基准(DSBench 系列)使用 DeepSeek 自研 Harness,与旧版 Terminal Bench 2.0 非同套题目,真实生产环境表现仍需第三方复现。