8 月 3 日,阿里发布了 Qwen3.8-Max——Qwen 家族迄今最强的模型,总参数(模型的容量,一般越大越聪明)2.4 万亿,激活 95B。但这次发布真正的新闻点不是参数,而是两件事:千问第一次把 Max 级权重(模型的核心文件,拿到就能自己跑)开源(下周上线),以及官方演示里那个「连续自主编程 16 天」的案例。

想象一家米其林三星餐厅,一直把主厨锁在后厨,谁也不给见。今天它突然宣布:主厨的食谱全部免费公开,谁都能拿走。听起来是天大的好事——但大家拿了食谱才发现:要做这道菜,得先有一个专业级的大厨房。类比到此为止,实际对应关系是:食谱 = 模型权重(免费),厨房 = 跑 2.4T 模型所需的 HBM(AI 计算专用的高速显存) GPU 集群(不免费)。开源把「下载」的门槛降到零,却把「部署」的门槛抬到了机房级别。
Qwen3.8-Max 官方性能总览图
Qwen3.8-Max 官方性能总览 · 来源:Qwen 官方博客
事件

阿里首次开源 Max 级权重

先看基本信息:Qwen3.8-Max 总参数 2.4 万亿,激活参数 95B,采用 MoE稀疏架构(分成许多小块,每次任务只启用需要的部分)(基于 Qwen 3.5 架构扩展),上下文窗口(一次能记住的文本长度)100 万 token(AI 按字数收费的单位)。它是 7 月 19 日上线的 Qwen3.8-Max-Preview 的正式版——同一套架构,经过系统性后训练迭代。

两个关键宣布:第一,下周在 Hugging Face 和 ModelScope 开放权重,这是千问历史上首次开源 Max 级权重,同步开源的还有稠密模型 Qwen3.8-27B。第二,API 已正式上线,可通过阿里云百炼、QwenCloud、Qoder 等平台调用,兼容 OpenAI 与 Anthropic 协议,能无缝接入 Claude Code、Codex 等开发工具。

定位很明确:不再单纯比拼聊天能力,重点押在编程、办公、科研和长周期任务上,全面瞄准生产级 AI 智能体(能自己拆任务、调工具、连续行动的 AI)。这也是千问首个 Max 级别同时支持图像、视频、长文档、文本全模态输入的模型。

2.4T
总参数
激活 95B,MoE 稀疏架构,运算量接近 100B 稠密模型。来源:Qwen 官方。
1M
上下文窗口
最大输入 991K,最大输出 131K,推理思维链上限 262K。来源:Qwen 官方。
首次
开源 Max 级权重
下周上线 HF + ModelScope,同步开源 Qwen3.8-27B。来源:Qwen 官方。
数字

定价全球第二,但标准跑分还没公布

API 定价:输入 2 美元/百万 token,输出 6 美元/百万 token,隐式缓存 0.25 美元/百万 token。官方口径是「综合能力仅次于 Fable 5(Claude)」,多个第三方盲测也把它的总分排在全球第二。

但要保持清醒:截至发布日,官方尚未公布标准化 benchmark(模型之间比拼的统一考试题)成绩(SWE-bench Verified/Pro、LiveCodeBench 等)。第三方的「仅次于 Claude」判断基于盲测主观评分,不等同于经审计的客观基准。参考一个锚点:Claude Fable 5 的 SWE-bench Verified 是 95%——Qwen3.8 正式版要坐到 70% 以上,才算坐实第二梯队。在官方成绩公布前,实测比榜单口径更有意义。

口径提醒

「全球第二」目前是官方口径 + 第三方盲测,不是标准化跑分。智东西的实测也指出:在 SWE-bench Pro、TerminalBench 2.1 等项上,它与最新闭源模型仍有差距。等下周权重开放,外部开发者能进一步检验真实能力。

维度Qwen3.8-Max备注
总参数 / 激活2.4T / 95BMoE 稀疏架构
上下文1M token混合注意力机制(MHA + 线性注意力)
API 输入价2 美元/百万 token缓存命中 0.25 美元
综合排名全球第 2(官方+盲测口径)标准跑分待公布
权重开源下周HF + ModelScope,含 27B 稠密版

数据来源:Qwen 官方发布 + 中国经营报、智东西、segmentfault 交叉报道。

反直觉

重点不是 2.4T,是「连续干 16 天」

这次发布里最该看的,不是参数表,而是官方演示的几个长程 Agent 案例。它们测的不是「写一个函数」,而是「能不能管理一个持续变化的工程项目」。

最震撼的一个:让 Qwen3.8-Max 从空文件夹开始做一个叫 oh-my-cli 的项目,全程无人插手。模型自己把需求整理成 issue、领取任务、写代码、跑测试、不通过就自己修复。截至 7 月 30 日,它自主运行了约 16 天,仓库留下 265 次提交、127 个 PR、151 个 issue。

另一个科研复现实验更像压力测试:给模型一篇论文,让它先复现再改进。它连续工作约 125 小时,写了约 7600 行代码、执行超 1100 步操作、跑了 33 轮 GPU 训练,先复现论文的六项主要结论,再自己试了 18 种改进想法。此外还有 24 小时竞赛把准确率从 0.60 提到 0.853、约 500 轮交互把芯片网表门数从 8298 优化到 678(面积缩减 81%)等案例。

16 天自主编程的循环
01
收集反馈
汇总社区意见、用户诉求、自测结果
02
自动立 issue
需求转化为 GitHub issue
03
领任务写码
智能体自己领取任务、编码、测试
04
失败自修复
测试不过就打回修改,循环 16 天
产出:265 次提交、127 个 PR、151 个 issue,全程无人插手(官方案例)。

边界提醒:这些都是官方案例和官方评测,不等于所有真实项目都会这么顺。案例的价值在于展示「长程自主执行」这个方向,而非保证复现。

格局

食谱免费,厨房才是门槛

把视角拉远。这次开源的真正意义,和它带来的一个反直觉后果,值得分开看。

意义:过去半年,DeepSeek 靠 284B 的 V4-Flash 以小博大,Kimi K3(2.8T)刚发布并承诺开源,现在 Qwen 直接甩出 2.4T——而且不是只发 API,是把权重开源,让所有企业和开发者都能下载、私有化部署、二次改造。中国开源大模型,正在集体冲向万亿参数时代。竞争焦点已经从「聊天能力」卷到「长程 Agent、工具链、成本、开放权重节奏」。

反直觉的后果:「可下载」和「跑得起来」是两回事。2.4T 的权重,光模型文件就是 TB 级;要真正部署推理,需要搭载高带宽显存(HBM)的 GPU 集群,不是一台机器。开源把「下载」的门槛降到零,却把「部署」的门槛抬到了数据中心级别——对 GPU/HBM 的需求不是减少,而是放大。

2.8T
Kimi K3
刚发布并承诺开源,国产万亿参数开源潮的一员。来源:公开报道。
2.4T
Qwen3.8-Max
本次开源主角,首个 Max 级开放权重。来源:Qwen 官方。
TB 级
权重文件体积
部署需 HBM GPU 集群,非单台机器可跑。来源:业内分析。
动手

谁该现在用,谁该等权重

API 已经上线,权重下周开放。不同需求的人,动作不一样:

按需行动清单
1

想立刻试能力:走 API(输入 2 美元/百万 token),接入 Claude Code / Codex / Qoder,用 reasoning_effort 参数调推理深度。

2

想要权重、自己微调(拿自家素材再训练,让它更贴合你):等下周 HF + ModelScope 开放,同步有 27B 稠密版(适合算力(跑模型所需的计算资源)有限的团队)。

3

想私有化部署 2.4T:先算硬件账——需要 HBM GPU 集群,不是单台服务器。预算不够就先用 API 或小尺寸版。

4

想看真实水平:等官方标准跑分(SWE-bench 等)公布,或等权重开放后看外部实测,别只信盲测口径。

快速上手
API阿里云百炼 / QwenCloud / Qoder,兼容 OpenAI 与 Anthropic 协议
价格输入 2 美元 / 输出 6 美元 / 缓存 0.25 美元(每百万 token)
权重下周开放:Hugging Face + ModelScope(Max + 27B)
调参支持 reasoning_effort(xhigh/medium/low)调推理深度

阿里这次开源的不是一个「更大的模型」,而是一个「能连续干活的工人」的证据。2.4T 权重免费下载,但真正跑起来需要数据中心级的 GPU 集群——食谱免费,厨房才是门槛。想用的先用 API,想要权重的等下周,想私有化的先算硬件账。

「全球第二」为官方口径 + 第三方盲测,标准化跑分截至发布日尚未公布;16 天自主编程等为官方案例,不等于所有真实项目可复现。市值变化等市场数据来自智东西报道。