8 月 3 日,阿里发布了 Qwen3.8-Max——Qwen 家族迄今最强的模型,总参数(模型的容量,一般越大越聪明)2.4 万亿,激活 95B。但这次发布真正的新闻点不是参数,而是两件事:千问第一次把 Max 级权重(模型的核心文件,拿到就能自己跑)开源(下周上线),以及官方演示里那个「连续自主编程 16 天」的案例。
阿里首次开源 Max 级权重
先看基本信息:Qwen3.8-Max 总参数 2.4 万亿,激活参数 95B,采用 MoE稀疏架构(分成许多小块,每次任务只启用需要的部分)(基于 Qwen 3.5 架构扩展),上下文窗口(一次能记住的文本长度)100 万 token(AI 按字数收费的单位)。它是 7 月 19 日上线的 Qwen3.8-Max-Preview 的正式版——同一套架构,经过系统性后训练迭代。
两个关键宣布:第一,下周在 Hugging Face 和 ModelScope 开放权重,这是千问历史上首次开源 Max 级权重,同步开源的还有稠密模型 Qwen3.8-27B。第二,API 已正式上线,可通过阿里云百炼、QwenCloud、Qoder 等平台调用,兼容 OpenAI 与 Anthropic 协议,能无缝接入 Claude Code、Codex 等开发工具。
定位很明确:不再单纯比拼聊天能力,重点押在编程、办公、科研和长周期任务上,全面瞄准生产级 AI 智能体(能自己拆任务、调工具、连续行动的 AI)。这也是千问首个 Max 级别同时支持图像、视频、长文档、文本全模态输入的模型。
定价全球第二,但标准跑分还没公布
API 定价:输入 2 美元/百万 token,输出 6 美元/百万 token,隐式缓存 0.25 美元/百万 token。官方口径是「综合能力仅次于 Fable 5(Claude)」,多个第三方盲测也把它的总分排在全球第二。
但要保持清醒:截至发布日,官方尚未公布标准化 benchmark(模型之间比拼的统一考试题)成绩(SWE-bench Verified/Pro、LiveCodeBench 等)。第三方的「仅次于 Claude」判断基于盲测主观评分,不等同于经审计的客观基准。参考一个锚点:Claude Fable 5 的 SWE-bench Verified 是 95%——Qwen3.8 正式版要坐到 70% 以上,才算坐实第二梯队。在官方成绩公布前,实测比榜单口径更有意义。
「全球第二」目前是官方口径 + 第三方盲测,不是标准化跑分。智东西的实测也指出:在 SWE-bench Pro、TerminalBench 2.1 等项上,它与最新闭源模型仍有差距。等下周权重开放,外部开发者能进一步检验真实能力。
| 维度 | Qwen3.8-Max | 备注 |
|---|---|---|
| 总参数 / 激活 | 2.4T / 95B | MoE 稀疏架构 |
| 上下文 | 1M token | 混合注意力机制(MHA + 线性注意力) |
| API 输入价 | 2 美元/百万 token | 缓存命中 0.25 美元 |
| 综合排名 | 全球第 2(官方+盲测口径) | 标准跑分待公布 |
| 权重开源 | 下周 | HF + ModelScope,含 27B 稠密版 |
数据来源:Qwen 官方发布 + 中国经营报、智东西、segmentfault 交叉报道。
重点不是 2.4T,是「连续干 16 天」
这次发布里最该看的,不是参数表,而是官方演示的几个长程 Agent 案例。它们测的不是「写一个函数」,而是「能不能管理一个持续变化的工程项目」。
最震撼的一个:让 Qwen3.8-Max 从空文件夹开始做一个叫 oh-my-cli 的项目,全程无人插手。模型自己把需求整理成 issue、领取任务、写代码、跑测试、不通过就自己修复。截至 7 月 30 日,它自主运行了约 16 天,仓库留下 265 次提交、127 个 PR、151 个 issue。
另一个科研复现实验更像压力测试:给模型一篇论文,让它先复现再改进。它连续工作约 125 小时,写了约 7600 行代码、执行超 1100 步操作、跑了 33 轮 GPU 训练,先复现论文的六项主要结论,再自己试了 18 种改进想法。此外还有 24 小时竞赛把准确率从 0.60 提到 0.853、约 500 轮交互把芯片网表门数从 8298 优化到 678(面积缩减 81%)等案例。
边界提醒:这些都是官方案例和官方评测,不等于所有真实项目都会这么顺。案例的价值在于展示「长程自主执行」这个方向,而非保证复现。
食谱免费,厨房才是门槛
把视角拉远。这次开源的真正意义,和它带来的一个反直觉后果,值得分开看。
意义:过去半年,DeepSeek 靠 284B 的 V4-Flash 以小博大,Kimi K3(2.8T)刚发布并承诺开源,现在 Qwen 直接甩出 2.4T——而且不是只发 API,是把权重开源,让所有企业和开发者都能下载、私有化部署、二次改造。中国开源大模型,正在集体冲向万亿参数时代。竞争焦点已经从「聊天能力」卷到「长程 Agent、工具链、成本、开放权重节奏」。
反直觉的后果:「可下载」和「跑得起来」是两回事。2.4T 的权重,光模型文件就是 TB 级;要真正部署推理,需要搭载高带宽显存(HBM)的 GPU 集群,不是一台机器。开源把「下载」的门槛降到零,却把「部署」的门槛抬到了数据中心级别——对 GPU/HBM 的需求不是减少,而是放大。
谁该现在用,谁该等权重
API 已经上线,权重下周开放。不同需求的人,动作不一样:
想立刻试能力:走 API(输入 2 美元/百万 token),接入 Claude Code / Codex / Qoder,用 reasoning_effort 参数调推理深度。
想要权重、自己微调(拿自家素材再训练,让它更贴合你):等下周 HF + ModelScope 开放,同步有 27B 稠密版(适合算力(跑模型所需的计算资源)有限的团队)。
想私有化部署 2.4T:先算硬件账——需要 HBM GPU 集群,不是单台服务器。预算不够就先用 API 或小尺寸版。
想看真实水平:等官方标准跑分(SWE-bench 等)公布,或等权重开放后看外部实测,别只信盲测口径。
阿里这次开源的不是一个「更大的模型」,而是一个「能连续干活的工人」的证据。2.4T 权重免费下载,但真正跑起来需要数据中心级的 GPU 集群——食谱免费,厨房才是门槛。想用的先用 API,想要权重的等下周,想私有化的先算硬件账。
「全球第二」为官方口径 + 第三方盲测,标准化跑分截至发布日尚未公布;16 天自主编程等为官方案例,不等于所有真实项目可复现。市值变化等市场数据来自智东西报道。